目录
0 参考链接
1 SlowFast基本思想
2 SlowFast模型结构
2.1 双通道处理
2.2 具体结构
2.3 横向连接
最近在完成一个视频分类的任务,找到并学习了SlowFast模型。这个模型在我实现的任务中取得了较好的效果,所以今天和大家分享一下我对SlowFast这个模型的理解。当然这个模型并不止于实现视频分类,更多用途等待大家去探索。
0 参考链接
SlowFast论文:SlowFast Networks for Video Recognition
SlowFast模型源码:https://github.com/ facebookresearch/SlowFast
1 SlowFast基本思想
如果我们忽略图片图层的影响,那么我们可以将一张图片看做具有两个维度x和y,分别代表图片的横向和纵向坐标。通常情况下,我们可以认为这两个维度在意义上是对称的,即我们可以同等的对待、处理这两个维度。
但对于视频而言,我们可以将其看做是一系列连续视频帧的集合,那么一个视频就具有三个维度:x、y和t,其中x和y仍是图片的横纵坐标,t代表时间维度。运动是时空领域