网易首页 > 网易号 > 正文 申请入驻

双流卷积网络如何在2014年第一次让深度学习赢了手工特征

0
分享至


你有没有想过,机器要看懂一个人在做什么动作,到底有多难?

你看一段视频里,有个人正在挥棒,这事儿对人来说一眼就明白。可对机器来说,这里藏着两个完全不同性质的信息。一个是画面里有什么东西,球棒、人、球场,这是静态的外观信息。另一个是这些东西怎么动的,球棒挥动的轨迹、速度、方向,这是动态的运动信息。人脑处理这两种信息几乎是无缝衔接的,但对2014年的深度学习来说,这是两座翻不过去的山。

那一年,卷积神经网络在图片识别上已经打出了漂亮的战绩。前一年,AlexNet横空出世,把图像分类的错误率甩开一大截,整个计算机视觉圈都在往深度学习转向。可是奇怪的事情发生了,同样的网络架构,一挪到视频动作识别上,就突然不好用了。

当时最好的手工特征方法,叫做improved Trajectories

**improved Trajectories(改进轨迹特征)**:一种手工设计的视频动作识别方法,通过跟踪像素点的运动轨迹并提取特征来判断动作类别,在深度学习出现前长期占据准确率榜首。

在UCF-101这个标准测试集上能拿到87.9%的准确率。而当时最好的深度学习方法,只能做到65.4%左右。这个差距接近22个百分点,意味着什么?意味着每5个动作里,深度学习就要比手工方法多认错一个还多。这在图像识别领域是不可想象的差距,深度学习明明应该是更先进的技术,却被一个"老古董"式的手工方法按在地上摩擦了两年多。

这篇论文的两位作者,Karen Simonyan和Andrew Zisserman,来自牛津大学视觉几何组。有意思的是,他们几个月后又发表了另一篇论文,叫VGGNet,后来成了图像识别领域最经典的架构之一。这两篇论文几乎是同期的工作,你可以想象这两位学者当时脑子里同时装着两个问题:图片怎么分类,视频怎么理解。而正是视频这道题,让他们想出了一个后来被证明极其重要的点子。

问题到底难在哪:一张图片不会动,但一段视频会

先说说为什么直接把图像分类的网络搬过来会失败。

卷积神经网络之所以在图片上表现好,是因为它能从像素里学出边缘、纹理、形状这些视觉特征,然后一层一层组合成更抽象的语义,比如"这是一只猫"。这套逻辑对单张静止图片是成立的,因为图片里所有该有的信息,都摆在那一帧画面上了。

可动作是个时间上的概念。挥棒这个动作,你给我看其中一帧,我可能猜到这是打棒球的场景,但我猜不出这一瞬间球棒是在往上举还是往下挥。你需要连续好几帧才能判断出运动的方向和速度。

这就好比你要判断一个人是在给你鞠躬还是刚站起来,如果只看一张照片,弯腰九十度的姿势可能是这两个动作里的任意一个瞬间。你只有看到这个姿势前后发生了什么变化,才能确定他到底在做哪个动作。

如果单纯把视频的每一帧图片喂给一个图像分类网络,然后把结果做个平均或者投票,网络学到的实际上只是"这个场景里通常会出现什么物体",比如泳池边容易出现游泳这个类别,而不是真正理解了运动本身。这也是为什么早期直接套用图像网络的方法,效果始终摸不到手工特征的天花板,因为手工特征里那些基于轨迹的方法,天生就是在追踪像素怎么动的。

核心方法:把一个问题拆成两条视线来看

Simonyan和Zisserman的解法,现在回头看简单到有点不可思议,但在当时是个真正的突破。

他们把网络拆成两条独立的流,一条叫空间流,一条叫时间流,各自处理各自擅长的信息,最后再把两边的判断结果融合起来。

空间流吃的是普通的RGB图像帧,跟一般的图像分类网络没什么区别,专门负责认出画面里有什么,场景、物体、人物姿态,这些静态的外观线索。

时间流则完全不吃原始图像,它吃的是光流

**光流(Optical Flow)**:描述图像序列中像素点运动方向和速度的一种表示方法,通常用两张连续帧计算得出,分为水平方向和垂直方向两个分量,像一张记录了"每个像素往哪儿动、动多快"的地图。

光流本身不包含任何颜色或纹理信息,它就是纯粹的运动信号。你可以把它想象成一张只画了箭头的地图,每个箭头指向像素下一帧要去的方向,箭头长短代表速度。这样一来,时间流网络看到的完全是运动模式,不会被画面里的颜色、光照这些无关信息干扰。

这个设计的关键就在于,把这两种性质完全不同的信息硬塞进同一个网络里学习,效果反而不如让两个网络各管一段,专心把自己那一半信息吃透,最后再把结论拼起来。

这就好比一个案子交给警察局处理,如果让一个人同时负责物证分析和监控录像分析,他可能顾此失彼,两头都做不到位。但如果分成两个专业小组,一组专门看现场留下的痕迹,一组专门看监控里人怎么移动,最后两组交换情报再做出联合判断,准确率往往更高。如果不这样拆分,让一个网络同时消化外观和运动两种信息,论文里的对比实验显示效果明显更差,这也印证了专业分工在这里不是形式主义,而是实打实的性能提升。

![双流架构图](placeholder)

图中展示的正是这套架构,输入视频被分成两路,一路是单帧RGB图像送进空间流卷积网络,另一路是连续多帧计算出的光流场送进时间流卷积网络,两路网络结构相似但参数独立训练,最后通过加权平均或者一个小型分类器把两边的softmax输出融合成最终预测。

时间流网络吃的到底是什么:多帧堆叠的光流

时间流网络具体怎么处理运动信息,这里有个细节值得展开说说。

网络不是只看两帧之间的一次光流,而是把连续L帧(论文里L取10)算出来的光流场堆叠在一起,做成一个多通道的输入。因为光流有水平和垂直两个方向的分量,10帧就是20个通道,这些通道被当成一张"多层图像"一起送进卷积网络。

这么做的道理在哪?一次光流只能捕捉两帧之间瞬间的运动,信息量太单薄。挥棒这个动作从开始到结束可能跨越几十帧,如果每次只看邻近两帧的运动,网络看到的永远是运动的碎片,很难拼出完整的动作轮廓。堆叠多帧光流相当于给网络一段"运动的历史",让它能看到运动是怎么随时间演变的,而不是某一瞬间的快照。

这跟你看一段慢动作回放很像,如果导播只给你看某一帧和下一帧的画面差异,你很难判断这是一次挥拍还是仅仅是手抖了一下。但如果给你看连续十几帧的运动轨迹叠在一起,挥拍的完整弧线一下子就显现出来了,起手、加速、挥出、收势,整个过程的形状都能看清楚。如果只用单帧光流而不做堆叠,论文的实验里准确率会明显下降,这说明运动信息的时间跨度本身就是判断动作类别的重要线索,不是可有可无的细节。

论文里还测试了另一种处理光流的方式,叫做轨迹堆叠

**轨迹堆叠(Trajectory Stacking)**:一种沿着像素运动轨迹采样光流的方式,而不是固定在同一个像素位置上采样,试图更精确地捕捉某个点随时间的运动路径。

这个想法听起来更精细,理论上应该比简单粗暴地在固定位置堆叠光流更准确。但实验结果显示,两种方式的效果其实差不多,固定位置堆叠反而实现起来更简单。这也是论文里一个挺诚实的地方,研究者没有为了显得方法更精巧而硬吹一个理论上更优雅但实际提升有限的设计,而是老老实实汇报了两种方法差距不大的事实。

光流的两种算法选择:精确但慢,还是粗糙但快

时间流网络依赖光流场,那光流本身怎么算出来?这里论文对比了两种主流算法。

一种是传统的光流算法,能算得比较精确,但速度慢,处理一段视频可能要花不少时间。另一种是当时刚出现的实时光流算法

**实时光流算法(Real-time Optical Flow)**:一种计算速度快、能满足实时应用需求的光流估计方法,精度上略逊于传统算法但换来了速度优势。

论文测试发现,用精度稍低但速度快得多的实时算法,最终分类准确率的下降幅度很小,但换来的是数量级上的速度提升。这个权衡在工程上非常重要,因为光流计算本身在整套流程里是个不小的计算瓶颈,如果非要用最精确但最慢的算法,整个系统可能根本没法实用。

这个选择背后的逻辑其实很朴素。你去医院拍片子,做一个特别精细的全身核磁共振可能要一个小时,但如果只是想快速判断骨头有没有骨折,一张几分钟就能拍出来的X光片可能就够用了。多余的精度如果换不来判断结果的实质提升,那这份精度就是浪费。光流计算在这里也是同样的道理,实时算法牺牲的那一点精度,并没有明显拖累最终的分类效果,但换来的速度提升是实打实的。

数据不够怎么办:借用图像分类的经验做迁移

深度网络最怕的就是数据不够,而当时的视频动作识别数据集,规模跟图像分类比起来小得可怜。UCF-101只有大约1.3万段视频,HMDB-51更少,只有几千段。相比ImageNet那种上百万张图片的规模,这个数据量对训练一个深层卷积网络来说是远远不够的,很容易过拟合。

论文里用了两个办法来缓解这个问题。第一个是多任务学习

**多任务学习(Multi-task Learning)**:让同一个网络同时在多个相关任务上训练,共享底层特征表示,借此提高数据利用效率的一种训练策略。

具体做法是把UCF-101和HMDB-51两个数据集放在一起训练,网络共享大部分参数,只在最后接了两个不同的输出层分别对应两个数据集的类别标签。这样网络能从两份数据里一起学习通用的运动模式,相当于把两个小数据集拼成了一个更大的训练资源。

第二个办法是用图像分类任务上预训练过的网络参数来初始化空间流网络,这个思路后来被称为迁移学习

**迁移学习(Transfer Learning)**:将一个任务上学到的知识迁移到另一个相关任务上,通常表现为用一个任务预训练的网络参数作为另一个任务的初始化起点。

空间流网络处理的是普通图像,跟ImageNet上训练的图像分类网络任务性质接近,所以直接借用在ImageNet上学到的底层特征当作起点,能省掉从零开始学习边缘、纹理这些基础视觉特征的过程,把有限的数据集中用在学习动作相关的高层特征上。

这跟一个人转行的道理很像。一个原本做建筑设计的人转去做游戏场景设计,他不需要从零学起怎么理解空间结构和透视关系,这些底子已经打好了,他只需要在这个基础上补充游戏引擎和交互设计的知识。如果每次换个领域都从零开始学,人生根本没有那么多时间。网络的训练也是这样,如果空间流网络不借用ImageNet的预训练参数而是从零开始在几千段视频上训练,过拟合几乎是必然的,准确率会大幅下滑。

两条流怎么融合:简单相加还是训练一个分类器

最后一步是怎么把空间流和时间流的预测结果拼到一起。

论文尝试了两种融合方式。一种是直接对两个网络输出的softmax分数做加权平均,权重可以手动调,论文里发现给时间流更高的权重效果更好,这也从另一个角度说明运动信息对动作识别的重要性其实超过外观信息。另一种是训练一个额外的支持向量机

**支持向量机(SVM)**:一种经典的机器学习分类算法,常用于在特征空间中寻找一个最优的分界面来区分不同类别。

把两条流的输出分数当作新的特征,重新训练一个分类器来做最终判断。实验显示这种方式比简单加权平均效果更好一些,因为它能自动学出更合理的组合方式,而不是依赖人工设定的权重。

最终成绩单:深度学习第一次赢了手工特征

说了这么多设计细节,最后来看结果。

| 方法 | UCF-101 准确率 | HMDB-51 准确率 |

| 单独空间流 | 72.6% | 40.5% |

| 单独时间流 | 81.2% | 54.6% |

| 双流融合(SVM) | **88.0%** | **59.4%** |

| improved Trajectories(此前最强手工特征) | 87.9% | 57.2% |

这张表格里最值得细品的是前两行的对比。单独用空间流,也就是只看图像不看运动,准确率是72.6%。单独用时间流,只看运动不看图像外观,准确率反而更高,81.2%。这说明了什么?说明对动作识别这件事,运动信息本身比静态外观信息更关键,这跟我们人类判断动作的直觉是一致的,你闭上眼睛只凭肢体运动的感觉往往也能猜出对方在做什么动作,但只看一张静止照片经常猜不准。

再看融合之后的88.0%,这是双流网络的最终成绩,比单独空间流高了整整15个百分点。如果不做这个融合,只用空间流去打这场仗,深度学习方法根本没资格跟手工特征掰手腕。而融合之后,88.0%这个数字,终于超过了此前保持了两年多的手工特征最好成绩87.9%,虽然只领先了0.1个百分点,但这是深度学习在视频动作识别领域第一次正面击败手工特征方法。这个历史节点的分量,不亚于AlexNet当年在图像分类上的突破。

在HMDB-51这个更难的数据集上,双流方法的优势更明显,59.4%对57.2%,领先了2.2个百分点。HMDB-51之所以更难,是因为里面的动作类别更细碎,场景更复杂,这也说明双流方法在更困难的场景下反而展现出更稳的优势,这对后续研究者来说是个很有信心的信号。

后续的故事:双流架构成了整个领域的地基

这篇论文的影响,不是那种"发表了就被遗忘"的论文,而是真正开启了一条研究路线。

2016年,Feichtenhofer等人在论文里对双流网络的融合方式做了改进,提出了在网络更深的层次上做特征融合,而不是仅仅在最后的分类分数层面融合,这个改进进一步提升了准确率,证明两条流之间在中间层就有信息可以互相借鉴,而不是完全独立训练到最后才见面。

2017年,Carreira和Zisserman(注意,Zisserman又出现了)发表了I3D网络,这篇论文把双流的思路和3D卷积结合起来,用3D卷积直接处理连续帧的时空信息,同时还提出了Kinetics这个规模更大的视频数据集用来预训练,这一下把视频动作识别的准确率又往上推了一大截,在Kinetics上预训练后再迁移到UCF-101,准确率能冲到98%左右。

这两项后续工作有个共同点,他们都没有推翻双流网络"分别处理外观和运动"这个核心思想,而是在这个框架的基础上做优化,一个是改进融合的时机和方式,一个是把光流这种手工设计的运动表示替换成更通用的3D卷积。这说明双流网络提出的那个基本判断,动作识别需要同时处理静态外观和动态运动这两种性质不同的信息,这个判断本身站住了脚,后来的十年里研究者们基本都是在这个地基上往上盖楼。

写在后面

读这篇论文的时候,最触动我的其实是那个15个百分点的对比。单独空间流72.6%,融合后88.0%,这中间的差距全部来自于加入了运动信息。这说明一件事,人在判断"这是什么动作"的时候,潜意识里用的信息量远比我们以为的复杂,不是简单地认出画面里有什么东西就完事了。

还有一个细节值得单独说一下,论文里发现给时间流更高的权重效果更好,这个发现在当时可能只是个工程上的小技巧,但往深里想,它其实暗示了一件事:静态图像里的"上下文线索"(比如游泳池边容易出现游泳动作)看似有用,但也容易造成偏见式的猜测,而真正忠实地反映动作本质的信号是运动本身。这跟后来大家批评深度学习模型容易"抓错重点"、依赖场景偏见而不是真正理解动作的讨论,其实是同一件事的两种表述。

这篇论文没解决的问题也很明显,光流本身的计算成本仍然是个瓶颈,而且光流是提前算好的一种"手工设计"的运动表示,并不是网络自己学出来的。I3D后来用3D卷积绕开了这个问题,但更彻底的端到端运动表示学习,直到今天依然是个开放的问题。

Q&A

Q1:双流卷积网络(Two-Stream ConvNet)是什么?

A:这是Simonyan和Zisserman在2014年提出的一种视频动作识别方法,把网络拆成空间流和时间流两部分,分别处理画面外观信息和光流运动信息,最后融合两边的判断结果,在UCF-101数据集上第一次让深度学习方法超过了手工特征方法。

Q2:双流网络为什么要用光流而不是直接用原始视频帧?

A:因为原始视频帧混杂了外观和运动两种性质不同的信息,网络很难同时学好这两者。光流是专门描述像素运动方向和速度的信号,不含颜色纹理信息,让时间流网络能专注学习运动模式,这样拆分后整体准确率比混在一起处理提升了约15个百分点。

Q3:双流卷积网络对后续研究有什么影响?

A:2016年Feichtenhofer等人改进了两条流的融合方式,在更深层次融合特征。2017年Carreira和Zisserman提出的I3D网络把双流思路和3D卷积结合,并引入Kinetics大规模数据集预训练,把准确率进一步推高到98%左右,双流的核心思想一直被后续工作沿用。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
崩了,茅台崩了!白酒的天变了,大消费还有未来么?

崩了,茅台崩了!白酒的天变了,大消费还有未来么?

价值事务所所长
2026-08-17 23:47:27
全网传错!郭德纲立案核心不是调侃红歌,官方定性藏关键细节

全网传错!郭德纲立案核心不是调侃红歌,官方定性藏关键细节

一盅情怀
2026-08-17 11:07:08
9年前欠下巨额赌债,在体坛销声匿迹的孔令辉,如今生活咋样?

9年前欠下巨额赌债,在体坛销声匿迹的孔令辉,如今生活咋样?

皮皮电影
2026-08-15 13:30:51
0分,又是0分!首发控卫啊!中国男篮无缘逆转新西兰

0分,又是0分!首发控卫啊!中国男篮无缘逆转新西兰

篮球实战宝典
2026-08-17 21:20:12
穆里尼奥笑晕!1.4 亿天才 30 分钟封神!皇马新王碾压全场

穆里尼奥笑晕!1.4 亿天才 30 分钟封神!皇马新王碾压全场

澜归序
2026-08-17 04:19:30
jennie因服装问题道歉 让观众体验不好

jennie因服装问题道歉 让观众体验不好

老吴教育课堂
2026-08-17 14:48:44
抛弃人民的颁奖机构,必将被人民抛弃

抛弃人民的颁奖机构,必将被人民抛弃

远方青木
2026-08-16 23:17:41
套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

人生录
2026-08-16 00:05:13
万亿资产归零,全国第四大保险集团破产,1.5万亿保单怎么样了?

万亿资产归零,全国第四大保险集团破产,1.5万亿保单怎么样了?

圆梦的小老头
2026-08-17 23:11:05
时隔81年,日俄再次交战!小泉进次郎摊牌了:向乌克兰学习经验

时隔81年,日俄再次交战!小泉进次郎摊牌了:向乌克兰学习经验

墨兰史书
2026-08-17 23:40:03
普京最不愿看到的一幕出现:日本没派兵,却把乌克兰战场搬回了太平洋

普京最不愿看到的一幕出现:日本没派兵,却把乌克兰战场搬回了太平洋

浯江孤舟
2026-08-17 13:05:37
我给母校捐了800万,却被安排在角落,校长不耐烦地说:有意见就走,不差你这点钱,我当场撤资,20分钟后他接到银行电话傻眼了

我给母校捐了800万,却被安排在角落,校长不耐烦地说:有意见就走,不差你这点钱,我当场撤资,20分钟后他接到银行电话傻眼了

晓艾故事汇
2026-08-17 08:35:58
国内将逐渐停止“肠镜检查”?做完对身体有无影响?医生告诉真相

国内将逐渐停止“肠镜检查”?做完对身体有无影响?医生告诉真相

荷兰豆爱健康
2026-08-17 14:09:24
读懂东野圭吾《恶意》中的一段话,就明白项立刚、郭松民为何围攻易中天?

读懂东野圭吾《恶意》中的一段话,就明白项立刚、郭松民为何围攻易中天?

壹家言
2026-08-17 12:45:57
收榜一大哥1000万,拒绝陪睡的女主播:生活特别的奢靡,对她同情不起来

收榜一大哥1000万,拒绝陪睡的女主播:生活特别的奢靡,对她同情不起来

汉史趣闻
2026-08-16 16:00:22
广东一中学原校长,被“双开”

广东一中学原校长,被“双开”

南方都市报
2026-08-17 21:13:20
解放军从补给箱中,掏出一沓新台币,这一幕对“台独”简直是暴击

解放军从补给箱中,掏出一沓新台币,这一幕对“台独”简直是暴击

施涛说
2026-08-17 15:28:13
残酷预警:再这样下去,社会将出现大批“天不怕地不怕”的狠人

残酷预警:再这样下去,社会将出现大批“天不怕地不怕”的狠人

宝哥精彩赛事
2026-08-17 04:51:56
局势突变!中方突然派人赶赴伊朗,要谈件大事,事关全球军工命脉

局势突变!中方突然派人赶赴伊朗,要谈件大事,事关全球军工命脉

月下守候
2026-08-17 23:29:29
5分钟,看完《牛来》全剧情

5分钟,看完《牛来》全剧情

果壳
2026-08-17 12:32:44
2026-08-18 00:12:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9553文章数 568关注度
往期回顾 全部

科技要闻

马斯克600亿美元买条近路

头条要闻

因老板娘一句随口交代 打工走失男子独守深山老宅25年

头条要闻

因老板娘一句随口交代 打工走失男子独守深山老宅25年

体育要闻

C罗:可能是生涯最后一年 未来都规划好了

娱乐要闻

立案风波席卷德云社多场巡演叫停!

财经要闻

爱丽家居跨界玩存储:溢价背后藏着机密案

汽车要闻

2027款艾瑞泽8 PRO 年轻人的务实之选

态度原创

健康
教育
亲子
时尚
数码

专家解答青少年脊柱侧弯七大问题

教育要闻

“你这样的,是真不配当爹!”流量背后,被消费的孩子,网友怒吼

亲子要闻

我一直很庆幸自己有几个这样好的表哥表姐。 杨雪呀

裤子专场|| 这条大长腿神裤绝了,好穿到想焊在腿上!

数码要闻

RGB-Mini LED纪元旗舰究竟有多强!海信UX 2026款评测:电视色域、亮度双冠王

无障碍浏览 进入关怀版