网易首页 > 网易号 > 正文 申请入驻

用两只眼睛看动作:当深度学习第一次学会了"看视频"

0
分享至


2014 年的深度学习圈子里,有一件事让所有人心里犯嘀咕。

图像识别这边,AlexNet 已经把传统方法打得毫无还手之力,大家都在庆祝卷积神经网络的胜利。但只要把静止的图片换成会动的视频,风向就完全变了。视频动作识别领域里,效果最好的方法居然还是一种叫"密集轨迹"的手工设计特征。神经网络在这个任务上试了好几年,就是打不过一个靠人工设计规则的老古董。

这事儿说起来挺打脸的。深度学习号称能自动学习特征,不需要人来设计规则,可偏偏在视频这个更复杂的任务上,人工设计的规则反而更管用。问题出在哪儿?两位来自牛津大学的研究者,Karen Simonyan 和 Andrew Zisserman,决定认真琢磨这个事。他们后来在同一年发表了另一篇大名鼎鼎的论文,提出了 VGGNet。这个背景值得一提,因为他们对"卷积网络怎么设计才管用"这件事,显然是下了苦功的。

视频比图片难在哪

要理解这篇论文的贡献,得先搞清楚视频动作识别到底难在什么地方。

一张静止图片里,你能看到的信息是空间信息:物体的形状、颜色、纹理、相对位置。识别一只猫,一辆车,靠的都是这些空间线索。但一段视频除了空间信息,还多了一个维度,时间。一个人是在挥手还是在鼓掌,光看某一帧的画面往往分不清,你必须看动作是怎么随时间变化的。

这就是当时卷积网络的尴尬之处。原始的网络设计是给静态图片用的,直接把它套到视频上,最直接的做法就是把很多帧堆在一起塞进网络,或者干脆用 3D 卷积在时间维度上也做卷积运算。这两种做法在当时的实验里效果都不理想,网络学不到有效的运动信息,识别准确率始终被手工特征方法压着一头。

具体差多少呢?在当时权威的 UCF-101 数据集上,最好的手工特征方法能做到 87% 左右的准确率,而深度学习方法普遍卡在 65% 到 70% 之间,差了将近 20 个百分点。20 个百分点是什么概念?意味着每 5 个动作视频里,深度学习方法就要比手工方法多认错 1 个。这个差距不是简单调调参数就能补上的,说明当时的网络架构在根本上就没抓住视频里最关键的信息。

核心思路:把"看什么"和"怎么动"分开来

Simonyan 和 Zisserman 的洞察其实挺朴素。他们注意到,人在识别动作的时候,大脑里似乎有两条独立的通路在同时工作。一条通路负责认物体和场景,看到一个人、一个球、一片草地,这是"这是什么"的问题。另一条通路专门负责感知运动,不管前景背景是什么样子,只关心东西是怎么动的,这是"它在怎么动"的问题。

这个想法其实来自神经科学里一个已经存在的理论,叫双流假说

> 双流假说:一种关于人类视觉系统的理论,认为大脑处理视觉信息时分为两条独立通路,一条处理物体的形状与身份,另一条专门处理运动信息。

于是论文提出了一个听起来简单却极其有效的架构,叫双流卷积网络

> 双流卷积网络:论文提出的核心模型,用两个独立的卷积神经网络分别处理视频的静态画面和运动信息,最后把两边的判断结果融合起来。

具体来说,这两条网络流是这样分工的。第一条叫空间流,它的输入就是视频里的单张 RGB 图片,负责识别画面里有什么东西,比如识别出这是个人,旁边有个篮球架。这一条其实跟普通的图片分类网络没什么本质区别,甚至可以直接用在 ImageNet 上预训练好的网络来做迁移学习。

第二条叫时间流,这才是这篇论文真正的巧思所在。它的输入不是图片,而是光流场

> 光流场:描述图像中每个像素点在连续两帧之间移动方向和速度的一种表示,通常用一张图来可视化,不同颜色和亮度代表不同的运动方向和强度。

光流场记录的是纯粹的运动信息,把画面里所有像素点在两帧之间挪动的方向和速度都算出来,变成一张新的"运动图"。这张图上你可能完全看不出场景里有什么物体,但能清楚看到哪些区域在往哪个方向动,动得有多快。时间流网络专门吃这种光流图,只学习运动模式,不管背景是什么。

这里必须停下来讲一个类比,因为这个设计决策的代价和收益特别值得说清楚。

想象你去医院拍片子,医生同时给你做了 X 光和心电图。X 光看的是你身体的结构,骨头有没有断,器官位置对不对。心电图看的是你心脏跳动的节律,一种纯粹的动态信号,跟身体结构长什么样完全无关。如果医生只看 X 光,完全看不出心律不齐;如果只看心电图,又完全不知道你骨头有没有问题。两种信息必须分开采集,分开分析,最后再综合判断,因为它们描述的是两种性质完全不同的东西,硬塞到一起去用同一套方法处理,反而会互相干扰,谁都学不好。双流网络的设计逻辑跟这个几乎一样,空间流是"结构片",时间流是"心电图",分开训练效果远好于混在一起硬train一个网络。

如果不这样分开会怎样?论文里其实做了对照实验。只用空间流单独识别,在 UCF-101 上的准确率是 72.6%。这个数字本身已经能看出问题,单靠图片信息是远远不够的,因为很多动作光看单帧画面根本区分不出来,比如"起跳"和"落地"这两个瞬间,画面可能长得差不多,区别全在于运动方向。而两条流融合之后,准确率跳到了 88% 左右,直接反超当时最好的手工特征方法。这多出来的十几个百分点,几乎全部来自那条专门处理运动信息的时间流网络。

光流是怎么变成能喂给神经网络的输入的

这里有个技术细节值得展开讲讲,因为它直接决定了这个方法能不能真正跑起来。

光流场本身是对连续两帧图像计算出来的,一张光流图只包含两帧之间瞬间的运动信息。但一个动作往往要持续好几十帧才能看清楚,比如"打网球发球"这个动作,单看两帧之间的瞬时运动是不够的,你需要看到一整个挥拍的过程。

论文的做法是把连续多帧,通常是 10 帧,计算出来的光流图叠在一起,作为时间流网络的输入。这样网络看到的就不是某一个瞬间的运动,而是一小段时间窗口内完整的运动轨迹。这个做法背后的道理跟看视频回放差不多,单帧截图看不出球是往哪个方向飞的,但把连续十几张截图叠加起来看运动轨迹,一下子就清楚了。

另外论文里还提了一个挺实用的技巧,叫多任务学习

> 多任务学习:让同一个网络同时在多个相关但不完全相同的数据集或任务上训练,以此增加有效训练数据量、提升泛化能力的一种训练策略。

当时的问题是,视频数据集普遍偏小,标注好的动作视频数量远不如静态图片多,神经网络又是那种越喂数据越强的模型,数据不够,网络就学不好,容易过拟合。研究者的做法是让网络同时在两个不同的动作识别数据集上训练,共享大部分网络参数,只在最后分类的地方区分开来。这相当于把两个小数据集拼成了一个更大的训练资源,缓解了数据不足的问题。

这个做法背后的逻辑也很好理解。假设你想学开车,教练只让你在一个停车场里练习,车位就那十几个,练几天你可能记住了每个车位怎么倒车,但换个陌生停车场就懵了,因为你学的是记忆而不是能力。如果换成同时在三四个不同停车场练习,你会被迫总结出真正通用的驾驶技巧,而不是死记硬背某个特定场地。多任务学习就是把网络从单一小数据集的"死记硬背"里解救出来,逼着它学到更通用的运动模式。

融合两条流:谁说了算

两条流各自算出一个分类结果之后,怎么把它们合并成最终答案,这也是个需要设计的问题。

论文里试了几种融合方式,最简单直接的是取平均,把空间流和时间流各自给出的分类概率直接加权平均一下。另一种更复杂一点,是训练一个额外的支持向量机分类器,把两条流的输出特征作为输入,让它自己学怎么组合权重。实验结果显示,用 SVM 做融合比简单平均效果稍好,但差距不算特别大,简单平均已经能拿到相当不错的结果,这说明两条流各自学到的信息确实是互补的,不需要太复杂的融合手段就能起作用。

这一点其实也挺有意思,说明这个架构设计的成功,主要功劳在于"分开处理再融合"这个大方向选对了,而不是融合环节的精细调参。方向选对了,后面很多细节反而没那么敏感。

结果说话:具体数字是什么样

论文在两个当时主流的动作识别数据集上做了测试,UCF-101 和 HMDB-51。

| 方法 | UCF-101 准确率 | HMDB-51 准确率 |

| 手工特征(改进的密集轨迹,当时最优) | 87.9% | 57.2% |

| 仅空间流网络 | 72.6% | 40.5% |

| 仅时间流网络 | 81.2% | 54.6% |

| **双流网络融合(本文方法)** | **88.0%** | **59.4%** |

这张表里有几个数字特别值得多看一眼。

第一,仅空间流的表现明显是三者中最弱的,72.6%,比手工特征方法低了 15 个百分点。这说明单纯靠画面内容识别动作,深度学习并没有比手工方法强,甚至更弱。

第二,仅时间流的表现,81.2%,已经比空间流强出接近 9 个百分点,说明运动信息本身就是识别动作更关键的线索,这也验证了论文最初的假设,动作识别的核心信息藏在时间维度里,不在空间维度里。

第三,两条流融合之后,88.0%,首次超过了当时最好的手工特征方法。这是深度学习第一次在视频动作识别任务上正面击败手工设计特征,在 2014 年,这个突破的分量不亚于两年前 AlexNet 在图像识别上掀起的那场革命。

这篇论文之后发生了什么

双流网络的思路提出之后,很快成了整个视频理解领域接下来好几年的主流范式,后续一大批工作都是在它的基础上做改进。

2016 年,Feichtenhofer 等人发表了一篇论文,把双流网络里两条流融合的位置从最后一层提前到了网络中间层,让空间信息和时间信息能更早地互相交流,而不是等到最后一刻才简单加权平均,这个改进进一步提升了识别准确率。

2016 年还有一篇很有影响力的工作,Wang 等人提出的 Temporal Segment Networks,简称 TSN

> TSN:一种改进的双流网络架构,通过把视频切成多个时间片段分别提取特征再融合,解决了原始双流网络只能捕捉短时间窗口运动信息的局限,能建模更长时间跨度的动作。

TSN 解决的是原始双流网络的一个明显短板,光流窗口只有 10 帧左右,覆盖的时间太短,对于持续时间较长、结构复杂的动作,比如做一套体操动作,短时间窗口根本看不全整个过程。TSN 把整段视频切成几段,每段都单独跑一次双流网络,最后把各段结果汇总,这样就能把长时间的动作结构也纳入考虑,准确率又往上提了一截。

再往后,光流计算本身也成了被优化的对象,因为传统光流算法计算量很大,拖慢了整个系统的速度,后续也出现了用神经网络直接学习光流,或者干脆抛弃显式光流计算,直接用 3D 卷积或者其他方式建模时序关系的路线,比如后来大家熟悉的 I3D 网络。但即便是这些绕开双流架构的新方法,在做效果对比的时候,双流网络依然是绕不开的基准线,这也说明它当年提出的"空间信息和运动信息应该分开建模"这个洞察,即便具体实现方式在变,核心思想的生命力一直延续了下来。

写在后面

读这篇论文的时候,最让我意外的是仅空间流网络那个 72.6% 的数字。它比手工特征方法低了整整 15 个百分点,这说明深度学习在视频识别上一开始并不是因为"网络不够深"或者"数据不够多"而输给传统方法,是架构设计本身就没抓对重点,直接把图片分类那一套硬搬过来是错的方向。这提醒我一个更普遍的问题,很多时候一个新技术在新场景里表现不好,未必是这个技术不行,可能只是搬运的方式有问题,光流场这个中间表示的引入,本质上是帮网络把"运动"这个抽象概念翻译成了一种它擅长处理的图像格式,这个翻译步骤才是真正的巧思所在。

现在的视频模型大多不再用光流了,用 3D 卷积甚至 Transformer 直接处理原始帧序列。但双流网络提出的那个问题,空间信息和时间信息要不要分开处理,怎么分开更合适,依然是个没有标准答案的问题。或许下一次真正的突破,还是会回到这个最初的分工问题上来。

Q&A

Q1:双流卷积网络是什么?

A:这是 2014 年由牛津大学 Simonyan 和 Zisserman 提出的视频动作识别模型,用两个独立的卷积神经网络分别处理视频画面(空间流)和运动信息(时间流),最后融合两边结果做出最终判断,准确率首次超过当时最强的手工特征方法。

Q2:为什么要把空间信息和时间信息分开处理,不能放一起训练吗?

A:实验证明放一起效果不好。单独用空间流识别准确率只有 72.6%,比手工特征方法低 15 个百分点,因为很多动作光看单帧画面根本分不清楚,运动信息和画面内容是两种性质不同的东西,混在一起训练反而互相干扰,分开处理再融合效果更好,融合后能达到 88%。

Q3:双流网络后来被什么方法取代了?

A:2016 年 Wang 等人提出的 TSN 网络通过切分视频片段解决了双流网络时间窗口太短的问题;同年 Feichtenhofer 等人把融合点提前到网络中间层提升了效果。后续也出现了用 3D 卷积直接处理视频、绕开光流计算的方法比如 I3D,但双流网络的核心思想至今仍是重要参照基准。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美国驻巴拿马使馆转载无端抹黑中国企业言论,我使馆发布一张图片作为回击,配文:“某些人会怀疑烧麦里有窃听器”

美国驻巴拿马使馆转载无端抹黑中国企业言论,我使馆发布一张图片作为回击,配文:“某些人会怀疑烧麦里有窃听器”

大风新闻
2026-08-25 16:40:36
韩德君烧起青训第一把火!15岁24篮板天才直接清退

韩德君烧起青训第一把火!15岁24篮板天才直接清退

无意争春
2026-08-26 00:44:27
8月23日,冯小刚作为长春电影节评委会主席,他说:观众太抽象了

8月23日,冯小刚作为长春电影节评委会主席,他说:观众太抽象了

喜欢历史的阿繁
2026-08-25 01:34:52
美国称将向世界各国提交停止与伊朗合作的时间表,外交部发言人林剑已明确表态:中国同伊朗的合作,不应受到干扰破坏

美国称将向世界各国提交停止与伊朗合作的时间表,外交部发言人林剑已明确表态:中国同伊朗的合作,不应受到干扰破坏

吉刻新闻
2026-08-25 16:04:46
乌军硬核战将获最高荣誉!镇守东线死战不退,凭实力拿满国家勋章

乌军硬核战将获最高荣誉!镇守东线死战不退,凭实力拿满国家勋章

老马拉车莫少装
2026-08-24 20:49:44
养老金年度不调整,低收入退休人员每月少涨46-54元,影响有多大

养老金年度不调整,低收入退休人员每月少涨46-54元,影响有多大

陈博世财经
2026-08-25 12:31:35
1.1亿镑!英超双星同日被挖,马丁内利6000万创阿森纳纪录

1.1亿镑!英超双星同日被挖,马丁内利6000万创阿森纳纪录

纸短情长o
2026-08-25 00:51:21
除了性生活,就是打麻将!2000多县城普通人的生活现状只能这样?

除了性生活,就是打麻将!2000多县城普通人的生活现状只能这样?

流史岁月
2026-07-06 18:00:06
我今年42了,做了一件不要老脸的事情,在厂里跟一个22岁小伙好了

我今年42了,做了一件不要老脸的事情,在厂里跟一个22岁小伙好了

千秋文化
2026-08-23 19:46:36
遇人不淑输光半生!洪欣与张丹峰16年婚姻落幕,付出终成一场空

遇人不淑输光半生!洪欣与张丹峰16年婚姻落幕,付出终成一场空

梦醉为红颜一笑
2026-08-24 20:45:53
发现一个耐人寻味的家庭现象:很多家庭只要儿子儿媳一直不单独买房,长期和父母共同生活,时间久了,彼此关系往往越来越紧张

发现一个耐人寻味的家庭现象:很多家庭只要儿子儿媳一直不单独买房,长期和父母共同生活,时间久了,彼此关系往往越来越紧张

心理观察局
2026-08-23 06:46:05
逢田梨香子可甜可柔,凹凸有致的身材太吸睛

逢田梨香子可甜可柔,凹凸有致的身材太吸睛

小椰的奶奶
2026-08-26 02:45:53
谷正文晚年讲得很直白:当年共产党在台湾的地下工作暴露,失败的真正原因不是因为我们的手段有多高明,而是因为他们的领导太乐观了

谷正文晚年讲得很直白:当年共产党在台湾的地下工作暴露,失败的真正原因不是因为我们的手段有多高明,而是因为他们的领导太乐观了

唠叨说历史
2026-08-24 16:36:16
千里跑去河南逛胖东来,4个人空手走!停车场大爷一眼看穿实情

千里跑去河南逛胖东来,4个人空手走!停车场大爷一眼看穿实情

华庭讲美食
2026-08-26 03:18:18
炒房客暴雷正在失控,房价走向没有悬念了

炒房客暴雷正在失控,房价走向没有悬念了

重远投资观
2026-08-24 15:05:49
B费荣膺PFA赛季最佳!温格直言:我选赖斯,他的整体影响力更占优势

B费荣膺PFA赛季最佳!温格直言:我选赖斯,他的整体影响力更占优势

体育闲话说
2026-08-26 06:15:23
漠河文旅:游客反映北极村景区问题基本属实,已清退相关人员

漠河文旅:游客反映北极村景区问题基本属实,已清退相关人员

中国青年报
2026-08-25 11:50:24
中超一条龙没人夸,野球过俩人吹成神!中国足球舆论到底怎么了?

中超一条龙没人夸,野球过俩人吹成神!中国足球舆论到底怎么了?

曹老师评球
2026-08-25 23:03:53
中共中央,国务院,中央军委决定对张陆,武飞,张洪章进行表彰!

中共中央,国务院,中央军委决定对张陆,武飞,张洪章进行表彰!

麓谷隐士
2026-08-24 06:55:06
绍伊古开口求人帮忙建电厂,设备要买技术要留,这要求开得够硬气

绍伊古开口求人帮忙建电厂,设备要买技术要留,这要求开得够硬气

阿器谈史
2026-07-03 06:54:28
2026-08-26 07:00:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9646文章数 568关注度
往期回顾 全部

科技要闻

机器人跑赢博尔特,身体太快,脑子还在追

头条要闻

赴韩遇害中国女生年仅25岁 原计划2天前入职新单位

头条要闻

赴韩遇害中国女生年仅25岁 原计划2天前入职新单位

体育要闻

穆里尼奥如何摆贝林修斯姆巴佩?

娱乐要闻

张韶涵成都演唱会中暑,中途吸氧

财经要闻

宇树科技最低跌破600元 5天缩水超2000亿

汽车要闻

硬派越野+华为智驾 泰钽700上市焕新价24.98万起

态度原创

时尚
旅游
房产
家居
公开课

出道8年成顶流,却在最红最美时退圈,为什么她至今仍是无数人的白月光?

旅游要闻

暑期休闲,这些玩法人气高(探访·暑期消费)

房产要闻

一年亏掉26个亿!三江潮声,吹不醒南沙开建豪宅美梦

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版