网易首页 > 网易号 > 正文 申请入驻

用两只眼睛看动作:当深度学习第�...

0
分享至

来源:市场资讯

(来源:科技行者)


2014 年的深度学习圈子里,有一件事让所有人心里犯嘀咕。

图像识别这边,AlexNet 已经把传统方法打得毫无还手之力,大家都在庆祝卷积神经网络的胜利。但只要把静止的图片换成会动的视频,风向就完全变了。视频动作识别领域里,效果最好的方法居然还是一种叫"密集轨迹"的手工设计特征。神经网络在这个任务上试了好几年,就是打不过一个靠人工设计规则的老古董。

这事儿说起来挺打脸的。深度学习号称能自动学习特征,不需要人来设计规则,可偏偏在视频这个更复杂的任务上,人工设计的规则反而更管用。问题出在哪儿?两位来自牛津大学的研究者,Karen Simonyan 和 Andrew Zisserman,决定认真琢磨这个事。他们后来在同一年发表了另一篇大名鼎鼎的论文,提出了 VGGNet。这个背景值得一提,因为他们对"卷积网络怎么设计才管用"这件事,显然是下了苦功的。

视频比图片难在哪

要理解这篇论文的贡献,得先搞清楚视频动作识别到底难在什么地方。

一张静止图片里,你能看到的信息是空间信息:物体的形状、颜色、纹理、相对位置。识别一只猫,一辆车,靠的都是这些空间线索。但一段视频除了空间信息,还多了一个维度,时间。一个人是在挥手还是在鼓掌,光看某一帧的画面往往分不清,你必须看动作是怎么随时间变化的。

这就是当时卷积网络的尴尬之处。原始的网络设计是给静态图片用的,直接把它套到视频上,最直接的做法就是把很多帧堆在一起塞进网络,或者干脆用 3D 卷积在时间维度上也做卷积运算。这两种做法在当时的实验里效果都不理想,网络学不到有效的运动信息,识别准确率始终被手工特征方法压着一头。

具体差多少呢?在当时权威的 UCF-101 数据集上,最好的手工特征方法能做到 87% 左右的准确率,而深度学习方法普遍卡在 65% 到 70% 之间,差了将近 20 个百分点。20 个百分点是什么概念?意味着每 5 个动作视频里,深度学习方法就要比手工方法多认错 1 个。这个差距不是简单调调参数就能补上的,说明当时的网络架构在根本上就没抓住视频里最关键的信息。

核心思路:把"看什么"和"怎么动"分开来

Simonyan 和 Zisserman 的洞察其实挺朴素。他们注意到,人在识别动作的时候,大脑里似乎有两条独立的通路在同时工作。一条通路负责认物体和场景,看到一个人、一个球、一片草地,这是"这是什么"的问题。另一条通路专门负责感知运动,不管前景背景是什么样子,只关心东西是怎么动的,这是"它在怎么动"的问题。

这个想法其实来自神经科学里一个已经存在的理论,叫双流假说

> 双流假说:一种关于人类视觉系统的理论,认为大脑处理视觉信息时分为两条独立通路,一条处理物体的形状与身份,另一条专门处理运动信息。

于是论文提出了一个听起来简单却极其有效的架构,叫双流卷积网络

> 双流卷积网络:论文提出的核心模型,用两个独立的卷积神经网络分别处理视频的静态画面和运动信息,最后把两边的判断结果融合起来。

具体来说,这两条网络流是这样分工的。第一条叫空间流,它的输入就是视频里的单张 RGB 图片,负责识别画面里有什么东西,比如识别出这是个人,旁边有个篮球架。这一条其实跟普通的图片分类网络没什么本质区别,甚至可以直接用在 ImageNet 上预训练好的网络来做迁移学习。

第二条叫时间流,这才是这篇论文真正的巧思所在。它的输入不是图片,而是光流场

> 光流场:描述图像中每个像素点在连续两帧之间移动方向和速度的一种表示,通常用一张图来可视化,不同颜色和亮度代表不同的运动方向和强度。

光流场记录的是纯粹的运动信息,把画面里所有像素点在两帧之间挪动的方向和速度都算出来,变成一张新的"运动图"。这张图上你可能完全看不出场景里有什么物体,但能清楚看到哪些区域在往哪个方向动,动得有多快。时间流网络专门吃这种光流图,只学习运动模式,不管背景是什么。

这里必须停下来讲一个类比,因为这个设计决策的代价和收益特别值得说清楚。

想象你去医院拍片子,医生同时给你做了 X 光和心电图。X 光看的是你身体的结构,骨头有没有断,器官位置对不对。心电图看的是你心脏跳动的节律,一种纯粹的动态信号,跟身体结构长什么样完全无关。如果医生只看 X 光,完全看不出心律不齐;如果只看心电图,又完全不知道你骨头有没有问题。两种信息必须分开采集,分开分析,最后再综合判断,因为它们描述的是两种性质完全不同的东西,硬塞到一起去用同一套方法处理,反而会互相干扰,谁都学不好。双流网络的设计逻辑跟这个几乎一样,空间流是"结构片",时间流是"心电图",分开训练效果远好于混在一起硬train一个网络。

如果不这样分开会怎样?论文里其实做了对照实验。只用空间流单独识别,在 UCF-101 上的准确率是 72.6%。这个数字本身已经能看出问题,单靠图片信息是远远不够的,因为很多动作光看单帧画面根本区分不出来,比如"起跳"和"落地"这两个瞬间,画面可能长得差不多,区别全在于运动方向。而两条流融合之后,准确率跳到了 88% 左右,直接反超当时最好的手工特征方法。这多出来的十几个百分点,几乎全部来自那条专门处理运动信息的时间流网络。

光流是怎么变成能喂给神经网络的输入的

这里有个技术细节值得展开讲讲,因为它直接决定了这个方法能不能真正跑起来。

光流场本身是对连续两帧图像计算出来的,一张光流图只包含两帧之间瞬间的运动信息。但一个动作往往要持续好几十帧才能看清楚,比如"打网球发球"这个动作,单看两帧之间的瞬时运动是不够的,你需要看到一整个挥拍的过程。

论文的做法是把连续多帧,通常是 10 帧,计算出来的光流图叠在一起,作为时间流网络的输入。这样网络看到的就不是某一个瞬间的运动,而是一小段时间窗口内完整的运动轨迹。这个做法背后的道理跟看视频回放差不多,单帧截图看不出球是往哪个方向飞的,但把连续十几张截图叠加起来看运动轨迹,一下子就清楚了。

另外论文里还提了一个挺实用的技巧,叫多任务学习

> 多任务学习:让同一个网络同时在多个相关但不完全相同的数据集或任务上训练,以此增加有效训练数据量、提升泛化能力的一种训练策略。

当时的问题是,视频数据集普遍偏小,标注好的动作视频数量远不如静态图片多,神经网络又是那种越喂数据越强的模型,数据不够,网络就学不好,容易过拟合。研究者的做法是让网络同时在两个不同的动作识别数据集上训练,共享大部分网络参数,只在最后分类的地方区分开来。这相当于把两个小数据集拼成了一个更大的训练资源,缓解了数据不足的问题。

这个做法背后的逻辑也很好理解。假设你想学开车,教练只让你在一个停车场里练习,车位就那十几个,练几天你可能记住了每个车位怎么倒车,但换个陌生停车场就懵了,因为你学的是记忆而不是能力。如果换成同时在三四个不同停车场练习,你会被迫总结出真正通用的驾驶技巧,而不是死记硬背某个特定场地。多任务学习就是把网络从单一小数据集的"死记硬背"里解救出来,逼着它学到更通用的运动模式。

融合两条流:谁说了算

两条流各自算出一个分类结果之后,怎么把它们合并成最终答案,这也是个需要设计的问题。

论文里试了几种融合方式,最简单直接的是取平均,把空间流和时间流各自给出的分类概率直接加权平均一下。另一种更复杂一点,是训练一个额外的支持向量机分类器,把两条流的输出特征作为输入,让它自己学怎么组合权重。实验结果显示,用 SVM 做融合比简单平均效果稍好,但差距不算特别大,简单平均已经能拿到相当不错的结果,这说明两条流各自学到的信息确实是互补的,不需要太复杂的融合手段就能起作用。

这一点其实也挺有意思,说明这个架构设计的成功,主要功劳在于"分开处理再融合"这个大方向选对了,而不是融合环节的精细调参。方向选对了,后面很多细节反而没那么敏感。

结果说话:具体数字是什么样

论文在两个当时主流的动作识别数据集上做了测试,UCF-101 和 HMDB-51。

| 方法 | UCF-101 准确率 | HMDB-51 准确率 |

| 手工特征(改进的密集轨迹,当时最优) | 87.9% | 57.2% |

| 仅空间流网络 | 72.6% | 40.5% |

| 仅时间流网络 | 81.2% | 54.6% |

| **双流网络融合(本文方法)** | **88.0%** | **59.4%** |

这张表里有几个数字特别值得多看一眼。

第一,仅空间流的表现明显是三者中最弱的,72.6%,比手工特征方法低了 15 个百分点。这说明单纯靠画面内容识别动作,深度学习并没有比手工方法强,甚至更弱。

第二,仅时间流的表现,81.2%,已经比空间流强出接近 9 个百分点,说明运动信息本身就是识别动作更关键的线索,这也验证了论文最初的假设,动作识别的核心信息藏在时间维度里,不在空间维度里。

第三,两条流融合之后,88.0%,首次超过了当时最好的手工特征方法。这是深度学习第一次在视频动作识别任务上正面击败手工设计特征,在 2014 年,这个突破的分量不亚于两年前 AlexNet 在图像识别上掀起的那场革命。

这篇论文之后发生了什么

双流网络的思路提出之后,很快成了整个视频理解领域接下来好几年的主流范式,后续一大批工作都是在它的基础上做改进。

2016 年,Feichtenhofer 等人发表了一篇论文,把双流网络里两条流融合的位置从最后一层提前到了网络中间层,让空间信息和时间信息能更早地互相交流,而不是等到最后一刻才简单加权平均,这个改进进一步提升了识别准确率。

2016 年还有一篇很有影响力的工作,Wang 等人提出的 Temporal Segment Networks,简称 TSN

> TSN:一种改进的双流网络架构,通过把视频切成多个时间片段分别提取特征再融合,解决了原始双流网络只能捕捉短时间窗口运动信息的局限,能建模更长时间跨度的动作。

TSN 解决的是原始双流网络的一个明显短板,光流窗口只有 10 帧左右,覆盖的时间太短,对于持续时间较长、结构复杂的动作,比如做一套体操动作,短时间窗口根本看不全整个过程。TSN 把整段视频切成几段,每段都单独跑一次双流网络,最后把各段结果汇总,这样就能把长时间的动作结构也纳入考虑,准确率又往上提了一截。

再往后,光流计算本身也成了被优化的对象,因为传统光流算法计算量很大,拖慢了整个系统的速度,后续也出现了用神经网络直接学习光流,或者干脆抛弃显式光流计算,直接用 3D 卷积或者其他方式建模时序关系的路线,比如后来大家熟悉的 I3D 网络。但即便是这些绕开双流架构的新方法,在做效果对比的时候,双流网络依然是绕不开的基准线,这也说明它当年提出的"空间信息和运动信息应该分开建模"这个洞察,即便具体实现方式在变,核心思想的生命力一直延续了下来。

写在后面

读这篇论文的时候,最让我意外的是仅空间流网络那个 72.6% 的数字。它比手工特征方法低了整整 15 个百分点,这说明深度学习在视频识别上一开始并不是因为"网络不够深"或者"数据不够多"而输给传统方法,是架构设计本身就没抓对重点,直接把图片分类那一套硬搬过来是错的方向。这提醒我一个更普遍的问题,很多时候一个新技术在新场景里表现不好,未必是这个技术不行,可能只是搬运的方式有问题,光流场这个中间表示的引入,本质上是帮网络把"运动"这个抽象概念翻译成了一种它擅长处理的图像格式,这个翻译步骤才是真正的巧思所在。

现在的视频模型大多不再用光流了,用 3D 卷积甚至 Transformer 直接处理原始帧序列。但双流网络提出的那个问题,空间信息和时间信息要不要分开处理,怎么分开更合适,依然是个没有标准答案的问题。或许下一次真正的突破,还是会回到这个最初的分工问题上来。

Q&A

Q1:双流卷积网络是什么?

A:这是 2014 年由牛津大学 Simonyan 和 Zisserman 提出的视频动作识别模型,用两个独立的卷积神经网络分别处理视频画面(空间流)和运动信息(时间流),最后融合两边结果做出最终判断,准确率首次超过当时最强的手工特征方法。

Q2:为什么要把空间信息和时间信息分开处理,不能放一起训练吗?

A:实验证明放一起效果不好。单独用空间流识别准确率只有 72.6%,比手工特征方法低 15 个百分点,因为很多动作光看单帧画面根本分不清楚,运动信息和画面内容是两种性质不同的东西,混在一起训练反而互相干扰,分开处理再融合效果更好,融合后能达到 88%。

Q3:双流网络后来被什么方法取代了?

A:2016 年 Wang 等人提出的 TSN 网络通过切分视频片段解决了双流网络时间窗口太短的问题;同年 Feichtenhofer 等人把融合点提前到网络中间层提升了效果。后续也出现了用 3D 卷积直接处理视频、绕开光流计算的方法比如 I3D,但双流网络的核心思想至今仍是重要参照基准。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
GTA6成人向内容太劲爆!敏感部位随着角色物理晃动

GTA6成人向内容太劲爆!敏感部位随着角色物理晃动

游民星空
2026-08-29 14:11:34
阿尔瓦雷斯:我只想去巴萨!马竞:0%!巴萨:那行吧,热苏斯也行

阿尔瓦雷斯:我只想去巴萨!马竞:0%!巴萨:那行吧,热苏斯也行

未来展望
2026-08-29 13:41:43
99年我随便买了只垃圾股,后来忘了密码,20年后证券公司打电话求我销户,我到柜台一看,当时就愣住了

99年我随便买了只垃圾股,后来忘了密码,20年后证券公司打电话求我销户,我到柜台一看,当时就愣住了

墨染尘香
2026-08-28 08:40:36
林彪鞭打妻子无人敢劝,刘亚楼夺鞭大吼,林彪:刘亚楼管我,我服

林彪鞭打妻子无人敢劝,刘亚楼夺鞭大吼,林彪:刘亚楼管我,我服

壁炉公子
2026-08-17 14:13:17
燕郊楼市开始离谱了!环京燕郊板块商品房从3.7万变成8千

燕郊楼市开始离谱了!环京燕郊板块商品房从3.7万变成8千

民生格物
2026-08-27 17:20:14
CBA猛料!广东队摊牌了,拒绝黄明依转会,只愿租借,吉林改策略

CBA猛料!广东队摊牌了,拒绝黄明依转会,只愿租借,吉林改策略

体坛小快灵
2026-08-28 10:52:43
美军退役三星上将断言:俄军即便占领整个顿巴斯,战争也不会结束

美军退役三星上将断言:俄军即便占领整个顿巴斯,战争也不会结束

观锐器
2026-08-26 18:20:03
比杀人更残忍的,是父母至今还不知道女儿已经没了

比杀人更残忍的,是父母至今还不知道女儿已经没了

小陆搞笑日常
2026-08-28 02:30:15
300人对垒3万俾路支武装,我国重装合成营有多强大?

300人对垒3万俾路支武装,我国重装合成营有多强大?

南冥那只猫
2025-04-11 23:52:33
我爸是市委书记,我对女友说我爸是工人,结果她和副镇长好上了

我爸是市委书记,我对女友说我爸是工人,结果她和副镇长好上了

乔生桂
2025-08-17 08:15:03
200艘渔船逼近仁爱礁!菲律宾刚想硬撑,转头却同意中国检查补给

200艘渔船逼近仁爱礁!菲律宾刚想硬撑,转头却同意中国检查补给

兵鉴史
2026-08-29 14:50:00
60岁老人骗女护士发生关系,手段低级,官方曝细节,结局大快人心

60岁老人骗女护士发生关系,手段低级,官方曝细节,结局大快人心

观察鉴娱
2026-08-22 09:35:48
丁忧与夺情 ——中国古代官员的被迫退休与强制上班

丁忧与夺情 ——中国古代官员的被迫退休与强制上班

《中国国家历史》
2026-08-27 22:39:59
美联储主席发表鹰派讲话 金价大跌

美联储主席发表鹰派讲话 金价大跌

新京报
2026-08-29 13:13:29
山东网友打算买龟,多个商家直言“山东不卖”,评论区全是电商泪

山东网友打算买龟,多个商家直言“山东不卖”,评论区全是电商泪

谭谈社会
2026-05-30 15:06:18
傻丫头卖血给我凑路费,二十年后我衣锦还乡,她却瘸腿扫大街

傻丫头卖血给我凑路费,二十年后我衣锦还乡,她却瘸腿扫大街

白云故事
2026-01-20 17:25:06
格列兹曼劝阿尔瓦雷斯别去巴萨:别犯我的错!在那里未必比马竞好

格列兹曼劝阿尔瓦雷斯别去巴萨:别犯我的错!在那里未必比马竞好

体育闲话说
2026-08-28 06:18:07
新首相决定对中国赔钱那一刻,全世界都看懂了:不能对华继续天真

新首相决定对中国赔钱那一刻,全世界都看懂了:不能对华继续天真

比利
2026-08-06 11:11:07
老年人注意!身份证印着“长期有效”的老年人,出现这三种抓紧换

老年人注意!身份证印着“长期有效”的老年人,出现这三种抓紧换

麓谷隐士
2026-08-22 05:50:03
24岁胃癌晚期,化疗25次!医生:6个“求救信号”,别再当胃病忍了

24岁胃癌晚期,化疗25次!医生:6个“求救信号”,别再当胃病忍了

人民日报健康客户端
2026-08-28 21:38:31
2026-08-29 15:59:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4593795文章数 9385关注度
往期回顾 全部

科技要闻

美团扭亏为盈后,外卖大战结束了吗?

头条要闻

孙宇晨诉景甜返还3000万"彩礼" 律师:彩礼性质有争议

头条要闻

孙宇晨诉景甜返还3000万"彩礼" 律师:彩礼性质有争议

体育要闻

米兰、巴黎、拉莫斯、巴克拉:所得与所失

娱乐要闻

孙宇晨最新发声:惊扰景女士非本意

财经要闻

刑自强:AI投资下半场中国蓄势待发

汽车要闻

东风日产NX8“喜柿橙意”限定色正式上市

态度原创

艺术
家居
手机
房产
公开课

艺术要闻

非洲第一高楼,又火了!

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

小米18 Fold首发搭载长鑫LPDDR6+玄戒O3!央视:为中国半导体协同突破提供了新样本

房产要闻

突发,三亚又大量卖地!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版