网易首页 > 网易号 > 正文 申请入驻

双流卷积网络:当深度学习第一次在视频动作识别上打败了手工特征

0
分享至


2014 年,深度学习已经在图片识别上把传统方法打得溃不成军。AlexNet 横空出世的消息传遍学术圈,卷积网络成了图像分类的标准答案。

但如果你去问一个做视频动作识别的研究者,他们大概会苦笑一下。

因为在他们的地盘上,深度学习一直打不过一种叫做"密集轨迹"的手工特征方法。

密集轨迹*:一种手工设计的视频特征提取方法,通过跟踪视频中密集分布的采样点在时间上的运动轨迹,统计轨迹周围的方向梯度、光流方向等信息来描述动作。

这不是深度学习不努力。研究者们试过把卷积网络直接怼到视频帧上,试过做时空卷积,试过各种结构调整。结果都差不多:深度学习模型的准确率长期卡在 65% 到 70% 左右,而密集轨迹这类手工方法已经能做到 85% 以上。

这个差距接近 20 个百分点。放在具体场景里理解一下,这意味着如果你让深度学习模型识别 5 个动作视频,它会比手工方法多认错 1 个。这已经不是"略逊一筹",是全面落后。

问题出在哪?视频比图片多了一个维度:时间。一张图片里的猫就是猫,静止不动,信息全在像素的空间排布里。但一段挥手的视频,关键信息藏在手臂从哪个位置移动到哪个位置,移动的方向和速度是什么。这种运动模式,恰恰是密集轨迹这类方法的拿手好戏,而单纯堆叠图片帧的卷积网络很难学到。

牛津大学的 Karen Simonyan 和 Andrew Zisserman 在 2014 年发表的这篇论文,给出了一个思路简单但极其有效的答案。他们把这个网络叫做双流卷积网络。

有意思的是,这两位作者所在的团队,几个月后就发表了 VGGNet,那个后来成为图像分类标杆架构的模型。双流网络和 VGGNet 几乎是同期的工作,某种意义上,这篇论文里已经能看到那种"用简洁架构解决复杂问题"的团队风格。

核心问题:动作到底藏在哪里

要理解双流网络的巧妙之处,得先搞清楚一件事:识别一个动作,到底需要看什么信息?

想象你在看一段视频,画面里一个人在打网球。如果只给你一张静止的截图,你可能能猜出这是打网球,因为你看到了球拍、网球场、白色的球。这是外观信息,静态的,和图片分类没什么区别。

但如果只给你截图,你分不清这个人是在发球、接球还是刚打完准备后退。要判断具体动作,你需要看手臂挥动的方向、身体重心移动的轨迹、球拍划过的弧线。这些是运动信息,只存在于连续的帧之间。

这就是问题的核心矛盾:一个网络,能不能同时处理好这两种性质完全不同的信息?

外观信息本质上是空间模式,和图片分类是一回事,卷积网络本来就擅长。运动信息本质上是时间模式,需要看帧与帧之间的变化,这是一种完全不同的信号类型,直接把很多帧堆在一起喂给卷积网络,效果并不好。

Simonyan 和 Zisserman 的答案是:不要试图用一个网络同时学两种东西,分开处理,各司其职。

空间流:专心认物体和场景

双流网络的第一条流叫做空间流。

空间流*:双流卷积网络中的一个分支,输入是视频里的单帧静止图像,负责提取物体、场景等静态外观信息。

这条流做的事情说白了很简单:从视频里随便抽一帧,当成一张普通图片扔给卷积网络去分类。这跟做图片分类没有本质区别,你甚至可以直接借用在海量图片上预训练好的模型参数,稍微调整一下拿来用。

这里有一个关键的工程选择,研究者们直接用 ImageNet 上预训练的模型初始化空间流的参数。

ImageNet*:一个包含超过 1400 万张标注图片、涵盖 2 万多个类别的大型图像数据库,是深度学习图像识别领域最常用的预训练数据集。

为什么可以这样做?因为动作识别的视频数据集,规模远远比不上 ImageNet。如果从零开始训练,网络很容易过拟合,记住了训练集里的细节却学不到真正有用的规律。借用 ImageNet 训练出来的通用视觉特征,相当于让空间流一开始就已经认识猫、狗、球拍、球场这些常见物体,不用从头学起。

这就像一个刚入职的新员工,如果公司愿意先让他去参加一个通用的行业培训,他上岗后处理具体业务时会快很多,不用把时间都花在补基础知识上。如果不这么做,直接让他从零摸索,他很可能在积累到足够经验之前就已经在测试中犯了太多错误,项目也就黄了。数据不够的时候硬train一个网络,大概就是这个结果。

时间流:光流场里藏着的运动密码

空间流解决了"这是什么"的问题,时间流负责回答"发生了什么运动"。

这才是整篇论文最有创造力的部分。

时间流的输入不是原始的视频帧,而是光流场。

光流场*:描述图像中每个像素点在连续两帧之间移动方向和速度的向量场,用来表示画面中物体的运动信息。

具体来说,研究者取相邻的两帧图像,计算出每个像素在这两帧之间往哪个方向移动了多少,水平方向的位移单独存成一张图,垂直方向的位移再存成另一张图。这两张"位移图"叠在一起,就是描述这一瞬间运动状态的光流场。

论文里进一步做了个扩展,不是只用两帧之间的光流,而是把连续 10 帧的光流场堆叠起来,一起喂给时间流。这样时间流看到的不是某个瞬间的运动,而是一小段时间窗口里持续的运动轨迹。

为什么要这么设计?

因为一个动作的完整信息,往往跨越好几帧才能看清楚。挥手这个动作,单看某一帧和下一帧之间的位移,可能只是手往上抬了一点点,你根本判断不出这是挥手还是随便动了一下。但把 10 帧的光流叠起来看,手臂的完整摆动轨迹就显现出来了。

论文里还专门画了一张光流场的可视化图。你能看到,在跑步、挥高尔夫球杆这些动作里,光流图上呈现出清晰的、有方向性的色块模式,腿部、手臂的运动轨迹被非常干净地勾勒出来,背景基本是静止的空白。这种模式比原始像素图干净太多,相当于帮网络提前把"运动到底往哪走"这件事标注清楚了,网络不用再费力从一堆颜色像素里去猜运动方向。

这里还藏着一个很聪明的细节:研究者观察到,相机本身的运动会给光流场带来干扰。比如镜头在平移拍摄,画面里所有东西看起来都在往一个方向移动,这会把真正的人物动作信号淹没掉。他们的解决办法是,先做一次相机运动的估计和补偿,把整体的平移趋势减掉,让光流场里剩下的主要是人物自身的运动。

这就像你坐在行驶的火车上录像,想拍清楚车厢里一个人挥手的动作,但因为火车在动,画面里所有东西都带着晃动。如果不做任何处理,直接分析原始画面的运动,你根本分不清哪部分晃动是火车造成的,哪部分是那个人真正在挥手。你得先把整体的晃动抵消掉,才能看清楚那个人到底在做什么。相机运动补偿做的就是这件事。

两条流怎么合起来:后期融合的选择

空间流看物体和场景,时间流看运动轨迹,两条流各自训练、各自输出一个分类结果,最后简单地把两边的预测分数做加权平均,得到最终答案。

这个融合方式叫做后期融合,是不是听起来有点简单粗暴?研究者确实也试过更复杂的融合方式,比如在网络中间层就把两条流的特征拼在一起,一起训练。但实验结果显示,简单的后期融合效果反而更稳定,复杂的早期融合并没有带来明显提升,还增加了训练难度。

这个选择背后有个朴素的道理:两条流学的东西性质差异太大,一个是静态外观,一个是动态轨迹,强行在网络内部把它们绞在一起训练,反而可能互相干扰,谁都学不好。让它们各自独立地把自己的活干到最好,最后只是在决策层面上做个投票加权,效果反而更干净。

这跟团队协作有点像。如果你的团队里一个人擅长做市场调研,一个人擅长做财务分析,你没必要逼着他们全程绑在一起完成每一步工作,更好的方式是让两人分别把各自的报告做到最扎实,最后开会的时候把两份结论放在一起综合判断。如果硬要把两人的工作流程强行捏合在每一个环节,反而可能互相干扰节奏,谁的专长都发挥不出来。

数据不够怎么办:多任务训练的补丁

双流网络还面临一个现实问题:当时能拿到的视频动作数据集,规模都不大,像 UCF-101 只有 101 类动作、大约 1 万多个视频片段,HMDB-51 更小,只有 51 类、不到 7000 个片段。这个数据量对于训练一个深度卷积网络来说,是相当吃紧的。

研究者的解决办法是多任务学习,让网络同时在两个数据集上训练,共享大部分网络参数,只在最后分类层为每个数据集单独设一个输出头。

多任务学习*:让同一个模型同时学习多个相关任务,通过共享底层表示来提高数据利用效率、缓解单个任务数据不足的问题。

这个思路的逻辑是,两个数据集虽然类别不完全一样,但它们描述的都是人体动作,底层的视觉规律是相通的。让网络同时看两批数据,相当于变相扩充了训练样本,网络能学到更通用、更鲁棒的动作特征,而不是死记硬背某一个数据集里的少数样本。

数据说话:双流网络到底强在哪

说了这么多设计思路,最终还是要靠实验数字说话。

在 UCF-101 数据集上,论文报告的结果里,单独的空间流准确率是 72.6%,单独的时间流是 81.0%,两者融合后达到 88.0%。

在 HMDB-51 数据集上,空间流是 40.5%,时间流是 54.6%,融合后是 59.4%。

| 方法 | UCF-101 准确率 | HMDB-51 准确率 |

| 仅空间流 | 72.6% | 40.5% |

| 仅时间流 | 81.0% | 54.6% |

| **双流融合** | **88.0%** | **59.4%** |

| 此前最好的手工特征方法 | 约 87% | 约 57% |

这组数字值得细细品一下。

首先,时间流单独的表现比空间流好出一大截,在 UCF-101 上高了 8.4 个百分点,在 HMDB-51 上高了 14.1 个百分点。这说明运动信息对动作识别的重要性,确实比单帧的静态外观信息更关键,这也验证了研究者一开始把光流单独拆出来处理的判断是对的。

如果只用空间流会怎么样?准确率停留在 72.6%,比双流融合的 88.0% 整整低了 15.4 个百分点。这个差距翻译一下就是,单独靠认物体和场景,大概每 6 到 7 个动作视频里就要错认 1 个,而两条流合起来看,错误率能压到更低的水平。

其次,融合之后的效果,比单独任何一条流都要好,这说明两条流确实学到了互补的信息,不是简单的重复劳动。

最重要的一点是,融合后的 88.0% 和 59.4%,已经追平甚至略微超过了当时最好的手工特征方法。这是深度学习方法第一次在视频动作识别这个任务上,正面打赢了手工特征。

在这之前,深度学习在这个领域一直被认为差着一口气。这篇论文出来之后,大家才真正确信,深度学习不是不适合处理视频,只是之前的网络结构没有对症下药。

后续影响:一条思路,两条延伸路线

双流网络这篇论文发表之后,启发了一大批后续工作,其中两条延伸路线特别值得一说。

第一条路线是把双流结构和时序建模结合起来。2016 年,Feichtenhofer 等人提出的时序分段网络,把一段视频切成多个片段,分别跑双流网络提特征,再用一种共识策略把各个片段的预测结果融合起来,解决了原始双流网络只能看很短时间窗口的问题,让网络能捕捉到跨越整段视频的长时序信息。

第二条路线是把双流结构和三维卷积结合。2017 年,Carreira 和 Zisserman(同一个 Zisserman)提出的 I3D 网络,把双流网络里的二维卷积换成三维卷积,直接在时间维度上做卷积操作,同时保留了空间流和时间流的双分支结构,并且借助大规模的 Kinetics 数据集做预训练,进一步把动作识别的准确率推高。I3D 后来成为视频理解领域一个非常重要的基准模型。

这两条路线分别解决了双流网络原始设计里的两个短板:时序建模范围太短,以及二维卷积天然不适合处理时间维度上的连续变化。但它们的骨架,依然是双流网络最早确立的那个核心思路:静态外观和动态运动,分开建模,再融合决策。

写在后面

读这篇论文最触动我的地方,是那张光流场的可视化图。你能直接用肉眼看到,网络"看到"的运动轨迹和人类理解的动作有多接近。这不是靠堆参数硬拟合出来的黑箱结果,是研究者对问题本质的洞察,先想清楚动作识别到底需要什么信息,再去设计对应的网络结构。

另一个值得琢磨的细节是相机运动补偿。这不是什么复杂的新算法,是一个很朴素的观察,相机自己在动会污染真实的运动信号。这种对数据本身特性的敏感,往往比堆砌更深的网络层数更值钱。

这篇论文也留了一个没解决的问题:两条流各自独立训练,后期才融合,这种"各管一段"的方式虽然稳,但两条流之间完全没有信息交流,时间流看不到空间流学到的物体知识,反过来也一样。如果能在训练过程中让两条流适度地互相"通气",会不会学到更好的联合表示?这个问题后来的论文一直在探索,答案也不算完全统一。

Q&A

Q1:双流卷积网络是什么?

A:双流卷积网络是 Karen Simonyan 和 Andrew Zisserman 在 2014 年提出的视频动作识别模型,用两条独立的卷积网络分支分别处理静态外观信息和运动信息,再把两者的预测结果融合,首次让深度学习方法在视频动作识别上超过了手工特征方法。

Q2:双流网络里的空间流和时间流分别负责什么?

A:空间流输入单帧图像,负责识别画面中的物体和场景等静态信息,借助 ImageNet 预训练模型;时间流输入连续多帧计算出的光流场,负责捕捉物体运动的方向和轨迹,这是判断具体动作类型的关键信息。

Q3:双流网络的实际效果如何,比之前的方法好多少?

A:在 UCF-101 数据集上,双流网络融合后准确率达到 88.0%,追平并略超当时最好的手工特征方法约 87%;在 HMDB-51 上达到 59.4%。这是深度学习方法第一次在这个任务上正面胜过手工特征方法。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
62岁影后自曝亡夫隐瞒渐冻症三年:他求我保密,我提前四年开始悲伤

62岁影后自曝亡夫隐瞒渐冻症三年:他求我保密,我提前四年开始悲伤

娱圈观察员
2026-08-21 02:34:00
北大教授张丹丹“灵活就业是福利,我们朝九晚五牺牲自由”引热议,胡锡进劝道歉,南大博士回怼

北大教授张丹丹“灵活就业是福利,我们朝九晚五牺牲自由”引热议,胡锡进劝道歉,南大博士回怼

东东趣谈
2026-08-21 11:56:23
今秋要见金正恩,特朗普首次公开谈论朝鲜核武器数量,避谈对朝无核化谈判立场

今秋要见金正恩,特朗普首次公开谈论朝鲜核武器数量,避谈对朝无核化谈判立场

大风新闻
2026-08-21 11:08:16
许家印结局已定!5个子女近况曝光,3个女人被他牵连,白珊珊最冤

许家印结局已定!5个子女近况曝光,3个女人被他牵连,白珊珊最冤

180视角
2026-08-21 10:08:59
石平出来表态了!在日本代表团即将访问中国之际,石平对此声称,他们访中的唯一“看点”,就是这些人究竟能到什么程度去“迎合”中国

石平出来表态了!在日本代表团即将访问中国之际,石平对此声称,他们访中的唯一“看点”,就是这些人究竟能到什么程度去“迎合”中国

扶苏聊历史
2026-08-21 18:27:30
许家印父子获刑!而远在英国的两个未成年儿子,正替父亲“享受”奢华人生

许家印父子获刑!而远在英国的两个未成年儿子,正替父亲“享受”奢华人生

资本董事局
2026-08-21 20:57:59
女子拍照拒搭讪遭围堵辱骂,公众为何如此愤慨?

女子拍照拒搭讪遭围堵辱骂,公众为何如此愤慨?

新民周刊
2026-08-21 20:55:38
许家印的骗术及其师承

许家印的骗术及其师承

中岭论坛
2026-08-21 12:22:42
30岁失业男子,20天没吃饭靠吃饼干和喝水扛,摔倒在家爬不起来……被紧急送医

30岁失业男子,20天没吃饭靠吃饼干和喝水扛,摔倒在家爬不起来……被紧急送医

南方都市报
2026-08-21 11:06:04
韩国总统李在明已明确表示:要在自己的任期内、即2030年前从美国“联合国军司令部”收回韩国军队战时指挥权

韩国总统李在明已明确表示:要在自己的任期内、即2030年前从美国“联合国军司令部”收回韩国军队战时指挥权

吉刻新闻
2026-08-21 21:29:22
“中国首胖”为爱切胃暴瘦480斤,成名后出轨抛妻,如今下场唏嘘

“中国首胖”为爱切胃暴瘦480斤,成名后出轨抛妻,如今下场唏嘘

健身狂人
2026-08-21 14:36:58
疯狂一夜!45亿大交易达成,克莱买断后加盟热火,76人再签一人

疯狂一夜!45亿大交易达成,克莱买断后加盟热火,76人再签一人

体坛小李
2026-08-22 04:49:31
外籍留学生做拉眼角手势惹众怒:开除学籍驱逐出境!

外籍留学生做拉眼角手势惹众怒:开除学籍驱逐出境!

尘埃里的看客
2026-08-21 16:34:31
李小冉宣布离婚后,七夕节花钱买了300万的豪车,称一个人也很好

李小冉宣布离婚后,七夕节花钱买了300万的豪车,称一个人也很好

椰黄娱乐
2026-08-21 12:03:40
赛力斯中报罕见巨亏:华为长期"吸血"问题集中爆发 问界M6意外崩盘走量预期落空

赛力斯中报罕见巨亏:华为长期"吸血"问题集中爆发 问界M6意外崩盘走量预期落空

新浪财经
2026-08-21 17:37:12
女篮惨败意大利!次节攻守崩盘,罗欣棫回暖,李月汝韩旭未归队!

女篮惨败意大利!次节攻守崩盘,罗欣棫回暖,李月汝韩旭未归队!

篮球资讯达人
2026-08-22 03:33:32
“神药”7年坚持虚假宣传,这次被媒体扒了

“神药”7年坚持虚假宣传,这次被媒体扒了

智识漂流
2026-08-21 18:31:32
许家印被判无期,他与恒大的债务,全球只有马斯克能独自还清

许家印被判无期,他与恒大的债务,全球只有马斯克能独自还清

News脑洞
2026-08-21 08:57:50
中华人民共和国正式向全世界宣告两件大事:

中华人民共和国正式向全世界宣告两件大事:

叶葉夜
2026-08-17 22:56:14
冯德莱恩傻眼,欧盟一成员国向世界宣告,与中方全面升级自贸协定

冯德莱恩傻眼,欧盟一成员国向世界宣告,与中方全面升级自贸协定

陌上桃花开的
2026-08-21 10:43:13
2026-08-22 05:08:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9612文章数 568关注度
往期回顾 全部

科技要闻

阿里AI的两面:云赚56亿,千问烧掉138亿

头条要闻

30岁女干部突遇洪水不幸牺牲 更多细节公布

头条要闻

30岁女干部突遇洪水不幸牺牲 更多细节公布

体育要闻

续哈登+招沃特森=骑士赌了

娱乐要闻

冯绍峰七夕带儿子游玩!次日聚会

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

汽车要闻

2026成都车展:小鹏全阵容亮相 三款新车套件上新

态度原创

教育
手机
家居
旅游
公开课

教育要闻

8月24日|安阳师范学院2027年研究生招生直播宣讲活动即将开启

手机要闻

全球智能手机销量下滑 唯独苹果逆势增长表现亮眼

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

大理上下两关,下关人人知晓,上关龙首关为什么慢慢淡出大众视野

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版