网易首页 > 网易号 > 正文 申请入驻

两条流打败了老办法:深度学习第一次在视频动作识别上翻盘的故事

0
分享至


2014 年之前,如果你去问一个做视频动作识别的研究者,深度学习到底行不行,大概率会得到一个尴尬的笑。

那两年,卷积神经网络已经在图像分类上把传统方法打得毫无还手之力,AlexNet 横扫 ImageNet 的故事人尽皆知。可是一旦换成视频,换成"识别一个人在做什么动作"这种任务,神经网络就突然变得不好使了。当时最好的手工特征方法,一种叫做密集轨迹的技术,在标准测试集上能拿到接近 88% 的准确率,而深度学习方法只能徘徊在 65% 到 70% 之间,中间隔着接近 20 个百分点的鸿沟。

20 个百分点的差距意味着什么?

意味着每 5 个动作里,深度学习就要比手工方法多认错 1 个。这不是小数点后的差距,这是量级上的失败。

这件事让很多人开始怀疑,深度学习是不是只擅长静态图像,一旦涉及到"运动"和"时间"这种维度,卷积网络的那套逻辑就失灵了。牛津大学的 Karen Simonyan 和 Andrew Zisserman 就是在这个背景下,拿出了一篇后来被称为"双流网络"的论文,第一次让深度学习在视频动作识别上赢了老办法。

问题出在哪:视频比图片多了一个维度,但也多了一堆麻烦

先说清楚,视频识别到底难在哪里。

一张图片,你要认出里面是猫是狗,关键信息是空间上的,纹理、轮廓、颜色搭配。卷积网络天生擅长这个,一层一层地提取边缘、纹理、局部形状,最后拼出整体判断。

可视频不一样,视频的关键信息除了空间还有时间。一个人挥手和一个人放下手,单看某一帧的画面可能长得一模一样,区分它们的唯一线索是"这个动作在时间上是怎么变化的"。

早期研究者想了很直接的办法,把视频当成一堆图片,直接把时间维度也塞进卷积核里,做三维卷积。听起来很合理,但效果差得离谱。原因是网络很难从原始像素的时序变化里,自己学出"运动"这个概念。像素的变化太嘈杂了,光照、背景、镜头晃动都会带来变化,网络分不清哪些像素变化代表真正的动作,哪些只是噪声。

> 三维卷积:在普通图像卷积的基础上,再加一个时间维度,让卷积核同时扫过空间和时间,试图直接从像素序列里学出动作特征。

这就好比你想学会看懂一段手语,但老师给你的教材不是标好的手势图解,而是一整段没有任何标注的监控录像,让你自己从画面的像素抖动里去猜哪里是手在动,哪里只是灯光闪烁。理论上信息都在那里,但信噪比太低,学习效率极其糟糕。如果换一种教材,直接告诉你"这一帧到那一帧,手往左移动了多少",你学起来会快得多。

Simonyan 和 Zisserman 想的正是这个"换教材"的思路。

核心方法:把运动信息提前算好,单独喂给网络

双流网络的核心想法说出来其实很朴素:既然让网络自己从像素里学运动太难,那就不让它学了,直接把运动信息算好,喂给它。

具体做法是,把视频拆成两条独立的处理流。

第一条叫空间流,输入是单独的一帧图像,负责识别画面里的场景和物体,回答"这是在哪里,画面里有什么"。这条流的结构跟普通的图像分类网络几乎一样,可以直接借用在海量图片上预训练好的模型。

第二条叫时间流,输入不是原始图像,而是光流场。

> 光流:描述视频中相邻两帧之间,每一个像素点是往哪个方向、移动了多远的一种运动场表示,通常用一张编码了运动方向和速度的图像来呈现。

光流场本质上是提前用传统算法把"运动"这件事算清楚了,变成一张张只包含运动信息、不包含颜色纹理的图。时间流网络看到的不是"一个人穿着红衣服在挥手",而是一堆箭头,告诉它手部区域正在往某个方向快速移动。这样网络就不用再费劲从像素噪声里挖运动信息,运动信息已经被显式地摆在了面前。

两条流各自独立训练,各自给出一个动作分类的预测,最后把两条流的预测结果做加权融合,得到最终答案。

![双流网络结构图]

论文里那张结构图画得很直白,一边是"空间卷积网络",输入单帧图像,一边是"时间卷积网络",输入的是堆叠起来的多帧光流图,两条线各走各的,最后在顶端汇合成一个分类分数。

为什么非要分成两条流,不合并成一个网络处理?

因为这两种信息的性质根本不同。空间信息关心的是"像什么",需要的是纹理和形状的层级特征,这恰好是图像分类网络最擅长的,而且可以直接复用在 ImageNet 上训练好的参数,省掉大量训练时间和数据。时间信息关心的是"怎么动",光流场里没有颜色和纹理,是一种完全不同性质的输入,需要单独设计和训练一套参数去理解运动模式。硬把两种性质不同的信息塞进同一套卷积核里学习,效果反而会互相干扰,谁也学不精。

这就像让一个人同时练两种完全不搭的技能,比如让一位画家兼职做手语翻译,一边要盯着画布上的色彩构图,一边要盯着别人手部动作的速度和方向,这两种注意力的调用方式完全不同,硬凑在一起练,两样都练不精。分开练,画画的时候专心用眼睛捕捉色彩,翻译的时候专心用眼睛捕捉运动轨迹,各自都能练到位,最后再把两种判断结合起来综合决策,效果自然更好。

关键细节:光流怎么喂给网络,以及怎么解决数据不够的问题

光流的具体处理方式上,论文也做了几个值得说的设计。

首先,时间流网络的输入不是单张光流图,而是连续多帧光流叠在一起,论文里用的是 10 帧,分别包含水平方向和垂直方向的运动分量,拼成一个多通道的输入。这样网络看到的不只是某一瞬间的运动,而是一小段时间窗口内运动的演变过程,这对捕捉一个完整动作的节奏很关键。挥手这个动作,你只看某一瞬间的运动方向是不够的,得看这一小段时间里手是怎么来回摆动的,单帧光流做不到这一点,多帧叠加才能。

其次是数据量的问题。

训练一个卷积网络需要大量标注数据,但当时的视频动作识别数据集,比如 UCF101 和 HMDB51,规模远远比不上图像分类领域的 ImageNet,视频数量以千计,而 ImageNet 的图片数量以百万计。数据不够,网络很容易过拟合,学到的不是动作的通用规律,而是训练集里的偶然细节。

论文给出的解法是两条腿走路。

空间流直接借用在 ImageNet 上预训练好的图像分类网络参数,再用视频数据做微调,这样空间流一开始就带着从百万级图片里学来的丰富视觉知识,不用从零开始学"什么是猫,什么是桌子"。

时间流因为输入是光流,跟自然图像的统计特性差别很大,没法直接借用图像预训练模型,只能从零训练,但作者们通过在多个数据集上联合训练,以及做数据增强,一定程度上缓解了数据不足的问题。

这里有个细节很能说明研究者当时的判断,他们没有强行要求两条流用完全一样的训练方式,而是根据每条流输入数据的特性,分别选择最合适的训练策略。这其实反映了一种务实的工程思路,不追求形式上的对称好看,只追求实际效果。

结果说话:两条流加起来,第一次超过了手工特征

实验结果是这篇论文最有说服力的部分。

在 UCF101 数据集上,单独用空间流,准确率是 72.6%。单独用时间流,准确率能到 81% 左右。而把两条流融合起来,准确率提升到了 88% 左右,第一次追平甚至略微超过了当时最好的手工特征方法。

如果只用空间流会发生什么?

准确率停留在 72.6%,比手工特征方法低了十几个百分点,说明单靠画面内容识别动作是远远不够的,你没法只看一张静止照片就百分百确定这个人是在挥手还是在放下手臂。

如果只用时间流呢?

准确率能到 81%,单独看已经相当不错,说明运动信息本身对判断动作类别的贡献比场景信息更大,这也解释了为什么"运动"这条线索这么重要。但即便这样,单独一条流也打不过手工特征,只有两条流拼在一起,信息互补,才能真正跨过那道门槛。

下面这张表大致还原了论文里的核心对比数据。

| 方法 | UCF101 准确率 |

| 手工特征(密集轨迹方法) | 约 87.9% |

| 仅空间流 | 72.6% |

| 仅时间流 | 约 81% |

| **双流网络(融合后)** | **约 88.0%** |

这张表最重要的信息不是哪个数字最大,而是"融合"这个动作本身带来的提升,比单条流的任何一条都高出一大截,这说明空间和时间这两种信息确实是互补的,而不是重复的。

这是深度学习在视频动作识别上第一次赢过手工特征方法。在 2014 年,这句话的分量不亚于 AlexNet 在图像分类上的横空出世,只不过双流网络没有掀起同样规模的舆论声浪,因为它的胜利margin没有那么夸张,只是刚刚超过,而不是碾压。但这道 20 个百分点的鸿沟,第一次被填平了,这本身就是一个信号,说明深度学习不是不适合处理时间信息,只是需要换一种喂数据的方式。

值得一提的是,Simonyan 和 Zisserman 是同一个牛津 VGG 研究组的成员,他们几个月后又发表了另一篇影响深远的论文,提出了后来被广泛使用的 VGGNet 图像分类架构。这两篇论文几乎是同期的工作,双流网络里空间流用的网络结构,思路上就和 VGGNet 一脉相承,都强调用更深、更规整的卷积层堆叠去提取特征。

后续影响:双流的思路被不断放大和延伸

双流网络提出的"分开处理空间和时间信息,再融合"这个思路,后来被很多研究直接继承和扩展。

2016 年,Feichtenhofer 等人发表的论文进一步研究了两条流应该在网络的哪一层进行融合最合适,他们发现如果两条流融合得太晚,信息交互不够充分,如果融合得太早,又会破坏各自流独立学习的优势,找到一个恰当的融合时机能进一步提升准确率。

2017 年,Carreira 和 Zisserman(还是同一个研究者)发表了 I3D 论文,把双流网络里的二维卷积扩展成了三维卷积,同时借助一个新的大规模视频数据集 Kinetics 做预训练,解决了当年视频数据量不够的老问题,把动作识别的准确率又往上推了一大截,这篇论文后来成为视频理解领域一个重要的基准模型。

这两篇后续工作分别从"怎么融合"和"怎么扩大数据规模"两个方向,延续和深化了双流网络最初提出的核心问题:如何让网络同时学好空间和时间这两种性质不同的信息。

写在后面

读这篇论文的时候,最触动我的其实不是双流网络本身的准确率数字,而是它体现出的一种研究态度:遇到网络学不好的问题,不一定要死磕"让网络自己学会一切",有时候把问题拆开,把其中一部分交给传统算法先算好,反而是更聪明的做法。

这跟后来深度学习一路狂奔、追求端到端、追求让网络吃进原始数据自己学出一切的主流叙事,其实是有点拧着来的。双流网络的成功恰恰依赖于"不端到端",依赖于光流这个手工设计的中间表示。这提醒我,端到端不是万能信条,有时候在数据和算力不够充裕的阶段,一个好的先验设计,比一个更大的网络更管用。

另一个值得琢磨的地方是,这篇论文的两条流准确率都不算特别高,72.6% 和 81%,单独看都不算惊艳,但融合之后的提升幅度证明了"信息互补"比"单一信息的极致优化"更重要。这其实是个挺普适的道理,不只是在动作识别这个具体任务里成立。

那如果换到今天,算力和数据都不再是瓶颈,双流网络这种"人工拆分信息通道"的思路,是不是已经彻底过时了?还是说,在某些数据依然稀缺的垂直领域,这种思路仍然值得重新捡起来用一用?

Q&A

Q1:双流网络是什么?

A:双流网络是牛津大学Simonyan和Zisserman在2014年提出的视频动作识别方法,把视频拆成空间流和时间流两条独立处理路径,空间流处理单帧图像识别场景,时间流处理光流场识别运动,最后融合两条流的预测结果。

Q2:双流网络为什么要分成空间流和时间流两条路径?

A:因为空间信息(画面内容)和时间信息(运动模式)性质完全不同,混在一起训练会互相干扰,效果反而不好。分开训练能让每条流专注学习自己擅长的信息,最后融合时实现互补,准确率比单条流分别提升十几个百分点。

Q3:双流网络的效果比传统手工特征方法好吗?

A:融合后的双流网络在UCF101数据集上准确率约88%,第一次追平并略超过当时最强的手工特征方法(密集轨迹,约87.9%),这是深度学习在视频动作识别领域第一次战胜传统方法。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
内塔尼亚胡发表视频声明:“别惹我们”

内塔尼亚胡发表视频声明:“别惹我们”

政知新媒体
2026-09-30 01:15:42
“看我脸就捅死你”,26岁女子被日本高管性侵40分钟经过曝光,高管承认吃药了,身体不自控

“看我脸就捅死你”,26岁女子被日本高管性侵40分钟经过曝光,高管承认吃药了,身体不自控

汉史趣闻
2026-09-29 18:58:47
李殿勋在孝感市检查节前安全生产与文旅消费等工作

李殿勋在孝感市检查节前安全生产与文旅消费等工作

孝感日报
2026-09-30 08:08:16
上海炒股冠军罕见发声:目前A股想逢低建仓,建议只磕银山谷形态

上海炒股冠军罕见发声:目前A股想逢低建仓,建议只磕银山谷形态

股经纵横谈
2026-09-30 02:54:49
捷克0-2英格兰,赛后评分:不是凯恩第一,英格兰11号排第一

捷克0-2英格兰,赛后评分:不是凯恩第一,英格兰11号排第一

侧身凌空斩
2026-09-30 04:38:30
郭士强宫鲁鸣只是冰山一角!新华社这盆冷水,浇醒了多少人?

郭士强宫鲁鸣只是冰山一角!新华社这盆冷水,浇醒了多少人?

刘哥谈体育
2026-09-30 03:51:47
1979年那场仗,中国人叫"自卫反击",可越南人把这口气憋了47年,憋到近年才有人敢说实话:那28天,高平、谅山两座省城被炸成了月球表面

1979年那场仗,中国人叫"自卫反击",可越南人把这口气憋了47年,憋到近年才有人敢说实话:那28天,高平、谅山两座省城被炸成了月球表面

扶苏聊历史
2026-09-29 17:20:48
姚明还能回归篮协吗?苏群:让专业人士当主席的政策现在已经没了

姚明还能回归篮协吗?苏群:让专业人士当主席的政策现在已经没了

狼叔评论
2026-09-29 18:28:04
40岁加州科技高管命丧停车场,遭亚裔岳父母轮流开枪,老人疑替年幼外孙出手

40岁加州科技高管命丧停车场,遭亚裔岳父母轮流开枪,老人疑替年幼外孙出手

译言
2026-09-29 07:25:54
泰国洪水上涨,寺庙为防27岁400公斤鳄鱼出逃,将其五花大绑、吊车转移

泰国洪水上涨,寺庙为防27岁400公斤鳄鱼出逃,将其五花大绑、吊车转移

都市快报橙柿互动
2026-09-29 16:22:02
中纪委再次放话!严令各地哪怕掉层皮,也要一抓到底!

中纪委再次放话!严令各地哪怕掉层皮,也要一抓到底!

职场资深秘书
2026-09-29 17:39:47
从确诊到去世仅15天,“央视最帅主持人”的遭遇为人们敲响警钟

从确诊到去世仅15天,“央视最帅主持人”的遭遇为人们敲响警钟

银河史记
2025-11-03 19:31:33
突然发现,陈妤颉居然是五五分的身材,简直颠覆短跑运动员选材标准

突然发现,陈妤颉居然是五五分的身材,简直颠覆短跑运动员选材标准

言过于诚
2026-09-26 21:46:42
全市场:奥斯瓦尔多病情稳定,仍在重症监护

全市场:奥斯瓦尔多病情稳定,仍在重症监护

懂球帝
2026-09-29 16:48:15
张本宇遭乒协重罚,亚运会握手细节,揭开日乒队内真实现状!

张本宇遭乒协重罚,亚运会握手细节,揭开日乒队内真实现状!

故事终将光明磊落
2026-09-29 16:29:34
江苏医务人员上班沉迷打游戏,患者咨询全程不抬头,院方回应

江苏医务人员上班沉迷打游戏,患者咨询全程不抬头,院方回应

新时代的两性情感
2026-09-30 06:24:04
今日校庆!同城两所顶尖985校庆仅隔一天!是巧合吗?

今日校庆!同城两所顶尖985校庆仅隔一天!是巧合吗?

牛锅巴小钒
2026-09-30 07:32:15
吃一堑长一智!山东泰山发誓再不请韩国教练!新主帅已渐渐浮出水面

吃一堑长一智!山东泰山发誓再不请韩国教练!新主帅已渐渐浮出水面

零度眼看球
2026-09-30 07:22:42
西安纪委通报:小学校长房日宏长期公款吃喝、购物,通过截留课后服务费等方式设立“小金库”,已被“双开”

西安纪委通报:小学校长房日宏长期公款吃喝、购物,通过截留课后服务费等方式设立“小金库”,已被“双开”

封面新闻
2026-09-29 21:30:38
韩国队慌了,赛前罕见认怂,输球全员服兵役,国足今非昔比,取胜概率提升

韩国队慌了,赛前罕见认怂,输球全员服兵役,国足今非昔比,取胜概率提升

体坛风之子
2026-09-30 07:00:23
2026-09-30 10:32:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10022文章数 569关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

牛弹琴:全部美军灰溜溜走了 伊拉克举国兴奋放假4天

头条要闻

牛弹琴:全部美军灰溜溜走了 伊拉克举国兴奋放假4天

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

游戏
家居
艺术
数码
公开课

《GTA6》12张全新截图!沙滩|泳装|夜店|野生动物等

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

齐白石:没见过的东西,我绝不画!一句话,道出大师封神的秘密!

数码要闻

微星流光X32 MAG 271QPX32 OLED显示器体验:新面板+旗舰调校,电竞玩家新选择

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版