网易首页 > 网易号 > 正文 申请入驻

ICCV2019 | 锁定视频中的目标:港大提出运动注意力检测方法

0
分享至

机器之心发布

作者:李灏峰

显著物体检测常作为计算机视觉与图形学应用的预处理步骤。 但目前只有面向图像的显著物体检测方法研究比较成熟,而面向视频的方法还有很大的研究空间。
为此,香港大学联合中山大学和深睿医疗人工智能实验室发布论文《Motion Guided Attention for Video Salient Object Detection》,提出了基于运动注意力的视频显著物体检测方法(MGA),比之前最好的算法在 DAVIS 和 FBMS 上分别提升了 4 个和 8 个百分点,该论文已被 ICCV2019 接收。


论文地址:http://openaccess.thecvf.com/content_ICCV_2019/papers/Li_Motion_Guided_Attention_for_Video_Salient_Object_Detection_ICCV_2019_paper.pdf

研究背景
显著物体检测问题要求对于每张图片或视频帧,预测一个二类别的像素级分割结果,用以表征图片中的显著或前景物体。 该问题常作为计算机视觉与图形学应用的预处理步骤。 随着深度学习技术的发展,面向图片的显著物体检测方法被广泛研究,而面向视频的显著物体检测有待进一步探索。

为了解决视频的显著物体检测,该论文作者有以下观察:

  • 其一,视频物体的显著性由其外观和运动共同决定,显著物体的运动往往也是显著的,显著运动的区域很可能是显著物体;


  • 其二,物体的运动蕴含空间连贯性信息,运动状态相似的相邻区域很可能同属于一个物体或者背景;


  • 其三,利用运动信息的空间连贯性,有助于分离物体和背景。背景外观可包含纹理不同的多个区域,而物体可包含内部边缘及不同外观的部件,这造成了分割的困难。而表征运动的光流图片相对「干净」(如图 1b),可更好地捕捉部分物体边界,成为分割显著物体的契机。

目前现有方法主要通过循环神经网络聚合多个视频帧的卷积特征,或者利用光流和变形来对齐不同帧的特征,而没有通过端到端学习来捕捉和利用光流中的显著运动。 作者提出一系列运动注意力模块,来建模显著运动如何结合外观信息来影响物体显著性。 作者还提出了一个双分支网络,用以放置上述注意力模块,来实现视频显著物体检测。

图 1。
运动引导的注意力机制
为了建模显著运动如何结合外观信息来影响物体显著性的,作者将外观信息抽象为三维的外观特征张量(可为某个 ReLU 隐层的输出),将显著运动抽象为二维的运动显著图(如某个 sigmoid 隐层的输出)或者三维的运动特征张量。 首先考虑最简单的情况,如何用一张二维的运动显著图来「关注」三维外观特征的重要位置。 一个直观的朴素模型是将运动显著图与外观特征逐位相乘,来加强外观特征中运动显著的区域的响应。 但这个朴素模型的缺点在于,运动显著图中的零元素会「抑制」外观特征中运动不显著或者静止的区域,从而导致物体分割不完整的情况出现。

为了解决朴素模型的缺点,作者提出模型一: 采用残差结构,将被加权后的外观特征与最初的外观特征逐位相加,补充回错误抑制的外观信息,使后续的神经网络层有机会勾勒出完整物体。 下面考虑如何利用三维运动特征来关注外观特征。 一个简单方案是模仿模型一,与外观特征逐位相乘相加,区别在于要先采用一个 1x1 卷积来对齐运动特征和外观特征的形状,这样得到模型二。
模型二可以看作是用一个三维权重同时实现空间和通道注意力的机制。 但由于运动特征来源于信息量较「稀疏」的光流图片,缺乏纹理信息和复杂语义,基于这样的特征对外观特征进行通道注意力,可能引入额外噪声或导致过拟合。 一个备选方案是运动特征仅用于空间注意力,即先用一个 1x1 卷积和 sigmoid 从运动特征预测出运动显著图,在进行类似模型一的操作,这样得到模型三。

图 2。
最后,基于模型二和三,考虑如何实现合理的通道注意力,作者提出了模型四。 模型四先用运动特征对外观特征进行空间注意力,「空间注意」后的外观特征经由全局平均池化得到一个一维向量,该向量可表征显著运动区域的外观特征。 由于物体的运动和静止部分有较一致的外观属性(如色彩、纹理、语义),那么基于上述运动区域的外观特征向量预测出的一维的通道注意力权重,可有效提高物体静止部分相应属性或通道的响应,从而有助于分割出完整物体。 模型四的末端保留残差结构,以避免零元素「抑制」的问题。

运动引导注意力网络(MGAnet)

图 3。
接下来,作者提出一个运动引导注意力网络(MGAnet),一方面用来提取前述外观特征、运动特征以及运动显著图,另一方面用来结合前面提出的一系列运动注意力模块,从而形成完整的视频显著物体检测方法。 MGAnet 是一个基于 DeepLab-V3+的双分支网络。 目前不少视频分割方法也采取双分支结构,但主要在各分支末端进行融合,而 MGAnet 采用多层次的、密集的方式连接两个分支。 MGAnet 包含一个以 RGB 图像为输入的外观分支,一个以光流可视化图片为输入的运动分支,以及连接两分支的 6 个注意力模块 MGA-{0-5}。 外观分支的编码器可为 ResNet-101 或 ResNet-50,运动分支的编码器可为 ResNet-34 或 ResNet-18,不同组合均可达到 SOTA 的性能。 MGA-{0-5} 可看作部署注意力模块的「槽」,其中 MGA-5 仅可采用模型一(运动信息是二维显著图),MGA-0 至 MGA-4 可采取模型二三四中的某一种,一般采用同一种。

实验结果
下文报告几个主要的实验。 第一个实验将 MGA 与现有的视频及图片的显著物体检测方法在三个数据集 DAVIS、FBMS 和 ViSal 上比较。 其中,ViSal 中并没有划分出训练集供模型训练,能较好地反映模型的泛化能力。 与 6 个视频模型和 11 个图片模型相比,MGA 在三个数据集上均表现最优,分别获得 4 个、8 个、1 个百分点的 MaxF 的领先。

表 1。
第二个实验验证网络结构的有效性。 作者尝试单独地训练、测试单个分支,其中独立的外观分支等价于语义分割中的 SOTA 模型 DeepLab-V3+; 作者还尝试仅保留编码器部分(MGA-E)或者解码器部分(MGA-D)的注意力模块。 实验结果显示,双分支结构有效利用了运动信息,优于任一单分支网络。 注意力模块部署在编码器端或解码器端,均能起到效果,同时部署在编码器和解码器端可获得最佳性能。
第三个实验验证四个运动注意力模块的有效性。 三种朴素的特征融合方法,包括逐位相乘、逐位相加和沿通道拼接(concatenate),被作为基线方法。 表 3 中,「E-」表示部署在编码器端,「D-」表示部署在解码器端。 实验结果显示,四种注意力模块均优于基线方法。 其中,较复杂的模型四(MGA-tmc)略优于模型二(MGA-t)和模型三(MGA-tm)。

表 2。

表 3。
总的来说,作者利用运动的空间连贯性,采用注意力机制来建模运动对物体显著性的影响,提出了一个简单但准确率高的双分支网络。 与基于循环神经网络的方法不同,该方法利用一个极小时间窗内的时序上下文(即与相邻帧的光流),取得了 SOTA 的性能。 本文是对原文主要方法和实验的解读,更多细节请参见原文。

文为机器之心发布,转载请联系本公众号获得授权
------------------------------------------------加入机器之心(全职记者 / 实习生):hr@jiqizhixin.com投稿或寻求报道:content@jiqizhixin.combd@jiqizhixin.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
台湾终极解决方案:土地回归中国,人员往来自由,逃走不是中国人

台湾终极解决方案:土地回归中国,人员往来自由,逃走不是中国人

史行途
2026-06-25 05:56:31
毛主席83岁给华国锋的珍贵书法,练字真的有意义吗?

毛主席83岁给华国锋的珍贵书法,练字真的有意义吗?

书画相约
2026-05-11 10:09:02
期望第二次改革开放

期望第二次改革开放

新浪财经
2026-07-17 23:30:34
定了!1986年的九年义务教育,2026年终要变天

定了!1986年的九年义务教育,2026年终要变天

优墨出品
2026-07-20 13:41:06
蓝营权力核心人物韩国瑜的丑陋表演

蓝营权力核心人物韩国瑜的丑陋表演

显微镜下的人性
2026-08-13 05:26:46
云南这个案子,已经不是“恐怖”的问题了

云南这个案子,已经不是“恐怖”的问题了

清书先生
2026-08-06 08:00:16
WTT大满贯:国乒无缘1冠!惨败连输勒布伦,单打新增5胜1负

WTT大满贯:国乒无缘1冠!惨败连输勒布伦,单打新增5胜1负

全言作品
2026-08-13 22:04:53
“统一”不会等到台湾换届,国民党主席候选人不改口号是做无用功

“统一”不会等到台湾换届,国民党主席候选人不改口号是做无用功

时光漫游志
2026-08-13 14:27:35
发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

心理观察局
2026-08-01 07:10:30
泪目!台风天,女外卖员半路把1岁娃托给上海一超市!店主:孩子浑身湿透颤抖……你送完再来接!

泪目!台风天,女外卖员半路把1岁娃托给上海一超市!店主:孩子浑身湿透颤抖……你送完再来接!

环球网资讯
2026-08-13 09:12:17
10万入场费的“换妻”盛宴:记者冒死暗访,组织者3年狂赚2亿

10万入场费的“换妻”盛宴:记者冒死暗访,组织者3年狂赚2亿

说点事
2026-07-16 11:29:11
拍完新龙门客栈,梁家辉对张曼玉说:以后除了拍戏,咱俩别联系,这样对你我都好

拍完新龙门客栈,梁家辉对张曼玉说:以后除了拍戏,咱俩别联系,这样对你我都好

草莓解说体育
2026-08-10 16:30:35
王虹的博士论文,被人扒出来了!她的致谢部分,英文写得跟小学生一样。带头开喷的,是一位雅思6分多的博主

王虹的博士论文,被人扒出来了!她的致谢部分,英文写得跟小学生一样。带头开喷的,是一位雅思6分多的博主

谭谈社会
2026-08-10 10:26:10
梅州梅江区开了9年的腌面店忽然停摆,老街坊望着摘掉的门牌一时发怔

梅州梅江区开了9年的腌面店忽然停摆,老街坊望着摘掉的门牌一时发怔

娱乐的硬糖吖
2026-08-12 12:50:50
一家4口在华山跳崖,总债务高达4亿元,仅有一个女儿被留下

一家4口在华山跳崖,总债务高达4亿元,仅有一个女儿被留下

纸鸢奇谭
2024-08-14 16:57:01
A股:尾盘突然跳水,做好准备,明天周五,8月14日,很可能这样走

A股:尾盘突然跳水,做好准备,明天周五,8月14日,很可能这样走

虎哥闲聊
2026-08-13 14:57:04
百花奖0票!看见王宝强被欺负成这样,陈思诚坐不住了,连夜赶回

百花奖0票!看见王宝强被欺负成这样,陈思诚坐不住了,连夜赶回

皮蛋儿电影
2026-08-12 22:02:11
广东一男子连续25小时没睡觉,突然头疼心跳加快,AI建议“赶紧去医院”,吓得准备交代后事,医生:别慌,只是轻微缺钾

广东一男子连续25小时没睡觉,突然头疼心跳加快,AI建议“赶紧去医院”,吓得准备交代后事,医生:别慌,只是轻微缺钾

深圳晚报
2026-08-13 20:41:54
阿维塔一句“合作非必要”,整个汽车圈都替华为急了

阿维塔一句“合作非必要”,整个汽车圈都替华为急了

蓝字计划
2026-08-12 17:35:31
53岁袁立家中办康复派对!瘦脱相还又跳又唱,屋内装修老土太朴素

53岁袁立家中办康复派对!瘦脱相还又跳又唱,屋内装修老土太朴素

动物奇奇怪怪
2026-07-16 14:51:53
2026-08-14 02:52:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13751文章数 142718关注度
往期回顾 全部

科技要闻

一切皆插件!DeepSeek Harness正式发布

头条要闻

冉莹颖被指称“输了换老公有保险”邹市明深夜回应

头条要闻

冉莹颖被指称“输了换老公有保险”邹市明深夜回应

体育要闻

负债十几亿的联赛,还在疯狂买球星

娱乐要闻

篡改红歌已立案,郭德纲大祸临头

财经要闻

可治疗癌症?神话破灭的片仔癀 陷入争议

汽车要闻

全新红旗H7到底新在哪儿?

态度原创

教育
游戏
手机
亲子
家居

教育要闻

潍坊拟筹建一所普通本科高校!

曾为LPL夺S赛冠军,如今沦落登峰组9连败,Jiejie归队遭质疑!

手机要闻

荣耀Robot Phone成了,Magic9要来了

亲子要闻

一个家过得怎么样,看孩子就知道

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版