网易首页 > 网易号 > 正文 申请入驻

复旦造出"超级视频剪刀手":同时追踪20个目标,速度还一样快

0
分享至


这项研究来自复旦大学与上海财经大学的联合团队,论文以预印本形式于2026年7月9日在arXiv公开发表,编号为arXiv:2607.08688,感兴趣的读者可通过该编号查阅完整论文。

你有没有想过,当一辆自动驾驶汽车行驶在繁忙的十字路口时,它的"眼睛"需要同时盯住多少个目标?行人、自行车、公交车、出租车、路边突然跑出来的小狗……每一个都不能漏掉,而且要实时、毫不迟疑地判断每个目标的位置和边界。这不是科幻场景,而是现代计算机视觉系统正在努力攻克的真实难题。复旦大学的研究团队最近拿出了一套名叫SAM-MT的新方案,在这个问题上迈出了关键的一步。

当前业界最强的视频目标分割工具——比如大名鼎鼎的SAM2(Segment Anything 2,由Meta AI开发)——虽然能够精准地在视频里"圈出"某个物体并持续追踪它,但有一个致命的弱点:每多追踪一个目标,系统就要多跑一遍完整的计算流程,就好像一个厨师,无论做几道菜,都必须把整个厨房从头收拾一遍才能下锅。追踪1个目标时,SAM2能跑到每秒37帧的流畅速度;但追踪3个目标时,速度就跌到17.8帧;追踪5个目标,更是只剩12.4帧——画面已经开始出现明显卡顿。如果目标再多,整个系统几乎就跑不动了。

SAM-MT的核心思路,就是彻底改变这种"追一个、算一遍"的低效模式,让系统无论面对多少个目标,计算量都几乎保持不变。结果相当令人印象深刻:追踪10个目标时,SAM-MT仍然能跑到36帧以上的实时速度,与追踪单个目标时几乎无异,是SAM2在同等条件下的6倍速度。与此同时,它在六个主流视频分割基准测试上的准确率,依然与SAM2的最强版本旗鼓相当,甚至在部分场景下略有超越。

一、多目标追踪的老大难:为什么加一个目标就慢这么多

要理解SAM-MT解决了什么问题,得先搞清楚传统方法是怎么运转的,以及它在哪里卡了壳。

视频目标分割,通俗地说,就是在视频的每一帧里,把你指定的那个东西(比如一只猫、一辆红色轿车)精确地"涂出来",并且随着视频播放,这个"涂色区域"要始终跟着目标走,不跑偏、不认错。这个任务背后最流行的技术框架叫做"时空记忆网络"(STM范式),核心思路是给每个被追踪的目标建一个专属的"记忆本",记录这个目标历史上长什么样、在哪里出现过,然后在新的一帧里,把当前画面和记忆本做比对,找到目标的位置,再精确地把它圈出来。

这个记忆本是非常"厚重"的——它存储的是像素级别的特征图,一张高清图片里有数千个像素点,每个点都要记录一套复杂的特征描述。追踪一个目标,维护一本记忆本;追踪两个目标,就得同时维护两本——不仅如此,每处理一帧新画面,所有的比对、更新、解码操作都得对每本记忆本各做一遍。这就像一个办公室职员,每多接手一个客户案例,他就要把整套接待流程完整地走一遍,客户越多,他就越忙,而且是线性地越来越忙,没有尽头。

后来出现了STCN、XMem、Cutie等改进方案,它们做了一个聪明的优化:提取图像特征这一步,可以所有目标共享,只算一次。这确实减少了一部分重复计算,但问题的根源没有被触动——每个目标的"专属记忆匹配"和"专属掩码解码",仍然需要独立地跑一遍。打个比方,这就像多个厨师共用一台打蛋机来打蛋液,但每人还是要独立地完成切菜、炒锅、摆盘全套流程。共用的那台机器省了点时间,但整体的忙碌程度仍然随人数线性增长。

还有一种听起来聪明、实则行不通的方法:干脆把所有目标合并成一个大目标来追踪。比如同时追踪三辆车,就把三辆车的轮廓合并成一个奇形怪状的大轮廓,当成一个目标来处理。这样确实只用算一遍,但代价是失去了"谁是谁"的身份信息——你不再知道这是第一辆车还是第三辆车——而且这个合并出来的怪形状,在现实世界中根本不存在,AI模型是用真实物体的图片训练出来的,它根本认不出这个东西,很快就会追丢。论文里专门做了实验验证这一点:让SAM2追踪三辆合并后的"超级车",很快就彻底失去了目标。

二、SAM-MT的核心思路:用"通缉令"代替"全程录像"

SAM-MT的解法,可以用一个侦探团队办案的比喻来理解。

传统方法就像这样:团队里有10个嫌疑人需要监视,就派10个侦探,每人全程跟踪一个嫌疑人,各自记录详细的行动录像,互不干扰,但人手成本随嫌疑人数量线性增长。

SAM-MT换了一种玩法:整个团队共享一套城市监控系统(这是"全局上下文"),掌握所有嫌疑人所在区域的大环境信息;同时,每个嫌疑人只有一张精简的"通缉令"(这就是"目标查询",target query),上面记录了这个人的关键特征。侦探们用共享的监控系统扫描全局环境,同时拿着各自的通缉令在里面找对应的人,一次扫描,所有人同时完成比对。新增再多嫌疑人,也只是多几张通缉令而已,监控系统本身不需要重新跑一遍。

在技术层面,SAM-MT在SAM2的架构基础上做了以下几项关键改造,每一项都至关重要,共同构成了这套系统的完整解法。

三、解耦掩码注意力:让"通缉令"彼此不干扰

多目标同时处理的最大风险是"串台"——追踪猫的那套特征,和追踪狗的那套特征,可能会相互影响,导致AI搞混了谁是谁。

SAM-MT用一个叫做"解耦掩码注意力"(Decoupled Masked Attention)的机制来解决这个问题。在AI的注意力计算中,有一种操作叫"自注意力",让所有的"查询"(queries)互相交流信息、相互参考。在多目标场景里,如果来自不同目标的查询可以随意交流,那么A目标的信息就会流入B目标的描述里,最终导致身份混乱。

SAM-MT的做法是在这个交流过程中加一张"隔离屏障":不同目标的专属查询之间,交流被直接屏蔽,设置为负无穷(相当于"对方根本不存在");但所有目标的专属查询,都可以自由地与代表全局环境的"全局查询"交流。用侦探比喻来说:各位侦探拿着自己的通缉令,不能互相分享内容、以免混淆嫌疑人特征,但他们都可以查阅公共的城市地图和监控档案,了解大环境。这样,每个目标既保持了自己的独立身份,又都能感知到整个场景的全局信息,二者不再是非此即彼的选择。

数学层面上,这个隔离屏障用一个注意力掩码矩阵M来实现:矩阵里,全局查询与所有查询之间的位置填0(允许交流),同一目标的查询彼此之间填0(允许交流),不同目标的查询之间填负无穷(完全阻断)。这个设计精巧地同时实现了两个目标:保护身份的独立性,同时共享全局上下文。

研究团队通过消融实验验证了这个设计的必要性。如果去掉隔离屏障,让所有目标的查询自由混合,准确率(J&F指标)会从43.0骤降到37.5,足足跌了5.5个百分点;反过来,如果把隔离做得过头,连全局查询也被隔离,准确率则降到39.3,跌了3.7个百分点。只有"解耦"这个恰到好处的中间状态,才能同时保住身份和上下文。

四、查询聚合:把多个"线索"压缩成一张"通缉令"

在用户第一次指定目标时,可以对同一个目标点多个点(正点击表示"这里是我要追踪的",负点击表示"这里不是"),提供更精确的初始描述。这些多个点会产生多个初始查询。

SAM-MT用一个轻量级的"加权头"(MLP-based weighting head)把这些多个查询合并成一个单一的"目标查询":系统会自动评估每个点的重要性,给重要的点更高的权重,然后加权平均,得到一个最具代表性的单一向量。这个单一向量就是后续帧中代表这个目标的"通缉令"。

从第二帧开始,每个目标只有一个查询在流转,既简洁,又携带了最关键的身份信息。这个设计把初始帧"点多个点"的灵活性,与后续帧"单一查询"的高效性,优雅地衔接在了一起。

五、稀疏记忆:用"关键词档案"替代"全程录像带"

SAM2的记忆系统非常"重":它存储的是每一帧图像的像素级特征图,一帧图像大约有4096个特征"像素点",每个点都有一套完整的特征描述。如果为每个目标单独维护这样一套记忆,随着目标数量增加,内存占用会急剧膨胀。

SAM-MT的应对方案是引入"基于查询的稀疏记忆"(Query-based Sparse Memory)。核心思路是:不再给每个目标存储完整的像素级记忆,而是只存储那个经过聚合的"目标查询"——一个目标,一帧,只有一个向量。

这个设计的压缩效率极高。用数字来说,传统方法每帧每目标需要存储4096个特征点,而SAM-MT只需要1个查询向量。这意味着同样的内存,SAM-MT可以往记忆库里存放多得多的历史帧,从而让系统"记住"更长时间跨度里目标的变化。这对于处理目标被遮挡后重新出现的场景尤为重要——记忆越长,就越不容易在目标消失一段时间后把它认错。

实验数据印证了这一点:在长序列基准测试LVOSv2和LVOSv1上,SAM-MT比SAM2.1-B+分别高出了2.0和2.3个百分点,而这两个数据集正是专门考验长时序追踪能力的。内存占用方面,追踪20个目标时,SAM2.1-B+需要8585MB显存,SAM-MT只需要3785MB,相差悬殊。

在稀疏记忆的具体组织上,SAM-MT采用先进先出(FIFO)的滑动窗口策略:始终保留第一帧的目标查询(因为那是用户初始指定的"基准形象"),以及最近T-1帧的目标查询。论文实验测试了不同窗口大小(8、12、16、32帧)的效果,最终选定16帧作为速度与精度的最佳平衡点。

六、身份变换器:确保"通缉令"随时间自动更新

目标不是静止的,它们会运动、旋转、被遮挡、改变姿态。一张在视频开头拍的"通缉令",到了视频后半段可能已经不太准确了。SAM-MT用"身份变换器"(Identity Transformer)来解决这个问题。

在每一帧处理结束后,当前帧的目标查询会被存入稀疏记忆。在处理下一帧时,身份变换器会让上一帧的目标查询,去"查阅"稀疏记忆里这个目标的所有历史查询,通过注意力机制综合参考历史信息,对当前查询进行更新和校正。这就像侦探每天下班前,会把今天观察到的新线索与历史档案对比,更新对嫌疑人最新状态的判断,让明天的追踪更精准。

身份变换器同样引入了一个"身份感知掩码":每个目标的查询只能查阅自己历史档案里的记录,不能跨目标查阅,从而杜绝了历史记忆层面的"串档"风险。消融实验表明,去掉这个掩码后,J&F指标会下降3.9个百分点。此外,研究团队测试了不同深度(1层、3层、5层)的变换器,最终选择3层,以在精度和速度之间取得平衡。

七、训练策略:让模型学会应对现实的复杂性

一个好的模型框架,还需要配套合理的训练策略才能发挥出应有的潜力。SAM-MT在训练上采取了几个有针对性的设计。

训练分为两个阶段:第一阶段在静态图片上训练,确保模型能够准确地从点击信号出发,一次性完成多目标的图像分割;第二阶段在视频序列上训练,强化跨帧的身份一致性。这个"先学静态、再学动态"的课程式学习策略,让基础打得更扎实。实验表明,去掉图像预训练阶段,准确率会下降2.7个百分点。

帧采样策略也经过精心设计。传统方法通常采样相邻的连续帧,这对于应对快速运动有好处,但对于"目标消失后重新出现"这种长时间跨度的事件,相邻帧的训练几乎没有帮助。SAM-MT采用"跨步采样":每次训练取8帧,其中一部分是连续帧(捕捉短期运动),另一部分是间隔4帧的跨步采样(覆盖更长的时间窗口,最多跨越32帧)。去掉跨步采样后,准确率下降1.3个百分点,而且在目标重新出现的场景中,系统会频繁认错目标。

重叠惩罚损失函数是另一个关键设计。在多目标场景中,如果两个目标的预测掩码出现重叠(即同一个像素被判定属于两个不同目标),就意味着身份出现了混乱。SAM-MT在损失函数里加入了一项专门的惩罚项:对于目标i的预测概率图,计算它与所有其他目标概率图的逐元素乘积,取平均值作为惩罚项,鼓励模型尽量输出互不重叠的掩码。这在羊群、车队等密集场景里效果尤为明显,能显著减少同一像素被多个目标"抢占"的混乱情况。

八、实验结果:数字背后的真实表现

SAM-MT在六个主流视频分割基准测试上进行了全面评估,每一个都代表了不同的真实挑战场景。

MOSEv2和MOSEv1是专门收录了频繁遮挡、快速运动、低光照、目标密集等极端场景的数据集。SAM-MT在MOSEv2上达到43.0分(J&F指标),超过了之前最好的结果Cutie的42.8分和SAM2.1-B+的41.1分。值得注意的是,SAM-MT和SAM2.1-B+都使用点击初始化,而其他方法使用的是更为"作弊"的真实标注掩码初始化,这意味着SAM-MT在更弱的初始条件下取得了更好的结果。

LVOSv2和LVOSv1是专注于长时序追踪的数据集,视频更长,目标会长时间消失后重新出现。这正是稀疏记忆设计的主场,SAM-MT的优势也最为突出:在LVOSv2上达到76.6分,比SAM2.1-B+的74.6高出2.0分;在LVOSv1上达到73.6分,比SAM2.1-B+的71.3高出2.3分。

SA-V val和SA-V test是包含大量遮挡和局部目标(如只露出头的人)的数据集,SAM-MT同样与SAM2.1-B+持平,在val上分别为66.1对65.6,在test上并列于66.4对66.1。

速度方面的对比最为直观。研究团队专门构建了一个合成基准测试,包含20个视频序列,目标数量从1个到20个分布,每个序列100帧,用来测量不同方法在不同目标密度下的帧率变化。在单目标时,SAM-MT和SAM2.1-B+的帧率相同,都是37.2帧/秒。但随着目标数量增加,SAM2.1-B+的帧率急剧下滑:3个目标时17.8帧,5个目标时12.4帧,9个目标时7.8帧,20个目标时只剩3.7帧。SAM-MT的帧率曲线则近乎水平:3个目标36.8帧,9个目标36.3帧,20个目标35.4帧,几乎感受不到任何差异。

在真实的视频数据集上,这种差距同样显著。以MOSEv2数据集中包含5个以上并发目标的子集为例,SAM-MT的帧率从整体的36.9帧仅轻微下降到35.8帧,而SAM2.1-B+从32.1帧骤跌至11.5帧,Cutie(1024p分辨率)从21.3帧跌至10.2帧。

九、真实场景中的表现:密集、相似、遮挡

研究团队还做了一系列定性实验,在真实视频里直观展示了SAM-MT的效果。

在高密度场景中,包括马戏表演(多个演员持续交叉移动)、鸭群(大量外观相似的鸭子)、团体健身课(十几个动作相似的参与者),SAM-MT都能为每个指定目标维持精确、稳定的分割轮廓,不同目标的颜色标记清晰分明,几乎没有出现混淆或丢失目标的情况。

在身份模糊场景中(如多只熊猫在草地上玩耍、多辆公交车在站台前停靠、台球游戏中多个颜色相近的球),SAM2.1-B+的表现是:开始时追踪正常,但过了一段时间后,要么丢失了某个目标,要么把两个目标的身份搞混,用错误的颜色标记了目标。SAM-MT则全程保持了正确的身份标记,多只外观相近的目标始终被用不同颜色准确区分。

这背后的原理差异在于:SAM-MT通过解耦掩码注意力,让全局上下文信息在所有目标之间共享,这使得系统在做判断时,知道场景里还有其他目标存在,可以利用"这个区域已经被另一个目标占据了"这样的信息来辅助判断;而SAM2每个目标完全独立处理,对其他目标的存在一无所知,更容易被相似的干扰物迷惑。

说到底,SAM-MT做的事情并不神秘——它就是把"追踪多个目标"这个问题,从"一个接一个地串行处理"变成了"一次全部并行处理",同时通过精巧的隔离机制确保不同目标的信息互不干扰。这种思路的转变,让速度和效率的提升几乎是量级上的。

对普通人而言,这项研究意味着:未来的视频监控系统、自动驾驶视觉模块、运动分析工具,在处理密集多目标场景时,不再需要在"追踪精度"和"实时速度"之间艰难取舍。当然,SAM-MT目前仍然是纯视觉的系统,它看的懂画面,却不理解画面的语义——比如它能把一只猫精确圈出来,但它不知道这只猫正在捉弄它旁边的那只狗。研究团队也指出,将这套高效的多目标追踪框架与多模态大模型结合,是下一步值得探索的方向。

有兴趣深入了解技术细节的读者,可以通过arXiv编号2607.08688查阅完整论文,代码也已在GitHub的FudanCVL/SAM-MT仓库开源。

Q&A

Q1:SAM-MT追踪多个目标为什么比SAM2快这么多?

A:SAM2追踪多个目标时,每新增一个目标就要完整重跑一遍记忆匹配和掩码解码,速度随目标数量线性下降。SAM-MT用轻量级"目标查询"代替了每个目标的完整像素级记忆,所有目标共享一套图像处理流程并行处理,增加目标只是多了几个查询向量,计算量几乎不变,所以追踪10个目标的速度依然能达到36帧以上。

Q2:SAM-MT是怎么避免追踪多个目标时把身份搞混的?

A:SAM-MT设计了"解耦掩码注意力"机制:不同目标的专属查询之间被完全隔离,不能相互参考,避免了特征污染;但所有目标都可以访问代表全局场景的公共查询,保持对整体环境的感知。同时,身份变换器在更新每个目标的查询时,也严格限制每个目标只查阅自己的历史档案,从根本上切断了跨目标的"串台"路径。

Q3:SAM-MT在哪些实际场景里能用上?

A:SAM-MT适合任何需要实时追踪多个物体的场景。自动驾驶需要同时追踪周围所有行人和车辆;体育分析需要实时标记场上所有球员的运动轨迹;视频监控需要持续识别多个嫌疑目标;机器人导航需要同时感知多个障碍物。这套方案在目标密集时仍能保持实时速度,正好满足这类场景对"快"和"多"的双重需求。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
《哥斯拉大战金刚》演员因车祸意外去世,年仅19岁

《哥斯拉大战金刚》演员因车祸意外去世,年仅19岁

韩小娱
2026-07-22 08:08:34
俄罗斯再次放出风声:普京可能在中国的主场上,和特朗普见上一面

俄罗斯再次放出风声:普京可能在中国的主场上,和特朗普见上一面

空天力量
2026-07-22 17:06:58
让人愤怒!冉莹颖说坐月子,公婆没出现,却被扒出,邹父早就去世,邹市明在豪宅请了4个保姆

让人愤怒!冉莹颖说坐月子,公婆没出现,却被扒出,邹父早就去世,邹市明在豪宅请了4个保姆

火山詩话
2026-07-22 06:53:41
中小学入学迎来重大调整,教育部已经下达通知,2026年9月1日全国统一执行

中小学入学迎来重大调整,教育部已经下达通知,2026年9月1日全国统一执行

每天分享天下事
2026-07-20 17:30:27
仅用5天,票房就超《功夫女足》!怪不得内地延迟上映

仅用5天,票房就超《功夫女足》!怪不得内地延迟上映

白公子探剧
2026-07-22 18:45:49
王毅会见美国国务卿鲁比奥

王毅会见美国国务卿鲁比奥

新华社
2026-07-22 22:07:05
8年烧光50个亿!从人山人海到无人问津,全国古镇为何批量倒闭?

8年烧光50个亿!从人山人海到无人问津,全国古镇为何批量倒闭?

观史搜寻着
2026-07-21 12:07:04
又一个泡沫破了!文旅,成了今年最难做的生意?

又一个泡沫破了!文旅,成了今年最难做的生意?

智谷趋势
2026-07-21 16:36:34
7月22号午评:长鑫科技:网上投资者放弃认购658万股!大盘后市将走向何方?

7月22号午评:长鑫科技:网上投资者放弃认购658万股!大盘后市将走向何方?

春江财富
2026-07-22 11:51:46
邓光荣走了,曾江走了,谢贤走了,香港影坛四大传奇只有他还活着

邓光荣走了,曾江走了,谢贤走了,香港影坛四大传奇只有他还活着

揽星河的笔记
2026-07-22 20:30:03
海航的空姐,真的挺不一样的

海航的空姐,真的挺不一样的

微微热评
2026-07-21 18:54:49
父亲晒200万海归女儿,放话啥男孩才配,网友一句话戳破残酷现实

父亲晒200万海归女儿,放话啥男孩才配,网友一句话戳破残酷现实

阿郎娱乐
2026-07-22 09:58:39
快讯!解放军用无人机在仁爱礁坐滩舰周围有了新发现!

快讯!解放军用无人机在仁爱礁坐滩舰周围有了新发现!

故事终将光明磊落
2026-07-22 17:05:13
又一巨头暴雷!创始人跳楼,多家门店关闭,客户血汗钱被坑惨了

又一巨头暴雷!创始人跳楼,多家门店关闭,客户血汗钱被坑惨了

秋枫凋零
2026-07-22 16:53:28
美加墨世界杯,展示川普正在把西方文明从白左虚无主义的悬崖边拉回来

美加墨世界杯,展示川普正在把西方文明从白左虚无主义的悬崖边拉回来

壹家言
2026-07-22 11:40:02
自驾新能源汽车跨境突遭远程锁车30多小时 车主:事前未提醒出境会被锁车

自驾新能源汽车跨境突遭远程锁车30多小时 车主:事前未提醒出境会被锁车

封面新闻
2026-07-22 21:54:10
王毅会见菲律宾外长拉扎罗

王毅会见菲律宾外长拉扎罗

环球网资讯
2026-07-22 22:44:24
阿根廷铁卫骗了全世界:左脚被踩却抱右腿打滚 西班牙进球被吹

阿根廷铁卫骗了全世界:左脚被踩却抱右腿打滚 西班牙进球被吹

念洲
2026-07-22 18:09:19
万亿市值8天蒸发!马斯克庞氏骗局坐实?更可怕的还在后头

万亿市值8天蒸发!马斯克庞氏骗局坐实?更可怕的还在后头

天马幸福的人生
2026-07-22 20:23:50
B站知名装机UP主突然被曝负债200万!“投资彻底崩盘,人已在国外......”只接高端订单,有人私下一次性转付9.1万元全款

B站知名装机UP主突然被曝负债200万!“投资彻底崩盘,人已在国外......”只接高端订单,有人私下一次性转付9.1万元全款

极目新闻
2026-07-22 22:33:17
2026-07-23 00:23:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9274文章数 567关注度
往期回顾 全部

科技要闻

马斯克看笑了:谷歌什么都有 偏偏没最强AI

头条要闻

自驾新能源汽车跨境突然遭远程锁车30多小时 车主发声

头条要闻

自驾新能源汽车跨境突然遭远程锁车30多小时 车主发声

体育要闻

阿根廷的亚军:单核足球的极限?

娱乐要闻

47岁汤唯宣布二胎产子 大女儿10岁

财经要闻

宜家出售八城"蓝盒子" 30年大店逻辑生变

汽车要闻

智能舒适却依旧硬核 泰钽700仍是台与众不同的硬派SUV

态度原创

本地
游戏
艺术
手机
公开课

本地新闻

杭州诗意路名,自带氛围感

国行PS5 Pro售罄!索尼自家商城都卖完了 至今无回应

艺术要闻

欧洲最佳高层住宅,却被吐槽“中看不中用”?

手机要闻

华为万级大电池手机曝光!中端定位,你买吗?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版