网易首页 > 网易号 > 正文 申请入驻

换个顺序,VLM「不会了」:EgoTSR让机器人判断任务是否真在推进

0
分享至



让我们想象一个场景:

机械臂夹起桌上的杯子,正准备把它放进盘子。下一秒,抓取失败,杯子重新掉回桌面。

从时间上看,后一幅画面发生得更晚;但从任务目标来看,机器人不仅没有取得进展,反而退回了原点。人类很容易看出这种变化,视觉语言模型却可能给出相反答案。

原因并不难理解。大量机器人视频都按正常时间顺序记录:先接近物体,再抓取,最后完成放置。在这样的数据里,「后面的画面更接近任务完成」往往成立。模型训练得越久,就越可能记住这条省力的捷径。它能认出杯子、盘子和机械臂,也能描述画面中的动作,却未必真正理解:这些动作究竟有没有推动任务向前。

针对这一问题,浙江大学等五所高校的研究团队提出 EgoTSR。研究从第一人称机器人视角出发,希望让 VLM 学会判断任务状态,并把这种能力进一步扩展到长程规划。团队构建了包含 4600 万条样本的 EgoTSR-Data,并设计了三阶段课程学习流程。





  • 论文题目: From Perception to Planning: Evolving Ego-Centric Task-Oriented Spatiotemporal Reasoning via Curriculum Learning
  • 研究团队: 浙江大学、天津大学、青岛大学、上海交通大学、新加坡国立大学等
  • 论文地址:https://arxiv.org/pdf/2604.10517
  • 代码链接:https://github.com/Collab-Gen/EgoTSR

时间偏置:后出现的画面,真的更接近任务完成吗?

EgoTSR 关注的并不是传统动作识别,而是一个更具体的问题:给定两张来自同一任务视频的图像,哪一个状态更接近任务目标?

例如:

把绿色杯子从桌上拿起来,放进白色盘子中。

模型不能只判断图中是否出现杯子和盘子,还要看杯子是否被抓住、是否正在移动、是否真正进入目标区域。

如果任务是「打开冰箱门」,门打开的状态更接近完成;如果任务是「关闭冰箱门」,判断恰好相反。同一幅图的任务意义,会随着目标发生变化。

真正可靠的模型还必须处理现实中的动作失败和状态回退:机械臂可能已经抓住物体,却在移动过程中将其掉落;抽屉可能被拉开,随后又因碰撞重新关闭;物体可能短暂到达目标区域,之后再次被移走。

因此,时间更晚并不意味着任务完成度一定更高。

研究团队将模型依赖输入顺序进行判断的现象称为「时间顺序偏差」,即 chronological bias。为了直接暴露这种捷径,EgoTSR 采用了一个简单但有效的办法:把同一对图像分别按照正向和反向顺序交给模型。

假设图像 B 比图像 A 更接近任务完成。

第一次输入为:

图像 A,图像 B。

正确答案是第二张图。

随后交换顺序:

图像 B,图像 A。

正确答案必须随之变成第一张图。

如果模型始终选择第二张图,那么它可能并没有分析物体状态,而是在根据图片位置猜测答案。

实验中,这种现象非常明显。以部分长任务评测为例,InternVL-8B 在正向输入下的准确率接近99%,但交换图像顺序后,准确率降至约2%。表面上接近满分的结果,经过反向测试后,暴露出严重的顺序依赖。

三阶段课程:先解释,再内化,最后规划

EgoTSR 没有把全部数据直接混合训练,而是按能力发展顺序分成三个阶段。

第一阶段使用约 1500 万条 CoT 数据:模型需要先描述两张图中的空间状态,再比较哪张图完成了更多必要动作,最后给出答案。这个阶段的重点,是建立视觉状态、任务目标和最终判断之间的联系。

第二阶段使用约 1600 万条 Tag 数据:详细推理文本被移除,只保留图像、任务和正确标签。模型需要直接判断哪张图更接近完成。作者希望将第一阶段形成的显式推理,逐渐转化为更快速的任务状态判断。

第三阶段加入约 1500 万条 LongTag 数据:把能力从单个动作扩展到长程任务。至此,三类数据合计 4600 万条。





子任务规划器:高层语义任务分解为多个细粒度子任务

「拿起杯子」是一个相对明确的原子任务,但真实机器人通常需要完成更复杂的目标。

例如:

打开冰箱,取出饮料,把饮料放到桌面,并重新关上冰箱门。

如果模型只看到「饮料已经被拿起」,可能会认为任务已经接近结束。但从完整目标来看,机器人还需要把饮料放到桌面,并关闭冰箱门。

为此,EgoTSR 引入了一个 Subtask Planner,也就是子任务规划器。它根据初始场景和高层任务描述,生成一组具有明确顺序的原子子任务。

上面的任务可以被拆解为:

  1. 打开冰箱门;
  2. 找到并抓取饮料;
  3. 将饮料从冰箱中取出;
  4. 把饮料放到桌面;
  5. 关闭冰箱门。

这组子任务构成了整个任务的「逻辑骨架」。

模型看到两张图后,不再只比较局部物体位置,而是进一步判断:每张图分别位于任务链的哪个阶段,已经完成了多少必要步骤,后续还剩下哪些动作。

论文将长任务图像对分为三个层次:同一子任务内部、相邻子任务之间,以及跨越多个子任务的状态比较。随着跨度增加,模型需要利用的就不再只是局部视觉变化,而是整个任务的因果和顺序结构。

值得注意的是,这里的「规划」主要指高层任务分解和任务进度推理。EgoTSR 并不直接输出机械臂的关节角、力矩或运动轨迹,而是为机器人提供「任务进行到哪里」和「后续还需要完成什么」的认知基础。

双层评测:既看是否「看清除」,也看是否「想明白」

研究团队构建了 Dual-Level Evaluation Framework。

第一层是短程原子任务,考察模型能否捕捉细粒度空间变化,例如夹爪是否闭合、按钮是否按下、物体是否进入容器。这一层主要诊断模型是否「看错了」。

第二层是长程任务,要求模型结合子任务序列,判断两张图在完整任务中的相对进度。这一层主要诊断模型是否「想错了」。

两个层级都加入了正向和反向输入测试,用来检查模型是否依赖图像顺序。

最终,EgoTSR 在长程任务上取得 92.4% 的平均准确率,短程任务表现约为 88%。在长程双向评测中,正向准确率约 92.4%,反向约 92.3%,差距仅 0.1 个百分点。

消融实验也说明了训练顺序的重要性。将 CoT、Tag 和 LongTag 混合训练时,长任务准确率只有 69.6%;按「显式推理 — 能力内化 — 长程规划」的顺序训练后,准确率提升到 92.4%。去掉 Subtask Planner 后,准确率则下降到 81.1%。





从任务判断走向任务完成度监测

除了定量评测,研究团队还在人类操作视频、模拟环境和真实机器人平台上进行了案例验证,涉及 LIBERO、SIMPLER、RoboTwin,以及 Franka、Agibot 和 So-100 等机器人平台。

在「把绿色杯子放进白色盘子」的案例中,模型持续处理未经切分的完整视频,并输出一条任务完成度曲线。

当机械臂接近杯子时,曲线缓慢变化;完成抓取和放置等关键子任务时,完成度出现明显上升;中间的搬运过程则保持相对稳定。

这意味着 EgoTSR 不仅可以比较两张静态图,还具备用于长视频任务监测的潜力,例如判断机器人当前处于哪个阶段、是否发生了动作回退,以及任务是否正在按照预期推进。



机器人需要的不只是「看见」


从静态图像识别走向真实机器人,模型面对的问题发生了根本变化。

在图像问答中,识别出杯子、盘子和机械臂可能已经足够;但在具身任务中,模型还需要理解这些物体之间的变化是否服务于当前目标。

机械臂动了,不代表任务取得了进展;视频继续播放,也不代表机器人越来越接近成功。

EgoTSR 的价值,一方面在于提供了一种从显式推理逐步过渡到长程规划的训练路径;另一方面,它通过正向和反向图像对,为具身模型设计了一把更加严格的「尺子」。

当然,这项工作距离完整的通用机器人系统仍有明显距离,但它至少揭示了一个容易被高准确率掩盖的问题:

当一个模型声称自己理解了机器人视频时,它究竟是在分析物体、动作和任务之间的因果关系,还是只是在重复「后一张图通常更接近完成」这一数据规律?

对于希望进入真实世界的具身智能而言,回答这个问题,或许比单纯提高几个百分点的准确率更加重要。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
散户还在割肉,国家队已经跑步进场,社保基金新进7只低价龙头

散户还在割肉,国家队已经跑步进场,社保基金新进7只低价龙头

财经智多星
2026-08-20 17:40:08
特种部队俘获30名俄军!俄媒大肆报道,暗示乌军第3军团司令已死

特种部队俘获30名俄军!俄媒大肆报道,暗示乌军第3军团司令已死

鹰眼Defence
2026-08-19 17:41:00
许家印被判无期徒刑!两儿子判有期,恒大案“剧终”

许家印被判无期徒刑!两儿子判有期,恒大案“剧终”

大厂财经社
2026-08-20 16:27:31
迪马利亚:被淘汰是艰难时刻,我得思考自己还想继续做什么

迪马利亚:被淘汰是艰难时刻,我得思考自己还想继续做什么

懂球帝
2026-08-21 11:35:12
巴基斯坦博主看完《欢迎来龙餐馆》直言 “不适”,她的不适,到底从何而来?

巴基斯坦博主看完《欢迎来龙餐馆》直言 “不适”,她的不适,到底从何而来?

海藻娱乐
2026-08-19 09:43:05
“暑假的北京,全是家长在揍孩子!”儿子在故宫门口满脸委屈,戳破家长的自我感动

“暑假的北京,全是家长在揍孩子!”儿子在故宫门口满脸委屈,戳破家长的自我感动

妍妍教育日记
2026-08-21 08:45:09
穆里尼奥哭晕!皇马头号废柴彻底砸手里!高薪烂账死活送不走

穆里尼奥哭晕!皇马头号废柴彻底砸手里!高薪烂账死活送不走

奶盖熊本熊
2026-08-21 06:04:28
陈吉宁率团在新疆学习考察,推动上海对口援疆各项工作走深走实

陈吉宁率团在新疆学习考察,推动上海对口援疆各项工作走深走实

澎湃新闻
2026-08-20 20:24:33
逍遥国外的丁玉梅也想不到,15亿资产才被冻结,许家印就又出事了

逍遥国外的丁玉梅也想不到,15亿资产才被冻结,许家印就又出事了

丁鸊惊悚影视解说
2026-08-19 18:56:02
一家九口吹嘘高学历“翻车”,评论区看穿现实:没文化就别硬装!

一家九口吹嘘高学历“翻车”,评论区看穿现实:没文化就别硬装!

妍妍教育日记
2026-06-24 11:03:55
公务员可以做的七种副业,不再纳入纪委严控,不算违纪!

公务员可以做的七种副业,不再纳入纪委严控,不算违纪!

细说职场
2026-08-19 11:53:35
8月21日,人社部和财政部关于2026年养老金的通知正式公布了吗?

8月21日,人社部和财政部关于2026年养老金的通知正式公布了吗?

陈博世财经
2026-08-21 09:31:48
明孝宗朱佑樘:中国五千年帝王史的唯一奇迹!仅此一人再无复刻

明孝宗朱佑樘:中国五千年帝王史的唯一奇迹!仅此一人再无复刻

新车知多少
2026-08-04 05:54:40
攒11年买下32平房!百花影后卫诗雅好心酸,谢霆锋到她家坐床吃饭

攒11年买下32平房!百花影后卫诗雅好心酸,谢霆锋到她家坐床吃饭

可乐谈情感
2026-08-20 11:19:10
性生活和谐后,发现老公变了,这才是真的“爽”

性生活和谐后,发现老公变了,这才是真的“爽”

精彩分享快乐
2026-08-21 12:00:13
骑士未裁白魔!全新14+3成东部第四豪强 TA透露骑管高度认可哈登

骑士未裁白魔!全新14+3成东部第四豪强 TA透露骑管高度认可哈登

颜小白的篮球梦
2026-08-21 10:30:15
朝鲜老式大炮在乌克兰打疯了,韩国最怕的噩梦成真了!

朝鲜老式大炮在乌克兰打疯了,韩国最怕的噩梦成真了!

何轐说
2026-08-19 16:33:44
北大教授高论“灵活就业是一种福利”,评论区炸锅了!

北大教授高论“灵活就业是一种福利”,评论区炸锅了!

慧翔百科
2026-08-21 11:32:13
许家印等57人被判刑,为何不见二号人物夏海钧?

许家印等57人被判刑,为何不见二号人物夏海钧?

苗苗情感说
2026-08-21 08:18:45
一场酒局,三顶官帽:一个单亲妈妈如何掀翻了权力的桌子

一场酒局,三顶官帽:一个单亲妈妈如何掀翻了权力的桌子

南传
2026-08-20 11:16:45
2026-08-21 13:59:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13808文章数 142724关注度
往期回顾 全部

科技要闻

阿里AI的两面:云赚56亿,千问烧掉138亿

头条要闻

特朗普称今年要见金正恩 罕见指出朝鲜有57枚核武器

头条要闻

特朗普称今年要见金正恩 罕见指出朝鲜有57枚核武器

体育要闻

46岁小罗抵达意大利 将为拉文纳征战意丙

娱乐要闻

迪丽热巴与陈飞宇的恋情罗生门

财经要闻

三部门发布多条促内需优化政策

汽车要闻

全新领克20大尾翼版成都车展首次亮相

态度原创

家居
房产
艺术
健康
教育

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

265亿资产甩出!三亚老牌地产巨头,正在集体退场!

艺术要闻

24 岁一幅画震惊巴黎,他被骂 "对绘画的屠杀"︱欧仁・德拉克洛瓦

脊柱侧弯到什么程度,需要戴支具?

教育要闻

孩子啥时候写完暑假作业,暴露了你晚年是享清福,还是倒贴钱

无障碍浏览 进入关怀版