网易首页 > 网易号 > 正文 申请入驻

Jim Fan、李飞飞团队新作:机器人也能「上下文scaling」

0
分享至


过去,受限于极短的上下文窗口,机器人很快就会遗忘刚刚发生的一切。那么,机器人能不能像当前的大语言模型(LLM)一样,记住并利用更长的上下文?

针对这一问题,英伟达高级研究科学家 Jim Fan 与斯坦福大学教授、“AI教母”李飞飞团队及其合作者,推出了机器人模型与训练方案 RoboTTT(Test-Time-Training Robot Policies),将视觉运动上下文扩展到 8K 时间步,相当于 5 分钟的“肌肉记忆”,比现有 SOTA 策略高出 3 个数量级,且不增加推理延迟。


论文链接:https://arxiv.org/abs/2607.15275

这意味着,RoboTTT 可以将一整段视频作为上下文输入,并根据人类视频进行一次性模仿。它还拥有实时“自我改进”的能力,能将修正信息纳入上下文,并在执行中不断调整动作,从而在多阶段长程任务上取得更好的表现。

研究团队表示,上下文长度将成为机器人基础模型的新 scaling 方向:使用 8K 时间步上下文训练的 RoboTTT,比使用 1K 时间步预训练的同一模型取得了 +62% 的性能提升。Jim Fan 甚至在 X 上发帖称:“很快,即使是 100 万上下文,也不再是幻想。”

面向机器人策略的长上下文建模

RoboTTT 将测试时训练(TTT)嵌入机器人基础模型,用快速权重作为模型的循环状态。每次接收传感器输入,模型都会执行一步梯度更新,把历史信息写入权重。这样做的好处是,由于隐藏状态大小固定,机器人可以在较低开销下保留更长历史信息,并在部署后继续学习。


图|RoboTTT 的模型架构、训练和推理。

RoboTTT 主要包含三项设计,如下:

1.模型架构:RoboTTT 由视觉-语言模型(VLM)骨干和带有 TTT 层的 DiT 动作头组成。注意力层处理单个时间步内的信息,TTT 层加在注意力层之后,负责沿时间维度处理跨时间信息。为提高效率,模型不直接将所有视觉-语言 token 输入 TTT 中,而是使用少量 register token 在时间上传递视觉-语言信息。为保留预训练能力,TTT 输出经 Tanh Gating 后再加入注意力输出。


图|带有 Tanh Gating 的计算流程。

2.序列训练:为扩展训练上下文的长度,RoboTTT 结合了序列动作强制和截断反向传播算法。训练时,序列动作强制为每个动作块独立采样噪声水平,以稳定 flow-matching 训练;TBPTT 将长序列切分为片段,只在片段内反传梯度,但让快速权重继续跨片段传递,这样既能让 TTT 贯穿整条序列,又能把显存开销控制在片段长度范围内。


图|TBPTT。

3.长上下文约束:RoboTTT 会把部分时间步只作为上下文使用,这些时间步会写入快速权重,但不参与动作损失计算。基于这一机制,模型可以从两类上下文中学习:

  • 视频模仿:人类视频作为上下文,只更新快速权重;动作损失在同任务机器人轨迹上计算。测试时,单个人类视频即可作为未见配置的条件。
  • DAgger 蒸馏:完整 DAgger 轨迹都会更新快速权重,其中次优机器人动作提供失败上下文,人类纠正动作提供监督目标;损失只在人类纠正动作上计算,把失败后的纠正方式写入快速权重。


图|DAgger 蒸馏。

上下文越长,性能越强

研究团队在三个长程双臂装配任务上评估了 RoboTTT。整体而言,RRoboTTT 能够利用自身更多的历史信息进行训练,除了上述更强的闭环性能之外,它仅需一段包含上下文信息的人类视频即可进行一次性模仿、实时自我改进以及对物理扰动鲁棒


图|评估任务。

1.在长程任务上持续优于基线

主评估显示,RoboTTT 的平均任务完成分数达到 79%,高于单步上下文基线 GR00T N1.7 和将 TTT 层替换为 Gated DeltaNet 的 GDN。


图|主评估:三个装配任务上的任务完成分数。

此外,RoboTTT 也是完全成功次数最多的方法,尤其是在平均约 5 分钟、包含 10 个阶段的“齿轮机器人”(Gear Bot)任务上,RoboTTT 是唯一完整完成任务的方法。


图|主评估:三个装配任务上的完全成功试验次数。

简单拼接过去观测并不能可靠提升表现。在 Pup Go Car(玩具车装配)任务上,加入一个历史帧的 GR00T N1.7 Hist 得分为 39.5%,低于只看当前观测的 GR00T N1.7(57%)。GDN 将历史压缩为循环状态,但没有在所有任务上带来提升。

RoboTTT 更善于跟踪任务进度、恢复错误和完成细粒度操作。在视觉相似的多阶段装配中,RoboTTT 能更好地区分当前阶段;电钻未对准螺丝时,它也会重新对齐并再次尝试;在插入、扣紧电路组件等细粒度操作中,动作也更精确。

2. 预训练上下文越长,闭环表现就越好

研究团队将预训练上下文从 128 扩展到 8K 时间步后评估发现,RoboTTT-8K 的平均任务完成分数达到 71.5%,比 1K 版本高 63%,比短上下文基线高 57%,且没有出现饱和迹象。相比而言,上下文变长后,GDN 却没有获得同样的性能提升。

研究团队认为,这一差异来自更新机制,RoboTTT 通过梯度下降更新快速权重,并学习快速权重的初始化和更新方式;GDN 则使用线性关联状态,不具备这种元学习机制。


图|闭环性能随预训练上下文长度扩展而提升。

3.one-shot 模仿与扰动鲁棒

RoboTTT 能基于上下文中的人类视频完成 one-shot 模仿。在 Circuit(电路装配任务中),机器人只能通过上下文中的人类视频判断该装配哪种电路配置。结果显示,RoboTTT 在 10 次未见配置试验中成功 6 次,任务完成分数为65%;GDN 没有取得完全成功,任务完成分数为 33%。


图|从上下文内人类视频进行一次性模仿。

长上下文约束也提升了扰动恢复能力。当人类在游戏过程中移除已安装的部件时,RoboTTT 会根据自身的部署情况返回并重新安装该部件。车顶被移除时,RoboTTT 的恢复率为 75%,高于 GDN 的 65% 和短上下文基线的 50%;轮胎被移除时,RoboTTT 与 GDN 的恢复率均达到 90%,也高于短上下文基线。

4.更强的即时恢复能力

RoboTTT 具备更强的即时恢复能力,并优于标准 DAgger。标准 DAgger 只在人类纠正动作上微调,平均提升9%;DAgger 蒸馏把完整轨迹作为上下文,包括次优机器人动作,但只在人类纠正动作上计算损失,平均提升 33%。通过 DAgger 蒸馏,RoboTTT 学习了一种隐式纠错算法,并能在线从自身的错误中恢复,无需人工干预。


图|DAgger 蒸馏在 Pup Go Car 上的结果。

不足与未来方向

研究团队指出,尽管 RoboTTT 展示了上下文长度作为机器人基础模型新 scaling 轴的潜力,但仍存在一些不足。

首先,扩展训练上下文长度会增加训练成本。虽然 RoboTTT 在推理时保持成本恒定,但训练更长上下文仍需要更多开销。未来,研究人员应采用更高效的 TTT 训练技术(如 TNT)来降低这一成本。

其次,TTT 层的目标函数仍有探索空间。当前工作提出了一种将 TTT 整合进机器人基础模型的方法,但面向机器人的 TTT 层目标(类似视觉领域中的相关探索)将是一个有潜力的方向。

此外,RoboTTT 仍未覆盖部署中可能出现的全部失败模式。研究团队表示,RoboTTT 与强化学习结合,直接优化任务成功率,有望进一步提升实际执行表现。

更多技术细节,详见原论文。

作者:夏千斯

如需转载或投稿,请直接在本文章评论区内留言

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
实探长鑫科技上市首日:多位员工称无上市福利,园区一把雨伞52元引吐槽

实探长鑫科技上市首日:多位员工称无上市福利,园区一把雨伞52元引吐槽

每日经济新闻
2026-07-28 01:48:01
员工误发“滚”表情包讨好领导,连续三个月后才察觉真相

员工误发“滚”表情包讨好领导,连续三个月后才察觉真相

另子维爱读史
2026-07-27 21:47:29
千万粉丝博主“痞幼”发布飙车视频,被指副驾驶乘客未系安全带,本人回应:系封路拍摄

千万粉丝博主“痞幼”发布飙车视频,被指副驾驶乘客未系安全带,本人回应:系封路拍摄

洪观新闻
2026-07-27 14:50:11
详解詹姆斯创3大历史:最大降薪+首次两FMVP加盟 冲不同4队夺冠神迹

详解詹姆斯创3大历史:最大降薪+首次两FMVP加盟 冲不同4队夺冠神迹

醉卧浮生
2026-07-28 08:10:28
上海女孩倾尽全家人脉,给外籍男友搞定4万月薪工作,对方却脚踏6条船

上海女孩倾尽全家人脉,给外籍男友搞定4万月薪工作,对方却脚踏6条船

小徐讲八卦
2026-07-27 08:50:17
没等来战争,反遭日方釜底抽薪!上海3万日侨估计要睡不着了

没等来战争,反遭日方釜底抽薪!上海3万日侨估计要睡不着了

叮当当科技
2026-07-27 03:39:13
中方果然没看错,晾了立陶宛一段时间后,对方和台当局重启谈判了

中方果然没看错,晾了立陶宛一段时间后,对方和台当局重启谈判了

乌克兰小静
2026-07-28 02:51:53
中科大校领导名单引热议!部门繁多、领导扎堆,被批“大学行政化”,网友:还能专心搞学术吗?

中科大校领导名单引热议!部门繁多、领导扎堆,被批“大学行政化”,网友:还能专心搞学术吗?

谭谈社会
2026-07-25 17:57:34
2011年初,在王虹近乎绝望的时候,雷军为什么愿意写推荐信?

2011年初,在王虹近乎绝望的时候,雷军为什么愿意写推荐信?

社会日日鲜
2026-07-28 06:57:24
1953年,77岁的了明禅师被押赴刑场执行枪决,临刑前他向行刑者恳求:“我罪大恶极,死有余辜,但能不能别往我头上打。”

1953年,77岁的了明禅师被押赴刑场执行枪决,临刑前他向行刑者恳求:“我罪大恶极,死有余辜,但能不能别往我头上打。”

人生录
2026-07-28 00:05:06
LVMH集团首次回应在华诉讼争议:不止在中国,在全球均定期处理商标侵权

LVMH集团首次回应在华诉讼争议:不止在中国,在全球均定期处理商标侵权

每日经济新闻
2026-07-28 08:12:05
最新 | 敬一丹紧急送医?最新回应!

最新 | 敬一丹紧急送医?最新回应!

天津广播
2026-07-27 22:02:07
邹市明和冉莹颖去民政局办理离婚,邹市明刻意带消磁身份证,并解释称:“敌进我退,敌退我进” ;两人因婚姻和债务问题引发热议

邹市明和冉莹颖去民政局办理离婚,邹市明刻意带消磁身份证,并解释称:“敌进我退,敌退我进” ;两人因婚姻和债务问题引发热议

大风新闻
2026-07-25 15:15:19
胡彦斌哽咽回忆放弃章龄之:母亲干预成终生遗憾

胡彦斌哽咽回忆放弃章龄之:母亲干预成终生遗憾

手工制作阿歼
2026-07-28 01:56:56
德国央行行长语出惊人:一旦最后决定报复中国,那就直接干票大的

德国央行行长语出惊人:一旦最后决定报复中国,那就直接干票大的

阿晪美食
2026-07-27 21:52:37
耍大牌+坐地起价!迪班萨中国行"变脸记",闹情绪后临时加钱50万刀

耍大牌+坐地起价!迪班萨中国行"变脸记",闹情绪后临时加钱50万刀

球童无忌
2026-07-27 09:25:25
王虹获菲尔兹奖,班主任抢功:那些没出息的差生,是不是你教的?

王虹获菲尔兹奖,班主任抢功:那些没出息的差生,是不是你教的?

许三岁
2026-07-27 17:20:55
乌克兰突袭雅罗斯拉夫尔!通往莫斯科道路被迫关闭

乌克兰突袭雅罗斯拉夫尔!通往莫斯科道路被迫关闭

项鹏飞
2026-07-27 20:23:11
皇马1.35亿签迪奥曼德!巴黎不满:他1年前踢西乙 就敢狮子大开口

皇马1.35亿签迪奥曼德!巴黎不满:他1年前踢西乙 就敢狮子大开口

念洲
2026-07-28 06:23:08
50亿真实大案改编,80%台词来自真实审讯录音!贾玲新片海报刚出就撕番!

50亿真实大案改编,80%台词来自真实审讯录音!贾玲新片海报刚出就撕番!

情感大头说说
2026-07-28 02:13:18
2026-07-28 08:40:49
人工智能学家 incentive-icons
人工智能学家
人工智能领域权威媒体
4923文章数 37498关注度
往期回顾 全部

科技要闻

Kimi K3完整开放!2.78万亿参数模型可部署

头条要闻

媒体:伊朗打击效果明显提升 美军可能"真的被打疼了"

头条要闻

媒体:伊朗打击效果明显提升 美军可能"真的被打疼了"

体育要闻

说过不会再回NBA的男人,又回来了

娱乐要闻

具俊晔零成本拿下大S房产

财经要闻

悟空租车乱象追踪:货不对板与迟来的赔偿

汽车要闻

2026宝马摩托车文化节举行 三款新车上市

态度原创

数码
房产
家居
手机
公开课

数码要闻

苹果macOS 26.6正式版发布

房产要闻

最新成交量猛跌22.9%!海南楼市,还没熬出头!

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

iPhone 20周年版长什么样?玻璃机身、固态按键、屏下Face ID,一文看懂目前所有爆料

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版