网易首页 > 网易号 > 正文 申请入驻

前沿分享丨Jim Fan、李飞飞团队新作:机器人也能「上下文scaling」

0
分享至

转自 学术头条

过去,受限于极短的上下文窗口,机器人很快就会遗忘刚刚发生的一切。那么,机器人能不能像当前的大语言模型(LLM)一样,记住并利用更长的上下文?

针对这一问题,英伟达高级研究科学家 Jim Fan 与斯坦福大学教授、“AI教母”李飞飞团队及其合作者,推出了机器人模型与训练方案 RoboTTT(Test-Time-Training Robot Policies),将视觉运动上下文扩展到 8K 时间步,相当于 5 分钟的“肌肉记忆”,比现有 SOTA 策略高出 3 个数量级,且不增加推理延迟。


论文链接:https://arxiv.org/abs/2607.15275

这意味着,RoboTTT 可以将一整段视频作为上下文输入,并根据人类视频进行一次性模仿。它还拥有实时“自我改进”的能力,能将修正信息纳入上下文,并在执行中不断调整动作,从而在多阶段长程任务上取得更好的表现。

研究团队表示,上下文长度将成为机器人基础模型的新 scaling 方向:使用 8K 时间步上下文训练的 RoboTTT,比使用 1K 时间步预训练的同一模型取得了 +62% 的性能提升。Jim Fan 甚至在 X 上发帖称:“很快,即使是 100 万上下文,也不再是幻想。”

面向机器人策略的长上下文建模

RoboTTT 将测试时训练(TTT)嵌入机器人基础模型,用快速权重作为模型的循环状态。每次接收传感器输入,模型都会执行一步梯度更新,把历史信息写入权重。这样做的好处是,由于隐藏状态大小固定,机器人可以在较低开销下保留更长历史信息,并在部署后继续学习。


图|RoboTTT 的模型架构、训练和推理。

RoboTTT 主要包含三项设计,如下:

1.模型架构:RoboTTT 由视觉-语言模型(VLM)骨干和带有 TTT 层的 DiT 动作头组成。注意力层处理单个时间步内的信息,TTT 层加在注意力层之后,负责沿时间维度处理跨时间信息。为提高效率,模型不直接将所有视觉-语言 token 输入 TTT 中,而是使用少量 register token 在时间上传递视觉-语言信息。为保留预训练能力,TTT 输出经 Tanh Gating 后再加入注意力输出。


图|带有 Tanh Gating 的计算流程。

2.序列训练:为扩展训练上下文的长度,RoboTTT 结合了序列动作强制和截断反向传播算法。训练时,序列动作强制为每个动作块独立采样噪声水平,以稳定 flow-matching 训练;TBPTT 将长序列切分为片段,只在片段内反传梯度,但让快速权重继续跨片段传递,这样既能让 TTT 贯穿整条序列,又能把显存开销控制在片段长度范围内。


图|TBPTT。

3.长上下文约束:RoboTTT 会把部分时间步只作为上下文使用,这些时间步会写入快速权重,但不参与动作损失计算。基于这一机制,模型可以从两类上下文中学习:

  • 视频模仿:人类视频作为上下文,只更新快速权重;动作损失在同任务机器人轨迹上计算。测试时,单个人类视频即可作为未见配置的条件。
  • DAgger 蒸馏:完整 DAgger 轨迹都会更新快速权重,其中次优机器人动作提供失败上下文,人类纠正动作提供监督目标;损失只在人类纠正动作上计算,把失败后的纠正方式写入快速权重。


图|DAgger 蒸馏。

上下文越长,性能越强

研究团队在三个长程双臂装配任务上评估了 RoboTTT。整体而言,RRoboTTT 能够利用自身更多的历史信息进行训练,除了上述更强的闭环性能之外,它仅需一段包含上下文信息的人类视频即可进行一次性模仿、实时自我改进以及对物理扰动鲁棒


图|评估任务。

1.在长程任务上持续优于基线

主评估显示,RoboTTT 的平均任务完成分数达到 79%,高于单步上下文基线 GR00T N1.7 和将 TTT 层替换为 Gated DeltaNet 的 GDN。


图|主评估:三个装配任务上的任务完成分数。

此外,RoboTTT 也是完全成功次数最多的方法,尤其是在平均约 5 分钟、包含 10 个阶段的“齿轮机器人”(Gear Bot)任务上,RoboTTT 是唯一完整完成任务的方法。


图|主评估:三个装配任务上的完全成功试验次数。

简单拼接过去观测并不能可靠提升表现。在 Pup Go Car(玩具车装配)任务上,加入一个历史帧的 GR00T N1.7 Hist 得分为 39.5%,低于只看当前观测的 GR00T N1.7(57%)。GDN 将历史压缩为循环状态,但没有在所有任务上带来提升。

RoboTTT 更善于跟踪任务进度、恢复错误和完成细粒度操作。在视觉相似的多阶段装配中,RoboTTT 能更好地区分当前阶段;电钻未对准螺丝时,它也会重新对齐并再次尝试;在插入、扣紧电路组件等细粒度操作中,动作也更精确。

2. 预训练上下文越长,闭环表现就越好

研究团队将预训练上下文从 128 扩展到 8K 时间步后评估发现,RoboTTT-8K 的平均任务完成分数达到 71.5%,比 1K 版本高 63%,比短上下文基线高 57%,且没有出现饱和迹象。相比而言,上下文变长后,GDN 却没有获得同样的性能提升。

研究团队认为,这一差异来自更新机制,RoboTTT 通过梯度下降更新快速权重,并学习快速权重的初始化和更新方式;GDN 则使用线性关联状态,不具备这种元学习机制。


图|闭环性能随预训练上下文长度扩展而提升。

3.one-shot 模仿与扰动鲁棒

RoboTTT 能基于上下文中的人类视频完成 one-shot 模仿。在 Circuit(电路装配任务中),机器人只能通过上下文中的人类视频判断该装配哪种电路配置。结果显示,RoboTTT 在 10 次未见配置试验中成功 6 次,任务完成分数为65%;GDN 没有取得完全成功,任务完成分数为 33%。


图|从上下文内人类视频进行一次性模仿。

长上下文约束也提升了扰动恢复能力。当人类在游戏过程中移除已安装的部件时,RoboTTT 会根据自身的部署情况返回并重新安装该部件。车顶被移除时,RoboTTT 的恢复率为 75%,高于 GDN 的 65% 和短上下文基线的 50%;轮胎被移除时,RoboTTT 与 GDN 的恢复率均达到 90%,也高于短上下文基线。

4.更强的即时恢复能力

RoboTTT 具备更强的即时恢复能力,并优于标准 DAgger。标准 DAgger 只在人类纠正动作上微调,平均提升9%;DAgger 蒸馏把完整轨迹作为上下文,包括次优机器人动作,但只在人类纠正动作上计算损失,平均提升 33%。通过 DAgger 蒸馏,RoboTTT 学习了一种隐式纠错算法,并能在线从自身的错误中恢复,无需人工干预。


图|DAgger 蒸馏在 Pup Go Car 上的结果。

不足与未来方向

研究团队指出,尽管 RoboTTT 展示了上下文长度作为机器人基础模型新 scaling 轴的潜力,但仍存在一些不足。

首先,扩展训练上下文长度会增加训练成本。虽然 RoboTTT 在推理时保持成本恒定,但训练更长上下文仍需要更多开销。未来,研究人员应采用更高效的 TTT 训练技术(如 TNT)来降低这一成本。

其次,TTT 层的目标函数仍有探索空间。当前工作提出了一种将 TTT 整合进机器人基础模型的方法,但面向机器人的 TTT 层目标(类似视觉领域中的相关探索)将是一个有潜力的方向。

此外,RoboTTT 仍未覆盖部署中可能出现的全部失败模式。研究团队表示,RoboTTT 与强化学习结合,直接优化任务成功率,有望进一步提升实际执行表现。

更多技术细节,详见原论文。

作者:夏千斯

【免责声明】转载出于非商业性的教育和科研目的,只为学术新闻信息的传播,版权归原作者所有,如有侵权请立即与我们联系,我们将及时删除。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
调查发现:血脂最怕的早餐,豆浆排第4,第1名很多人天天都在吃

调查发现:血脂最怕的早餐,豆浆排第4,第1名很多人天天都在吃

橘子约定
2026-07-27 17:49:10
多地公布2026年社保缴费基数,最高涨幅超13%,网友说:最低工资为什么不跟着社保基数一起涨?

多地公布2026年社保缴费基数,最高涨幅超13%,网友说:最低工资为什么不跟着社保基数一起涨?

黯泉
2026-07-27 16:37:58
中共中央批准,开除杨宏勇党籍

中共中央批准,开除杨宏勇党籍

新京报
2026-07-27 17:18:48
立陶宛新政府上台,不到20天,就重启对台谈判,幸好大陆留了一手

立陶宛新政府上台,不到20天,就重启对台谈判,幸好大陆留了一手

面包夹知识
2026-07-27 19:26:54
印度男子一口气娶仨老婆?还是亲姐妹?然而网友发现,这小妹还没成年吧...

印度男子一口气娶仨老婆?还是亲姐妹?然而网友发现,这小妹还没成年吧...

英国那些事儿
2026-07-28 00:07:42
16GB+1TB跳水1300元,荣耀目前“最值得捡漏”的一款手机,且买且珍惜

16GB+1TB跳水1300元,荣耀目前“最值得捡漏”的一款手机,且买且珍惜

小愚测评
2026-07-27 23:54:41
中国十大千年古刹,就算没去过也要懂

中国十大千年古刹,就算没去过也要懂

简食记工作号
2026-07-27 00:07:30
长鑫上市谁赢麻了?股民赚两万,高管赚十亿,阿里赚千亿,合肥赚万亿

长鑫上市谁赢麻了?股民赚两万,高管赚十亿,阿里赚千亿,合肥赚万亿

上游新闻
2026-07-27 19:30:07
10000mAh+120Hz!新机官宣:即将上市

10000mAh+120Hz!新机官宣:即将上市

高科技爱好者
2026-07-27 23:57:10
手机害得都是穷人家的孩子,因为穷人家的孩子除了手机没什么好玩

手机害得都是穷人家的孩子,因为穷人家的孩子除了手机没什么好玩

户外阿毽
2026-07-26 19:41:47
725全代会结束后,不到24小时,蓝营有人提台湾省,受郑丽文重用

725全代会结束后,不到24小时,蓝营有人提台湾省,受郑丽文重用

观史搜寻着
2026-07-27 23:03:33
DNA揭开隔代血缘真相:孙子最亲的其实不是爷爷奶奶

DNA揭开隔代血缘真相:孙子最亲的其实不是爷爷奶奶

粤语音乐喷泉
2026-07-25 15:16:01
你知道的吸毒人最后怎样了?看网友讲述他们的结局 无尽感慨唏嘘

你知道的吸毒人最后怎样了?看网友讲述他们的结局 无尽感慨唏嘘

侃神评故事
2026-06-24 14:16:41
心理学:一个人突然变得很“静”,不再炫、不再争,说明他就要走好运了

心理学:一个人突然变得很“静”,不再炫、不再争,说明他就要走好运了

心理观察局
2026-07-26 06:46:05
日本国民女神代言比亚迪惨遭网暴!日本网友:不爱国,她甚至穿上了中国红!

日本国民女神代言比亚迪惨遭网暴!日本网友:不爱国,她甚至穿上了中国红!

大白聊IT
2026-07-27 00:02:32
我国越来越多的人患新冠?建议:停止食用“4物”,保护肺部

我国越来越多的人患新冠?建议:停止食用“4物”,保护肺部

垚垚分享健康
2026-07-27 23:40:03
三个月蒸发700亿,杭州六小龙第一股跌近发行价

三个月蒸发700亿,杭州六小龙第一股跌近发行价

ZAKER新闻
2026-07-27 20:02:23
惊天大反转!具俊晔怒告S妈,称被蒙骗放弃遗产,还窥伺孩子继承权利

惊天大反转!具俊晔怒告S妈,称被蒙骗放弃遗产,还窥伺孩子继承权利

可乐谈情感
2026-07-18 13:58:50
长鑫向上,“长鑫概念股”向下

长鑫向上,“长鑫概念股”向下

21世纪经济报道
2026-07-27 20:55:06
吴尊15岁女儿独自亮相《蜘蛛侠:崭新之日》首映礼,身高颜值引热议

吴尊15岁女儿独自亮相《蜘蛛侠:崭新之日》首映礼,身高颜值引热议

露珠聊影视
2026-07-27 23:37:26
2026-07-28 00:31:00
中国人工智能学会
中国人工智能学会
中国人工智能学会网易官方账号
4188文章数 1490关注度
往期回顾 全部

科技要闻

长鑫科技上市首日收涨465%,市值3.28万亿

头条要闻

衡水一中学创办人举报:公职人员2元买走价值8亿元股权

头条要闻

衡水一中学创办人举报:公职人员2元买走价值8亿元股权

体育要闻

说过不会再回NBA的男人,又回来了

娱乐要闻

具俊晔零成本拿下大S房产

财经要闻

破产德企如何托起长鑫科技的逆袭之路

汽车要闻

2026宝马摩托车文化节举行 三款新车上市

态度原创

教育
家居
时尚
艺术
房产

教育要闻

明日填报!超70所!2026年北京市中招志愿征集录取学校名单公布

家居要闻

2026建博会(广州) 公装联探展交流活动

夏天T恤别只穿黑色或白色,试试这几款彩色T恤,高级亮眼显活力

艺术要闻

猫狗题材油画 | 德裔匈牙利画家Arthur Heyer

房产要闻

最新成交量猛跌22.9%!海南楼市,还没熬出头!

无障碍浏览 进入关怀版