网易首页 > 网易号 > 正文 申请入驻

李飞飞团队联手英伟达,推出全新模型RoboTTT,让机器人读懂上下文

0
分享至


机器人前瞻(公众号:robot_pro)
作者 刘俐杉
编辑 许丽思

机器人前瞻7月28日报道,近日,英伟达高级研究科学家Jim Fan与斯坦福大学教授李飞飞团队及其合作者,发布新作《RoboTTT:机器人策略的上下文扩展》,推出了机器人模型与训练方案RoboTTT。

当前的机器人基座模型大多只能处理单步或短历史的视觉运动上下文,而ROBOTTT可以将视觉运动上下文扩展至8K个时间步,比现有的先进策略高出三个数量级,且不会增加推理延迟。


▲ 论文封面(图源:《RoboTTT:机器人策略的上下文扩展》)

在此上下文长度下,RoboTTT赋予了机器人基于人类演示视频的单样本上下文内模仿、基于自身历史数据的实时策略优化、面对外部干扰时的高鲁棒性、在多阶段、长时序任务中展现出更强的闭环控制性能的全新能力

与此同时,该方案结合了序列动作强制与截断时间反向传播技术。

这意味着,在高难度的真实机器人操作任务中,ROBOTTT比单步上下文基线模型的整体性能提升了87%。它还完整实现了一个耗时5分钟、包含10个阶段的装配任务,而所有基线模型均未成功。在8K时间步下训练的ROBOTTT,比1K时间步训练的同模型性能高出62%

这表明上下文长度可以作为机器人基座模型的一个全新扩展维度。

一、模型学会了从上下文视频中蒸馏学习

目前大多数先进的机器人基座模型,都仅在单步或短历史视觉运动上下文下工作。相比之下,上下文长度早已成为大语言模型的重要扩展维度。这就引出一个问题:要如何构建能够从任意长上下文中学习并加以利用的视觉运动策略?

而此次李飞飞团队推出的机器人模型和训练方案RoboTTT,其核心逻辑是,将测试时训练机制融入到视觉-语言-动作(VLA)等机器人基座模型中。

RoboTTT本质上是一个序列模型。它的循环状态由“快权重”组成。与推理阶段冻结的“慢权重”不同,快权重在训练和推理阶段都会通过梯度下降进行实时更新。它将历史轨迹信息压缩进权重空间,并在长上下文条件引导下进行精准检索。


▲ RoboTTT的模型架构、训练和推理(图源:《RoboTTT:机器人策略的上下文扩展》)

1、模型架构

ROBOTTT由一个视觉-语言模型(VLM)主干和一个带有TTT层的扩散Transformer(DiT)动作头组成。团队在自注意力层和交叉注意力层之后添加TTT层。这样,注意力层处理单个时间步内的信息,而TTT层就可处理跨时间步的信息。

为了提高计算效率,模型不会将VLM Token直接传过TTT层,而是使用较少数量的寄存器Token(Register Tokens)来跨时间传递视语言信息。

为了保留预训练VLA模型的知识,ROBOTTT将基座模型权重初始化,并采用了可学习的门控机制,TTT输出经Tanh Gating后再加入注意力输出。


▲ (图源:《RoboTTT:机器人策略的上下文扩展》)

通过这种方式,ROBOTTT学会了动态调整TTT层的贡献,同时不会破坏预训练模型的计算逻辑。

2、序列训练

该团队在机器人轨迹序列上训练ROBOTTT,使快权重在每个训练序列内更新,从而同时学习到合适的快权重初始化值及其更新动态。

在序列训练中,该方案结合了序列动作强制与截断时间反向传播技术。

在训练中,ROBOTTT使用Flow-Matching目标进行动作训练。

序列动作强制为序列中的每个动作块独立采样噪声水平,如果不这样做,训练会变得不稳定。因为在整个序列中共享同一个噪声水平,会导致整条序列要么过于简单,要么过于艰难,难以有效学习。

此外,因为在长序列上进行全反向传播(BPTT)需要存储每个时间步的激活值,显存会随序列长度线性增长。因此该方案采用截断时间反向传播(TBPTT),即输入序列被划分为多个分段,梯度仅在每个分段内部流动。


▲ (图源:《RoboTTT:机器人策略的上下文扩展》)

关键在于,快权重会在分段边界处跨段传递。因此TTT会在整条序列上持续进行,但它们的梯度会在分段边界处切断。GPU显存占用因此由分段长度决定,而非总序列长度。这使得在固定显存预算下训练任意长度的上下文成为可能。

3、从上下文中高效学习

通过在特定时间步屏蔽Flow-Matching损失,这些时间步仅充当纯上下文。它们只更新快权重,而不提供模仿目标。这种灵活性使ROBOTTT 能够从异质上下文中学习,例如人类演示视频或机器人自身的非最优Rollout数据。

从上下文视频演示中模仿:

将人类演示视频序列与同一任务的机器人轨迹成对组合后发现,人类视频序列仅更新快权重,动作损失则在以更新后的快权重为条件的机器人轨迹上计算。

在此类成对数据上训练后,模型学会了从上下文视频中提取任务信息。测试时,只需以未见任务配置的单条人类视频为条件,即可实现单样本模仿。

DAgger蒸馏:

每当机器人犯错时,人类操作员就会介入并给出纠正动作。标准的DAgger会在人类纠正数据上进行微调,并丢弃机器人做错的动作。然而,恰恰是这些做错的动作,揭示了人类的纠正动作针对的是哪种错误。

ROBOTTT巧妙地同时利用了这两者,在序列训练期间,人类执行的纠正动作和机器人本身的非最优动作,这一整个交互历史都会用于更新快权重,并且Flow-Matching损失仅在人类纠正动作上计算。


▲ (图源:《RoboTTT:机器人策略的上下文扩展》)

这种将失败作为上下文,纠正作为目标的非对称性,正是将人类“从失败到纠正”的映射逻辑蒸馏进快权重的核心机制。模型学会了针对失败做出纠正,而不只是模仿纠正动作。

在测试时,模型可以在线执行此类纠正,无需人类干预。它做出的纠正随后会进入历史动作,并被吸收进快权重中,就像训练期间吸收人类纠正一样。

二、上下文越长,性能越强

研究团队将RoboTTT与GR00T N1.7(51)、GR00T N1.7 Hist.、GDN三种基线方法,在模型车装配、电路板组装和齿轮机器人装配,这三个需要双臂协同与灵巧操作的长时序装配任务上进行了对比评估。


▲ 模型车装配(图源:《RoboTTT:机器人策略的上下文扩展》)

所有方法均在相同的任务数据上进行训练。其中序列模型采用1K时步的上下文长度,非序列模型则在匹配的计算预算下进行训练。每种控制方法均在不同的构型下进行20次测试。


▲ (图源:《RoboTTT:机器人策略的上下文扩展》)

实验后得出了结论:

1、RoboTTT在长时程任务中的表现持续优于基线方法。ROBOTTT平均任务完成得分达到79%,比单步上下文基线高87%,比最佳基线GDN高41%。在耗时长达5分钟的齿轮机器人装配任务中,ROBOTTT是唯一实现完整成功的模型。


▲ 齿轮机器人装配(图源:《RoboTTT:机器人策略的上下文扩展》)

2、预训练上下文越长,闭环性能越好。如下图所示,当预训练上下文长度从128扩展到8K时间步时,ROBOTTT的闭环性能呈现出持续稳步上升的趋势。从1K时间步开始,它就超越了所有短上下文基线,且没有任何饱和迹象。


▲ (图源:《RoboTTT:机器人策略的上下文扩展》)

3、单样本模仿与抗干扰:在电路板装配任务中,ROBOTTT只能基于上下文中的人类视频完成单样本模仿。


▲ 电路板组装(图源:《RoboTTT:机器人策略的上下文扩展》)

结果显示,ROBOTTT仅凭一条人类演示视频,在10次新配置装配中成功了6次。GDN没有取得完全成功,任务完成分数为33%。在外部干扰测试中,ROBOTTT展现出了在线恢复与重新尝试能力。

结语:向更长时序、更自适应的具身智能迈进

ROBOTTT证明了上下文长度可以作为机器人基座模型的一个全新扩展维度。研究团队将视觉运动上下文从主流方案的数十步扩展至8K个时间步,比现有先进策略高出三个数量级,且不增加推理延迟。这一突破带来的性能提升是显著的。

上下文的长度赋予了机器人前所未有的能力,基于单条人类演示视频完成单样本模仿、从自身错误历史中在线学习并自我纠正、在外部干扰下保持高鲁棒性执行长时序任务。RoboTTT为未来开发具备更长时序记忆、更强自适应能力的具身智能,奠定了坚实的技术基础与扩展路径。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
我想要,但他累了:中年夫妻的性困境与破局之道

我想要,但他累了:中年夫妻的性困境与破局之道

精彩分享快乐
2026-07-11 12:00:07
巴西召见阿根廷大使谴责米莱言辞,巴西媒体:米莱把外交政策搞得像是在发动政治战争

巴西召见阿根廷大使谴责米莱言辞,巴西媒体:米莱把外交政策搞得像是在发动政治战争

环球网资讯
2026-07-28 07:19:12
下载速度飙至120MB/s!1分钟下载8GB,可抓取网页音视频!

下载速度飙至120MB/s!1分钟下载8GB,可抓取网页音视频!

科技乐小天
2026-07-18 14:14:08
九寨沟泥石流:童话世界下午3点50分张嘴,幸好游客没在沟底拍照

九寨沟泥石流:童话世界下午3点50分张嘴,幸好游客没在沟底拍照

防灾小卫士
2026-07-27 00:03:08
上海超级巨无霸正式获批....

上海超级巨无霸正式获批....

新浪财经
2026-07-28 11:05:41
《蜘蛛侠4》预售破亿、口碑炸裂!成龙成家班动作指导,《功夫女足》遇强对手

《蜘蛛侠4》预售破亿、口碑炸裂!成龙成家班动作指导,《功夫女足》遇强对手

露珠聊影视
2026-07-28 23:48:53
脚被卡进方向盘,天津女子尴尬报警得救视频刷屏!当事人:确实意外,两小时自救,耗尽一瓶护手霜

脚被卡进方向盘,天津女子尴尬报警得救视频刷屏!当事人:确实意外,两小时自救,耗尽一瓶护手霜

极目新闻
2026-07-28 20:53:29
千万别在顾客付款前多废话!网友:全是销售踩过的血泪史

千万别在顾客付款前多废话!网友:全是销售踩过的血泪史

夜深爱杂谈
2026-07-28 20:21:47
香港知名演员遗孤现身,身高1.85米纹身显眼,生父身份神秘

香港知名演员遗孤现身,身高1.85米纹身显眼,生父身份神秘

时间巡查
2026-07-27 05:17:01
人民日报:中国籍数学家首获菲尔兹奖,意味着什么

人民日报:中国籍数学家首获菲尔兹奖,意味着什么

澎湃新闻
2026-07-28 07:48:06
“人家主动坦白了,那就查查这家地头蛇”!高铁大声聊微信被提醒后叫嚣“全家体制内”,一女子一句话引爆全网

“人家主动坦白了,那就查查这家地头蛇”!高铁大声聊微信被提醒后叫嚣“全家体制内”,一女子一句话引爆全网

火山詩话
2026-07-29 06:56:12
“我不理解为什么需要2000亿美元”:卖掉公司获16亿,他只留不足1亿

“我不理解为什么需要2000亿美元”:卖掉公司获16亿,他只留不足1亿

灰度测试中
2026-07-26 22:01:14
爸爸是上门女婿,我和弟弟随母姓,大学毕业后,我悄悄改回父姓

爸爸是上门女婿,我和弟弟随母姓,大学毕业后,我悄悄改回父姓

有态度网友19Dsym
2026-07-29 00:41:04
女子全裸跳入科莫湖禁泳区,路人和游客看傻了

女子全裸跳入科莫湖禁泳区,路人和游客看傻了

意大利华人网0039
2026-07-28 17:47:47
一路走好?敬一丹脑溢血,赵本山灵堂、庆奶凌晨去世,谣言太荒唐

一路走好?敬一丹脑溢血,赵本山灵堂、庆奶凌晨去世,谣言太荒唐

青梅侃史啊
2026-07-29 07:11:49
助理集体反水!曝24小时卖命、陪睡等特殊服务

助理集体反水!曝24小时卖命、陪睡等特殊服务

草莓解说体育
2026-07-29 08:20:52
印媒:卫星拍到歼-20,两处各一批,印度防空网怎么破?

印媒:卫星拍到歼-20,两处各一批,印度防空网怎么破?

止戈军是我
2026-07-28 08:27:09
月之暗面全面开源Kimi K3;新研究推翻三星堆祭祀坑献祭说;台风“白海豚”生成

月之暗面全面开源Kimi K3;新研究推翻三星堆祭祀坑献祭说;台风“白海豚”生成

果壳
2026-07-28 19:16:40
最后的疯狂:许家印被抓捕的失控三秒钟

最后的疯狂:许家印被抓捕的失控三秒钟

财经保探长
2026-04-09 22:30:38
未经审查发布虚假医疗广告、夸大疗效,广州番禺区一医院被罚22万元

未经审查发布虚假医疗广告、夸大疗效,广州番禺区一医院被罚22万元

澎湃新闻
2026-07-28 22:10:26
2026-07-29 08:55:00
机器人前瞻
机器人前瞻
智东西AI媒体矩阵品牌。机器人前瞻,机器人产业新媒体,专注报道全球机器人创新。
741文章数 13关注度
往期回顾 全部

科技要闻

千名AI员工联署:别让AI快到人类跟不上

头条要闻

牛弹琴:拉美两个大国掀桌吵起来了 更精彩的还在后面

头条要闻

牛弹琴:拉美两个大国掀桌吵起来了 更精彩的还在后面

体育要闻

35岁德甲球星,退役半年后成了一名农民

娱乐要闻

43岁演员王凯去世!独居公寓无人知晓

财经要闻

潘老板的算盘全砸了,欠的25亿跑不了了

汽车要闻

宾利托卡尔重塑百年菱形美学,将于9月全球首秀

态度原创

亲子
本地
数码
公开课
军事航空

亲子要闻

孩子干瘦不长肉脸色发黄四款居家儿童养胃粥,配方坚持喝 气色红润长肉。

本地新闻

跟着影视去旅行:八仙篇

数码要闻

苹果欲借新版Siri补齐智能家居短板:多款AI驱动设备蓄势待发

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普:若谈判破裂将强力打击伊朗

无障碍浏览 进入关怀版