网易首页 > 网易号 > 正文 申请入驻

把搜索从“必须”变成“可选”:浙大&清华联合RoboParty Lab提出INTACT,LeCun点赞,3w浏览量引爆X

0
分享至

把搜索从“必须”变成“可选”:浙大&清华联合RoboParty Lab提出INTACT,LeCun点赞,3w浏览量引爆X!


导语

发布一天,X上浏览量突破3万图灵奖得主Yann LeCun亲自点赞—— 这是INTACT在社交媒体上交出的成绩单。

世界模型学会了预测"动作会带来什么变化",但要从"想要的变化"倒推出"该做什么动作",传统方案只能靠大规模候选采样加成本函数评估——一次推理就要遍历数千条候选轨迹,耗时 1.5 秒以上。

浙大CAD&CG国家重点实验室、清华大学智能产业研究院(AIR)、RoboParty Lab(萝卜派对)、InSpatio(影溯)共同发布了INTACT,端到端训练一个“意图→动作”的直接映射接口,将推理延迟从1.48秒压到2.9-5.5毫秒,加速约300倍。在四个官方LeWM基准任务上,仅训练1个epoch、零搜索,直接控制器就达到**95.33%**的宏平均成功率。更值得关注的是,论文用一整节因果分析拆解了“为什么行”——这是近年世界模型方向罕见的研究深度。


硬核科普:三个关键概念 JEPA(联合嵌入预测架构)

一句话定义:在潜在空间中预测未来状态,而不是在像素空间中生成未来帧。

类比说明:就像你不需要完整想象下一个画面,只需要在心里有一个"大概是什么样"的向量——距离多远、方向在哪、什么东西在附近。

机器人场景:JEPA 让世界模型避免了在像素空间做生成式重建的昂贵代价,只保留对控制有用的几何和语义信息。

CEM(交叉熵方法 / 模型预测路径积分 MPPI)

一句话定义:一种基于采样的规划方法:随机生成大量候选动作序列,用世界模型推演结果,选择代价最低的那个。

类比说明:就像你打台球时,在脑子里快速试几十种出杆角度,选出最可能进洞的那个。

机器人场景:CEM 是 LeWM 等前沿世界模型的标配控制器,但每次决策都要采样 300×30=9000 条候选序列,推理成本极高。

Action Chunk(动作分块)

一句话定义:一次性预测未来 5 步动作序列,而不是单步预测。

类比说明:就像你写一个英文单词时不会逐字母思考,而是自然地写出整个词。

机器人场景:Action Chunk 让控制更流畅,避免逐帧推理的抖动,也是 INTACT 发挥优势的基础设计。

核心突破:INTACT 深度拆解 痛点:前向世界模型的控制不对称

LeCun 提出的 JEPA 范式在机器人领域催生了 LeWM、Fast-LeWM 等世界模型方法——它们能学会"给定当前状态 z_t 和动作 a_t,预测下一个状态 z_{t+1}"。问题出在控制端:

训练时_:动作参与塑造潜在空间结构
_部署时:要从通用高斯分布中重新采样、重新搜索

这意味着,即使世界模型本身已经学到了很好的表征,控制时还是要在 9000 条候选序列里用 CEM 做盲搜。表征越好,搜索成本反而越显得"冤枉"。


图 1 说明:论文图 1 展示了共享编码器 INTACT 的训练与循环控制架构。注意"本地调用"(local)与"目标调用"(goal)以完全相同语法进入同一个 Predictor,但梯度路由不对称——这是全篇最核心的设计。

方案:同构的双调用架构

INTACT 的核心洞察是:带动作标签的轨迹本身就包含了"从状态 A 到状态 B 该做什么动作"的监督。关键在于把两类意图统一起来:

两类意图,一个条件动作算子

意图类型

公式

角色

物理后继意图

m_local = z_{t+1} - z_t

真实物理变化,提供梯度锚定

可部署目标意图

m_goal =sg(z_g) - z_t

模拟部署条件,但梯度只流向当前状态

两者共享一个四槽输入语法

h_t(m) = [z_t;  m;  z_t ⊙ m;  A(a_{t-1})]

四个槽分别是:

当前状态z_t:告诉我"我在哪"

意图向量m:告诉我"想去哪"

状态-意图交互项z_t ⊙ m:提供廉价的 bilinear 交互,让同一位移在不同姿态/接触条件下被不同解读

前序动作编码A(a_{t-1}):保留时序上下文


图 2 说明:论文图 2 直观对比了两种范式——LeWM 从无信息高斯分布撒出 300×30 个候选序列,再用成本函数排序;INTACT 直接从目标位移均值生成行动计划,无需任何候选评估。

三个损失项,一种新范式

INTACT 的训练目标只有三项:

L_world:标准的 JEPA 潜在预测 + SIGReg 正则化,维持世界模型能力

L_z+:基于物理后继的逆动力学负对数似然,告诉模型"真实发生了什么样的变化→对应了什么动作"

L_goal:基于目标意图的 GCSL 式负对数似然,告诉模型"如果部署时给出一个目标变化→该输出什么动作"

梯度设计是关键:物理后继给双向梯度(锚定表征),目标意图只给单向梯度(模拟部署时不提供未来信息)。这种不对称性让模型学会了"可部署的意图坐标",同时不会把目标意图强行拉到与物理后继一致的位置——因为部署时你永远没有"真实的下一步"。

分布式动作法则:Direct 模式

部署时,INTACT 有两种模式:

Direct(主模式):直接用动作法则的条件均值输出 action chunk,零搜索、零候选评估,2.9-5.5ms 完成推理

Guarded A(可选验证):在 Direct 计划周围做小范围局部 CEM(128×3=384 候选),仅用 1/23 的候选量进一步提升成功率


图 3 说明:论文图 3 展示了在 PushT 任务上,物理逆动力学监督(L_z+)对 Actor-disabled CEM 和 Frozen Probe 的改善效果。这张图证明了"表征受益"是可分离测量的——即使最终控制器不用 INTACT,物理逆监督本身也在改进潜在空间。

效果:四个任务上的碾压级表现 单任务:1 epoch 训练,零搜索直接控

任务

Direct(0候选)

Guarded A(384候选)

LeWM 官方

PushT

85.78%

92.22%

96.0%

OGBench Cube

100.00%

99.78%

74.0%

DMC Reacher

97.67%

97.44%

86.0%

TwoRoom

97.89%

98.00%

87.0%

宏平均

95.33%

96.86%

85.75%

注:LeWM 官方数字来自已发布论文,使用纯 CEM 搜索(300×30=9000 候选)。INTACT Direct 零搜索即超其 9.58 个百分点。

多任务共享编码器:一个视觉骨干驱动四个域

方法

PushT

Cube

Reacher

TwoRoom

宏平均

LeWM CEM

74.6%

7.38%

83.1%

39.7%

66.18%

INTACT Direct

80.2%

99.6%

95.7%

82.1%

89.39%

INTACT Guarded A

85.0%

99.0%

97.9%

80.0%

90.48%

在共享编码器下,INTACT Direct 比同配置 LeWM CEM 高出23.22 个百分点。尤其是在 Cube 任务上,LeWM CEM 仅 7.38%,INTACT 达到 99.6%——这是因为 Cube 的接触动力学高度非线性,CEM 的高斯采样很难覆盖有效动作区域,而 INTACT 的意图坐标直接指向可行解。


图 4 说明:论文图 4 展示了共享编码器下各训练单元的逐任务成功率对比。从仅物理逆动力学到仅目标意图再到 Full INTACT,成功率阶梯式上升,每一项消融都在证明两个意图家族缺一不可。

为什么行?一篇罕见的因果分析

INTACT 论文最特别的地方,是用了整整一个实验章节做因果机制分析,而不是停留在"我们分最高":

1. 动作族诊断指标:关系比精度更重要

论文提出了预测动作与专家动作之间的 CKA(线性中心核对齐)和 kNN 重叠度作为诊断指标。在 45 个检查点的跨 epoch 分析中:

预测-专家kNN 对齐度与 Direct SR 的 Pearson 相关系数:r = 0.954

线性CKA相关:r = 0.897

逐点动作:仅 r = 0.815

这意味着:保持动作之间的关系结构比精确复现每一个动作值更重要。这也解释了为什么 INTACT 的条件均值策略有效——它保留的是"动作流形"而非"动作点"。

2. 高秩 ≠ 好表征

有效秩(effective rank)更高的模型,不一定有更高的成功率。论文给出了具体反例:两个模型秩分别为 93.87 和 89.26,但前者 SR 只有 74.22%,后者达到 89.39%。秩是必要检查但不是充分证书

3. 坐标映射干预实验

这是全篇最漂亮的实验之一:论文在共享编码器下做跨任务坐标映射——

正确配对(PushT→PushT 映射):恢复 68.04% SR

随机打乱配对:仅 9.46%

逆向互换(用 LeWM 的 actor 替换 INTACT 的 predictor):仅 5.08%

结论很清楚:INTACT 的意图坐标确实编码了可迁移的动作语义,但这种语义是任务局部的,不能跨任务直接复用


图 5 说明:论文图 5 展示了任务纯度、动作 R²、CKA、kNN 对齐度与成功率的关系。kNN 对齐度的 r=0.954 近乎完美地追踪了 Direct 控制能力,而逐点 R² 明显弱很多。这张图是整个"动作家族理论"的实证基石。

技术溯源与关联工作 团队脉络

INTACT 来自浙江大学 CAD&CG 国家重点实验室(Junhan Sun、Guofeng Zhang)与清华大学智能产业研究院 AIR / RoboParty Lab(Hao Zhao)的联合团队。通讯作者 Hao Zhao 和 Guofeng Zhang 分别是 RoboParty Lab 和 InSpatio 的核心成员。

从技术路线上看,INTACT 承接了 LeCun 提出的JEPA(联合嵌入预测架构)范式,直接对话的是LeWM(Learning Environment World Models)系列工作。与 C-JEPA、PRISM、Qantara 等方法的关键区别在于:INTACT 不是改进世界模型本身,而是在世界模型之上叠加了一个可部署的意图-动作接口,将"学习预测"升级为"学习如何行动"。

局限性与边界

论文第 6 节坦诚列出了多项局限:

当前仅在 4 个仿真任务、固定图像目标、离线专家演示上验证

动作商空间仅限于演示支撑集,未验证对 OOD 目标的泛化

高斯均值控制在多模态动作分布处可能落在两个有效模式之间

未在真实机器人、跨具身场景测试

但这些问题更多是"还没做"而非"做不到"——INTACT 的框架本身是任务无关和具身无关的。

资源直达

论文:arXiv:2607.26056

项目主页:zju3dv.github.io/INTACT-JEPA

GitHub:github.com/zju3dv/INTACT-JEPA

RoboParty Lab:lab.roboparty.com

InSpatio:inspatio.com

欢迎有兴趣的朋友加入群聊 ,后续多多交流学习


Mbot具身智能实验室

让尖端科技触手可及,人人皆可探索未来


Mbot基础交流群等你加入,下方扫码联系

具身-杰西

Mbot具身-小助手

Mbot-视频号

Mbot-公众号

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
炸裂!妻子怀孕期间清华博士出轨:坦言女孩太漂亮,没把持住自己

炸裂!妻子怀孕期间清华博士出轨:坦言女孩太漂亮,没把持住自己

汉史趣闻
2026-08-09 10:32:37
中国正式进入“超级内卷”时代!只有一种人能赚钱(深度)

中国正式进入“超级内卷”时代!只有一种人能赚钱(深度)

新浪财经
2026-06-23 08:51:12
泰晤士:曼城坚持对罗德里要6000万镑,巴萨愿付5500万+500万镑

泰晤士:曼城坚持对罗德里要6000万镑,巴萨愿付5500万+500万镑

懂球帝
2026-08-11 01:17:12
为了那一哆嗦,这些人连命都不要了?网友经历一个比一个离谱

为了那一哆嗦,这些人连命都不要了?网友经历一个比一个离谱

另子维爱读史
2026-07-28 20:26:27
涉嫌严重违纪违法,奚晖主动投案

涉嫌严重违纪违法,奚晖主动投案

中国基金报
2026-08-11 17:45:49
国家税务总局贵阳市云岩区税务局原党委书记、局长王海鹰接受纪律审查和监察调查

国家税务总局贵阳市云岩区税务局原党委书记、局长王海鹰接受纪律审查和监察调查

知知贵阳
2026-08-11 20:14:34
西南航空航班年轻乘客离世 身份确认后死因仍成谜

西南航空航班年轻乘客离世 身份确认后死因仍成谜

字节漫游指南
2026-08-11 06:39:43
股价跌停 北京科锐跨界收购引发关注

股价跌停 北京科锐跨界收购引发关注

中国基金报
2026-08-11 23:42:24
中国脑梗发病率世界第一!医生:罪魁祸首已揪出,3种蔬菜要少吃

中国脑梗发病率世界第一!医生:罪魁祸首已揪出,3种蔬菜要少吃

纸上的心语
2026-08-11 09:16:55
从被嘲到封神:迈克尔·曼的《迈阿密风云》20年后为何被赞为神作?

从被嘲到封神:迈克尔·曼的《迈阿密风云》20年后为何被赞为神作?

追星雷达站
2026-08-12 00:26:39
永远不要去埋怨你的家人,爱人和朋友,你强大,就去帮助和扶持他

永远不要去埋怨你的家人,爱人和朋友,你强大,就去帮助和扶持他

木言观
2026-08-10 22:58:30
1990,何超琼、陈百强、许晋亨微妙三人合影,藏半生意难平

1990,何超琼、陈百强、许晋亨微妙三人合影,藏半生意难平

娱你同欢
2026-07-21 23:04:17
知名女星自曝治疗进展:情况不太妙

知名女星自曝治疗进展:情况不太妙

南方都市报
2026-08-10 09:18:50
中国给印度发45万张签证,印度给中国2000张,竟然还上门提要求

中国给印度发45万张签证,印度给中国2000张,竟然还上门提要求

晓帝爱八卦
2026-08-10 22:26:39
委内瑞拉有20万华人,但最令人惊讶的是:这20万人里,竟有九成左右都来自同一个县城

委内瑞拉有20万华人,但最令人惊讶的是:这20万人里,竟有九成左右都来自同一个县城

背包旅行
2026-08-06 10:09:09
中国底层男人的一生,是家人、爱人的供养者,社会的纳税人和外地房东的血包!

中国底层男人的一生,是家人、爱人的供养者,社会的纳税人和外地房东的血包!

黯泉
2026-07-25 17:54:56
看德国悲惨现状就明白:中国为何坚决打击性交易,原因不言自明

看德国悲惨现状就明白:中国为何坚决打击性交易,原因不言自明

雪莉故事汇
2026-07-15 11:25:19
如果中国只保留一个省,那么一定就是山东

如果中国只保留一个省,那么一定就是山东

海佑讲史
2026-08-11 23:16:15
3岁遭抛弃,被养父家8个姐姐宠爱,红遍亚洲后亲生父母上门认亲

3岁遭抛弃,被养父家8个姐姐宠爱,红遍亚洲后亲生父母上门认亲

网络易不易
2026-08-03 12:06:19
吉达联合4-1大胜阿布扎比半岛,贝尔温两球,马尔万-萨哈菲破门

吉达联合4-1大胜阿布扎比半岛,贝尔温两球,马尔万-萨哈菲破门

懂球帝
2026-08-12 01:59:08
2026-08-12 03:16:49
杰西讲具身 incentive-icons
杰西讲具身
一名分享AI前沿的分享官,专注具身智能前沿知识
129文章数 1关注度
往期回顾 全部

科技要闻

AI大战变天:扎克伯格突然回头

头条要闻

网红"雅典娜"失踪3年 好友:她被李姓女网友诱骗至境外

头条要闻

网红"雅典娜"失踪3年 好友:她被李姓女网友诱骗至境外

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

“雅典娜”确认被害 细节令人发指!

财经要闻

AI泡沫的剧本,是2008年的次贷危机?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

家居
健康
旅游
教育
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

心血管专家破解猝死八大谣言

旅游要闻

住在拓东路几十年,今天才弄明白家门口这座老城,对昆明有多重要!

教育要闻

低分照样上本科 孩子高考不到四百分,一定要了解湖北专升本

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版