把搜索从“必须”变成“可选”:浙大&清华联合RoboParty Lab提出INTACT,LeCun点赞,3w浏览量引爆X!
导语
发布一天,X上浏览量突破3万,图灵奖得主Yann LeCun亲自点赞—— 这是INTACT在社交媒体上交出的成绩单。
世界模型学会了预测"动作会带来什么变化",但要从"想要的变化"倒推出"该做什么动作",传统方案只能靠大规模候选采样加成本函数评估——一次推理就要遍历数千条候选轨迹,耗时 1.5 秒以上。
浙大CAD&CG国家重点实验室、清华大学智能产业研究院(AIR)、RoboParty Lab(萝卜派对)、InSpatio(影溯)共同发布了INTACT,端到端训练一个“意图→动作”的直接映射接口,将推理延迟从1.48秒压到2.9-5.5毫秒,加速约300倍。在四个官方LeWM基准任务上,仅训练1个epoch、零搜索,直接控制器就达到**95.33%**的宏平均成功率。更值得关注的是,论文用一整节因果分析拆解了“为什么行”——这是近年世界模型方向罕见的研究深度。
![]()
硬核科普:三个关键概念 JEPA(联合嵌入预测架构)
一句话定义:在潜在空间中预测未来状态,而不是在像素空间中生成未来帧。
类比说明:就像你不需要完整想象下一个画面,只需要在心里有一个"大概是什么样"的向量——距离多远、方向在哪、什么东西在附近。
机器人场景:JEPA 让世界模型避免了在像素空间做生成式重建的昂贵代价,只保留对控制有用的几何和语义信息。
CEM(交叉熵方法 / 模型预测路径积分 MPPI)
一句话定义:一种基于采样的规划方法:随机生成大量候选动作序列,用世界模型推演结果,选择代价最低的那个。
类比说明:就像你打台球时,在脑子里快速试几十种出杆角度,选出最可能进洞的那个。
机器人场景:CEM 是 LeWM 等前沿世界模型的标配控制器,但每次决策都要采样 300×30=9000 条候选序列,推理成本极高。
Action Chunk(动作分块)
一句话定义:一次性预测未来 5 步动作序列,而不是单步预测。
类比说明:就像你写一个英文单词时不会逐字母思考,而是自然地写出整个词。
机器人场景:Action Chunk 让控制更流畅,避免逐帧推理的抖动,也是 INTACT 发挥优势的基础设计。
核心突破:INTACT 深度拆解 痛点:前向世界模型的控制不对称
LeCun 提出的 JEPA 范式在机器人领域催生了 LeWM、Fast-LeWM 等世界模型方法——它们能学会"给定当前状态 z_t 和动作 a_t,预测下一个状态 z_{t+1}"。问题出在控制端:
训练时_:动作参与塑造潜在空间结构
_部署时:要从通用高斯分布中重新采样、重新搜索
这意味着,即使世界模型本身已经学到了很好的表征,控制时还是要在 9000 条候选序列里用 CEM 做盲搜。表征越好,搜索成本反而越显得"冤枉"。
![]()
图 1 说明:论文图 1 展示了共享编码器 INTACT 的训练与循环控制架构。注意"本地调用"(local)与"目标调用"(goal)以完全相同语法进入同一个 Predictor,但梯度路由不对称——这是全篇最核心的设计。
方案:同构的双调用架构
INTACT 的核心洞察是:带动作标签的轨迹本身就包含了"从状态 A 到状态 B 该做什么动作"的监督。关键在于把两类意图统一起来:
两类意图,一个条件动作算子
意图类型
公式
角色
物理后继意图
m_local = z_{t+1} - z_t
真实物理变化,提供梯度锚定
可部署目标意图
m_goal =sg(z_g) - z_t
模拟部署条件,但梯度只流向当前状态
两者共享一个四槽输入语法:
h_t(m) = [z_t; m; z_t ⊙ m; A(a_{t-1})]
四个槽分别是:
当前状态z_t:告诉我"我在哪"
意图向量m:告诉我"想去哪"
状态-意图交互项z_t ⊙ m:提供廉价的 bilinear 交互,让同一位移在不同姿态/接触条件下被不同解读
前序动作编码A(a_{t-1}):保留时序上下文
![]()
图 2 说明:论文图 2 直观对比了两种范式——LeWM 从无信息高斯分布撒出 300×30 个候选序列,再用成本函数排序;INTACT 直接从目标位移均值生成行动计划,无需任何候选评估。
三个损失项,一种新范式
INTACT 的训练目标只有三项:
L_world:标准的 JEPA 潜在预测 + SIGReg 正则化,维持世界模型能力
L_z+:基于物理后继的逆动力学负对数似然,告诉模型"真实发生了什么样的变化→对应了什么动作"
L_goal:基于目标意图的 GCSL 式负对数似然,告诉模型"如果部署时给出一个目标变化→该输出什么动作"
梯度设计是关键:物理后继给双向梯度(锚定表征),目标意图只给单向梯度(模拟部署时不提供未来信息)。这种不对称性让模型学会了"可部署的意图坐标",同时不会把目标意图强行拉到与物理后继一致的位置——因为部署时你永远没有"真实的下一步"。
分布式动作法则:Direct 模式
部署时,INTACT 有两种模式:
Direct(主模式):直接用动作法则的条件均值输出 action chunk,零搜索、零候选评估,2.9-5.5ms 完成推理
Guarded A(可选验证):在 Direct 计划周围做小范围局部 CEM(128×3=384 候选),仅用 1/23 的候选量进一步提升成功率
![]()
图 3 说明:论文图 3 展示了在 PushT 任务上,物理逆动力学监督(L_z+)对 Actor-disabled CEM 和 Frozen Probe 的改善效果。这张图证明了"表征受益"是可分离测量的——即使最终控制器不用 INTACT,物理逆监督本身也在改进潜在空间。
效果:四个任务上的碾压级表现 单任务:1 epoch 训练,零搜索直接控
任务
Direct(0候选)
Guarded A(384候选)
LeWM 官方
PushT
85.78%
92.22%
96.0%
OGBench Cube
100.00%
99.78%
74.0%
DMC Reacher
97.67%
97.44%
86.0%
TwoRoom
97.89%
98.00%
87.0%
宏平均
95.33%
96.86%
85.75%
注:LeWM 官方数字来自已发布论文,使用纯 CEM 搜索(300×30=9000 候选)。INTACT Direct 零搜索即超其 9.58 个百分点。
多任务共享编码器:一个视觉骨干驱动四个域
方法
PushT
Cube
Reacher
TwoRoom
宏平均
LeWM CEM
74.6%
7.38%
83.1%
39.7%
66.18%
INTACT Direct
80.2%
99.6%
95.7%
82.1%
89.39%
INTACT Guarded A
85.0%
99.0%
97.9%
80.0%
90.48%
在共享编码器下,INTACT Direct 比同配置 LeWM CEM 高出23.22 个百分点。尤其是在 Cube 任务上,LeWM CEM 仅 7.38%,INTACT 达到 99.6%——这是因为 Cube 的接触动力学高度非线性,CEM 的高斯采样很难覆盖有效动作区域,而 INTACT 的意图坐标直接指向可行解。
![]()
图 4 说明:论文图 4 展示了共享编码器下各训练单元的逐任务成功率对比。从仅物理逆动力学到仅目标意图再到 Full INTACT,成功率阶梯式上升,每一项消融都在证明两个意图家族缺一不可。
为什么行?一篇罕见的因果分析
INTACT 论文最特别的地方,是用了整整一个实验章节做因果机制分析,而不是停留在"我们分最高":
1. 动作族诊断指标:关系比精度更重要
论文提出了预测动作与专家动作之间的 CKA(线性中心核对齐)和 kNN 重叠度作为诊断指标。在 45 个检查点的跨 epoch 分析中:
预测-专家kNN 对齐度与 Direct SR 的 Pearson 相关系数:r = 0.954
线性CKA相关:r = 0.897
逐点动作R²:仅 r = 0.815
这意味着:保持动作之间的关系结构比精确复现每一个动作值更重要。这也解释了为什么 INTACT 的条件均值策略有效——它保留的是"动作流形"而非"动作点"。
2. 高秩 ≠ 好表征
有效秩(effective rank)更高的模型,不一定有更高的成功率。论文给出了具体反例:两个模型秩分别为 93.87 和 89.26,但前者 SR 只有 74.22%,后者达到 89.39%。秩是必要检查但不是充分证书。
3. 坐标映射干预实验
这是全篇最漂亮的实验之一:论文在共享编码器下做跨任务坐标映射——
正确配对(PushT→PushT 映射):恢复 68.04% SR
随机打乱配对:仅 9.46%
逆向互换(用 LeWM 的 actor 替换 INTACT 的 predictor):仅 5.08%
结论很清楚:INTACT 的意图坐标确实编码了可迁移的动作语义,但这种语义是任务局部的,不能跨任务直接复用。
![]()
图 5 说明:论文图 5 展示了任务纯度、动作 R²、CKA、kNN 对齐度与成功率的关系。kNN 对齐度的 r=0.954 近乎完美地追踪了 Direct 控制能力,而逐点 R² 明显弱很多。这张图是整个"动作家族理论"的实证基石。
技术溯源与关联工作 团队脉络
INTACT 来自浙江大学 CAD&CG 国家重点实验室(Junhan Sun、Guofeng Zhang)与清华大学智能产业研究院 AIR / RoboParty Lab(Hao Zhao)的联合团队。通讯作者 Hao Zhao 和 Guofeng Zhang 分别是 RoboParty Lab 和 InSpatio 的核心成员。
从技术路线上看,INTACT 承接了 LeCun 提出的JEPA(联合嵌入预测架构)范式,直接对话的是LeWM(Learning Environment World Models)系列工作。与 C-JEPA、PRISM、Qantara 等方法的关键区别在于:INTACT 不是改进世界模型本身,而是在世界模型之上叠加了一个可部署的意图-动作接口,将"学习预测"升级为"学习如何行动"。
局限性与边界
论文第 6 节坦诚列出了多项局限:
当前仅在 4 个仿真任务、固定图像目标、离线专家演示上验证
动作商空间仅限于演示支撑集,未验证对 OOD 目标的泛化
高斯均值控制在多模态动作分布处可能落在两个有效模式之间
未在真实机器人、跨具身场景测试
但这些问题更多是"还没做"而非"做不到"——INTACT 的框架本身是任务无关和具身无关的。
资源直达
论文:arXiv:2607.26056
项目主页:zju3dv.github.io/INTACT-JEPA
GitHub:github.com/zju3dv/INTACT-JEPA
RoboParty Lab:lab.roboparty.com
InSpatio:inspatio.com
欢迎有兴趣的朋友加入群聊 ,后续多多交流学习
![]()
Mbot具身智能实验室
让尖端科技触手可及,人人皆可探索未来
![]()
Mbot基础交流群等你加入,下方扫码联系
具身-杰西
Mbot具身-小助手
Mbot-视频号
Mbot-公众号
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.