网易首页 > 网易号 > 正文 申请入驻

Aether AI发布首个因果世界模型,世界模型开始思考“行动背后的因果”|甲子光年

0
分享至



一张新榜单能证明什么,又不能证明什么。

作者|七月

编辑|栗子

假设一台双臂机器人正在把罐子放进锅里。

头部相机显示任务已经完成,左腕画面里的罐子却还留在夹爪中;右腕画面里,另一只机械臂甚至出现了不该发生的移动。三段视频分开看都足够流畅,合在一起,物理世界却裂成了三份。

机器人不会被一段好看的视频安抚,它必须在同一个世界里行动。

这正是TriWorldBench(首个面向机器人三视角视频生成与理解的具身世界模型评测基准)想解决的问题。过去,机器人世界模型的评测往往盯着单一外部视角,看画面是否清晰、连贯、接近参考视频。TriWorldBench同时检查头部、左腕和右腕三个视角,要求它们描述同一次操作、同一个物体状态和同一段动作进程。它还把任务完成度、接触合理性、轨迹、时间稳定性和视觉质量放进同一套评测里。

就在最近,TriWorldBench更新了他们榜单的排名,Aether AI最新发布的首个因果世界模型——CausalWM以66.04的高分登顶榜首。


图源:Aether AI创始人黄碧薇X账号官宣发布CausalWM

除了在聚焦机器人三视角一致性的TriWorldBench上取得第一,CWM还在覆盖更广泛物理场景的Physical AI Bench(PAI-Bench)中获得验证。


在接收到一个观察结果和语言指令后,因果工作记忆系统会通过明确的运动和几何预测来生成未来的情景 图源:Aether AI官网

第一名的成绩当然值得欣喜。但身处世界模型这样一个定义仍在快速变化的赛道,对Aether AI来说更重要的问题或许是:这66.04分究竟测到了什么?

1.第一名的背后

Aether AI的此次发布,带来了模型机制和榜单成绩两项公开信息。


CausalWM(下文简称CWM)是一个16B的模型。给定当前观测,并结合语言指令或机器人动作条件,CWM先预测光流,再生成三维点图(pointmap),最后生成未来RGB视频。前一步的结果会成为后一步的上下文,后续信息则由注意力掩码挡住,不能提前“泄题”。Aether AI团队把这套顺序预测机制称为Causal CoT(因果思维链)。

这次发布也带来了一项榜单结果。

在最近更新的TriWorldBench榜单中,共收录了36个模型,CWM以66.04分排名第一,第二名dream4act为65.66分。


从分项看,CausalWM在跨视角、任务和运动相关指标上表现靠前,同时又在世界合理性和视觉质量上斩获第一——

在三视角一致性维度排名第2,任务对齐维度排第3,运动质量维度排第2,视觉质量维度排第2,透视合理性和图像质量则拿到了单项第一。

因此,这次第一名可以证明CausalWM其背后采用的因果路线展现出了对物理世界更强的建模能力。

它也释放了一个产业信号:世界模型的一部分评测重心,正从“谁的视频更像”,转向“谁能生成一个可供行动的统一世界”。

2.CausalWM:把中间物理过程写进预测链

传统世界模型已经能做动作条件预测:给定当前状态和控制信号,生成未来画面。CausalWM想进一步处理的是另一个问题——模型究竟依靠什么中间物理变量完成预测。

Aether AI选择把这部分过程显式展开。团队将光流、深度、几何等可自动提取的物理变量组织成一条有顺序的推理链:

Observation→Motion→Geometry→Future


这里的关键不是多预测几个额外特征,而是让前一步结果真正成为下一步的条件。先描述运动,再补充空间结构,最终共同参与未来视频的生成。训练中,后续变量不会提前泄露给前序阶段;推理时,模型也按照同样的顺序逐级生成。因此,CausalWM试图把原本压缩在隐变量里的物理过程,变成一条可以显式监督和复用的因果思维链(Causal CoT)。


在接收到一个观察结果和语言指令后,因果工作记忆系统会通过明确的运动和几何预测来生成未来的情景 图源:Aether AI官网

为了训练CausalWM,Aether AI构建了一个约30K小时的视频数据集,覆盖机器人操作、第一视角视频和多视角交互场景。


训练分成三个阶段:

第一阶段先解决生成能力。CausalWM基于LTX-2.3-22B继续训练,学习语言条件、动作条件和多视角未来预测。

第二阶段加入Causal CoT。光流、深度和点云信息被作为中间物理变量,按照固定顺序参与预测。前一阶段生成的特征会重新进入上下文,后续预测再以此为条件。由于这些监督信号可以从原始视频自动提取,这套CoT训练可以扩展到大规模视频数据,而不依赖人工逐帧标注。

第三阶段再用多目标强化学习优化完整生成结果。视频预测本身具有开放性,同一个状态可能对应多个合理未来,单纯监督学习并不能直接保证物理一致性、视觉质量和任务完成度。CausalWM因此对同一上下文采样多个未来,并根据多类奖励进行组内优化。这样一来,中间CoT也不再只是模仿固定模式,而可以根据最终视频质量被进一步调整。


CausalWM训练的三个阶段:一种共享扩散式转换器先预测光流,然后生成点图,最后预测未来的RGB图像。每个完成的流段都会保持不变,作为下一个流段的背景信息;因果注意力机制会屏蔽后续阶段的信息。 图源:Aether AI官网

CausalWM还有一个比较有意思的结果:训练CoT之后,模型不仅会预测这些中间变量,也更擅长利用新的上下文信息控制。这给模型留下了一个相对通用的控制接口:只要某种控制信号可以被表示成视觉形式,就可以沿着现有 上下文窗口注入模型,实现上下文学习(In-context Learning)。

例如,在机器人场景中,可以把simulator给出的机器臂轨迹渲染成运动视频,经过少量微调后,模型就可以根据这些轨迹生成相匹配的未来视频。这意味着,中间变量不再只是“解释模型预测”的辅助信息,也可以反过来成为因果干涉(Causal Intervention)的窗口。类似机制还可以扩展到物体轨迹、目标姿态等信号。


图源:Aether AI官网

3.因果路线真正想省下的是“重训税”

机器人完成一次演示,离规模化部署还很远。

机械臂换了夹爪,工厂换上一批反光零件,家庭环境里多了一张粗糙桌面,模型都可能需要重新采集数据、增加遥操作示范,再做一轮微调。部署方关心演示视频里的成功率,也会追问模型遇到变化后的恢复成本:需要补多少数据?跑多少次真机?投入多少工程人/天?

这些重复投入,我们认为可以叫作“重训税”。如果因果方法能够让部分机制在新场景中复用,它的商业价值就体现在降低这笔成本上。

如果模型学到的机制能够拆开复用,局部变化就有机会局部调整。桌面摩擦变了,更新接触和滑动相关的部分;夹爪尺寸变了,重新校准本体接口;抓取和放置已经学会,面对新的物体组合时沿用已有经验。只有这套设想能够落地,机器人的边际交付成本才可能下降。

ICLR 2025的WM3C研究沿着相近方向,把语言中的动作和物体拆成可组合的动力学组件,测试模型对未见任务的适配。实验支持因果模块化改善迁移的可能性,不过任务数量有限,验证环境也以仿真为主。


(a)环境模型示意图(b)环境模型的因果图示 图源:《Modeling Unseen Environments with Language-guided Composable Causal Components in Reinforcement Learning》

Aether AI此前提出的CD-LAM则从动作表征入手。论文发现,隐式动作模型容易把背景、场景和镜头变化一并塞进“动作”表示——下游世界模型名义上接收了动作条件,预测时仍可能依赖画面连续性,甚至在收到静止指令后继续让机械臂移动。

CD-LAM通过提高机械臂和被操作物体的学习权重,拉近同类动作的表征,然后再把相同画面之间的变化校准为接近零动作。论文在2B和14B两种模型上报告,接入真实机器人动作后,动作跟随误差相对基线下降约30%,适配所需更新次数减少12倍以上。这项工作说明:控制信号可以通过表示去偏重新接回模型。


CD-LAM在DreamDojo上显著提升了动作跟随、视觉保真度和数据效率。图源:Causally Debiased Latent Action Model for Embodied Action Conditioned World Models

理论给出了因果模型可能更稳健的条件,经验研究的结果则取决于具体任务和数据。

ICLR 2024的Robust agents learn causal world models在特定理论设定中推导出:智能体若要应对足够广泛的分布变化,需要学到近似的数据生成因果模型;

放到世界模型行业,各家选择的入口并不相同:Meta的V-JEPA 2主要在潜空间学习预测和规划;英伟达Cosmos提供物理AI所需的生成模型和数据工具;Google DeepMind的Genie 3侧重实时可交互环境;World Labs的Atlas处理文本、图像、视频和3D共享的空间上下文。Aether AI选择把运动、几何等中间表征显式化,再尝试让这些表征承担控制条件。

这些路线可以组合——生成模型负责扩充训练环境,潜空间模型提高表征和规划效率,因果模块尝试处理变化中的机制复用。此外,系统效果还取决于一系列模型之外的条件:仿真环境能否重置、干预变量是否可控、验证器是否可靠,以及失败经验能否复用。

目前我们能看到的是,CWM给出了一种结构设计,TriWorldBench记录了视频生成侧的成绩。但是两者之间还缺一条证据链:显式的运动和几何中间过程,能否让模型换环境后少补数据、少跑真机、更快恢复?

判断“重训税”是否真的下降,需要把视线移到更严格的干预评测和真机闭环。

4.从Causal CoT到因果智能,还缺哪些证据?

按照Aether AI的长期设想,因果世界模型还要回答:哪些变量真正决定未来,改变某个变量会带来什么结果。第一版CWM模型给出的Causal CoT的起点已经很具体,但这还不足以说明模型已经找到了真实的因果变量。

第一类证据来自更严格的干预与组合评测。主动改变物体质量、摩擦、光照、相机位置或动作策略,可以观察模型能否分清外观变化与动力学变化。把见过的动作、物体和环境重新组合,再记录模型需要补多少数据、经过多少次更新才能恢复性能。这条恢复曲线比单次“零样本成功”更接近部署实际。

第二类证据来自真机闭环。世界模型进入真实机器人后,策略要根据预测选择动作,连续处理误差累积,并在失败时找到需要调整的环节。不同路线还应尽量使用相近的数据量、模型规模、交互次数和推理成本。模型版本、训练设置、随机方差与失败案例也需要公开,第三方才能分辨提升来自结构设计还是资源投入。

Aether AI表示,后续还会继续围绕因果世界模型,探索更优的因果表征学习和因果推理策略,让模型能够更好地识别物理世界中的关键因果变量、理解变量之间的因果依赖,为下一代因果智能(Causal Intelligence)建立基础。从物理世界出发,Aether AI希望进一步打通因果世界理解与行动生成,让模型从预测世界,走向理解因果、利用因果并作用于世界,最终实现:让AI理解什么真正影响结果,以及不同的行动与干预将如何改变未来。

(封面图来源:AETHER AI)



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
怪不得巴基斯坦死活不肯出兵帮沙特!不是不敢打胡塞武装,而是真怕后院起火

怪不得巴基斯坦死活不肯出兵帮沙特!不是不敢打胡塞武装,而是真怕后院起火

回京历史梦
2026-09-24 14:07:44
内塔尼亚胡:5年内,追上中美

内塔尼亚胡:5年内,追上中美

环球时报国际
2026-09-24 07:55:13
三方都吃亏,顺风车定价病在哪?

三方都吃亏,顺风车定价病在哪?

趣味萌宠的日常
2026-09-24 02:53:34
女子起诉离婚4次均被驳回,17岁长子还写信给法官以死相劝,第5次起诉离婚目前已开庭未宣判

女子起诉离婚4次均被驳回,17岁长子还写信给法官以死相劝,第5次起诉离婚目前已开庭未宣判

扬子晚报
2026-09-20 19:08:31
世界首次500强差距断崖:日本149家,美国151家,中国3家,如今呢

世界首次500强差距断崖:日本149家,美国151家,中国3家,如今呢

福建睿平
2026-08-28 07:25:16
为何俄罗斯宁愿割让500多万平方公里的领土,也不愿舍弃克里米亚

为何俄罗斯宁愿割让500多万平方公里的领土,也不愿舍弃克里米亚

纪史行者
2026-08-09 08:47:12
哈佛研究发现:3种颜色是“抑郁色”,若孩子喜欢,家长需谨慎

哈佛研究发现:3种颜色是“抑郁色”,若孩子喜欢,家长需谨慎

户外阿毽
2026-09-23 15:23:41
炸完莫斯科第三天,泽连斯基想议和,俄连夜报复,欧洲已放弃幻想

炸完莫斯科第三天,泽连斯基想议和,俄连夜报复,欧洲已放弃幻想

林子说事
2026-09-24 05:55:38
彭德怀只指挥了一年半,谁接过了抗美援朝后半程?

彭德怀只指挥了一年半,谁接过了抗美援朝后半程?

纪史行者
2026-08-02 19:08:57
教育部回应“13岁于子迪亚运泳池连夺两金”:我们觉得这是一件非常了不起的事情

教育部回应“13岁于子迪亚运泳池连夺两金”:我们觉得这是一件非常了不起的事情

极目新闻
2026-09-23 12:19:13
兰香如故:林锦岐沈家坟前坦白!原来,这才是兰香哭到失控真相,她在给自己全家磕头啊

兰香如故:林锦岐沈家坟前坦白!原来,这才是兰香哭到失控真相,她在给自己全家磕头啊

可乐谈情感
2026-09-25 00:30:39
当着所有国家代表的面,特朗普在联大上向全球宣告:人工智能将更名“超级智能”!

当着所有国家代表的面,特朗普在联大上向全球宣告:人工智能将更名“超级智能”!

军武咖
2026-09-23 14:53:55
全线下跌!美联储加息,传来新消息!

全线下跌!美联储加息,传来新消息!

证券时报
2026-09-24 23:10:09
实体店末日?人民日报怒批,死的不是实体店,是 20 年不变经营脑!

实体店末日?人民日报怒批,死的不是实体店,是 20 年不变经营脑!

抽象派大师
2026-08-31 17:04:18
马德里德比处罚出炉!3 人停赛:皇马中卫赫伊森、穆帅助教、马竞门将教练各禁 1 场!马竞罗梅罗、李刚仁安然无事!

马德里德比处罚出炉!3 人停赛:皇马中卫赫伊森、穆帅助教、马竞门将教练各禁 1 场!马竞罗梅罗、李刚仁安然无事!

福酱的小时光
2026-09-24 05:37:39
310cc踏板车跑700英里,比本田金翼更让人上头

310cc踏板车跑700英里,比本田金翼更让人上头

Ping值焦虑
2026-09-24 00:39:19
不是迷信!中秋节晚上,最不能做的4件事,一定别忘了告诉家人

不是迷信!中秋节晚上,最不能做的4件事,一定别忘了告诉家人

简食记工作号
2026-09-24 01:27:03
2亿美元卖掉豌豆荚,却成了AI时代的黄埔军校

2亿美元卖掉豌豆荚,却成了AI时代的黄埔军校

野生运营
2026-09-22 06:00:27
亚运会|中国游泳队已斩获25金,打破队史夺金纪录在望

亚运会|中国游泳队已斩获25金,打破队史夺金纪录在望

北青网-北京青年报
2026-09-24 20:59:13
金鹤龙再次为杨幂化妆!据说一次妆容费用高达五万起,这短发看起来真的太显年轻了

金鹤龙再次为杨幂化妆!据说一次妆容费用高达五万起,这短发看起来真的太显年轻了

放开他让wo来
2026-09-23 16:15:57
2026-09-25 03:19:00
甲子光年
甲子光年
中国科技产业化前沿智库
3629文章数 9296关注度
往期回顾 全部

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

头条要闻

5架战机飞越白宫 致敬中美两国元首夫妇

头条要闻

5架战机飞越白宫 致敬中美两国元首夫妇

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

跌光1400亿,“女王”亏麻了

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

艺术
家居
房产
数码
旅游

艺术要闻

看完她的油画我沉默了:风景静物美成壁纸,笔触多变,色彩清新到犯规!

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

中秋、国庆小长假来了,但我劝你别离开海口

数码要闻

罗技G PRO X3 LIGHTSPEED头戴式游戏耳麦发售,到手价1699元

旅游要闻

1年幽禁7年囚居,贵阳这座不起眼的山洞,藏着两代爱国志士的遗憾

无障碍浏览 进入关怀版