一个模型能把“机器人端着水杯在运动”的画面生成得无比逼真,水纹丝不动,机器人动作平稳。但模型并不理解——水,实际上应当从水杯中泼溅出来。画面美好,物理崩塌。
这也是世界模型赛道最核心的困局:生成不等于理解,理解不等于行动。物理 AI 真正需要的,是从“知道世界长什么样”到“知道世界怎么运行”再到“知道该怎么行动”的完整能力链。
![]()
7月19日,由世界人工智能大会主办、大晓机器人承办的世界模型“六小龙”巅峰论坛,将这道命题摆上了桌面。诺贝尔经济学奖得主Thomas J.Sargent首次站在具身智能的舞台上,用理性预期理论为世界模型提供了跨学科的理论底座;大晓机器人、蚂蚁灵波、自变量机器人、智元机器人、无界动力、极佳视界——国内世界模型第一梯队的“六小龙”首次同台论道。
从“理解”到“执行”这道鸿沟怎么填?本次论坛用三个层面做出了回应:理论底座和“行业共识”、系统性解法首次亮相、世界模型行业终于有了统一考场。
理论底座与行业共识
大晓董事长王晓刚在《物理 AI 的开悟时刻》的主旨演讲中指出,数字世界模型失误仅影响图文生成,而物理场景下智能体预判偏差将产生不可逆真实损失。他进一步给出“大晓”的解法——“具身世界模型第一性原理”和“具身模型信息密度定律”。
王晓刚认为,从具身世界模型第一性原理来看,唯有高密度地锚定控制状态,才能在不稳定的世界中最小化行动代价。机器人的行动代价与关键信息和控制充分状态正相关:机器人知道的关键信息越多,理解的控制充分状态就越准确,执行的时候犯错就越少。
而具身模型信息密度定律则强调,数据的价值不在数量堆叠,而在信息密度,会改变行动结果的信息,就是有价值的信息。在此定律下,L1-L2级数据仅能支撑基础预训练,L3-L4级数据止步于已知任务的拟合;唯有当数据迈入L5,深度融入三维力触觉、失败恢复轨迹和开放场景变量时,世界模型才真正挣脱“描述”的桎梏,抵达泛化、反思与自进化的“开悟”之境。
这个判断的行业价值在于:它给出了一套可操作的数据分级标准,而不是空谈“数据是燃料”。他进一步提出,只有当具身世界模型锚定第一性原理,依托多模态高密度信息萃取、控制充分状态锚定,在复杂不确定环境中最大限度降低机器人行动试错成本,物理AI 的开悟时刻,才能加速到来。
诺贝尔经济学奖得主 Thomas J.Sargent 则在《理性预期、人工智能与世界模型》的演讲中,辩证剖析了现有人工智能体系在罕见、未知场景下的认知局限:AI 可以从反复发生的事情中学习,但对那些很少发生、从未见过或尚未被尝试的事情,它仍可能一无所知。这句话精准戳中了具身智能的软肋——机器人真正的考验,恰恰来自物理世界中那些突发、不可预演的瞬间。
世界模型“六小龙”圆桌对话上,来自国内世界模型研发第一梯队的六位掌舵人同台论道,他们分别是大晓机器人首席科学家陶大程、蚂蚁灵波首席科学家沈宇军、极佳视界首席科学家朱政、无界动力联合创始人兼CTO 夏中谱、智元机器人 AI 算法总监任广辉、自变量机器人CTO 王昊。
谈论中,陶大程抛出了一个直击行业痛点的问题:现在世界模型的榜单,很多仍在沿用视频生成时代的老标准——画质好不好、时长够不够、一致性高不高。按照这套标尺,一个模型完全可以把“机器人端着水杯在运动”的画面生成得无比逼真,水纹丝不动,机器人动作平稳。但模型并不理解——水,实际上应当从水杯中泼溅出来。画面美好,物理崩塌。
三层九维:世界模型有了统一标尺
一个好的世界模型,到底该用什么来衡量?嘉宾们的深度碰撞下,共识浮现——三个层次、九个核心维度。
生成智能是入场券。核心是物理合理性,模型需了解常识物理与3D多视角一致性,知道铁比棉花掉得快。
认知智能是硬实力。泛化性检验模型是否真正理解物理因果而非机械记忆;反事实预测以当前状态加动作推演未来,且动作往往是反事实的,能否正确推演是理解世界因果的核心试金石;长期表示能力考察模型能否提取世界公共表示并形成长程记忆;预测精度则决定了对几何、运动、力学规律的掌握程度。
物理智能是终极标尺。动作准确性衡量模型支持的动作种类及执行准确度;时效性强调快速推理加即时反馈,这也是具身场景的刚性约束;决策增益指向世界模型对最终决策策略的可量化提升;真机验证则回归Fewshot背景下多任务真机成功率这一硬指标,是“做得成”的最直接证明。
这九条评价标准,其实也回应了本次圆桌的核心命题——物理AI从“理解”到“执行”究竟需要跨越哪些能力鸿沟。三层智能、九个维度,勾勒出的正是一条从“画得像”到“想得对”再到“做得成”的完整进化路径,为世界模型赛道指明了方向标尺。
值得一提的是,这三个层次的攻克方向,也与Kairos 3.1在“生成-认知-物理”三位一体上的技术架构深度呼应。这不仅验证了大晓提出的具身世界模型第一性原理,更预示着一条以真实行动为锚点的技术路线,正从前沿探索走向行业共识。
系统性解法亮相:大脑、数据与场景
论坛现场,大晓还正式发布三大核心成果:开悟世界模型 3.1(Kairos 3.1)、环境式数据采集方案 2.0,以及覆盖三大垂直场景的成套解决方案,从“大脑”到“数据”再到“场景”,为物理 AI 规模化落地构建起完整技术底座。
Kairos 3.1 的设计逻辑很明确:不追求对物理的“像素级”完美复刻,而是聚焦于“为行动而理解”。这意味着模型不需要无所不知,只需从高维感知中筛出与物理因果强相关的关键变量,在每个时刻锚定足以驱动可靠决策的“控制充分状态”,忽略其余冗余干扰。
在架构层面,Kairos 3.1 依托混合 Transformer 与共享混合注意力机制,将视觉观测、语言指令、力触状态、策略轨迹等多维数据压缩进统一隐空间,形成高密度表征向量。统一空间为三大智能的融合提供了底层基础:生成智能构建物理世界的内在表征,物理智能掌握因果推演与平行世界模拟,认知智能则负责复杂推理与长程任务分解。三者不再是各自独立的能力模块,而是在同一架构下深度耦合,让机器人从“生成虚拟未来”转向“预判行动对世界的真实影响”,真正理解行动后果。
在运行机制上,模型先通过世界理解完成长程任务拆解与环境评估,再在平行空间开展物理因果推演与多步决策仿真,最终输出可直接部署的动作策略。论坛现场演示的案例中,机器人面对“从杂乱桌面取特定药瓶”的任务,Kairos 3.1首先识别出药瓶位置、周边障碍物分布以及可能的抓取角度,随后在虚拟空间中模拟多种操作路径,推演每种选择对应的力学反馈与碰撞风险,最终选定成功率最高的方案并执行。整个过程从感知到决策的闭环时间控制在毫秒级。
数据采集方案2.0则回应了具身智能领域长期存在的瓶颈:如何以低成本、规模化方式获取高信息密度数据。大晓提出的“以人为中心的环境式采集方案”,不再依赖传统动捕设备或远程操控,而是通过可穿戴传感器与环境相机阵列,在人类自然操作过程中同步捕捉视觉、力触、语音指令与操作结果等多模态信号。该方法使得采集效率提升数倍,同时将数据成本大幅压缩,为L5级高密度数据的规模化获取提供了可行路径。
三大垂直场景解决方案——晓途、晓满、晓新,分别对应物流仓储、家庭服务和柔性制造三个领域。晓途聚焦仓储场景中的分拣、搬运与码垛任务,具备复杂光照与动态障碍条件下的稳定作业能力;晓满面向家庭环境,强调人机共融与安全交互,能够执行物品整理、桌面清洁等多步骤任务;晓新则瞄准精密装配与柔性产线,支持快速换型与小批量定制。
统一考场:Physical IQ物智发布
世界模型行业终于有了统一考场。Physical IQ物智在论坛上正式发布,这是首个具身原生、面向多场景、多本体、多任务的物理智能评测基准平台,让“自说自话”成为过去。
Physical IQ的设计理念直接对标前述九维评价体系。在生成智能维度上,它设置了物理合理性测试集与3D一致性评估指标;在认知智能层面,引入反事实预测任务、长程记忆保持率测量以及泛化性跨场景迁移测试;在物理智能层面,则聚焦动作准确率、推理时效性、决策增益量化指标与真机成功率四大硬核指标。
该平台支持多种机器人本体的接入测试,包括双臂人形机器人、轮式移动机器人以及四足机器人等,覆盖家庭、仓储、医疗、制造等典型应用场景。所有测试任务都配有标准化的评分细则和自动化评估流程,确保评测结果的可复现与可比较性。
大晓机器人在Physical IQ首期公布的基准成绩中,Kairos 3.1在生成智能的物理合理性评分和认知智能的反事实预测准确率两项指标上均居于首位。现场公布的数据显示,其真机Fewshot任务成功率在多个子场景中较上一代模型有明显提升。
三个层次的探讨,串起一条清晰的主线:这场论坛,在给物理AI“铺路”——铺一条从理论到标准、从技术到产业的完整路径。从王晓刚提出的具身世界模型第一性原理,到Thomas J.Sargent的理性预期理论跨学科注解,再到三层九维评价体系的行业共识,以及Kairos 3.1的系统性落地和Physical IQ的统一考场,物理AI正在从各自摸索的“手工作坊”阶段,走向有公共语言、有可度量目标、有标准化工具的工程化新阶段。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.