作者:中国新闻周刊 周游,快思慢想研究院院长田丰
一、腿脚利索,脑子跟不上
![]()
8月19日,宇树科技登陆科创板,董事长王兴兴的身家一夜之间超过千亿元,坐上了"90后"新首富的位置。宇树从四足机器狗起家,2023年推出首款人形机器人H1,2025年出货量超过5500台,全球第一,能后空翻、能打拳。但也有人说当前人形机器人"小脑发达,大脑发育不良"——腿脚利索,脑子跟不上。去年9月,宇树自己也推出了一个开源世界模型UnifoLM-WMA-0,想给通用机器人学习补上一块统一的技术基础。8月20日的世界机器人大会上,王兴兴坦言,机器人走进家庭最大的瓶颈是"具身智能的泛化能力还不太够",任务执行时"最后一厘米"的偏差,足以让成功率断崖式下跌;他判断,迈向具身智能的"ChatGPT时刻",理想情况要2到3年,悲观估计得5到10年。
所有人都在问同一个问题:机器人翘首以盼的那个"大脑",到底该长什么样?答案越来越指向一个答案——世界模型。
二、学会"算",而不是"背"
![]()
问AI"松开咖啡杯会怎样",普通大语言模型会答"掉地上摔碎"——它是从训练数据里读过这句话。世界模型不这样干,它会盯着杯子离地的高度,代入重力加速度,算出"0.5秒后落地",再按材质估算碎裂程度。它不需要读过这句话,它自己会算。
图灵奖得主、前Meta首席AI科学家杨立昆把世界模型定义为"能预测行动后果的内部模拟器"。斯坦福教授、World Labs创始人李飞飞把这件事称为"空间智能",认为AI要真正理解三维世界,构建大型世界模型是最重要的路径;她的学生、复旦大学通用物理智能研究院院长苏昊则专注"物理智能",想让AI在真实世界里把抓、推、拧这些动作真正做成。快思慢想研究院院长田丰则认为:空间智能关心"房间的几何结构记不记得住",物理智能关心"动作做不做得成",世界模型是这两者背后共用的推演能力,三个概念是具身智能的三个切面,不是三条互相竞争的赛道。
三、老结构,装上了新算力
![]()
世界模型不是凭空冒出来的新发明。状态预测在控制论里已经是60年的老概念——卡尔曼滤波、模型预测控制、强化学习先驱萨顿提出的Dyna架构,内核都是同一句话:"用一个模型预演未来,再据此选动作。"今天的新意,只是把这套老逻辑做成了大规模、可微分、能端到端训练的样子。
田丰的判断是,技术范式转移的历史规律一贯如此:新范式通常等于旧结构乘以新算力,很少是凭空出现的新原理。他还指出更实际的分界线:语言模型处理的是秒到分钟级的语义步骤,世界模型处理的是20~100毫秒级的物理步骤,两者时间尺度差着两个数量级,压根不在同一个战场上。产业界真正该追问的问题,是谁握着机器人执行器的写入权限——是人类遥控,还是大脑真正指挥机器人身体自主行为。
四、吵了80年的路线之争
![]()
世界模型这个概念能追溯到1943年,80多年过去,业内还在争怎么实现它。杨立昆押注"隐空间"——在一个抽象空间里预测未来状态,Meta去年6月发布的V-JEPA 2走的就是这条路,代价是这个空间人眼看不见,工程化困难。生成式大模型崛起后,Sora、Seedance这类视频模型顺势成了另一条路,但视觉上"看着合理"不等于物理上"算得对"。李飞飞团队的Marble选择直接生成可交互的3D世界,2025年11月13日开放,精度够高,已经按每月20到95美元的档位商用,代价是算力吃得凶。
田丰把争论拆成两个轴:"预测在什么空间进行"和"预测结果给谁看"。国内几家车企的选择很说明问题:小鹏把图像压缩成结构化词元,理想在隐空间里预测以回避像素级生成,小米让生成器的内部表征直接服务规划,华为把车和环境动力学拆开算——共同判断是“控制任务根本不需要照片级重建”。腾讯混元世界模型2.0在2026年4月16日开源,能把资产直接导进Unity、UE引擎,走的是显式3D这条路,好处是产物能立刻进入现成的美术和仿真流程,付费方当天就能闭环。隐空间路线的产物人看不懂,只能靠下游任务的表现背书,商业化天然要慢一到两年。
五、数据卡住脖子
![]()
再前沿的世界模型,拉到严格测试下都会露怯。一项针对自动驾驶世界模型的测试发现,即便是谷歌Veo 3.1这样的顶尖模型,预测热油飞溅、金属遇水这类物理风险时依然不可靠,常常漏判风险链条。北京智源人工智能研究院院长王仲远说得更形象:视频生成模型可能生成一群在天上飞的猪,可物理世界不会这样运行。要是机器人装上一个分不清真实和幻想的脑子,它可能真以为自己是钢铁侠——这就是安全隐患。
田丰指出,问题的根子在数据类型。大语言模型学的是人类写下来的文字,是加工过一遍的二手经验,高质量文本的总量已经见底,业内估计大约在10的13次方词元这个量级。世界模型学的是摄像头、传感器、机械臂直接采到的一手记录,每天新增的比特数比文本高出好几个数量级。V-JEPA 2只有12亿参数,不到主流大语言模型的百分之一,却吃掉了超过100万小时视频。更麻烦的是,生成过程中误差会逐帧累积,当前最强的模型也只能维持几分钟的物理一致性,工业可用的门槛却是连续一小时以上。经济学规律再次应验:瓶颈永远卡在最稀缺的那个环节。
六、实践是检验认知的唯一标准
![]()
AI学习靠的是相关性归纳,可物理世界的规律是因果性的,这道坎怎么迈?田丰的答案是:把动作当成外生变量注入模型,就完成了大半。纯观测数据里,动作和状态纠缠在一起,模型只能学到"经常一起出现";一旦把动作作为独立输入喂给模型,在同一个初始状态下改变动作,就等于做了一次真正的干预,模型才第一次有能力回答"如果这样做,结果会不同吗"。V-JEPA 2的证据很直接:只用62小时机器人数据做动作条件化训练后,模型在全新环境里抓取、摆放陌生物体的成功率就能达到65%到80%——干预数据的价值,远高于单纯的观测数据。谷歌DeepMind的Genie 3已经能在生成过程中让用户改天气、加物体,这是反事实推演能力的雏形。
田丰预判:当虚拟世界里训练出来的机器人,搬到真实世界后的成功率,超过用同样成本采集真实数据训练出来的成功率时,拐点就到了——从那一刻起,造数据比采数据划算,这可能是世界模型带给整个行业最大的颠覆。
七、多数"世界模型",还只是半成品?
![]()
行业公认,完整的世界模型该有感知、记忆、预测、规划四个模块,但田丰的判断很扎心:现在市面上多数自称世界模型的系统,本质上是一个带了动作输入的视频生成器——感知和预测算是有了,记忆和规划基本还是空的。他给出三个简单标准:
能不能接受动作输入?
状态能不能跨越分钟级维持住?
预测误差能不能反过来改进策略?
按这个标准,Genie 3的视觉记忆大约只有1分钟,连续交互也只能维持几分钟,面向订阅用户开放的版本单次生成上限是60秒、720p、24帧。
拦住记忆模块的不是生成质量,是维护状态的成本——逐帧生成时,参与计算的历史随时间线性增长,长时一致性和实时性在同一块显存带宽上互相抢资源。真正缺失的那块拼图,是价值判断能力:模型能回答"接下来会发生什么",答不了"这样做值不值得"。Physical Intelligence在其模型π*0.6中,靠一个多任务价值函数补上了这块空白,代价是必须依赖真机部署攒出来的经验。田丰认为,完整架构的落地顺序基本已定:先有动作条件,再有能持久压缩的状态记忆,然后是价值和奖励,最后才轮到规划。跳过任何一步就敢自称"世界模型",交付的其实只是一段渲染视频。
八、真实世界的“学费”
![]()
再逼真的仿真,也替代不了机器人真实摔一次跤。田丰指出,质量、摩擦系数、刚度、形变阈值这些参数,在像素里根本看不见,它们只在"施力—观测反应"的真实交互中才会暴露出来——再多第三人称视频也反推不出这些参数,因为观测数据里从来就缺"施力"这个自变量。人搬箱子时,不会描述前臂张力如何随箱内液体晃动实时调整,这类默会知识几乎从未被写进任何语料,这也是为什么李飞飞判断当前大模型"擅长抽象知识、却缺乏对物理世界的真实理解"。
真实交互确实必要,但真正值钱的是失败样本,而失败恰恰是仿真最难生成的部分。Physical Intelligence的RECAP方法给出了一条实际路径:先人类示教,再实时干预纠错,最后让机器人自主试错做强化学习。效果是实打实的——最难任务的吞吐量提升一倍以上,失败率大约减半,除了高难度的叠衣服,多数任务最终成功率超过90%,机器人甚至能连续13小时不间断制作意式咖啡。这才是补齐世界模型短板真正要花的“学费”。
九、一半“真突破”,一半“真透支”
![]()
2026年被业内称为"世界模型元年",谷歌DeepMind开放Genie 3公测,腾讯开源混元3D世界模型2.0。田丰的判断是:技术在狭窄场景里确实成熟了,资本在宏大叙事里也确实透支了,这两件事同时发生,谁也不能否定谁。成熟的部分看得见——腾讯的模型能导出资产直接进游戏引擎;英伟达今年6月1日发布的Cosmos 3采用"混合Transformer"架构,把推理和生成两套Transformer配对,同时覆盖文本、图像、视频、声音和动作轨迹五种模态,客户名单里已经有理想汽车;世界模型已经成为能交付、能收钱的产品。
透支的部分同样看得见。杨立昆今年初创办AMI Labs,3月完成约10.3亿美元种子轮,投前估值35亿美元,投资方里有贝索斯、英伟达、三星、丰田创投,他自己都说这是一个基础研究项目,不是三个月就能憋出产品的应用型创业公司。中国这边同样火热,2026年上半年世界模型相关赛道三个月内融资规模超百亿元人民币,有企业两个月内完成四轮融资。田丰认为最靠谱的检验尺子是单位经济账:Genie 3订阅顶配月费250美元,换来的却是每次仅60秒的生成时长;今年6月完成3.1亿美元B轮融资的Odyssey,随即把云服务商转向AWS的Trainium芯片,动因直指推理成本太高。产业史反复证明一条规律:新范式里第一批倒下的公司,大多死于算不过来的成本账,很少死于模型本身不够聪明。
十、没有捷径,只有笨功夫
![]()
自动驾驶的数据管道已经跑通——特斯拉AI负责人Ashok Elluswamy在2025年国际计算机视觉大会上介绍过公司的神经世界模拟器,用车队回传数据训练出闭环仿真系统,据称同一套系统可以直接迁移到人形机器人Optimus身上;理想汽车已经出现在英伟达Cosmos 3的客户名单里。田丰判断:这类结构化、闭环反馈成本最低的场景会先兑现,仓储、产线这类环境可能率先跨过"虚拟训练成功率超过真实采集"的分水岭,时间点大概在2027到2028年。至于真正走进千家万户的通用服务机器人,人工智能学者安德烈·卡帕西认为"还要十年"。
宇树的机器人已经能后空翻、能打拳,市值破千亿。可它缺的那个脑子,还得靠数据、靠算力、靠一次次真实世界里的摔打,一点点长出来。这场竞赛没有捷径,只有笨功夫。
参考文章:《宇树机器人,缺个“好脑子”?》,中国新闻周刊 周游
畅销书:《AI商业进化论:“人工智能+”赋能新质生产力发展》
出版社:人民邮电出版社
作者:田丰
帮助你定位AI当下发展坐标的指南针
帮助你洞察AI未来演进趋势的航海图
通俗化解读AI的原理、特性和四大发展规律、提供AI赋能商业、引发新质生产力变革的一手案例分析。既有宏观视角的全局观照,又有各行业应用层面的下探记录,聚焦AI的原理与实践、现在与未来,是当下AI应用的全景图、更是身处AI技术浪潮之中的探路书。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.