2026年,具身智能领域发生了一场静悄悄但意义深远的“大脑”革命。这场革命的核心,是从VLA(视觉-语言-动作)模型 到WAM(世界动作模型)的代际跃升。
如果说VLA让机器人学会了“听懂指令并动起来”,那么WAM则赋予了它们“先思考后果,再决定行动”的想象力。这不仅是技术的进步,更是机器人从“机械执行者”迈向“认知智能体 ”的关键一步,或许,我们期盼已久的具身智能“iPhone时刻”正由此开启。
VLA的局限:高级的“条件反射”
VLA模型的出现,曾是具身智能领域的一大里程碑。它成功地将视觉、语言和动作三种模态打通,让机器人能够理解人类的自然语言指令,并根据摄像头 看到的画面,输出相应的动作。
例如,你对机器人说:“把桌上的可乐递给我。”VLA模型会识别出“可乐”的视觉特征,定位其在空间中的位置,然后规划一条路径,控制机械臂 完成抓取和递送。
但这本质上,仍是一种高级的“条件反射”。机器人并不真正“理解”它在做什么,它只是在执行一个从“视觉+语言”到“动作”的复杂映射。
这种模式的致命弱点在于,它缺乏对物理世界的常识和因果推理能力。一旦遇到训练数据中未覆盖的“长尾场景”,机器人就很容易“翻车”。
比如,如果桌上有两瓶可乐,一瓶是满的,一瓶是空的,VLA机器人可能会随机抓取一瓶。如果它抓起了满的那瓶,但抓握力度过大,导致可乐罐变形,液体喷溅,它也无法预判这个后果并调整策略。因为它没有“罐子变形会喷溅”的世界模型。
WAM的降维打击:赋予机器人“想象力”
WAM(世界动作模型)的出现,正是为了解决VLA的“智商”瓶颈。
WAM的核心突破在于,它在“感知”和“行动”之间,增加了一个“预测”的环节。它不再满足于“看到什么就做什么”,而是学会了“如果我这么做,世界会变成什么样”。
这个“世界模型”,就像是机器人大脑里的一个物理模拟器。在行动之前,它会先在脑海里“想象”出多种可能的行动路径及其后果,然后选择那个最安全、最高效的方案。
让我们回到刚才的例子。当面对两瓶可乐时,搭载WAM的机器人会先在“脑海”中模拟两种抓握方式:
方案A:用大力抓满的可乐。模拟结果显示:罐体变形,液体喷溅。
方案B:用适中的力抓满的可乐。模拟结果显示:成功抓起,无喷溅。
方案C:抓起空的可乐。模拟结果显示:任务失败。
通过这种“想象力”,机器人会毫不犹豫地选择方案B。它“理解”了物体的物理属性(满的罐子易变形),并基于常识(喷溅是坏结果)做出了最优决策。
这种“先预测,后行动”的能力,就是WAM赋予机器人的“想象力”。它让机器人具备了处理未知场景、应对突发状况的泛化能力,极大地提升了其在开放世界中的安全性 和可靠性。
从“动”到“懂”:跨越“iPhone时刻”的临门一脚
WAM的出现,为何被寄予厚望,甚至被认为是通向“iPhone时刻”的关键?
因为一项技术产品要迎来“iPhone时刻”,必须满足两个条件:
能力上的质变:从“能用”到“好用”,解决用户的核心痛点。
体验上的颠覆:创造出前所未有的、自然流畅的交互方式。
VLA模型解决了“能动”的问题,让机器人初步具备了通用性。但WAM模型解决的,是“能懂”的问题。它让机器人真正开始理解物理世界的运行规律,具备了常识和推理能力。
这种能力上的质变,是机器人从工厂、展厅走向千家万户的前提。只有当机器人足够“聪明”和“可靠”,能够理解“轻拿轻放”、“不要打碎”这些蕴含物理常识的指令时,人们才会放心地让它进入家庭,去整理房间、照顾老人。因此,从VLA到WAM的演进,正是具身智能跨越“iPhone时刻”的临门一脚。它标志着我们正从让机器人“动起来”的时代,迈向让它们“聪明起来”的新时代。当机器人普遍拥有了“想象力”,那个属于物理AI的颠覆性时代,或许就真的不远了。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.