![]()
作者:吕鑫燚
出品:具身研习社
2026年,世界模型的热度已经无需赘述。无论海外还是国内,越来越多机器人企业和研究机构开始将其视为具身智能迈向通用能力的关键技术方向。“世界模型是具身智能从演示走向通用的关键一跃”,正在成为行业共识。
但共识只解决了“要不要做”,真正困难的是“怎么做”。无论是视频生成类还是隐空间类世界模型,表面上看是技术路线之争,但往深一层看,所有路线都绕不开三个共同难题。
第一个难题,是动作能不能真正影响预测。大量实验表明,视觉先验过强时,模型容易忽略动作信号,倾向于生成“大概率成功”的未来。即使输入的是一个必然导致失败的动作,模型也可能预测出成功结果。
第二个难题,是推演能不能撑过一分钟。在自回归生成中,每一步预测都会成为下一步的输入,微小误差不断累积,时间越长越容易出现状态漂移。对于动辄持续数分钟的复杂机器人任务而言,长时间的任务推演是世界模型走向真实场景必须跨过的一道门槛。
第三个难题,是虚拟世界能不能与真实世界对齐。世界模型的终极价值,并不是生成一段逼真的视频,而是在虚拟环境中评估机器人策略,并让结果能够指导真实机器人。如果虚拟世界里的成功率与真机表现无法对应,那么整个“虚拟测试—策略筛选—真实执行”的价值链条就无法成立。
这三个问题,也正是自变量此次发布 WALL-SS 所瞄准的核心。
针对“动作指挥不了画面”,WALL-SS提出尺度对齐的动作条件注入,让机器人动作贯穿不同尺度的预测过程:粗尺度决定整体运动,精尺度进一步刻画夹爪和物体的细微变化。同时,通过统一时间轴和坐标系,让动作与画面建立更严格的对应关系。
针对“推演撑不过一分钟”,WALL-SS通过多尺度记忆压缩保留不同时间尺度的信息,并同步压缩动作历史,让机器人不仅记得“发生过什么”,也能保留动作与结果之间的关联,实现最长60秒的连续推演。
针对“虚拟与真实对不齐”,WALL-SS进一步进行了闭环 Sim-to-Real 对比:让同一策略分别在世界模型和真实机器人中执行,通过两者结果进行验证。这让世界模型不只是一个“生成未来”的工具,也开始具备评估机器人策略的意义。
当然,WALL-SS并不是终点。它更重要的意义在于,针对世界模型最关键的几个瓶颈,给出了新的技术路径和实验验证:动作可以更准确地影响未来,长时推演可以进一步延伸,虚拟世界也有可能与真实机器人建立更可靠的对应关系。
对于产业界而言,这意味着世界模型正在从一个远期概念,逐渐进入具身智能的实际技术路线。当核心问题开始出现可验证、可复现的解决方案,接下来需要面对的,就是工程化、规模化和成本下降。
世界模型的技术范式仍未收敛,但真正的竞争已经开始从“要不要做”,进入“谁能把它做成”的阶段。
以下是WALL-SS技术解读报告,经具身研习社整理。
![]()
今日,自变量机器人发布 WALL-SS,即下一尺度自回归世界模型,像画画一样先勾勒粗轮廓、再补上线条、最后描绘细节。它具备三个核心优势:锚定动作,生成的未来必须严格遵循动作指令;持久性,推演能够长时间保持连贯;可验证性,生成的未来能够作为真实物理世界的有效参考。
WALL-SS 取得了显著效果:动作跟随得分 0.29,是评测模型中唯一不为零的;生成视频与给定轨迹的契合度从 0.251 提升到 0.539,提升 115%;推演时长从几秒提升到 60 秒不崩溃;虚拟世界与真实世界的任务成功率吻合度达到 93%。
![]()
WALL-SS 学习“动作—画面变化”的物理规律,并通过下一尺度自回归,从粗到精生成未来画面。
第一层突破:视觉经验不再成为“干扰项”
现有世界模型在预测未来画面时,主要依赖“视觉经验”,动作信号往往被优先忽略。这导致机器人抓杯子时,手指移动相差 1 毫米,原本应该对应“抓起杯子”和“打翻杯子”的天壤之别。但由于当前的视觉画面几乎相同,模型不去细看动作指令的差异,直接从画面“猜”出了“抓起杯子”。
自变量提出“尺度对齐的动作条件注入”:动作信号按照画面的精细尺度,被精确地注入到每一步生成中,不再是可有可无的信号,而是必须遵循的“全程指导”。
在预测每个尺度的画面时,机器人动作都直接参与决策:粗尺度确定机器人大致位置,精尺度确定手指是否合拢,动作贯穿预测画面的每一层。WALL-SS 还建立起动作和画面的严格对照:两者采用相同的时间轴和坐标系,多个摄像头也互相“通气”,确保画面一致。
![]()
分别输入向左、向前、向右三种动作指令,蓝色虚线为指令轨迹,橙色实线为生成轨迹,两者高度重合,表明模型生成能够遵循动作指令。
在“动作跟随”测试中,WALL-SS 得分 0.29,是所有对比模型中唯一得分不为零的。换言之,在此之前,没有任何模型能够可靠地让预测画面中的虚拟机器人“遵循动作指令”。生成视频与给定轨迹指令的重合度也从 0.251 提升到 0.539,提升115%。
第二层突破:分层处理记忆,模型不再“短择”
世界模型的另一大挑战是:它要连续预测很多帧,后面的画面根据前面的画面预测,误差会不断累积。到某一个画面时,预测会完全崩溃:物体突然消失,桌子东倒西歪,机器人抓住的物体瞬间移回原位。现有世界模型通常只能稳定推演几秒,而很多家庭任务需要连续几十秒甚至一分钟的预测。
预测崩溃的根本原因是:模型预测画面需要把历史帧作为上下文,如果只保留最近几帧信息,就会“忘掉”更早的信息,只能“乱编”;如果保留太多历史信息,又会导致内存开销快速膨胀。
自变量提出了“尺度压缩的长时间跨度记忆”:由于不是所有历史都同等重要,越近的记忆保留越精细,越远的越粗略。举例来说,模型记得机器人“几秒前用左手抓住了杯子”,记得机器人“几十秒前移动到桌子旁边”,对于更久远的信息,只记得“场景里有桌子和杯子”。不管推演多久,内存占用始终恒定。
不仅区别处理记忆,WALL-SS 还会记住“做了什么动作导致这个画面”,在压缩画面时同步压缩动作历史,确保两者因果关系始终清晰。此外,自变量还提出“尺度级梦境强迫”,即在训练时故意给模型“喂错题”,让它学会从错误中恢复,以便在推理时面对误差实时矫正。
![]()
WALL-SS 推演至 60 秒,画面仍保持清晰,物体位置稳定;通用视频模型在约 30 秒后物体消失。
在“流式推演”测试中,WALL-SS 能稳定推演 60 秒,仍然保持清晰的画面和正确的物体位置。作为对比,仅保留最近几帧的模型预测 20-30 秒就开始“画面崩坏”。
第三层突破:93%吻合度,模型不再只是“仿真王者”
世界模型面临的第三个关键问题是:在虚拟世界里成功的策略,拿到真实世界里也好用吗?世界模型预测的世界演化,根本目的还是指导物理世界的动作,如果不能作为依据,价值就大打折扣。
自变量提出了“视觉动力学的在线策略对齐”:用强化学习让模型在自己预测的轨迹上“实战练习”,根据两个裁判的打分不断修正——一个检查“动作对不对”,画面预测是否遵循动作指令;另一个检查“长期一致性”,不同时间看到的画面是否连贯。这作为前两种方法的补充,使得虚拟世界预测更贴近物理现实。
在“闭环策略一致性”测试中,自变量在 6 个任务、5 个训练阶段分别测试,发现同一个策略在虚拟世界和真实世界中的任务成功率,吻合度高达93%。这意味着你可以信任虚拟世界的结果,将世界模型作为检验各种策略有效性的“训练场”,大幅提升筛选机器人动作策略的效率。
![]()
同一个策略在虚拟世界与真实世界中分别测试,任务成功率高度吻合,相关系数达到0.93。
不仅如此,WALL-SS 还有两个独特能力。首先,WALL-SS 的同一个网络既能当模拟器也能当规划器:模拟器能根据给定动作预测未来,规划器能根据任务目标自主规划路径。这表示你可以用规划器生成一套动作方案,然后立刻用模拟器验证结果,整个“生成方案→验证效果→筛选最优”闭环都在同一个模型里完成。
其次,WALL-SS 内置了动作解码头,能从生成的未来画面中直接读出下一个机器人动作。传统的世界模型只能告诉你“未来画面长什么样”,需要另一个模型把画面翻译成动作指令,WALL-SS 则本身就能输出动作。这表示 WALL-SS 不仅是一个仿真平台,也是能直接控制机器人的策略。
结语
WALL-SS 不是终点,世界模型的路依然漫长。但它是一个明确的信号,那个曾经只存在于论文和愿景中的“会思考的机器人”,正在从概念变成工程。而当机器真正学会在动手之前先想清楚,它们走进人类生活的速度,将超出大多数人的预期。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.