RSS 2026 具身智能论文观察:世界模型、VLA 与机器人闭环学习的新拐点 写在前面
RSS 2026 的 accepted papers 已经公布。从官方论文列表和 RSS 2026 Paper Explorer 的统计结果看,本届会议共收录 210 篇论文,覆盖 21 个 session,每篇论文平均作者数约 7.4 人,整体呈现出高度交叉和系统化的研究特征。其 中,Humanoids、Control & Dynamics、Multi-robot Systems、Perception and Estimation、Planning 是规模最大的几个 session,各包含 13 篇论文;而 World Models & Memory、VLA Models、Datasets and Benchmarks、
Manipulation、Navigation、Imitation Learning、RL 等方向也都保持了较高密度,说明 RSS 2026 的机器人研究并不是由单一热点驱动,而是在学习、感知、控制、规划、操作、仿真与具身模型之间形成了更完整的技术版图。
![]()
从 topic 统计看,Learning 是最核心的关键词,覆盖 105 篇论文,约占全部论文的一半;其后是 Manipulation 56 篇、Perception 51 篇、Control and Dynamics 48 篇。这组数据很有代表性:学习方法已经成为机器人研究的主轴,
但最终仍然要落到操作、感知和控制这些机器人基本问题上。与具身智能直接相关的方向同样突出,包括 Human-Robot Interaction 36 篇、Navigation and Planning 36 篇、Safety and Robustness 33 篇、Language and VLM 27 篇、 Simulation and Digital Twins 20 篇、Humanoids and Locomotion 16 篇。需要说明的是,这些 topic 来自 RSS 2026 Paper Explorer 基于标题和 session 的规则化自动打标,并非 RSS 官方关键词,但它们仍然能较好反映本届论文 结构。
因此,RSS 2026 传递出的一个明确信号是:具身智能正在从“把视觉语言模型接到动作输出”进一步走向“可预测、可评估、可自我改进的机器人闭环系统”。这不是一个单点趋势。RSS 2026 单独设立了 World Models & Memory session,
同时 VLA Models、Imitation Learning、Datasets and Benchmarks、Humanoids、Manipulation 等方向也出现了大量与具身基础模型相关的工作。尤其是 world model、memory、VLA、sim-to-real、cross-embodiment、long-horizon
manipulation 等关键词,在论文标题和摘要中高频出现。
如果用一句话概括这届 RSS 2026 在具身智能方向的技术变化,我认为是:
机器人基础模型的重点,正在从“学会输出动作”转向“理解动作会如何改变世界,并利用这种预测能力持续改进策略”。
下面我按几个技术主线展开梳理。
一、World Models & Memory:机器人开始把“想象”接入控制闭环
过去两年,VLA(Vision-Language-Action)模型是具身智能里最受关注的方向。它的基本思路是:输入图像、语言指令和机器人状态,输出动作序列。这个范式很有吸引力,因为它把大模型的语义理解能力直接接入了机器人控制。
但问题也很明显:很多 VLA 模型本质上仍是强行为克隆系统。它们可以从大规模示范数据中学到“类似场景下人类或专家会怎么做”,但当任务进入长时程、接触丰富、动态扰动、遮挡严重的真实场景时,只靠一步步模仿很容易累积误差。
RSS 2026 的 World Models & Memory session 正是在回应这个问题。该 session 包括 Memory Retrieval in Visuomotor Policies、RAG-Diff、Self-Improving Robot Policy with Compositional World Model、HAIC、ViPSim、Act2Goal、Causal World Modeling、Simulation Distillation、Interactive World Simulator 等论文。它们共同指向一个核心判断:机器人不能只根据当前观测输出动作,还需要预测未来状态、评估动作后果,并把这种能力用于规划、训练和评测。
1. 【已开源】RISE:用组合式世界模型做“想象中的强化学习”![]()
论文Self-Improving Robot Policy with Compositional World Model提出 RISE。它针对的是一个很现实的问题:VLA 模型在接触丰富和动态操作任务中仍然脆弱,而真实世界 on-policy RL 又面临安全风险、硬件成本、环境 reset 等限制。
RISE 的思路是构建一个组合式世界模型:一部分负责预测多视角未来状态,另一部分负责评估 imagined outcome 的任务进展价值。然后系统在“想象空间”里生成 rollout、估计 advantage、更新策略,从而减少真实物理交互成本。
这个设计有两个值得注意的点:
第一,它不是把世界模型当成一个单纯的视频预测器,而是把它拆成“状态预测”和“价值评估”两个功能模块。前者关注未来会发生什么,后者关注这些未来对任务是否有帮助。
第二,它把策略改进从真实世界搬到 imagined space 中进行。对于机器人来说,这一点很关键,因为真实试错不仅慢,而且经常伴随碰撞、失败和设备损耗。
根据官方摘要,RISE 在动态砖块分拣、背包打包、关盒子等真实任务上取得了明显提升。这类结果说明,world model 不是只用于可视化预测,而是可以成为策略自我改进的训练接口。
论文:https://www.roboticsproceedings.org/rss22/p012.pdf
主页:https://opendrivelab.com/RISE
2. 【已开源】CauVA:把视频世界模型变成动作推断模型![]()
Causal World Modeling for Robot Control则把问题推进了一步。它明确提出,视频世界模型与视觉语言预训练一样,是机器人学习的重要基础能力。
这篇论文提出 CauVA,将帧预测和动作推断统一到一个自回归扩散框架中。它的核心技术包括:把视觉帧和动作作为同一个因果序列处理的 Mixture-of-Transformers、通过 KV cache 保留真实交互历史、以及用 noisy latent augmentation 从中间去噪视频中快速解码动作。
这里的关键不只是“预测未来图像”,而是“从对未来的预测中反推出动作”。如果一个模型既能回答“执行这个动作后场景会怎样变化”,也能回答“为了达到这个未来状态应该执行什么动作”,它就不再只是生成模型,而是开始承担控制器和规划器的一部分角色。
这也是世界模型在机器人中区别于通用视频生成模型的地方:机器人关心的不是视频是否逼真,而是预测是否与动作、物体、接触和任务进展一致。
论文:https://www.roboticsproceedings.org/rss22/p016.pdf
3. HAIC:世界模型进入人形机器人的全身交互![]()
HAIC: Humanoid Agile Object Interaction Control via Dynamics-Aware World Model关注人形机器人与欠驱动物体的交互,例如滑板、推车、拉车以及带负载的物体操作。
这类任务的难点在于:目标物体并不是刚性绑定在机器人末端执行器上的。物体有自己的速度、加速度、惯性、非完整约束和遮挡问题。传统只基于视觉或末端状态的控制,很容易在动态耦合中失效。
HAIC 的方法是从机器人本体历史中预测物体的高阶状态,包括速度和加速度,并把预测结果投影到静态几何先验中,形成一种动态 occupancy 表示。这样,即使视觉上有盲区,策略也能利用预测到的动态边界和接触 affordance 做决策。
这个方向非常值得关注,因为它说明 world model 正在从桌面机械臂操作扩展到 humanoid whole-body interaction。人形机器人要进入真实环境,不能只会走路,也不能只会抓取。它必须在移动、平衡、接触、避障、负载变化之间做连续决策,而这正是 dynamics-aware world model 可以发挥作用的地方。
论文:https://www.roboticsproceedings.org/rss22/p013.pdf
主页:https://haic-humanoid.github.io/
代码:https://github.com/ldt29/HAIC
4. Act2Goal:从世界模型到目标条件策略
Act2Goal: From World Model To General Goal-conditioned Policy则把 world model 与 goal-conditioned policy 结合起来。
![]()
传统 goal-conditioned policy 往往输入当前观测和目标图像,然后直接预测下一步动作。但对于长时程操作来说,中间过程非常重要。只看最终目标,很难保证策略不会在中途偏离。
Act2Goal 的做法是:先用目标条件视觉世界模型生成一串可能的中间视觉状态,再通过多尺度时间控制把这些 imagined states 转成实际动作。论文中提出的 Multi-Scale Temporal Hashing 将轨迹分成两类:近端密集帧用于细粒度闭环控制,远端稀疏帧用于保持全局任务一致性。
这背后的思想很清晰:长时程任务不应该只用一个最终目标约束,而应该把任务展开成一条可执行、可纠偏的视觉计划。对于机器人来说,“我最终要把东西放进盒子”不够;它还需要知道“下一阶段应该接近哪个中间状态”。
官方摘要还提到,Act2Goal 支持无奖励的在线自主改进,通过 hindsight goal relabeling 和 LoRA 微调,在一些真实 out-of-distribution 任务中能在短时间交互后显著提高成功率。这个结果体现了一个重要趋势:离线大规模学习和在线部署适应正在合流。
论文:https://www.roboticsproceedings.org/rss22/p015.pdf
二、Interactive World Simulator:世界模型开始承担数据生成与评测职责
如果说上面的论文主要把 world model 用于策略训练和控制,那么Interactive World Simulator for Robot Policy Training and Evaluation关注的是另一个更基础的问题:能不能把 world model 变成可交互的机器人训练与评测环境?
根据官方摘要,这篇工作构建了一个交互式世界模拟器,可以用中等规模机器人交互数据训练 world model,并支持在单张 RTX 4090 上以 15 FPS 进行超过 10 分钟的稳定长时程交互。更重要的是,论文用 world-model-generated data 训练了 Diffusion Policy、Action Chunking Transformer 和 π-series policies 等策略,并在真实世界中验证这些策略的表现。
这个方向的意义很大。
目前机器人学习有两个非常大的瓶颈:
第一,真实数据昂贵。机器人采集数据慢、设备成本高、场景 reset 麻烦,而且失败可能造成硬件损耗。
第二,真实评测不稳定。不同实验室、不同物体、不同相机角度、不同初始状态都会影响结果,导致论文之间很难公平比较。
如果交互式世界模型可以稳定生成动作条件下的长期物理变化,并且模型内评测与真实世界评测有较强相关性,那么它就可能成为机器人领域的“可扩展评测代理”。这不是简单的仿真替代,而是从真实交互数据中学习出来的 surrogate environment。
当然,这里仍有关键挑战:world model 是否真的理解接触、摩擦、遮挡、形变和失败状态?它生成的数据是否会带来模型偏差?在模型中表现好的策略,是否会利用 world model 的漏洞而不是学到真实可迁移行为?这些问题决定了 world model 能否从研究 demo 走向基础设施。
但至少从 RSS 2026 的论文布局看,社区已经开始认真对待“world model as training and evaluation infrastructure”这个方向。
三、VLA 模型进入第二阶段:跨本体、长时程、持续学习
RSS 2026 的 VLA Models session 也很密集,包括 X-DiffVLA、SkillVLA、BagelVLA、GuidedVLA、AR-VLA、continual learning VLA、π*₀.₆、StereoVLA、RLux-VLA 等。
这一组论文传递出的信号是:VLA 已经从“能不能工作”进入“如何更可靠、更泛化、更可持续改进”的阶段。
1. X-DiffVLA:跨本体动作头成为关键问题
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models关注 cross-embodiment learning。
![]()
现有 VLA 模型通常需要针对具体机器人形态进行微调。机械臂、夹爪、灵巧手、移动底盘的 action space 不同,动作分布和可达空间也不同。这会限制大模型在不同机器人之间迁移。
X-DiffVLA 的核心是一个统一的跨本体 diffusion action head。它通过 Embodiment Forcing 让动作生成隐式适配不同 embodiment 的功能组件,并通过 Morphological Tree Diffusion 捕捉不同末端执行器之间的结构相关性。
这个问题在产业中尤其重要。真实部署不可能只面对一种标准机器人。如果每换一个夹爪、每换一台机械臂都要重新训练大模型,VLA 的通用性就会大打折扣。跨本体动作建模,可能是机器人基础模型走向平台化的必要步骤。
论文:https://www.roboticsproceedings.org/rss22/p081.pdf
主页:https://boyuli-xh.github.io/X-DiffVLA/
2. BagelVLA:语言规划、视觉预测、动作生成进入同一个循环
BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation试图把语言规划、视觉预测和动作生成放进统一框架。
很多 VLA 系统会把语言规划和动作生成分成不同模块,或者只关注其中一个能力:要么强调语言推理,要么强调视觉预测。但长时程操作通常同时需要这两者。机器人既要理解任务阶段,也要预判物体状态变化,还要生成低层动作。
BagelVLA 的做法是将文本推理和视觉预测交错嵌入动作执行循环,并通过 Residual Flow Guidance 用较低延迟提取预测视觉特征来指导动作生成。
这个方向说明,下一代 VLA 可能不会是“语言模型 + 动作头”的简单结构,而会更像一个多模态生成控制系统:语言负责抽象任务结构,视觉预测负责物理后果,动作生成负责执行。
论文:https://www.roboticsproceedings.org/rss22/p083.pdf
主页:
3. π*₀.₆:VLA 需要从真实经验中学习![]()
π*₀.₆: a VLA That Learns From Experience是另一篇很值得关注的论文。它提出 RECAP,通过 advantage-conditioned policies 利用真实世界经验,包括人类示范、策略 rollout 和在线纠正数据。
这篇论文的核心问题是:VLA 要真正部署,不能只依赖离线数据。因为真实环境中的长尾情况太多,离线数据不可能覆盖所有失败模式。模型必须能从部署中的失败、纠正和人类干预中学习。
官方摘要提到,π*₀.₆ 可以在真实家庭中长时间完成叠衣任务,也可以在工厂装箱、操作专业咖啡机,并在部分困难任务上提升吞吐量、降低失败率。
这类工作代表了 VLA 的一个重要转向:从 static policy 到 experience-driven policy。也就是说,模型不是训练完就固定,而是在真实使用中继续吸收经验。
这里最难的不是“再训练一次模型”,而是如何处理异构经验数据。真实部署中会有成功示范、失败轨迹、人类接管、局部纠正、任务偏好、环境变化。这些数据质量不一、目标不一、分布复杂。如何把它们转化为稳定的策略改进信号,是 VLA 走向实用的核心问题之一。
论文:https://www.roboticsproceedings.org/rss22/p087.pdf
主页:https://www.pi.website/blog/pistar06
四、数据与评测:具身智能的第二战场
如果只看模型架构,很容易低估数据和评测的重要性。但 RSS 2026 的 Datasets and Benchmarks session 显示,社区正在把数据基础设施当成具身智能的核心竞争点。
1. MolmoSpaces:从 benchmark 到开放生态
MolmoSpaces: Large-Scale Open Ecosystem for Robot Manipulation and Navigation提供了一个大规模开放生态,包括超过 23 万个室内环境、13 万个带标注物体资产、4.8 万个可操作物体和 4200 万个稳定抓取,并支持 MuJoCo、Isaac、ManiSkill 等模拟器。
这不是传统意义上的单一 benchmark,而更像一个机器人学习的数据与评测生态。它覆盖静态操作、移动操作、导航、多房间长时程任务等场景,并报告了较强的 sim-to-real correlation。
为什么这重要?
因为具身智能真正困难的地方不是某个固定任务,而是长尾分布:房间布局不同、物体几何不同、遮挡不同、初始姿态不同、任务表达不同。靠少量真实实验无法系统覆盖这些变化。大规模、多样化、可复现的开放环境,可能是训练和评测通用机器人策略的必要条件。
2. LDA-1B:异构具身数据的规模化摄取
LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion则从数据摄取和模型规模上给出另一个方向。
这篇论文提出 1B 参数级别的 Latent Dynamics Action Model,并构建 EI-30k,一个包含超过 3 万小时人类和机器人轨迹的 embodied interaction dataset。它的目标不是只做行为克隆,而是联合学习 dynamics、policy 和 visual forecasting。
这非常关键。传统行为克隆倾向于筛选高质量专家数据,因为次优轨迹可能伤害动作学习。但对于 dynamics learning 和 world modeling 来说,失败、探索、低质量轨迹也有价值,因为它们包含“动作如何改变世界”的信息。
如果一个模型能从异构数据中区分不同数据质量的角色:高质量示范用于策略学习,普通交互用于动力学建模,失败轨迹用于边界学习,那么机器人数据利用效率会显著提升。
这也是为什么 world model 与 foundation model 结合后,会改变机器人数据范式:数据不再只是“正确动作标签”,也是关于物理世界的观察样本。
五、Manipulation 与触觉:大模型绕不开物理接触
RSS 2026 的 manipulation 论文数量很大,且从第一组开始就出现了双臂操作、人类视频迁移、语义接触场、视觉触觉策略、人到机器人策略迁移、大行为模型共训练等方向。
这说明一个事实:具身智能并没有因为大模型出现而绕开传统机器人难题。相反,大模型路线正在重新进入最硬的机器人问题:接触、摩擦、形变、遮挡、力控、误差累积。
例如,Contact-Grounded Policy、TactAlign、TACTIC、ViTacFormer、Force Policy、Contact-Anchored Policies、HydroShear 等工作都表明,触觉和接触建模仍然是高可靠操作的关键。
视觉语言模型可以提供任务语义,world model 可以预测未来趋势,但当机器人真正接触物体时,局部力学信息仍然不可替代。尤其在插入、抓取、布料、软体物体、接触丰富装配等任务中,仅靠 RGB 视觉往往不足以判断是否滑动、是否卡住、是否接触稳定。
因此,一个更现实的具身智能系统很可能不是单一大模型端到端解决所有问题,而是由多种信号共同构成:
视觉语言模型负责理解任务和场景语义;
世界模型负责预测未来状态和动作后果;
触觉/力觉模型负责局部接触状态估计;
控制器负责稳定执行和安全约束;
在线学习模块负责从真实交互中持续修正。
这也是 RSS 2026 给出的一个重要提醒:机器人智能不是纯粹的多模态理解问题,而是多模态理解、物理预测、控制稳定性和真实交互数据共同构成的系统问题。
六、人形机器人:从 locomotion 走向 loco-manipulation
Humanoids session 也是 RSS 2026 的重点之一。论文覆盖滑板、跑酷、通用 humanoid loco-manipulation foundation model、generalist locomotion、raw-pixel locomotion、高动态控制等方向。
值得注意的是,人形机器人方向正在从“能走、能跑、能保持平衡”走向“在运动中完成操作”。例如 Ψ₀ 这类工作强调 universal humanoid loco-manipulation,HiWET 关注长时程 humanoid loco-manipulation,Now You See That 探索从 raw pixels 学习端到端 humanoid locomotion。
这与 world model 和 VLA 的趋势是相互呼应的。人形机器人如果只做 locomotion,本质上还是运动控制问题;如果要进入真实生活和工业场景,它必须同时具备:
对环境的语义理解;
对物体动力学的预测;
对全身运动和操作的协调;
对失败和扰动的恢复能力;
对长时程任务目标的保持能力。
这意味着 humanoid 不会只是更复杂的机械结构,它会倒逼具身智能模型处理更复杂的状态空间、更强的动态耦合和更长的任务链条。
七、我的技术判断:RSS 2026 的关键词不是“大”,而是“闭环”
如果只看表面关键词,RSS 2026 当然有很多“大模型”色彩:VLA、foundation model、1B 参数、large-scale dataset、open ecosystem。但更值得关注的不是模型继续变大,而是具身智能开始补齐闭环。
我认为可以总结为五个技术趋势。
1. World model 会成为机器人基础模型的核心组件
VLA 解决的是“根据当前输入输出动作”的问题,而 world model 解决的是“动作会如何改变未来”的问题。后者对于长时程任务、规划、失败恢复、策略改进都更关键。
未来的机器人基础模型,很可能不会只是 VLA,而是 VLA + world model + value/reward model + memory 的组合系统。
2. 机器人学习会从 offline imitation 走向 online improvement
RSS 2026 多篇论文都在强调自我改进、真实经验、在线纠正、hindsight relabeling、reinforcement fine-tuning。这说明仅靠离线数据训练一个固定策略已经不够。
真实部署中的失败轨迹和人类纠正,将成为非常重要的数据资产。
3. Cross-embodiment 是通用机器人的必要条件
如果一个模型只能服务一种机械臂或一种夹爪,它很难成为真正的基础模型。X-DiffVLA、DexGrasp-Zero、RIO、LDA-1B 等方向都在尝试处理不同机器人本体之间的迁移。
这背后需要统一动作表示、形态条件建模、数据格式标准化和可迁移控制接口。
4. 数据生态和评测基础设施会决定进展速度
MolmoSpaces、RoboLab、LIBERO-X、RoboVista、OopsieVerse 等工作说明,具身智能已经进入“评测基础设施竞争”阶段。
没有大规模、多样化、可复现、与真实世界相关性强的 benchmark,模型能力就很难被准确度量,也很难稳定迭代。
5. 物理可靠性仍然是最终门槛
无论模型多大,机器人最终要和真实世界接触。接触、摩擦、形变、遮挡、力反馈、安全约束、硬件限制,仍然决定了系统能不能落地。
因此,未来有竞争力的具身智能系统,应该不是纯神经网络端到端替代一切,而是把 foundation model、world model、触觉感知、控制理论、仿真和真实交互数据整合起来。
结语
RSS 2026 给出的信号很明确:具身智能正在从“模型能否听懂指令并输出动作”进入“模型能否理解物理后果并持续自我改进”的阶段。
VLA 仍然重要,但它不再是全部。世界模型、记忆、价值评估、在线学习、仿真生态、跨本体迁移、触觉接触和人形全身控制,正在共同构成下一代机器人基础模型的技术栈。
如果说过去几年机器人学习的核心问题是“如何从数据中学动作”,那么 RSS 2026 展示的新问题是:
机器人如何建立一个可用于行动、评估和自我改进的内部世界?
这可能会成为未来几年具身智能最关键的技术主线。
参考资料
RSS 2026 Accepted Papers: https://roboticsconference.org/program/papers/
Self-Improving Robot Policy with Compositional World Model: https://roboticsconference.org/program/papers/12/
HAIC: Humanoid Agile Object Interaction Control via Dynamics-Aware World Model: https://roboticsconference.org/program/papers/13/
Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Model: https://roboticsconference.org/program/papers/14/
Act2Goal: From World Model To General Goal-conditioned Policy: https://roboticsconference.org/program/papers/15/
Causal World Modeling for Robot Control: https://roboticsconference.org/program/papers/16/
Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation: https://roboticsconference.org/program/papers/17/
Interactive World Simulator for Robot Policy Training and Evaluation: https://roboticsconference.org/program/papers/18/
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models: https://roboticsconference.org/program/papers/81/
BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation: https://roboticsconference.org/program/papers/83/
π*₀.₆: a VLA That Learns From Experience: https://roboticsconference.org/program/papers/87/
MolmoSpaces: Large-Scale Open Ecosystem for Robot Manipulation and Navigation: https://roboticsconference.org/program/papers/91/
LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion: https://roboticsconference.org/program/papers/210/
Mbot具身智能实验室
让尖端科技触手可及,人人皆可探索未来
![]()
Mbot基础交流群等你加入,下方扫码联系
![]()
具身-杰西
Mbot具身-小助手
![]()
![]()
Mbot-视频号
Mbot-公众号
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.