EAI Awesome Work | 世界模型反攻,VLA 攻防战开启
如果说前几周大家在吵 VLA 该用扩散还是自回归、动作 token 该离散还是连续,那么本周 arXiv cs.RO 给出的答案是另一个维度的:**世界模型(World Model)开始从"预测未来的玩具"变成"接管机器人大脑的正规军"**。
本周最重的两发炮弹都来自这里:昆仑万维黎曼动力用 20 万+ 小时交互数据训出的全因果 World Action Model(Riemann-1.0),把 LIBERO 刷到 **99.0%**;普林斯顿把动作条件视频模型做成"跨具身零样本物理模拟器"(CLAP),并全套开源。
而另一个值得警惕的信号是:VLA 安全从"论文里的感慨"变成了"有基准的攻击任务"。中山大学团队正式定义了一种叫"配置化失败诱捕"的后门攻击——不只要让机器人失败,还要让机器人按指定姿势失败。攻防双方同时出手,本周看点拉满。
本周精选19 篇论文,按五条主线拆解:世界模型反攻、VLA 安全攻防、VLA 效率新范式、人形机器人长跑、机器人的记忆。这不是新闻简报,而是对"机器人正在往哪里走"的一次认真回答。
World Models:视频预测正式上岗当"物理引擎"
世界模型方向的密度本周达到峰值:WAM(世界动作模型)概念落地、跨具身视频模型开源、长时程自回归世界模型成型,再加上程序化 4D 世界合成——一条"数据 → 模型 → 仿真器 → 策略"的完整产业逻辑已经闭环。
Riemann-1.0:20 万小时交互数据训出的"世界动作模型"
https://arxiv.org/abs/2608.27033
昆仑万维·黎曼动力 | Haofeng Sun, Jiangbo Pei, Fei Kang 等
一句话:把机器人的动作和世界的演化放进同一个自回归序列里,一个模型既当策略、又当模拟器。
摘要翻译:
我们提出 Riemann-1.0,一个用于具身智能的全因果自回归世界动作模型(World Action Model)。它在统一的因果序列中联合建模多视角视觉观测、机器人状态与具身专属动作,把"机器人动作"和"世界演化"表示成因果状态转移。
与现有基于联合生成、视频优先预测或解耦建模范式的 WAM 不同,Riemann-1.0 把在线策略执行和动作条件世界模拟统一进同一个模型——它既能作为可执行的机器人策略,也能作为多具身视觉世界模拟器。为了在异构数据源上规模化具身经验,论文提出渐进式具身预训练框架,在共享的"世界动作建模"目标下统一学习第一人称人类视频、手持夹具演示和异构机器人轨迹。基于20 万+ 小时交互数据,Riemann-1.0 把大规模具身经验逐步迁移为可执行的机器人操作能力。
结果/亮点:
基准
结果
RoboTwin2.0
成功率94.3%
LIBERO
成功率99.0%
RoboCasa-365(长程组合)
62.6%,比此前最优高 8.4%
真实世界长程操作
SR85.0%/ PSR94.4%,SR 比最强开源基线高 15%
️研发团队:昆仑万维旗下机器人公司黎曼动力(Riemann Dynamics)
代码/项目页:未公开(模型权重未发布)
![]()
CLAP:把视频世界模型做成"跨具身零样本物理模拟器"
https://arxiv.org/abs/2608.27406
普林斯顿大学 | Kechen Liu, Ola Shorinwa
一句话:物理规律不分本体——用一套模型看人类和所有机器人干活,然后让它在没见过的机器人上直接当模拟器用。
摘要翻译:
最先进的动作条件视频模型通常被限制在单一机器人本体上,无法利用海量异构视频数据中的通用物理信号。为此我们提出CLAP,一个跨具身(cross-embodiment)动作条件视频生成框架,可在包含人类和多种机器人的互联网规模异构视频上训练。
核心洞察是:物理规律是普适的,不取决于"谁在动"。但跨具身学习并不容易——不同机器人平台的动作表示差异巨大,且人类视频里根本没有动作标注。CLAP 用三个手段解决:用末端执行器位姿 + 语言指令 + 潜在动作统一差异巨大的动作空间;再通过课程式跨具身学习,先在无标注视频上借助潜在动作学物理先验,再把先验"锚定"到末端执行器动作空间,实现真实任务零样本部署。在 DROID 等挑战性环境上,CLAP 达到或超越了单具身视频世界模型的 SOTA,少样本自适应后优势进一步放大。
结果/亮点:
覆盖 DROID、Bridge、双臂 YAM 机器人、G1 人形机器人等形态
支持端执行器 / 语言 / 潜在动作三种条件空间
全套代码与模型开源,这是目前最全的动作条件视频世界模型套件
️研发团队:普林斯顿大学
代码/项目页:https://omni-clap.github.io · https://github.com/omni-CLAP/clap
![]()
WALL-SS:逐尺度自回归,让世界模型"能跑一分钟"
https://arxiv.org/abs/2608.26239
机构未披露 | Maeve Zhang, Rain Sun, Xiang Wang 等 25 人
一句话:未来画面按"低清→高清"逐尺度地预测出来,配合压缩记忆和在线策略对齐,让世界模型在有限显存里滚出分钟级连贯视频。
摘要翻译:
生成式世界模型为机器人提供"世界在交互下如何演化"的预测能力,在仿真、规划、策略评估和机器人学习中潜力巨大。但仅做片段级未来预测是不够的——一个统一的生成式公式应该把动作与后果关联起来、支持灵活的时间跨度和持续交互、并允许基于奖励的优化。
我们提出WALL-SS,通过逐尺度自回归(Scale-wise autoregressive Scaling)生成视觉未来,实现动作可控、长时程的机器人仿真。WALL-SS 把具身轨迹表示为观测与动作时间交织的因果序列,使动作依赖的状态转移显式化,同时天然支持变长生成、通过可复用因果状态的流式扩展,以及基于序列概率的直接优化。为了让长时程有效,每个未来观测都以"粗到细"方式生成,并在同一层级中配合三个组件:动作条件下一尺度预测(注入尺度对齐的动作表示,同时建模成功与失败行为)、尺度压缩长时程记忆(近期交互保持高分辨率,远期观测动作压缩存储,尺度级 dream forcing 提升对自生成上下文的鲁棒性)、以及在线策略对齐(用动作跟随与长期一致性奖励优化自回归视觉动态,同时保持预训练视觉分布)。
结果/亮点:
改善动作跟随与轨迹精度
在有界显存下支持连贯的分钟级流式 rollout
在线策略对齐持续减少动作漂移与长时程不一致
️研发团队:机构未披露(团队规模大、风格接近大厂研究组)
代码/项目页:未公开
![]()
4DSynth:让"世界"可以被一句话生成、可编辑、可复现
https://arxiv.org/abs/2608.26947
机构未披露 | Zehao Qi, Haochen Luo, Jia-Wang Bian, Zeyu Ma, Shuyun Sun
一句话:用自然语言/蓝图/一张照片就能生成带物理、带动画角色的可编辑 4D 环境,顺带做出了一个难倒两个 VLM 的导航基准。
具身智能体需要视觉多样、可物理交互、随时间变化的环境。4DSynth 把自然语言描述、蓝图掩码或单张照片变成可编辑的 4D 环境——含显式几何、动画角色、无碰撞轨迹和物理仿真状态;多条生成路线共享同一种几何表达,因此动画、相机规划、渲染、任务生成走同一套流程。配套基准4DSynth-Nav完全由程序化场景生成,三个难度等级上两个 VLM 均大面积失败——这恰恰是卖点:每个失败都可复现,每个难度轴都可独立调节,可当标准压力测试。
️研发团队:机构未披露
代码/项目页:未公开
![]()
世界模型板块小结
世界模型的叙事线很清楚:CLAP 负责"从哪里学"(跨具身互联网视频)、Riemann-1.0 负责"学到哪去"(直接变成可执行策略 + 模拟器)、WALL-SS 负责"能滚多远"(分钟级长时程)、4DSynth 负责"训练场从哪来"(程序化可控仿真)。当这四块拼图凑齐,机器人训练就不再依赖昂贵的真实数据采集——这是本周最重要的一条产业逻辑。值得注意的是,头部玩家(黎曼动力)的模型权重与数据仍未开源,社区世界模型(CLAP)则用全开源来对冲——生态位之争已经开始。
️ VLA Safety:从"会不会失败"到"怎么被攻击"
本周安全方向的论文有一个共同特点:不再停留在"提出一个更稳的策略",而是把失败、攻击、恢复当成一类需要专门研究的问题。攻击者拿到了新基准,防御者也拿出了新框架。
TrapVLA:让 VLA"按指定姿势失败"的后门攻击
https://arxiv.org/abs/2608.26578
中山大学(郑伟诗团队)等 | Jun-Hui Liu, Kun-Yu Lin, Yi-Lin Wei 等
一句话:传统后门攻击只要机器人任务失败就算成功;TrapVLA 要求攻击者精确控制"怎么失败"——比如让机器人带着固定的位置偏差去抓取。
摘要翻译:
本文定义了针对 VLA 模型的新型后门攻击任务——配置化失败诱捕(Configured Failure Trapping):通过隐蔽的文本触发器激活攻击,诱导机器人进入配置好的失败模式。与以往把"任意任务失败"当作攻击成功的后门不同,配置化失败诱捕要求攻击者控制机器人以指定方式失败(例如以特定的位置偏移完成抓取),挑战显著更大、也更难被检测。
为此,论文提出高效的数据引擎合成高质量目标轨迹,并构建自动化套件测量"配置化失败保真度";在此基础上构造了Trap-LIBERO和Trap-RoboTwin两个基准,覆盖四种代表性失败模式。针对任务中"稀疏动作偏差"这一关键难点,作者提出TrapVLA方法,显式学习触发器诱导的动作残差,把策略引向配置化失败行为。在仿真基准与真实机器人上的大量实验表明:TrapVLA 能把配置化失败模式有效注入 VLA 模型,同时基本保持干净数据上的原有性能。
结果/亮点:
新任务 + 新基准:Trap-LIBERO / Trap-RoboTwin,覆盖 4 种失败模式
攻击保持"隐蔽性":干净数据性能基本不掉
首次把 VLA 后门攻击从"让任务失败"升级到"控制失败方式"
️研发团队:中山大学 HCP 实验室(郑伟诗团队)等
代码/项目页:https://john-liua.github.io/TrapVLA
![]()
FLARE:给 VLA 装上"重试"和"复位"两套保险丝
https://arxiv.org/abs/2608.26645
中山大学 & 腾讯 | Ganlong Zhao, Zijia Tang, Xingping Chen, Zhanghui Kuang, Ye Tian, Guanbin Li
一句话:VLA 学不会"从错误里爬出来",那就别让它只吃完美数据——在训练里注入扰动让它学会重试,再配一个能看懂失败的"复位"技能库。
VLA 在长程操作上潜力巨大,但训练数据是"单调、无失败"的完美示范,导致它们对抓空、掉物、意外碰撞这类常见执行错误毫无恢复能力。FLARE 用"Retry + Reset"双机制解决:Retry 层面,在示范中注入扰动和桥接片段,把机器人姿态与环境状态解耦,让策略学会自主处理执行偏差;Reset 层面,用 MLLM 离线分析执行视频、自动识别分布外(OOD)失败状态,针对性采集少量"以物体为中心"的 Reset 技能,把环境恢复到任务合法状态。推理时由在线 MLLM 监控器仲裁"继续干"还是"先复位"。
️研发团队:中山大学 & 腾讯(CVPR 2026)
代码/项目页:未公开
![]()
Arrive and Survive:用对比学习给强化学习"做减法"
https://arxiv.org/abs/2608.26571(跨学科投稿)
机构未披露 | 作者详见论文页
一句话:与其让安全目标在奖励函数里被稀疏信号淹没,不如显式学一个"安全对比修正",告诉策略"做得像危险状态"的那部分该往哪躲。
该工作提出 Safe-CRL(安全对比强化学习)范式,把安全规范转成对比式的修正信号,叠加到标准 RL 目标上,在保留任务性能的同时显著降低安全违规。从摘要看亮点在方法论层面:安全修正不依赖显式安全代价模型,而是通过正负样本对比学习隐式安全边界——这是"安全 RL 工程化"的一个轻量选项。
️研发团队:机构未披露
代码/项目页:代码开源(见论文页)
安全板块小结
攻击者(TrapVLA)把 VLA 安全从"玄学担忧"变成"可测基准",防御者(FLARE)把恢复能力从"调 prompt"变成"结构化训练范式"。两者叠加的信号是:VLA 大规模上真机之前,"失败"本身必须先被当成一等公民研究。下周值得关注:这类攻击任务会不会被引入人形机器人本体、形成行业级安全评测。
⚡ VLA 新范式:更快、更小、更会"看历史"
本周 VLA 方向没有堆参数,反而在三个维度上"做减法/做工程":推理速度(FlashVLA)、参数规模(PredVLA)、历史信息利用(TemporalFlow-VLA)。这说明 VLA 竞争已从"榜单刷分"进入"能不能真机上跑得动"的阶段。
TemporalFlow-VLA:给 VLA 补上"物理接地"的执行历史
https://arxiv.org/abs/2608.26821
机构未披露 | Jiarui Yang, Yehao Lu, Yuning Su 等
一句话:多阶段任务里"长得一样的画面可能要干不同的事",所以给模型喂一段物理接地的时间流当记忆——效果是 LIBERO 平均成功率 97.63%。
VLA 靠预训练视觉-语言表征干活,但只堆历史帧并不能捕捉近期的物理变化——多阶段操作中,视觉相似的状态可能因先前的执行情况而需要不同动作。TemporalFlow-VLA 用物理接地的时间监督学习紧凑执行历史:利用记录的机器人状态、机器人几何和标定相机,构造"机器人-表面时间流"作为训练目标,监督两个执行对齐的时间查询,为动作专家提供结构化历史;部署时无需显式运动估计或几何处理。配合异步特征缓存,时间条件机制不增加额外历史编码开销,保持单帧级采样延迟。
结果/亮点:
基准
结果
LIBERO 平均
97.63 ± 0.26%
LIBERO Long
96.60 ± 0.87%
RoboTwin(12 任务)
Clean85.5%/ Randomized84.2%
️研发团队:机构未披露(作者阵容似国内团队)
代码/项目页:未公开
![]()
FlashVLA:流式动作解码,单卡跑出 30Hz
https://arxiv.org/abs/2608.27384
MIT(Zhijian Liu 团队)| Zekai Li, Jiaming Tang, Zhijian Liu
一句话:把动作解码从"一次生成一整段"改成"流式逐块吐出",配合逐块因果注意力,单张 GPU 上控制频率突破 30Hz。
VLA 部署最大的现实障碍是高推理延迟和异步执行不稳定——尤其基于流匹配的 VLA,动作解码需要在 VLM 上下文下迭代多步。现有方案要么提升控制频率、要么减少执行空闲,但很难同时做到"低延迟 + 时间一致的异步执行"。FlashVLA 维护一个含多噪声层级块的流式动作缓冲区,用逐块因果注意力解码,每个推理步吐出一个可执行动作块;逐块自回归公式隐式保持动作连续性,无需额外未来状态条件即可平滑异步执行。单 GPU 控制频率 ≥30Hz,且在真实场景部署中实现平滑异步推理。
️研发团队:MIT(Zhijian Liu 团队)
代码/项目页:https://github.com/z-lab/flashvla
![]()
PredVLA:68 万参数,靠"预测编码"硬刚大模型
https://arxiv.org/abs/2608.26673
Sony(推测)| Hiroki Sawada, Shunichi Kasahara
一句话:不做大数据预训练、不用大参数,只靠"预测自己的下一帧特征+本体感觉"的循环架构,68 万参数在 LIBERO 上打到了 86.9%。
大参数 VLA 主导榜单,但没人回答:语言条件控制到底需要多大模型?小参数预算下换一套架构行不行?PredVLA 给出一个激进答案——仅68 万可训练参数、无需机器人数据预训练的语言条件预测编码策略。其分层生成式循环动力学预测视觉特征和本体感受,观测只通过感知预测误差的在线推理影响潜在状态——这带来一个附加福利:禁用该推理即得到精确的开环控制条件,观测驱动的校正贡献可被直接量化。
结果/亮点:
LIBERO 三套短时程套件平均 **86.9%**(含长时程 **75.4%**)
相同冻结前端/数据/解码器下,是参数匹配 Transformer 策略的3.7 倍、LSTM 的7.4 倍
️研发团队:Sony(推测,作者背景与 Sony CSL 吻合)
代码/项目页:未公开
![]()
VLA 新范式板块小结
三条线索其实指向同一件事:**"大模型 + 全模仿学习"不是唯一路线**。PredVLA 证明小模型+生成式架构仍有生存空间,FlashVLA 解决"大模型如何跑得快",TemporalFlow-VLA 解决"历史信息如何被物理接地地利用"。结合上周的 StableVLA、ActionTokenizer 等信号,VLA 正在从"堆数据刷榜"转向"工程化落地",这对真机部署是实打实的利好。
人形机器人与移动:1.5 公里的里程碑
本周人形/移动方向最硬的成果是 SOLO:仅用胸部深度相机 + 本体感觉,零样本走出 1.5 公里户外路线——这可能是感知人形移动长时程稳定性的一次里程碑式验证。其余两篇分别代表"低成本开源"和"实时性"两个方向。
SOLO:胸部一个相机,零样本走完 1.5 公里户外
https://arxiv.org/abs/2608.26583
中国科学技术大学(张强团队)等 | Pihai Sun, Gang Han, Jingkai Sun 等
一句话:人形机器人走远路会"越走越虚",根源是地形重建把关键细节磨平了 + 模仿学习不会算时间账——SOLO 两个都治。
人类能在复杂地形上长时间行走不失衡,但感知人形策略会因感知误差与控制误差累积而变得脆弱。SOLO 同时处理两个叠加的致因:其一,密集地形重建会平滑掉对动作至关重要的细节——为此 Query Reconstructor(QR)用傅里叶编码的单元查询,从深度-本体感觉 token 中检索空间证据,保住锐利地形边界;其二,逐点模仿缺乏时间信用分配——Trajectory-Aware MSE(TA-MSE)蒸馏把"下一状态师生不一致"加进 PPO 奖励,让 GAE 把未来的不一致惩罚传播到先前动作。
结果/亮点:
指标
SOLO
密集重建变体
压力测试地形平均穿越
97.5%
75.0–75.6%
踏脚石(stepping-stone)
96%
0–3%
高度图 L1 误差
降低3.3–4.0 倍
真实部署:仅胸部深度相机 + 本体感觉,零样本完成连续1.5 公里户外路线 + 室内混合地形路线
️研发团队:中国科学技术大学(张强组)等
代码/项目页:https://sunpihai-up.github.io/solo
![]()
Poppy Humanoid:给开源低价双足机器人补上"能走路"这一课
https://arxiv.org/abs/2608.26505
雪城大学(Syracuse)| Xulin Chen, Borui He, Zhenyu Gan, Garrett E. Katz 等
一句话:Poppy 是个便宜的开源双足机器人,但一直没人让它站得住走得起——这次用 LQR + 从开环数据学出来的代价函数把闭环走行打通了。
Poppy Humanoid 是用于 AI 研究与教育的开源低成本机器人,但此前没有已发表方法能在标准 Poppy 硬件上实现可靠的无辅助双足行走。本文提供一个功能性闭环行走控制器:基于 LQR 框架做轨迹跟踪,并从开环播放名义行走轨迹时收集的数据中学习 LQR 的二次代价函数,显著提升运动可靠性。闭环控制器相对开环播放有统计学显著的性能提升——看似"基础",实则是社区低成本硬件生态里一块重要拼图。
️研发团队:雪城大学(Zhenyu Gan 组)
代码/项目页:未公开
![]()
RTNav:目标导航的"实时性"终于被当成一等公民
https://arxiv.org/abs/2608.26496
杜克大学(Boyuan Chen 团队)| Easop Lee, Lingyu Zhang, Boyuan Chen
一句话:之前大家都在同步模拟器里测导航,推理时间默认是零;真按墙钟时间算,SOTA 方法集体拉胯——RTNav 把延迟和异步步进写进架构里。
在未知环境找未见过的物体,因视觉-语言基础模型而越来越可行,但这些模型推理延迟不可忽略。现有 SOTA 大多在同步模拟器里开发(环境等智能体,推理时间近乎为零),智能体被设计成"感知→推理→行动"串行执行,几乎不考虑时间约束。RTNav 把推理延迟、异步环境步进、有限计算预算作为显式设计考量:在 HM3D-v1/v2/OVON 的实时变体上,成功率最高提升 **11%**,SPL 最高提升5.1 个点。
️研发团队:杜克大学(Boyuan Chen 团队)
代码/项目页:未公开
![]()
人形与移动板块小结
SOLO 的 1.5 公里是"感知-运动长时程稳定性"的信号弹:当单次任务从"走几步"变成"走一公里",地形重建的细节保留和时间信用分配就成了新的分水岭。Poppy 提醒我们生态里还有大量"买得起但走不起来"的低成本硬件等待算法填坑;RTNav 则把话挑明——真实世界的时钟不走模拟器的时间。人形机器人的竞争,正在从"demo 有多炫"转向"能连续跑多久、跑多稳"。
机器人记忆:持续学习的关键在"锚点"
本周有一个被低估的概念型工作——Shuran Song 组在"持续学习"这个老问题上给出了新视角:回放缓冲区里的经验不是同等重要的,少数"记忆锚点"撑起了大部分旧任务性能。
Memory Anchors:回放数据里的"锚点",删掉 10% 遗忘暴涨 4.5 倍
https://arxiv.org/abs/2608.26545
哥伦比亚大学(Shuran Song 团队)| Maximilian Du, Zhanyi Sun, Chen Xu, Paarth Shah, Masha Itkina, Shuran Song
一句话:不是所有旧数据都值得回放——只有"新旧任务表示坍缩到一起但动作互相冲突"的那些经验,才是守护旧技能的定海神针。
部署在真实世界的机器人应该能持续学新任务而不遗忘旧技能。主流做法是用旧数据回放缓冲对抗灾难性遗忘,且通常从全部旧经验中随机采样——但本工作发现:只有一小部分经验在"锚定"旧表现上起着决定性作用,它们位于"新任务观测表示坍缩到旧任务观测表示"的区域,尽管两个任务要求冲突的动作(例如熟悉的物体要用新方式操作)。回放这些区域的旧数据,能防止旧任务知识被破坏性覆盖。仅从缓冲中排除 10% 的记忆锚点,LIBERO 上的灾难性遗忘就增加 4.5 倍以上;反过来,用锚点富集缓冲可使高冲突任务遗忘降低 **63%**,并在真实机器人上成功实现两个任务序列的持续学习。
️研发团队:哥伦比亚大学(Shuran Song 团队)
代码/项目页:https://robot-adaptation.github.io/MemoryAnchors
GRAFT:精细操作里的"在线打补丁",成功率高 25 个百分点
https://arxiv.org/abs/2608.27079
中国科学技术大学等 | Ronald X Xu, Mingzhai Sun, Xiang Yu 等
一句话:真实机器人上手就翻车的 VLA,先用离线数据"接好地",再在真机上做接地强化微调——细小动作学得又快又稳。
GRAFT 面向生物医学级精细操作,提出"接地 + 在线强化适应"两段式:先让预训练 VLA 与真实平台对齐(接地),再通过小规模在线 RL 适应任务细节。实验显示成功率相对直接部署提升25 个百分点,且样本效率显著优于从头微调。它和 Memory Anchors 一起指向同一个趋势:真机上的"最后一公里"正在成为研究主战场。
️研发团队:中国科学技术大学等
代码/项目页:未公开
![]()
记忆板块小结
Memory Anchors 的贡献不在于又刷了一个 LIBERO 分,而在于揭示了回放数据的"非均匀价值"——这直接关系到机器人如何低成本地持续学习。GRAFT 则代表"真机小样本适应"这一务实路线。两者相加的判断是:当模型能力见顶后,数据组织和在线适应的工程价值会超过架构创新本身。
其他值得关注
机器人在线学杂耍(https://arxiv.org/abs/2608.26800,CMU Atkeson 组 等):双臂多指手 + 机载视觉,5 分钟内在真实硬件上学会并组合 5 种三球杂耍(cascade/tennis/half-shower/shower/box)。核心哲学:"学习应该建立在现有知识之上,而不是替代它"——即便模型远非真实也极其有用,正则化记忆学习 + 互可达集保证安全在线练习。动态操控在线学习的一个漂亮 demo。
具身场景重排规划(https://arxiv.org/abs/2608.27371):提出 ESRP-Bench(5400+ OmniGibson 场景),把场景重排从"目标导向"推进到"规划生成"统一框架。
MeshPriorDiT(https://arxiv.org/abs/2608.26766):GNN + Diffusion Transformer 分层建模布料动力学,动作条件下布料仿真精度与泛化俱佳。
STEP(https://arxiv.org/abs/2608.27225):多模态 LLM 做状态感知的任务估计与规划,人机协作场景行动可执行性提升 32.8%。
Pass the Bucket(https://arxiv.org/abs/2608.27085):异构机器人团队的负载均衡,动态任务分配的理论与实证结合。
本周趋势全景 3 大趋势
世界模型产业化 安全攻防基准化 真机效率竞赛
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│ Riemann-1.0 20万小时│ │ TrapVLA 新攻击任务 │ │ FlashVLA 30Hz │
│ CLAP 跨具身开源 │ + │ FLARE Retry/Reset│ + │ PredVLA 0.68M │
│ WALL-SS 分钟级 │ │ Arrive&Survive │ │ TemporalFlow 97.6%│
└──────────────────┘ └──────────────────┘ └──────────────────┘
世界模型进入"产业化"阶段。Riemann-1.0 用 20 万小时数据直接当策略 + 模拟器,CLAP 用互联网视频跨具身学物理,WALL-SS 解决长时程滚动——"世界模型 + WAM"正在形成自己的技术栈。接下来 1-2 个季度,谁能把世界模型滚到"小时级连续仿真",谁就握住了数据飞轮的钥匙。
VLA 安全从议题变成基准。TrapVLA 定义"配置化失败诱捕"并给出 Trap-LIBERO/Trap-RoboTwin,攻击由"玄学"变"可评测";FLARE 则给出"Retry/Reset"的恢复训练范式。攻防同时基准化,是安全方向走向成熟的标志——预计很快会有"VLA 安全评测联盟"式的社区行动。
**竞争焦点从"刷榜"转向"真机效率"**。PredVLA(0.68M 参数)、FlashVLA(单卡 30Hz)、RTNav(实时导航)、SOLO(1.5km 零样本)——四篇论文不约而同地把"真实时间/真实硬件/真实里程"作为第一度量。行业对"能不能跑得动"的焦虑,正在把研究方法论推向工程化。
值得关注的团队
昆仑万维·黎曼动力:Riemann-1.0 的 99.0% LIBERO 与 20 万小时数据,表明国内具身公司已具备"数据 + 模型"一体化的重资产打法,但不开源的策略值得后续观察。
普林斯顿(Liu/Shorinwa):CLAP 全开源 + 跨具身视角,是社区世界模型路线的重要旗手。
中山大学 HCP(郑伟诗团队):本周一手安全攻击(TrapVLA)、一手安全防御(FLARE),攻防通吃的信号很强。
中科大(张强团队):SOLO 的 1.5km 户外是感知人形移动的硬核进展,持续追踪其代码开源节奏。
哥伦比亚大学(Shuran Song 团队):Memory Anchors 延续了其"用数据的视角解决机器人学习"的一贯风格,概念质量高。
反向观察
代码/模型开源率依然偏低:19 篇论文中明确开源(CLAP、FlashVLA、Memory Anchors、Arrive and Survive 等)的不足半数,且三篇最重磅的(Riemann-1.0、SOLO、TrapVLA)均未给出代码仓库——"论文先发、代码后补"在具身领域仍是常态。
摘要里的"平均成功率"越来越卷:当 LIBERO 被刷到 97-99%,基准本身的信息量在快速衰减;读者应更多关注长时程、真实硬件、分布外等细分指标(如 SOLO 的 1.5km、PredVLA 的开环对照、TrapVLA 的干净数据保持度)。
机构披露透明度:多篇论文(WALL-SS、TemporalFlow-VLA、4DSynth 等)在 papers.cool 等索引页未列出作者机构,学术信用体系的元数据建设仍需改进。
本文基于 2026-08-28 arXiv cs.RO/new 页面抓取 + 论文详情页自主研读编译。数据来源:arxiv.org、papers.cool、humanoid.press。
Mbot具身智能实验室
让尖端科技触手可及,人人皆可探索未来
![]()
Mbot基础交流群等你加入,下方扫码联系
具身-杰西
Mbot具身-小助手
Mbot-视频号
Mbot-公众号
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.