EAI Awesome Work | 规模与效率的正面对撞
本周的 arXiv 传递出一组很有意思的"互相拆台"的信号:一边,有人把双臂家务操作的数据堆到了1,500 小时并宣布开源;另一边,有人用0.54M 参数的迷你策略在 LIBERO 上打到 95.1%,顺手拆穿了主流 VLA 在这个基准上的"含金量";而当你打算用 VLM 当裁判来评机器人做得对不对时,FailBench 告诉我们——**最好的 VLM 裁判,平均只有 0.77 的正确率,而且它总是倾向于说"成功"**。
规模、效率与评测三条线同时进入"被重新审视"阶段。本周我们精选14 篇核心工作,按世界模型、数据路线之争、全身移动操作、评测与鲁棒性四个方向拆解。这不是一篇新闻简报,而是一次对"这个领域正被什么驱动"的认真回答。
本周速览(1 分钟版)
世界模型从"预测未来"升级为 VLA 后训练的调度中枢(WISE 省 80% GPU),同时有人在认真提醒你:别用开环 rollout 分数自嗨。
⚖️ 三条数据路线正面对撞:1,500 小时双臂演示(PKU) vs0.54M 参数小策略(U Tokyo) vs一条演示换 16 个物体(Stanford)。
全身移动操作(loco-manipulation)密集爆发:无传感器的接触力感知(FWBC-VLA)、文本驱动的全身控制(ADAPT)、形态-控制协同设计的开源人形(BRIDGE)。
评测圈大地震:VLM 裁判不可靠(FailBench)、模态纠缠让 VLA 变脆(EGR)、新的评估范式开始转向"质量偏好"(R2S-Eval)。
World Models:从"预测未来"到"调度一切"
世界模型本周不再只是"预测下一帧"的工具,它同时被用来调度 VLA 后训练、做目标规划、给中间特征当监督信号——而一篇受控实验则给这股热情泼了盆冷水。
WISE:给 VLA 后训练装上"想象调度器",GPU 省 80%
arXiv:https://arxiv.org/abs/2609.03681
Chenhao Zhang, Hanyu Zhao, Hang Cheng, Tengfei Pan, Long Zeng 等
一句话:VLA 的后训练不一定要靠真人数据或真机 RL——让世界模型"挑关键的时刻想象一下",成本降到全量想象的 1/5,效果反而更稳。
用世界模型做强化学习(想象 rollout 当奖励信号)并不新鲜,但 WISE 指出了此前方案的三个暗坑:不是所有状态下都值得想象、长 rollout 会累积误差、绝对预测值不能直接当监督。于是它只在交互相关的状态选择性调用世界模型,做有界多视角 rollout,用进度与完成信号评估候选未来,再以"相对结果"来精修动作——想象被"调度"到刀刃上。
指标
结果
GPU 计算时间 vs 全量想象
减少约 80%
基座模型
π₀ 与 π₀.5 双验证
真实世界分布偏移
鲁棒性与泛化显著提升
️研发团队:Chenhao Zhang / Long Zeng 团队(机构未在摘要页标注)
代码/项目页:未公开
![]()
GIFT:视觉特征很丰富,但对动作"不够用"
arXiv:https://arxiv.org/abs/2609.04193
Yupeng Zheng, Xiang Li, Ya-Qin Zhang, Shuicheng Yan, Dongbin Zhao 等 14 人 | 含清华 AIR(Ya-Qin Zhang)等
一句话:VLM/世界模型给了机器人一堆漂亮的视觉特征,但这些特征未必承载控制要用的信息——GIFT 用"几何 + 可供性 + 目标区域"三种结构把它们掰回正轨。
论文把这种错配命名为**"动作充分性鸿沟"(action-sufficiency gap):预训练特征对"看"很充分,对"干"很冗余。GIFT 的做法是在训练时用几何对齐、可供性预测、目标区域重建三种约束引导中间特征**,而且不改各模型自己的动作输出公式——所以它能同时插进 VLA、直接动作 WAM、逆动力学 WAM 三种模型。
基准(零样本)
GIFT-VLA
GIFT-WAM-Fast
GIFT-WAM-IDM
LIBERO-Plus
79.6%(+4.6)
72.6%(+12.6)
87.8%(+5.2)
RoboCasa
61.4%(+12.6)
83.6%(+9.0)
82.3%(+8.4)
️研发团队:含清华 AIR 张亚勤团队的多校联合
代码/项目页:摘要标注 Project page,URL 需在论文内查看
![]()
给机器人规划加"物理锚"的 JEPA 世界模型
arXiv:https://arxiv.org/abs/2609.03565
Muyuan Liu, Yue Huang, Zheng Liang, Xiang Gao | GENISOM AI(北京)
一句话:JEPA 系世界模型不重建像素、直接拿隐空间做规划,但隐变量容易"飘"——加一个逆动力学约束和物理状态对齐,规划成功率立刻上一个台阶。
面向视觉指定目标做规划时,纯隐空间预测不会主动保留"控制需要的信息"。这篇工作给行动条件 JEPA 世界模型补上两个模块:逆动力学(IDM)防止隐表征坍缩、让转移与动作挂钩;状态对齐(SA)把连续表征锚定到真实物理构型与运动上。转移子空间分析显示:基线模型 LeWorldModel 的转移能量集中在低维子空间,而本文模型的有效转移维度更高。
任务
成功率
TwoRoom
100%
PushT
98%
OGBench-Cube
87%
Reacher
与 LeWorldModel 相当
️研发团队:GENISOM AI(北京)
代码/项目页:未公开 | 已录用 IROS 2026 PWMS Workshop
![]()
一盆冷水:更好的"想象 rollout"不等于更好的控制
arXiv:https://arxiv.org/abs/2609.02811
Dharini Raghavan, Amritpal Singh
一句话:大家习惯用开环预测误差来评估世界模型——但机器人是闭环跑的。这篇受控实验告诉你:换个评估方式,结论可能整个翻过来。
研究在有偏里程计 + 间歇路标感知的路径跟踪任务中,横跨 24 种感知条件评测 6 种估计器,对比三种评估方式:轨迹重放、20 步无测量 rollout、闭环跟踪。结果相当反直觉——重放误差与闭环表现的相关性(ρ=0.923)反而比 rollout 误差(ρ=0.774)更强;用 rollout 指标会选错估计器的场景占 18/24,而用重放指标只有 5/24。
评估方式
与闭环表现的相关性
选错估计器的场景
轨迹重放
ρ = 0.923
5 / 24
20 步无测量 rollout
ρ = 0.774
18 / 24
结论很直接:评测预测模型必须同时声明预测时域与测量更新调度——否则你的世界模型分数可能在骗你。
️研发团队:作者机构未在摘要页标注
代码/项目页:论文附代码
世界模型板块小结
四篇文章拼出了世界模型本周的完整版图:WISE 用它训练(调度想象做后训练信号)、JEPA 用它规划(物理锚定避免隐空间漂移)、GIFT 用它监督(把预测式建模的特征掰向控制结构)、02811 则警告所有人别乱评估它。世界模型的角色正在从"演示品"变成 VLA 技术栈里的公共基础设施——但它的评测规范还没跟上。
⚖️ 数据的三个答案:1,500 小时、0.54M 参数与一条演示
本周最过瘾的对照实验不需要专门设计:三篇论文给出了关于"数据到底要多大规模"的三种截然不同的答案。
XR-2:开源 1,500 小时双臂家务数据 ,示范"演示 + 在线纠错"双扩展轴
arXiv:https://arxiv.org/abs/2609.03591
Jiafeng Xu, Qi Li, Yan Shen 等 10 人 | 含 Hao Dong(北京大学)团队
一句话:双臂家务操作是当前最难啃的数据荒地——这个团队直接开源了 1,500 小时演示数据,并系统验证了"加演示数据"和"用 DAgger 做在线纠错后训练"两个 scaling 轴都还没到顶。
双臂家庭操作被大规模高质量人类演示数据的稀缺卡了脖子。该工作放出1,500 小时覆盖日常家务的双臂操作演示语料,配合高吞吐数据管线与多阶段训练范式训练出双臂 VLA 模型XR-2。更重要的是两项受控的 scaling 研究:
Scaling 维度
发现
专家演示数据量 ↑
任务成功率稳步上升
真人在线干预的 DAgger 纠错数据后训练
成功率同样稳步上升
两条曲线在当前数据规模下都呈现一致的上升趋势——为"双臂家务数据仍值得继续加注"提供了实证。数据集承诺开源。
️研发团队:Jiafeng Xu 等(含北京大学 Hao Dong 团队)
代码/项目页:数据集承诺开源,仓库地址暂未公布
![]()
MINERVA:0.54M 参数打穿 LIBERO,顺手给 benchmark 做了一次"体检"
arXiv:https://arxiv.org/abs/2609.03715
Kohei Sendai, Tatsuya Matsushima, Yusuke Iwasawa | 东京大学
一句话:一个 0.54M 参数的策略在 LIBERO 上做到 95.1%,只比 π₀.5 低 2.4 分——参数少 7,700 倍。更要命的是:把任务 ID 换一下映射,成功率直接归零,说明这个基准考的主要是"记性"。
MINERVA(MINimal Efficient Robotic Vision-Action policy)是一组刻意压缩的视觉运动策略,用来给 LIBERO 基准测量"任务特定的容量下限"。
指标
MINERVA
参数量
0.54M(比 π₀.5 少 7,700 倍)
LIBERO 四套件平均成功率(2,000 次 rollout)
95.1%
与 π₀.5 差距
仅 -2.4 个百分点
性能饱和点 / 崩溃点
~1M 参数饱和,<0.25M 崩溃
笔记本 CPU 每块重规划
5–9 ms(比 SmolVLA 快 113 倍,比 π₀.5 快 1,400 倍)
三项杀伤力极强的诊断结论:① 在大量架构、训练与推理扫描中,只有动作块长度和视觉容量能稳定影响性能,其他折腾全是噪声(±1 个百分点内);②流匹配相比直接 L1 回归没有可检测优势,而回归在 GPU 上快 3.8 倍——对"必上 flow matching"的惯性信仰是一次公开处刑;③任务 ID 置换探针表明标准 LIBERO 的指令条件化主要是在"记忆任务之间做选择",换个 ID 映射成功率就崩到随机水平。
同样配方在 LIBERO-90 的 89 个任务上拿到 94.6%,但 LIBERO-Plus 扰动下掉到 46–56%,对光度变化的鲁棒性接近于零——数据量说明一切:它证明了 LIBERO 的容量下限极低,也顺带暴露了这个基准离"语义理解"有多远。
️研发团队:东京大学(Matsushima / Iwasawa)
代码/项目页:未公开
![]()
DemoMimic:一条人类演示,泛化 16 种物体的灵巧操作
arXiv:https://arxiv.org/abs/2609.01938
Satvik Sharma, Samrat Sahoo, Fei-Fei Li, Jiajun Wu, Dorsa Sadigh, Jeannette Bohg 等 | Stanford
一句话:灵巧手数据贵到收不起?那就别学"整只手怎么动",只学"接触点附近的局部几何"——一条演示就能在形状、尺度、质量都不同的 16 个物体间迁移。
多指灵巧手的 sim-to-real 方法常有两个病:奖励里没有显式鼓励精确接触,导致真机效果差;以及过度依赖整体物体模型,换个物体就泛化不动。DemoMimic 的策略只盯着接触点局部的几何结构操作物体,用接触中心奖励拉高 sim-to-real 一致性——一个单一策略,只要局部接触结构一致就能跨物体迁移。
指标
结果
真实世界成功率
71%(16 个物体 × 4 类任务 × 2 种机械手)
sim-to-real 性能下降
各基线中最小
️研发团队:Stanford(Fei-Fei Li / Jiajun Wu / Dorsa Sadigh / Jeannette Bohg)
代码/项目页:未公开
![]()
数据路线板块小结
把三篇放在一起看,是今年最具张力的一张"三岔路口":XR-2 押注——数据还远没到 scaling 瓶颈,双臂家务尤其如此;MINERVA 拆台——至少在 LIBERO 这类基准上,参数与"语义"都被高估了;DemoMimic 换道——与其纠结数据量,不如把先验(接触几何)用好。三者的共识其实只有一个:**"更大的模型 + 更多的数据"正在从默认答案变成待论证的假设**。
全身移动操作:从"会走路"到"边走路边干活"
人形/轮腿机器人的研究本周高度收敛到一个词:loco-manipulation。四篇工作分别回答了它四个子问题——怎么感知接触力、怎么听人指挥、怎么造出适配的硬件、怎么把行为系统搭得可编辑。
FWBC-VLA:不加力传感器,也能让 VLA"感觉到"接触
arXiv:https://arxiv.org/abs/2609.03889
Yutian Zhang, Siyuan Ma, Liwen Yang, Yang Li, Ce Hao, Haozhen Chi, Dong We, Qiaojun Yu, Dibo Hou
一句话:VLA 会"想"但感觉不到力,WBC 会"站"但分不清任务力与干扰力——FWBC-VLA 用一个无传感器力矩估计器把两边缝起来,让轮腿机器人在富接触任务里又稳又懂轻重。
富接触的移动操作需要"语义动作生成"与"物理交互控制"的桥接,而给机器人装力/力矩传感器既贵又难集成。FWBC-VLA 提出HSR-Force无传感器残差力矩估计器,推断接触强度及其时序变化,并把接触状态编码成 token 注入 VLA 动作专家的解码阶段——让策略感知接触的建立、持续加载与释放。本体感觉、雅可比导出的机体坐标系力估计与接触状态再联合送入补偿生成器,产出修正动作叠加到操作动作上交给全身控制执行。
验证任务
真机结果
擦白板
有效(接触持续 + 力补偿)
推开带闭门器的门
有效(力突变下的全身补偿)
配套发布了WL&Arm 数据集(5,000+ 回合)用于全参数微调 VLA 骨干。真实场景里没有"传感器白名单",能无感测力是移动操作规模化落地的一道关键减法。
️研发团队:作者团队(轮腿平台 + VLA/WBC 系统),机构未在摘要页标注
代码/项目页:未公开
![]()
ADAPT:人形机器人"边保持平衡边听懂你换指令"
arXiv:https://arxiv.org/abs/2609.00677
Yan Wu, Chenhao Li, Kaifeng Zhao, Gen Li, Marco Hutter, Siyu Tang | ETH Zurich
一句话:主流"文本→动作"是先生成运动学动作再交给跟踪器,ADAPT 直接端到端闭环学——机器人要一边维持平衡一边持续响应口语指令,还能流畅切任务。
ADAPT 从带文本标签的状态-动作轨迹中学习基于扩散的动作先验,让多样化技能可直接由语言驱动;再在冻结的扩散控制器之上训练一个轻量残差 RL 策略,专门处理长时程鲁棒性与指令切换的平滑度。这个扩散策略还能被复用为"可操控的文本条件运动先验"做下游任务适配——一套参数,两种用法。
能力
鲁棒语言落地技能执行
端到端闭环,无需独立跟踪器
交互式指令切换
残差 RL 保证长时程稳定与流畅过渡
先验复用
可作 steerable 运动先验适配下游任务
️研发团队:ETH Zurich(Marco Hutter / Siyu Tang)
代码/项目页:有项目页(URL 见论文 Comments 链接)
![]()
BRIDGE:先优化"长得像不像人",再谈造人形机器人
arXiv:https://arxiv.org/abs/2609.03497
Jianren Wang, Letian Qian, Zikai Wang, Weiwei Wu, Junjie Zong, Abhinav Gupta, Deepak Pathak | CMU 团队
一句话:大多数机器人是"先定好硬件尺寸,再想办法控住它";BRIDGE 反过来——以"能不能忠实地复现人类动作"为目标,把形态和控制一起优化,造出 88cm 的开源人形平台。
硬件设计与全身控制长期脱节,导致机器人在"类人流畅度"上妥协。BRIDGE 提出数据驱动的形态-控制协同设计框架,并给出一个联合度量:运动学重定向保真度 × 动态跟踪性能,用它对基线人形(Bumi、K1、Toddlerbot)全面领先。最终落地为Bridge——88cm 高、开源硬件 + 同步开源控制策略,在基础移动、鲁棒平衡与高动态机动上均表现出色,能以高保真度采集人类运动数据。
对比项
BRIDGE
设计方式
形态-控制协同设计(数据驱动)
平台规格
88cm 高,开源硬件 + 策略
对标基线
Bumi / K1 / Toddlerbot(全面 SOTA)
️研发团队:CMU 团队(Deepak Pathak / Abhinav Gupta)
代码/项目页:开源材料 + 视频(URL 见论文)
![]()
IHMC:把"行为系统"做成能现场改的程序,34 秒推门穿行
arXiv:https://arxiv.org/abs/2609.01518
Duncan Calvert, Luigi Penco, Robert Griffin 等 | IHMC(Florida Institute for Human & Machine Cognition)
一句话:当别人在卷学习策略时,IHMC 在卷"行为架构"——让操作员像改剧本一样在运行时增删机器人行为,人类干扰下 45 秒分拣 6 个球。
论文的核心主张很反潮流:行为架构(而非某个算法)才是能力、速度与可靠性的主要推动因素。系统用"以对象为中心的 Affordance 模板 + 树状结构 + 运行时可编辑的感知"组织行为,操作员界面与机器人持续同步,支持现场编写、监控与修复。动作原语由支持并发行走与身体运动的全身控制器执行。
场景
表现
推门穿行(Unitree H1-2 / Alex)
34 秒
人类物理干扰下按颜色分拣 6 球
45 秒
从零编写/适配一个新移动操控行为
仅需数小时
️研发团队:IHMC(Robert Griffin 团队)
代码/项目页:附演示视频(URL 见论文)
![]()
全身移动操作板块小结
四篇合起来正好是一套完整分工:FWBC-VLA解决"接触力的感知与补偿"(在轮腿上),ADAPT解决"语言如何实时指挥全身"(在人形上),BRIDGE从源头解决"硬件形态要不要为数据收集优化",IHMC则提醒我们——生产级的 loco-manipulation 还需要能被现场调试的行为系统。从"能走"到"边走边干活还扛得住人捣乱",这条技术链正在快速闭合。
评测与鲁棒性:给机器人请裁判,先问裁判靠不靠谱
本周评测圈集体"排雷":VLM 当任务成功裁判并不可靠;VLA 对传感器损坏/遮挡格外脆弱;而有团队开始用"成对偏好"替代二元成功计数。
FailBench:VLM 当裁判,最好成绩 0.77,还总爱说"成功"
arXiv:https://arxiv.org/abs/2609.03611
Zaruhi Navasardyan, Tatul Danielyan, Hrant Davtyan
一句话:越来越多人拿 VLM 判断"机器人这步做成了没"。FailBench 用 2,197 次真实操作试出了真相:最强的 VLM 裁判平均正确率只有 0.77,证据模糊时它会系统性倾向判"成功"。
FailBench 汇聚 14 个公开来源(12 个真机 + 2 个仿真)的 2,197 次操作尝试,其中75% 的失败是自然发生的(不是人为构造),且有 6 个来源来自原本并非失败检测用途的数据集——专治"在自己的数据集上自嗨"。
发现
数据
13 个 VLM 检测器最好成绩
0.77平均平衡准确率
专门微调过的失败检测模型
一致跑输通用 VLM 与其预训练基线
结果取决于物体可见运动时
接近饱和
接触密集的装配任务
掉到接近随机(<0.60)
证据模糊时
系统性偏向预测"成功"(加长推理也不改)
一个务实的解法:把"结果相关区域"空间定位并裁剪后喂给模型,不做任何训练就能让最强检测器+2.4 个百分点。换句话说,目前的瓶颈一半在模型,一半在"你给它看了什么"。
️研发团队:作者机构未在摘要页标注
代码/项目页:未公开
![]()
EGR:模态纠缠——你的 VLA 在靠"传感器间的巧合"答题
arXiv:https://arxiv.org/abs/2609.03142
Yue Yang, Diego Romeres, Chiori Hori, Gedas Bertasius, Daniel Szafir, Siddarth Jain
一句话:VLA 在有限同质数据上训练会学到"传感器 A 和 B 之间的虚假相关"——其中一个坏了或遮住了它就抓瞎。EGR 让策略学会分辨"哪个传感器此刻在说真话"。
这种失败模式被命名为模态纠缠(modality entanglement):表现为对无信息传感器损坏的"干扰敏感",以及只剩单一信息传感器时的"单模态不足"。EGR 用逐帧、逐传感器的任务相关性信号做门控:低证据传感器强制它"不变量"(坏了也别捣乱),高证据传感器强制"单传感器充分性"(只靠它也能完成任务),且只在训练期生效,推理零开销。
场景(BEHAVIOR-1K 仿真)
成功率提升
全模态
12.5% → 16.4%(+31%)
无信息传感器损坏
9.4% → 16.5%(+75%)
单传感器回退
2.8% → 6.1%(+120%)
真机遮挡干扰(双臂 Kinova)
30% → 85%(+183%)
真机(视觉+触觉 MELFA)
55% → 70%(+27%)
️研发团队:作者机构未在摘要页标注
代码/项目页:未公开
R2S-Eval:与其数成功率,不如让 VLM 比"哪段做得更好"
arXiv:https://arxiv.org/abs/2609.03276
Yidi Wang, Feixiang Ruan, Ruoqu Chen, Jie Yin, Yang Yu, Mengdi Xu, Kaifeng Zhang
一句话:真机评估又贵又不稳定,还可能换个批次排名就翻车;R2S-Eval 用"校准过的仿真视频 + VLM 成对偏好"给策略排名,还能量化成功标签看不到的执行质量差异。
传统的真实世界评估靠重复硬件试验 + 人工数成功率,既费力,且成功率这种二元标签丢失了大量执行质量信息。R2S-Eval 先在与真实环境校准过的仿真器里高效生成 rollout 视频(real-to-sim),再用VLM 成对偏好评判执行质量并聚合成策略排名,并配套了一套协议来验证"评估结论是否可信"。
特性
R2S-Eval
评估粒度
成对偏好 → 质量感知排名(非二元成功)
硬件负担
大幅减少重复真机试验
结果
与人类偏好一致、统计稳定、能暴露二元标签漏掉的质量差异
️研发团队:作者机构未在摘要页标注(有项目页)
代码/项目页:有项目页(URL 见论文 Comments)
![]()
评测板块小结
三篇互为因果:FailBench用大规模真机数据证明了"VLM 裁判"远未达标且存在系统性乐观偏差,EGR揭示了 VLA 本身在感知退化下有多脆(这也正是"裁判"难当的根源之一),R2S-Eval则给出一条出路——把评估从"成功/失败计数"升级为"校准仿真 + 质量偏好"。评测正在从附属品变成和策略训练同等重要的一等公民。
本期趋势判断 三大信号
"越大越好"从公理变成了待证命题。MINERVA 用 0.54M 参数、XR-2 用 1,500 小时演示、DemoMimic 用一条演示,给出了三个方向的证据;而 FailBench 又提醒我们,连"评价变大了好不好"的工具都还不可靠。2026 年下半场,说服别人的成本在上升——每一条 scaling 主张都得自带受控实验。
世界模型成了 VLA 的"训练期外挂",想象开始讲成本。WISE 把世界模型从"未来预测器"升级成"后训练调度器"并宣称省 80% GPU;GIFT 则把预测式建模的特征直接用于动作监督。参考上月 GigaWorld 把 WAM 推理压到 85ms——想象不仅要比谁准,还要比谁便宜,这条军备竞赛已经开始。
全身移动操作进入"系统级收敛"。本周五篇与 humanoid/loco-manipulation 相关的工作分布在感知(FWBC-VLA)、控制(ADAPT)、硬件(BRIDGE)、行为系统(IHMC)与安全(Safe Stop 等)每一层。行业端小鹏机器人完成超 9 亿美元融资、OpenAI 官宣自研人形本体(见行业速递)——资本与论文在同一时间指向"全身"这个形态。
值得关注的团队
东京大学(Matsushima / Iwasawa):MINERVA 给 LIBERO 及 flow matching 信仰同时立了块墓碑,基准批判会引发一串 follow-up。
Stanford(Fei-Fei Li / Jiajun Wu / Bohg 组):DemoMimic 的"接触几何先验"路线可能是灵巧手少样本的下一个共识。
CMU(Deepak Pathak / Abhinav Gupta):BRIDGE 的形态-控制协同设计把"开源人形数据采集平台"又往前推了一步。
北京大学(Hao Dong 团队):XR-2 的 1,500 小时双臂数据若如期开源,将是双臂家务学习的一块公共地基。
GENISOM AI(北京):JEPA 物理锚定方向的中国公司信号,值得盯后续。
反向观察
本周 14 篇精选里,明确公开代码/数据/项目页的屈指可数(XR-2 数据承诺开源、BRIDGE 开源硬件、FailBench/R2S-Eval 未附仓库)。论文宣称的 SOTA 大多没有可复现路径,而 MINERVA 恰恰证明了"复现成本与基准含金量"是这个领域的隐形税。既然评测范式(R2S-Eval、FailBench)本身正在成为研究对象,那么"开源,不然别谈 scaling"应当成为审稿人标配。
行业速递
OpenAI 官宣自研人形机器人(9/2):奥特曼在播客中首次明确 OpenAI 将自研人形本体,并并行研发数据中心特种机器人,长期目标是"人手一台"。
小鹏机器人业务完成超 9 亿美元首轮融资(估值超 63 亿美元),刷新国内具身智能单轮纪录:76 个自由度、端侧算力 2250 TOPS、已完成约 250 台小批量试产,规划 2026 年底规模量产;同期发布第二代 VLA 4D 时空大模型(端侧参数扩大 3.5 倍,留存前 30 秒路况、推演未来 6 秒),技术同步迁移至人形机器人 IRON。
美国首只专注中国人形机器人的 ETF(CROB)于 9/2 在纳斯达克上市,前十大成分股覆盖绿的谐波、汇川技术等中国产业链龙头。
Galbot(银河通用)ET1 开启预售(9/3):首款双足人形,1,230mm / 30kg,采用宇树电机单元 + Galbot AstraBrain-WBC 控制器,2026 世界机器人大会首秀。
天工机器人完成数亿元融资(9/2,初芯基金领投)。
国家标准 GB/T 47245—2026《机器人智能控制系统总体架构》等一批智能控制国标于 9/1 正式实施;行业口径预计 2026 年全球人形机器人出货超 5 万台、中国厂商占八成以上。
Mbot具身智能实验室
让尖端科技触手可及,人人皆可探索未来
![]()
Mbot基础交流群等你加入,下方扫码联系
具身-杰西
Mbot具身-小助手
Mbot-视频号
Mbot-公众号
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.