![]()
原力灵机登顶 RoboDojo:一个专门给机器人"卸妆"的考场。
作者丨齐铖湧
编辑丨董子博
最近的朋友圈,几乎被机器人运动会和 WRC 2026 上的各种视频刷屏了。
看多了机器人百米冲刺、跳远,再看各个展台叠衣服、冲咖啡,很容易得出一个结论:机器人时代来了。
然而,如果你不幸参与过这些演示背后动辄几千次的调试与过拟合,你就会清楚这里面的水有多深。
行业内管这种情况叫"Demo 滤镜"。滤镜有多厚?说实话,即使你积累了一些行业知识,在现场盯着看,你也未必分得清:这个演示到底是提前编好的动作,还是模型在实时驱动。
![]()
这些信息差,让具身行业多少有些鱼龙混杂。
好在,学术界还留着几面"照妖镜",比如 RoboDojo。
01
一个不许摆拍的考场
这是一个来头不小的权威评测:由香港大学多媒体实验室牵头,联合 UC 伯克利、清华等全球近 20 所顶尖机构,背后是知名仿真基准 RoboTwin 的原班人马。它干的事用一句话概括:给全世界的机器人模型办一场统一高考。
其中,42 道题,考泛化、记忆、精细操作、长程执行、开放语义理解五个科目;另外还有18 道题,考场里摆着三种双臂机器人(ARX X5、Piper 等),灯光、复位流程、部署接口全部统一,评审双盲打分,既看结果也看过程。
翻译一下:不许自带考具,不许挑题,不许摆拍,仿真、真机分开考。
成绩单相当惨烈。截至今年 7 月,仿真榜上 30 多个参评模型里,不乏大家熟悉的 π0.5(Physical Intelligence)、英伟达 GR00T-N1.7、OpenVLA-OFT,全是这个赛道叫得上名号的选手,头部模型的平均成功率只有 8.80%,作为对比,人类专家是 76.03%。
真机榜更惨:头部模型总体成功率 12.8%,人类 100%。最难看的是开放语义任务,成功率只有 1.67%。
1.67% 是什么概念?考 60 次,蒙对 1 次。而同一个考场里的人类,满分。
所以这个榜单暴露的,不是哪家公司不行,而是一个行业级现实:现在的具身模型,绝大多数离落地还很远。
然而最近,RoboDojo 的一家中国具身头部公司:原力灵机。它的通用具身基础模型 DM0.5,以 24.90 的综合得分、19.34% 的平均成功率,双项第一,综合排名登顶。
![]()
02
分数之外,先看它干活的样子
从去年底开始,AI 科技评论判断一个具身模型的含金量时,就越来越关注榜单之外的东西,它干活的样子。
毕竟,分数是给人看的,活是给世界干的。
我们特地找到了 DM0.5 的 GitHub 仓库,结果看到了一些让人意外的细节。
先从一个测试视频开始。桌上随机摆着红、绿、蓝三块积木。给你三个杯子,从左到右把它们挨个盖住。等颜色全部遮住,再按红、绿、蓝的顺序,把杯子依次揭开。
听着像逗小孩的。没错,三四岁的小孩确实能轻松完成,顺便还会嫌你无聊。但让机器人来呢?很遗憾,绝大多数"具身大脑"都会当场露馅:不是颜色记错,就是步骤乱套。
因为现在的具身模型,大多和金鱼差不多:走一步,忘一步。
主流 VLA 模型做决策时,只看眼前这一帧,或者最近几帧画面。十秒内的短任务没问题,抓个杯子、按个按钮,靠本能反应够了。但真实世界的活儿几乎都是长程的:做一顿饭半小时,收拾一间屋子一小时,流水线一站一整天。没有记忆,机器人就永远只能活在 10 秒的 Demo 里。
这个"杯子盖积木",正是 RoboDojo 里的一道真题,任务名叫 Cover Blocks,考的就是记忆。来看 DM0.5 的表现:
三个随机种子,DM0.5 全部 100% 通过。
注意,拿满分还有两个附加条件:杯子姿态全程有效,结束后物归原位。也就是说,它不是蒙对了一次开盖顺序,而是稳定走完"观察、记忆、按序执行、善始善终"的完整闭环。如果你是做具身算法的,就知道这个表现有多惊艳。
这个 100% 的含金量,放到榜单里更直观:Memory 维度,DM0.5 拿到 47.74 分、47.44% 的成功率;而全场第二名,只有 13.37 分、12.11%,得分差了 3 倍多,成功率接近 4 倍。
Memory一直是原力灵机的强项。PI的Mem具身记忆架构论文,就引用过原力灵机的MemoryVLA,肯定了其在具身记忆方向的探索。
近期旗舰π0.7论文再度引用该成果。π0.7作为全球泛化顶尖的机器人基础模型,架构基于PI的Mem框架,而MemoryVLA在“小脑记忆”路线的研究,为PI提供重要参考。两次引用,足以证明原力灵机在具身智能记忆领域的能力。而这次按榜单的五维综合评价,Memory 正是 DM0.5 拉开差距、最终登顶的关键科目。
03
治"金鱼病",为什么这么难
可能有读者会问:既然记忆这么重要,为什么这么多公司不去攻克?
首先是贵。把几十秒的历史画面塞进模型,上下文一拉长,计算量暴涨,架构也得重新设计。多数团队的选择是先把短任务跑通,记忆以后再说。
这个剧情其实眼熟。大语言模型的进化史,几乎就是一部上下文长度的扩张史:从几千 token 到十几万、上百万,模型记得住的东西越多,能力就发生一次质变——从陪聊到读论文、写代码、当 Agent。上下文,就是语言模型的记忆。
而如果具身行业因为"贵",一直解决不了大脑的记忆问题,那不管机器人是进工厂还是进家庭,都是个闯祸精。
DM0.5 为什么能把记忆做成杀手锏?我们翻了它的开源论文,找到了相关章节:
![]()
简单说,DM0.5 是把记忆从后面临时打的补丁,变成预训练阶段就长进去的原生能力。具体有三招:
第一招在架构。DM0.5 由 4B 的 VLM 多模态主干加 680M 的 Action Expert 组成,中间专门设了一个"上下文抽象层":用高效的信息压缩,让 VLM 在预训练阶段就原生学习历史信息,原生支持最长 60 秒记忆,一套架构通吃可变长的时间窗口。
关键是"原生"两个字:不是把长历史硬塞进去硬算,而是让模型从小学会把历史压缩着用。
第二招在预训练。围绕历史上下文、具身推理、动作监督、数据质量做系统升级,让长程记忆、指令理解、动作连续性、抗干扰作为一个整体长出来,而不是东拼一块、西凑一块。
第三招在微调。针对下游任务的 SFT 里直接加入 20 秒历史观测,把预训练攒下的时序理解能力,真正迁移到考场任务上。
三招的回报,就是 Memory 维度那条接近 4 倍的分差。
04
只会背书,拿不了状元
不过按官方的说法,DM0.5 的登顶并非依赖某一项单点能力,而是预训练与针对性 SFT 共同带来的整体提升。我们在仓库里核对了一圈,确实如此。
LIBERO 综合成功率 99.0%;RoboTwin 2.0 简单和复杂场景分别是 93.6% 和 93.3%;VLA-Arena 三档难度下 89.0%、53.6%、44.1%;导航任务 R2R、RxR 的未见场景成功率 59.7% 和 65.5%,全面压过基线方法。
在另一项同样"魔鬼"的评测 RoboChallenge Table30 v2里,面对 ARX5、UR5、ALOHA、Dexmal-Mirror 四种不同构型的机器人、30 个复杂任务,DM0.5 以 43.0% 的整体成功率、54.42 的综合得分位列第一。
![]()
![]()
榜单看到这里,我们更好奇了:DM0.5 落到真刀真枪的活儿上,到底能不能打?
官方放出的实机演示里,有几段值得细看。
第一段是拼微型积木。最小组件宽度不到 1 厘米,抓取和扣合要在 0.1 到 1 毫米的尺度内完成,而人手的自然抖动极限差不多就是 0.3 到 1 毫米——这个活的精度要求,正好卡在人类手抖的误差带里。
DM0.5 控制下的机械臂有个很"人"的动作:先对准,再轻轻一震,抖着往下压,用一股"寸劲儿"把积木送进卡扣。
更神奇的是出错的时候。高强度连续作业中,难免有积木因角度偏差接错。它没有死板地继续拼,而是自主感知到了"拼装失败":停顿大约半秒——那半秒很像人发现不对时的愣神——然后调整姿态、重新抓取、修正位置、再度按下。平均每台机器人 12 秒完成一次拼装,全天候无间断。
再比如削黄瓜和切黄瓜。
削黄瓜这类需要精细力控的柔性任务,靠的是通过关节电机的电流值实时感知作用力,对接触力做精确判断。
切黄瓜听着简单,但执行端是一双 58 个自由度的灵巧手:握刀、扶稳、下刀、控制力道。黄瓜是软的、会滚动、每根形状都不一样,这种柔性物体,靠写死轨迹的传统工业机器人根本碰不了,只能让底座模型实时感知、实时决策。DM0.5 加一层针对性后训练,就把 58 个自由度管了起来。
物流分拣则是另一个极端,考的不是细,是快。传送带上包裹堆叠、材质各异、姿态随机,DM0.5 不用预设脚本,纯靠实时视觉识别和决策,平均 3 秒分离一件,准确率超过 99%。
还有一段抗干扰测试,让人印象很深。机器人正在收拾桌面,人类中途强行把它推开、相机被猛晃,它的反应是:停下来看清楚,接着干——还记得刚才的东西收到哪了。
这背后就是前面说的原生 60 秒记忆:它能记住整整一分钟内自己做过的所有动作。
这个能力还有个顺手的衍生品:既然记得住长序列,它就能直接"看懂"人类的演示视频,看完跟着做。绕开语言,看视频上岗。
05
同一个考场,凭什么它分高
记忆是杀招,但一场五门课的考试,光靠一门赢不了。DM0.5 的基本盘,还有三样东西。
先说数据。具身智能和聊天机器人最大的区别是,语料没法从互联网上白嫖。网上有几万亿字的文本,但没有"机器人第一视角抓杯子"的数据,这玩意只能拿真机一小时一小时地采,又贵又慢。
原力灵机在数据上的家底有三大块:
真机数据:5 万小时高精度操作数据,做到秒级指令-动作对齐;
Egocentric 数据:10 万小时第一视角视频,能生成毫米级精度的 3D 空间标注;
场景重建数据:100 万平方米空间建模,把真实室内环境高精度数字化,让模型在仿真里训练时,看到的考场和真机考场尽可能一样。
毫米级高精度3D Landmark生成
Dexmal高精度场景重建数
高质量数据才能带来高质量智能。这套覆盖导航、抓取、全身控制三大任务、六类机器人本体的数据资产,把仿真与现实的鸿沟一寸一寸填平。
再说脑子。
团队内部有句话说得挺直白:"没有语言能力的 VLA,就是数据集复读机。“如果模型只是把画面死记硬背地映射到动作,换个场景就废。DM0.5 加了一层"具身思维链”:动作生成之前,模型要先想清楚一串问题——目标物体在哪、上一步干了什么、这步该不该结束、不这么干会怎样(反事实推理)。11 项推理任务,逼模型真正理解指令、环境和自身的关系,而不是背答案。
最后是最硬核的一块:速度。
VLA 模型一直被一个问题卡着脖子:模型越大越聪明,但推理越慢。如果模型半秒才能给出一次动作指令,机器人就像喝了半斤白酒,眼睛看着杯子掉下去,手就是来不及。行业里的解法是"双系统":慢系统想清楚,快系统手上快。Figure 的 Helix、英伟达的 GR00T 都走这条路,算是行业共识。
DM0.5 也是双系统:Sys2 负责理解指令、预判大局,Sys1 动作专家网络负责高频响应。差别在于,原力灵机把推理速度卷到了离谱的水平:通过 Vision TensorRT、FP8、CUDA Graph 等一串工程优化,模型核心延迟从 534 毫秒压到 57.49 毫秒,9.29 倍加速,API 响应控制在 70 毫秒内。而且在 2000 个 LIBERO 测试 episode 上,成功率只掉了 0.05 个百分点(98.45% → 98.40%),几乎无损。
57 毫秒什么概念?人眨一次眼大约 100 到 150 毫秒。DM0.5 的"思考加出手",比眨眼还快。大模型的智力,第一次跑进了实时控制要求的时间窗口。前面演示里,它能接住人类的突然打断、能在流水线上 3 秒一单,靠的就是这个。
06
考第一的DM0.5,
居然是一个开源模型
聊开源之前,得先说清楚这场"全科第一"为什么值钱。
同一个模型,在仿真、真机、导航、精细操作这些差别极大的场景里都跑进第一梯队,这在具身行业并不多见。它释放的信号是:具身模型的能力上限,正在被真正看见。
更关键的是,行业现在把宝全押在数据上,"百万小时"几乎成了口头禅。但数据 Scaling 有个常被忽略的前提:木桶能装多少水,取决于最短的那块板。记忆、推理是短板,灌再多数据,水照样从短板流走。全科优秀,才是进入百万小时时代的必要条件,每门课都没有结构性漏洞,数据才会真正转化为能力。DM0.5 考出的,正是这张"值得灌数据"的门票。
然后才是开源的故事。
按商业剧本,考第一的模型应该捂着,卖 API、卖授权,把领先优势变现得越久越好。原力灵机反着来:DM0.5 全面开源。模型权重、训练框架,从 LIBERO 到 RoboTwin2、RoboChallenge 再到真机 SO101 的完整工作流,陆续放上 GitHub 和 Hugging Face,核心代码也提交给了 LeRobot 社区。前阵子,国际电信联盟(ITU)具身智能焦点组首次线下会议,原力灵机当选"开源生态"工作组组长单位。
这个选择接住了上面的逻辑。具身智能缺一个公共底座:每家公司都在重复造轮子,中小团队根本进不了场。一个经过全科验证的底座开源出来,等于告诉所有开发者:放心往里灌数据,这只桶没有洞。短期看是让渡壁垒,长期看,谁成为生态的默认底座,谁就拿走最值钱的门票。
RoboDojo 那张 1.67% 的成绩单,短期看是行业的难堪,长期看是好事:具身智能终于有了一把没人能作弊的尺子,"我家机器人很智能"这句话,从此需要证据。
而登顶之后选择开源的 DM0.5,把尺子、证据和答卷一起放到了所有人面前。物理世界的智能觉醒,可能就从有人愿意公开答卷开始。
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.