网易首页 > 网易号 > 正文 申请入驻

没有全科优秀,具身模型别想进入百万小时

0
分享至


原力灵机登顶 RoboDojo:一个专门给机器人"卸妆"的考场。

作者丨齐铖湧

编辑丨董子博

最近的朋友圈,几乎被机器人运动会和 WRC 2026 上的各种视频刷屏了。

看多了机器人百米冲刺、跳远,再看各个展台叠衣服、冲咖啡,很容易得出一个结论:机器人时代来了。

然而,如果你不幸参与过这些演示背后动辄几千次的调试与过拟合,你就会清楚这里面的水有多深。

行业内管这种情况叫"Demo 滤镜"。滤镜有多厚?说实话,即使你积累了一些行业知识,在现场盯着看,你也未必分得清:这个演示到底是提前编好的动作,还是模型在实时驱动。


这些信息差,让具身行业多少有些鱼龙混杂。

好在,学术界还留着几面"照妖镜",比如 RoboDojo。

01


一个不许摆拍的考场

这是一个来头不小的权威评测:由香港大学多媒体实验室牵头,联合 UC 伯克利、清华等全球近 20 所顶尖机构,背后是知名仿真基准 RoboTwin 的原班人马。它干的事用一句话概括:给全世界的机器人模型办一场统一高考。

其中,42 道题,考泛化、记忆、精细操作、长程执行、开放语义理解五个科目;另外还有18 道题,考场里摆着三种双臂机器人(ARX X5、Piper 等),灯光、复位流程、部署接口全部统一,评审双盲打分,既看结果也看过程。

翻译一下:不许自带考具,不许挑题,不许摆拍,仿真、真机分开考。

成绩单相当惨烈。截至今年 7 月,仿真榜上 30 多个参评模型里,不乏大家熟悉的 π0.5(Physical Intelligence)、英伟达 GR00T-N1.7、OpenVLA-OFT,全是这个赛道叫得上名号的选手,头部模型的平均成功率只有 8.80%,作为对比,人类专家是 76.03%。

真机榜更惨:头部模型总体成功率 12.8%,人类 100%。最难看的是开放语义任务,成功率只有 1.67%。

1.67% 是什么概念?考 60 次,蒙对 1 次。而同一个考场里的人类,满分。

所以这个榜单暴露的,不是哪家公司不行,而是一个行业级现实:现在的具身模型,绝大多数离落地还很远。

然而最近,RoboDojo 的一家中国具身头部公司:原力灵机。它的通用具身基础模型 DM0.5,以 24.90 的综合得分、19.34% 的平均成功率,双项第一,综合排名登顶。


02


分数之外,先看它干活的样子

从去年底开始,AI 科技评论判断一个具身模型的含金量时,就越来越关注榜单之外的东西,它干活的样子。

毕竟,分数是给人看的,活是给世界干的。

我们特地找到了 DM0.5 的 GitHub 仓库,结果看到了一些让人意外的细节。

先从一个测试视频开始。桌上随机摆着红、绿、蓝三块积木。给你三个杯子,从左到右把它们挨个盖住。等颜色全部遮住,再按红、绿、蓝的顺序,把杯子依次揭开。

听着像逗小孩的。没错,三四岁的小孩确实能轻松完成,顺便还会嫌你无聊。但让机器人来呢?很遗憾,绝大多数"具身大脑"都会当场露馅:不是颜色记错,就是步骤乱套。

因为现在的具身模型,大多和金鱼差不多:走一步,忘一步。

主流 VLA 模型做决策时,只看眼前这一帧,或者最近几帧画面。十秒内的短任务没问题,抓个杯子、按个按钮,靠本能反应够了。但真实世界的活儿几乎都是长程的:做一顿饭半小时,收拾一间屋子一小时,流水线一站一整天。没有记忆,机器人就永远只能活在 10 秒的 Demo 里。

这个"杯子盖积木",正是 RoboDojo 里的一道真题,任务名叫 Cover Blocks,考的就是记忆。来看 DM0.5 的表现:

三个随机种子,DM0.5 全部 100% 通过。

注意,拿满分还有两个附加条件:杯子姿态全程有效,结束后物归原位。也就是说,它不是蒙对了一次开盖顺序,而是稳定走完"观察、记忆、按序执行、善始善终"的完整闭环。如果你是做具身算法的,就知道这个表现有多惊艳。

这个 100% 的含金量,放到榜单里更直观:Memory 维度,DM0.5 拿到 47.74 分、47.44% 的成功率;而全场第二名,只有 13.37 分、12.11%,得分差了 3 倍多,成功率接近 4 倍。

Memory一直是原力灵机的强项。PI的Mem具身记忆架构论文,就引用过原力灵机的MemoryVLA,肯定了其在具身记忆方向的探索。

近期旗舰π0.7论文再度引用该成果。π0.7作为全球泛化顶尖的机器人基础模型,架构基于PI的Mem框架,而MemoryVLA在“小脑记忆”路线的研究,为PI提供重要参考。两次引用,足以证明原力灵机在具身智能记忆领域的能力。而这次按榜单的五维综合评价,Memory 正是 DM0.5 拉开差距、最终登顶的关键科目。

03


治"金鱼病",为什么这么难

可能有读者会问:既然记忆这么重要,为什么这么多公司不去攻克?

首先是贵。把几十秒的历史画面塞进模型,上下文一拉长,计算量暴涨,架构也得重新设计。多数团队的选择是先把短任务跑通,记忆以后再说。

这个剧情其实眼熟。大语言模型的进化史,几乎就是一部上下文长度的扩张史:从几千 token 到十几万、上百万,模型记得住的东西越多,能力就发生一次质变——从陪聊到读论文、写代码、当 Agent。上下文,就是语言模型的记忆。

而如果具身行业因为"贵",一直解决不了大脑的记忆问题,那不管机器人是进工厂还是进家庭,都是个闯祸精。

DM0.5 为什么能把记忆做成杀手锏?我们翻了它的开源论文,找到了相关章节:


简单说,DM0.5 是把记忆从后面临时打的补丁,变成预训练阶段就长进去的原生能力。具体有三招:

第一招在架构。DM0.5 由 4B 的 VLM 多模态主干加 680M 的 Action Expert 组成,中间专门设了一个"上下文抽象层":用高效的信息压缩,让 VLM 在预训练阶段就原生学习历史信息,原生支持最长 60 秒记忆,一套架构通吃可变长的时间窗口。

关键是"原生"两个字:不是把长历史硬塞进去硬算,而是让模型从小学会把历史压缩着用。

第二招在预训练。围绕历史上下文、具身推理、动作监督、数据质量做系统升级,让长程记忆、指令理解、动作连续性、抗干扰作为一个整体长出来,而不是东拼一块、西凑一块。

第三招在微调。针对下游任务的 SFT 里直接加入 20 秒历史观测,把预训练攒下的时序理解能力,真正迁移到考场任务上。

三招的回报,就是 Memory 维度那条接近 4 倍的分差。

04


只会背书,拿不了状元

不过按官方的说法,DM0.5 的登顶并非依赖某一项单点能力,而是预训练与针对性 SFT 共同带来的整体提升。我们在仓库里核对了一圈,确实如此。

LIBERO 综合成功率 99.0%;RoboTwin 2.0 简单和复杂场景分别是 93.6% 和 93.3%;VLA-Arena 三档难度下 89.0%、53.6%、44.1%;导航任务 R2R、RxR 的未见场景成功率 59.7% 和 65.5%,全面压过基线方法。

在另一项同样"魔鬼"的评测 RoboChallenge Table30 v2里,面对 ARX5、UR5、ALOHA、Dexmal-Mirror 四种不同构型的机器人、30 个复杂任务,DM0.5 以 43.0% 的整体成功率、54.42 的综合得分位列第一。



榜单看到这里,我们更好奇了:DM0.5 落到真刀真枪的活儿上,到底能不能打?

官方放出的实机演示里,有几段值得细看。

第一段是拼微型积木。最小组件宽度不到 1 厘米,抓取和扣合要在 0.1 到 1 毫米的尺度内完成,而人手的自然抖动极限差不多就是 0.3 到 1 毫米——这个活的精度要求,正好卡在人类手抖的误差带里。

DM0.5 控制下的机械臂有个很"人"的动作:先对准,再轻轻一震,抖着往下压,用一股"寸劲儿"把积木送进卡扣。

更神奇的是出错的时候。高强度连续作业中,难免有积木因角度偏差接错。它没有死板地继续拼,而是自主感知到了"拼装失败":停顿大约半秒——那半秒很像人发现不对时的愣神——然后调整姿态、重新抓取、修正位置、再度按下。平均每台机器人 12 秒完成一次拼装,全天候无间断。

再比如削黄瓜和切黄瓜。

削黄瓜这类需要精细力控的柔性任务,靠的是通过关节电机的电流值实时感知作用力,对接触力做精确判断。

切黄瓜听着简单,但执行端是一双 58 个自由度的灵巧手:握刀、扶稳、下刀、控制力道。黄瓜是软的、会滚动、每根形状都不一样,这种柔性物体,靠写死轨迹的传统工业机器人根本碰不了,只能让底座模型实时感知、实时决策。DM0.5 加一层针对性后训练,就把 58 个自由度管了起来。

物流分拣则是另一个极端,考的不是细,是快。传送带上包裹堆叠、材质各异、姿态随机,DM0.5 不用预设脚本,纯靠实时视觉识别和决策,平均 3 秒分离一件,准确率超过 99%。

还有一段抗干扰测试,让人印象很深。机器人正在收拾桌面,人类中途强行把它推开、相机被猛晃,它的反应是:停下来看清楚,接着干——还记得刚才的东西收到哪了。

这背后就是前面说的原生 60 秒记忆:它能记住整整一分钟内自己做过的所有动作。

这个能力还有个顺手的衍生品:既然记得住长序列,它就能直接"看懂"人类的演示视频,看完跟着做。绕开语言,看视频上岗。

05


同一个考场,凭什么它分高

记忆是杀招,但一场五门课的考试,光靠一门赢不了。DM0.5 的基本盘,还有三样东西。

先说数据。具身智能和聊天机器人最大的区别是,语料没法从互联网上白嫖。网上有几万亿字的文本,但没有"机器人第一视角抓杯子"的数据,这玩意只能拿真机一小时一小时地采,又贵又慢。

原力灵机在数据上的家底有三大块:

真机数:5 万小时高精度操作数据,做到秒级指令-动作对齐;

Egocentric 数据:10 万小时第一视角视频,能生成毫米级精度的 3D 空间标注;

场景重建数据:100 万平方米空间建模,把真实室内环境高精度数字化,让模型在仿真里训练时,看到的考场和真机考场尽可能一样。

毫米级高精度3D Landmark生成

Dexmal高精度场景重建数

高质量数据才能带来高质量智能。这套覆盖导航、抓取、全身控制三大任务、六类机器人本体的数据资产,把仿真与现实的鸿沟一寸一寸填平。

再说脑子。

团队内部有句话说得挺直白:"没有语言能力的 VLA,就是数据集复读机。“如果模型只是把画面死记硬背地映射到动作,换个场景就废。DM0.5 加了一层"具身思维链”:动作生成之前,模型要先想清楚一串问题——目标物体在哪、上一步干了什么、这步该不该结束、不这么干会怎样(反事实推理)。11 项推理任务,逼模型真正理解指令、环境和自身的关系,而不是背答案。

最后是最硬核的一块:速度。

VLA 模型一直被一个问题卡着脖子:模型越大越聪明,但推理越慢。如果模型半秒才能给出一次动作指令,机器人就像喝了半斤白酒,眼睛看着杯子掉下去,手就是来不及。行业里的解法是"双系统":慢系统想清楚,快系统手上快。Figure 的 Helix、英伟达的 GR00T 都走这条路,算是行业共识。

DM0.5 也是双系统:Sys2 负责理解指令、预判大局,Sys1 动作专家网络负责高频响应。差别在于,原力灵机把推理速度卷到了离谱的水平:通过 Vision TensorRT、FP8、CUDA Graph 等一串工程优化,模型核心延迟从 534 毫秒压到 57.49 毫秒,9.29 倍加速,API 响应控制在 70 毫秒内。而且在 2000 个 LIBERO 测试 episode 上,成功率只掉了 0.05 个百分点(98.45% → 98.40%),几乎无损。

57 毫秒什么概念?人眨一次眼大约 100 到 150 毫秒。DM0.5 的"思考加出手",比眨眼还快。大模型的智力,第一次跑进了实时控制要求的时间窗口。前面演示里,它能接住人类的突然打断、能在流水线上 3 秒一单,靠的就是这个。

06


考第一的DM0.5,

居然是一个开源模型

聊开源之前,得先说清楚这场"全科第一"为什么值钱。

同一个模型,在仿真、真机、导航、精细操作这些差别极大的场景里都跑进第一梯队,这在具身行业并不多见。它释放的信号是:具身模型的能力上限,正在被真正看见。

更关键的是,行业现在把宝全押在数据上,"百万小时"几乎成了口头禅。但数据 Scaling 有个常被忽略的前提:木桶能装多少水,取决于最短的那块板。记忆、推理是短板,灌再多数据,水照样从短板流走。全科优秀,才是进入百万小时时代的必要条件,每门课都没有结构性漏洞,数据才会真正转化为能力。DM0.5 考出的,正是这张"值得灌数据"的门票。

然后才是开源的故事。

按商业剧本,考第一的模型应该捂着,卖 API、卖授权,把领先优势变现得越久越好。原力灵机反着来:DM0.5 全面开源。模型权重、训练框架,从 LIBERO 到 RoboTwin2、RoboChallenge 再到真机 SO101 的完整工作流,陆续放上 GitHub 和 Hugging Face,核心代码也提交给了 LeRobot 社区。前阵子,国际电信联盟(ITU)具身智能焦点组首次线下会议,原力灵机当选"开源生态"工作组组长单位。

这个选择接住了上面的逻辑。具身智能缺一个公共底座:每家公司都在重复造轮子,中小团队根本进不了场。一个经过全科验证的底座开源出来,等于告诉所有开发者:放心往里灌数据,这只桶没有洞。短期看是让渡壁垒,长期看,谁成为生态的默认底座,谁就拿走最值钱的门票。

RoboDojo 那张 1.67% 的成绩单,短期看是行业的难堪,长期看是好事:具身智能终于有了一把没人能作弊的尺子,"我家机器人很智能"这句话,从此需要证据。

而登顶之后选择开源的 DM0.5,把尺子、证据和答卷一起放到了所有人面前。物理世界的智能觉醒,可能就从有人愿意公开答卷开始。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
13岁女孩靠AI三天赚了1.8万元!当事人:几乎不懂编程,一年前才第一次接触AI,这次从构思到做出核心功能,只用了三四天

13岁女孩靠AI三天赚了1.8万元!当事人:几乎不懂编程,一年前才第一次接触AI,这次从构思到做出核心功能,只用了三四天

大风新闻
2026-08-25 14:36:04
早婚致数百万女孩辍学 教育损失为何总由女性承担

早婚致数百万女孩辍学 教育损失为何总由女性承担

心事寄山海
2026-08-25 00:57:52
iPhone 18 Pro 系列正面确定!观感提升

iPhone 18 Pro 系列正面确定!观感提升

花果科技
2026-08-24 23:40:41
告诉孩子,在家庭之外:三不管、四不说、五不帮

告诉孩子,在家庭之外:三不管、四不说、五不帮

男孩派
2026-08-09 09:31:10
陈妍希首谈「再婚可能性」 公开情断陈晓1年半:肯定是遗憾

陈妍希首谈「再婚可能性」 公开情断陈晓1年半:肯定是遗憾

ETtoday星光云
2026-08-25 11:31:07
柳岩当年的身材真的太出众了 完全没有对手

柳岩当年的身材真的太出众了 完全没有对手

乡野小珥
2026-08-26 00:51:23
29年后重回流媒体,这部曾被骂烂片的科幻神作口碑大翻盘

29年后重回流媒体,这部曾被骂烂片的科幻神作口碑大翻盘

追星雷达站
2026-08-24 01:28:10
日本全面叫停种植牙?种牙潜藏的风险与后遗症,一次为你讲明白

日本全面叫停种植牙?种牙潜藏的风险与后遗症,一次为你讲明白

健康科普365
2026-08-13 14:30:15
续约谈判卡死!先签后换重磅交易曝光,杜伦有望4年1.8亿加盟凯尔特人

续约谈判卡死!先签后换重磅交易曝光,杜伦有望4年1.8亿加盟凯尔特人

夜白侃球
2026-08-25 11:48:50
美媒没想到:中国歼-16打出51:0战绩,可能是世界最强四代战斗机

美媒没想到:中国歼-16打出51:0战绩,可能是世界最强四代战斗机

小丸说故事
2026-08-22 17:19:49
韩沛颖的出身,不查不知道,一查才发现,她压根不是什么资源咖。

韩沛颖的出身,不查不知道,一查才发现,她压根不是什么资源咖。

草莓解说体育
2026-08-25 10:38:26
18次丢球权!皇马19岁外租天才发火:替补席怒砸水瓶 穆帅看人真准

18次丢球权!皇马19岁外租天才发火:替补席怒砸水瓶 穆帅看人真准

风过乡
2026-08-25 12:10:26
俄媒:莫迪通过印度外长给普京“捎了个信儿”

俄媒:莫迪通过印度外长给普京“捎了个信儿”

环球网资讯
2026-08-25 13:12:56
银行将停发六位数短信验证码,新加密认证系统上线获三大运营商支持

银行将停发六位数短信验证码,新加密认证系统上线获三大运营商支持

像素与芯片
2026-08-24 00:08:51
韩红基金会溢价买救护车?均奕公司:每辆13.2万

韩红基金会溢价买救护车?均奕公司:每辆13.2万

看看新闻Knews
2026-08-24 19:45:13
李莉同志简历,因多次预判到美军动作,被美国列入制裁黑名单

李莉同志简历,因多次预判到美军动作,被美国列入制裁黑名单

谈史论天地
2026-04-18 10:35:33
伊普斯维奇镇与莱斯特城英联杯次轮战至加时,波特曼路现场直播

伊普斯维奇镇与莱斯特城英联杯次轮战至加时,波特曼路现场直播

甜份超标的我
2026-08-26 02:29:21
蒋雯丽母亲:一个母亲最狠的远见,当初不让小女儿蒋雯丽嫁他,到死都在担心的事还是发生了

蒋雯丽母亲:一个母亲最狠的远见,当初不让小女儿蒋雯丽嫁他,到死都在担心的事还是发生了

品茗赏娱
2026-08-25 22:09:15
你知道10万块钱的网贷有多可怕吗?

你知道10万块钱的网贷有多可怕吗?

流苏晚晴
2026-07-11 16:29:42
我国下一次8级大地震,最有可能发生在哪里?

我国下一次8级大地震,最有可能发生在哪里?

创造精彩剧情
2026-08-09 01:28:02
2026-08-26 02:48:49
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7576文章数 20776关注度
往期回顾 全部

科技要闻

机器人跑赢博尔特,身体太快,脑子还在追

头条要闻

赴韩遇害中国女生年仅25岁 原计划2天前入职新单位

头条要闻

赴韩遇害中国女生年仅25岁 原计划2天前入职新单位

体育要闻

穆里尼奥如何摆贝林修斯姆巴佩?

娱乐要闻

张韶涵成都演唱会中暑,中途吸氧

财经要闻

宇树科技最低跌破600元 5天缩水超2000亿

汽车要闻

硬派越野+华为智驾 泰钽700上市焕新价24.98万起

态度原创

房产
健康
教育
旅游
艺术

房产要闻

一年亏掉26个亿!三江潮声,吹不醒南沙开建豪宅美梦

女孩几岁月经?7个青春期月经真相

教育要闻

严禁幼儿园小学化教育,教育部:幼儿园不得教授小学阶段的课程

旅游要闻

避开网红景区看云南,山村巨石藏古老传说,至今没有确切答案!

艺术要闻

看哭了!如果你是70、80后,千万别在深夜点开崔小冬的画,那里藏着你回不去的青春和弄丢的恋人!

无障碍浏览 进入关怀版