网易首页 > 网易号 > 正文 申请入驻

人均第一,具身智能榜单能信吗?

0
分享至



刷题、话术包装、资源置换。

定焦One(dingjiaoone)原创

作者 | 王璐

编辑 | 魏佳

具身智能赛道持续吸引资本目光的同时,各类相关榜单也越来越多。当“第一”几乎成为各家标配时,榜单还有可信度吗?

一个多月前,千寻智能就经历了尴尬时刻。6月初,其具身基座模型Spirit v1.6在RoboArena榜单上以1918分的成绩超过了英伟达Cosmos3的1880分,一度位居“世界第一”;紧接着,千寻宣布完成15亿元A+轮融资,三个月内累计完成四轮密集融资,总额接近50亿元,创下具身智能赛道的融资频率新高。

不过,业内对评测数据的质疑几乎从次日就开始升温。有观察者指出,在310次评测记录中,有72%的分数来自两个账号。更值得关注的是,RoboArena官方随后发布声明,经回溯调查后移除了部分存疑的评测数据,并更新了榜单排名。Spirit v1.6也随之从榜单上除名。

但这一事件并未浇灭玩家们的热情,翻开近半年的行业新闻,星动纪元、原力灵机、极佳视界、智元、跨维、鹿明……几乎每一家头部公司手里都攥着一个“第一”,且这些“第一”维度各不相同。

这一景象或许不难理解,具身智能目前技术路线还没统一、真机成功率大多卡在五六成,外界想判断一家公司到底行不行,很大程度上只能依赖榜单。可当发榜的既有高校、机构也有媒体,各家标准各不相同、有的还牵扯商单和利益关系时,榜单本身还能不能当尺子用,就成了一个问题。

一位关注具身赛道的投资人坦言,榜单更偏市场行为,最多算投资决策的一个参考,他对于千寻这件事并不吃惊。在他看来,真正在意名次的,往往不是以财务或技术为出发点的机构,而是一些地方引导基金或偏国资的资金,一个“第一”,可能正是他们“写在报告里一个比较好的入口”。但也有投资人持不同看法,他们认为在技术门槛高、信息不对称的早期赛道,榜单至少提供了一个横向比较的起点。

当“第一”的数量比认真做机器人的公司还多时,这些榜单到底是在测技术,还是在测讲故事的能力?哪些榜单还值得看?

01.技术路线还没统一,先人手一个“第一”

我们先来盘一盘目前市面上的榜单,建立一个大致印象。据不完全统计,目前具身智能的活跃榜单高达20余个。按评测内容,这些榜单大致可以分成三类。



VLA操作综合榜,考察机器人能不能真干活,跑的是任务成功率,代表榜单是RoboChallenge Table30、MolmoSpaces;

世界模型榜,考的是脑内推演对不对,考察模型对物理世界的推演,不考机器人手脚利不利索,代表是World Arena和WorldModelBench;

专项基准榜,考察“极端情况下会不会露馅”,针对单点极端能力,比如双臂协同、仿真到真机迁移,代表是RoboTwin 2.0、SimplerEnv、LIBERO 和 CALVIN。它的价值在于,在综合榜照不到的极端场景里,把模型的短板逼出来。

需要说明的是,这三类榜单各有侧重、互不替代。真机榜测执行、世界模型榜测推演、专项榜测边界,没有任何一个能覆盖具身智能的全部能力。

有了这层坐标,近半年具身基座模型的战报就能对号入座。如果把近两个月具身基座模型的战报汇总,可以得到一份相当壮观的名单。

今年5月,星动纪元Era0宣称拿下RoboChallenge Table30第一;智元GE-Sim 2.0是World Arena Track1第一;跨维DSCFuncWorld是World Arena Track2第一。进入6月,千寻Spirit v1.6拿下RoboArena第一(后被除名),鹿明Prime R0登顶MolmoSpaces。几乎每一家都是第一,而且都有具体榜单排名作背书。

而乱象,也是从各种榜单开始的。

最明显的是,榜首像流水席,“第一名”更换频繁。

RoboChallenge Table30的榜首,过去半年里至少换了四次:先是千寻Spirit v1.5以50.33%的成功率刷新纪录,很快又被极佳视界GigaBrain-0.1、美国波士顿动力Atlas、星动纪元Era0先后超越。

这个速度,比大语言模型的主流榜单更新快得多。2023年到2025年,GPT-4、Claude 3、Gemini 1.5在MMLU、GSM8K等榜单上的榜首位置,通常能守数月甚至一年,即便是2020年到2022年的高速迭代期,GPT-3、PaLM也是以月为换榜周期。“当下的具身智能,单个模型能霸榜一周就算不容易。”一家头部具身智能公司的从业者米范表示。

其将主要原因归结为两点。一是物理世界的随机性,同一个模型在真机上跑两次,成功率差三到五个百分点很正常,光照、物体位置、机械臂公差都会影响结果,而MMLU这类大语言模型榜单是固定题目、确定性判分,同一模型跑一百次分数几乎不变。二是测试任务的公开程度,像RoboChallenge的Table30,30项任务分布是公开的,各家可以照着任务专门采数据、微调模型再提交,榜首的“保质期”于是被压到了以周计。

更让人迷惑的,是同一个榜里会同时冒出好几个“第一”。

World Arena就是典型,智元GE-Sim 2.0、跨维DSCFuncWorld对外都称自己“登顶World Arena”,但事实是,这个榜单含有多条赛道,智元GE-Sim 2.0在Track1(感知与动作响应)以68.26分排第一,跨维DSCFuncWorld在Track2(数据引擎)排第一。“第一”分属不同个子榜,对外却被统一写成了同一句话。

对不熟悉赛道划分的读者来说,两家并列的“World Arena第一”的说法几乎无法分辨,甚至会怀疑是不是有人在撒谎,但其实谁都没说错,只是不够精确。

还有一层更模糊的地带是,榜单性质混杂,“第一”的含金量却被默认成同一档,容易产生误导。

一些公司的对外口径里,经常会同时列出“某模型在RoboChallenge排名第一”,和“在某具身智能媒体的测评中也位居第一”。前者是7×24小时真机跑出来的成功率,后者可能只是编辑部闭门讨论、甚至商务合作敲定的名单,两者被并排放进一句话,含金量却被默认成了同一档。

其中最模糊的是“产业榜”,有些榜单顶着“产业”二字,但既不是真机锁死的硬榜,也不是学术机构背书的benchmark,而是咨询公司或媒体合办的打分榜。类似情况也在大语言模型圈出现过,但随着学术榜、商业测评、媒体榜逐渐分层,“双料第一”才慢慢被拆掉,而具身智能,眼下正处在那个尚未分层的阶段。

三种现象叠加,结果就是榜单“第一”严重通货膨胀。而且这种通胀不只停留在营销层面,一个“第一”的头衔往往能换来关注度、资源和实打实的估值溢价。

02.一个“第一”是怎么造出来的?

既然榜单能撬动真金白银,如何把第一造出来,也形成了“潜规则”。业内人士介绍,虽然千寻Spirit v1.6属于极端个例,但行业里造“第一”的现象并不少,手法大致有三种。

成本最低、也最普遍的一种方式是话术包装,“单科第一”成了“总分第一”,核心是省掉关键限定词。

比如实际拿的是“RoboTwin 2.0双臂协同VLA类Clean档第一”,对外就变成“登顶RoboTwin 2.0”;实际是“LIBERO-Plus场景泛化专项第一”,对外就成了“LIBERO-Plus榜首”。数据没造假、成绩也是真的,但“第一”所指代的范围被人为放大了。

第二种方式是利用“刷题”等方式直接干预结果。

一条是“照着考题练”。榜单公开的任务分布、评分标准、环境参数,都可以拿来做定向后训练,在一些任务相对固定的榜上尤其明显,各家可以通过反复“刷题”、过拟合到特定场景换来高分。

米范表示,具身领域的部分榜单的测试任务是公开的,各家可以针对这些任务专门采集数据、微调模型后再提交,这在具身圈被视为正常迭代,不算作弊,和LLM领域的“数据泄露、数据污染”有本质区别。

另一条是钻评测机制的漏洞。有些榜权威性很高,机制却有空子可钻。比如RoboArena采用开放注册、分布式评测,本意是让更多人参与,却留下了三个空子。


图源 / RoboArena官网


一是评测者身份无门槛。任何人都能注册当裁判,短期内大量新账号集中评测同一个模型,就能把它的Elo分数快速推高;

二是匹配不强制全覆盖,随机分配对手不等于必须跟同期在榜者都打一轮,评测者领任务时,A 是固定的,B 是从分数相近的模型里随机抽,样本不够大时两个模型完全可能一次都排不上。比如Spiritv1.6早期与DreamZero交手,23场后停战,与5月30日入榜的英伟达Cosmos3-Nano-Policy为零对战;

三是集中刷评,用多个账号密集评测自家模型,把负面记录降低。比如Spirit v1.6的310次评测记录中,72%的分数来自于ECUST和Robotics Lab两个账号,它们用224场评测刷出97%胜率,把Spirit v1.6推上第一,但英伟达用同样条件自测21次,胜率0%,两组数据摆在一起,直接让从业者产生怀疑。

事后,RoboArena补了规则:评测者必须是无利益关联的第三方,堵住自刷账号的入口,评测完成率低于20%的账号标为可疑,堵住选择性匹配。而处理后,千寻跌出榜单。

还有一种方式最隐蔽也最泛滥,是资源置换,把榜单直接做成生意。

不少媒体榜评选标准并不透明,有的干脆与被评对象存在商务合作,双方联合发一份“权威报告”,把媒体榜和学术benchmark并排包装。它不涉及技术,也不涉及数据,只涉及预算和关系。不止一位从业者表示,刷榜、买榜等现象并不少见。

这三种手法往往叠加,先靠针对性训练或钻空子把分数刷上去,再用赛道偷换掩盖来源,最后用话术对外传播,必要时再买个媒体榜背书。层层包装之下,“第一”就成了。

这些手法在行业内部并不是秘密。真正的问题在于,看穿它们需要一定的技术功底,技术越复杂,外行越难分辨,故事就越容易讲。

03.去掉水分,还该信什么?

不止一位具身智能从业者坦言,他们当下已经不太关注榜单排名了,因为榜单能刷、能买,即便一切合规,物理环境的复杂性也让数据很难做到百分百准确。

更深一层的问题是,这个行业目前还没有一把“通用的尺子”。

具身智能从业者gashero用“炒鸡蛋”和“拌凉菜”打了一个比方:机器人A擅长炒鸡蛋、成功率90%,机器人B擅长拌凉菜、成功率85%,但不能就此说A比B强。炒鸡蛋考验抓取和翻锅,拌凉菜考验精准倒料和搅拌,两件事技能不同、难度不同、评价标准也不同。当下的具身智能赛道还没有一个统一标准,能把“炒鸡蛋的能力”和“拌凉菜的能力”折算进同一个打分体系里。

不过,这不代表榜单一无是处。从业者普遍认为,榜单仍有其参考价值,关键在于知道什么值得看,以及看完之后还该看什么。


图源 / RoboChallenge官网


综合业内共识,真正可信的榜单,大体同时具备三个特征。

一是分项透明,不是只甩一个“第一”。

不论综合榜还是专项榜,可信的做法都是把细项一一拆开。以RoboChallenge Table30为例,它测的是30项日常任务的综合成功率,可信之处在于,不仅告诉读者64.33%这个综合数字,还让读者看到30项里哪几项做得好、哪几项掉链子。只报总分、不报细项的榜,价值要大打折扣。

二是评测由第三方掌控,且有反刷题设计。

MolmoSpaces不允许微调,模型直接“裸考”;LIBERO-Plus则加了光照突变、背景杂乱、相机角度变化等极端扰动,专门防止靠死记硬背拿分。它们的共同特点,是让刷题变难,让泛化成为真正的门槛。

三是看评测机制,而不是看更新频率。

更新慢的榜单不一定可靠,更新快的榜单也不一定可刷。有些榜更新慢,可能因为真机评测成本极高,比如RoboChallenge一次完整评测周期可能要数周,30项任务每项跑10次,一共300次真机尝试,7×24小时连续运行,这是物理世界的成本约束。而有些榜更新快,则是机制设计。比如RoboArena采用了Elo评分系统进行动态排名,每天都有新对战数据进来,排名自然每天更新。这种快本身不是问题,它的可信度取决于机制是否严密、漏洞是否被补上。

但是,既然圈内都知道榜单有水分,为什么大家还在拼命刷?

答案在于行业当下的阶段。

眼下这场“第一”的争夺战,本质上是资本焦虑的产物。今年是具身基座模型密集迭代的一年,早期赛道出货量、营收、订单量都不稳定,只能拿榜单顶上。融资导向的阶段没变,刷榜这件事就不会停。

当行业进入下一阶段,评判的标尺会自然切换,例如每年交付多少台、有哪些固定客户、是否能盈利。到那时候,“第一”的通货膨胀会自然消散,榜单也会退回它本该在的位置。

或许,那些不忙着刷榜、只顾着把机器人送进产线的公司,才是行业真正的答案。

*题图由「定焦One」拍摄。应受访者要求,文中米范为化名。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
这些国家长期把中国称为“契丹”!

这些国家长期把中国称为“契丹”!

小豫讲故事
2026-09-29 06:00:18
9月销量出炉,又是“一米穿五界”!网友:余承东不必尴尬,华为乾崑ADS车型已经遍地开花

9月销量出炉,又是“一米穿五界”!网友:余承东不必尴尬,华为乾崑ADS车型已经遍地开花

大白聊IT
2026-10-02 22:29:11
亚运会最终金牌榜产生,最后2金决出,亚运会男女MVP也均产生!

亚运会最终金牌榜产生,最后2金决出,亚运会男女MVP也均产生!

第五才子
2026-10-04 18:38:09
中方决定撤离援助后,对中国的态度立马变了

中方决定撤离援助后,对中国的态度立马变了

麓谷隐士
2026-10-04 00:15:04
74比24程序过关,这项法案把NCAA告上风口浪尖

74比24程序过关,这项法案把NCAA告上风口浪尖

赛场速报局
2026-10-04 20:29:39
54岁藤原纪香,从未活在美颜滤镜里

54岁藤原纪香,从未活在美颜滤镜里

草莓解说体育
2026-09-15 06:46:01
李在明暗示韩国曾统治中原万年言论曝出,日本媒体冷嘲:他对中国“怕不是有啥幻想”,争议迅速发酵

李在明暗示韩国曾统治中原万年言论曝出,日本媒体冷嘲:他对中国“怕不是有啥幻想”,争议迅速发酵

爱竞彩的小周
2026-10-02 04:39:54
iPhone 18 Pro Max真机对比,与iPhone Duo差距曝光

iPhone 18 Pro Max真机对比,与iPhone Duo差距曝光

搞机小帝
2026-10-04 21:03:44
揭幕战不打,对阵老东家也不打!刚签下大合同就开摆?超巨太真实

揭幕战不打,对阵老东家也不打!刚签下大合同就开摆?超巨太真实

你的篮球频道
2026-10-04 07:51:41
“金九”收官,汽车销量排行榜出炉:第一名断层领先!

“金九”收官,汽车销量排行榜出炉:第一名断层领先!

侃故事的阿庆
2026-10-03 02:19:10
蒙古国政府再次公开拒绝了中方提出的跨境铁路运力扩容方案

蒙古国政府再次公开拒绝了中方提出的跨境铁路运力扩容方案

果妈聊娱乐
2026-08-23 08:38:03
“这跟内衣有啥区别?”中学女儿的外出穿搭,让母亲绷不住了

“这跟内衣有啥区别?”中学女儿的外出穿搭,让母亲绷不住了

世界圈
2026-09-22 15:46:08
6000块罚单上热搜后:为什么全国网友都在喊“全国推广”?

6000块罚单上热搜后:为什么全国网友都在喊“全国推广”?

阿芒娱乐说
2026-10-04 09:54:23
刘小涛率团访问阿联酋

刘小涛率团访问阿联酋

新京报
2026-10-04 22:28:21
湖人后悔吗?八村垒快船首秀打疯了:15分钟狂轰21+5秀翻全场

湖人后悔吗?八村垒快船首秀打疯了:15分钟狂轰21+5秀翻全场

追球者
2026-10-05 08:44:20
昔日国乒名将陈龙灿发声!张本宇留日另有原因,当年选择不简单

昔日国乒名将陈龙灿发声!张本宇留日另有原因,当年选择不简单

潋滟晴方DAY
2026-08-13 13:06:45
快船险胜!八村塁21+5,瓦格勒准绝杀,赛后巴特勒一把抱住加兰

快船险胜!八村塁21+5,瓦格勒准绝杀,赛后巴特勒一把抱住加兰

担酒
2026-10-05 09:40:10
奶奶把550万全给姑姑,我带爸妈远走,春节一通电话让他们吓傻

奶奶把550万全给姑姑,我带爸妈远走,春节一通电话让他们吓傻

有态度网友19Dsym
2026-10-04 17:10:29
蒙嘉慧首回应移居日本:是郑伊健提议要在日本买房,否认公司倒闭

蒙嘉慧首回应移居日本:是郑伊健提议要在日本买房,否认公司倒闭

开开森森
2026-10-03 09:47:42
伊朗内部发生激烈交火!安全部队出动坦克控局,准将级指挥官阵亡

伊朗内部发生激烈交火!安全部队出动坦克控局,准将级指挥官阵亡

比利
2026-10-01 12:36:52
2026-10-05 10:28:49
定焦One incentive-icons
定焦One
深度影响创新。
1276文章数 1121关注度
往期回顾 全部

科技要闻

DeepSeek Harness国庆假期上新!

头条要闻

名校"7人轮奸案"震惊全美 女方曾称同意与2人发生关系

头条要闻

名校"7人轮奸案"震惊全美 女方曾称同意与2人发生关系

体育要闻

32胜0负!德约2-1逆转头号种子兹维列夫 第7次晋级中网四强

娱乐要闻

高晓松悄悄复出:官媒没给他留体面

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
教育
游戏
房产
公开课

艺术要闻

震惊!吴冠中为何把自己的画展叫“叛徒画展”?真相远比你想的扎心!

教育要闻

班主任22条实用管理方法(建议收藏)

《秋叶原迷踪》制作人专访:倾注全部心血的诚意之作

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版