为什么几乎每一家具身智能公司都攥着一个“第一”?翻看近半年的行业新闻,星动纪元、原力灵机、极佳视界、智元、跨维、鹿明……从VLA操作综合榜到世界模型榜,再到专项基准榜,各家手里的“第一”维度各不相同。可当发榜的既有高校、机构也有媒体,标准五花八门,有些还牵扯商单和利益关系时,榜单本身还能不能当尺子用,就成了一个绕不开的问题。
支持方认为,在技术门槛高、信息不对称的早期赛道,榜单至少提供了一个横向比较的起点。反对方则直言,榜单更偏市场行为,最多算投资决策的一个参考。一位关注具身赛道的投资人点出了关键:真正在意名次的,往往不是以财务或技术为出发点的机构,而是一些地方引导基金或偏国资的资金,一个“第一”,可能正是他们“写在报告里一个比较好的入口”。两方都有理,但谁都没否认一个事实——当“第一”的数量比认真做机器人的公司还多时,这些榜单到底是在测技术,还是在测讲故事的能力,就需要先把榜单本身拆开来看。
![]()
先盘一盘市面上的榜单。据不完全统计,目前具身智能的活跃榜单已经达到20余个。按评测内容,大致可以分成三类。第一类是VLA操作综合榜,考察机器人能不能真干活,跑的是任务成功率,代表榜单是RoboChallenge Table30和MolmoSpaces。第二类是世界模型榜,考的是模型对物理世界的推演能力,不涉及真机执行,代表是World Arena和WorldModelBench。第三类是专项基准榜,针对单点极端能力,比如双臂协同、仿真到真机迁移,代表包括RoboTwin 2.0、SimplerEnv、LIBERO和CALVIN,它的价值在于把模型在综合榜照不到的极端场景下的短板逼出来。这三类榜单各有侧重、互不替代,没有任何一个能覆盖具身智能的全部能力。
有了这个坐标,近半年具身基座模型的战报就能对号入座。今年5月,星动纪元Era0宣称拿下RoboChallenge Table30第一;智元GE-Sim 2.0是World Arena Track1第一;跨维DSCFuncWorld是World Arena Track2第一。进入6月,千寻Spirit v1.6拿下RoboArena第一,鹿明Prime R0登顶MolmoSpaces。如果只看外宣口径,几乎每一家都是第一,而且都有具体榜单排名作背书。问题是,这些“第一”的真实经受力,远比公关稿复杂得多。
最直观的乱象是榜首像流水席,第一名更换得比天气预报还快。RoboChallenge Table30的榜首过去半年里至少换了四次:先是千寻Spirit v1.5以50.33%的成功率刷新纪录,很快又被极佳视界GigaBrain-0.1、波士顿动力Atlas、星动纪元Era0先后超越。这个速度,大语言模型的主流榜单根本追不上。2023年到2025年,GPT-4、Claude 3、Gemini 1.5在MMLU、GSM8K等榜单上的榜首位置通常能守数月甚至一年;即便在2020年到2022年的高速迭代期,GPT-3、PaLM也是以月为换榜周期。一家头部具身智能公司的从业者米范解释说,物理世界的随机性让同一个模型在真机上跑两次,成功率就能差三到五个百分点,光照、物体位置、机械臂公差都会影响结果。而MMLU这类大语言模型榜单是固定题目、确定性判分,同一模型跑一百次分数几乎不变。再加上像RoboChallenge的Table30,30项任务分布是公开的,各家可以照着任务专门采数据、微调模型再提交,榜首的“保质期”就被压到了以周计。单个模型能霸榜一周就算不容易。
更让人迷惑的是,同一个榜里会同时冒出好几个“第一”。World Arena就是典型,智元GE-Sim 2.0和跨维DSCFuncWorld对外都称自己“登顶World Arena”。但事实是,这个榜单含有多条赛道,智元在Track1(感知与动作响应)以68.26分排第一,跨维在Track2(数据引擎)排第一,两者所属的子榜完全不同。对外却被统一写成了“World Arena第一”。对不熟悉赛道划分的读者来说,这几乎无法分辨,甚至会怀疑是不是有人在撒谎,但其实谁都没说错,只是不够精确。这种“单科第一”变“总分第一”的话术包装,在行业里相当普遍。实际拿的是“RoboTwin 2.0双臂协同VLA类Clean档第一”,对外就变成“登顶RoboTwin 2.0”;实际是“LIBERO-Plus场景泛化专项第一”,对外就成了“LIBERO-Plus榜首”。数据没造假,成绩也是真的,但“第一”所指代的范围被人为放大了。
还有一层更模糊的地带是榜单性质混杂,“第一”的含金量却被默认成同一档。一些公司对外口径里,经常会同时列出“某模型在RoboChallenge排名第一”和“在某具身智能媒体的测评中也位居第一”。前者是7×24小时真机跑出来的成功率,后者可能只是编辑部闭门讨论、甚至商务合作敲定的名单。两者被并排放进一句话,含金量却被默认为同一档。其中最具迷惑性的是“产业榜”,有些榜单顶着“产业”二字,但既不是真机锁死的硬榜,也不是学术机构背书的benchmark,而是咨询公司或媒体合办的打分榜。类似情况在大语言模型圈也曾出现过,后来随着学术榜、商业测评、媒体榜逐渐分层,“双料第一”的说法才慢慢被拆掉。而具身智能,眼下正处在那个尚未分层的阶段。
既然榜单能撬动关注度、资源和实打实的估值溢价,把“第一”造出来的手法也就形成了潜规则。业内人士指出,成本最低、也最普遍的一种就是前面提到的话术包装。第二种方式是“选择性提交”,在多个榜单中挑选对自己最有利的结果公开,同时淡化甚至完全不提在其他榜上的平庸成绩。第三种是更有操作空间的“定制赛道”——在还没有统一标准的早期阶段,有些公司会主动与发榜机构沟通,围绕自身优势维度定制评测子项或赛道,从而锁定一个“第一”的标签。这三种方式叠加起来,结果就是“第一”严重通货膨胀,几乎每家公司都能从某个维度找到属于自己的第一名。
但这些现象并不意味着榜单完全失去参考价值。关键在于看清背后的规则和边界。如果一家公司能在一段时间内稳定出现在多个真机锁定的硬榜前列,或者在不同机构、不同维度的评测中都拿到不错的名次,那其技术实力就相对可靠。相反,如果“第一”只出现在一两个自定义赛道或商业合作榜单上,且从未在其他权威评测中被验证,这个“第一”的含金量就需要打折。对于真正在意技术进展的观察者来说,更值得关注的不是“排第几”,而是模型在具体任务上的成功率区间、在不同环境下的泛化表现,以及评测方法是否公开透明。在一个还没有统一标准、物理随机性又极大的行业里,比起相信任何一纸榜单,这些拆解下来的细节,才是更接近真实的衡量尺子。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.