网易首页 > 网易号 > 正文 申请入驻

“世界第一”成标配 具身大模型榜单林立背后的含金量几何?

0
分享至

证券时报记者 周春媚

“拿下具身世界模型第一”“登顶具身智能榜单”“具身大模型登顶国际评测公开排行榜”……搜索最近的具身大模型新闻,满屏的“第一”和“登顶”跃入眼帘。在这个资本最密集的赛道,榜单已经变得不够用了。

当几乎所有头部公司都手握至少一个“第一”时,这些榜单究竟在衡量什么?记者调研发现,当前具身大模型榜单数量已超20个,但业内公认的权威标准尚未形成。仿真榜单刷分容易、真机测试成本高昂、榜单性质混杂——“第一”的含金量千差万别。在这场“榜单狂欢”背后,真正值得追问的是:如何让“榜单第一”经得起真实世界的检验?

人手一个“世界第一”

8月11日,越疆科技宣布,在面向复杂遮挡机器人抓取的国际评测赛事UNOBench Challenge公开排行榜上,越疆空弈DobotWAM具身大模型在两大赛道中同时登顶。越疆科技表示,这一成绩展现出该具身大模型从语义理解到动作前置推理的领先实力。

而就在此前不到半个月,具身智能公司智元宣布,其自研的具身原生全模态大模型WITA-Omni Preview在具身全模态理解权威榜单DailyOmni上,超过国内外众多领先模型登顶榜首。智元强调,DailyOmni榜单高度贴合人形机器人在真实物理空间开展人机交互所需的核心感知能力,登顶榜首意味着该模型在物理世界视听时序理解任务上具备独特竞争力。

如果将时间轴拉长,会发现在令人眼花缭乱的具身大模型榜单中,机器人公司都曾榜上有名,几乎人手一个“世界第一”。

证券时报记者根据公开资料不完全梳理,今年3月,极佳视界宣布其自研的GigaWorld-1世界模型在权威评测基准WorldArena中登上全球榜首;4月,中科第五纪宣布其研发的具身世界模型FlowWAM登顶WorldArena榜单;6月,千寻智能宣布在全球具身智能实战评测平台RoboArena中,其自研模型Spirit v1.6排名全球第一。

纵观以上案例,涉及的榜单就有4个,每一个的形容词都是“全球”“权威”。在层出不穷的“登顶榜单”新闻中,普通人很难分辨不同榜单之间有何区别、登顶到底意味着什么,只是在同质化的宣传话语中,留下“不明觉厉”的粗浅印象。

这与行业当前所处的阶段有关。安邦智库宏观经济研究中心助理研究员赵至江在接受证券时报记者采访时表示,具身智能正处于技术探索与产业验证的早期阶段。“一方面,技术路线尚未完全收敛,还没有形成统一的行业评价标准。另一方面,资本市场对具身智能保持高度关注,企业需要通过测试成绩、演示视频和技术指标证明自身领先优势,客观上推动了部分指标包装和营销放大现象。”赵至江说。

赵至江强调,不能简单否定榜单的意义,但也要客观看待其价值。“不同企业仍在探索差异化的技术路径,在这种格局下,形成统一的行业评价标准并不容易。”赵至江说,当前榜单更多反映企业在某一单项能力上的突破,而非技术水平的全貌。

榜单含金量各不相同

首先,要厘清的概念是,机器人公司竞相追逐的“榜单第一”究竟是什么,与通用大模型的榜单有何区别?

近一两年来,随着供应链的成熟,造一台机器人已经不是难事,行业竞争从“拼本体”转向“拼大脑”,而这个“大脑”就是具身大模型。

因此,机器人要真正变得聪明好用,就需要拥有自己的具身大模型,重新采集训练机器人所需要的数据。通用大模型由于较为成熟,指标清晰,行业内已经形成了若干个公认的权威榜单,但具身大模型领域还没有。不同机构提出的榜单在评分维度与指标上差异较大,缺乏统一标准。

此外,天使投资人、资深人工智能专家郭涛告诉证券时报记者,具身大模型榜单高度依赖配套进行评测的机器人本体、执行器与仿真环境,分数无法脱离硬件单独成立。厂商可以通过调整机械参数、优化仿真环境定向提分,纯技术参考价值弱于通用大模型榜单。

其次,当前有哪些主流的具身大模型榜单,各自含金量如何?

据证券时报记者不完全梳理,当前各类具身大模型榜单数量已超20个,发起方包括清华大学、北京大学、普林斯顿大学、斯坦福大学等顶尖高校,美国艾伦AI研究院、上海AI实验室等研究机构,以及英伟达等企业。大多数榜单由几个机构联合发起。

按照不同类别,具身大模型榜单有不同的划分方式。如果从考察能力范围的全面性来看,可以分为综合能力榜单和专项能力榜单。前者就像对模型能力的“全面体检”;后者则侧重专项测试,考察其特定能力或极端场景下的表现。如果按照评测环境与真实物理世界的距离来划分,则主要分为仿真任务榜单与真机测试榜单,前者如同理论考试,后者则像实战演习。

一名业内人士告诉记者,不同于通用大模型测评以数字形式输入、数字结果输出,可以线上进行,具身大模型真机评测需要匹配硬件和场地,耗时长,成本高,因此真机测试榜单十分稀缺。

“仿真任务榜单是目前数量最多的,比如LIBERO、RoboTwin、ManiSkill等,它们标准化、低成本、容易复现,特别适合做算法横向比较。”中国社会科学院大学数字中国研究院特聘研究员刘兴亮在接受证券时报记者采访时表示。在他看来,真机和真实场景评测是含金量最高的一类,目前一些榜单比赛已经开始采用“仿真初赛+真机决赛”形式,把仿真评测与实体机器人验证结合起来。

当榜单足够多、赛道足够细分,机器人公司总能找到某个维度让模型登顶。刘兴亮表示,一个榜单有没有含金量,应从四方面来判断:题目是否公开透明,测试集是否与训练集隔离,结果能否被第三方复现,能否经过真实世界的验证。“科研评价关注的是能力问题,而产业评价关注的是技术能否形成稳定商业价值,两者本身就是不同逻辑。”赵至江说,一些榜单是为营销、融资而服务,但真正有能力有价值的企业,最终会由具体的应用而不是榜单排名筛选出来。

亟需从“做题”走向“实战”

具身大模型榜单看似热闹,但一个尴尬的现实是,仿真环境中的“学霸”到了真实世界,往往变成“学渣”,“榜单上的高手,实践中的矮子”是行业的普遍现象。

原因是多方面的。首先,郭涛指出,许多榜单不具备完整有效的评价能力,测试场景单一,任务边界固定,无法覆盖工业、家庭等多元化的真实工况。一家公司在某个榜单上得分高,可能只是在该榜单的特定任务上表现优异,而非整体技术实力领先。

其次,大多数榜单基于仿真环境,与真机实测存在不可忽视的差距。“在仿真环境里,光照可以标准化,摩擦系数可以设定,摄像机不会突然被人挡住。但进入工厂、商场和家庭以后,桌子可能挪了两厘米,袋子会变形,玻璃会反光,人可能突然伸手过来,网络还可能延迟。”刘兴亮说,机器人面对的是一个开放、不确定并且持续变化的物理世界,仿真环境测试的结果更多是一种理想状态。

以被誉为具身智能领域“珠峰级”评测的RoboDojo为例,该榜单采取“仿真+真机”双榜单机制,设计了42个仿真任务和18个真实机器人任务,真实世界部分表现最好的模型总体成功率仅为12.8%,折射出机器人落地的巨大鸿沟。

最后,部分企业存在定向“刷榜”行为,人为抬高分数。郭涛表示,有的是针对仿真榜单的“题库式刷分”,比如企业提前获取测试任务样本,针对榜单内固定物体、固定动作场景专项微调模型权重,刻意降低陌生场景权重分配。有的是针对真机榜单的硬件调优,锁定专用测试样机,调试关节阻尼、运动速度适配榜单任务,规避通用工况的严苛约束。此外,个别厂商还可能针对一些榜单挑战赛的规则,利用自己注册的评测账号不断测试、刷新评分。

刘兴亮指出,破解榜单“虚假繁荣”,关键不是取消榜单,而是把考试从“做题”变成“实战”。在他看来,具身大模型榜单需从以下几个方面加以改进:一是评测标准要统一。现有的评测在环境设置、硬件配置、测试条件等方面都不同,不同模型间很难进行公平对比,唯有制定更统一的标准,才能提高结果的可复现性。二是需要引入盲测,测试任务不能全部提前公开,最终排名应由隐藏测试集、陌生物体、陌生场景决定,以此达到防“刷榜”,真正测试机器人泛化能力的目的。三是将仿真测试与真机测试结合起来,验证机器人在物理世界的可靠性。

“目前,具身智能还处于发展的早期阶段,评价更多围绕单项能力、实验性能、技术参数展开,目的在于证明技术路线是否成立。随着产业进入应用阶段,评价体系会逐渐转向综合能力,由技术展示驱动转向产业价值驱动。”赵至江说,一个成熟的产业,通常不会依赖技术性的榜单作为评价标准,而是形成由行业标准、第三方测试和市场反馈共同构成的评价体系。“具身智能距离这一阶段还有较长过程,三到五年甚至更长的时间都是有可能的。”赵至江表示。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
37岁还演少女,演技尴尬遭全网抵制,真是浪费了张晓龙33年的栽培

37岁还演少女,演技尴尬遭全网抵制,真是浪费了张晓龙33年的栽培

鹤羽说个事
2026-08-18 13:28:45
罕见!德保罗指着队徽上的星星抗议裁判:你有冠军么?没有吧

罕见!德保罗指着队徽上的星星抗议裁判:你有冠军么?没有吧

爱奇艺体育
2026-08-18 10:52:03
18岁女学生意外检出多种性病:梅毒,尖锐湿疣,多种生殖道支原体感染

18岁女学生意外检出多种性病:梅毒,尖锐湿疣,多种生殖道支原体感染

压舌说
2026-08-18 10:20:51
华人老板把“996”搬到美国被捕,最高恐判20年……

华人老板把“996”搬到美国被捕,最高恐判20年……

吃瓜体
2026-08-18 11:20:08
策略:明天8月19日的预判出来了,全面减仓之前,我要说两句!

策略:明天8月19日的预判出来了,全面减仓之前,我要说两句!

一担金
2026-08-18 13:18:22
刷来刷去都是同一张脸!平台决定管一管

刷来刷去都是同一张脸!平台决定管一管

扬子晚报
2026-08-17 14:28:46
突然才发现:凡是家里出学霸的家庭,爸爸都有同一个特点,太准了

突然才发现:凡是家里出学霸的家庭,爸爸都有同一个特点,太准了

户外阿毽
2026-08-13 00:24:11
伊朗自己也没料到,封锁海峡打成了“大烂牌”,全世界已经不认了

伊朗自己也没料到,封锁海峡打成了“大烂牌”,全世界已经不认了

何氽简史
2026-08-17 21:38:50
莫言:永远不要期望一个没有血缘关系的人,能站在你的角度替你考虑|成年人最大的清醒

莫言:永远不要期望一个没有血缘关系的人,能站在你的角度替你考虑|成年人最大的清醒

杏花烟雨江南的碧园
2026-07-27 11:15:03
28岁关晓彤北京啤酒节登台,裙子短得离谱,上个台阶还要护住裙摆

28岁关晓彤北京啤酒节登台,裙子短得离谱,上个台阶还要护住裙摆

动物奇奇怪怪
2026-08-18 05:44:22
上海市调整2026年度社保缴费基数上下限!

上海市调整2026年度社保缴费基数上下限!

尚虹桥
2026-08-18 21:53:00
新股上市半个多月,从110跌到61,已经腰斩,进场的基本都被套!

新股上市半个多月,从110跌到61,已经腰斩,进场的基本都被套!

财经市界
2026-08-19 00:21:54
纯电续航1008km!比亚迪新车官宣:8月21日开启预售

纯电续航1008km!比亚迪新车官宣:8月21日开启预售

科技阿维
2026-08-18 10:53:13
刘慧,受贿数额特别巨大

刘慧,受贿数额特别巨大

新京报
2026-08-18 10:11:24
悲痛!不到48小时三名人相继辞世,最大105岁,每一位都让人不舍

悲痛!不到48小时三名人相继辞世,最大105岁,每一位都让人不舍

就一点
2026-08-14 16:07:23
捏蛋女已社死:正脸曝光面目狰狞,工作单位被扒,一家都是狠角色

捏蛋女已社死:正脸曝光面目狰狞,工作单位被扒,一家都是狠角色

吃瓜盟主
2025-08-30 15:53:04
毛主席虽活了83岁,保健医生却说:其实毛主席不具备长寿条件

毛主席虽活了83岁,保健医生却说:其实毛主席不具备长寿条件

华庭讲美食
2026-08-17 15:23:42
美国不拦,中俄拦不住日本拥核,但既然拦不住,就没必要打嘴皮子官司,他做初一我们做十五?

美国不拦,中俄拦不住日本拥核,但既然拦不住,就没必要打嘴皮子官司,他做初一我们做十五?

扶苏聊历史
2026-08-14 11:43:32
拒绝2年合同!威少啊威少,本可以不退役的!

拒绝2年合同!威少啊威少,本可以不退役的!

篮球实录
2026-08-19 02:59:50
网友问“英国的白崖放到中国会变成什么样的景区?” AI生成的图片太真实了,评论区也是满级嘲讽!

网友问“英国的白崖放到中国会变成什么样的景区?” AI生成的图片太真实了,评论区也是满级嘲讽!

谭谈社会
2026-08-17 23:53:21
2026-08-19 03:11:00
证券时报 incentive-icons
证券时报
运营主体:深圳证券时报社有限公司
959266文章数 239509关注度
往期回顾 全部

科技要闻

英伟达的资本局:从AI卖铲人到AI央行

头条要闻

女子称住民宿被员工打开房门看光:我全裸在擦身体

头条要闻

女子称住民宿被员工打开房门看光:我全裸在擦身体

体育要闻

中国男篮,一直被质疑,永远被期待

娱乐要闻

蓝盈莹官宣新恋情

财经要闻

一场酒局献祭,掀开了杭州地产潜规则

汽车要闻

试驾银河TT:兼顾操控与舒适,年轻人出行好搭子

态度原创

游戏
房产
家居
时尚
公开课

《剑星》开发商新作规划曝光:3A大作与三上真司新作

房产要闻

又又又狂抢207轮!海口土拍,彻底爆了!

家居要闻

2026建博会(广州) 公装联探展交流活动

松弛感白衬衫,要配牛仔裤才时髦啊

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版