网易首页 > 网易号 > 正文 申请入驻

“世界第一”成标配 具身大模型榜单林立背后的含金量几何?

0
分享至

来源:证券时报

  证券时报记者 周春媚

  “拿下具身世界模型第一”“登顶具身智能榜单”“具身大模型登顶国际评测公开排行榜”……搜索最近的具身大模型新闻,满屏的“第一”和“登顶”跃入眼帘。在这个资本最密集的赛道,榜单已经变得不够用了。

  当几乎所有头部公司都手握至少一个“第一”时,这些榜单究竟在衡量什么?记者调研发现,当前具身大模型榜单数量已超20个,但业内公认的权威标准尚未形成。仿真榜单刷分容易、真机测试成本高昂、榜单性质混杂——“第一”的含金量千差万别。在这场“榜单狂欢”背后,真正值得追问的是:如何让“榜单第一”经得起真实世界的检验?

  人手一个“世界第一”

  8月11日,越疆科技宣布,在面向复杂遮挡机器人抓取的国际评测赛事UNOBench Challenge公开排行榜上,越疆空弈DobotWAM具身大模型在两大赛道中同时登顶。越疆科技表示,这一成绩展现出该具身大模型从语义理解到动作前置推理的领先实力。

  而就在此前不到半个月,具身智能公司智元宣布,其自研的具身原生全模态大模型WITA-Omni Preview在具身全模态理解权威榜单DailyOmni上,超过国内外众多领先模型登顶榜首。智元强调,DailyOmni榜单高度贴合人形机器人在真实物理空间开展人机交互所需的核心感知能力,登顶榜首意味着该模型在物理世界视听时序理解任务上具备独特竞争力。

  如果将时间轴拉长,会发现在令人眼花缭乱的具身大模型榜单中,机器人公司都曾榜上有名,几乎人手一个“世界第一”。

  证券时报记者根据公开资料不完全梳理,今年3月,极佳视界宣布其自研的GigaWorld-1世界模型在权威评测基准WorldArena中登上全球榜首;4月,中科第五纪宣布其研发的具身世界模型FlowWAM登顶WorldArena榜单;6月,千寻智能宣布在全球具身智能实战评测平台RoboArena中,其自研模型Spirit v1.6排名全球第一。

  纵观以上案例,涉及的榜单就有4个,每一个的形容词都是“全球”“权威”。在层出不穷的“登顶榜单”新闻中,普通人很难分辨不同榜单之间有何区别、登顶到底意味着什么,只是在同质化的宣传话语中,留下“不明觉厉”的粗浅印象。

  这与行业当前所处的阶段有关。安邦智库宏观经济研究中心助理研究员赵至江在接受证券时报记者采访时表示,具身智能正处于技术探索与产业验证的早期阶段。“一方面,技术路线尚未完全收敛,还没有形成统一的行业评价标准。另一方面,资本市场对具身智能保持高度关注,企业需要通过测试成绩、演示视频和技术指标证明自身领先优势,客观上推动了部分指标包装和营销放大现象。”赵至江说。

  赵至江强调,不能简单否定榜单的意义,但也要客观看待其价值。“不同企业仍在探索差异化的技术路径,在这种格局下,形成统一的行业评价标准并不容易。”赵至江说,当前榜单更多反映企业在某一单项能力上的突破,而非技术水平的全貌。

  榜单含金量各不相同

  首先,要厘清的概念是,机器人公司竞相追逐的“榜单第一”究竟是什么,与通用大模型的榜单有何区别?

  近一两年来,随着供应链的成熟,造一台机器人已经不是难事,行业竞争从“拼本体”转向“拼大脑”,而这个“大脑”就是具身大模型。

  因此,机器人要真正变得聪明好用,就需要拥有自己的具身大模型,重新采集训练机器人所需要的数据。通用大模型由于较为成熟,指标清晰,行业内已经形成了若干个公认的权威榜单,但具身大模型领域还没有。不同机构提出的榜单在评分维度与指标上差异较大,缺乏统一标准。

  此外,天使投资人、资深人工智能专家郭涛告诉证券时报记者,具身大模型榜单高度依赖配套进行评测的机器人本体、执行器与仿真环境,分数无法脱离硬件单独成立。厂商可以通过调整机械参数、优化仿真环境定向提分,纯技术参考价值弱于通用大模型榜单。

  其次,当前有哪些主流的具身大模型榜单,各自含金量如何?

  据证券时报记者不完全梳理,当前各类具身大模型榜单数量已超20个,发起方包括清华大学、北京大学、普林斯顿大学、斯坦福大学等顶尖高校,美国艾伦AI研究院、上海AI实验室等研究机构,以及英伟达等企业。大多数榜单由几个机构联合发起。

  按照不同类别,具身大模型榜单有不同的划分方式。如果从考察能力范围的全面性来看,可以分为综合能力榜单和专项能力榜单。前者就像对模型能力的“全面体检”;后者则侧重专项测试,考察其特定能力或极端场景下的表现。如果按照评测环境与真实物理世界的距离来划分,则主要分为仿真任务榜单与真机测试榜单,前者如同理论考试,后者则像实战演习。

  一名业内人士告诉记者,不同于通用大模型测评以数字形式输入、数字结果输出,可以线上进行,具身大模型真机评测需要匹配硬件和场地,耗时长,成本高,因此真机测试榜单十分稀缺。

  “仿真任务榜单是目前数量最多的,比如LIBERO、RoboTwin、ManiSkill等,它们标准化、低成本、容易复现,特别适合做算法横向比较。”中国社会科学院大学数字中国研究院特聘研究员刘兴亮在接受证券时报记者采访时表示。在他看来,真机和真实场景评测是含金量最高的一类,目前一些榜单比赛已经开始采用“仿真初赛+真机决赛”形式,把仿真评测与实体机器人验证结合起来。

  当榜单足够多、赛道足够细分,机器人公司总能找到某个维度让模型登顶。刘兴亮表示,一个榜单有没有含金量,应从四方面来判断:题目是否公开透明,测试集是否与训练集隔离,结果能否被第三方复现,能否经过真实世界的验证。“科研评价关注的是能力问题,而产业评价关注的是技术能否形成稳定商业价值,两者本身就是不同逻辑。”赵至江说,一些榜单是为营销、融资而服务,但真正有能力有价值的企业,最终会由具体的应用而不是榜单排名筛选出来。

  亟需从“做题”走向“实战”

  具身大模型榜单看似热闹,但一个尴尬的现实是,仿真环境中的“学霸”到了真实世界,往往变成“学渣”,“榜单上的高手,实践中的矮子”是行业的普遍现象。

  原因是多方面的。首先,郭涛指出,许多榜单不具备完整有效的评价能力,测试场景单一,任务边界固定,无法覆盖工业、家庭等多元化的真实工况。一家公司在某个榜单上得分高,可能只是在该榜单的特定任务上表现优异,而非整体技术实力领先。

  其次,大多数榜单基于仿真环境,与真机实测存在不可忽视的差距。“在仿真环境里,光照可以标准化,摩擦系数可以设定,摄像机不会突然被人挡住。但进入工厂、商场和家庭以后,桌子可能挪了两厘米,袋子会变形,玻璃会反光,人可能突然伸手过来,网络还可能延迟。”刘兴亮说,机器人面对的是一个开放、不确定并且持续变化的物理世界,仿真环境测试的结果更多是一种理想状态。

  以被誉为具身智能领域“珠峰级”评测的RoboDojo为例,该榜单采取“仿真+真机”双榜单机制,设计了42个仿真任务和18个真实机器人任务,真实世界部分表现最好的模型总体成功率仅为12.8%,折射出机器人落地的巨大鸿沟。

  最后,部分企业存在定向“刷榜”行为,人为抬高分数。郭涛表示,有的是针对仿真榜单的“题库式刷分”,比如企业提前获取测试任务样本,针对榜单内固定物体、固定动作场景专项微调模型权重,刻意降低陌生场景权重分配。有的是针对真机榜单的硬件调优,锁定专用测试样机,调试关节阻尼、运动速度适配榜单任务,规避通用工况的严苛约束。此外,个别厂商还可能针对一些榜单挑战赛的规则,利用自己注册的评测账号不断测试、刷新评分。

  刘兴亮指出,破解榜单“虚假繁荣”,关键不是取消榜单,而是把考试从“做题”变成“实战”。在他看来,具身大模型榜单需从以下几个方面加以改进:一是评测标准要统一。现有的评测在环境设置、硬件配置、测试条件等方面都不同,不同模型间很难进行公平对比,唯有制定更统一的标准,才能提高结果的可复现性。二是需要引入盲测,测试任务不能全部提前公开,最终排名应由隐藏测试集、陌生物体、陌生场景决定,以此达到防“刷榜”,真正测试机器人泛化能力的目的。三是将仿真测试与真机测试结合起来,验证机器人在物理世界的可靠性。

  “目前,具身智能还处于发展的早期阶段,评价更多围绕单项能力、实验性能、技术参数展开,目的在于证明技术路线是否成立。随着产业进入应用阶段,评价体系会逐渐转向综合能力,由技术展示驱动转向产业价值驱动。”赵至江说,一个成熟的产业,通常不会依赖技术性的榜单作为评价标准,而是形成由行业标准、第三方测试和市场反馈共同构成的评价体系。“具身智能距离这一阶段还有较长过程,三到五年甚至更长的时间都是有可能的。”赵至江表示。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
申请5000辆 结果只批10辆!特斯拉Robotaxi车队在内华达州被带紧箍咒

申请5000辆 结果只批10辆!特斯拉Robotaxi车队在内华达州被带紧箍咒

快科技
2026-08-18 18:59:05
养老金月入过万群体的心声:年轻人不生娃,不交社保,自私自利,还拖垮了社会养老体系

养老金月入过万群体的心声:年轻人不生娃,不交社保,自私自利,还拖垮了社会养老体系

舒山有鹿
2026-08-09 11:56:27
女人承诺儿子考600分给他个惊喜,儿子考643分回家,推门却愣住了

女人承诺儿子考600分给他个惊喜,儿子考643分回家,推门却愣住了

兰姐说故事
2025-07-16 00:00:07
接了个顺风车,乘客列了10条要求,把司机看懵了

接了个顺风车,乘客列了10条要求,把司机看懵了

网约车观察室
2026-08-18 10:21:33
中国,有必要打一场立威之仗吗?

中国,有必要打一场立威之仗吗?

清沐执笔
2026-07-17 16:30:42
“摸奶子”再惹争议,OPPO的流量反噬开始了

“摸奶子”再惹争议,OPPO的流量反噬开始了

品牌头版
2026-05-13 10:18:15
10000mAh泰坦电池 小米首款万级电池手机来了

10000mAh泰坦电池 小米首款万级电池手机来了

PChome电脑之家
2026-08-18 10:09:59
中国已经成为全球第一个集体拒接电话的国家

中国已经成为全球第一个集体拒接电话的国家

黯泉
2026-06-26 10:44:35
四字弟弟谈顶级白富美!军艺校草也吃窝边草!

四字弟弟谈顶级白富美!军艺校草也吃窝边草!

八卦疯叔
2026-08-18 11:27:51
给老人的忠告:永远不要在女婿、儿媳妇面前,表现出以下4种行为

给老人的忠告:永远不要在女婿、儿媳妇面前,表现出以下4种行为

热心市民小黄
2026-06-23 15:10:51
记者:阿尔瓦雷斯考虑在转会窗结束后更换经纪人

记者:阿尔瓦雷斯考虑在转会窗结束后更换经纪人

懂球帝
2026-08-19 01:32:06
“我突然不爱女儿了!”单亲妈妈公开表达厌恶:我下班回家还得伺候她

“我突然不爱女儿了!”单亲妈妈公开表达厌恶:我下班回家还得伺候她

泽泽先生
2026-08-17 14:28:39
文班亚马:代表法国出战的意义比代表马刺更加重大

文班亚马:代表法国出战的意义比代表马刺更加重大

体坛周报
2026-08-18 20:45:34
克林顿:我后悔让乌克兰放弃核武器,其次是让中国加入世贸组织

克林顿:我后悔让乌克兰放弃核武器,其次是让中国加入世贸组织

战域笔墨
2026-07-19 06:34:29
当今有4个国家最危险,一是印度,二是土耳其,另外两个才是重点

当今有4个国家最危险,一是印度,二是土耳其,另外两个才是重点

书写传奇
2026-08-18 22:27:18
哈佛发现:10种食物最能长肌肉,第一名多数人家里没有

哈佛发现:10种食物最能长肌肉,第一名多数人家里没有

今日养生之道
2026-08-09 09:38:49
CCTV5直播,中国女篮VS美国女篮,最后两人敲定,五大球星领衔!

CCTV5直播,中国女篮VS美国女篮,最后两人敲定,五大球星领衔!

体坛小快灵
2026-08-18 09:01:58
把耿彦波再度捧上神坛,是一个危险信号

把耿彦波再度捧上神坛,是一个危险信号

老萧杂说
2026-08-17 07:22:29
中华人民共和国正式向全世界宣告两件大事:

中华人民共和国正式向全世界宣告两件大事:

叶葉夜
2026-08-17 22:56:14
小米澎程换电池供应商,雷军:经过1230项严苛测试

小米澎程换电池供应商,雷军:经过1230项严苛测试

大厂财经社
2026-08-18 08:04:50
2026-08-19 03:00:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4465799文章数 9319关注度
往期回顾 全部

科技要闻

英伟达的资本局:从AI卖铲人到AI央行

头条要闻

女子称住民宿被员工打开房门看光:我全裸在擦身体

头条要闻

女子称住民宿被员工打开房门看光:我全裸在擦身体

体育要闻

中国男篮,一直被质疑,永远被期待

娱乐要闻

蓝盈莹官宣新恋情

财经要闻

一场酒局献祭,掀开了杭州地产潜规则

汽车要闻

试驾银河TT:兼顾操控与舒适,年轻人出行好搭子

态度原创

时尚
教育
本地
艺术
数码

松弛感白衬衫,要配牛仔裤才时髦啊

教育要闻

“就业率”最高的5所大学,不是清华北大,学生还没毕业就被签走

本地新闻

邂逅活珊瑚的西沙,感受独属于国人的浪漫

艺术要闻

这才是真正的“降维打击”!当他们的仙女图一出,所有古风美女都黯然失色!

数码要闻

杨元庆:AI可能局部过热,但远未结束

无障碍浏览 进入关怀版