网易首页 > 网易号 > 正文 申请入驻

OpenAI o3 模型基准测试成绩遭质疑,实测分数远不及宣称

0
分享至

IT之家 4 月 21 日消息,OpenAI 的 o3 人工智能模型的第一方与第三方基准测试结果存在显著差异,引发了外界对其公司透明度和模型测试实践的质疑。

去年 12 月,OpenAI 首次发布 o3 模型时宣称,该模型能够在 FrontierMath 这一极具挑战性的数学问题集上正确回答超过四分之一的问题。这一成绩远远超过了竞争对手 —— 排名第二的模型仅能正确回答约 2% 的 FrontierMath 问题。OpenAI 首席研究官 Mark Chen 在直播中表示:“目前市场上所有其他产品在 FrontierMath 上的成绩都不足 2%,而我们在内部测试中,使用 o3 模型在激进的测试时计算设置下,能够达到超过 25% 的正确率。”

然而,这一高分似乎是一个上限值,是通过一个计算资源更为强大的 o3 模型版本实现的,而并非是 OpenAI 上周公开发布的版本。负责 FrontierMath 的 Epoch 研究所于上周五公布了其对 o3 模型的独立基准测试结果,发现 o3 的得分仅为约 10%,远低于 OpenAI 此前声称的最高分数。

这并不意味着 OpenAI 故意撒谎,该公司在 12 月份公布的基准测试结果中也包含了一个与 Epoch 测试结果相符的较低分数。Epoch 还指出,其测试设置可能与 OpenAI 有所不同,并且其评估使用了更新版本的 FrontierMath。Epoch 在报告中写道:“我们与 OpenAI 的结果差异可能是因为 OpenAI 在内部评估时使用了更强大的计算框架、更多的测试时计算资源,或者是因为这些结果是在 FrontierMath 的不同子集上运行的(例如 2024 年 11 月 26 日版本的 180 个问题与 2025 年 2 月 28 日私有版本的 290 个问题)。”

此外,ARC Prize 基金会(一个测试了 o3 预发布版本的组织)在 X 平台上发布消息表示,公开发布的 o3 模型是一个“针对聊天 / 产品使用进行了调整的不同模型”,这进一步证实了 Epoch 的报告。ARC Prize 还指出:“所有发布的 o3 计算层级都比我们测试的版本要小。”一般来说,更大的计算层级通常可以获得更好的基准测试分数。

值得注意的是,尽管公开版本的 o3 未能完全达到 OpenAI 测试时的表现,但这在一定程度上已不再是关键问题,因为该公司后续推出的 o3-mini-high 和 o4-mini 模型在 FrontierMath 上的表现已经优于 o3。此外,OpenAI 计划在未来几周内推出更强大的 o3 版本 o3-pro。

然而,此事再次提醒人们,人工智能基准测试结果最好不要完全照单全收,尤其是当结果来自一家有产品需要销售的公司时。随着人工智能行业竞争的加剧,各供应商纷纷急于通过推出新模型来吸引眼球和市场份额,基准测试“争议”正变得越来越常见。

IT之家注意到,今年 1 月,Epoch 因在 OpenAI 宣布 o3 之后才披露其从 OpenAI 获得的资金支持而受到批评。许多为 FrontierMath 做出贡献的学者直到公开时才知道 OpenAI 的参与。最近,埃隆・马斯克的 xAI 被指控为其最新的人工智能模型 Grok 3 发布了误导性的基准测试图表。就在本月,Meta 也承认其宣传的基准测试分数所基于的模型版本与提供给开发者的版本不一致。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
数千万波斯人,不伺候阿塞拜疆权贵了?伊朗今夜,就是百年前清末

数千万波斯人,不伺候阿塞拜疆权贵了?伊朗今夜,就是百年前清末

南宗历史
2026-01-10 16:15:24
坚决不能要!必须永久踢出CBA联赛!杜锋爱将重返广东队失败

坚决不能要!必须永久踢出CBA联赛!杜锋爱将重返广东队失败

砚底沉香
2026-01-14 01:18:49
渤海完全属于中国!因当年毛主席的一句话,如今没有一艘外船敢进

渤海完全属于中国!因当年毛主席的一句话,如今没有一艘外船敢进

抽象派大师
2025-12-11 17:05:41
82岁港星回应与陈慧琳亲戚关系真相:你搞谁都不可以搞她

82岁港星回应与陈慧琳亲戚关系真相:你搞谁都不可以搞她

风月得自难寻
2026-01-13 21:48:31
哈登季后赛纪录遇转机?快船靠东部之旅“回血”

哈登季后赛纪录遇转机?快船靠东部之旅“回血”

大眼瞄世界
2026-01-13 21:40:25
“人还没登机,学校没了!”370所美国大学或将倒闭…

“人还没登机,学校没了!”370所美国大学或将倒闭…

化学人生
2026-01-11 20:30:12
在岸人民币兑美元(CNY)北京时间03:00收报6.9795元,较周一夜盘收盘跌62点

在岸人民币兑美元(CNY)北京时间03:00收报6.9795元,较周一夜盘收盘跌62点

每日经济新闻
2026-01-14 05:41:05
结三次婚、两度丧子,59岁无儿无女,王晶为何说张卫健一点都不惨

结三次婚、两度丧子,59岁无儿无女,王晶为何说张卫健一点都不惨

情感大头说说
2026-01-14 01:55:52
马卡报调查:多数球迷认为弗洛伦蒂诺和球员应对皇马现状负责

马卡报调查:多数球迷认为弗洛伦蒂诺和球员应对皇马现状负责

懂球帝
2026-01-14 07:49:08
被兄弟"做局"夺走300亿公司,坐牢10年的赌徒CEO出来了

被兄弟"做局"夺走300亿公司,坐牢10年的赌徒CEO出来了

帅真商业
2025-12-16 21:08:37
国籍争议不到1年,人民日报公开点名谷爱凌,邓亚萍的话有人信了

国籍争议不到1年,人民日报公开点名谷爱凌,邓亚萍的话有人信了

阅微札记
2025-12-22 14:28:33
丈夫想先睡妻子,妻子和情夫都不同意,2015年丈夫把他俩都杀了

丈夫想先睡妻子,妻子和情夫都不同意,2015年丈夫把他俩都杀了

汉史趣闻
2026-01-03 19:21:52
海归光环已经消失?49.5万留学生涌回国,残酷真相:企业只认这个

海归光环已经消失?49.5万留学生涌回国,残酷真相:企业只认这个

鬼菜生活
2026-01-12 11:46:20
出席蒋经国纪念音乐会!蒋万安引名言:今天不做明天就会后悔

出席蒋经国纪念音乐会!蒋万安引名言:今天不做明天就会后悔

新时光点滴
2026-01-14 06:02:50
越来越多孩子得白血病?医生坦言:家里4样东西是祸根,趁早扔了

越来越多孩子得白血病?医生坦言:家里4样东西是祸根,趁早扔了

DrX说
2025-11-19 14:42:09
央视《小城大事》遭痛批?年代剧是要接地气,但绝不是“接地府”

央视《小城大事》遭痛批?年代剧是要接地气,但绝不是“接地府”

世界更加宽广
2026-01-12 16:04:31
多名家庭成员被渗透 商人成蒋超良“大管家”

多名家庭成员被渗透 商人成蒋超良“大管家”

环球网资讯
2026-01-13 20:19:31
在伊朗华商:这一次,伊朗非死不可!为什么伊朗“非死不可”?

在伊朗华商:这一次,伊朗非死不可!为什么伊朗“非死不可”?

黑翼天使
2026-01-14 06:09:59
链式崩塌:俄罗斯深陷乌克兰泥潭,从加沙到德黑兰

链式崩塌:俄罗斯深陷乌克兰泥潭,从加沙到德黑兰

高博新视野
2026-01-11 19:32:04
斯诺克大师赛:第5个6-2,8强决出第5席,中国00后一轮游

斯诺克大师赛:第5个6-2,8强决出第5席,中国00后一轮游

阿错田间生活
2026-01-14 01:27:02
2026-01-14 08:35:00
IT之家
IT之家
爱科技,爱这里 - 前沿科技人气平台
324404文章数 606879关注度
往期回顾 全部

科技要闻

美国放宽对英伟达H200芯片出口中国的管制

头条要闻

媒体:赖清德训练打巷战 解放军无人机可直接"斩首"

头条要闻

媒体:赖清德训练打巷战 解放军无人机可直接"斩首"

体育要闻

他带出国乒世界冠军,退休后为爱徒返场

娱乐要闻

蔡卓妍承认新恋情,与男友林俊贤感情稳定

财经要闻

"天量存款"将到期 资金会否搬入股市?

汽车要闻

限时9.99万元起 2026款启辰大V DD-i虎鲸上市

态度原创

时尚
艺术
数码
公开课
军事航空

今年春天,外套长一点会更美!

艺术要闻

世界各地的男女厕所标志, 看得都大笑了!

数码要闻

MiniLED背光技术2.0时代来了 RGB架构电视今年冲击40万台

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美再发安全警告 敦促美公民立即离开伊朗

无障碍浏览 进入关怀版