网易首页 > 网易号 > 正文 申请入驻

OpenAI发布权威AI科研基准,扯下AI遮羞布:奥赛金牌≠一流科学家!

0
分享至


新智元报道

编辑:艾伦

【新智元导读】OpenAI最新发布的FrontierScience基准,试图用真实的博士级难题,从物理、化学、生物三个维度上考验AI。真相是残酷的:在没有唯一标准答案的科研实战中,AI作为「顶级做题家」,距离真正的科学家,还差得远。

OpenAI在2025年12月16日发布了一套新基准FrontierScience,用来衡量AI在物理、化学、生物三门学科里,能否做到接近专家水准的科学推理,而不只是背知识点。



OpenAI在文中把科学工作描述成一套更接近「持续试错」的流程。

提出假设,设计验证,推翻再重来,还要把不同领域的线索拼成同一张图。

模型越强,问题就越尖锐,AI能不能把这种深推理用到真正的科研推进上。

OpenAI提到,过去一年他们的系统在国际数学奥林匹克和国际信息学奥林匹克上达到了金牌级表现,同时更重要的变化发生在实验室和办公室里。

研究者开始拿这些模型做跨学科文献检索,跨语言读论文,也拿它们去推复杂证明。

有些原本要耗掉几天甚至几周的工作,被压到几小时就能跑完一轮。

为什么需要FrontierScience?OpenAI给了一个对比。

2023年11月,GPQA这个由博士专家撰写、强调「谷歌搜不到」的科学题库发布时,GPT-4只拿到39%,低于专家基线74%。

两年后,GPT-5.2在同一基准上拿到92%。

当旧题库逐渐被刷穿,新的尺子就必须更长,否则你看不出模型还能往哪里发展。

FrontierScience的设计更像是给模型丢进两种不同的「科学难关」。

一类偏竞赛风格,考你在约束条件下把推理做到干净利落。


物理竞赛题示例

另一类更贴近研究现场,要求你在开放问题里把思路走通,哪怕没有标准答案那么工整。


物理科研问题示例

这套评测总量超过700道文本型题目,其中160道属于「黄金组」(Gold Set)题目。

竞赛赛道有100道题,强调短答案形式,便于核验对错。

研究赛道有60个原创研究子任务,由博士阶段或更资深的研究者设计,用10分制评分,拿到至少7分才算通过。


题目质量是有充足保障的:

竞赛赛道和42位前国际奖牌得主或国家队教练合作,总计109枚奥赛奖牌;

研究赛道由45位合格科学家与领域专家参与,覆盖从量子电动力学到合成有机化学,再到进化生物学等细分方向。

OpenAI还承认了一个不那么「中立」的细节。

两套题在制作流程里会刻意淘汰OpenAI自家内部模型已经能答对的题,因此这套评测对OpenAI自家模型可能更苛刻一些。

与此同时,他们开源了两套赛道的「黄金组」题目,其余题目保留,用来追踪数据污染。

OpenAI说,短答案适合机器判定,但研究型任务需要更细颗粒度的量表,于是他们用GPT-5充当模型判卷员,对照短答案逐项打分。

理想状态是请专家逐题批改,现实是规模不允许,于是规则被设计成尽量客观且可被模型检查,并配了验证流程来校准难度与正确性。

成绩单上,OpenAI给出了一轮初测对比。

他们评测了GPT-5.2、Claude Opus 4.5、Gemini 3 Pro、GPT-4o、OpenAI o4-mini、OpenAI o3等模型。OpenAI表示,GPT-5.2在竞赛题上得分77%,在研究题上得分25%,目前领先;Gemini 3 Pro在竞赛题上拿到76%,紧跟其后。


更值得注意的是失败原因。

OpenAI从答题记录里总结,前沿模型仍会犯推理、逻辑和计算错误,会卡在冷门概念上,也会出现事实性偏差。

另一个很朴素的观察也被写进正文:模型想得更久,准确率往往更高。


OpenAI对FrontierScience的边界也直言不讳。

它把科研切成可控的题目,这让评测更标准化,但也意味着它更像一张高清截图,而不是科研的全景纪录片。

尤其是它不评估模型能否提出真正新颖的假设,也不覆盖它与多模态数据和现实实验系统打交道的能力。

接下来,OpenAI计划迭代题库、扩展领域,并配套更多真实世界评估,看这些系统究竟让科学家多做成了什么。

奥赛金牌≠一流科学家,AI距离成为真正能独当一面的一流科学家,还有很长的路要走完。

参考资料:

https://openai.com/index/frontierscience/

秒追ASI

⭐点赞、转发、在看一键三连⭐

点亮星标,锁定新智元极速推送!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
出大事了!美国两大行强行冻结中企4000万,中企硬核反击,太解气

出大事了!美国两大行强行冻结中企4000万,中企硬核反击,太解气

霁寒飘雪
2026-05-12 16:48:12
"就业难我是不承认的,主要是年轻人不肯吃苦",教授出马一个顶俩

"就业难我是不承认的,主要是年轻人不肯吃苦",教授出马一个顶俩

走读新生
2026-05-12 02:01:01
爷爷最后一面不见,姥姥录音骂卖国!张本智和,你赢了世界输了家

爷爷最后一面不见,姥姥录音骂卖国!张本智和,你赢了世界输了家

曹老师评球
2026-05-01 13:49:39
农村光棍没减少,又冒4个扎心怪象,热闹背后全是难念的经

农村光棍没减少,又冒4个扎心怪象,热闹背后全是难念的经

老特有话说
2026-05-12 15:30:33
王励勤多次劝说无果!樊振东深夜发声,国乒藏着怎样的现实?

王励勤多次劝说无果!樊振东深夜发声,国乒藏着怎样的现实?

运动探索
2026-05-12 11:08:54
释永信被一女子爆料:她们姐妹住少林寺3天,争着往释永信房间跑

释永信被一女子爆料:她们姐妹住少林寺3天,争着往释永信房间跑

江山挥笔
2026-03-23 15:40:31
手机顶部出现这4个图标,马上关机!你的手机可能正在被人控制

手机顶部出现这4个图标,马上关机!你的手机可能正在被人控制

职场资深秘书
2026-05-10 13:51:21
94岁周贤珍:一人过母亲节,住养老院精神矍铄,演员女儿在日本

94岁周贤珍:一人过母亲节,住养老院精神矍铄,演员女儿在日本

白面书誏
2026-05-11 18:24:20
一个被窝睡不出两种人,离婚又复婚的梁靖崑,如今过的怎样?

一个被窝睡不出两种人,离婚又复婚的梁靖崑,如今过的怎样?

错过美好
2026-03-01 03:01:04
首钢2:1淘汰广东晋级四强,赵睿的受伤让许利民醍醐灌顶

首钢2:1淘汰广东晋级四强,赵睿的受伤让许利民醍醐灌顶

李广专业体育评论
2026-05-12 21:54:02
太痛心!河北美女张霞去世!仅27岁,颜值惊艳,结婚刚满一年

太痛心!河北美女张霞去世!仅27岁,颜值惊艳,结婚刚满一年

北纬的咖啡豆
2026-05-12 09:43:05
在名为“统治东方”的地方,让东方人去庆贺?海参崴阅兵未免过了

在名为“统治东方”的地方,让东方人去庆贺?海参崴阅兵未免过了

历史摆渡
2026-05-10 18:55:03
原来林诗栋的姐姐是她!藏了十几年身份曝光,日本队输得一点不冤

原来林诗栋的姐姐是她!藏了十几年身份曝光,日本队输得一点不冤

老黯谈娱
2026-05-12 12:57:16
深度长文:地球,就是宇宙中的一粒尘埃!看完之后你会释然!

深度长文:地球,就是宇宙中的一粒尘埃!看完之后你会释然!

宇宙时空
2026-05-10 10:12:03
韩国一季度GDP增速居全球首位

韩国一季度GDP增速居全球首位

财闻
2026-05-12 09:11:45
“看傻眼了”!深圳一女子要卖房,才发现学位莫名被锁!区教育局:忘撤销了

“看傻眼了”!深圳一女子要卖房,才发现学位莫名被锁!区教育局:忘撤销了

南方都市报
2026-05-12 08:07:19
特朗普拒绝中方要求,美媒提醒他:中国并不期待,别摆架子

特朗普拒绝中方要求,美媒提醒他:中国并不期待,别摆架子

说历史的老牢
2026-05-11 15:43:20
不会复刻2020欧洲杯,德拉富恩特:世界杯一定会召满26人

不会复刻2020欧洲杯,德拉富恩特:世界杯一定会召满26人

懂球帝
2026-05-12 17:18:42
悉尼妹化身性感大雷女巨人!《亢奋》新一集曝福利

悉尼妹化身性感大雷女巨人!《亢奋》新一集曝福利

手工制作阿歼
2026-05-12 17:27:15
路费已曝光,特朗普2天后抵华,上飞机前对中国表态,措辞不寻常

路费已曝光,特朗普2天后抵华,上飞机前对中国表态,措辞不寻常

影孖看世界
2026-05-11 19:14:27
2026-05-12 22:39:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
15194文章数 66863关注度
往期回顾 全部

科技要闻

宇树发布载人变形机甲,定价390万元起

头条要闻

新电动车到手不足一月频繁自动锁死 老人被摔伤五六次

头条要闻

新电动车到手不足一月频繁自动锁死 老人被摔伤五六次

体育要闻

总是掉链子的“倒霉蛋”,闯进了欧战决赛

娱乐要闻

白鹿风波升级!掉粉20万评论区沦陷

财经要闻

黄仁勋真是被白宫彻底封杀了

汽车要闻

吉利银河“TT”申报图曝光 电动尾翼+激光雷达

态度原创

时尚
亲子
本地
手机
军事航空

普通人真该学学如何穿搭!多穿裙子比裤子更时髦,大方提气质

亲子要闻

amh值0.95怎么调理?吃什么可以让卵泡长得好又大又圆?

本地新闻

用苏绣的方式,打开江西婺源

手机要闻

iOS 26.5正式版发布,端对端加密RCS信息支持

军事要闻

知情人士披露:美国或考虑恢复对伊朗军事行动

无障碍浏览 进入关怀版