网易首页 > 网易号 > 正文 申请入驻

GPT-5.2部分基准测试分数超过谷歌,但OpenAI“红色警报”尚未解除

0
分享至

拉响“红色警报”应对谷歌竞争后,当地时间12月11日,OpenAI推出了GPT-5.2,包含GPT-5.2 Instant、Thinking和Pro模式,此时距离OpenAI更新GPT-5.1只过去了一个月。

此次发布GPT-5.2,被外界视为OpenAI应对谷歌挑战的一次反击。上个月谷歌发布Gemini 3后,在硅谷掀起一场AI权力的重新分配,OpenAI作为大模型霸主的地位受到挑战。


不同于GPT-5.1着重强调具有“情绪价值”、能与人愉快交谈,此次应对挑战,OpenAI拿出了更多“真枪实弹”。GPT-5.2推出了更多智能上的更新,也放出了基准测试的分数。可以看到一些基准测试分数提升明显。

例如,在知识型工作任务GDPval测试中,GPT-5.2Thinking的分数为70.9%,明显超过GPT-5.1的38.8%,在抽象推理ARC-AGI-2基准测试中,GPT-5.2Thinking的分数为52.9%,明显超过GPT-5.1的17.6%。另一些基准测试分数也有提升,在软件工程SWE-Bench Pro、科学问题GPQA Diamond、科学图表类问题CharXiv推理、数学竞赛HMMT测试中,GPT-5.2Thinking的分数为55.6%、92.4%、88.7%、99.4%,GPT-5.1为50.8%、88.1%、80.3%、96.3%。

基于这些能力提升,OpenAI称为专业知识型工作打造的GPT-5.2是公司至今最强的模型,“GPT-5.2在众多基准测试中都刷新了行业水平,例如GDPval测试中,这款模型在涵盖44个职业的明确知识型工作任务中表现超过了行业专家。”

谷歌发布的Gemini 3 Pro此前在基准测试榜单中“屠榜”,OpenAI此次在基准测试榜单中终于扳回一局。

据此前谷歌放出的数据,在ARC-AGI-2测试中,Gemini 3 Pro分数为31.1%,远超GPT-5.1的17.6%,GPQA Diamond测试中,Gemini 3 Pro分数为91.9%,超过GPT-5.1的88.1%,这种明显的能力提升当时引来业内人士预言“未来6个月内很难有公司能超越这一成绩”。此次GPT-5.2在上述两项基准测试中得分终于超过了Gemini 3 Pro。不过,记者留意到,当时谷歌放出的一些分数明显超过OpenAI的基准测试,例如Humanity’s Last Exam,此次GPT-5.2并未放出。

OpenAI此次也强调了新模型在专业工作中的可用性,称基准测试得分体现了GPT-5.2在制作演示文稿、电子表格等方面的表现优于或与专业人士持平,生成的电子表格和幻灯片在复杂度和格式呈现上相比前一代有明显提升。不过,用户要使用新的电子表格和演示文稿功能,需要订阅付费套餐。长上下文能力使新模型能处理报告、合同、研究论文等文件。而在编码任务中,GPT-5.2能更可靠地调试生产环境代码、以更少的人工干预完成修复交付。

OpenAI演示了一些编码方面的案例,例如,只需要一个提示,GPT-5.2就能生成一个海浪模拟器、一个节日贺卡生成器。其中,海浪模拟器可以拉动数值,改变风速和海浪高度。OpenAI还强调了GPT-5.2 Thinking的幻觉率低于前一代,在一组去标识的查询中,新模型错误回答的频率比GPT-5.1 Thinking减少了38%。OpenAI称,这意味着在写作、研究、分析和决策中模型犯的错误更少,GPT-5.2 Thinking在图表推理和软件界面理解方面的错误率减少了大约一半。此外,OpenAI称,GPT-5.2 Pro和GPT-5.2 Thinking还是目前最有助于加快科研进展的模型。


GPT-5.2Instant、Thinking和Pro周四在ChatGPT中陆续推出,付费套餐用户将能率先体验。不过,OpenAI应对谷歌等竞争而拉响的“红色警报”,并未随着GPT-5.2的发布而解除。

此前OpenAI CEO山姆·奥尔特曼(Sam Altman)在内部备忘录中承认,随着谷歌等竞争对手的快速进步,公司正面临“氛围紧张”和“经济逆风”的双重挑战。

此次OpenAI则表示,拉响“红色警报”是为了集中资源,是一种明确优先级的方式,公司确实增加了更多与ChatGPT相关的资源。奥尔特曼表示,谷歌发布的Gemini 3对公司的一些指标的影响,比原本预计的更小,但当竞争对手的威胁出现时,应该专注并迅速应对,OpenAI预计在明年1月之前结束“红色警报”状态。

GPT-5.2将不是OpenAI应对竞争抛出的唯一产品,奥尔特曼在社交媒体上表示,下周OpenAI还将送出一些“小小的圣诞礼物”。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
恭喜湖人!冠军中锋来了!老詹东契奇或迎雷霆首发内线哈滕

恭喜湖人!冠军中锋来了!老詹东契奇或迎雷霆首发内线哈滕

湖人侃球师
2026-02-01 06:50:07
轻易把女人约出来的4种方法,坏男人都精通,老实男快学

轻易把女人约出来的4种方法,坏男人都精通,老实男快学

文雅笔墨
2026-01-31 03:31:14
湖人三分出手多但不准,东契奇八村塁难扛大旗,乐福或成破局关键

湖人三分出手多但不准,东契奇八村塁难扛大旗,乐福或成破局关键

不凡体育
2026-02-01 13:08:10
害怕春节被“斩首”?赖清德当局加紧春节备战!模拟解放军突袭机场等关键设施,台军演练短程防空接战、地空整体作战、无人机攻击等

害怕春节被“斩首”?赖清德当局加紧春节备战!模拟解放军突袭机场等关键设施,台军演练短程防空接战、地空整体作战、无人机攻击等

每日经济新闻
2026-01-31 19:15:15
美国华人直言:中国手机扫码支付是最不智能的发明!

美国华人直言:中国手机扫码支付是最不智能的发明!

阿伧说事
2026-01-20 12:53:01
婆婆当了近四十年的老师,今年刚好退休,我还以为退休金最多4000

婆婆当了近四十年的老师,今年刚好退休,我还以为退休金最多4000

五元讲堂
2026-01-26 11:26:26
破旧衣服大叔摸狗后续:狗主人回应,已联系社区帮助,大叔已回家

破旧衣服大叔摸狗后续:狗主人回应,已联系社区帮助,大叔已回家

离离言几许
2026-01-31 11:04:37
蒙哥马利有多痴情?对寡妇贝蒂一见钟情,甘愿做她两个孩子的继父

蒙哥马利有多痴情?对寡妇贝蒂一见钟情,甘愿做她两个孩子的继父

饭小妹说历史
2026-01-17 09:12:37
日本羽毛球界再次诞生超级美少女,韩媒疯狂报道

日本羽毛球界再次诞生超级美少女,韩媒疯狂报道

随波荡漾的漂流瓶
2026-01-22 12:00:14
2月1日,券商给予评级并且给出目标价的公司一览

2月1日,券商给予评级并且给出目标价的公司一览

A股数据表
2026-02-01 06:00:03
中国芯片英雄,被美国囚禁9年后终于回家!他反手把苹果告上法庭

中国芯片英雄,被美国囚禁9年后终于回家!他反手把苹果告上法庭

胖哥不胡说
2026-01-24 18:45:24
中铁建领导、员工薪资大曝光!

中铁建领导、员工薪资大曝光!

黯泉
2026-01-31 22:24:38
28元到5元!“股息奶牛”大秦铁路陨落,21万股民被套真相

28元到5元!“股息奶牛”大秦铁路陨落,21万股民被套真相

慧眼看世界哈哈
2026-01-07 11:54:23
连超湖人太阳升西部第5!华子33分森林狼大胜灰熊 兰德尔27+7+7

连超湖人太阳升西部第5!华子33分森林狼大胜灰熊 兰德尔27+7+7

醉卧浮生
2026-02-01 11:20:02
董璇小酒窝参加朵朵生日会,陈思诚罕见露面,两家人合照太有爱了

董璇小酒窝参加朵朵生日会,陈思诚罕见露面,两家人合照太有爱了

扒虾侃娱
2026-01-31 18:25:21
为什么大多数中国家长无法独立带娃?网友的分享犹如醍醐灌顶

为什么大多数中国家长无法独立带娃?网友的分享犹如醍醐灌顶

另子维爱读史
2026-01-31 20:12:55
最惨首相诞生?高市早苗支持率雪崩,17天豪赌变全民打脸现场!

最惨首相诞生?高市早苗支持率雪崩,17天豪赌变全民打脸现场!

孤单是寂寞的毒
2026-02-01 12:47:43
78岁连路都走不稳还开演唱会,全网骂声一片,她却扬言回馈粉丝

78岁连路都走不稳还开演唱会,全网骂声一片,她却扬言回馈粉丝

林雁飞
2026-01-29 16:31:48
山东省纪委监委最新通报!

山东省纪委监委最新通报!

齐河大视野广告
2026-02-01 10:49:23
马斯克拉响警报:旧世界只剩5年,中国手握的唯一王牌,不是芯片

马斯克拉响警报:旧世界只剩5年,中国手握的唯一王牌,不是芯片

郭蛹包工头
2026-01-30 11:33:20
2026-02-01 13:56:49
第一财经资讯 incentive-icons
第一财经资讯
第一财经官方账号
243196文章数 621383关注度
往期回顾 全部

科技要闻

腾讯元宝宣布:10亿现金红包,今日开抢

头条要闻

媒体:宝可梦十年间三次踩线 可不是简单的"工作失误"

头条要闻

媒体:宝可梦十年间三次踩线 可不是简单的"工作失误"

体育要闻

锁喉吃红牌+扇耳光 英超15人打群架

娱乐要闻

马年春晚第三次联排,多位明星现身

财经要闻

黄仁勋台北"夜宴":汇聚近40位台企高管

汽车要闻

新款宾利欧陆GT S/GTC S官图发布 V8混动加持

态度原创

教育
亲子
艺术
手机
军事航空

教育要闻

高二上学期结束了,英语只有20分怎么办?要如何才能提分?

亲子要闻

萌娃爆笑模仿爸爸打呼噜,逗得妈妈哈哈大笑

艺术要闻

明代隐藏的“草书高手”,他的字无人能模仿

手机要闻

老外看不下去了!吐槽国产手机抄袭iPhone:为了像苹果 3个摄像头里有1个是假的

军事要闻

伊朗民众:伊朗不会屈服于美国霸权

无障碍浏览 进入关怀版