网易首页 > 网易号 > 正文 申请入驻

OpenAI红色警报下的反击:发布GPT-5.2迎战Gemini 3

0
分享至

当谷歌的 Gemini 在各大 AI 排行榜上风头正劲时,OpenAI 终于打出了新的王牌。

周四,这家 AI 巨头发布了 GPT-5.2,称其是迄今为止“最强大的模型”,专为开发者和职场人士打造。


(来源:OpenAI)

这场发布会的时机颇为微妙。

一个月前,OpenAI CEO 山姆·奥特曼(Sam Altman)向内部发出“红色警报”,承认 ChatGPT 面临巨大竞争压力,正在输掉消费市场份额。今天的 GPT-5.2 正是 OpenAI 试图夺回领导地位的关键一步。

同时,今天也是 OpenAI 官宣成立十周年的日子。

GPT-5.2 模型家族包括三个不同版本:Instant、Thinking 和 Pro。

Instant 是速度优化版本,专门处理日常查询,比如信息检索、写作和翻译这类常规任务。

Thinking 则擅长复杂的结构化工作,在编程、分析长文档、数学计算和项目规划方面表现突出。

Pro 则是顶级版本,旨在为最棘手的问题提供最高精度和可靠性。它的运行速度显著慢于其他版本,且成本极其高昂,专为那些准确性高于一切、成本退居其次的重要任务设计。

测试数据表明,Pro 版本是唯一在 ARC-AGI-1 推理基准测试中突破 90% 大关,并在 AIME 2025 数学竞赛中不使用工具就达到 100% 满分的模型。

在 ChatGPT 中,GPT-5.2 的三个版本已经上线,首先面向付费用户开放。OpenAI 表示将在未来几天逐步部署 GPT-5.2,以保持 ChatGPT 尽可能流畅和可靠。

“我们设计 GPT-5.2 就是为了给人们创造更多经济价值。”OpenAI 应用业务 CEO 菲吉·西莫(Fidji Simo)在发布会上表示。她强调,新模型在创建电子表格、制作演示文稿、编写代码、图像识别、理解长文本、使用工具以及处理复杂多步骤项目方面都有显著提升。


(来源:OpenAI)

据其介绍,ChatGPT 企业版的普通用户表示“AI 每天为他们节省 40-60 分钟”,而重度用户每周节省时间“超过十小时”。GPT-5.2 的目标就是进一步扩大这种价值。

OpenAI 表示,GPT-5.2 在多项行业基准测试中创下新纪录。


图 | 多项基准测试成绩(来源:OpenAI)

在涵盖 40 多种职业专业知识的 GDPval 测试中,GPT-5.2 Thinking 的表现达到了专家级水平。根据专业评审的判断,在 70.9% 的情况下,GPT-5.2 Thinking 击败或打平了顶级行业专业人士。这些任务包括制作演示文稿、电子表格和其他各类工作成果。

更重要的是,GPT-5.2 完成这些任务的速度是专业人士的 11 倍以上,成本却不到 1%,不过 OpenAI 并未公布模型 VS 人类的成本是如何计算的。


(来源:OpenAI)

在软件工程领域,GPT-5.2 Thinking 在 SWE-Bench Pro 测试中达到了 55.6% 的新高分。这个成绩也是超过了 Claude 4.5 Sonnet 和 Gemini 3 Pro。在更基础的 SWE-bench Verified 测试中,GPT-5.2 的得分更是达到了 80%。


(来源:资料图)

OpenAI 研究主管艾丹·克拉克(Aidan Clark)解释说,更强的数学能力不仅仅是解方程那么简单。数学推理能力是衡量模型能否遵循多步骤逻辑、保持数字长期一致性、避免可能随时间累积的细微错误的代理指标。

在科学问题方面,GPT-5.2 Pro 在 GPQA Diamond 测试中取得了 93.2% 成绩。GPT-5.2 Thinking 也有 92.4% 的高分。双双打破了 Gemini 3 Pro 保持的纪录。




图 | GPQA Diamond 榜单(来源:OpenAI)

克拉克在发布会上分享了一个案例:团队让一位资深免疫学研究员使用 GPT-5.2 Pro,当研究员要求模型生成关于免疫系统最重要的未解问题时,模型产生了“更敏锐的问题和更有力的解释”,用于说明这些问题为何重要。该研究员认为其表现超过了“所有其他前沿模型”。

在可靠性方面,GPT-5.2 也取得了重要进展。OpenAI 后训练负责人马克斯·施瓦策(Max Schwarzer)指出,在衡量对事实性问题回答的基准测试中,GPT-5.2 Thinking 的幻觉出现率比 GPT-5.1 降低了 38%。


(来源:OpenAI)

长文本理解方面,GPT-5.2 Thinking 同样创下了新纪录。OpenAI 采用 MRCRv2 评估来衡量模型整合分散在长文档中信息的能力。

处理需要跨越数十万 token 相关信息的真实任务时,GPT-5.2 Thinking 的准确性远超 GPT-5.1 Thinking。它是第一个在四针 MRCRv2 测试中(最多 256k token)实现接近 100% 准确率的模型。


(来源:OpenAI)

这意味着专业人士可以更放心地使用 GPT-5.2 处理长文档,如报告、合同、研究论文、记录和多文件项目,同时在数十万 token 范围内保持连贯性和准确性。

在视觉能力方面,GPT-5.2 Thinking 在图表推理和软件界面理解方面的准确率提升近 50%。这意味着模型可以更准确地解读仪表板、产品截图、技术图表和可视化报告,支持更加依赖视觉信息的工作流。

相比之前的模型,GPT-5.2 Thinking 对图像中元素位置的把握更强。例如,在识别主板图像中的组件并返回大致边界框的任务中,即使在低质量图像上,GPT-5.2 也能识别主要区域并放置与每个组件真实位置有时匹配的框,而 GPT-5.1 只能标记少数部分,对空间排列的理解要弱得多。


(来源:OpenAI)

值得一提的是,OpenAI 的新图像生成工具仍然缺位。据报道,奥特曼曾在内部红色警报备忘录中表示,图像生成将是未来的重点,特别是在谷歌的新版 Nano Banana 发布之后。

据报道,OpenAI 计划在明年一月发布另一款新模型,具有更好的图像效果、更快的速度和更好的个性,但尚未得到官方确认。

最后在发布会上,OpenAI 承认在某些方面还有改进空间。比如在 ChatGPT 中,公司正在努力解决过度拒绝等已知问题,同时继续提高回复的可靠性。此外,OpenAI 据传正在考虑开放模型成人内容限制。

对于 OpenAI 来说,GPT-5.2 能否帮助它重新夺回失去的领地,还需要时间来证明。

参考资料:

https://openai.com/index/introducing-gpt-5-2/

https://www.theverge.com/ai-artificial-intelligence/842529/openai-gpt-5-2-new-model-chatgpt

https://techcrunch.com/2025/12/11/openai-fires-back-at-google-with-gpt-5-2-after-code-red-memo/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
不登岛不轰炸!美国深夜一招绝杀:伊朗一天损失2亿,彻底扛不住

不登岛不轰炸!美国深夜一招绝杀:伊朗一天损失2亿,彻底扛不住

和海看日出
2026-04-14 01:21:30
巴黎13岁梯队球员为受歧视的队友出头,被暴力袭击致鼻骨骨折

巴黎13岁梯队球员为受歧视的队友出头,被暴力袭击致鼻骨骨折

懂球帝
2026-04-14 09:53:02
央视封杀!那个靠AI年赚200万的90后夫妻,彻底被扒干净了……

央视封杀!那个靠AI年赚200万的90后夫妻,彻底被扒干净了……

桌子的生活观
2026-04-13 12:41:08
真刚啊,伊朗最多暂停铀5年,特朗普不接受不谈了

真刚啊,伊朗最多暂停铀5年,特朗普不接受不谈了

秦林涛战研社
2026-04-14 16:05:03
每天走多少步最延寿?哈佛研究实锤:这样走路,全因死亡风险降17%

每天走多少步最延寿?哈佛研究实锤:这样走路,全因死亡风险降17%

CHTV百姓健康
2026-04-14 12:00:07
全球最大冰山A23a,没了

全球最大冰山A23a,没了

澎湃新闻
2026-04-12 01:01:07
卫报:伊朗女足队长加巴里被没收的财产已被伊朗方面解冻

卫报:伊朗女足队长加巴里被没收的财产已被伊朗方面解冻

懂球帝
2026-04-14 11:39:07
女篮新骄傲!WNBA选秀大会梦想第43顺位选中冉珂嘉

女篮新骄傲!WNBA选秀大会梦想第43顺位选中冉珂嘉

体坛周报
2026-04-14 11:08:13
吸烟又火了?医生发现:血压高吸烟时,多留意6点,有益健康

吸烟又火了?医生发现:血压高吸烟时,多留意6点,有益健康

岐黄传人孙大夫
2026-04-14 09:30:11
比亚迪紧急回应

比亚迪紧急回应

中国基金报
2026-04-14 10:15:25
孕妇买200元水果被丈夫骂后续:双标到极致,家境曝光,网友劝离

孕妇买200元水果被丈夫骂后续:双标到极致,家境曝光,网友劝离

阿凫爱吐槽
2026-04-04 10:40:39
女子16岁遭邻居性侵后选择原谅,26年后竟下毒将其杀害

女子16岁遭邻居性侵后选择原谅,26年后竟下毒将其杀害

就一点
2026-04-13 23:45:31
王晶曝陈百强真正死因,64岁何超琼颜面尽失

王晶曝陈百强真正死因,64岁何超琼颜面尽失

君笙的拂兮
2026-03-22 03:44:36
海关总署点名“张雪机车”:我国每出口10台内燃机摩托车中,有4台来自中西部地区

海关总署点名“张雪机车”:我国每出口10台内燃机摩托车中,有4台来自中西部地区

红星新闻
2026-04-14 12:31:12
三十多位作家、编辑在五台山遭遇离奇车祸,竟是因为口无遮拦?

三十多位作家、编辑在五台山遭遇离奇车祸,竟是因为口无遮拦?

心灵短笛
2025-04-11 14:08:32
浙大名嘴揭开残酷真相:当年恒大倒台,压根不是因为2万亿负债!

浙大名嘴揭开残酷真相:当年恒大倒台,压根不是因为2万亿负债!

阿器谈史
2026-04-02 13:31:44
回顾“91女神”琪琪:五官出众,却因天真让自己“受伤”

回顾“91女神”琪琪:五官出众,却因天真让自己“受伤”

就一点
2025-11-22 10:36:39
人民日报锐评全红婵遭受网暴,只字不提陈芋汐,却句句不离陈芋汐

人民日报锐评全红婵遭受网暴,只字不提陈芋汐,却句句不离陈芋汐

哄动一时啊
2026-04-13 19:37:27
我妈让我婚前把4套房公证了,领证后,老公果然说:给我弟一套房

我妈让我婚前把4套房公证了,领证后,老公果然说:给我弟一套房

小影的娱乐
2026-04-14 07:17:03
欧媒道破真相:对西方来说,比失败更痛苦的,是看到美国输给中国

欧媒道破真相:对西方来说,比失败更痛苦的,是看到美国输给中国

南宗历史
2026-04-14 10:44:20
2026-04-14 17:07:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
16575文章数 514874关注度
往期回顾 全部

科技要闻

离职同事"炼化"成AI?这届公司不需要活人了

头条要闻

大陆公布十项惠台政策 民进党当局拟封杀

头条要闻

大陆公布十项惠台政策 民进党当局拟封杀

体育要闻

他做对了所有事,却被整个职业网坛放逐了八年

娱乐要闻

宋祖儿刘宇宁恋情大反转 正主火速辟谣

财经要闻

许家印受审当庭表示认罪悔罪

汽车要闻

售12.99万起/续航2000km 风云T9L上市

态度原创

数码
房产
家居
手机
游戏

数码要闻

黄仁勋要造整机:NVIDIA密谋收购大型PC厂商!官方回应

房产要闻

改善标杆,1.5w+起横扫国兴!海口楼市,打出最猛一张牌!

家居要闻

现代融合 自然灵动

手机要闻

REDMI K90 Max续航拉满!8550mAh电池+100W快充 边玩边充不发烫

《FZ地平线6》重磅消息公布:系列最大城市 东京首曝

无障碍浏览 进入关怀版