网易首页 > 网易号 > 正文 申请入驻

刚刚,GPT-5.6 正式发布,史上最强但被自己坑惨了

0
分享至

就在刚刚,GPT-5.6 系列正式发布,不过,它并没有直接全面开放,而是以「有限预览」的方式先行试水。


作为 OpenAI 最强的一代,GPT-5.6 一口气端出三款型号,名字起得颇有诗意:

Sol(太阳)是旗舰模型,也是 OpenAI 口中目前最强的模型;

Terra(地球/大地)是面向日常工作的平衡型模型,性能可以与 GPT-5.5 竞争,同时价格便宜一半;

Luna(月亮)主打速度和低成本,是 GPT-5.6 系列中最便宜的模型。

从这命名方式来看,奥特曼私底下没少学习 Anthropic 营销的精髓。而借着 GPT-5.6 的发布,OpenAI 也顺手把命名体系重新梳理了一遍:

数字表示代际,Sol、Terra、Luna 对应不同能力层级,便于区分智能水平、速度与成本。产品定位上,Sol 面向高难复杂任务,Terra 覆盖日常工作流,Luna 主打低成本调用。

换句话说,GPT-5.6 不只是一次能力升级,也是 OpenAI 对模型产品线的一次重新分层。


https://openai.com/index/previewing-gpt-5-6-sol/

GPT-5.6 深夜突袭,能力全系霸榜

作为 OpenAI 迄今最强模型。GPT-5.6 Sol 的能力展示,主要集中在编程、生物信息学和网络安全三个方向。

这三类场景有一个共同特征:

复杂、长链条、强依赖上下文。模型需要在任务中持续规划、推理、调用工具、修正错误,并不断推进流程。OpenAI 把这种能力称为 agentic capabilities——让模型更像一个能独立执行任务的 agent。

在编程场景中,GPT-5.6 Sol 已经不再停留在代码补全,而是深入到命令行环境中的复杂操作。

OpenAI 称,Sol 在 Terminal-Bench 2.1 上刷新了表现。Terminal-Bench 2.1 测试的是命令行工作流,任务要求模型具备规划、迭代和工具协调能力。


基准测试成绩显示,GPT-5.6 Sol Ultra 在 Terminal-Bench 2.1 上得分 91.9%,GPT-5.6 Sol 得分 88.8%。作为对照,GPT-5.5 为 88.0%,GPT-5.6 Terra 为 82.5%,GPT-5.6 Luna 为 84.3%。

横向对比其它模型,Claude Mythos 5 为 84.3%,Claude Fable 5 为 83.4%,Claude Opus 4.8 为 78.9%,Gemini 3.1 Pro Preview 为 70.7%。


Sol Ultra 的成绩,也对应 GPT-5.6 的核心功能。

一方面,max 级别的推理强度让模型可以投入更多时间进行深度推理;另一方面,新增的 Ultra 模式会调度多个子 Agent,把复杂任务拆分处理,再统一汇总结果。

在真实开发场景里,模型经常需要理解项目结构、读取文件、修改代码、运行命令、分析报错、继续修改。一个复杂任务通常无法靠一次回答完成。Ultra 模式的方向,是让多个子 Agent 分别处理不同环节,再把结果汇总起来,从而提高复杂任务的完成效率。

生物方向上,GPT-5.6 Sol 的提升体现在 GeneBench v1 上。这个评测主要面向长周期基因组学和定量生物分析任务。OpenAI 称,Sol 相比 GPT-5.5 取得了更强结果,而且使用的输出 tokens 更少。




向左滑动查看更多内容

这一点对科研场景尤为关键。生物信息学、基因组学和定量生物分析,经常需要模型持续分析数据、解释结果、选择方法、比较假设,并在多轮操作中保持上下文一致。模型能不能完成这类任务很重要,能不能用更低 tokens 成本完成长链条分析同样重要。

如果 Sol 能在更少输出 tokens 下取得更强结果,意味着它在专业科研工作流中有更好的成本效率。对实验室、企业研发团队和生物医药场景来说,tokens 消耗直接影响调用成本,也影响模型能否进入大规模工作流。

网络安全则是 GPT-5.6 Sol 最敏感的能力方向。

OpenAI 称,Sol 是其迄今最强的网络安全模型,能够推进长周期安全任务的性能和效率边界,包括漏洞研究和 exploitation 相关任务。

在 ExploitBench 上,GPT-5.6 Sol 的表现接近 Mythos Preview,但只使用了大约三分之一的输出 tokens。


同时,OpenAI 还提到 ExploitGym——一个由 UC Berkeley 联合多家前沿实验室打造的评测体系,用于衡量模型在安全任务中的能力。随着推理能力提升,Sol、Terra、Luna 在这一领域都有明显进步。


不过,OpenAI 对这部分表述明显踩了刹车。

官方强调,Sol 更擅长发现和修复漏洞,还不能稳定完成端到端攻击。在涉及 Chromium 和 Firefox 的评估中,Sol 可以识别 bug 和程序缺陷,也就是漏洞利用的基础组件,但在测试条件下没有自主生成可运行的完整攻击链。

基于这些结果,OpenAI 判断GPT-5.6 Sol 尚未跨过 Preparedness Framework 中的网络安全关键风险阈值。


System Card :https://deploymentsafety.openai.com/gpt-5-6-preview/introduction

这种踩刹车的判断显然是为了避免重走「Mythos」的老路。

一方面,OpenAI 要证明 Sol 在网络安全任务上确实强了很多;另一方面,它也要说明 Sol 还没有达到必须极端限制的风险级别。更讽刺的是,这种压力很大程度上来自 OpenAI 自己参与塑造的 AI 行业炒作叙事。

与此同时,OpenAI 也承认,基准测试无法覆盖所有现实用法。没有任何评测可以代表所有产品配置、多步骤攻击和真实工作流。模型可能被接入其他工具,也可能被放进更复杂的攻击链条里。

正是这种不确定性,让 GPT-5.6 的发布方式变得格外谨慎。

性能最强,但戏份却给了 AI 安全

GPT-5.6 的发布说明中,安全罕见地占据了较大篇幅。

OpenAI 为 Sol、Terra、Luna 配置了分级防护体系,能力越强,防护越严,目标是在压制攻击性用途的同时保留代码审查、漏洞研究等合法场景。

模型层面,系统被训练为拒绝违规网络安全请求,即便用户尝试伪装或绕过。生成阶段引入实时分类器,对高风险内容进行检测与拦截,必要时交由更强模型复核。账号层面则结合跨对话行为与风险信号,识别持续性滥用。

这套机制被称为分层安全栈,涵盖模型拒答、实时检测、账号审查、差异化访问与持续测试。多层协同用于应对复杂滥用,同时尽量减少对正常工作的干扰。

面向企业客户,OpenAI 还提出了隐私保护检测、自主安全控制以及风险分级访问等方案,试图在安全与数据保护之间找到平衡点。


为了避免重蹈覆辙,OpenAI 在自动化红队测试上投入了超过70 万 A100 等效 GPU 小时,重点寻找通用 jailbreak(越狱),并辅以专家人工测试。OpenAI 还建立快速响应流程,对新漏洞进行复现、评估与修复,并纳入持续评测体系。

可用性方面,GPT-5.6 目前仍处于有限预览阶段。

OpenAI 表示,模型将先通过 API 和 Codex 向一部分可信合作伙伴开放,随后再逐步扩展到 ChatGPT、Codex 和更广泛的 API 用户。

同时,OpenAI 也强调,自己相信前沿模型应该尽可能广泛地开放,并计划在未来几周内,让 GPT-5.6 Sol、Terra 和 Luna 进入更普遍的可用状态。


看起来评价不太妙

价格体系也同步公布:

按每百万 tokens 计费,Sol 输入 5 美元、输出 30 美元;Terra 输入 2.5 美元、输出 15 美元;Luna 输入 1 美元、输出 6 美元。


同时,GPT-5.6 引入了更可预测的 prompt caching 机制,支持显式 cache breakpoints,并提供至少 30 分钟缓存生命周期。缓存写入按未缓存输入价格的 1.25 倍计费,读取则享受 90% 折扣。

当然,想要用上还需要一些时日,OpenAI 宣布 GPT-5.6 Sol 将在 7 月登陆 Cerebras,最高速度可达每秒 750 tokens。这个版本初期同样只面向部分客户开放,后续会随着容量扩展逐步放开。

换句话说,GPT-5.6 的「有限预览」并不只是产品灰度发布,更是一套安全验证流程。OpenAI 需要在能力、风险与开放之间,找到一个可控的平衡点。

前沿模型发布节奏,进入新周期

两周前,Anthropic 停用了其最强模型之一 Fable 5,因为美国政府要求该公司限制美国境内外外国公民使用相关模型,理由是国家安全。

而在 GPT-5.6 的发布流程中,第一批使用用户同样不完全由 OpenAI 自己决定。

OpenAI 在官方博客中披露,在发布前已向美国政府展示 GPT-5.6 的能力与发布计划。根据美国政府要求,模型将以有限预览形式上线,仅向少数可信合作伙伴开放,并且这些合作伙伴的信息已与政府共享。


《华盛顿邮报》的报道提到,美国联邦政府将审核哪些公司可以访问 OpenAI 的最新技术。且目前只有获得美国政府批准的公司可以访问新模型,个人用户没有申请通道。

彭博社则报道称,GPT-5.6 首批开放对象约为 20 家合作伙伴,其中一个入口可能是亚马逊的 Bedrock 平台。

对此,OpenAI 的态度显然是有些模凌两可。OpenAI 在博客中表示,不认为美国政府参与模型访问流程应当成为长期默认机制,因为这会让最好的工具远离用户、开发者、企业、网络防御者和全球合作伙伴。


但现实是,OpenAI 仍选择接受这一安排,理由是希望争取更广泛开放,同时与美国政府共同制定一套可复制的模型发布流程。

这一变化背后,是前沿 AI 模型逐渐被纳入国家安全框架。

过去,新模型发布主要是公司产品节奏问题。现在,一旦模型在编程、网络安全、生物和代理式工作流上跨过新的能力区间,发布节奏就可能被纳入安全和出口控制讨论。

对 OpenAI 来说,GPT-5.6 既是一次旗舰模型预览,也是一次政策试探。OpenAI 需要证明 Sol 足够强,也需要证明安全体系足够严密,还要在美国政府审查和商业开放之间找到可执行路径。

如此复杂的发布流程,某种程度上也「剧透」了前沿 AI 未来的魔幻走向:当模型能力逼近关键阈值,使用资格与使用方式,将成为比性能更为关注的事项。

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
哈马斯宣布:放弃在加沙执政 时隔20年参加巴勒斯坦立法委员会选举

哈马斯宣布:放弃在加沙执政 时隔20年参加巴勒斯坦立法委员会选举

红星新闻
2026-08-14 16:03:14
晚上7点半!CCTV5+直播“中乌二番战”,赵继伟或复出,郭士强力争两连胜

晚上7点半!CCTV5+直播“中乌二番战”,赵继伟或复出,郭士强力争两连胜

后仰跳投绝杀
2026-08-14 17:23:30
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
特朗普老婆跑了?美国第一夫人销声匿迹,夫妻大难临头各自飞?

特朗普老婆跑了?美国第一夫人销声匿迹,夫妻大难临头各自飞?

历史的游荡者
2026-08-14 12:56:54
朝鲜导弹顶到基辅鼻子底下,北约却连个屁都不敢放!这世界怎么了

朝鲜导弹顶到基辅鼻子底下,北约却连个屁都不敢放!这世界怎么了

浯江孤舟
2026-08-12 11:15:07
曝马竞1.2亿欧巨星已在队内道歉:自知无法加盟巴萨 承诺仍会拼命

曝马竞1.2亿欧巨星已在队内道歉:自知无法加盟巴萨 承诺仍会拼命

风过乡
2026-08-14 08:16:13
明起施行!广场舞扰民个人最高可罚1000元,驾驶私自改装的机动车“炸街”,最高可罚2000元

明起施行!广场舞扰民个人最高可罚1000元,驾驶私自改装的机动车“炸街”,最高可罚2000元

每日经济新闻
2026-08-14 19:11:24
海港九分钟三球3-2客胜三镇,安佩姆双响,李昂绝平无效

海港九分钟三球3-2客胜三镇,安佩姆双响,李昂绝平无效

懂球帝
2026-08-14 21:34:03
如果马寅初没有提出人口论,没有实施计划生育,如今中国会怎样?

如果马寅初没有提出人口论,没有实施计划生育,如今中国会怎样?

墨策史
2026-08-12 22:21:27
A股几乎全军覆没,CPO、光通信、存储芯片“独活”,谁在导演这出戏?

A股几乎全军覆没,CPO、光通信、存储芯片“独活”,谁在导演这出戏?

财报翻译官
2026-08-14 11:21:37
请保姆12年踩过不少坑后,我想告诉大家:保姆再好,也不能对她做这三件事

请保姆12年踩过不少坑后,我想告诉大家:保姆再好,也不能对她做这三件事

小马达情感故事
2026-08-14 19:10:06
NBA官宣完整赛程!10大球星回归战敲定 4队拥有最多全美直播场次

NBA官宣完整赛程!10大球星回归战敲定 4队拥有最多全美直播场次

罗说NBA
2026-08-14 04:53:45
完结9.3分!这五部近期最佳美剧,值得通宵去看

完结9.3分!这五部近期最佳美剧,值得通宵去看

来看美剧
2026-08-14 20:04:55
上海市关于公开征集涉黑涉恶违法犯罪线索的通告

上海市关于公开征集涉黑涉恶违法犯罪线索的通告

环球网资讯
2026-08-14 20:40:26
吕继宏:22次登上春晚,父母离世无妻无子,66岁却把余生留给了她

吕继宏:22次登上春晚,父母离世无妻无子,66岁却把余生留给了她

飘飘然的娱乐汇
2026-08-13 21:50:07
一手好牌打稀烂!歌坛天后跟“活佛”生下孩子,如今现状令人唏嘘

一手好牌打稀烂!歌坛天后跟“活佛”生下孩子,如今现状令人唏嘘

小椰的奶奶
2026-08-13 07:01:45
甘肃省“70后”副省长程晓波主动投案,曾任国家发改委副秘书长

甘肃省“70后”副省长程晓波主动投案,曾任国家发改委副秘书长

界面新闻
2026-08-14 16:43:13
美史上第一位痴呆总统?特朗普疑似痴呆,专家预测:他很快会辞职

美史上第一位痴呆总统?特朗普疑似痴呆,专家预测:他很快会辞职

各生欢喜者
2026-08-14 16:29:32
新疆兵团为啥不能撤?看完2026真实数据,瞬间看懂国家布局

新疆兵团为啥不能撤?看完2026真实数据,瞬间看懂国家布局

心灵得以滋养
2026-08-01 02:28:35
震惊!40岁华裔“天才”币圈大佬全裸坠亡

震惊!40岁华裔“天才”币圈大佬全裸坠亡

大厂财经社
2026-08-13 01:19:01
2026-08-14 21:51:00
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6684文章数 26895关注度
往期回顾 全部

科技要闻

苹果为中国训练自有大模型,阿里提供支持

头条要闻

媒体:《纽约时报》连发三篇报道 戳破台当局虚幻想象

头条要闻

媒体:《纽约时报》连发三篇报道 戳破台当局虚幻想象

体育要闻

离开雷霆后,威少再也没成为威少

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

便利蜂加盟遭立案:“0元加盟”生意被查

汽车要闻

吉克隽逸选车和选歌一样绝!新锐动感SUV 长安启源Q06

态度原创

本地
艺术
数码
手机
军事航空

本地新闻

黄景藏用半刀泥刻瓷都魂

艺术要闻

赵孟頫67岁写的《绝交书》,字字摆脱俗气,台北故宫“压箱底”之宝!

数码要闻

DDR5太贵逼退玩家!13、14代酷睿需求暴涨断货:Intel都没想到

手机要闻

性能续航大满贯!荣耀WIN2系列10月亮相:万级电池+2nm芯片

军事要闻

特朗普下令美海军弃用电磁弹射系统 改回蒸汽弹射

无障碍浏览 进入关怀版