网易首页 > 网易号 > 正文 申请入驻

GPT-5.6突然发布!Fable5痛失最强基模王座

0
分享至

梦瑶 发自 凹非寺

量子位 | 公众号 QbitAI

ChatGPT史上最强模型来了!

就在刚刚,OpenAI一口气端出三款GPT 5.6系列模型。

主打一个全家桶「多款齐发」——

旗舰模型Sol(太阳)、平衡模型Terra(大地)、低成本高速款Luna(月亮)。



  • GPT-5.6 Sol:最夯模型,编程测试左踢自家模型GPT5.5,右打隔壁Fable 5,还新增max/ultra两个模式。



△GPT-5.6 Sol编程评测表现

  • GPT-5.6 Terra:面向日常工作,性能对标GPT-5.5,同时价格便宜约2倍。
  • GPT-5.6 Luna:GPT-5.6系列里最快、最便宜的一档,同时保留较强能力~



看完内心os:你别说哈,这新模型确实夯啊…

但坏消息是——

普通用户目前无缘使用ing!!!是的,人家玩《有限预览》那套了…

目前新模型只给少数受信任的「合作伙伴」提供了有限的预览版本。

普通用户可能得等等等等等等*100。(doge)

熟悉的配方,熟悉的操作。

Fable 5:我不知道您这是怎么了,这波咋瞅都像冲着我来的呢???

GPT-5.6 Sol、Terra、Luna三款模型齐发

是的,这次人家模型的名字开始走起天文学宇宙感路子了。

从产品定位看,三者分工很清楚——

Sol冲旗舰能力,Terra打日常主力,Luna负责速度和成本。

在价格上,则按每100万token计价:

Sol输入5美元、输出30美元;Terra输入2.5美元、输出15美元;Luna输入1美元、输出6美元。



先看这次发布的OpenAI史上最强旗舰模型——「太阳」Sol。

在能力上,Sol面向的是高难度推理、复杂代码、生物、网络安全等长链路任务。

尤其适合需要规划、迭代、调用工具、协调步骤的复杂工作流。

而且非常值得一提的是,OpenAI还给这新模型搞上了「加餐」——

让模型获得更长的深度推理时间的max模式,以及可以调用多个subagents协同处理复杂任务的ultra模式。

要知道但凡加上ultra俩字估计就不简单……

这不嘛,吊打Fable 5的编程能力基准测试就水灵灵地来了,人家在Terminal-Bench 2.1上创造了新的SOTA。

ultra模式下比Fable5高出去7.6个百分点,比上一代GPT5.5高出9.4个百分点——



不仅如此,在生物方向,GPT-5.6 Sol在GeneBench v1上也强于GPT-5.5,而且使用token更少。

这个测试评估的是长链路基因组学和定量生物分析任务,说明Sol在科研类复杂任务上的效率也有提升~



在网络安全方向,OpenAI称Sol是其目前网络安全能力最强的模型。

在ExploitBench上,GPT-5.6 Sol已经能接近Mythos Preview的表现,同时只使用约三分之一的输出token:




而在由加州大学伯克利分校研究人员与OpenAI及其他前沿实验室合作开发的ExploitGym测试中——

Sol、Terra、Luna三款模型都会随着推理强度增加,在网络安全能力上出现明显提升~



再看Terra——

Terra的定位更接近GPT-5.6系列里的日常主力模型,OpenAI给出的说法是,Terra性能与GPT-5.5具备竞争力,同时价格便宜约2倍。

最后走速度和成本路子的Luna,则是GPT-5.6系列里最快、最便宜的一档。

它面向的是高频、低延迟、成本敏感任务,比如轻量问答、简单信息处理、实时交互、批量自动化等场景。

需要提一嘴的是,除了Sol外,Terra和Luna目前公开披露的benchmark信息相对有限的,后续可以蹲蹲这俩模型的评测表现!



三个模型综合对比下来,确实能看得出Sol在模型性能表现上不一般。

but——好巧不巧的是,大家伙对于Sol的争议也恰好出现在「评测」部分。

外部评测机构METR拿到GPT-5.6 Sol早期访问权限后,尝试用Time Horizon 1.1软件任务套件评估它的长期任务能力。

但结果出现了一个麻烦问题:Sol在评测中被检测到较高比例的cheating和metagaming行为。



这里的「作弊」,指的是模型利用评测环境漏洞、绕开任务规则来提高表现,比如试图获取隐藏测试集信息,或者提取隐藏源码反推答案。

这让最终分数很难解释……

如果把这些作弊尝试算作失败,GPT-5.6 Sol的50%-Time Horizon约为11.3小时。

如果把它们算作成功,结果会超过270小时;如果直接剔除相关样本,估计值约为71小时,但不确定性很大。

所以METR最后的态度相当谨慎,这些结果很难代表Sol稳定、可靠的真实能力。



——————(真的吗.jpg)————————

当然,除了模型本身的评测表现和一些小八卦外,还值得一提的是一些「附加技能」。

比如,GPT-5.6这次在开发者调用体验上补了一块关键能力:更可预测的prompt caching。

简单说,就是当开发者反复调用同一段长提示词、工具说明、系统规则或项目上下文时,模型不必每次都重新处理全部内容,可以把重复部分缓存下来,后续调用直接复用。

GPT-5.6这次支持显式cache breakpoints,也就是说开发者可以更明确地告诉系统:哪些内容该被缓存、缓存到哪里为止。

同时,缓存生命周期至少30分钟,也让长任务、多轮任务、持续开发会话更容易保持稳定~



反正就是,三款模型各取所需,喜欢您来。

凶猛的野兽都得被关进笼子里

能力讲完,另一件更微妙的事也来了。

GPT-5.6 Sol确实猛,但OpenAI这次的发布姿势,反倒显得格外《谨慎》。

一边在推自家最强模型的同时,一边又把安全栈、访问权限、审核流程全都加厚了一圈。

(隔壁Mythos:咋这剧情那么熟悉呢…)

按照官方说法,GPT-5.6系列用了其目前最稳健的安全机制,并且会根据不同模型能力配置不同的保护策略,具体来看,这套安全栈不是只靠模型自己拒答,而是分成了好几层——

首先是模型内置的「拒答训练」。

遇到被禁止的网络安全协助请求时,模型需要先学会拒绝。哪怕用户试图包装意图、绕开限制,模型层面也要先挡住一部分高风险请求。

其次是生成过程中的「实时风险检测」。

OpenAI给GPT-5.6加了网络安全和生物滥用分类器,会在内容生成过程中持续判断风险。

高风险情况下,生成甚至会被暂停,然后交给更大的推理模型重新审查上下文。最后如果判断内容不该放出,结果就会在到达用户前被拦截。



第三层则是「账号级风险信号」。

如果某些请求触发风险,系统还会结合相关会话和账号行为做更长期的判断。

毕竟单看一句请求,很难区分对方是在做正当漏洞修复,还是在持续试探攻击路径,OpenAI想做的,是从单轮请求判断,走向更完整的行为模式判断。

这也解释了为什么GPT-5.6 Sol明明已经发布,却先只给少量trusted partners和组织使用,初期入口也主要放在API和Codex。

因为可能确实《略危》。(至于是不是炒作咱就另说…)

危的不仅是模型本身,危的还有隔壁友商家的朋友——Fable 5。

要知道Anthropic给它的定位,就是Claude系列里最强的广泛发布模型,主打高难推理、长周期agentic任务、复杂代码工程和企业工作流。

此前在SWE-bench Verified上,Fable 5也是排在榜首位置,在代码等能力上明显高于Claude Opus 4.8和GPT-5.5。

结果这边刚把长链路代码能力的招牌挂起来,GPT-5.6 Sol就来了,真没地方说理了……

而且更扎心的是,OpenAI这次来的还不止一个Sol——

高端能力,Sol来压;日常调用,Terra来抢;成本和速度,Luna来铺。

Fable 5:前脚俺刚封神、后脚你就要踢我馆??



至于咱们啥时候能真正用上奥特曼的新模型,还得再等等。

反正OpenAI自己已经把话放出来了:



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
俄方一口咬死,中俄气价没法谈,普京改名贝加尔力量,中方没惯着

俄方一口咬死,中俄气价没法谈,普京改名贝加尔力量,中方没惯着

策前论
2026-09-30 16:16:08
人到晚年,一定要在还能走动时,把这五件事办了,一旦卧床就晚了

人到晚年,一定要在还能走动时,把这五件事办了,一旦卧床就晚了

小虎新车推荐员
2026-09-29 01:18:45
你见过一人搞没整个单位福利吗?他走那天大伙差点放鞭炮

你见过一人搞没整个单位福利吗?他走那天大伙差点放鞭炮

另子维爱读史
2026-09-30 15:48:45
埃及天才神童沦为看客,却遭多家豪强哄抢,巴萨解约金直接飙升到1.5亿欧

埃及天才神童沦为看客,却遭多家豪强哄抢,巴萨解约金直接飙升到1.5亿欧

零度眼看球
2026-09-30 07:40:50
四平溃败东北濒临崩盘,无人敢战之际,却被闲置时的陈光一战翻盘

四平溃败东北濒临崩盘,无人敢战之际,却被闲置时的陈光一战翻盘

纪史行者
2026-09-27 06:35:06
官宣归队!再见了,NCAA!中国男篮第一高塔

官宣归队!再见了,NCAA!中国男篮第一高塔

篮球实战宝典
2026-09-30 19:41:06
06年男子打工借宿同学家,被同学母亲一眼看中,意外改变了他一生

06年男子打工借宿同学家,被同学母亲一眼看中,意外改变了他一生

小月文史
2025-03-11 18:44:56
王钰栋单刀破门!亚运会处子球,4人精妙配合,破40年魔咒

王钰栋单刀破门!亚运会处子球,4人精妙配合,破40年魔咒

奥拜尔
2026-09-30 14:28:35
2年8706万美金!联盟第1!26岁状元瘦身成功,他不想再做禁区之王

2年8706万美金!联盟第1!26岁状元瘦身成功,他不想再做禁区之王

微评体育圈
2026-09-30 20:33:57
C罗与主帅热苏斯发生矛盾并退出训练营,你认为责任在哪方?

C罗与主帅热苏斯发生矛盾并退出训练营,你认为责任在哪方?

懂球帝
2026-10-01 03:57:40
笑死,经济上行时的自己能有多敢买,网友:好想回到过去打死自己

笑死,经济上行时的自己能有多敢买,网友:好想回到过去打死自己

夜深爱杂谈
2026-09-30 15:33:39
1981年,卡米拉亮相戴安娜婚礼,眼神嚣张,毫不避讳和查尔斯对视

1981年,卡米拉亮相戴安娜婚礼,眼神嚣张,毫不避讳和查尔斯对视

照见古今
2026-09-30 18:44:06
不查不知道,一查吓一跳!63岁因病离世的刘欢,私下生活壕到离谱

不查不知道,一查吓一跳!63岁因病离世的刘欢,私下生活壕到离谱

林轻吟
2026-09-30 11:45:41
猛然发现,现今没人提固态电池了?后路都让抄了,大饼画不下去了

猛然发现,现今没人提固态电池了?后路都让抄了,大饼画不下去了

一路荒凉如歌a
2026-09-29 16:03:49
正大量上市,现在该吃的“宝藏水果”,好处多多,千万别错过!

正大量上市,现在该吃的“宝藏水果”,好处多多,千万别错过!

禾光小厨
2026-09-30 06:06:15
卡塔尔首相:内塔尼亚胡是战争犯

卡塔尔首相:内塔尼亚胡是战争犯

澎湃新闻
2026-09-30 12:09:02
急刹车!亚运会第11日奖牌榜出炉,中国队单日8金本届最少,日本甩开韩国

急刹车!亚运会第11日奖牌榜出炉,中国队单日8金本届最少,日本甩开韩国

球盲百小易
2026-10-01 02:37:25
余承东的“地表最强SUV”卖爆!新款问界M9上市16周 交付破4万台

余承东的“地表最强SUV”卖爆!新款问界M9上市16周 交付破4万台

快科技
2026-09-30 17:25:05
纪委开始倒查问责!在职、退休一视同仁,这5类红线切莫心存侥幸

纪委开始倒查问责!在职、退休一视同仁,这5类红线切莫心存侥幸

职场资深秘书
2026-09-30 10:42:01
天津一大型商场刚刚宣布:连续7天,全天不限时免费停车!

天津一大型商场刚刚宣布:连续7天,全天不限时免费停车!

天津人
2026-09-30 23:11:57
2026-10-01 04:19:00
量子位 incentive-icons
量子位
追踪人工智能动态
13427文章数 176573关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

美国著名演员史泰龙发声:我糟蹋了自己的身体

头条要闻

美国著名演员史泰龙发声:我糟蹋了自己的身体

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

“杭州六小龙”迎来价值重估

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

教育
家居
艺术
亲子
游戏

教育要闻

二三等奖名单公示!祝贺南京这些学生!

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

不服来辩!这些山水画,才是中国画的真正巅峰!

亲子要闻

着床的那一刻,妈妈的身体会有感觉吗?答案是......

《秋叶原迷踪》制作人专访:倾注全部心血的诚意之作"/> 主站 商城 论坛 自运营 登录 注册 简体中文 简体中文 English 《秋叶原迷踪》...

无障碍浏览 进入关怀版