OpenAI在7月10日正式向全球全量开放GPT-5.6系列模型,一口气推出旗舰版Sol、均衡版Terra和性价比版Luna三款产品,当天陆续覆盖ChatGPT、Codex和API。
这次发布的核心叙事只有一个词:性价比。
三款模型的定价分别是Sol每百万Token输入/输出5/30美元、Terra 2.5/15美元、Luna 1/6美元。最低档Luna的价格仅为Anthropic旗舰模型Fable5的十六分之一。十六分之一的价格,基准得分却超过了对手——这个信号再明确不过了。
Sol:旗舰的碾压与短板
在跨55个行业的Agents' Last Exam评测中,Sol以53.6分超出Claude Fable5达13.1个百分点。即便只开中档推理,也高出11.4分,而成本仅约对方四分之一。
编程领域更是Sol的主场。在Artificial Analysis编程智能体指数上,Sol以80分刷新纪录,输出Token不到Fable5的一半,耗时和成本均大幅缩减。
但Sol并非全面碾压。在SWE-Bench Pro上Sol得分64.6%,仍低于Fable5的80%和Mythos5的80.3%。最难的FrontierMath Tier4数学题,Sol的65.9%甚至不如上代GPT-5.5的72.5%,而Fable5高达87.8%。在深度工程和前沿数学领域,Anthropic依然握着优势。
Terra和Luna:真正的性价比武器
相比Sol的旗舰定位,Terra和Luna才是这次发布中最值得关注的产品。
Luna以Fable5十六分之一的成本,在多项基准测试中得分仍超过Fable5。这对于预算敏感的开发者来说是实实在在的降维打击——过去要在性能和价格之间做取舍,现在最低档就能覆盖大部分日常任务。
GPT-5.6还引入了ultra模式,最多协调16个智能体并行工作,在BrowseComp测试中以92.2%刷新纪录,网络安全领域的ExploitBench得分也从47.9%飙升至73.5%。
三国杀:OpenAI、Anthropic、智谱AI
这场AI军备竞赛中出现了三个玩家。
OpenAI用价格战压缩对手空间,以Sol守住高端、Terra覆盖主流、Luna抢占长尾。Anthropic在深度推理和前沿数学领域继续守住壁垒,Fable5和Mythos5在SWE-Bench Pro和FrontierMath上仍有显著优势。
中国玩家也未缺席。智谱AI在6月底发布的开源模型GLM-5.2,在编程和长程任务能力上已达国际先进水平。据The Verge报道,多位研究人员认为GLM-5.2在部分漏洞挖掘和网络安全测试场景中的表现,已能与Anthropic旗下Mythos相媲美。当Fable5因出口管制全球关停时,GLM-5.2的开源策略为开发者提供了可靠替代。
三强格局让这场竞赛更有悬念。
对开发者意味着什么
GPT-5.6的全量开放标志着AI开发进入新阶段:模型能力不再是唯一标尺,同等预算下能完成多少实质性工作,才是企业真正关心的核心指标。
三档定价本质上是在告诉开发者:不要再拿一个模型打天下了。把简单任务路由到Luna、日常开发用Terra、最难的问题交给Sol——这种分层使用策略正在成为新的开发范式。谁先适应这种思维方式,谁就能在成本和质量之间找到最优解。
欢迎来评论区聊聊你的看法;另外如果读到这里觉得有收获,欢迎关注,后续还有更多硬货。
-5.6
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.