这个月初 OpenAI 发布了 GPT-6 Astra,称它是“世界上最聪明、对齐做得最好的模型”。能力很强,价格也不低:API 每百万 token 输入 10 美元、输出 50 美元。
今天,OpenAI 把 GPT-6 家族补齐了:中端的GPT-6 Sol,轻量的GPT-6 Luna。Astra 负责最难的任务,其他活交给更便宜的模型。
OpenAI CEO Sam Altman 在 X 上说,Sol 和 Luna 在智能、对齐、工作产出、编码和电脑操作等方面比 5.6 系列有重大改进,每 token 价格只有一半,每任务的价格还要更低。
![]()
▲ 图:Sam Altman 在 X 上介绍 GPT-6 Sol 和 Luna
发布时间也很巧。就在前一天(美国时间 9 月 22 日),Anthropic 发布了 Claude Opus 5.5,同样主打降价和提效。
01 价格:官方说降了一半,要看跟哪个价比
两款模型已经上线 API,名称分别是gpt-6-sol和gpt-6-luna。
每百万 token 价格如下:
![]()
▲ 图:GPT-6 Sol 和 Luna 与 GPT-5.6 同级模型的 API 价格对比
OpenAI 在 X 上的原话是,价格“比 GPT-5.6促销价低 50%”。
8 月下旬 OpenAI 给 GPT-5.6 Sol 做过三个月的限时降价,原价是输入 5 美元、输出 30 美元。按原价算,GPT-6 Sol 输入便宜了 60%,输出便宜了约三分之二。
这次的新价格不是限时的。
OpenAI 产品负责人 Tibo(Thibault Sottiaux)在 X 上说,API 价格是永久降低 50%。他还宣布给 Plus、Pro 和 Business 用户的账户发放一次“banked reset”,按字面意思,是存进账户、需要时再用的一次用量重置。
![]()
▲ 图:OpenAI 产品负责人 Tibo 在 X 上宣布永久降价和用量重置
放在 GPT-6 家族里看,Sol 的单价是 Astra 的五分之一,Luna 又是 Sol 的二十分之一。
和 Opus 5.5 比(输入 4 美元、输出 20 美元),Sol 的单价正好是它的一半。
02 Sol:定位专业工作,主要比成本
OpenAI 几乎每项基准测试都拿 Claude 来对比,比的不只是分数,还有每个任务的成本。以下是官方数据,Claude 的成绩取自公开报告。
最亮眼的是 AutomationBench(跨应用的商业工作流):Sol 在 xhigh 推理强度下得分 33.2%,单任务约 0.27 美元;Claude Opus 5 开到 max 是 26.9%,成本却是 Sol 的 11 倍多。
![]()
在 DeepSWE v1.1(真实代码库中的软件工程任务)上,Sol max 得分 68.8%,比 Claude Fable 5 的最高分低 1.1 个百分点;在 OSWorld 2.0 离线版(电脑操作)上,Sol 和 Claude Opus 5 medium 基本打平,60.5% 对 60.3%。两项的单任务成本都低约 80%。
![]()
要注意,这些成绩多是开到 xhigh 或 max 换来的,Sol 也没有全面领先,卖点是同等水平下便宜很多。
而且 OpenAI 对比的是 Opus 5,不是前一天刚发布、运行成本又降了 40% 的 Opus 5.5。
03 Luna:成本约百分之一,做到上一代中端的水平
Luna 的起点低,提升幅度比 Sol 还大。DeepSWE v1.1 上,Luna max 得分 66.6%,与 Claude Opus 5 和 Fable 5 在 medium 强度下相当;OSWorld 2.0 上,它超过了 GPT-5.6 Sol medium,成本只有后者的十分之一。
上一代要花中端模型的钱才能做的事,现在用轻量模型就能做到相近水平。批量处理、客服、数据清洗这类调用量大的场景,账单会有明显变化。
04 第三方评测:成本减半,分数基本持平
独立评测机构 Artificial Analysis 在发布当天给出了第一份第三方成绩。结论是:成本确实减半,但综合智能分数和 GPT-5.6 基本持平,有的项目进步,有的退步。
在它的 Intelligence Index 上,GPT-6 Sol (max) 跑完一轮任务要 1.06 美元,GPT-5.6 Sol (max) 要 1.99 美元;Luna (max) 是 0.07 美元,上一代是 0.18 美元。
省钱主要靠降价,新模型每个任务的输出 token 其实略多。
![]()
▲ 图:Artificial Analysis 智能指数排名(上),以及智能指数与单任务成本的关系(下)
分数上,Sol (max) 的智能指数是 48,上一代是 47;Luna (max) 和上一代都是 37。
同一榜单上,Claude Opus 5.5 以 58 分排第一。编码 Agent 方面,Sol 比上一代高 2 分,Luna 反而低了 2 分。
幻觉明显减少,但一部分是靠少答题换来的。
Sol (max) 的幻觉率从 92% 降到 60%,它只尝试回答 83% 的问题(上一代是 99%),准确率也从 59% 降到 54%。
知识工作类测试出现了退步。在 GDPval-AA v2.1(基于 OpenAI 的 44 个职业经济价值任务数据集改编)上,Sol 下降约 100 Elo 分,Luna 下降约 75 分。
![]()
▲ 图:GDPval-AA v2.1 排行榜,GPT-6 Sol 和 Luna 均低于各自的上一代
Artificial Analysis 人工检查了数百份模型输出,退步主要是因为交付物的呈现质量下降,以及遗漏了评分标准要求的内容。
05 缓存和说话方式
提示缓存也改进了:默认命中率更高,命中缓存的输入 token 只收原价的一成,缓存写入仍要多付 25%。OpenAI 还加了缓存仪表盘和诊断工具。GitHub 反馈,需要重新处理的提示 token 占比降了 50% 以上。
回答风格上,OpenAI 说新模型更清晰、更少术语,回答整体略短。巧的是,Anthropic 这次也说 Opus 5.5 的表达更自然。
两家同一周都在改“AI 腔”。
06 最早的上手反馈
最有分量的早期反馈来自 Every 创始人 Dan Shipper,他们在团队的真实工作里把 Sol 和 Opus 5.5 做了对比。
他的结论是:Sol 写作接近 Astra,干净简洁;电脑操作上,早期预览版在 6 个较简单任务的 18 次尝试中有 17 次达到 Astra 的水平;但在长时间自主编码上,Opus 5.5 的上限更高。他也吐槽 Codex 新的安全分类器会反复打断已经授权的工作。
总体上,他把 Sol 比作一次“S 版 iPhone 发布”:拿到 Astra 大部分的能力,价格只有五分之一。不过他也承认,Opus 5.5 是这一轮更大的惊喜。
评论区里,有人问为什么没有明显的分数飞跃;也有几位用户贴出报错,在 Codex 里用 ChatGPT 账户登录时提示不支持gpt-6-sol。OpenAI 说当天会逐步推送,这可能只是还没轮到。
07 谁能用
Sol 和 Luna 即日起在 ChatGPT Work 和 Codex 中向 Plus、Pro、Business、Enterprise 和 Edu 用户开放,当天内逐步推送。
![]()
免费和 Go 用户可以在桌面 App 中使用 Luna;API 已同步上线。ChatGPT 普通对话暂未开放,官方没有给出时间。
08 写在最后
把 Astra、Sol、Luna 放在一起看,OpenAI 的思路很清楚:旗舰模型负责拉高上限,中端和轻量模型负责把价格打下来。
但结论要分开看。
官方成绩是 OpenAI 自己测的,对比的是 Opus 5;第三方评测则显示,成本减半是真的,综合分数和上一代基本持平,知识工作类任务还有退步。
所以这一代更像是同样的能力变便宜了,而不是变强了很多。要在具体业务里换模型,最好先拿自己的任务测一轮。
参考资料
01|OpenAI:Introducing GPT-6 Sol and GPT-6 Luna
https://openai.com/index/introducing-gpt-6-sol-and-luna/
02|X:OpenAI 发布推文及回复
https://x.com/OpenAI/status/2102460975790137662
03|X:Artificial Analysis 对 GPT-6 Sol 和 Luna 的评测
https://x.com/ArtificialAnlys/status/2102462962758033624
04|Anthropic:Introducing Claude Opus 5.5
https://www.anthropic.com/claude-opus-5-5
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.