网易首页 > 网易号 > 正文 申请入驻

OpenAI、Grok、Meta三大模型先后发布,谁是性价比之王?

0
分享至


©有界UnKnown原创

作者丨山茶

编辑|钱江

一夜之间,美国大模型集体上新了。

先是SpaceX AI/X AI,率先发布了Grok-4.5;然后是Meta推出Muse Spark 1.1,再然后是OpenAI,推出GPT-5.6,还一次性端出来三个版本:SolTerraLuna

虽然一次性发布的模型有点多,让人眼花缭乱,但这些模型都有一个共同点。

那就是,能力上去了,价格下来了,大家都在拼命强调性价比

比如扎克伯格在X上宣布Muse Spark 1.1时,第一句话就提到:Muse Spark 1.1,一款功能强大的大力和编码模型,价格非常实惠。

马斯克的Grok-4.5,也将性价比作为这次更新最重要的卖点。Grok官方账号官宣Grok-4.5发布时的描述是,Grok-4.5提供前沿智能,同时具备领先的速度和成本效率。

OpenAI更是直接,它将新版GPT-5.6分成了三个版本,Sol(旗舰版)、Terra(均衡版)、Luna(平价版),可以让大家按需取用。

想要性能的,可以用贵的,在意价格的,可以用便宜的。

那么,在这一轮新模型中,谁是性价比之王,谁又会成为版本新贵呢?



偏谁是性价比之王

大家都在争性价比,那么这一轮发布的新模型,谁的性价比最高呢?

我们可以从价格和能力来对比一下。

首先是能力,因为各家测试,披露的维度都各不相同,我们尽量找同一维度来进行对比。

三家模型最大的交集是编码能力,这也是目前AI大厂在重点竞争的领域。

编码项大家都披露的维度主要是两个:Terminal-Bench 2.1(AI使用电脑的能力)和SWE-Bench Pro(真实项目的代码修复能力)。

具体评分如下:


这个口径下,GPT-5.6 Sol第一,Terra第二,Grok-4.5第三,Luna和Grok很接近,MuseSpark-1.1最后。

但要注意,Grok-4.5SWE-Bench Pro上的得分是64.7,是三款模型中表现最好的。

当然,各家也都披露了DeepSWE(AI能不能完成更长、更开放的工程任务)的得分。

但各家测评的版本有所不同,GPT-5.6MuseSpark-1.1测评的是DeepSWE1.1,Grok-4.5披露的是DeepSWE1.0,这两项的指标有所不同。

GPT-5.5为例,其测评标准从DeepSWE1.0换成DeepSWE1.1,得分是所有提高的。

如果按照这个角度,把DeepSWE纳入考虑的话,GPT-5.6三个版本仍然整体压过Grok-4.5MuseSpark-1.1,但MuseSpark-1.1被甩开的差距就会有点大。


当然,MuseSpark-1.1也有自己独特的优势。

比如在包括MedScribeTaxEvalHarvey's Legal Agent Bench的专业能力上,Muse Spark1.1就成为现在行业里公开表现最好的模型(SOTA)。

其中,MedScribe是指模型能不能根据医患对话,生成合格的医疗记录;axEval 测的是模型回答复杂税务问题的能力;Harvey's Legal Agent Bench则是测试大模型/智能体能不能完成真实法律工作。


当然,要谈性价比,光有能力还不行,还有比价格

目前,MuseSpark-1.1价格最便宜,按一百万token算,其输入价是1.25美元,输出价格是4.25美元,整体价格是5.5美元。

性能最好的GPT-5.6 Sol显然最贵,一百万token输入价格是5美元,输出价格是30美元,综合价格达到35美元。

Grok4.5处在中间,输入2美元/百万token,输出6美元/百万token,综合价格8美元/百万token,仅比GPT-5.6 Luna版本贵一点点。

但需要注意的是Grok官方表示,Grok 4.5单个任务消耗的Token仅为同级领先模型的一半。


所以,结合价格整体来看。

GPT-5.6 Luna应该是综合性价比最高的价格接近低价档,但编码、终端任务、长上下文能力明显强,1.05M上下文也是大优势。

其次是MetaMuseSpark-1.1价格最便宜,且在法律、税务、医疗、工具调用、电脑操作、多模态图表上表现亮眼,Agent/专业工具任务性价比最高。

然后是Grok-4.5,如果按“每百万token单价”算,Grok-4.5不是最便宜;但如果按“完成一个代码/工程任务的总token、步骤数和速度”算,Grok-4.5很可能是编码场景下性价比最高的模型。

至于GPT-5.6 SolGPT-5.6 Terra,我理解它更偏向纯性能玩家的选择,价格几乎不成为考虑的因素。


傲越过山丘 才发现中国模型在等候?

不管怎么说,性价比已经成为了现在模型最重要的衡量标准。

OpenAICEO Sam Altman还在GPT-4.5发布后专门提到,我们已经听到了企业对成本的担忧......


但这件事情其实是有背景的,那就是在过去的几个月里,大量美国公司正在抛弃OpenAIAnthropic,转而使用DeepSeek智谱千问等更具性价比中国模型

OpenRouter(一个让开发者能够访问多种AI模型的平台)的数据显示,2025年上半年,中国模型在该平台上消耗的token占比仅有4.5%,过去12个月平均占比也只有11%。但从今年2月份以来,中国AI模型token消耗占比每周都保持在30%以上,最高曾升至46%。


美国公司集体拥抱中国模型,关键原因就是性价比

在能力上,中国的AI模型和OpenAIAnthropic比起来或许还有一些差距,但是架不住价格仅有Anthropic/OpenAI同类模型的10%-40%。

美国一家AI公司的创始人在X上表示,他在6月初已经将公司100%的流量从Anthropic切换到DeepSeek V4;这个行为为公司节省数百万美元,并且还在许多使用场景下看到实际性能的提升。

具体可以参看我们之前发布的文章:

在这次几家模型陆续发布之后,美国专业的模型测评机构Artificial Analysis还做了一个测评,这个测评纳入了中美的主流模型,测评其完成跨行业完成真实任务的能力,以及对应每项任务花费的平均成本

Artificial Analysis给出的这个框架下,能力越强,价格越低的模型更具有优势,其对应的区间是左上角的第二象限。

这个象限中,除了Gork-4.5之外,基本上都是中国模型,比如DeepSeek V4Pro,小米的MiMo-V2.5 pro,MiniMax-M3。(GPT-5.6系列和MuseSpark-1.1还未纳入)


在这一轮美国头部厂商的模型发布之前,中国AI模型凭借性价比优势,已经在逐渐打开了美国市场。

这一次模型的发布,美国头部的模型厂商相当于重新稳住了阵线,并抢回了话语权。

但市场的竞争从来不是线性的,更不会由一次模型发布决定最终胜负。

中国模型已经证明,性价比并不是一个只在本土市场成立的优势,它同样可以转化为全球开发者的真实选择和市场份额。

所以接下来,模型厂商比拼的不会只是榜单上高出几个百分点,也不会只是每百万Token便宜几美元,而是谁能用更低的总成本,更稳定地完成更多真实任务。模型调用价格、任务所需Token、执行速度、成功率以及工具和生态能力,都将被放到同一张账单上计算。

这意味着,大模型竞争正在进入一个更加残酷、也更加务实的阶段:性能领先不再等于商业领先,价格便宜也不会成为永久壁垒

* 文中配图均来自网络

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
医院的实习生能闯多大的祸?网友:世界就是个巨大的草台班子

医院的实习生能闯多大的祸?网友:世界就是个巨大的草台班子

康富贵碎碎念
2026-07-21 13:23:22
日本人评价抗美援朝:中国若是不出兵,美国根本打不到鸭绿江边,可中国偏偏去了,这仗西方复盘了70多年都没搞懂

日本人评价抗美援朝:中国若是不出兵,美国根本打不到鸭绿江边,可中国偏偏去了,这仗西方复盘了70多年都没搞懂

磊子讲史
2026-07-15 15:33:52
在哪一瞬间,你意识到那个人不能深交?

在哪一瞬间,你意识到那个人不能深交?

康富贵碎碎念
2026-07-20 13:42:06
中国球员4人入围美网单打正赛!郑钦文等10人将从资格赛打起!

中国球员4人入围美网单打正赛!郑钦文等10人将从资格赛打起!

7号观察室
2026-07-21 05:25:21
英媒:恩佐是本届世界杯“最令人反感球员”,补时染红全场仅2射门

英媒:恩佐是本届世界杯“最令人反感球员”,补时染红全场仅2射门

宇宙来信发
2026-07-20 14:15:03
9月中小学开学新调整!学生直呼“坏消息”,家长总算松一口气

9月中小学开学新调整!学生直呼“坏消息”,家长总算松一口气

李博世财经
2026-07-21 12:47:26
这 4 大岗位将被移出事业编!

这 4 大岗位将被移出事业编!

职场资深秘书
2026-07-21 13:23:28
这枚回旋镖突然扎向项立刚,他能安然逃脱吗?

这枚回旋镖突然扎向项立刚,他能安然逃脱吗?

壹家言
2026-07-20 09:28:30
谢贤去世 最让人唏嘘的不是谢霆锋 是为谢家延续香火的前儿媳张柏芝

谢贤去世 最让人唏嘘的不是谢霆锋 是为谢家延续香火的前儿媳张柏芝

可乐谈情感
2026-07-21 03:37:04
中资向英国发布声明:你们困难的时候我们帮了你,现在却背信弃义

中资向英国发布声明:你们困难的时候我们帮了你,现在却背信弃义

阿龙聊军事
2026-07-20 20:54:08
12省公布上半年GDP:河南不敌四川,上海近2.8万亿,江西发力!

12省公布上半年GDP:河南不敌四川,上海近2.8万亿,江西发力!

别人都叫我阿腈
2026-07-21 12:16:26
1951年陈锡联请毛主席给炮校题词,主席:炮是火字旁还是石字旁?

1951年陈锡联请毛主席给炮校题词,主席:炮是火字旁还是石字旁?

浩渺青史
2026-07-21 05:24:02
空气真能当饭吃,中国二氧化碳造淀粉,领跑全球一个身位

空气真能当饭吃,中国二氧化碳造淀粉,领跑全球一个身位

华山穹剑
2026-07-20 21:56:29
圣母心泛滥!为救一匹死马,四名女游客硬刚秃鹫,遭全网热议

圣母心泛滥!为救一匹死马,四名女游客硬刚秃鹫,遭全网热议

奇思妙想生活家
2026-07-21 00:27:27
央视:钨球暴雨从天而降:PHL-191空爆弹药改写现代战场压制规则

央视:钨球暴雨从天而降:PHL-191空爆弹药改写现代战场压制规则

止戈军是我
2026-07-21 06:55:08
哀悼!北京大学夏蒙棼教授逝世

哀悼!北京大学夏蒙棼教授逝世

双一流高校
2026-07-21 01:30:34
广西壮族自治区政府副秘书长梁磊,拟任新职!“90后”曾祥文,拟提名县市区政府副职!

广西壮族自治区政府副秘书长梁磊,拟任新职!“90后”曾祥文,拟提名县市区政府副职!

时尚的弄潮
2026-07-21 11:27:50
胡塞武装宣布对沙特实施海上封锁

胡塞武装宣布对沙特实施海上封锁

参考消息
2026-07-21 14:13:17
22个国家向美国施压后,美国喊话伊朗,休战10天,伊朗回应亮了

22个国家向美国施压后,美国喊话伊朗,休战10天,伊朗回应亮了

起喜电影
2026-07-21 02:38:15
红遍大江南北的刘欢,嗜酒如命患上不死癌症,早已走上一条不归路

红遍大江南北的刘欢,嗜酒如命患上不死癌症,早已走上一条不归路

打小我就醜
2026-07-19 01:05:10
2026-07-21 15:00:49
有界UnKnown incentive-icons
有界UnKnown
记录时代发展,讲好产业故事。
124文章数 59关注度
往期回顾 全部

科技要闻

智谱暴跌,Kimi只是导火索

头条要闻

11岁男孩被泳池排水口吸住溺亡:在水下挣扎约3-5分钟

头条要闻

11岁男孩被泳池排水口吸住溺亡:在水下挣扎约3-5分钟

体育要闻

西班牙队夺冠游行庆典:200万人,狂欢5小时

娱乐要闻

谢贤遗产几乎全给了2个孙子

财经要闻

百虾竞速上车:4条路线争夺车载AI话语权

汽车要闻

热爱驾驶的更棒选择 极氪8X让大块头也有大乐趣

态度原创

时尚
艺术
本地
数码
公开课

今年夏天“这条裤子”居然流行回来了!时髦的人都在穿

艺术要闻

山林溪艺术中心开馆主题展览《连续的清晨》启幕

本地新闻

2026暑期旅行新灵感:跟着影视去旅行

数码要闻

技嘉多款AORUS INFINITY硬件上架电商,7月24日10:00解禁

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版