文 | 明晰野望
美股AI交易近日再度遭遇“DeepSeek时刻”。
7月17日凌晨,月之暗面发布新一代旗舰模型——Kimi K3。这个2.8万亿参数的开源模型,在Artificial Analysis智能指数上得分57,综合水平直逼国际两座大山,位列全球第三,仅排在Claude Fable 5和GPT-5.6 Sol之后。
技术能力上追平全球前三,成本上做到对手一半,路线上用开源挑战闭源——K3发布后首个交易日,美股半导体板块出现明显下跌,英伟达单日蒸发1111亿美元。
K3不是最强的模型,但它是最强性价比的模型。它引发的震荡,在于迫使市场系统性重估AI产业链的价值分配。
![]()
7月9日,OpenAI、xAI、Meta同日发布新一代模型。发布会的重心出奇一致:没有一家把“跑分刷新纪录”“参数更大”“智能更强”作为主叙事,取而代之的是分层定价、企业场景以及一场几乎肉眼可见的价格战。
一边是中国模型让美股AI板块再次剧烈重估,一边是美国头部厂商集体放弃“最强智能”的神话叙事。过去两年支撑整个AI行业估值和话语权的“最强模型”崇拜,正在被打破——不是被某一家颠覆,而是“差距”本身被消解了。
大模型的竞争维度,正在从模型参数转向效率闭环。
模型差距在收敛
过去三年,大模型行业赖以生存的商业底层逻辑是“赢家通吃、代差压制”,在绝大多数投资人和创业者的认知里,只要OpenAI或Anthropic能保持一年以上的智能水平代差,那么任何后发者的追赶都会沦为低水平的重复劳动。
然而到了2026年夏天,这场围绕“代差”筑起的护城河正在被多路大军以不同方式无情填平。
一直以来,万亿级参数大模型被视为效果的唯一保证,但模型通过架构优化和长上下文注意力机制的改良,正在彻底打破“体型决定智商”的迷思。
根据OpenAI官方披露的数据,GPT-5.6的中档模型Terra、综合能力已经微幅超越了上一代的全球标杆;而处于最底层的轻量级模型Luna,在多个复杂推理与编码测试中甚至反超了曾经的Claude Opus 4.8。
换句话说,OpenAI今天仅用原本四分之一左右的推理成本,就复现了半年前行业顶级顶配才有的智力产出,旗舰模型“降维打击”的震慑力,正在其内部子系列的分化中逐渐消解。
与此同时,开源梯队集体跟上闭源模型的现实,也证明了大模型之间的代差正不断收敛。
在代码能力测评严苛的SWE-bench Verified榜单上,曾经的高端闭源顶配Claude Opus 4.8得分约为88.6%,采用MIT协议开源、且允许完全本地自部署的DeepSeek V4 Pro,在该榜单上的得分则为80.6%,今年四月份亮相并开源的Kimi K2.6,也同样将成绩保持在了80.2%的第一梯队水准。
在7月17日公布的Artificial Analysis独立测试中,Kimi K3以57分登上综合智能指数全球第三,超过Claude Opus 4.8;在衡量长周期知识工作的AA-Briefcase中位列第二,仅次于Claude Fable 5。另一边,K3还以1677分登顶Arena前端开发榜,压过一众海外闭源模型。
![]()
尽管在长程任务中,顶尖闭源模型依然保有更高的容错率与稳定性,但从各角度的硬核指标看,曾经犹如天堑的技术代差已被压缩到了如今的个位数。
当一个新版本的发布只需要几个月时间就能完成对上一代顶尖模型的超越,“谁最强”这个命题的含金量也不可避免地走向贬值。
差距收敛也在改写市场对大厂的定价。过去两年,A股和港股的头部互联网公司普遍被贴上“模型能力落后”的标签——这个标签一度是拖累估值的重要因素之一。但随着模型能力的差距被压平、追赶所需的时间被缩短,“大厂能不能跟上”这件事的赔率,正在被重新评估。
价格战取代神话叙事
当“最强模型”这个词不再能撑起议价能力,价格就成了下一个战场。而这一轮价格战和过去两年那种“清库存式打折”完全不是一回事——它不是把旧模型甩卖,而是把新旗舰的定价直接向下重构。
最直白的信号来自OpenAI。GPT-5.6一次性被拆成Sol、Terra、Luna三档:最强的Sol每百万Token输入5美元、输出30美元;中档的Terra对半砍到2.5/15美元;最低的Luna下探到1/6美元。
同一款旗舰内部就出现了六倍的价差——这本身就是一次立场转变:厂商开始承认,“最强”并不是每个用户都愿意为之买单的东西。
跟进者立刻出现,同一天,xAI的Grok 4.5把输入价压到2美元,Meta则把Muse Spark 1.1的API首度对外开放,直接定到1.25/4.25美元——头部厂商第一次不再享有价格的品牌溢价。
战火延伸至国内。7月16日,DeepSeek-V4正式版上线,首次引入峰谷分时计费,打破了大模型API“统一单价”的行业惯例。API定价第一次按“使用时段”而不是“能力档位”分层,供需匹配开始取代技术溢价,成为新的定价逻辑。
大模型从“稀缺技术产品”往“水电煤式基础设施”的方向又滑了一步。
![]()
但真正的深水区不在标价,而在每一个Token背后的真实成本。大模型推理里有一条反直觉的规律——用户看的是输出单价,厂商赚的是缓存命中率。长对话、代码仓库、Agent任务里那些重复出现的上下文,每次重新计算一遍就是烧钱,能命中缓存就是印钞。所以各家真正在拼的,不是标价栏里的那几个美元,而是同一段上下文能被重复利用多少次。
腾讯Hy3把缓存命中价打到基础输入价的四分之一;月之暗面开源的Mooncake分离式推理架构声称能在长代码任务里把命中率维持在90%以上——那些动辄几十万字的项目背景,理论上只需要付一次钱。
而Kimi K3首创并开源的Mooncake分离式推理架构,则能在处理高密度的编程任务和长代码仓库时,将真实缓存命中率维持在超90%的区间,意味着那些动辄几十万字的项目背景、数十个历史版本迭代的中间过程,并不需要每次都去付费重新读取。
![]()
从上游模型掀起价格战,到推理引擎成本的降维压榨,大模型的竞争已经演化为一场立体化、链条式的综合战役。模型“够聪明”已经变成入场券,不再是差异点。市场现在真正在问的,不是“谁最聪明”,而是同样一个任务,谁能“又快、又稳、又便宜”地把它跑完。
竞争要件变了
价格和成本迅速下降、模型分数差异持续缩小,既然大家都能把题的分数刷得这么接近,在下半场的终局里,什么才是不可复制、绝对稀缺的核心壁垒?
高价值的“真实工作流数据”算一个。
在美国市场,OpenAI正把自己的产品不断做“重”,他们不满足于仅让ChatGPT当一个“小秘书”,而是把庞大的编程平台Codex直接并入了“ChatGPT Work”生态中,开辟出了企业级高阶Agent的专属战场。
要知道,Codex每周活跃调用人数超500万,而在这之中有超过100万个复杂请求,被用于用户写代码之外的专业文档撰写、繁琐数据排查以及公司项目协作。千万企业最隐秘、最复杂的工作链路流转,就这样被完全截留在了OpenAI的密闭体系之内。
![]()
马斯克收购AI编程工具Cursor的开发企业Anysphere,也是为了增强SpaceX在企业AI工具市场中的布局,方便其将麾下最新的Grok 4.5与Cursor进行联合训练、完成场景层面的深度绑定。
Anthropic旗下的Claude Code不仅把代码编译反馈、系统终端交互通通包装进自己的闭环管道,还通过与LTM等咨询公司合作把业务推进金融、制造等垂直领域,进一步拓宽从代码到业务流程的覆盖范围。
企业选择与市场反馈证明了,在真实业务中的任务定义能力远比刷分更重要。模型基座只是原料,真正稀缺的不是场景本身,而是把真实反馈工程化、并回流进模型利用的闭环能力。
![]()
当下全球AI产业主要有两条运营路径,一条是以科技巨头为代表的“多入口生态协同”,另一条则是垂直玩家深入钻研的“单点产品破局”。
第一条路径的精髓在于通过宽广的产品入口矩阵,押注场景广度与反馈频率密度,它能让底层大模型经历多角度的任务抗压测试,以火力覆盖的方式完成自我迭代。
谷歌把Gemini横向铺进搜索、浏览器、workspace和YouTube,让同一套模型能力在数十亿量级的日活入口里被反复调用、反复回收信号。国内有此优势的是拥有14亿超级入口的腾讯,并且不只是微信,是把AI能力嵌进社交、内容、支付等场景以及新推出的WorkBuddy工作流工具,用C端与B端协同两条腿同时接触真实任务。
两家产品形态不同,赌的是同一件事:入口足够多、频次足够高,模型的每一次能力代际更新都能被立刻转化为用户行为反馈。
![]()
而第二条路径赌的,是高价值场景下单点反馈信号的质量与深度。
Cursor凭什么可以每天生成1.5亿行企业代码、让马斯克在内的科技大佬眼红心热?就因为它做深做透了“编程”这件事,不仅代码生成速度不断提升、支持20多种编程语言,甚至能自动纠错和重构项目,准确率超过95%。
两套路径虽在体量上存在鲜明的差距,但与竞争优势却没有必然联系,相较于生态丰富度,更重要是谁能把“任务-反馈-模型-再任务“的流程跑通。
产品提供高质量的任务反馈链条,让模型在垂直专业度上完成大跃升;能力的跃升降低了任务耗时和人工干预,又反过来吸引高价值商业用户带着更珍贵的数据涌入,高效可循环的闭环就这样达成。
7月以来,阿里巴巴、腾讯股价回暖,这类生态型公司AI+云业绩加速兑现,为新资金流入提供了信心。而智谱、MiniMax等大模型公司股价冲高回落大幅震荡,也从侧面说明,大模型企业单纯的参数护城河正在日益变窄。
资本对AI的定价逻辑开始从“看谁资本开支大、算力囤得多”,转向“看谁能把算力真正转化成收入和利润”。
这也并不意味着硬件和算力基础设施被抛弃,而是它们开始被市场严苛地要求给出切实的回报;软件与应用层也并非凭空全面胜出,而是因为它们直接触达客户、离真实业务的“收入与现金流”更近,因而被资本重新估值。
从价格内卷到回归真实工作流,相较于无限烧钱、贩卖参数故事的上半场,与亿万用户息息相关的真实应用与商业闭环,或许才是新一轮AI浪潮的最终指向。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.