作者:快思慢想研究院 田丰,Global Times 张蔚蓝
引言
![]()
今年6月,美国AI创业公司Lindy的CEO做了一个决定:把公司所有流量从Anthropic的Claude切换到DeepSeek。他对外界的解释简洁到近乎粗暴——"接下来几个月,这个决定将为我们节省数百万美元。"
这不是一次情绪化的叛逃,而是一道纯粹的算术题。
用1美元,调用DeepSeek V4-Pro可以生成115万个输出token;同样的钱,在Anthropic Claude Opus 4.8上只能买到4万个token,在OpenAI GPT-5.5上只能买到3.3万个。价差,是28到34倍。
![]()
Lindy不是孤例。OpenRouter是全球最大的AI模型聚合路由平台,开发者在这里可以同时接入400余款模型、自由切换。它的流量数据,是目前观察全球开发者真实选择的最直接窗口。数据显示,自今年2月8日起,美国企业通过OpenRouter调用中国AI模型的token占比,每周均超过30%,峰值达到46%。而过去12个月的均值不过11%,2025年上半年更低至4.5%。
18个月,从4.5%到46%。硅谷的开发者正在用每一次API调用投票。
一、架构重塑成本:V4将推理算力需求打到V3.2的27%
![]()
经济学中,价格是成本的镜像。要理解中国AI模型为何能定出10倍乃至34倍于对手的价格差距,必须从成本结构的源头读起。
成本结构来自算法架构,这是第一性原理。
2026年4月24日,DeepSeek发布V4系列,分为V4-Pro和V4-Flash两个变体。V4-Pro总参数量1.6万亿,但每次推理仅激活490亿参数;V4-Flash总参数量2840亿,激活130亿。两款模型均以MIT协议开源,原生支持100万token上下文窗口。这个"激活参数"的概念,是理解中国AI成本优势的关键钥匙。
传统稠密模型(Dense Model)的计算方式,好比一家工厂接到每一份订单都要开动全部生产线——无论任务大小,全体员工到岗。MoE(混合专家)架构的革新在于:针对不同任务动态路由、仅激活最相关的"专家子网络"。V4-Pro的1.6万亿参数是全厂总产能,但每次生产只调用490亿参数的精锐小组,计算效率与一款单独训练的490亿参数稠密模型相当,却同时保有万亿级参数带来的深度知识储备。
但V4真正的架构突破,在注意力机制层面的再一次革命。
V3系列使用的MLA(多头潜在注意力)已是业界领先的KV缓存压缩技术。V4在此基础上引入混合注意力架构,融合CSA(压缩稀疏注意力)与HCA(重度压缩注意力):CSA通过可学习稀疏模式处理长程token之间的关联选择,HCA对本地窗口缓存做极端秩压缩。效果直接写进了技术报告:在100万token的上下文场景下,V4-Pro所需的单token推理FLOPs仅为V3.2的27%,KV缓存降至10%;V4-Flash更极端,FLOPs压至10%,KV缓存降至7%。
![]()
这是什么概念?同等的推理算力投入,V4-Pro服务的token吞吐量相当于V3.2的近四倍。不是升级了服务器,是把同一台机器的产出效率扩大了四倍。
DeepSeek在V4技术报告中同时披露,V4训练语料超过32万亿token,引入了Manifold-Constrained Hyper-Connections(mHC)替代传统残差连接,强化超大规模训练中的信号传播稳定性;Muon优化器用于加速收敛;MoE专家权重采用FP4量化感知训练,进一步压缩内存与计算开销。
有一点值得坦诚说明:与V3技术报告完整披露训练成本(2.788M H800 GPU小时、约556万美元,对比GPT-4估计超1亿美元)不同,V4技术报告未公开训练总算力消耗与成本数字。DeepSeek仅披露了架构设计与推理效率数据。但逻辑闭环仍然成立:推理侧的算力需求已从技术报告中得到量化验证——百万token上下文的推理成本降至V3.2的约四分之一,这是新一代注意力架构带来的确定性成本坍塌。
这里还有一个不可忽略的背景:美国对华芯片出口管制,限制了中国AI实验室获取最先进GPU的渠道,客观上倒逼中国团队在算法效率上加倍投入。MoE架构、多头潜在注意力、FP8混合精度训练——这些技术路线的持续深耕,从某种意义上是在算力约束下磨砺出来的刀法。限制造就了专注,专注产生了降本的边际效率,而这种效率最终反哺为全球开发者可感知的价格优势。
芯片侧还有一个信号,战略意义甚至超过算法本身。V4是第一款深度适配华为昇腾AI芯片(Ascend 910B与950系列)、使用CANN开源软件栈(算子库、通信库)的前沿级开源模型,训练与推理均可在非NVIDIA硬件上完成。在华为昇腾950DT平台实测数据中,V4-Pro高并发推理吞吐量为每秒388 token,延迟约20毫秒;V4-Flash则达每秒4722 token。英伟达CEO黄仁勋在V4发布前8天接受播客采访时曾表示,"DeepSeek先于英伟达在华为芯片上跑起来"是他不愿看到的结局。8天后,V4发布,他所担心的事情成真了。
斯坦福2026年AI Index报告提供了最直接的宏观坐标:美中两国最强模型之间的能力差距,已从2023年5月的17.5至31.6个百分点收窄至2026年3月的2.7%,而美国的私募AI投资是中国的23倍(2859亿美元对124亿美元)。报告的结论一针见血:美国走的是"以资本换能力"路线,中国走的是"以效率换能力"路线。
快思慢想研究院的判断是,MoE稀疏激活体系每一代迭代(V2→V3→V4)的效率增益呈非线性累积。这是架构红利的复利效应,不是一次性技术突破——每部署一个token,边际成本差距就被复现一次。
二、开源是国家战略,不是慈善:定价目标的根本切换
![]()
价格背后是定价目标,定价目标背后是商业逻辑。
Anthropic在2026年5月完成H轮融资,估值攀至9650亿美元;OpenAI最新估值为8520亿美元,均已备案IPO。这两家公司的高API定价,承担着多重不可回避的结构性成本:推理成本占生产AI系统总预算的80%至90%,闭源模型还需叠加安全对齐研发的持续投入、企业服务基础设施的搭建,以及对规模空前的外部投资人的回报承诺。接近万亿美元的估值是一把双刃剑——它代表市场信心,也锁定了高定价的必要性。
中国模型的开源策略,彻底解构了这一套定价方程。
以DeepSeek V4-Flash为例,其API输入定价仅为每百万token $0.14、输出$0.28。V4-Pro更设计了一项专门针对Agent工作流的定价机制:缓存命中时的输入价格降至每百万token $0.003625,相对标准输入价格折扣达120倍。开放权重意味着开发者可自行下载并在本地硬件上运行,发布方无需为每一次调用收取边际利润,收入目标从"单次API的定价权"切换为"通过生态扩散建立分发护城河,再从云服务或企业定制中间接变现"。
![]()
这一策略的市场渗透效果已可量化。2026年2月,Alibaba的Qwen单月下载量达1.536亿次,超过Meta、DeepSeek、OpenAI、Mistral等后八名的总和。Qwen在Hugging Face上拥有超过18万个衍生模型,数量超过Google和Meta的总和。斯坦福、UC Berkeley的研究人员以低至30至50美元的成本基于Qwen训练出了表现领先的专用模型。新加坡政府选择了Qwen而非Meta的Llama,作为构建本国主权AI模型的基础底座。
斯坦福2026年AI Index的另一项数据提供了更深层的佐证:全球100篇最高引用AI论文中,中国机构的贡献已从2021年的33篇增长至2024年的41篇。这说明这场成本革命的底层,有一个充沛的技术研究储备在持续供给。
推动美国企业转向的,除了成本,还有另一股力量:美国国内对头部AI模型的监管审查正在收紧。合规压力、数据主权争议与模型使用条款的不确定性,催促部分海外企业主动寻找替代方案。中国开源模型恰好在这一节点提供了在本地部署、自主可控、成本更低的完整选项——这三个属性的组合,在企业级采购决策中具有较强说服力。
Andreessen Horowitz合伙人Martin Casado给出的数据,让硅谷内部感到不安:使用开源技术栈的AI创业公司中,约80%正在运行中国模型。
快思慢想研究院的判断是,中国主流AI实验室没有AppStore式封闭生态需要保护,反而得以用开源换市场份额而无历史包袱。开源是将成本优势转化为分发优势的战略乘数——这一策略已将竞争压力反向传导至OpenAI,促使其发布了自己的开源模型gpt-oss。市场的逻辑一旦成立,就有自我强化的能力。
三、Agent时代改变了一切:价差从"折扣"变成"生死线"
![]()
成本差距并非2026年才出现,却在这一年初突然成为市场的决定性变量。触发点是计算范式的切换。
英伟达CEO黄仁勋在多个场合强调,token是AI时代的货币,生产和消费token将驱动AI经济的未来。这句话在2026年初被Agent浪潮赋予了新的分量。
AI的工作方式正在发生根本改变。一次普通对话,模型响应一次;一个Agent任务——让AI自动规划、编写、测试、修正一段代码,或者自主完成一项研究——模型需要被反复调用数十乃至数百次。OpenRouter的实测数据显示,Agentic工作负载每次请求消耗的token量约是普通人机对话的15倍。编程类任务在OpenRouter平台的占比从2025年初的11%跃升至2026年中的50%以上,Agent驱动的输出token已占平台总量的多数——而这一爆发式增长集中在2026年2月之后。
这一转变,让原本可以被品牌溢价覆盖的价格差距,变成了直接穿透月度研发预算的硬约束。
![]()
以一项标准化编程工作负载为基准:同等任务在DeepSeek上耗费1071美元,在Claude上耗费4811美元,差距约4.5倍。单次调用的成本差距可能只是财务报表上的一个小数点,但在每日自动化调用数千次的Agent工作流下,这个差距直接决定了一家创业公司的技术路线是否在经济上可持续。这是Lindy做出决定的真实逻辑——他们切换的不是品牌偏好,是生存必选项。
值得关注的是,这种成本压力在不同行业的传导方式并不相同。资深电信产业观察者向锂光指出,AI落地的最后一公里是推理,而推理环节的token消耗才是真正的成本核心。对于很多实际场景——自动驾驶的实时感知决策、医疗问诊的高频辅助、家用机器人的指令响应——业务需要的不是最贵的旗舰模型,而是在足够的精度下以最低成本持续运行的推理能力。DeepSeek、智谱AI、阿里Qwen等中国厂商恰恰在架构优化、token效率与更智能的推理策略上持续投入,在单位算力产出上具备系统性优势,这使其在高频、长尾、对成本极度敏感的企业应用场景中,成为优先入选项而非将就之选。
更值得关注的是机构客户的行为迁移。OpenRouter数据显示,包括AI原生公司和大型组织在内的企业级用户,在2026年6月初向DeepSeek路由的token流量远超年初水平。这说明主动转向中国模型的,不只是预算有限的初创团队,具有真实议价能力的机构客户也在做出同样选择。
智谱AI的GLM 5.2提供了另一个维度的例证:在一项主流Agent基准测试中,GLM 5.2的得分与Anthropic Opus 4.8相差不足1%,但使用成本仅为后者的五分之一。这已经不是"便宜但将就"的逻辑,而是"同等能力、更低成本"的竞争格局——“智价比”正在成为企业级采购的首要筛选条件。
V4-Pro的缓存命中定价印证了这一取向:每百万输入token $0.003625,是标准输入价格的1/120。这一机制专门面向Agent工作流的结构性特征而设计——稳定的系统提示和RAG上下文在多轮调用中被反复使用,缓存折扣在高频Agent场景下的实际节省幅度,远超表面价差所展示的数字。
快思慢想研究院将这一现象归结为两种"token经济"模式的并存:一种以约束下的效率最大化为核心,另一种以稀缺性溢价为定价基础。Agentic范式下,两种路径的市场反馈周期极短:每日数千次的自动化调用让成本差距从"百分比折扣"变成了"技术路线可行性门槛",而非一个可以被品牌溢价从容覆盖的次要因素。
四、三条线索,一个结论
![]()
从架构到生态,从代码到商业,这三条线索汇集成一个结论:
中国AI大模型在MoE稀疏激活架构持续迭代、开源扩散战略重构定价逻辑、Agentic工作负载放大成本差距三重叠加下,系统性压低了推理侧边际成本,并在Agent计算范式转移的节点,将价格差距转化为了市场份额的决定性优势。
"AI市场正在从模型最强的可选项,转向更具成本效益、更易部署的必选项。"这是开发者用脚投票、用流量数据写下的事实。
![]()
46%——这个在OpenRouter上峰值出现过的数字,可能只是个开始。
参考文章:《US firms’ growing adoption highlights rising competitiveness of Chines AI models: experts》,Global Times,Zhang Weilan.
![]()
畅销书:《AI商业进化论:“人工智能+”赋能新质生产力发展》
出版社:人民邮电出版社
作者:田丰
帮助你定位AI当下发展坐标的指南针
帮助你洞察AI未来演进趋势的航海图
通俗化解读AI的原理、特性和四大发展规律、提供AI赋能商业、引发新质生产力变革的一手案例分析。既有宏观视角的全局观照,又有各行业应用层面的下探记录,聚焦AI的原理与实践、现在与未来,是当下AI应用的全景图、更是身处AI技术浪潮之中的探路书。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.