21世纪经济报道记者 董静怡
8月26日,阿里、智谱两款“高性价比”模型同日发布。
阿里通义千问正式发布Qwen3.8‑Flash,智谱AI上线并开源GLM‑5.3‑Flash,两款产品均采用混合专家MoE架构。前者为下一代Qwen4架构的先导预览版,MoE总参数125B,每Token仅激活6B参数;后者是GLM‑5系列首个原生多模态模型,总参数320B,单Token激活18B参数。
两个模型都对外开源权重,主打高并发、低成本、原生多模态与Agent能力,引发社区关注。发布还不足24小时,阿里云把Qwen3.8-Flash的定价又砍了一刀——输入每百万Tokens 0.8元,输出2.7元。
用更少的计算资源,做更多的事,Flash成了大模型厂商心照不宣的新方向。参数不再是竞赛的唯一标尺,效率、成本和落地能力正在重新定义游戏规则。
Qwen3.8‑Flash与GLM‑5.3‑Flash,代表国内大模型厂商对Flash路线的落地,二者在技术路径上既有共识,也存在差异化取舍。
阿里Qwen3.8‑Flash主模型总参数125B,叠加51B N‑gram Embedding记忆库,但每一次Token生成,仅激活6B参数参与计算,这也是其推理成本大幅下降的核心原因。
架构层面,Qwen3.8-Flash引入了GDN与QSA混合注意力机制,在高缓存命中的百万Token长上下文场景中可提速8倍以上。
训练成本较前代Qwen3.7-Plus骤降近90%,推理成本同样大幅下降,推理定价每百万Tokens输入1元、输出3元,最低仅为DeepSeek-V4-Flash的三分之一。发布次日降价后,输入每百万Tokens 0.8元,输出2.7元。
几乎同一时间登场的GLM‑5.3‑Flash,总参数320B,单Token激活仅18B,采用稀疏注意力+线性注意力混合架构,是GLM‑5系列第一个原生多模态基座。
API价格仅为GLM-5.3的十分之一,限时折扣阶段进一步降至二十分之一,约为Claude Opus 4.8的四十分之一。
正式发布前,该模型以匿名模型Ox-Alpha在OpenRouter、OpenCode两大海外平台测试,迅速登顶并刷新双平台历史纪录,Token调用量高达62T。8月27日港股收盘,智谱全日收涨12.62%,报1160港元/股。
放在两年前,行业主流认知依旧是稠密模型效果更稳,MoE被视作“看上去很美,但落地麻烦”的备选方案。但2026年,MoE‑Flash已经从备选变成主流。
背后是大模型产业迎来商业化的关键拐点。经历过去几年的疯狂烧钱,行业已经不再满足于实验室里的榜单分数,企业客户、开发者最关心三件事:单位Token成本、真实业务任务成功率、部署灵活性。
背后有两层现实约束。第一,稠密模型的推理成本天花板很难突破,千亿稠密模型高并发场景下,算力开销会直接吞噬企业客户的AI预算,很多企业即便看到强大的模型能力,也无法大规模落地;
第二,长上下文、多模态、Agent智能体成为刚需,文档解析、办公自动化、代码全链路任务,对知识储量要求极高,单纯小稠密模型很难胜任复杂任务,单纯做大稠密模型又会陷入算力不可承受的死循环。
第三,MoE‑Flash恰好提供折中解法,接近旗舰的综合能力,推理成本下降一个数量级,让大规模商用从经济上变得可行。
放眼国内其他厂商,也能看到高度相似的迭代节奏。腾讯7月发布混元Hy3极致量化版本,总参数量295B,单Token激活21B,同样追求大知识底座、低部署门槛;DeepSeek持续迭代V4‑Flash,依靠MoE架构在代码、长文本领域形成性价比优势;海外谷歌Gemini Flash系列,长期坚持“旗舰能力下探、推理成本大幅下降”的产品策略,成为云服务商最主要的流量载体。
Flash模型的集中发布,正在重塑行业商业逻辑,同时也在改写国产模型出海的竞争格局。
阿里Qwen3.8‑Flash训练成本相比前代下降九成,GLM‑5.3‑Flash价格仅为自家上一代旗舰的十分之一,这种成本下降源于稀疏激活、注意力优化、缓存压缩等底层技术,构成了可长期持续的成本优势。
“过去降价是赔本换流量,现在架构带来成本下降,厂商可以在合理毛利区间内持续压低对外报价。”有AI云厂商技术负责人向记者评价称。
因此对于大模型厂商来说,这并不是打价格战,而是技术路线的选择。
“降价和提升毛利率并非矛盾。只要单位Token毛利率仍然保持正向,并且持续改善毛利,规模扩大就会带来更高的绝对毛利。”MiniMax CEO闫俊杰在财报会议上表示,成本下降后,一部分收益让给客户降低门槛,一部分保留改善毛利。
横向对比,中国模型的定价仅为国际顶尖闭源模型的数十分之一。中小企业、垂直行业客户不再完全依赖大厂闭源API,拥有更多选型空间。据Hugging Face《2026年春季全球开源AI生态报告》,中国开源模型下载占比已达41%,首次超过美国,累计下载量突破100亿次。
这会倒逼闭源商业API持续下调价格,加速全球大模型的价格内卷。
8月,OpenAI宣布对GPT-5.6 Sol进行“限时促销”,价格下调逾20%。这已是OpenAI近一个月内的第二轮降价。就在7月底,同系列的GPT-5.6 Luna价格刚被下调了80%。
有分析认为,中国AI企业通过开源权重策略快速提升了价格竞争力,在全球市场影响力持续扩大,由此引发的市场价格战正迫使美国企业跟进。
此外,算力格局迎来变化,国产算力大规模承接MoE推理,算力需求结构发生转移。
智谱GLM‑5.3‑Flash是国内前沿大模型首次大规模线上流量完全跑在国产算力之上,具备标志性意义。智谱称,通过推理系统改造,硬件效率和单Token成本已达到与主流英伟达GPU相当的水平。
MoE架构本身对算力互联、显存带宽、调度框架提出极高要求,过去国产芯片普遍被诟病难以承载千亿级MoE大模型。而Flash版本通过稀疏激活,降低单Token计算压力,让国产算力有机会承接前沿模型,反过来,国产算力的成熟,又进一步压低Flash模型的推理成本,形成正向循环。
当然,Flash模型不会彻底取代稠密旗舰大模型。对于最高难度科研推理、复杂风险决策场景,稠密旗舰模型依旧代表能力上限。整个市场会形成分层格局,共同构成产业的供给底座。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.