网易首页 > 网易号 > 正文 申请入驻

智谱“牛来”模型算力谜底:全部国产卡承载,价格仅为Opus 4.8的1/40

0
分享至


文|晓静

编辑|徐青阳

匿名六天之后,“牛来”终于揭开了最后一层面纱。

8月26日晚,智谱正式发布并开源GLM-5.3-Flash。这款此前以Ox-Alpha身份在OpenRouter、OpenCode匿名测试的模型,总参数量320B、激活18B,是GLM-5系列首个原生多模态模型


与GLM-5.3相比,这个模型的价格低到有些出乎意料,它的价格仅为GLM-5.3的1/10,限时折扣期进一步降至1/20;与Anthropic旗舰模型Claude Opus 4.8相比,约为1/40。

Artificial Analysis目前给Claude Opus 4.8的Intelligence Index评分为57分,它的官方API标准价格为每百万Token输入5美元、输出25美元。 智谱披露,GLM-5.3-Flash在同一指数中同样获得57分;在智谱自研的Z.ai Code Bench中,两者的Coding实际使用体验也处于相近水平。


虽然这并不意味着GLM-5.3-Flash已经在所有任务上“等于”Opus 4.8,单项Benchmark、长任务稳定性和真实Agent任务仍可能存在差异,但至少从第三方综合测试来看,一款开源模型已经进入此前主要由高价闭源旗舰占据的能力区间。

更重要的是,这次低价并不是建立在海外GPU推理集群之上。

01“牛来”背后,全部跑在国产芯片上

GLM-5.3-Flash的发布,也回应了此前围绕Ox-Alpha最大的一个疑问:如此大规模的海外免费测试,背后的算力从哪里来?

智谱确认,正式发布前,GLM-5.3-Flash以Ox-Alpha为名,在OpenCode和OpenRouter进行匿名测试。模型很快成为当周最受欢迎的模型,并创下两个平台调用量新高。

这些请求流量全部由国产芯片提供算力。

据悉,智谱共调用了超过10万张国产芯片集群用于该模型服务,但未公布具体的芯片型号。这也是智谱首次尝试使用一个大规模国产芯片集群,直接承载来自全球开发者的真实线上负载。

匿名测试期间,用户并不知道模型背后是谁,也不知道使用什么芯片,只会根据速度、稳定性和效果决定是否继续调用。国产算力因此接受了一次持续的真实流量测试,并不是实验室环境下的峰值性能展示。

根据官方信息,为了让前沿模型真正跑在国产芯片上,智谱对推理系统做了大量针对性改造。

单张国产芯片当前面对的主要瓶颈包括内存容量和带宽,而GLM-5.3-Flash又原生支持最长1M上下文,对显存和通信提出了更高要求。

智谱基于SGLang构建了专用推理引擎,并加入节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化以及Layer Split等技术,通过“以算力换带宽、以通信换显存”的方式降低硬件限制。

在集群层面,采用Encode-Prefill-Decode,也就是EPD分离架构。多模态编码、Prompt预填充和逐Token解码被拆分为三个可以独立调度和扩缩容的工作池,让不同阶段按照各自的算力特征运行。

按照智谱公布的数据,与同一批硬件上的初始基线相比,这套方案将端到端服务性能提高了3倍。智谱称,最终硬件效率和单Token成本已经达到与主流英伟达GPU相当的水平。

这里需要区分两个概念。

所谓“1/40”,并不是说国产芯片的硬件推理成本只有海外GPU的1/40。目前公开数据并不足以支持这样的比较。

更准确的理解是:一款全部由国产芯片集群承载的前沿模型服务,把面向用户的价格压到了Claude Opus 4.8的大约1/40。

02320B,为什么比上一代旗舰还强

价格下降的另一半原因来自模型结构。

GLM-5.3-Flash总参数量320B,每个Token激活18B参数。作为参照,GLM-4.5总参数量355B、激活32B,共92层;GLM-5.3-Flash则为320B总参数、18B激活参数和45层。相比GLM早期旗舰架构,每Token实际参与计算的参数量和网络深度都明显下降。

但按照智谱公布的Benchmark和实际使用结果,GLM-5.3-Flash整体能力反而超过了参数规模更大的GLM-5.2。


这意味着“Flash”这次不再只是把旗舰模型简单缩小,它从架构层面重新设计了推理成本。

GLM-5.3-Flash是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型

其中,线性注意力通过递归机制处理局部依赖;稀疏注意力则使用轻量级索引器,在长上下文中召回真正需要计算的全局信息。

针对1M上下文下索引器自身的内存和延迟问题,智谱又引入IndexPool,通过加权池化,把索引器原本的4个缓存向量压缩成1个。

按照智谱的测算,与GLM-5.3相比,GLM-5.3-Flash的注意力计算量降低3.01倍,KV缓存大小降低4.44倍。

在智谱列出的GLM-5.3、DeepSeek-V4-Flash和Kimi-K3等基线模型中,GLM-5.3-Flash的注意力计算量最低。不过,其平均每层KV缓存大小仍略高于Kimi-K3和DeepSeek-V4-Flash。

这组数据一定程度上解释了为什么价格可以“打下来”。

尤其对于Coding和Agent任务,一个任务可能连续运行数十分钟甚至数小时,模型不断读入代码、历史对话和工具返回结果,上下文持续增长。注意力计算量和KV缓存直接决定了长任务需要消耗多少显存、算力和推理成本。

GLM-5.3-Flash还引入流形约束超连接mHC,并使用30T Token多模态预训练语料,在降低参数量和计算量的同时,继续提升模型扩展能力。最终形成的不是一款单纯“更小”的模型,更准确的说,是一套围绕低成本推理重新设计的模型架构。


03Flash开始进入前沿模型区间

另一个变化,是“Flash模型”的定位正在改变。

过去,Flash、Mini、Air通常意味着更快、更便宜,同时接受明显的能力折损。

GLM-5.3-Flash320B总参数、18B激活参数,在Artificial Analysis综合智能指数上拿到57分,与Claude Opus 4.8持平,同时价格只有后者的约1/40。

它还是GLM-5系列第一款原生多模态模型。

这次加入视觉,并不是只是简单增加一个“看图”能力,目的为了直接服务于Coding和Agent。对于网页、游戏、3D建模等任务,模型最终生成的并不仅是代码,还有真正呈现在屏幕上的页面、交互和虚拟场景。

只有模型能重新“看见”自己生成的结果,才能知道按钮是不是错位、页面是否真的渲染成功、3D场景是否符合预期,再继续修改。

智谱因此专门训练了模型的自我视觉判断和测试时改进能力,让模型在生成之后继续观察结果,并根据环境反馈迭代。

例如,官方展示的一个案例中,GLM-5.3-Flash在没有外部素材的情况下,自主运行16小时,在Blender中搭建了一套约400平方米的专业主厨住宅与测试厨房。


类似机制也被延伸到PPTX、PDF、DOCX、XLSX,以及金融和法律等专业任务:模型不仅生成内容,还能通过视觉结果继续检查和修改自己的输出。

对于Agent来说,这种变化比“多模态”本身更重要。过去的Coding模型主要判断代码是否正确;但它更需要去判断一项工作最终有没有真正完成。

如果单独看GLM-5.3-Flash,这是一款参数更少、推理成本更低,同时进入前沿能力区间的新模型。

但Ox-Alpha匿名六天以来,测试了国产芯片能不能稳定、经济地承载一个前沿模型,并直接服务全球真实开发者。

与此同时,GLM-5.3-Flash采用MIT协议开源,并同步开放API。

前沿模型能力、开放权重、国产芯片大规模在线承载,以及极低API价格,同时出现。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
悲剧还是发生了!黑龙江女子因酷热将空调连续开了一天一夜,期间紧紧关闭门窗。随后她开始剧烈头痛、恶心头晕...

悲剧还是发生了!黑龙江女子因酷热将空调连续开了一天一夜,期间紧紧关闭门窗。随后她开始剧烈头痛、恶心头晕...

LULU生活家
2026-08-26 19:42:18
Here We Go!大马丁空降斯坦福桥,蓝军防线迎来“潘帕斯门神”

Here We Go!大马丁空降斯坦福桥,蓝军防线迎来“潘帕斯门神”

智道足球
2026-08-28 08:07:50
在上海工作的26岁男子云南哈巴雪山遇难,距去年坠亡点仅百米

在上海工作的26岁男子云南哈巴雪山遇难,距去年坠亡点仅百米

上观新闻
2026-08-28 07:56:30
美股收涨,英伟达财报后飙涨近9%,芯片股走强,油价反弹

美股收涨,英伟达财报后飙涨近9%,芯片股走强,油价反弹

第一财经资讯
2026-08-28 07:22:13
热搜上令人窒息的“母女吃牛肉面一幕”,精神穷人可怕的三观

热搜上令人窒息的“母女吃牛肉面一幕”,精神穷人可怕的三观

蝴蝶花雨话教育
2026-08-18 09:57:05
阎罗王告知:烧纸钱前需先做一事,否则逝者看得到拿不了,徒劳无益

阎罗王告知:烧纸钱前需先做一事,否则逝者看得到拿不了,徒劳无益

红豆讲堂
2025-03-31 16:45:10
彻底捂不住了!俄核心铁杆痛呼现状:当下就是1917沙俄崩盘翻版

彻底捂不住了!俄核心铁杆痛呼现状:当下就是1917沙俄崩盘翻版

老马拉车莫少装
2026-07-02 11:54:24
全面反俄?50国联手围堵俄罗斯,不到24小时,中方在安理会出手了

全面反俄?50国联手围堵俄罗斯,不到24小时,中方在安理会出手了

小莜读史
2026-08-26 15:51:39
堪称最离谱的枕边翻车现场,清华学霸杨奇函被女友趁熟睡时蚂蚁搬家式转走百万

堪称最离谱的枕边翻车现场,清华学霸杨奇函被女友趁熟睡时蚂蚁搬家式转走百万

东方不败然多多
2026-08-22 04:34:50
如果不算核武器,全球十大军事强国分别是谁?第一名你想不到!

如果不算核武器,全球十大军事强国分别是谁?第一名你想不到!

铭记历史呀
2026-08-26 20:08:56
日本代表团抵达北京,三样请求个个扎心,想为高市早苗访华铺路?

日本代表团抵达北京,三样请求个个扎心,想为高市早苗访华铺路?

娱乐的宅急便
2026-08-27 03:24:58
西藏吉隆:近500名群众已转移至临时安置点 将防治次生灾害

西藏吉隆:近500名群众已转移至临时安置点 将防治次生灾害

新京报
2026-08-28 08:07:12
刘翔面前有4条路:不想当教练不愿朝九晚五上班 只有买断拿钱走人

刘翔面前有4条路:不想当教练不愿朝九晚五上班 只有买断拿钱走人

念洲
2026-08-27 09:09:37
太扎心了!“在上海断子绝孙简直就是家常便饭”,一句刺耳的网络吐槽,评论区炸锅

太扎心了!“在上海断子绝孙简直就是家常便饭”,一句刺耳的网络吐槽,评论区炸锅

火山詩话
2026-08-25 16:18:38
全球最大岛礁被我国收回,相当于四个深圳大!曾被美、菲合力抢夺

全球最大岛礁被我国收回,相当于四个深圳大!曾被美、菲合力抢夺

铁锤侃侃而谈
2026-08-26 22:12:20
“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

江山挥笔
2026-08-25 16:40:36
美国网红小唐酱香饼的瓜:从二手车坑同胞到假牙膏割粉丝

美国网红小唐酱香饼的瓜:从二手车坑同胞到假牙膏割粉丝

杭城村叔
2026-08-25 09:02:17
一针没打的280万人,2026年身体真相曝光

一针没打的280万人,2026年身体真相曝光

华庭讲美食
2026-08-26 01:21:08
夏窗新标王诞生!利物浦签下23岁法国边锋 总价1.4亿欧 队史第2贵

夏窗新标王诞生!利物浦签下23岁法国边锋 总价1.4亿欧 队史第2贵

我爱英超
2026-08-27 16:51:56
金球先生罗德里首秀,费尔明连场破门!巴塞罗那2-0迎西甲两连胜

金球先生罗德里首秀,费尔明连场破门!巴塞罗那2-0迎西甲两连胜

全景体育V
2026-08-28 05:56:40
2026-08-28 08:24:49
次元君情感
次元君情感
分享情感生活
357文章数 17830关注度
往期回顾 全部

科技要闻

苹果邀请函:新CEO、折叠屏iPhone都要来了

头条要闻

"结婚8年3女非亲生"当事人首次摘下口罩:不怕异样眼光

头条要闻

"结婚8年3女非亲生"当事人首次摘下口罩:不怕异样眼光

体育要闻

因为这条规则,欧联冠军一个夏天散伙了

娱乐要闻

包贝尔幽会后陪老婆!曾炫耀谈7个女友

财经要闻

机构预测"过剩",市场却在疯抢废铜?

汽车要闻

搭华为ADS 5/增程纯电可选 阿尔法T7预售13.78万起

态度原创

艺术
游戏
家居
亲子
教育

艺术要闻

《捣练图》 干最累的活,穿最雅的衣

《GTA6》引入犯罪档案系统 杀人太多反而会降低等级

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

人民日报多次预警,孩子电话手表暗藏隐患,绝非单纯护娃工具啊!

教育要闻

把家长急得,火爆脾气都上来了

无障碍浏览 进入关怀版