金财牛来聊聊最近AI圈最炸裂的消息。
8月26日晚,智谱正式宣布上线并开源GLM-5.3-Flash(320B-A18B),并确认它正是过去一周刷屏海外开发者社区的匿名模型Ox-Alpha——中文社区叫它"牛来"。这个模型采用MIT协议开放权重,上线即登陆Hugging Face,直接在全球开发者圈子里引爆关注。
![]()
先说一个让人起鸡皮疙瘩的数据。
8月20日,Ox-Alpha以匿名身份悄然上线全球最大模型聚合平台OpenRouter,首日调用量直接登顶,创下单日历史纪录,单日处理tokens达到62T。它不仅刷新了双平台历史纪录,还终结了DeepSeek在OpenCode长达56天的霸榜。
独立研究员之前发布的技术指纹报告称,其分词器在25组提示词测试中与GLM-5.3的Token计数完全一致,11项探针交叉测试与GLM家族全匹配,"99%把握"指向智谱。如今被官方证实,谜底揭晓。
![]()
能力对标国际旗舰,价格却打了骨折
GLM-5.3-Flash是GLM-5系列首个原生多模态模型,总参数320B、激活参数仅18B。在Artificial Analysis Intelligence Index中拿下57分,这个分数与Anthropic旗下最热门的Claude Opus 4.8持平,还高于GLM-5.2的53分和DeepSeek V4 Pro正式版的53分。
但真正让人震撼的是定价。
GLM-5.3-Flash定价为GLM-5.3的1/10,限时折扣期内低至1/20,仅为Opus 4.8的1/40。具体来看,每百万token输入0.8元、输出2.8元、缓存命中0.23元。
也就是说,你用四分之一的价格,买到了和国际旗舰同等水平的模型能力。这在以前是不可想象的。
![]()
10万张国产芯片,首次大规模集体出海
这才是整篇文章最值得骄傲的部分。
智谱披露,"牛来"测试期间的全部线上流量,以及GLM-5.3-Flash发布后的线上服务,均由10万张国产芯片承载。这是国产算力芯片首次大规模直接服务全球真实负载。
此前市场一直有争论,每天100万亿Token的算力供给从何而来。现在答案清楚了。据记者了解,这些国产算力芯片可能来自华为、海光、摩尔线程。
技术架构才是成本压降的根源
光有芯片还不够,架构创新才是关键。GLM-5.3-Flash基于30T Token多模态语料完成预训练,是GLM系列首次引入稀疏注意力与线性注意力混合架构,并创新采用流形约束超连接(mHC)。
这套组合拳打下来,注意力计算量较GLM-5.3下降约3倍,KV缓存缩小4.4倍,支撑1M上下文窗口的经济化部署。简单说就是,同样的算力能跑更强的模型,同样的模型能花更少的钱。
开源即全球可用
GLM-5.3-Flash已正式面向全球开源,接入ZCode等编码平台,并纳入GLM Coding Plan(每天限量发放10,000张体验卡),同步开放API调用。
![]()
北京计算机学会AI专委会秘书长张有鱼评价说,"匿名上线、全网实测、择日揭晓"的打法让GLM-5.3-Flash在揭晓前已完成真实流量压测并收割盲测口碑。在DeepSeek V4 Flash提价、市场对"用得起的前沿模型"呼声日高的背景下,其以"前沿能力加1/40价格加国产算力底座"的组合切入,前沿模型的价格底线被再度击穿。
这意味着什么
对行业来说,GLM-5.3-Flash的出现意味着两件事。
第一,国产算力芯片已经从"能用"走到了"好用"。10万张国产芯片扛住全球真实流量,这不是实验室数据,是实打实的生产环境验证。华为、海光、摩尔线程这些名字,接下来会频繁出现在全球AI算力供应链的讨论中。
第二,前沿AI模型的价格战才刚刚开始。1/40的定价直接把门槛砸到地板上,中小企业和开发者可以用极低的成本调用国际旗舰水平的模型。这会加速AI应用的普及,也会倒逼所有模型厂商重新思考定价策略。
DeepSeek之前把价格打下来了,智谱现在把能力又往上拉了一截,同时还用国产算力把供应链安全兜住了。这一套组合拳下来,国内AI生态的竞争力肉眼可见地在增强。
AI的浪潮还在加速,而中国玩家正在从跟随者变成规则制定者。
注:本文基于财联社、科创板日报公开报道数据深度解析,不构成任何投资建议。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.