![]()
一刻 talks | 硬科技·新商业
![]()
8月26日晚,智谱正式认领了那个让全球开发者猜了一周的匿名模型,"牛来"。
它真正的名字,叫 GLM-5.3-Flash。过去一周,它以"隐身"身份上线全球最大模型聚合平台 OpenRouter,不挂厂牌、不标参数,只放免费接口让海外开发者实跑。结果炸了:单日调用量登顶,使用量一度是 DeepSeek 的两倍,终结了 DeepSeek 连续 56 天的霸榜。
但真正让所有人瞳孔地震的,是智谱随后摊开的一个细节:这一周的所有流量,全部由 10 万张国产芯片承载。
一张英伟达卡,没用。
![]()
Ox Alpha一上线即终结了前款模型连续56天的霸榜
这件事的分量,不在模型多强,而在于一个判断被证成了,中国 AI,可以不靠英伟达,跑通从训练到推理的完整闭环。
这件事,不只是智谱和英伟达之间的事。它关系到你未来用的每一个 AI 产品,会更便宜还是更贵;关系到一条全新的国产芯片产业链,正在从这条路上长出来。看懂它,你就看懂了中国 AI 接下来五年最大的变量。
我们不替你判断国产芯片能不能追上英伟达。我们帮你看清楚,中国 AI 的"去英伟达化",已经从"能不能",走到了"划不划算"。而这,才是这场竞赛真正的转折点。
01
"牛来"是什么:一次匿名的大考
先把这个模型讲清楚。
"牛来"是中文社区的叫法,取"Ox Alpha"里"Ox"的谐音。它真正的身份,是智谱刚开源的 GLM-5.3-Flash,3200 亿总参数、180 亿激活,GLM-5 系列第一个原生多模态模型。
![]()
它先在 OpenRouter 上匿名上线。没有品牌,没有发布会,只有一条公告:限时免费,欢迎来测。
然后,它炸了。
首日调用量就登顶 OpenRouter,单日处理词元达 62 万亿。5 天累计流量超 50 万亿。开发者们像闻到血腥味的鲨鱼一样涌入,有人拿它写复杂代码,有人拿它做多模态任务,速度快、响应稳、效果惊艳。
在 Artificial Analysis 的综合智能指数上,它拿下 57 分,持平 Anthropic 的 Claude Opus 4.8,高于 DeepSeek V4 Pro 的 53 分。而它的定价,只有 Opus 4.8 的四十分之一。
![]()
但这场大考最狠的地方,是"匿名"。
测试期间,没有一个人知道这套模型背后跑的是什么芯片。用户只看三件事:快不快、稳不稳、准不准。这意味着,10 万张国产芯片摘掉了"国产"标签,接受了一场完全没有预演、没有照顾的生产级压力测试。
它扛住了。
02
推理破了,训练呢?其实也破了
要看清这件事,得先划清一个边界:智谱这 10 万张卡,扛住的是"推理",不是"从头训练"。
GLM-5.3-Flash 的预训练,并不是在这 10 万张国产卡上完成的。这次验证的,是"模型训完之后,国产芯片能不能低成本接住全世界来问"。
但如果你因此觉得"训练端还没破",那就低估了中国 AI 的速度。
训练端,其实已经被另外几家公司,先后撕开了口子。
![]()
ox 模型的 LLM Leaderboard 排名
最硬的一张牌,是美团。2026 年 6 月,美团发布 LongCat-2.0,一个万亿参数的模型,官方确认在 5 万张国产芯片上完成了全流程训练和推理,消费超 35 万亿 token,全程无回滚、无不可恢复的 loss 突刺。这是中国大模型第一次公开证明:万亿参数,可以在纯国产算力上跑通。
更早的是科大讯飞。2023 年,讯飞和华为成立"联合特战队",华为投入几百人、高峰时期上千名工程师驻场,讯飞星火大模型全部基于昇腾训练。后来,讯飞把国产算力平台一路建到了"飞星二号",三万卡级的昇腾集群。
百度也在训练端交了卷:昆仑芯 3.4 万卡集群,文心 5.1 基于昆仑芯训练,有效训练率达到 97%。
所以,准确的说法是:推理端,智谱"牛来"用 10 万张卡破了;训练端,美团、讯飞、百度,用万亿参数和全栈训练,也破了。
03
纵向看:中国大模型
是怎么一步步"去英伟达化"的
把镜头拉远,你会发现:中国 AI 的"去英伟达化",不是某一个公司突然的爆发,而是一条走了三四年的路,而且每一家,都切了自己最擅长的那一块。
科大讯飞切的是"全栈",从 2023 年起,就押注华为昇腾,把星火大模型整个搬到国产算力上,是这条路上最早、也最彻底的一个。
美团切的是"训练",LongCat-2.0 证明万亿参数模型可以在纯国产卡上全流程跑通,这是训练端最重的一张成绩单。
百度切的是"自研芯片 + 训练",昆仑芯一路从推理做到训练,还准备 IPO。
阿里切的是"自研",平头哥的真武系列 PPU,从立项就对标英伟达 GPGPU,2026 年 5 月已经发布训推一体的真武 M890。
腾讯切的是"芯模协同",混元 Hy3 在设计阶段,燧原科技的芯片就同步介入,两边一起做精度对齐、一起调优,输入百万 token 的成本被压到 1 元。
![]()
而智谱,这次切的是"推理",用 10 万张国产卡,接住了全球的真实流量。
把这几块拼起来,答案就清楚了:训练、推理、芯片、软件栈,中国 AI 在"去英伟达化"这条路上,已经不再是零散的单点,而是拼出了一整张地图。
04
本质:不是替代英伟达
是"芯模协同"自成体系
到这里,可以下判断了。
这轮"去英伟达化"的本质,从来不是"造一块和英伟达一样的芯片",而是"芯模协同",芯片和模型,一起设计。
过去,是模型"削足适履"去适配芯片:芯片先定下来,模型再想办法绕开它的短板。现在反过来了:华为昇腾在 DeepSeek V4 研发阶段就介入,腾讯 Hy3 在设计阶段,燧原就同步投入研发人员。芯片和模型,从"你追我赶"变成了"双向奔赴"。
这才是最根本的变化,它意味着,中国 AI 开始长出自己的一套生态,而不是永远跟在英伟达的 CUDA 后面跑。
当然,得说实话。这条路还远没到终点。英伟达真正的护城河,从来不只是 GPU,而是 CUDA 那套把芯片、编译器、算子库、开发者习惯绑在一起的生态。从 CUDA 迁移到国产平台,每个团队至少要付出 50% 的额外时间和成本。前沿级训练,依然更贵。
![]()
但别忘了另一件事:性价比,才是这轮破局最锋利的刀。
当国产芯片的硬件效率、单 token 成本,已经"与主流英伟达 GPU 相当",而模型的定价只有 Opus 4.8 的四十分之一,中国 AI 在国际市场上,第一次有了一个"非英伟达、还更便宜"的选项。
地缘意义上,这是最狠的一击:不是"我也有",是"我更便宜"。
*关注一刻talks,我们不替你判断国产芯片能不能追上英伟达。我们帮你看清楚,中国 AI 的"去英伟达化",已经从"能不能",走到了"划不划算"。而推理端先破了,训练端也在跟上,这张地图,正在一块块拼起来。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.