★ 设为星标 | 只讲人话,带你玩转AIGC。
前几天那个把整个 AI 圈猜了个遍的神秘模型 Ox Alpha(牛来),终于掉马了。
答案是:智谱。
8 月 26 日,智谱正式发布并开源 GLM-5.3-Flash。官方确认,此前突然出现在 OpenCode 和 OpenRouter、没有公布任何背景的 Ox Alpha,其实就是 GLM-5.3-Flash 的匿名预览版。
更有意思的是,智谱表示,匿名测试期间 Ox Alpha 很快成为当周最受欢迎的模型之一,而这些流量全部跑在国产 AI 芯片上。
![]()
一夜之间,GLM 5.3 Flash 已经成为新的斩杀线。
![]()
GLM-5.3-Flash 标准 API 定价(每 100 万 token) :
- 输入:0.15 美元
- 输出:0.50 美元
- 缓存输入:0.03 美元
智谱给出的定位是:GLM-5.3-Flash 正常价格只有 GLM-5.3 的 1/10。
限时折扣期间更低到 1/20;按照官方对比,大约只有 Claude Opus 4.8 的 1/40,是 DeepSeek 的 1/7。
![]()
Artificial Analysis 的测试里,它取得 57 分综合智能指数时,每完成一个任务的折扣成本只有约 0.045 美元。
换句话说,以前需要大约 10 倍成本才能买到的智能水平,现在被直接打下来了。
这可能才是 GLM-5.3-Flash 真正值得关注的地方。
现在大模型的竞争已经越来越不像单纯的“谁分数最高”,而更像:同样 1 块钱,你到底能买到多少智能。
01 它到底是什么?
GLM-5.3-Flash 可以理解成智谱最新的高性价比主力模型。
它有几个非常关键的数据:320B 总参数,但每次只激活 18B。也就是总参数 3200 亿,真正推理时只需要激活 180 亿。
相比 GLM-4.5 的 355B 总参数、32B 激活参数,GLM-5.3-Flash 不仅激活参数接近砍半,模型层数也从 92 层降到了 45 层。
但模型变“轻”了,能力反而更强。
官方数据显示,GLM-5.3-Flash 在多项测试和实际工作负载中已经超过 GLM-5.2,在编程和 Agent 能力上则开始逼近 Claude Opus 4.8。
这也是这个模型最值得关注的地方:
不是继续无脑堆参数,而是想办法用更少的计算量,换来更强的能力。
02 能力对标 Opus 4.8
这次比较炸裂的是 Artificial Analysis 的综合智能指数。
GLM-5.3-Flash 拿到了 57 分。按照智谱公布的对比,这已经进入目前全球前沿模型区间,并与 Claude Opus 4.8 处于同一分数水平。
![]()
在几个更偏 Coding 和 Agent 的测试里,提升也很明显。
DeepSWE v1.1 从 GLM-5.2 的 46.2 提升到 63.4;AutomationBench 从 26.2 提升到 48.8。
智谱自己的 Z.ai Code Bench 上,在最高推理强度下,GLM-5.3-Flash 得分 29.0,Claude Opus 4.8 是 29.5,已经非常接近。
当然,自家 Benchmark 还是要留一点余地看。
但至少从目前公开结果来看,GLM-5.3-Flash 已经不是传统意义上的“小模型换低价”,而是在尝试做到:
旗舰模型的能力,Flash 模型的成本。
03 还是原生多模态
GLM-5.3-Flash 还是 GLM-5 系列第一个原生多模态模型。
它不是后面外挂一个视觉模型,而是在预训练阶段就把文本、图片等多模态数据一起训练,整个预训练数据规模达到 30T Token。
同时支持最高 100 万 Token 上下文。
这意味着它的定位其实已经不只是 Coding。
比如 Agent 可以直接看网页、理解界面,然后点击和操作;也可以处理文档、表格、PPT、Dashboard 等内容,甚至根据视觉反馈检查自己刚刚生成的东西,再继续修改。
这其实非常符合下一阶段 Agent 的方向:
不只是“会写代码”,而是开始真正看得见、点得动、做得完。
04 为什么它能这么便宜?
背后一个很重要的变化,是架构。
GLM-5.3-Flash 首次采用了稀疏注意力 + 线性注意力的混合架构。
简单理解:
以前处理超长上下文,有点像每个人都要和房间里所有人说一遍话,人越多,计算量增长越快。
新的方法则是——附近的人重点交流,真正重要的远距离信息再单独建立联系。
这样一来,模型面对几十万甚至上百万 Token 时,就不需要把所有信息都用最昂贵的方式计算一遍。
据公开资料,GLM-5.3-Flash 相比 GLM-5.3 将 Attention 计算量降低到约 1/3,KV Cache 占用降低约 4.4 倍。
![]()
再加上 320B 总参数只激活 18B,推理成本自然就被大幅压了下来。
所以这次的 Flash,并不是简单把 GLM-5.3 做个“青春版”。
它实际上重新设计了一套更追求效率的模型架构。
05 还有一个容易被忽略的细节
这次 Ox Alpha 的匿名测试,还有一个挺有意思的信息:
所有真实用户流量都是国产 AI 芯片跑出来的。
智谱称,他们基于 SGLang 搭建了一套推理系统,把编码、预填充和解码等阶段拆开优化,并已经运行在数万张国产加速卡组成的基础设施上。
官方资料称,这套系统实现了约 3 倍的端到端服务性能提升。
这件事情的意义甚至可能不亚于模型本身。
因为国产 AI 现在真正缺的,从来不只是“能不能训练出一个好模型”。
而是:
模型 + 芯片 + 推理框架 + 大规模真实用户流量,能不能真的跑起来。
Ox Alpha 至少给出了一次非常有意思的实战验证,这已经表明国产芯片能够高效、经济地支持大规模前沿模型推理。
06 而且,它已经开源
和刚刚发布时还要等两周才能开放权重的 GLM-5.3 不同,这次 GLM-5.3-Flash 直接开放了模型权重。
目前 Hugging Face 已经上线,模型采用 MIT License,本地部署已经支持 SGLang、vLLM 和 TokenSpeed。
https://huggingface.co/zai-org/GLM-5.3-Flash
前几天我写 Ox Alpha 的时候还在问:“牛来”到底是谁?
现在答案出来了。
但 GLM-5.3-Flash 更值得关注的,可能不是“牛来居然是智谱”。
而是另一个越来越明显的趋势:前沿 AI 的门槛,正在从“谁能做出最强模型”,变成“谁能用最低的成本,把足够强的智能真正跑起来”。
而这一次,中国模型又把价格往下砍了一刀。
参考资料:
https://z.ai/blog/glm-5.3-flash
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.