昨天智谱放出了GLM-5.3-Flash,我盯着价格表看了三遍——每百万Token输入0.8元、输出2.8元,缓存命中只要0.23元。说实话,这个数字比模型参数更让我愣住。我花了一晚上把它塞进我现在的日常工作流跑了几轮,今天不吹不黑,把账和体感都摊开说。
一、为什么突然想测它
起因很简单:我每个月AI工具的账单一直在涨。主力编程模型按美元计费,一个稍微大点的重构任务跑下来,几美元就没了。之前那个神秘的"牛来"模型在榜单上挂了几天,大家猜来猜去,8月26日谜底揭晓——智谱正式发布GLM-5.3-Flash,权重也开源了。
我一看架构就来了兴趣:总参数320B,激活只有18B。说白了就是"脑子很大,但每次只动一小块",这种设计天然就是奔着低成本高吞吐去的。财联社还提到它是用10万张国产算力卡训练的——这个先按下不表,咱们只看开发者视角。
二、先算账:这个价格到底便宜多少
我做了张对比表,数据都来自各家官方定价页:
模型
输入(每百万Token)
输出(每百万Token)
GLM-5.3-Flash
¥0.8(限时五折约¥0.4)
¥2.8
GLM-5.3(本体)
约10倍于Flash
约10倍于Flash
Claude Opus 4.8
约¥36($5)
约¥180($25)
折算下来,活动期间的实际调用成本大约是Claude Opus 4.8的四十分之一。好家伙,四十分之一什么概念——以前一天的模型开销,现在够用一个多月。
按我自己的月用量粗算(大概每月输入2000万、输出400万Token),理论上能从几百块的量级压到几十块。当然这是纯按价目表推演,实际还得看效果,效果不行再便宜也是白花钱。
三、实际跑了几个任务
我把手头一个真实的活丢给它:一个Python脚本的优化加一个TypeScript模块的重构。
你输入:这个脚本里有个O(n²)的循环,帮我找出瓶颈并重构成线性复杂度 AI回复:定位到了双重循环的哈希查找,给出了用字典预建索引的重构方案,附带复杂度说明和边界情况提醒。
体感上,常规的代码理解和改写任务没有掉链子,输出结构也比较干净,不需要反复追问。官方基准里它超过了自家上一代的GLM-5.2(DeepSWE实测63.4对46.2),我的几个场景里没感觉到明显短板。
但我也踩了个坑:第一次调用没注意上下文长度,把整个项目目录的日志全喂进去,直接超限报错。翻了文档才知道要先做内容裁剪。这怪我自己手快,但提醒你们别学我。
四、什么情况下它不是好选择
说实话,有两类活我现在还不敢全交给它:一是超长链路的自主编程任务,那种要连续跑十几个小时的agent活儿,我还会用更稳的旗舰模型兜底;二是对输出质量容错极低的场景,便宜模型的"抽查率"你得提高。
另外限价五折是有期限的,长期成本要按原价算,别被活动价锚定了预期。
五、我的判断
我的结论很直接:日常80%的编码辅助任务,GLM-5.3-Flash的价格性能比已经够用了,值得切换。剩下20%的高难度任务,留着旗舰模型当保险。
三类人的具体建议:
- 个人开发者和副业党:直接切,省下来的都是净利润
- 小团队:主力任务用Flash,关键路径双跑(Flash出初稿+旗舰复核),综合成本能砍一大截
- 重度agent用户:先小流量灰度,观察长任务的稳定性再说
说到底,模型价格打到这个份上,"用不用AI"已经不再是问题,"怎么组合着用"才是。别纠结了,先用起来,反正这个试错成本也就几块钱。
你们会为了四十分之一的价格换模型吗?还是觉得便宜没好货?评论区聊聊。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.