![]()
神仙打架,这周的大模型圈,已经卷到了几乎一天一个新旗舰。
有 Cursor 数据加持的 Grok 4.6 突飞猛进,马斯克还说 4.7 马上就要来;DeepSeek V4 Pro 正式版虚晃一枪后正式发布,多项 benchmark 直指 Fable 5;还有一个不能算旗舰的 Gemini Flash。
然后今天,智谱也把 GLM-5.3 端了上来。
这个在 5.2 期间,一直被调侃「我知道很好用,但不给我开会员用」的顶尖国产编程模型,终于迎来了更新。
新的模型继续在编程方面发力,评测榜单的结果显示,GLM-5.3 在编程能力上比肩 Fable 5 和 GPT-5.6 Sol。在社交媒体上参与内测用户的反馈则提到,使用体感比 Kimi K3、DeepSeek V4-Pro-0813 要更好。
![]()
能跟 GLM-5.3 上桌对比的模型,在可视化图表中只剩下了 Kimi K3、Fable 5 和 GPT-5.6 Sol。以前是开源自己一堆模型对比,不找闭源自讨苦吃,现在是「对标 Fable 5」成了开源的基本配置。
六个 benchmark,GLM-5.3 的表现都不赖,尤其是由 OpenAI 提出的 GDPVal 评估测试,智谱拿到了第一名。
AutomationBench、Agents' Last Exam,一个是用来测试跨应用工作流编排能力,一个是测试智能体能力,GLM-5.3 的成绩也是数一数二。
和 Kimi K3、Qwen3.8-Max 迈向万亿大参数不同,GLM-5.3 这次参数量和上一版本差不多,同样是 7000 亿参数级别。官方技术博客中提到,此次升级带来的提升主要原因是后训练 Scaling。
就是靠着 743B 的基模,智谱训练出来了 Kimi K3 2.8T 级别的大模型。
我们在与 GLM-5.2 完全相同基座上高效推进强化学习,可能我们还远未开发出这个基座(即 GLM-5.2 模型)的智能上界。
![]()
▲ 更完整的 benchmark 对比,经过后训练的 GLM-5.3 对比 GLM-5.2 提升相当明显,Coding、网络安全和 Agentic 成绩进步都不像是一个基座模型。
不得不说,现在大模型做好后训练在某些程度上比预训练都更好使。就拿四月份发布的 DeepSeek V4 Flash 预览版和 7 月底发布的正式版相比,两个模型的能力几乎是断层的。
智谱这次还开源了名为史莱姆 Slime 的一个后训练框架,直接能覆盖发布级模型后训练所需要的完整工作流。他们说从 GLM 4.5 开始,就一直在用这套框架进行后训练。
目前 Slime 支持对 GLM 系列、Qwen 系列以及 DeepSeek 系列的部分模型和 Llama 3 进行后训练。
![]()
▲ 教你如何用 128xH100 训练 DeepSeek R1,以及如何蒸馏
除了主打编程,GLM-5.3 的另一个重点方向是网络安全。从 Hugging Face 事件开始,现在哪个模型不能谈谈网络安全,都算不上是一个好模型。
无论是模型的攻击能力强,能逃出设置的沙箱,还是防守能力强,能监控、抵御和分析复杂的 AI Zero Day 漏洞;这些以前听着离我们普通用户很远的东西,也成了大模型角力的新赛场。
GLM-5.3 在网络安全相关的任务中,表现与 Claude Mythos 5 持平。其中 ExploitGym 网络安全测试,就是 OpenAI 在评估自己的待发布模型时,为了解决更多问题去攻击了 Hugging Face,GLM-5.3 的表现也非常不错,898 到题,限时 6 小时内完成的情况下,达到了 130 道。
![]()
针对模型的网络安全能力,智谱还公开了一项网络安全披露账本,记录模型在不同的项目中找到的各种漏洞。GLM 找到的最古老漏洞,甚至可以追溯到大约 40 年前。
40 年都没找到,GLM-5.3 一出手就找到了,放 OpenAI 或者 A 社手里,这不比证明了一个数学难题强吗。
![]()
▲ 网络安全披露账本 https://cvd.z.ai/
虽然我们普通用户不会拿它去找各种攻防漏洞,但模型的能力提升是实打实的,具体到日常的办公和编程任务上,GLM-5.3 的表现又如何。
APPSO 提前拿到了 GLM-5.3 的测试资格,继续用一些 3D 网页生成、网页应用开发、macOS 小工具开发等任务,来看看 GLM-5.3 的表现是否能快速实现我们的想法。
目前 GLM-5.3 已经上线智谱官方 Agent 应用 Zcode 和效率工具 AutoClaw,同时面向 GLM Coding Plan 用户全量开放并开放订阅。
![]()
▲ 在 Zcode 应用内可以直接选择 GLM-5.3 进行体验
第三方平台像是 WorkBuddy,QwenWork,TraeWork 等应用也已经开放抢先体验。而 API 调用预计在下周二开放,模型的完整权重则会在两周内开源。
当所有 AI 都开始卷编程
相较于写作或者文科领域,那些见仁见智,审美无法统一的任务,编程大概是大模型最适合发力的场景。
简单粗暴的一句提示词丢进去,就等着看它用代码能写出什么好看好玩有意思的画面。
我们先是让它做了一个人体血液循环的 3D 交互仿真系统,原以为它会做一个写实的人体透视,至少像是这种细节满满的 3D 仿真,有真实的身体轮廓,合理排放的血管,真实的肌肉线条。
![]()
但不知道是不是提示词不够详细,GLM-5.3 给的交付是看起来比较粗糙的版本。整个人更像是一个火柴人,内部器官也全部堆在了一起。
比较难得的是,整个的演示有较多的自定义,例如视图图层可以选择不同的场景,生理参数也有心率、压力等内容。我们甚至可以选择失血性休克的场景,直接看到血液循环的流向。
![]()
▲ 提示词:做一个高精度的人体血压循环 3D 可交互仿真系统,使用 GLM-5.3 + Claude Code
总的来说,这个交互网页能够用在教学场景,但就是没有那么好看。
继续我们在 DeepSeek Harness 中的金字塔滑板游戏测试,同样的提示词,GLM-5.3 + Claude Code 最高推理深度给出的结果也不赖——游戏体验好,场景渲染也准确。
![]()
▲ 如果你不好好操作,可能真的会输,只是这个滑板的残影,过于「亮眼」。
当我们想要它生成一些惊艳的 3D 场景时,像是一个满是水母的湖,数百万只写实的水母在一片翡翠湖泊里飘动。
![]()
这个效果确实还挺漂亮的,渲染水母就不会像渲染人体一样,只用一些简单的圆圈,不过这个 3D 水母的提示词也相当长。
在 Claude Code 中使用 GLM-5.3 时,如果你开启了自动审批命令,会经常遇到一个错误,显示「auto mode cannot determine thesafety of Bash right now.」即「自动模式目前无法判断 Bash 命令的安全性。」
这大概是 Claude Code 应用自身的机制来处理自动模式下,如何识别不同的命令是否需要弹窗通知交给我选择,但第三方的模型,暂时还没有适配 Claude Code。
于是我们切换到 ZCode 进行体验,它能像 Codex 一样使用不同的工具,不断对已经生成的网页截图识屏,分析存在的问题,然后持续优化,整个运行时间也比单纯在 Claude Code 中使用会更久。
![]()
就像这个行星撞地球的模拟,两个行星碰撞,我们在 Claude Code 中的任务最长没有超过 1h,但这个 3D 网页过了一个小时,ZCode 还在反复地测试检查。
好在最后的效果没有让人失望,我们第一眼就能看到地壳开裂、熔岩喷出、碎片形成行星环等壮观画面。就这些复杂的粒子运动,要面面俱到的编程好,肯定是需要一点模型底子的。
![]()
同尺寸里的最强模型
GLM-5.3 的意义,我们测试下来就觉得它还是回到了原本属于它的位置,即同尺寸最强模型,编程开发者的首选。
K3 用了 2.8T,DeepSeek V4 用了 1.6T,而 GLM 5.2 用了不到一半的参数,就实现了同样程度的智能。
所以如果你本来就在用智谱,已经购买了 Coding Plan(今天下午他们也重置了一次),从六月中旬发布的 GLM-5.2 切换到 5.3,是能感受到比较明显的差异。
虽然 API 版本预计要等到下周二更新,目前官网显示的 API 价格也还是 GLM-5.2 版本,但同样的模型尺寸,估计 GLM-5.3 的 API 定价不会有太大的变化。
![]()
Kimi K3、Qwen3.8-Max、DeepSeek V4 正式版、Grok 4.6、Gemini 3.7 Flash、GLM-5.3,最近的模型发布节奏几乎是前所未有,每天都有新的模型,新的工具可以测试。
模型之间的区别也随着密集的发布逐渐在缩小。拿我们自己来说,曾经 Claude 被认为是写作上最好用的模型,优化一些句子的结构,把脑子里乱成一团的想法让它有逻辑的串联起来,Claude 给的文章有时比人类写得还要好。
但频繁封号的 Claude,让我们转到了用 GPT 以及其他的模型,于是发现好像所谓的 Fable 5 和 Opus 5 并不是那么的非它不可。
写作如此,编程、生图、整理文档、做报告、构建知识库也越来越接近这个状态。
![]()
GLM-5.3 和最近这一连串新模型一起,把大模型的「最强保质期」压得越来越短。
新发布的 GLM 用了 20 天,就有更强更好的 Kimi,Kimi 用了 20 天,又能换到新发布的 DeepSeek,等 DeepSeek 不好用了,那个时候又可以轮到 GLM 了。
所以当别人问你,现在最好的国产编程模型是什么,你会说 Kimi K3、DeepSeek V4 还是 GLM 5.3?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.