![]()
GLM-5.3三大标签,最强安全模型,最强编程模型,最强开源模型
作者丨高允毅
编辑丨岑 峰
昨晚刚经历完DeepSeek的狂欢,智谱不声不响放个大招,GLM-5.3正式上线。
我们先看智谱给GLM-5.3的三个标签,最强安全模型,最强编程模型,最强开源模型。
在基座模型没变的情况下,GLM-5.3编程能力体感暴涨50%,写起代码来直逼干了十年的资深老架构师。在找Bug和漏洞防御上,甚至可以对标Mythos 5,能一口气挖出2436个漏洞,里面光是中高危漏洞就有 1097 个。
而这些飞跃,都来自极致的后训练,智谱将秘诀归功于“架构优化技术IndexShare、强化学习算法SAO、以及新一代后训练框架Slime框架”。
而且智谱这次动作极快,不仅官方编程工具 ZCode、效率神器 AutoClaw 连夜开放,GLM Coding Plan 也直接面向所有人开放订阅。为了配合这波全员狂欢,GLM Coding Plan 的额度已经满血复活。
![]()
01
编程能力:开源第一,体感超Claude Fable 5
智谱的编程能力有多强?可以说,全面逼近全球顶尖模型Claude Fable 5,甚至在部分高难度评测里完成了反超。我们可以看一下数据。
在考验真实终端环境复杂操作的 Terminal-Bench 3.0 上,GLM-5.3 开启了惊人进化,得分从4.6 直接大跃进到 28.3,紧逼Fable 5的33.7。
在长程软件工程、极其考验持续改代码能力的 DeepSWE v1.1 中,它更是从 46.2 提升到 66.9,距离 Fable 5 只差 2.8 分,跟 Kimi K3 的差距更是缩短到了微弱的 0.6 分,而长程任务一直是 Kimi K3 的拿手好戏。
而在强调多工具协作、覆盖真实专业场景的 Agents' Last Exam 评测中,GLM-5.3 直接反超Fable 5 。
在测试AI 能不能在现实职场里真正替人类干活、以及能产出多大的实际经济价值的 GDPval-AA v2 里,GLM-5.3 直接拿下全球第一。
![]()
整体而言,GLM-5.3 这次不仅进步大,而且提升的方向非常有针对性,它主要提升的是复杂软件工程、终端操作和真实世界 Agent 任务的表现。
可以说,智谱希望把GLM-5.3训练成能真正扛起整个项目的专家级开发者,而这种能力的提升源于智谱自建的一套评测:Z.ai Code Bench。
区别于传统的纸上谈兵,这个评测不看模型做题,而是直接把大模型空投进真实的本地开发环境,模拟人类开发者使用 Coding Agent 的体感。
结果在难度最高的 High 档位下,GLM-5.3 拿到了 31.4% 的准确率,比Claude Opus 4.8(29.5%)还高1.9%。而在Token效率上,面对同一项高难任务,Opus 4.8需要12 万个 Token,而GLM-5.3 平均只用了 5 万个Token,
这意味着,在真实开发环境中,GLM-5.3 不仅比Claude Opus 4.8做得更好,算力还节省了一半。
![]()
这是怎么做到的呢?官方表示原来他们把训练环境一比一复刻成了大厂专家的完整工作流。
拿最复杂的机器学习优化任务来说,智谱直接给模型配齐了和算法工程师一模一样的计算集群、存储系统、内部文档和代码库,让它在真实环境里端到端地实操。而有些任务的工作量十分巨大,即使是一位人类工程师,也得死磕好几天。
在这种极限捶打下,大模型终于开了窍。它不再是只会听话执行单条命令的机器,而是学会了像人类专家一样,自己去发现 Bug、推导分析、自主验证,最后一个人高产地把整个项目闭环掉。
![]()
02
安全能力:从"附属功能"变成"主打招牌"
不过相较于编程能力而言,这次更新中,安全问题才是GLM-5.3真正的重头戏。
官方披露,从GLM-5.2发布以来,智谱联合各个顶尖安全团队,已经在 269 个开源和商业项目中,累计揪出了2436 个漏洞,里面光是中高危漏洞就占了1097 个,部分漏洞甚至潜伏了近 40 多年。
还记得前段时间震惊科技圈的 Hugging Face 被黑事件吧?当时在面对 OpenAI 超强模型的攻击时,Hugging Face 几乎瘫痪。而 Claude 因为层层安全限制导致无法正常防御,最后是开源模型 GLM-5.2 成功顶住压力,这一战也直接让它成为“全球安全大模型”的标杆。
到了 GLM-5.3,智谱在安全上更强了。
为了防范恶意请求,GLM-5.3 搭建了一套“纵深防御”的风险审查系统,把防线分成了三层。最外层是一个轻量级的分类模型,用来快速拦截大规模的低级滥用。中间层是推理监控器,在模型一边思考的时候,一边实时盯着它的任务意图。最内核则是模型自身的“深度安全对齐”,让它从底层逻辑上就能自主拒绝攻击请求。
最后这层最关键,因为在开发者下载模型到本地部署的开源场景下,只有模型自身的防线才是唯一有效的安全盾牌。
更聪明的是,这套系统不是一刀切地搞“关键词封杀”,而是根据“意图和语境”来做风险分级。毕竟在网络安全领域,黑客攻击和专家防御在字面描述上高度相似。GLM-5.3 的精细化审查,就是为了能一边拦截高危漏洞利用,一边放行正常的安全防护工作。
其实,智谱在安全方向上布局很早,早在 2025 年 9 月,他们就联合国内多家顶级安全实验室,共同制定了专业化的网络安全评测与执行框架。
他们早早看到,伴随着模型能力的快速提升,攻击能力正在扩散。而近期一系列的模型失控越狱事件也确实印证了这一猜想。
比如Mythos 5在测试中连网逃逸,甚至为了把恶意代码塞进开源项目,注册了一堆“假号”;连 Meta 的模型也因为配置错误溜出实验室,顺手把隔壁公司的系统给端了;而OpenAI 被迫宣布紧急暂停下一代模型 Astra 的研发,就因为它的自主黑客能力已经强到了不受控的“危急”红线。
在安全事件频发后,智谱死磕安全能力,执意开源,正是为了打破顶尖安全技术被少数闭源大厂垄断的局面。
通常来说,网络安全实操可拆分为代码审查、漏洞验证、漏洞利用以及真实环境的攻防闭环。
而在实际的测试中,它在链条前半段的“防守和验证”上已经登峰造极,甚至反超了 Mythos 5和 GPT-5.6 Sol,但在深入的漏洞利用阶段仍有提升空间。
![]()
官方还透露了,除了Hugging Face事件,GLM-5.3还曾协助处理另一起AI发起的攻击事件。
当时,FOFA 的追踪分析引擎 Ferret 敏锐地察觉到巴西一台临时文件服务器有些不对劲。当安全人员把 GLM-5.3 接入分析后,顺藤摸瓜,一个名为 "Neo" 的未知 AI Agent 黑客终于浮出水面。
这个被称为 "Neo" 的 AI 黑客胃口极大,它打算猎杀某国的会计师事务所、税务服务公司和记账机构。在短短不到两个月的时间里,这个 AI 黑客就已经疯狂扩军,名下管理着 4 台黑客服务器、7 个恶意域名、6 万个用于轰炸的邮箱以及 100 多个自动化攻击脚本,在短时间内扔出了 18567 封高度拟真的钓鱼邮件。
面对数千个开放目录、数万份杂乱日志,这种高度碎片化、海量且由 AI 生成的攻击线索,如果单靠纯人工分析,几乎是个不可能完成的任务。
而 GLM-5.3 在介入后,迅速在垃圾信息里提取出关键线索、自动关联跨服务器的攻击行为,最终辅助安全研究人员,完整还原出了整条被埋藏在深处的 AI 攻击链条。
这可能也是大模型安全史上的一个里程碑事件:人类用“防御 AI”,第一次死死狙击了“攻击 AI”。
此外,它还协助挖出了一个潜伏在互联网底层 DNS 协议规则本身、长达 40 多年的世界级隐患。
这个漏洞不是某家公司的代码写错了,而是互联网底层基建的“出厂设计缺陷”。攻击者只需要发送极少量的特殊请求,就能把服务器的计算压力瞬间放大近 8 万倍,能在一夜之间瘫痪全球超过 1000 万处公网 DNS 服务。如果被恶意引爆,全球的网站访问、邮件收发、云服务全得瞬间停摆。
幸运的是,这些漏洞被翻出来后,已经全部进入了 CNVD 国家漏洞库的协同修复流程。就像安全圈广为流传的那句话:对于防守方而言,最好的安全,事故没有发生。
![]()
03
一切强大,源于后训练
GLM-5.3 的发布,可以说给正在寻找新增长曲线的大模型行业,投下了一块极具重量的新路标:
当预训练的参数红利逐渐见顶,后训练到底能释放多大的能量?智谱能靠后训练实现跨越式提升,背后的技术底牌究竟是什么?
答案藏在一套彼此协同、层层递进的后训练技术体系里。架构优化 IndexShare、强化学习算法 SAO、分布式后训练框架 Slime,三者分别从算力成本、算法稳定性、工程规模化三个维度,重新定义了大模型后训练的效率天花板。
要做深后训练,先要解决的是长上下文的算力成本。
随着 Agent 任务链条不断拉长、工程环境复杂度持续提升,模型需要处理的上下文长度动辄突破百万 Token。动态稀疏注意力机制虽然能从原理上降低注意力计算量,但每层都需要配置独立的索引器,通过点积计算和 Top-K 筛选判断哪些 Token 需要被关注,这笔索引计算的开销反而成了新的瓶颈。可以简单理解为,为了省下赶路的成本,反而在导航上花了更多的钱。
IndexShare 就是负责省算力的架构优化方案。
它的核心思路是不再给每一层 Transformer 都配备独立的索引器,而是让每 4 层共享同一个轻量级 Indexer。 这种分层复用的设计,在 1M 上下文长度下将单位 Token 的 FLOPs 直接降低了 2.9 倍。它不仅释放了推理侧的算力空间,更重要的是为后训练阶段引入更长的任务轨迹、更复杂的多文件工程环境扫清了成本障碍,让长程强化学习变成了 “可落地的常规操作”。
算力问题解决了,强化学习本身的稳定性难题,又是长程 Agent 训练面前另一难题。
传统的同步 PPO、GRPO 等算法,都遵循 “凑齐一整批数据再统一更新” 的逻辑。训练节点要等所有推理节点跑完轨迹才能开始参数更新,推理节点也要等参数同步完成才能开始下一轮采样,两边互相等待不仅造成大量算力空耗,一旦遇到个别长难任务拖慢整体进度,还会出现 “掉队者效应”,严重时甚至引发训练死锁。
而在长程任务中,传统方法往往训练到 160 步左右,就会因为策略偏离正轨而彻底崩溃,根本撑不起完整的长周期工程任务训练。
SAO出现是为了保证不崩盘。
它彻底抛弃了批量同步的传统思路,实现了单轨迹级别的异步化训练:模型每跑完一条完整的任务轨迹,不需要等待其他样本完成,直接送入数据缓冲区,训练端就可以立刻读取数据开始参数更新。
这种设计直接解耦训练和推理,按最优效率运行,大幅提升硬件利用率。还让长程强化学习的稳定性更上一个台阶,以前传统方法撑不过 160 步的长链条任务,现在可以稳定支撑超过 1000 步的连续训练,模型终于有机会学习到从需求拆解到调试交付的完整工程闭环。
而Slime 后训练框架的作用就是承接起 IndexShare和 SAO的超级流水线,让强化学习(RL)可以大规模跑起来。
Slime 采用了一种“训推分离”的流水线思路。它把整个后训练拆成了三件事:
首先是推理生成(Rollout),模型在沙箱和终端环境中执行任务、编写代码并获取反馈;其次是分布式训练(Training),系统接收这些反馈数据并快速更新模型权重;同时,通过数据缓冲区(Data Buffer)作为中介,推理和训练两个环节可以异步独立运行,从而大幅提升了整体计算效率。
以前要训练一个千亿参数模型的强化学习,动辄需要几周时间,而智谱用 Slime 框架,把这个过程缩短到了 2 到 3 天。这意味着,大模型的后训练变成了一个可以快速试错、天天迭代的常态化流程。
放到整个行业的视角来看,GLM-5.3 的出现,其实是一个明确的行业信号。
2026 年的大模型行业,参数竞赛的上半场已经逐渐落幕,DeepSeek、OpenAI、Anthropic 等头部厂商都在寻找新的增长曲线,而 GLM 用实际成果证明,后训练就是那条确定的赛道。
当把将基座能力“练深、练透、挤出水分”,大模型的价值挖掘,才刚刚进入深水区。
参考链接:https://mp.weixin.qq.com/s/JdBx3B12L7Mhxruf4Nfr4g
上车,雷峰网带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.