网易首页 > 网易号 > 正文 申请入驻

实测GLM-5.3: 在神仙打架的一周杀回国模顶流,还按下了重置键

0
分享至


神仙打架,这周的大模型圈,已经卷到了几乎一天一个新旗舰。

有 Cursor 数据加持的 Grok 4.6 突飞猛进,马斯克还说 4.7 马上就要来;DeepSeek V4 Pro 正式版虚晃一枪后正式发布,多项 benchmark 直指 Fable 5;还有一个不能算旗舰的 Gemini Flash。

然后今天,智谱也把 GLM-5.3 端了上来。

这个在 5.2 期间,一直被调侃「我知道很好用,但不给我开会员用」的顶尖国产编程模型,终于迎来了更新。

新的模型继续在编程方面发力,评测榜单的结果显示,GLM-5.3 在编程能力上比肩 Fable 5 和 GPT-5.6 Sol。在社交媒体上参与内测用户的反馈则提到,使用体感比 Kimi K3、DeepSeek V4-Pro-0813 要更好


能跟 GLM-5.3 上桌对比的模型,在可视化图表中只剩下了 Kimi K3、Fable 5 和 GPT-5.6 Sol。以前是开源自己一堆模型对比,不找闭源自讨苦吃,现在是「对标 Fable 5」成了开源的基本配置。

六个 benchmark,GLM-5.3 的表现都不赖,尤其是由 OpenAI 提出的 GDPVal 评估测试,智谱拿到了第一名。

AutomationBench、Agents' Last Exam,一个是用来测试跨应用工作流编排能力,一个是测试智能体能力,GLM-5.3 的成绩也是数一数二。

和 Kimi K3、Qwen3.8-Max 迈向万亿大参数不同,GLM-5.3 这次参数量和上一版本差不多,同样是 7000 亿参数级别。官方技术博客中提到,此次升级带来的提升主要原因是后训练 Scaling

就是靠着 743B 的基模,智谱训练出来了 Kimi K3 2.8T 级别的大模型。

我们在与 GLM-5.2 完全相同基座上高效推进强化学习,可能我们还远未开发出这个基座(即 GLM-5.2 模型)的智能上界。


▲ 更完整的 benchmark 对比,经过后训练的 GLM-5.3 对比 GLM-5.2 提升相当明显,Coding、网络安全和 Agentic 成绩进步都不像是一个基座模型。

不得不说,现在大模型做好后训练在某些程度上比预训练都更好使。就拿四月份发布的 DeepSeek V4 Flash 预览版和 7 月底发布的正式版相比,两个模型的能力几乎是断层的。

智谱这次还开源了名为史莱姆 Slime 的一个后训练框架,直接能覆盖发布级模型后训练所需要的完整工作流。他们说从 GLM 4.5 开始,就一直在用这套框架进行后训练

目前 Slime 支持对 GLM 系列、Qwen 系列以及 DeepSeek 系列的部分模型和 Llama 3 进行后训练。


▲ 教你如何用 128xH100 训练 DeepSeek R1,以及如何蒸馏

除了主打编程,GLM-5.3 的另一个重点方向是网络安全。从 Hugging Face 事件开始,现在哪个模型不能谈谈网络安全,都算不上是一个好模型。

无论是模型的攻击能力强,能逃出设置的沙箱,还是防守能力强,能监控、抵御和分析复杂的 AI Zero Day 漏洞;这些以前听着离我们普通用户很远的东西,也成了大模型角力的新赛场。

GLM-5.3 在网络安全相关的任务中,表现与 Claude Mythos 5 持平。其中 ExploitGym 网络安全测试,就是 OpenAI 在评估自己的待发布模型时,为了解决更多问题去攻击了 Hugging Face,GLM-5.3 的表现也非常不错,898 到题,限时 6 小时内完成的情况下,达到了 130 道。


针对模型的网络安全能力,智谱还公开了一项网络安全披露账本,记录模型在不同的项目中找到的各种漏洞。GLM 找到的最古老漏洞,甚至可以追溯到大约 40 年前

40 年都没找到,GLM-5.3 一出手就找到了,放 OpenAI 或者 A 社手里,这不比证明了一个数学难题强吗。


▲ 网络安全披露账本 https://cvd.z.ai/

虽然我们普通用户不会拿它去找各种攻防漏洞,但模型的能力提升是实打实的,具体到日常的办公和编程任务上,GLM-5.3 的表现又如何。

APPSO 提前拿到了 GLM-5.3 的测试资格,继续用一些 3D 网页生成、网页应用开发、macOS 小工具开发等任务,来看看 GLM-5.3 的表现是否能快速实现我们的想法。

目前 GLM-5.3 已经上线智谱官方 Agent 应用 Zcode 和效率工具 AutoClaw,同时面向 GLM Coding Plan 用户全量开放并开放订阅。


▲ 在 Zcode 应用内可以直接选择 GLM-5.3 进行体验

第三方平台像是 WorkBuddy,QwenWork,TraeWork 等应用也已经开放抢先体验。而 API 调用预计在下周二开放,模型的完整权重则会在两周内开源。

当所有 AI 都开始卷编程

相较于写作或者文科领域,那些见仁见智,审美无法统一的任务,编程大概是大模型最适合发力的场景。

简单粗暴的一句提示词丢进去,就等着看它用代码能写出什么好看好玩有意思的画面。

我们先是让它做了一个人体血液循环的 3D 交互仿真系统,原以为它会做一个写实的人体透视,至少像是这种细节满满的 3D 仿真,有真实的身体轮廓,合理排放的血管,真实的肌肉线条。


但不知道是不是提示词不够详细,GLM-5.3 给的交付是看起来比较粗糙的版本。整个人更像是一个火柴人,内部器官也全部堆在了一起。

比较难得的是,整个的演示有较多的自定义,例如视图图层可以选择不同的场景,生理参数也有心率、压力等内容。我们甚至可以选择失血性休克的场景,直接看到血液循环的流向。


▲ 提示词:做一个高精度的人体血压循环 3D 可交互仿真系统,使用 GLM-5.3 + Claude Code

总的来说,这个交互网页能够用在教学场景,但就是没有那么好看。

继续我们在 DeepSeek Harness 中的金字塔滑板游戏测试,同样的提示词,GLM-5.3 + Claude Code 最高推理深度给出的结果也不赖——游戏体验好,场景渲染也准确。


▲ 如果你不好好操作,可能真的会输,只是这个滑板的残影,过于「亮眼」。

当我们想要它生成一些惊艳的 3D 场景时,像是一个满是水母的湖,数百万只写实的水母在一片翡翠湖泊里飘动。


这个效果确实还挺漂亮的,渲染水母就不会像渲染人体一样,只用一些简单的圆圈,不过这个 3D 水母的提示词也相当长。

在 Claude Code 中使用 GLM-5.3 时,如果你开启了自动审批命令,会经常遇到一个错误,显示「auto mode cannot determine thesafety of Bash right now.」即「自动模式目前无法判断 Bash 命令的安全性。」

这大概是 Claude Code 应用自身的机制来处理自动模式下,如何识别不同的命令是否需要弹窗通知交给我选择,但第三方的模型,暂时还没有适配 Claude Code。

于是我们切换到 ZCode 进行体验,它能像 Codex 一样使用不同的工具,不断对已经生成的网页截图识屏,分析存在的问题,然后持续优化,整个运行时间也比单纯在 Claude Code 中使用会更久。


就像这个行星撞地球的模拟,两个行星碰撞,我们在 Claude Code 中的任务最长没有超过 1h,但这个 3D 网页过了一个小时,ZCode 还在反复地测试检查。

好在最后的效果没有让人失望,我们第一眼就能看到地壳开裂、熔岩喷出、碎片形成行星环等壮观画面。就这些复杂的粒子运动,要面面俱到的编程好,肯定是需要一点模型底子的。


同尺寸里的最强模型

GLM-5.3 的意义,我们测试下来就觉得它还是回到了原本属于它的位置,即同尺寸最强模型,编程开发者的首选。

K3 用了 2.8T,DeepSeek V4 用了 1.6T,而 GLM 5.2 用了不到一半的参数,就实现了同样程度的智能。

所以如果你本来就在用智谱,已经购买了 Coding Plan(今天下午他们也重置了一次),从六月中旬发布的 GLM-5.2 切换到 5.3,是能感受到比较明显的差异。

虽然 API 版本预计要等到下周二更新,目前官网显示的 API 价格也还是 GLM-5.2 版本,但同样的模型尺寸,估计 GLM-5.3 的 API 定价不会有太大的变化。


Kimi K3、Qwen3.8-Max、DeepSeek V4 正式版、Grok 4.6、Gemini 3.7 Flash、GLM-5.3,最近的模型发布节奏几乎是前所未有,每天都有新的模型,新的工具可以测试。

模型之间的区别也随着密集的发布逐渐在缩小。拿我们自己来说,曾经 Claude 被认为是写作上最好用的模型,优化一些句子的结构,把脑子里乱成一团的想法让它有逻辑的串联起来,Claude 给的文章有时比人类写得还要好。

但频繁封号的 Claude,让我们转到了用 GPT 以及其他的模型,于是发现好像所谓的 Fable 5 和 Opus 5 并不是那么的非它不可。

写作如此,编程、生图、整理文档、做报告、构建知识库也越来越接近这个状态。


GLM-5.3 和最近这一连串新模型一起,把大模型的「最强保质期」压得越来越短。

新发布的 GLM 用了 20 天,就有更强更好的 Kimi,Kimi 用了 20 天,又能换到新发布的 DeepSeek,等 DeepSeek 不好用了,那个时候又可以轮到 GLM 了。

所以当别人问你,现在最好的国产编程模型是什么,你会说 Kimi K3、DeepSeek V4 还是 GLM 5.3?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
10块大石头每个重约1吨,当年被老蒋扔下飞机,如今是国宝中的国宝

10块大石头每个重约1吨,当年被老蒋扔下飞机,如今是国宝中的国宝

收藏大视界
2026-08-12 23:04:45
托卡耶夫很果断,利益受损的哈萨克斯坦,把一批石油改道运往中国

托卡耶夫很果断,利益受损的哈萨克斯坦,把一批石油改道运往中国

阿甘天天传
2026-08-13 02:43:41
受台风“白海豚”影响,河南舞阳一养殖户称上千头猪被淹死亡或冲走,当地回应:目前救援以人员转移为主,死亡生猪将进行无公害化处理

受台风“白海豚”影响,河南舞阳一养殖户称上千头猪被淹死亡或冲走,当地回应:目前救援以人员转移为主,死亡生猪将进行无公害化处理

每日经济新闻
2026-08-14 19:10:47
杨紫琼与托德度假捕获巨型龙虾的留影

杨紫琼与托德度假捕获巨型龙虾的留影

娱你同欢
2026-08-04 19:41:35
北京市城管执法局拟修订“违法行为举报奖励办法”

北京市城管执法局拟修订“违法行为举报奖励办法”

新京报
2026-08-14 16:53:24
刚刚,上海发布雷电预警!降水云团正在东移,注意防范

刚刚,上海发布雷电预警!降水云团正在东移,注意防范

上海长宁
2026-08-14 13:27:23
周星驰破例接受TVB专访,刘嘉玲当面追问“为何不演了”,全场反应亮了

周星驰破例接受TVB专访,刘嘉玲当面追问“为何不演了”,全场反应亮了

易象君
2026-08-13 00:15:04
1962年,毛泽东设宴款待溥仪,席间突然发问:你们御膳房的饭菜,到底好不好吃?溥仪是如何回答的?

1962年,毛泽东设宴款待溥仪,席间突然发问:你们御膳房的饭菜,到底好不好吃?溥仪是如何回答的?

人生录
2026-08-08 00:05:22
第17号台风“浪卡”生成,浙江一地:停课、停工、停产、停运!

第17号台风“浪卡”生成,浙江一地:停课、停工、停产、停运!

艺利森
2026-08-13 22:49:34
81比51大胜30分!女篮热身赛豪取4连胜:冲击亚洲冠军指日可待了?

81比51大胜30分!女篮热身赛豪取4连胜:冲击亚洲冠军指日可待了?

篮球快餐车
2026-08-14 06:54:46
巴萨第3次报价!7000万欧求购罗德里+不再提价,曼城爱卖不卖

巴萨第3次报价!7000万欧求购罗德里+不再提价,曼城爱卖不卖

体育知多少
2026-08-14 06:58:53
毛主席将他的名字,从少将名单划掉,此人流泪说:毛主席没忘了我

毛主席将他的名字,从少将名单划掉,此人流泪说:毛主席没忘了我

老范谈史
2026-08-14 09:15:38
美国将对伊朗实施“前所未见”的经济孤立手段,伊朗官员:美若敢用核弹,其全球基地将成靶子

美国将对伊朗实施“前所未见”的经济孤立手段,伊朗官员:美若敢用核弹,其全球基地将成靶子

每日经济新闻
2026-08-14 19:10:33
CBA最新消息!上海男篮续约古德温,北京留下范子铭,山东报价NBA后卫华盛顿

CBA最新消息!上海男篮续约古德温,北京留下范子铭,山东报价NBA后卫华盛顿

中国篮坛快讯
2026-08-14 16:26:02
1.2 亿!曼城锁定阿根廷巨星!世界杯一战封神!

1.2 亿!曼城锁定阿根廷巨星!世界杯一战封神!

澜归序
2026-08-14 07:53:42
消息一出,5连板牛股,“一”字跌停!

消息一出,5连板牛股,“一”字跌停!

新浪财经
2026-08-14 12:22:52
从胖东来到腾讯:房东是怎么把自己玩死的…

从胖东来到腾讯:房东是怎么把自己玩死的…

思哲与创富
2026-08-12 11:15:17
太惨了!7月纯电车销量榜!ModeIY丢冠,零跑A10第2,小米YU7第15

太惨了!7月纯电车销量榜!ModeIY丢冠,零跑A10第2,小米YU7第15

阿芒娱乐说
2026-08-13 06:49:23
事情闹大了,以色列不宣而战,伊朗头号盟友参战,美或被迫撤军

事情闹大了,以色列不宣而战,伊朗头号盟友参战,美或被迫撤军

阿代说事
2026-08-14 06:57:31
佛山辉记甜品店停业装修,疑因卫生被举报,当事人、市监发声

佛山辉记甜品店停业装修,疑因卫生被举报,当事人、市监发声

南方都市报
2026-08-14 16:36:17
2026-08-14 20:48:49
爱范儿 incentive-icons
爱范儿
消费科技第一媒体
39247文章数 2602329关注度
往期回顾 全部

科技要闻

苹果为中国训练自有大模型,阿里提供支持

头条要闻

99岁独居老人去世:曾称日子太苦不想活 后改口舍不得死

头条要闻

99岁独居老人去世:曾称日子太苦不想活 后改口舍不得死

体育要闻

离开雷霆后,威少再也没成为威少

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

便利蜂加盟遭立案:“0元加盟”生意被查

汽车要闻

吉克隽逸选车和选歌一样绝!新锐动感SUV 长安启源Q06

态度原创

艺术
游戏
手机
数码
公开课

艺术要闻

赵孟頫67岁写的《绝交书》,字字摆脱俗气,台北故宫“压箱底”之宝!

LCK第三赛段:把T1主场打成图书馆的人,只有许秀!DK三局战胜T1

手机要闻

性能续航大满贯!荣耀WIN2系列10月亮相:万级电池+2nm芯片

数码要闻

京东方举办前沿显示技术媒体品鉴会 三大技术品牌集中亮相

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版