网易首页 > 网易号 > 正文 申请入驻

刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness

0
分享至


智东西
作者 陈骏达
编辑 心缘

智东西8月14日报道,就在刚刚,智谱发布了其最新一代旗舰模型GLM-5.3,并宣布模型将在两周内开源。这是一个拥有7430亿个参数的模型,和此前的GLM模型一样主打编程。

在多项主流基准测试中,GLM-5.3位居所有已开源或即将开源模型中的第一;其在编程与智能体任务上的能力,已逼近Claude Fable 5、GPT-5.6 Sol等海外顶尖模型

与国内模型相比,GLM-5.3与Kimi K3在编程和智能体领域互有胜负,并在绝大部分基准测试中领先DeepSeek-V4-Pro-0813。而在网络安全能力方面,GLM-5.3则展现出一定优势,领先于另外两款国产模型。


同时,GLM-5.3还在能力和token效率之间取得了更好的平衡。在相同的高档位思考预算下,GLM-5.3的准确率达到31.5%,超过Claude Opus 4.8的29.5%,任务平均输出约5万个token,不到Opus 4.8平均输出量的一半。


智东西在发布前获得了GLM-5.3的内测资格,得以提前深度体验这款模型在真实开发场景中的完整能力。在我们的实测中,GLM-5.3+ZCode的组合不仅能从0到1开发一款以真实地图数据1:1复刻上海陆家嘴至外滩区域的3D开放世界驾驶游戏,还能“裸考”DeepSeek刚开源的Harness框架:在零先验的条件下读懂这个超7000个文件的代码仓库,再按它的规矩打造出一个“人格插件”。


除了编程能力之外,智谱称GLM-5.3在充分的预训练之后,还涌现出了不错的网络安全能力,在与国内高校、企业的合作中,GLM-5.3用两周时间揪出了2436个漏洞。在白盒代码审查与漏洞推理等安全任务中,GLM-5.3的表现与Claude Mythos 5接近。

目前,GLM-5.3已上线智谱的AI编程工具Zcode、效率工具AutoClaw,支持通过GLM Coding Plan使用。同时,这一模型还在TraeWork、WorkBuddy、Qoder、OpenCode等平台开放了抢先体验。

智谱称,GLM-5.3的API将很快上线。同时,在模型开源之前,GLM-5.3还将完成安全评估、安全加固,以限制其在网安领域的潜在攻击能力,保留其防御价值。

体验链接:https://zcode.z.ai/en

博客链接:https://z.ai/blog/glm-5.3

一、拿真实数据1:1复刻外滩建筑群,还做了个开放世界驾驶游戏

此次测试,我们用到了智谱最近更新的ZCode,搭配旗舰模型GLM-5.3。我们交给GLM-5.3的第一个任务是一份有难度的产品需求文档:以真实的OpenStreetMap数据为基础,开发一款上海陆家嘴至外滩区域的3D开放世界驾驶游戏。

文档中要求,地图解析、坐标转换和游戏逻辑等关键模块全部让模型“手写”,只允许使用Three.js的底层渲染能力。为了测试模型在长任务中的记忆可靠性,我们还在文档中部埋下了两条“陷阱条款”,包括凌晨两点到四点外滩建筑灯光熄灭一半,以及地图边缘需要设置带有提示的软性阻挡。


GLM-5.3拿到需求后先验证了数据的真实形态。它编写脚本从Overpass API拉取了8万多个OSM节点,先做了一轮数据勘查,确认地图数据的完整性后,才开始开发。

整个开发过程持续了多轮,最终交付了约4900行代码,覆盖数据管线、车辆物理、车辆音效、导航、昼夜循环和存档系统,两条埋雷条款在最终验收中全部通过。

开发过程中,可以观察到GLM-5.3排查问题的思路很清晰。测试早期,游戏页面完全卡死,它没有盲目改动代码,而是给本地服务器加了请求探针,通过面包屑日志定位到问题。


在精准定位后,GLM-5.3修复bug的效率得到了提升。比如,当我提出游戏相机视角存在问题,有时会穿过建筑时,GLM-5.3从这条模糊的描述出发,统计出全部6300多栋建筑中有大约4成的轮廓环绕方向与墙面法线约定相反,从而导致了上述问题,实际修复只改了几行代码。


因为测试环境无法直接目检画面,它甚至自己写了一个零依赖的PNG解码器,用像素统计来客观证明水面、标线和夜间灯光确实被正确渲染。

值得一提的是,搭配ZCode使用时,整个对话的平均缓存命中率达超过了99%,可以节省不少钱。


不过,在这一项目的开发过程中,我们也发现了GLM-5.3的一些短板。工程能力之外,它的审美判断还有提升空间,建筑贴图和道路标线的观感先后经过四轮人工反馈,还是没能达到预期,略显简陋。

总体来看,GLM-5.3搭配ZCode基本可以顺利完成用户交代的开发任务,但用户仍需要给模型提供一定的反馈,才能打磨出更好的交付物。

二、读懂超7000个文件,连夜打造DeepSeek Harness“人格插件”

如果说驾驶游戏考察的是GLM-5.3从零创造的交付能力,第二项实测考察的则是另一个方向:面对一个完全陌生的大型代码仓库,能否读懂它,再按它的规矩改造它。

我们的测试对象是DeepSeek昨天刚刚开源的DeepSeek Harness,一个采用“一切皆插件”架构的智能体框架。这个monorepo包含40多个顶层包、200多个工作区项目、7400多个文件

对GLM-5.3来说,这是一次“裸考”:DeepSeek Harness仓库发布仅一天,它的训练数据里不可能有任何相关信息,对这个框架的全部认识只能来自现场摸索。


第一项任务是仓库级理解。我们向GLM-5.3询问,用户执行dsh web之后,从进程启动到第一条消息抵达模型,中间经过哪些模块,插件如何加载,出错时又如何兜底。

面对这种体量的代码仓库,GLM-5.3派出了4个并行探索子智能体,分别追查CLI入口、插件机制、模型契约与消息通路,再把四份结论汇成一份链路报告,并回头逐条核对关键代码。这些文件的跨度较大,而GLM-5.3成功地找到了它们之间的联系。

报告的关键结论有三条:插件的装配依据一份YAML清单逐行登记,不存在目录扫描式的自动发现;顺着这条线索,它锁定了LlmAdapter这份所有模型提供方共同遵守的契约;启动失败时的策略是快速失败,而非静默跳过。


在此基础上,我们进一步要求GLM-5.3为DeepSeek Harness开发一个“人格插件”,让AI的回复可以在文言文、东北话与猫语之间切换。


这项任务的难点在于要做到“零侵入”:我们要求GLM-5.3开发的结果功能要生效,但框架的原有行为不能变,插件关闭要立刻复原。

GLM-5.3先派出2个探索子智能体并行通读仓库,约5分钟后各自提交报告,研究页面交互方案时又派出第3个,3个子智能体合计消耗约690万token。规范摸清后,它选定系统提示注册表作为注入口:指令随系统层下发,用户消息没有改动;插件卸载后注册表自行摘除。

下方是GLM-5.3最终交付的插件效果。可以看到这个插件的交互体验是比较原生的,可以与DeepSeek Harness的其他插件出现在同一个菜单栏中,切换后语言风格的确符合要求。

再来看看具体的执行过程。初版交付涉及20个文件、净增560行,除代码外还包含双语文档配对记录与重新生成的依赖图。同时,配套的11条单元测试一次通过,覆盖开启注入、关闭复原与三人格路由等功能。


不过,在跑全量回归的时候出现了一段插曲:771个测试文件中有6个失败。为排查问题,GLM-5.3先将自己的改动整体撤下,在干净基线上重跑同一批用例,失败原样复现。据此,它确认问题源于本机环境,与新增代码无关。

在解决环境问题后,应我们要求,GLM-5.3复用了DeepSeek Harness既有的命令机制,将人格切换接入网页端,键入一条斜杠命令即可切换人格,前端基本没有新增代码,28项文档门禁与937对双语文档检查全数通过。


从结果看,GLM-5.3在本轮实测中的长板是任务拆解、跨包溯源与代码引用,以及对陌生工程规范的理解和遵循,对照实验的处置方式也比较严谨。

不过,体验时我们也发现,ZCode在一些长任务执行期间存在反馈不足,我们一度以为进程中断,人工打断了执行。同时,对于一些风险很低的修改,GLM-5.3也会跑完整的检查与测试,这在有些场景下可能会带来不必要的token消耗。

DSH“人格插件”开源地址:

https://github.com/chenjunda0018-sketch/A-persona-plugin-for-DeepSeek-Harness

三、能力提升来自后训练Scaling,网安能力涌现

智谱在GLM-5.3博客中,详细介绍了这款模型在技术方面的思考。

GLM-5.3的基座模型与GLM-5.2完全一致,其能力提升主要来自于后训练的Scaling。GLM-5.3在后训练过程中经历了更长的任务环境,更丰富的环境类型,后训练时间也明显加长。

随着任务环境的不断丰富,智谱还观察到GLM-5.3涌现出超预期的网络安全能力。

例如,在白盒源代码安全基准测试CyberGym中,GLM-5.3得分为84.5%,超过GLM-5.2(77.2%)、Claude Mythos 5(83.8%)、GPT-5.6 Sol(83.6%)。在更接近完整漏洞利用的ExploitGym测试中,2小时内,Mythos 5完成了181个任务,GLM-5.3完成105个任务,达到Mythos 5约58%的水平,相比GLM-5.2的29项提升明显。


GLM-5.3发布前两周,智谱联合清华大学、南开大学,以及云起无垠、绿盟科技、赛博昆仑、DARKNAVY、华顺信安、奇安信、腾讯玄武、云鼎实验室等多家安全团队,开展了密集的红队测试与安全评估。

相关测试最终在2周内累计发现漏洞2436个(经过初筛、去重),其中1097个为中高危,最早可追溯至约45年前,代表性漏洞覆盖系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与互联网协议等269个项目,相关漏洞均已报送国家CNNVD/CNVD国家漏洞库,为提高披露过程的透明度,智谱建立了Z.ai安全披露账本,记录漏洞从发现、确认到修复的全过程。


执行效率方面,智谱自GLM-5.2开始引入effort level(思考档位)控制。智谱称,在相近Token预算下,GLM-5.3在任务完成质量、执行速度和使用成本之间取得了更好的平衡。

结语:智谱、DeepSeek等纷纷重押后训练,不换基座也能换代

从我们的实测来看,GLM-5.3已经能在真实工程现场交出完整的交付物;而审美判断等短板,或许可以成为下一轮后训练继续打磨的方向。

后训练这条路线近期的受益者不止智谱一家:DeepSeek-V4正式版能力的大幅提升,同样与后训练阶段的投入有关。在预训练的数据与算力红利逐渐见顶之后,后训练正成为头部模型厂商进一步提升性能的关键方向,其潜力很可能还未被充分挖掘。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
著名演员李立群含泪发视频!表示家被儿子给抄,82年百万级珍藏茅台被喝精光,评论区炸锅

著名演员李立群含泪发视频!表示家被儿子给抄,82年百万级珍藏茅台被喝精光,评论区炸锅

火山詩话
2026-08-10 17:01:43
要求员工“996”!华人知名地板商被起诉多项重罪,面临最高20年刑期

要求员工“996”!华人知名地板商被起诉多项重罪,面临最高20年刑期

大洛杉矶LA
2026-08-14 05:57:40
美媒终于回过味:中国这哪是买石油,分明是在给俄进行“大换血”

美媒终于回过味:中国这哪是买石油,分明是在给俄进行“大换血”

麓谷隐士
2026-08-07 05:25:03
1场婚外情风波!澳板球女副队长陷争议 首席执行官首度回应

1场婚外情风波!澳板球女副队长陷争议 首席执行官首度回应

赛场名场面
2026-08-13 17:20:58
消息人士:以色列情报部门曾通报美方,伊朗可能用肩扛式对空导弹袭击特朗普专机,中央情报局官员认为这条情报可信度低

消息人士:以色列情报部门曾通报美方,伊朗可能用肩扛式对空导弹袭击特朗普专机,中央情报局官员认为这条情报可信度低

政知新媒体
2026-08-14 11:10:17
1941 年日军一路追击国军溃兵,不料迎面撞上王牌74军,师长李天霞一个眼神警卫心领神会,一场血战令上高成为日军挥之不去的噩梦

1941 年日军一路追击国军溃兵,不料迎面撞上王牌74军,师长李天霞一个眼神警卫心领神会,一场血战令上高成为日军挥之不去的噩梦

唠叨说历史
2026-08-10 15:59:07
解放军南京舰开进台湾24海里,一声无线电警告美军机立刻掉头,台军全程沉默无力应对,台海防务格局已被彻底改写

解放军南京舰开进台湾24海里,一声无线电警告美军机立刻掉头,台军全程沉默无力应对,台海防务格局已被彻底改写

林杰论事
2026-08-13 23:30:36
国产动画《牛来》上映9天票房7169元 观众看完想哭

国产动画《牛来》上映9天票房7169元 观众看完想哭

3DM游戏
2026-08-14 17:13:12
开空调可减缓衰老?浙大联合哈佛研究:热一天,身体可能老0.057岁

开空调可减缓衰老?浙大联合哈佛研究:热一天,身体可能老0.057岁

思思夜话
2026-08-11 15:32:19
阿富汗塔利班恢复奴隶制。

阿富汗塔利班恢复奴隶制。

荆楚寰宇文枢
2026-01-29 23:23:47
补充常见维生素,近50%癌细胞凋亡!2026年最新:还破坏线粒体功能,诱发氧化应激,掐断癌细胞能量补给,抑制癌症生长

补充常见维生素,近50%癌细胞凋亡!2026年最新:还破坏线粒体功能,诱发氧化应激,掐断癌细胞能量补给,抑制癌症生长

梅斯医学
2026-08-14 07:54:40
几乎全是假货!利润高达2400%,为何消费者还前赴后继争相购买?

几乎全是假货!利润高达2400%,为何消费者还前赴后继争相购买?

大鱼简科
2026-06-23 16:53:56
中国广电很多年没见过这么严峻的形势了

中国广电很多年没见过这么严峻的形势了

辉哥说动漫
2026-07-17 10:42:19
王骁风波再升级!抢遗产传闻未平,更多黑料被扒,张译没说错

王骁风波再升级!抢遗产传闻未平,更多黑料被扒,张译没说错

草莓解说体育
2026-08-14 02:14:57
终于有经济学家批评体制内退休金太高、加剧代际矛盾,评论区炸锅

终于有经济学家批评体制内退休金太高、加剧代际矛盾,评论区炸锅

慧翔百科
2026-06-23 08:47:02
美股存储芯片股盘前强势,闪迪涨近4%,国际金银集体翻红

美股存储芯片股盘前强势,闪迪涨近4%,国际金银集体翻红

21世纪经济报道
2026-08-14 18:33:14
法庭上杀人犯当场质问法官:“我明明杀了四个女人,你们为什么说我杀了3个?”

法庭上杀人犯当场质问法官:“我明明杀了四个女人,你们为什么说我杀了3个?”

落纸生花创意手工
2026-07-19 12:06:31
坐海航航班,遇到了超漂亮空姐

坐海航航班,遇到了超漂亮空姐

微微热评
2026-08-06 12:11:18
9.2 分神剧回归,第 1 集就脱光,Netflix 这次真敢拍...

9.2 分神剧回归,第 1 集就脱光,Netflix 这次真敢拍...

i书与房
2026-08-08 07:25:03
下体被捅2尺木棍,军嫂被害,内参惊动中央,江苏特大杀人案始末

下体被捅2尺木棍,军嫂被害,内参惊动中央,江苏特大杀人案始末

易玄
2026-08-07 12:39:42
2026-08-14 19:24:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12440文章数 117151关注度
往期回顾 全部

科技要闻

苹果为中国训练自有大模型,阿里提供支持

头条要闻

老人被撞身亡肇事车仅有交强险 司机当庭称没能力赔偿

头条要闻

老人被撞身亡肇事车仅有交强险 司机当庭称没能力赔偿

体育要闻

离开雷霆后,威少再也没成为威少

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

便利蜂加盟遭立案:“0元加盟”生意被查

汽车要闻

长安启源Q06-吉克隽逸

态度原创

游戏
房产
数码
健康
公开课

《漫威争锋》黑人泳装引爆争议:维权还是小题大做?

房产要闻

金茂、招商,海南多个岗位招人!

数码要闻

周末聚会怎么玩才尽兴?哈趣H3 Ultra Max把客厅变成快乐主场

孩子高低肩,是不是脊柱侧弯了?!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版