智谱日前推出 GLM-5.3 模型,这次升级没有更换基础架构,而是继续沿用 GLM-5.2 底座,通过扩大后训练规模来强化长时程编程、智能体任务和网络安全能力,其中网络安全部分的数据表现尤为突出。 智谱在官方博客中披露,研究团队已将 GLM-5.3 应用于 269 个真实项目,经过专家复核、筛选和去重后,合计发现 2436 个有效漏洞,其中 1097 个属于中高危漏洞。目前已有 53 个漏洞公开披露,其余漏洞仍处于延期披露状态。 值得注意的是,智谱原本只是希望让模型更擅长发现漏洞,但在扩大后训练规模后,模型能力提升速度超过预期。GLM-5.3 已经不止能发现简单漏洞,还可以将多个步骤串联起来,形成完整的漏洞利用计划。 由于模型仍在进行安全评估和加固,智谱暂未开放模型权重。官方计划在完成安全测试后,以开放形式发布 GLM-5.3 权重,预计两周后可下载。届时安全研究团体也能使用该模型提升漏洞发掘效率。 在编程能力方面,智谱这次的主要思路是扩大后训练规模。与传统的代码训练题不同,新任务要求模型在完整的工作环境中读取代码、调用工具、运行测试、定位问题并完成最终交付。为此,智谱继续使用 IndexShare、SAO 和 slime 等工具,分别负责提升长上下文处理效率、训练长时程强化学习任务,以及连接模型训练、推理和任务环境。 智谱搭建了自动生成和验证任务环境的流水线:由研究智能体从真实工作中提取任务模式,再生成可以运行的长期任务;其他智能体则负责验证任务是否可完成,检查模型是否通过投机方式获得奖励,并排除没有明确结果或无法验证的任务。这意味着训练重点正从准备更多问答数据,转向构建更多可执行、可验证、可反复运行的工作环境。 智谱公布的测试数据显示,GLM-5.3 在多种模型基准测试中均有提升,尤其在需要操作终端、修改项目文件、运行测试并处理连续错误的接近真实编程场景中,表现明显优于 GLM-5.2。此外,内部测试表明 GLM-5.3 能用更少的 Token 完成任务。例如在某些任务中,GLM-5.2 需要约 95K Token,而 GLM-5.3 只需要约 78K,复杂任务场景下可节省更多资源。 不过需要说明的是,这些数据主要来自智谱公布的测试结果,不能简单理解为 GLM-5.3 已全面超越所有闭源模型。在部分公开测试中,GPT-5.6 Sol 等前沿闭源模型仍然领先。GLM-5.3 的主要变化是大幅缩小了差距,并在开放模型中达到较高水平。 消息源:智谱官方博客
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.