中国前沿模型公司Z.ai于上周五发布了GLM-5.3。这款模型与其前代GLM-5.2基于同一代码库,所有性能提升均通过后训练阶段实现。官方宣称,新模型在复杂编码和长时程任务(long-horizon tasks)上表现显著增强。
后训练优化并非遵循单一固定流程的标准化操作,它通常包含推理对齐、监督微调以及基于人类反馈的强化学习(RLHF)等环节。Z.ai在一篇匿名发布的博客中表示:“过去一个月,我们持续在GLM-5.2的堆栈上扩展:更多环境、更多样化的任务、投入更多算力进行训练。”
![]()
更贴近真实生产的训练环境
公司进一步说明,扩展后的训练环境覆盖了“更广泛的生产工作流”,任务类别围绕工程和研究工作的实际执行方式设计。部分任务的工作量相当于资深工程师数日的工作内容。
Z.ai举例称:“在ML基础设施任务中,模型会获得与工程师相同的工作环境,包括计算集群、存储系统、内部文档、代码库和实验结果。它需要诊断训练堆栈中的瓶颈、实施优化、运行实验,并在保证正确性的前提下实现可量化的端到端加速。”
内部基准与公开榜单
如果内部基准可信,Z.ai新推出的Z.ai Code Bench显示,GLM-5.3的编码能力较GLM-5.2提升了50%。公司强调,这一私有基准“降低了公共测试集污染的风险”,能更真实地反映用户体验。此外,公司也公开了TerminalBench 3.0、DeepSWE、Agents' Last Exam、AutomationBench、HLE w/ Tools等多项公开基准的成绩。
开发者的真实看法
抛开这些基准,开源权重模型领域的开发者怎么看?长期时程自主软件工程公司NonBioS.ai联合创始人Nishant Soni对The New Stack表示,基于自身实践经验,他对Z.ai在真实长时程任务上的扩展成果“持保留态度”。
“据我所知,没有基准能客观证明GLM-5.3在真实世界任务中具备所宣称的优越长时程能力,”Soni说。在他看来,内部基准与真实生产环境之间的鸿沟,依然是评估这类模型时最大的不确定性。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.