在基础能力测试中,GLM-5.3在输出限制内返回可见内容的表现优于GLM-5.2。本次评测将难度大幅提升,设置了六个可客观验证的难题:极难数学、因果分析、约束推理、嵌套JSON、多阶段物理以及可执行的最优代码。 首轮回答结果显示:GLM-5.3拿下4/6,GLM-5.2仅获2/6。然而戏剧性的是,唯一一个通过全部隐藏测试的最优程序,恰恰出自总分落后的GLM-5.2。 **测试环境** 运行前先请求 GET https://cn.crazyrouter.com/v1/models 确认两个模型ID均准确存在。全部12个首轮响应均正确返回了所请求的模型。 **极难数学题:两个模型双双落败** 题目设定四种优惠券,概率分别为1/2、1/4、1/8、1/8,要求用容斥原理精确计算两个结果: E[T] = 1339/105 ≈ 12.752380952 P(T≤8) = 46179/131072 ≈ 0.352317810 两个模型都耗尽9,000个推理token,始终未能输出可见内容。GLM-5.3将上限提升到20k后依然返回空结果;GLM-5.2的20k请求则直接超过420秒读取超时。 这一结果表明:盲目调大max_tokens并非通用解法。系统必须同时监控finish reason、内容长度与超时时间,才能避免评测陷入死循环。 **GLM-5.3的高光时刻** 在辛普森悖论题中,模型准确识别出统计反转: - 小石子:A组 81/87 > B组 234/270 - 大石子:A组 192/263 > B组 55/80 - 合计原始:A组 273/350 < B组 289/350 - 50/50标准化后:A=0.8305,B=0.7771 GLM-5.3还正确区分了数据标准化与因果结论,主动提及随机化、未测混杂、正向性(positivity)以及置信区间,展现出扎实的因果推理素养。 在UNSAT核心题中,模型输出含[1,2,3]的正确JSON,并严谨证明C、D被强制分配至同一位置。多阶段物理题中,GLM-5.3一口气给出a≈0.847、v1≈1.59、v2≈1.18、x≈0.0835的全套数值。 **GLM-5.2的制胜点** 代码题要求实现optimize_release_plan函数,需处理传递依赖、按日限制、最大化value、最小化risk、字典序仲裁、非法引用与循环检测等多重约束。GLM-5.2生成的原始Python文件未经任何修改,一次通过全部隐藏测试套件,成为六道题中唯一满分代码。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.