一个名为 slop code bench 的编码评测基准正在成形。Dex Horthy 发文透露,该基准目前对比了 Fable 5.1、Sol 的 med/high/xhigh 三档推理设置,以及 GLM 5.3 的 med/high 两档表现。
评测尚未跑完
![]()
Horthy 明确表示,目前许多 run(测试运行)尚未完成,结果会持续更新。这意味着当前数据只是阶段性快照,最终排名仍有变数。
幕后团队与后续动作
他在文中特别感谢了 GOrlanski 团队搭建该基准。对于关注编码模型选型的开发者来说,这个新基准提供了一个横向对比不同推理强度下模型表现的参考维度。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.