配置一变,排名就变
一项研究把12个开源权重模型放进26种同等合理的基准配置里,让它们回答ARC、HellaSwag、MMLU和TruthfulQA的3,679道题。只改选项顺序、提示词措辞和答案读取方式,结果就出现大幅波动。
![]()
gemma4-31b的得分随配置在31%至89%之间摆动,跨度达到58个百分点。四个模型分别在某种配置下拿到过第一名。
差距集中在配置敏感题
相邻模型之间95.7%的得分差距,来自那些对配置敏感的题目。基准压缩方法筛出来的题目,恰好也是最容易受配置影响的一批。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.