同一批模型,换个配置排名就变
一项研究让12个开源权重模型在26种同等合理的基准配置下回答ARC、HellaSwag、MMLU和TruthfulQA的3,679道题,只改变选项顺序、提示词措辞及答案读取方式。
![]()
结果并不稳定。gemma4-31b的得分随配置在31%至89%间波动,四个模型在某种配置下排名第一。
配置敏感题目放大了差距
配置敏感题目承载了相邻模型间95.7%的差距。基准压缩方法筛选出的题目,恰是最易受配置影响的。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.