同一个问题,只是换了个说法,AI的准确率能差多少?IBM新论文给出的答案是:74.7个百分点。
这个数字来自IBM提出的新审计框架BenchDrift。它做的事情很直接:在不改变答案的前提下,系统性地改写同一道题目的措辞,然后看模型分数跟着波动多少。
![]()
更强的模型,波动反而更大
研究覆盖了8个模型和3个基准测试。结果显示,最佳与最差准确率的平均差距达到74.7个百分点。更反直觉的是,能力更强的模型受措辞影响反而更大。
换句话说,你以为模型“会”这道题,可能只是因为它恰好“看懂”了你的问法。
高置信度也不可靠
另一个值得警惕的发现是:即便模型给出最高置信度的回答,改写措辞后仍有18.5%的正确回答丢失。也就是说,模型自己“很确定”的答案,换个问法就可能答错。
BenchDrift的价值在于,它把“模型到底会不会”和“模型只是碰巧答对”区分开了。对于依赖大模型做决策的场景,这个波动幅度值得认真对待。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.