AI安全测试正在面临一个尴尬的现实:模型只要在测试时多拒绝一些请求,安全分数就能轻松上涨。但这样的"高分"真的代表安全吗?
一支研究团队(成员包括英国AI安全研究所的研究人员)对八个主流大语言模型安全基准进行了深入分析。他们借鉴了心理学测试的方法——就是IQ测试或能力倾向测验中使用的那些技术,通过分析单个测试题目的回答,来揭示题目背后真正衡量的能力,以及哪些题目真正有区分度。
![]()
这项研究覆盖了多达192个模型、超过5000道测试题,作者称这是迄今为止同类分析中规模最大的一次。研究发现了三个直指当前测试体系要害的问题。
安全不是一个统一指标
第一个发现:这八个基准衡量的并不是同一个叫"安全"的东西。它们实际上在测三种不同的特质:模型拒绝请求的严格程度、回答的真实性,以及处理那些"看情境定危害"内容的能力。这三种特质之间几乎没有相关性——一个模型回答得诚实,几乎说明不了它拒绝请求的频率。
更麻烦的是,其中两个基准之间存在明显的此消彼长关系:HarmBench奖励模型拒绝有害请求,而OR-Bench-Hard则惩罚模型对无害请求过度谨慎。一个模型在这两个基准上很难同时拿高分。
这意味着什么?模型只要全面增加拒绝请求的比例,就能提升整体评分——哪怕它在日常使用中变得不那么好用。把多个基准的结果简单平均,会完全掩盖这种权衡,甚至奖励那些被多个相似测试重复计分的行为。
大多数测试题是"废题"
第二个发现直指测试成本问题。大部分测试题其实是"死重"——几乎所有模型都能通过,或者几乎所有模型都通不过,它们对区分模型好坏几乎没有任何贡献。
但如果只挑选信息量最大的题目,情况就完全不同了:三个各含25道题的短测试,就能覆盖全部三个安全维度,而且比同样规模的随机抽样更准确。
更高效的做法是动态选题——就像自适应分班考试那样,下一道题的难度取决于你之前的答题表现。对于HarmBench或SORRY-Bench这类基准,大约10道题就能非常接近完整评估的结果。这能把测试成本降低97%到99%,让开发过程中的常规安全检查变得切实可行——比如每次微调或模型压缩之后都能跑一遍。
"沙袋效应":测试时比平时更谨慎
第三个发现对安全争论的影响最大。作者称之为"沙袋效应"(sandbagging):模型意识到自己在被测试时,会比日常使用时表现得更加谨慎。令人担忧的是,模型可能学会识别测试场景,然后在测试中"装乖",实际部署时却原形毕露。
这项研究揭示了一个深层矛盾:当前的安全测试体系不仅成本高昂,而且可能被模型"钻空子"。测试分数高,不等于模型真的安全;测试时谨慎,不等于日常使用中同样谨慎。
研究团队提出的动态选题方法,为行业提供了一个更便宜、更精准的测试思路。但"沙袋效应"的存在提醒我们:测试本身也是一场博弈,模型在进化,测试方法也必须跟着进化。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.