检索增强生成(RAG)系统正面临一种新型攻击:投毒文档不仅能让模型给出错误答案,还会让模型变得异常自信,使传统检测手段失效。
研究发现,RAG投毒会推高模型token置信度,同时让输出一致性上升。这意味着,模型在给出错误答案时反而表现得更加笃定,基于不确定性的检测器因此难以识别异常。
![]()
注意力崩塌:攻击的关键特征
研究人员观察到,攻击发生时,模型的注意力会异常集中于被投毒的文档,而非分散在多个检索证据之间。作者将这一现象称为“注意力崩塌”。
这一发现提供了新的防御思路:通过监控文档级注意力分布,或许能在答案明显出错之前就暴露投毒行为。相比之下,仅检查最终答案或置信度指标,很可能漏报攻击。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.