网易首页 > 网易号 > 正文 申请入驻

语义熵识破LLM幻觉!牛津大学新研究登Nature

0
分享至

新智元报道

编辑:alan

【新智元导读】近日,来自牛津大学的研究人员推出了利用语义熵来检测LLM幻觉的新方法。作为克服混淆的策略,语义熵建立在不确定性估计的概率工具之上,可以直接应用于基础模型,无需对架构进行任何修改。

时至今日,大语言模型胡编乱造的情况仍屡见不鲜。

不知大家面对LLM的一本正经胡说八道,是轻皱眉头,还是一笑而过?

俗话说,大风起兮云飞扬,安得猛士兮走四方。LLM幻觉任何时候都要除掉,不除不行。

试想,当你搜索一个简单语法时,网页上排名前几的都是由大模型生成的错误答案,测过之后才发觉浪费了生命。

如果LLM涉及了医学、法律等专业领域,幻觉将造成严重的后果,所以相关的研究也从未停止。

近日,来自牛津大学的研究人员在Nature上发表了利用语义熵来检测LLM幻觉的新方法。

论文地址:https://www.nature.com/articles/s41586-024-07421-0

牛津大学计算机科学家Sebastian Farquhar等人,通过设计基于LLM确定的语义熵(相似性),来度量大模型答案中语义层面的不确定性。

做法是让第一个LLM针对同一问题多次产生答案,并由第二个LLM(裁判)来分析这些答案的语义相似性。

同时,为了验证以上判断的准确性,再启用第三个LLM,同时接收人类的答案和第二个LLM的评判结果进行比较,做到了无监督,但有理有据。

整个过程简单来说就是:如果我想检查你是否在胡编乱造,我就会反复问你同一个问题。如果你每次给出的答案都不一样......那就不对劲了。

实验结果表明,本文采用的语义熵方案优于所有基线方法:

在Nature的一篇评论文章中,皇家墨尔本理工大学计算机技术学院院长Karin Verspoor教授表示,这是一种「Fighting fire with fire」的方法:

「结果表明,与这些簇相关的不确定性(语义熵)比标准的基于单词的熵更能有效地估计第一个LLM的不确定性。这意味着即使第二个LLM的语义等价计算并不完美,但它仍然有帮助。」

不过Karin Verspoor也指出,用一个LLM来评估一种基于LLM的方法似乎是在循环论证,而且可能有偏差。

「但另一方面,我们确实能从中受到很多启发,这将有助于其他相关问题的研究,包括学术诚信和抄袭,使用LLM创建误导或捏造的内容」。

Fighting fire with fire

LLM的幻觉通常被定义为生成「无意义或不忠实于所提供的源内容的内容」,本文关注幻觉的一个子集——「虚构」,即答案对不相关的内容很敏感(比如随机种子)。

检测虚构可以让基于LLM构建的系统,避免回答可能导致虚构的问题,让用户意识到问题答案的不可靠性,或者通过更有根据的搜索,来补充或恢复LLM给出的回答。

语义熵和混淆检测

为了检测虚构,研究人员使用概率工具,来定义并测量LLM所产生内容的语义熵——根据句子含义计算的熵。

因为对于语言来说,尽管表达方式不同(语法或词汇上不同),但答案可能意味着相同的事情(语义上等效)。

而语义熵倾向于估计自由形式答案的含义分布,而不是单词或单词片段的分布,符合实际情况,同时也可以看作是随机种子变异的一种语义一致性检查。

如下图所示,一般的不确定性衡量方法会将「巴黎」、「这是巴黎」和「法国首都巴黎」视为不同的回答,这并不适合语言任务。

而本文的方法可以让答案在计算熵之前根据含义进行聚类。

另外,语义熵还可以检测较长段落中的混淆。如下图所示,将生成的长答案分解为事实陈述。

对于每个事实陈述,LLM会生成对应的问题。然后另一个LLM对这些问题给出M个可能的答案。

最后,计算每个特定问题答案的语义熵(包括原始事实),与该事实相关的问题的平均语义熵较高表明为虚构。

直观上,本文方法的工作原理是对每个问题的几个可能答案进行采样,并通过算法将它们聚类为具有相似含义的答案,然后根据同一聚类(簇)中的答案是否双向相互关联来确定答案。

——如果句子A的含义包含句子B(或者相反),那么我们认为它们位于同一语义簇中。

研究人员使用通用LLM和专门开发的自然语言推理 (NLI) 工具来测量语义关联性 。

实验评估

语义熵可以检测跨一系列语言模型和领域的自由格式文本生成中的混淆,而无需先前的领域知识。

本文的实验评估涵盖了问答知识(TriviaQA)、常识(SQuAD 1.1 )、生命科学(BioASQ)和开放知识域自然问题 (NQ-Open)。

还包括检测数学文字问题 (SVAMP) 和传记生成数据集 (FactualBio)中的混淆。

TriviaQA、SQuAD、BioASQ、NQ-Open和SVAMP均在上下文无关的情况下进行评估,句子长度96±70个字符,模型使用LLaMA 2 Chat(7B、13B和70B)、Falcon Instruct(7B和40B)以及Mistral Instruct(7B)。

实验采用嵌入回归方法作为强监督基线。

评估指标

首先,对于给定答案不正确的二元事件,使用AUROC来同时捕获精确度和召回率,范围从0到1,其中1代表完美的分类器,0.5代表无信息的分类器。

第二个衡量标准是拒绝精度曲线下的面积 (AURAC),AURAC表示如果使用语义熵来过滤掉导致最高熵的问题,用户将体验到的准确性改进。

上图结果是五个数据集的平均值,表明语义熵及其离散近似都优于句子长度生成的最佳基线。

其中AUROC衡量方法预测LLM错误的程度(与虚构相关),而AURAC衡量拒绝回答被认为可能导致混淆的问题,所带来的系统性能改进。

对实验中的30种任务和模型组合进行平均,语义熵达到了0.790的最佳AUROC值,而朴素熵为0.691、P(True) 为0.698、嵌入回归基线 为0.687。

在我们不同模型系列(LLaMA、Falcon和Mistral)和尺度(从7B到70B参数)中,语义熵具有稳定的性能(AUROC在0.78到0.81之间)。

上表给出了TriviaQA、SQuAD和BioASQ在LLaMA 2 Chat 70B上测试的问题和答案示例。

我们可以从中发现语义熵如何检测含义不变但形式变化的情况(表的第一行),

当形式和含义一起变化时(第二行),熵和朴素熵都正确预测了虚构的存在;

当形式和含义在几个重新采样的代中都保持不变时,熵和朴素熵都正确预测了虚构的不存在(第三行)。

而最后一行的示例显示了上下文和判断在聚类中的重要性,以及根据固定参考答案进行评估的缺点。

上图展示了语义熵的离散变体有效地检测了FactualBio数据集上的虚构。

离散语义熵的AUROC和AURAC高于简单的自检基线(仅询问LLM事实是否可能为真)或P(True) 的变体,具有更好的拒绝准确性性能。

结论

语义熵在检测错误方面的成功表明:LLM更擅长「知道他们不知道什么」,——他们只是不知道他们知道他们不知道什么(狗头)。

语义熵作为克服混淆的策略建立在不确定性估计的概率工具的基础上。它可以直接应用于任何LLM或类似的基础模型,无需对架构进行任何修改。即使当模型的预测概率不可访问时,语义不确定性的离散变体也可以应用。

参考资料:

https://www.science.org/content/article/is-your-ai-hallucinating-new-approach-can-tell-when-chatbots-make-things-up

责任编辑:郜雪丹_NT5097

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
今日A股为何再度冲高跳水大跌?是谁在砸盘啊?熊市要被重启了吗?

今日A股为何再度冲高跳水大跌?是谁在砸盘啊?熊市要被重启了吗?

股侠指北针
2026-07-20 14:32:55
89岁谢贤过亿遗产分配曝光:百分之九十给孙子,张柏芝成最大赢家

89岁谢贤过亿遗产分配曝光:百分之九十给孙子,张柏芝成最大赢家

娱乐圈圈圆
2026-07-20 17:15:41
韩国生育率彻底爆发,打脸了全球人口学家。

韩国生育率彻底爆发,打脸了全球人口学家。

流苏晚晴
2026-07-12 19:08:14
你见过人性最阴暗的一面是啥样?网友:这种人,还是让他活太久了

你见过人性最阴暗的一面是啥样?网友:这种人,还是让他活太久了

解读热点事件
2026-07-19 00:31:00
零射门、满场犯规:这场决赛撕开了足球最不堪的底色

零射门、满场犯规:这场决赛撕开了足球最不堪的底色

带你逛体坛
2026-07-20 16:17:05
心理边界:当你接触的人多了,就会发现,敢吵架,敢冲突,敢强势的人,才是命运的强者,才配赢得尊重

心理边界:当你接触的人多了,就会发现,敢吵架,敢冲突,敢强势的人,才是命运的强者,才配赢得尊重

心理观察局
2026-07-20 06:43:06
广州某民办学校招生不理想,通知或将不续聘,评论区一边倒盼关停

广州某民办学校招生不理想,通知或将不续聘,评论区一边倒盼关停

谭谈社会
2026-07-20 14:50:55
华为Mate 90系列9月初预热:首发麒麟9050芯片 基于韬定律打造

华为Mate 90系列9月初预热:首发麒麟9050芯片 基于韬定律打造

快科技
2026-07-20 17:05:15
卡戴珊家月耗870吨水被骂上热搜,背后藏着NBA半个圈的情史?

卡戴珊家月耗870吨水被骂上热搜,背后藏着NBA半个圈的情史?

绿茵八卦君
2026-07-20 18:20:03
美军损失惨重,引爆连锁反应,盟友集体转向,阿联酋找上俄罗斯

美军损失惨重,引爆连锁反应,盟友集体转向,阿联酋找上俄罗斯

战域笔墨
2026-07-20 17:32:21
土媒:加拉塔萨雷3500万欧报价B费,开出3+1合同

土媒:加拉塔萨雷3500万欧报价B费,开出3+1合同

懂球帝
2026-07-20 14:02:05
老蒋接见杨振宁恩师合影,注意看姿态,与主席见杨振宁截然不同!

老蒋接见杨振宁恩师合影,注意看姿态,与主席见杨振宁截然不同!

丁隗解说
2026-07-19 05:18:38
李修贤评价周星驰:“鬼鬼祟祟”“戴个口罩怕被人打”

李修贤评价周星驰:“鬼鬼祟祟”“戴个口罩怕被人打”

手工制作阿歼
2026-07-20 16:00:03
官媒发文,抗击渐冻症7年的蔡磊迎一大好消息,网友:他配享太庙

官媒发文,抗击渐冻症7年的蔡磊迎一大好消息,网友:他配享太庙

晓肂爱八卦
2026-07-19 18:38:46
伊朗称摧毁约旦20个美军藏身处,打死美军数十人,还对多架飞机造成严重损坏

伊朗称摧毁约旦20个美军藏身处,打死美军数十人,还对多架飞机造成严重损坏

都市快报橙柿互动
2026-07-20 11:01:03
全年涨幅全部跌光!看透这波回调的底牌,别被恐慌情绪割韭菜

全年涨幅全部跌光!看透这波回调的底牌,别被恐慌情绪割韭菜

随梦而飞起
2026-07-20 18:25:58
巴黎新生儿70%是黑人,法国正在“换种”

巴黎新生儿70%是黑人,法国正在“换种”

李荣茂
2026-07-03 19:05:58
布伦森直白拒绝招募詹姆斯!名记实锤:詹姆斯基本锁定东部三强

布伦森直白拒绝招募詹姆斯!名记实锤:詹姆斯基本锁定东部三强

夜白侃球
2026-07-19 19:20:39
潇洒一生的谢贤走了,遗嘱公布:九成遗产留给张柏芝和谢霆锋两个儿子

潇洒一生的谢贤走了,遗嘱公布:九成遗产留给张柏芝和谢霆锋两个儿子

新快报新闻
2026-07-20 18:36:03
为什么全国有那么多教堂?看网友讲述,难怪它能全国遍地开花呢

为什么全国有那么多教堂?看网友讲述,难怪它能全国遍地开花呢

侃神评故事
2026-07-18 12:05:08
2026-07-20 19:12:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
15737文章数 66962关注度
往期回顾 全部

科技要闻

中兴阶跃荣耀齐出手,AI手机争夺系统入口

头条要闻

女子带88岁奶奶自驾游8省 耗时21天总花费约2万

头条要闻

女子带88岁奶奶自驾游8省 耗时21天总花费约2万

体育要闻

65岁肌肉男,世界杯最年长冠军主帅

娱乐要闻

谢霆锋发文确认父亲谢贤去世 享年89岁

财经要闻

AI开始挤泡沫

汽车要闻

宾利第四大车系定名托卡尔 9月23日伦敦全球首秀

态度原创

亲子
艺术
本地
公开课
军事航空

亲子要闻

夏季湿疹热疹虫咬皮炎高发,儿童皮肤科专家支招科学防治

艺术要闻

速览:2030年世界杯的23座球场,覆盖6国

本地新闻

2026暑期旅行新灵感:跟着影视去旅行

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

两名美军士兵死亡 美伊冲突升级

无障碍浏览 进入关怀版