网易首页 > 网易号 > 正文 申请入驻

答对了,理由却错了:港科大提出LexAgentHallu,追踪智能体的「隐性幻觉」

0
分享至

来源:市场资讯

(来源:机器之心)

让智能体分析一起法律案件,它可能检索法规、整理事实、列出理由,最后给出一个看起来完全正确的答案。

问题可能出在更早的一步:它引用了错误法源,算错了程序期限,或者误解了工具返回的内容。后面的推理越流畅,这个错误反而越容易被最终答案遮住。

如今,法律大模型正在从单轮问答走向智能体。系统不再只是生成一段文字,而是会规划任务、调用检索工具、读取材料,并依据中间结果继续行动。人们把更多步骤交给模型,也就更难逐项确认它究竟看到了什么、为什么作出当前判断。

一次幻觉,开始有了跨步骤的后果。

香港科技大学的研究团队将目光放在了这条执行链上。他们提出智能体幻觉评测基准 LexAgentHallu,把观察对象从最终答案扩展到完整轨迹,并将错误定位到具体步骤。

这项工作的出发点很直接:当一个智能体说“依据已经找到”“规则适用于当前事实”时,评测不能只看结论对不对,还要检查支撑结论的理由是否真实、准确并且前后一致。


  • 论文标题:LexAgentHallu: A Hierarchical Benchmark for Profiling Hallucinations in Legal Agents

  • 机构:香港科技大学

  • 论文地址:https://arxiv.org/abs/2609.09754

一个错误法源

可以带偏整条法律推理

过去评测法律大模型,最常见的做法是给出一道题,再检查最终答案是否正确。到了智能体场景,同一个错误还要继续往下追,看看它影响了哪些检索、引用和判断。

把一条法规的名称写错,可能只留下一个文本错误。把已经失效的规定当成现行法,或者把下位规范当成上位法,却可能改变后续的规则选择、事实适用和救济建议。

智能体的风险因此不只来自“编造”。它也可能找到真实材料,却把材料用错;调用了正确工具,却填写了错误参数;看到了相关结果,却误读了结果所支持的范围。

一次幻觉,不再只是错误文本,而可能成为下一步法律判断的前提。

LexAgentHallu 因此不把最终答案视为唯一评测对象。它沿着智能体的执行轨迹逐步检查:系统如何规划、调用了什么工具、读到了什么结果、保留了哪些信息,以及怎样把事实与规则连接起来。

智能体的幻觉

究竟藏在哪里

LexAgentHallu 建立了一套双层分类体系。

第一层关注法律内容本身,包括法源、法律原则、程序规则和事实适用等错误。第二层关注智能体执行过程,包括规划与推理、记忆,以及工具调用与观察结果理解等错误。两层合计包含 7 个中层类别和 27 个细粒度子类。

这套分类的目的不是给错误换一组名称,而是让问题能够被定位。法源伪造需要核验引用,事实—规则错配需要重新检查要件,工具参数错误需要约束调用接口,记忆偏移则指向上下文管理。

基准的构建也围绕“难例”和“可核验”展开。研究团队从多类法律任务中收集数据,过滤容易样本,再由具备法律训练背景的标注者核对答案、法源和推理轨迹,最后完成幻觉分类与专家复核。


图 1|LexAgentHallu 的四阶段构建流程。来源:原论文 Figure 1,第 4 页。

最终,LexAgentHallu 收录 3414 个实例,覆盖 17 个法律类别和 6 类任务。它不只回答“系统错了多少”,还试图说明错误发生在哪里、属于哪一类,以及是否可能继续污染后续步骤。

最好的配置

也有 89% 的轨迹出现幻觉

论文评测了 18 种闭源和开源智能体配置。结果显示,高幻觉率并不是个别系统的边缘现象。

即使表现最好的配置,仍有 89% 的执行轨迹至少出现一次幻觉。所有系统在法律内容层面的幻觉频率都不低于 87.5%。

这组结果并不等于“所有法律回答都有同样风险”。它说明的是,在这套强调困难样本和完整执行轨迹的评测中,当前系统很难从头到尾保持一条干净、可核验的推理链。

模型、工具和编排方式还会共同改变错误分布。ReAct 式的行动—观察循环在整体幻觉和法律内容幻觉上更有优势;法律专用工作流更能压低过程性错误;预先规划再执行的方式,在本实验中没有表现出稳定领先。

因此,部署智能体时,不能把模型、工具和流程拆开评估。更强的基础模型,仍可能在不合适的检索流程里放大错误;较小的模型,也可能通过更明确的工具协议和过程约束获得更稳定的表现。

答案已经正确

为什么理由仍然不可信

论文提出了一个很直观的指标:RAWR,即 Right-Answer-Wrong-Reason。它只观察最终答案正确的样本,再检查这些样本的执行轨迹中是否仍然存在幻觉。

结果显示,在答案正确的前提下,平均仍有 68% 的轨迹包含至少一种法律内容幻觉,37% 的轨迹包含至少一种智能体过程幻觉。


图 2|RAWR 衡量“答对但理由错”的比例。红色为法律内容错误,蓝色为智能体过程错误。来源:原论文 Figure 4,第 7 页。

正确答案只能说明结论命中,不能证明推理链是干净的。

对法律咨询、合同审查和诉讼辅助等应用来说,这一区别尤其关键。用户需要的不只是一个看起来正确的句子,还需要能够追溯、核验并经得起反问的理由链。

如果系统只在输出端给出结论,却不暴露引用、推理和工具调用的质量,错误就可能在“答案正确”的表象下继续留存。

哪些任务更容易出问题

不同任务的幻觉频率并不均匀。开放式、长链条、需要综合事实与规则的任务,更容易暴露法律内容和过程错误。


图 3|不同任务类型下的幻觉频率。判决分析、案例分析等开放式任务处于高位。来源:原论文 Figure 5,第 8 页。

在任务类型上,判决分析的法律内容幻觉频率达到 1.00,案例分析为 0.95;法律推理、法律咨询、法律知识问答和判决预测也都处于高位。

过程性幻觉呈现出不同排序。判决分析达到 0.83,判决预测为 0.71。较短输出并不必然安全:只要任务要求多步证据整合、期限判断或规则适用,规划和记忆仍可能成为风险点。

真正决定风险的,不只是题目看起来有多难,而是系统需要完成多长的“事实—规则—程序—结论”映射。任何一个环节发生偏移,后面的步骤都可能在错误前提上继续推进。

幻觉会不会沿着链条一起发生

论文还分析了 27 个细粒度幻觉子类之间的共现关系。结果显示,这些错误并不是随机散点,而会形成具有结构的组合。


图 4|27×27 幻觉子类共现矩阵。红色表示正向共现,蓝色表示负向共现。来源:原论文 Figure 6,第 8 页。

程序期限错误与救济路径错误的共现提升度达到 2.82,程序步骤错误与程序后果错误达到 2.59。最强的跨组信号出现在法源层级错误与法律立场混淆之间,提升度达到 7.07。

这意味着,很多看似分散的错误可能共享同一个上游原因。法源层级一旦判断错误,后续的规则立场和事实适用就可能一起偏移;程序时钟一旦算错,期限、步骤和救济路径也可能连续出问题。

对系统治理来说,高风险错误可以被视为早期信号。一旦检测到法源层级、期限计算、程序步骤或事实要件映射异常,系统就应触发二次检索、规则校验或人工复核,而不是等到最终答案生成后再被动纠错。

从评测基准

怎样走向产品防线

LexAgentHallu 的直接价值,是把“幻觉很多”拆成可以处理的故障类型。把这套思路落到产品中,智能体至少需要三道检查。

生成前,明确边界。系统需要确认适用法域、任务范围和可回答程度。在管辖权、时效或程序路径不清楚时,不应直接给出确定判断。

执行中,验证依据。检索结果、引用来源、关键事实和工具返回值需要持续核对。一个中间结果不能只因为“看起来合理”就被带入下一步。

输出前,检查一致性。结论与理由应当相互支撑,尤其要核对法源效力、程序期限、构成要件和救济路径。最终答案正确,也不能替代这一步检查。

更进一步,评测对象应当从单一模型扩展为“模型—工具—工作流”整体。系统如何检索、何时反思、怎样保留中间状态、在什么条件下停止,都是可靠性的一部分。

论文也提醒我们谨慎外推。LexAgentHallu 主要基于中国法律体系,并集中于单智能体场景。迁移到普通法、多法域检索或多智能体协作时,法源权威性、先例适用和程序规则都需要重新定义。

LexAgentHallu 为智能体增加了一种更接近真实部署的评测方式:不仅看最后答了什么,还要追踪答案是怎样形成的。

我们把法律任务交给智能体,是希望它能够稳定处理检索、事实整理和规则适用,而不是让用户在事后逐条排查一条看似顺畅的推理链。一个引用、一项期限判断、一次工具调用,都需要在进入下一步之前经得起核对。

“答对了,理由却错了”不只是一个评测现象。它提醒我们,智能体的可信度不能由最终答案单独证明。真正可靠的系统,需要让错误更早暴露,也让错误更难沿着执行链继续传播。

作者简介

论文共同第一作者周钰锦、郑明轩、曹楚雪均为香港科技大学跨学科学院人工智能在读博士生,师从韩斯睿教授与郭毅可教授,研究方向涵盖法律人工智能、大模型安全对齐、与智能体等,成果发表于 ICML、EMNLP、ACL 等国际顶级会议。韩斯睿为香港科技大学助理教授、主要从事人工智能、法律科技与法律金融交叉研究。郭毅可教授为国际知名的计算机科学家、香港科技大学计算机科学及工程学系讲座教授、中国工程院外籍院士。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
世界首次500强差距断崖:日本149家,美国151家,中国3家,如今呢

世界首次500强差距断崖:日本149家,美国151家,中国3家,如今呢

福建睿平
2026-08-28 07:25:16
郑钦文打退卡林斯卡娅喜迎1000赛新里程碑,辛纳官宣伤退上师赛

郑钦文打退卡林斯卡娅喜迎1000赛新里程碑,辛纳官宣伤退上师赛

网球之家
2026-10-03 21:08:52
看德国悲惨现状就明白:中国为何坚决打击性交易,原因不言自明

看德国悲惨现状就明白:中国为何坚决打击性交易,原因不言自明

怪味历史连连看
2026-07-01 14:49:12
瞒不住了!刘嘉玲除了洁癖之外,不和梁朝伟生孩子也是有原因的

瞒不住了!刘嘉玲除了洁癖之外,不和梁朝伟生孩子也是有原因的

天马幸福的人生
2026-10-01 15:15:49
爸妈今年都62了,昨晚跟我摊了底:家里存款只有二十六万出头。

爸妈今年都62了,昨晚跟我摊了底:家里存款只有二十六万出头。

大熊欢乐坊
2026-10-03 18:00:30
人民日报发声:体制内公职人员的隐性收入,正在消失

人民日报发声:体制内公职人员的隐性收入,正在消失

细说职场
2026-10-01 09:35:46
罗马诺:邓弗里斯暂无回归国米迹象,球员在皇马很开心

罗马诺:邓弗里斯暂无回归国米迹象,球员在皇马很开心

懂球帝
2026-10-03 21:48:12
别当废品扔!这东西涨得比黄金疯,一天一个价,家里翻到就变现

别当废品扔!这东西涨得比黄金疯,一天一个价,家里翻到就变现

叮当当科技
2026-10-02 21:09:38
再恩爱都挡不住残酷现实?窦骁何超莲关系被曝,彻底击碎婚变谣言

再恩爱都挡不住残酷现实?窦骁何超莲关系被曝,彻底击碎婚变谣言

甜柠檬吖
2026-10-03 20:28:03
消息称大众CARIAD拟进一步裁员1000人,未来5年削减61亿欧元投资

消息称大众CARIAD拟进一步裁员1000人,未来5年削减61亿欧元投资

IT之家
2026-10-03 17:32:15
部门同事聚餐唯独没叫我,第二天接到通知,我被调到总裁办公室

部门同事聚餐唯独没叫我,第二天接到通知,我被调到总裁办公室

温情邮局
2025-11-14 10:11:42
两性关系:老话从不骗人:十个女人九个愿,就怕男人嘴不稳

两性关系:老话从不骗人:十个女人九个愿,就怕男人嘴不稳

皓皓情感说
2026-10-03 20:02:30
蔡天凤案最新庭审:前夫在星巴克练习“从上往下猛击”,前公公用16天备好作案工具

蔡天凤案最新庭审:前夫在星巴克练习“从上往下猛击”,前公公用16天备好作案工具

八卦宝宝
2026-10-02 17:15:29
净利暴增370%却13连跌停!割肉就反弹25%,A股扎心一幕

净利暴增370%却13连跌停!割肉就反弹25%,A股扎心一幕

慧眼看世界哈哈
2026-10-03 11:03:38
天津南开警方通报:安某某(女,58岁)、姚某某(男,60岁) 违规燃放烟花被罚,烟花来源正在追查中

天津南开警方通报:安某某(女,58岁)、姚某某(男,60岁) 违规燃放烟花被罚,烟花来源正在追查中

扬子晚报
2026-10-03 14:15:35
人这一生,五大定数皆是天意:万般皆是命,半点不由人

人这一生,五大定数皆是天意:万般皆是命,半点不由人

青苹果sht
2026-09-16 05:53:05
美国花几十年研究日本,最后无奈承认:日本人,永远改不了本性

美国花几十年研究日本,最后无奈承认:日本人,永远改不了本性

音乐时光的娱乐
2026-10-03 20:26:28
《兰香如故》:所有人都以为许兰香烧掉放走废太子的证据是因为爱林锦岐,只有养母薛桂花知道,其中藏着沈家满门被灭的真相

《兰香如故》:所有人都以为许兰香烧掉放走废太子的证据是因为爱林锦岐,只有养母薛桂花知道,其中藏着沈家满门被灭的真相

慢半拍sir
2026-10-03 19:25:17
沈腾节目中自曝:去年曾许愿工作半年休息半年,如今休息半年达成了,工作没了

沈腾节目中自曝:去年曾许愿工作半年休息半年,如今休息半年达成了,工作没了

韩小娱
2026-10-02 09:05:28
53岁董卿现身博物馆,穿短裤显年轻,身姿挺拔苗条,气质依旧出众

53岁董卿现身博物馆,穿短裤显年轻,身姿挺拔苗条,气质依旧出众

调侃国际观点
2026-10-03 20:43:56
2026-10-03 23:00:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4954038文章数 9714关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

女生遭美国常春藤名校7名男生下药性侵 最新后续来了

头条要闻

女生遭美国常春藤名校7名男生下药性侵 最新后续来了

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

马思纯一家爬山祈福!素颜出镜笑容甜

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
健康
教育
时尚
军事航空

艺术要闻

广州又封顶一栋总部!楼像水晶,主人是A股龙头

刷酸祛痘,为什么有人翻车?

教育要闻

夏装130冬装300,成都家长这件烦心事五个区给了三种答案

Chemena Kamali写给Chloé的又一封情书

军事要闻

美国被指正向中东派遣第三艘航母

无障碍浏览 进入关怀版