![]()
这项由芬兰阿尔托大学计算机科学系团队完成的研究,以预印本形式于2026年7月27日公开发布在arXiv平台,编号为arXiv:2607.24651v1,归属计算机视觉(cs.CV)方向。有兴趣深入了解的读者可通过该编号查询完整论文。
**一、先讲一个AI"答对了但找错地方"的故事**
假设你手里有一份长达二三十页的技术规格说明书,你想知道里面用了什么材料来制作内部接触针。一款先进的AI视觉模型给出了正确答案:"磷青铜"。很好,回答准确。但当你追问"你从哪里看出来的?",AI给你画出了一个框——而那个框框在说明书的第二页上,完全圈住了一块错误的区域,跟实际包含"磷青铜"字样的那行文字毫无交集。
这不是某一款AI偶尔犯的小错误,而是目前几乎所有开放视觉语言模型都面临的系统性困境。这种现象有个专门的名字,叫做**归因幻觉**——模型回答正确,但证据指向错误。这就像一个学生考试答对了,但在作答来源那栏随手填了一个不相关的参考书页码。答案正确并不能说明他真的理解了知识来源。
阿尔托大学的研究团队深入研究了这个问题,并提出了一种完全不同的解决思路:与其让AI去"画框定位",不如让AI"用语言引用原文",然后再由一个独立的检索系统把引用的文字对应回文档上的具体区域。这个思路听起来简单,但它带来的效果差异相当显著——归因幻觉率从最高97%骤降至28%,证据召回率从个位数提升到了50%以上。
**二、为什么AI总是"答对却找错"——坐标接口的先天缺陷**
要理解这个问题,先理解AI在视觉文档中是怎么"标注证据位置"的。
目前主流的做法,是让AI直接输出一串数字坐标,类似这样的格式:``。这串数字代表文档第二页上一个矩形区域的左上角和右下角位置。这种方式源自计算机视觉里的目标检测技术——检测一只猫在照片里的位置,就是用这种坐标框框来标注的。
然而,把这种"目标检测式的坐标输出"用在文档理解上,存在一个根本性的问题。
打个比方:你去图书馆找一本书,图书馆员工说"那本书在北侧书架第三排,从左边数第七本的附近"。这个描述很粗糙,你大致找对了那片区域,但具体是第六本还是第八本,你未必能精准找到。坐标输出就面临类似困境——语言模型擅长理解内容和逻辑,但要求它精确输出一个像素级别的矩形坐标,等于让一个文学学者去做精密的几何测量,这不是他的强项。
研究团队做了一个关键实验来验证这一点。他们在CiteVQA这个专门评估文档证据归因能力的基准测试集上,测试了六款来自四个不同家族的开放视觉语言模型,参数规模从80亿到310亿不等。结果显示,在坐标输出模式下,六款模型的证据方框召回率(即模型标出的框框有多少真正覆盖了答案所在的文档元素)最高只有8.1%,最低只有0.3%。换句话说,即便AI答对了问题,它画出的那个框有82%到97%的概率是错的。
更有意思的是,团队还观察到一个细节:当要求一款310亿参数级别的模型输出坐标时,该模型在三分之二的情况下根本没有给出可以解析的坐标,而是用语言描述了证据位置,比如"第十页第七步的标题下方"、"补充材料二里写道"。这个模型被要求用坐标语言说话,却本能地用文字语言来表达位置信息——这恰恰说明,模型的内部能力其实并没有缺失,缺失的只是一个合适的表达接口。
**三、换一种表达方式——"引用原文"而非"画框定位"**
研究团队提出的替代方案,可以用一个日常场景来理解。
假设你在读一本厚厚的法律合同,律师朋友帮你解读了关键条款,并告诉你证据在哪里。有两种方式:第一种,律师拿起笔,在几百页的合同里估摸着某个位置画了个圈;第二种,律师直接把原文念给你听,"第十二条第三款写道:乙方须在收到通知后三十日内……",然后你拿着这段原话去合同里精确定位。显然,第二种方式更可靠,而且更能体现律师真的读懂了合同。
研究团队的"语言接口"正是基于这个原理。在这种模式下,AI不再输出坐标,而是输出一个JSON格式的回答,包含两部分:答案文本,以及一组逐字引用(verbatim quote)——AI从文档中原文摘录出支持答案的关键文字片段,可以是一个句子、一个表格行、一条图注或一段说明文字。
仅仅输出文字引用还不够,还需要把这段引用对应回文档页面上的具体区域。这个任务由一个独立的检索流程完成:首先,一个文档排版解析工具(研究中使用的是MinerU)把文档的每一页分割成若干"语义块",每个语义块对应一个段落、表格、图表或图注;然后,一个多模态编码器(Qwen3-VL-Embedding-2B)把AI输出的文字引用和文档里每个语义块的图像截图都转换成高维数字向量(可以理解为每段内容的"数字指纹");最后,通过计算引用和语义块之间的相似度,用匈牙利算法做一对一的最优匹配,找出每条引用最有可能来自的那个语义块,该语义块的页码和坐标就成为最终的证据区域。
这个流程把"精确画框"这件难事,从AI模型本身的工作中剥离出来,交给了更擅长做精确匹配的检索系统。AI只需要做它最擅长的事:理解内容,并用语言原文引用证据。
值得一提的是,为什么用图像截图而不是直接用文字来做匹配?研究团队发现,大约有三成的证据内容是非文字性的,比如表格、图表等。对于这类内容,AI会通过引用它们的图注(caption)或附注(note)来间接引用;而将图注文字与语义块截图进行跨模态的图文匹配,往往比纯文字匹配更准确,因为渲染在页面上的表格外观与纯文字描述在语义空间中差异很大。
**四、实验结果:证据找对了,答案也没变差**
研究团队在一个经过人工核实的CiteVQA子集上进行了系统评测,这个子集包含719个双语(中英文)问题,覆盖440份PDF文档,文档页数中位数为34页,最长达182页。
对比实验的设计非常干净:六款相同的AI模型,完全相同的输入文档和问题,唯一改变的是证据表达接口——一组用坐标输出,一组用语言引用输出。
在坐标接口下,六款模型的证据方框召回率(IoU≥0.5)分别是:0.3%、1.3%、4.0%、8.1%、0.3%和7.8%,归因幻觉率(即答对了但证据找错了的比例)分别高达97%、92.1%、87.3%、82.1%、95.9%和87.1%。
切换到语言接口后,同样这六款模型的证据召回率变成了:39.9%、34.9%、25.9%、46.9%、29.9%和44.5%,归因幻觉率降至:41.2%、47%、65.4%、40.5%、48%和38.6%。每款模型的召回率都提升了二三十个百分点,归因幻觉率大致砍半。
更关键的一点是:答案质量几乎没有变化。五款模型在两种接口下的答案质量评分相差不超过2.3分(满分100分换算),说明换用语言引用方式并没有让AI回答得更差,只是让它的证据引用变得更准确了。(其中一款80亿参数的小模型因为同时要输出答案和引用,输出预算相对紧张,答案质量下降了约6分,是个例外。)
不同的IoU阈值分析揭示了两种接口的本质差异。坐标接口下,从"找到正确页面"到"框住正确元素",准确率急剧衰减——以一款模型为例,页面级别的命中率是30.7%,但到了IoU≥0.1的元素级别就跌至5.8%,到IoU≥0.7则归零。坐标框框能找到大致正确的页面,但无法精确覆盖正确的元素。语言接口则截然不同:从IoU≥0.1到IoU≥0.7,召回率几乎持平,约在39%到42%之间——因为一旦通过语义检索找到了正确的语义块,这个块的边界就是由排版解析工具精确定义的,不存在"找对区域却框错边界"的问题。
**五、到底是哪个环节救了证据归因——拆解实验**
语言接口相比坐标接口增加了三个新组件:排版解析工具、多模态检索器和匈牙利匹配算法。那么,功劳到底归谁?研究团队做了一系列拆解实验来回答这个问题。
第一个实验,叫"坐标对齐块边界":保留坐标接口的输出,但把每个预测出来的坐标框强制对齐到同一页面上重叠面积最大的语义块。这样做之后,坐标接口的阈值衰减问题消失了(因为现在用的是语义块的边界而非模糊的坐标),但整体召回率依然很低,六款模型的对齐后召回率在5%到23.5%之间。这说明,单纯给坐标接口换上精确的元素边界,并不能显著提升效果——真正的问题在于坐标接口根本没有找到正确的页面或区域。
第二个实验,测试"只用问题去检索":不用AI输出任何内容,直接把问题本身当作查询词,用相同的多模态检索器在文档里找对应数量的语义块。结果,这种方式的召回率普遍低于语言引用方式,差距在13到19个百分点之间。这说明,并非检索器本身足够强大,而是AI输出的文字引用提供了额外的定位信息。
第三个实验更有意思,用"问题加上AI生成的答案"一起去检索。这时候,召回率和语言引用方式相近甚至偶尔更高。研究团队认为,这是因为答案文字本身也编码了与证据位置相关的信息,而引用和答案其实是同一理解能力的两种表达。为了验证两者的互补性,研究团队进一步计算了"引用检索"和"问题+答案检索"在每道题上取最优的联合召回率,发现平均可以达到51.9%,而引用贡献了其中额外的11.1个百分点覆盖,远超只换一个查询词带来的2.4个百分点提升。这意味着引用和答案在不同题目上捕捉到了不同的位置信息,两者并不冗余。
第四个实验比较了不同的文字匹配方式:词符重叠匹配(lexical)和BM25检索与多模态图文嵌入检索相比,前两种方式的召回率低了5到14个百分点。这证明跨模态的图文嵌入检索确实比单纯的字面匹配更有效,尤其是在处理AI输出了近义改写而非完全逐字引用的情况下。
**六、无需标注区域的强化学习训练——让模型学会更好地引用**
语言接口虽然已经大幅改善了证据归因,但研究团队进一步思考:能不能通过训练让AI主动学会更好地引用证据,而不依赖任何人工标注的区域坐标?
这个问题的实践价值在于:收集长文档中每个证据区域的精确坐标标注,成本极高。而如果可以只用问答对(问题加参考答案)来训练,就能大幅降低训练数据的获取成本。
研究团队设计了一套基于GRPO(一种强化学习算法,全称为群体相对策略优化)的训练方案。具体做法是:让模型对同一个问题生成多个不同的回答,每个回答都包含答案文字和若干文字引用;然后通过前面描述的检索流程,把引用对应回文档页面上的具体语义块截图;接下来,一个独立的"裁判"AI(研究中用的是Qwen3.5-9B)同时看到问题、参考答案、模型答案和对应的语义块截图,给出三个分数:答案正确度、证据相关度、证据覆盖度。
奖励函数的设计巧妙地体现了归因幻觉的本质:奖励等于答案正确度乘以证据得分的平均值。这个乘法结构意味着,只有当答案本身正确时,证据质量才会被纳入奖励计算——这精确地针对了"答对但引证错"这个问题。如果答案就是错的,证据再好也没用;如果答案正确但引证一塌糊涂,奖励也会被大幅压低。
这个奖励信号完全不依赖任何区域坐标标注,只需要QA数据集里自带的问题和参考答案。"裁判"AI看的是检索到的语义块截图,而不是模型输出的原始文字引用,这确保了一个流畅好听但实际对应错误区域的引用无法骗过评分。
训练数据使用了从LongDocURL数据集构建的1584个长文档问题,在一款80亿参数的基础模型上用LoRA(一种低秩适配微调技术,可以理解为对模型做局部精调而不改动大部分参数)进行了三轮训练,共144步。整个训练过程在三块H200 GPU上运行了约28小时,花费约85 GPU小时。
训练结果相当明显。与未经训练的同款模型相比,经过GRPO训练后,证据召回率从39.9%提升到51.3%,严格归因准确率(即答案正确且证据充分的比例)从22.4%提升到33.8%,归因幻觉率从41.2%降至28.4%。从训练动态来看,提升主要来自"证据覆盖度"这个指标——模型学会了引用更多之前遗漏的证据,而不只是让现有引用更精准。
研究团队还进一步验证了这些额外引用是否真的有价值,还是只是堆砌无关内容来骗取奖励。他们用一个更严格的评估标准(要求答案质量和证据相关度都达到4分以上,不考虑召回率),训练后模型的得分从19.1%提升到27.4%,统计检验的p值为6×10??,说明额外引用确实指向了有价值的支持内容,而非刷分噪声。
**七、研究的边界与尚未解决的问题**
研究团队在论文中诚实地指出了这套方法的局限性。
在方法层面,这套流程并没有教会模型独立进行精确的空间定位——模型只负责写引用,页面定位的工作依赖排版解析工具和检索器。排版解析工具的上限就是整套系统的上限:如果文档是扫描图像、排版解析完全失败,整套流程就无从发挥。研究实测的解析工具上限(即假设检索完美情况下的最高可达召回率)在IoU≥0.5时约为88.2%,留有约12%的不可达空间。
对于纯图形类证据(没有任何文字图注的图表),语言引用无法捕捉,系统会沉默地忽略这类证据——这是一个真实的盲区。
此外,每道题的引用分配使用的是一对一的匈牙利匹配,这意味着一条"幻觉引用"(引用了文档中根本不存在的内容)依然会被强制对应到某个相似度最高的语义块,而不是被识别为无效。不过,研究团队也展示了相似度本身可以用作可信度信号:相似度越高,命中率越高;通过设置阈值拒绝低相似度的引用,可以在召回率和精准度之间做权衡。
在评估层面,实验使用的是单一文档场景,跨多文档的证据归因(比如同时检索多份报告中的证据)没有覆盖。评估结果也依赖AI"裁判"的主观打分,裁判模型本身的偏差会渗透进评分结果。
**八、这件事对你我意味着什么**
归根结底,这项研究触碰了一个真实而重要的需求。
当我们把AI用在需要负责任的场景——比如医院里查阅病历指南、律师事务所检索合同条款、金融机构核对招股说明书——"给出正确答案"还远远不够,必须同时提供"答案来自哪里"的可验证路径。如果AI指向了错误的证据区域,用户无法有效核查,AI的回答就依然停留在一个黑盒子里。
而这项研究展示的路径在于:不需要重新训练模型学会精确画框,不需要标注海量的区域坐标,只需要让模型做它本就擅长的事——用语言引用原文——然后用一个外部的检索流程完成精确定位。这种分工把问题难度降低到了可解范围之内。
进一步地,研究提供了一个只用问答数据就能做训练的强化学习方案,意味着在任何已有QA数据集的场景下,都有可能用这套方法去改善模型的证据引用质量,而不需要额外花费大量成本去标注文档的区域坐标。
当然,这不是终点。模型仍然无法自主处理纯图形证据,排版解析的上限依然存在,跨文档场景的验证也尚未完成。但从"归因幻觉率高达97%"到"降至28%",这个跨度在现实应用中的差距,已经足以把一个基本不可用的工具变成一个值得认真考虑的可用工具。
有兴趣深入了解技术细节的读者,可以通过arXiv编号2607.24651查阅完整论文,原文包含所有提示词模板、超参数设置和统计检验结果,研究团队也承诺将公开评估代码和训练配置,以便复现所有实验结果。
Q&A
Q1:归因幻觉是什么意思,AI为什么会出现归因幻觉?
A:归因幻觉是指AI回答了正确的答案,但它指向的证据区域是错的。出现这个问题,是因为现有系统要求AI直接输出坐标数字来定位证据区域,但语言模型并不擅长精确生成像素级坐标,往往在大致正确的页面附近随机生成一个框,而这个框并不真正覆盖答案所在的文字位置。
Q2:语言接口方案需要重新训练AI模型吗?
A:不需要重新训练就能大幅提升效果。语言接口的核心改变是让现有模型输出文字引用而非坐标,然后由外部的排版解析工具和检索系统完成精确定位。研究中测试的六款模型在不做任何训练的情况下,证据召回率就从个位数提升到了25%至47%。额外的GRPO强化学习训练可以进一步提升效果,但并非必要前提。
Q3:这套方法对扫描版PDF文档有效吗?
A:效果会大打折扣。该方法依赖排版解析工具将文档分割成可检索的语义块,而扫描版PDF通常没有可提取的文字层,解析工具难以正常工作。研究团队也在论文中明确指出,这是当前方法的一个重要局限,对扫描型文档的处理效果尚未经过系统验证。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.