网易首页 > 网易号 > 正文 申请入驻

德克萨斯大学奥斯汀分校与纽约大学联合研究揭示AI推理的隐秘陷阱

0
分享至

来源:市场资讯

(来源:科技行者)


这项由德克萨斯大学奥斯汀分校与纽约大学联合开展的研究,于2026年8月以预印本形式发布,论文编号为arXiv:2608.03506。研究聚焦于大型语言模型在因果推理任务中的一个棘手难题,提出了名为CALVER的解决方案,为AI推理系统的可靠性带来了新的思路。

说到底,这项研究要解决的问题,其实可以用一个日常生活场景来理解。假设你在组织一场投票,大家都在挑选今天晚饭吃什么。正确答案有很多——披萨、意面、沙拉都完全可以。但因为大家分散投票,每种正确答案只得到一两票,而那份实际上大家都不怎么想吃的外卖套餐,却因为有几个人凑巧都选了它,反而赢得了最多票数。于是,明明大多数人都认同"正确答案",投票结果却给出了一个"错误答案"。这就是研究团队发现的AI推理系统中一个非常真实的问题。

一、投票制度为何在这里失灵

当前最流行的AI推理方法之一叫做"自洽性"(self-consistency)。它的工作原理类似于让AI同一道题做好几遍,然后看哪个答案出现次数最多,就采纳哪个。这个方法背后的逻辑很直觉——如果大多数尝试都得到同一个结果,那个结果很可能是对的。

这套逻辑在很多场合确实管用,比如数学计算题通常只有一个正确答案,正确的解题路径会集中在同一个数字上。然而,因果推理这类问题天生就存在"多个正确答案"的情况。

以因果推理中最经典的一类问题为例:给你一张描述变量之间影响关系的图(专业上叫"有向无环图"或DAG),然后问你,要想准确估计变量X对变量Y的影响,应该同时控制哪些其他变量?这类问题在医学研究、经济分析等领域非常常见——比如要研究一种药物的疗效,需要控制哪些混淆因素?

关键在于,这类问题往往有不止一个正确答案。控制变量Z1是对的,控制Z2也是对的,同时控制Z1和Z2还是对的。三种不同的答案字符串,背后说的都是完全合理的解法。

当AI被要求做同一道题八次时,它可能给出三次包含Z1的答案、两次包含Z2的答案、两次同时包含Z1和Z2的答案,以及一次什么都不控制的错误答案。按照投票规则,"空集"(什么都不控制)反而成了出现次数最多的单一选项,尽管它是唯一错误的答案,而正确答案的总票数占了七成。

研究团队通过数据验证了这一现象的普遍性:在他们收集的问题样本中,有39%的情况下,无效答案成为了单一出现次数最多的答案,即便问题的候选答案中明明有正确选项存在。

二、因果推理究竟在研究什么

在深入理解这项研究的解决方案之前,有必要简单了解一下"因果推理"是什么,以及为何AI在这方面容易翻车。

因果推理关注的不只是"A和B同时发生"(相关性),而是"A是否真正导致了B"(因果性)。这是统计学和AI领域中一个非常深刻的区别——冰淇淋销量上升和溺水事故增加同时发生,并不意味着吃冰淇淋会导致溺水,二者都源于共同原因:夏天天气热。

判断真正的因果关系需要用到一套严格的数学工具,其中最核心的来自统计学家朱迪亚·珀尔(Judea Pearl)的工作。珀尔提出了一系列图形化标准,用来判断哪些变量需要被"控制",哪些路径传递了真实的因果信号,哪些只是表面的统计巧合。这些标准包括研究中提到的"d-分隔"(判断两个变量在给定条件下是否独立)、"后门调整"(找到正确的控制变量集合)以及"干预图"(模拟强制改变某个变量时系统的行为)。

这些标准有一个重要特性:它们是可以被计算机精确执行的算法。给定一张描述变量关系的图,计算机可以确定性地判断某个答案是否合法——不需要靠感觉,也不需要依赖经验,完全可以用代码计算出来。

研究团队正是抓住了这一特性,设计出了他们的解决方案。

三、CALVER:一位严格的阅卷老师

CALVER的全称是"因果公理级验证"(Causal Axiom-Level VERification)。它的核心思想用一句话说:不要数答案出现了几次,而要检验每个答案是否真的满足因果推理的数学标准。

可以把它理解为一位严格的阅卷老师。这位老师不在乎"三个同学都写了答案A",她只关心:答案A根据题目中给出的因果图,在数学上是不是一个有效的解?答案B呢?答案C呢?找到所有通过检验的答案,从中选择得分最高的那一个。

具体来说,CALVER对AI给出的每一次推理过程进行六个维度的检查。第一,AI是否正确读取并解析了题目中的因果图?第二,AI是否准确识别了题目想问的是什么(治疗变量、结果变量、任务类型)?第三,AI提出的策略(比如某个控制变量集合)在数学上是否真的满足因果有效性条件?第四,AI的推导过程中是否使用了正确的操作类型,格式和来源是否合规?第五,AI报告的计算结果能否经得起独立重新计算的验证?第六,AI最终给出的答案是否与它自己的计算结果一致?

每个维度通过就得一分,总分六分,选择最先达到最高分的那个推理过程所对应的答案。整个过程完全不需要知道"正确答案"是什么,纯粹依靠因果推理的数学规则进行判断。

这一系统有一个非常实际的优势:计算成本极低。每个候选答案的评分只需要在普通CPU上运行1到8毫秒,整个评分过程相比已经花费的AI推理成本,仅增加约7%的额外开销。

四、数字说话:CALVER的实际表现

研究团队在一个叫做CLEAR的基准数据集上进行了测试,专门挑选了那些存在多个有效答案的因果推理问题,共126道题,每道题让AI做8次,最终形成1111个"问题-推理"单元的对比实验。

在这个测试中,普通投票方法的正确率约为31%,一个更聪明的集合相似度投票方法(考虑答案内容而非纯文字匹配)约为31%,AI模型自己对答案的信心评分约为30%,一个专门训练的奖励模型约为31%,让另一个大型语言模型当裁判员约为27%,而CALVER达到了42%。

这18到19个百分点的差距,在实际意义上相当可观。研究团队还做了一个更有说服力的对照实验:他们设计了一个"只检查格式不检查内容"的对照版本,保留了CALVER的所有解析和格式检查步骤,但去掉了因果有效性的语义判断。这个对照版本的正确率只有23.5%,甚至低于普通投票。这直接证明了提升效果来自因果推理的数学判断本身,而不是什么格式或顺序上的技巧。

把另一个AI模型升级到720亿参数充当裁判员会不会更好?答案令人意外——720亿参数的AI裁判员与普通投票相比几乎没有差别(仅提升0.4个百分点,且统计上不显著)。这说明单纯增大模型规模,并不能解决"多个正确答案导致投票失灵"这一根本问题。

五、随着尝试次数增加,差距越来越大

一个特别有趣的发现是,CALVER相对于普通投票的优势,随着AI尝试次数的增加而持续扩大。

当AI只做1次时,两种方法自然是一样的。当AI做2次时,CALVER领先约7.7个百分点;做4次时领先约10.6个百分点;做8次时领先约14.3个百分点;做16次时领先约19.1个百分点;做到32次时,差距扩大到了25.4个百分点,而此时普通投票的准确率已经停止提升,卡在32.5%一动不动。

这个现象背后的逻辑很清晰。普通投票随着尝试次数增加,越来越确定地选中那个"出现最多次的单一答案",而那个答案往往是无效的。CALVER则随着尝试次数增加,越来越有机会碰到至少一个通过全部六项检查的高质量推理过程。两种机制一个在自我强化错误,一个在持续积累正确信号,差距当然越来越大。

六、理论保障:为什么这种方法在数学上是可靠的

研究团队不只是做了实验,还从数学上证明了CALVER的可靠性。

他们给出了两个定理。第一个定理证明:在供给了正确的因果图和观测数据的前提下,如果某个推理过程通过了CALVER的完整检查(包括一些额外的安全条件),那么它给出的关于"某种干预是否有效"的判断,一定是正确的,而且不需要事先知道答案是什么。

第二个定理从数学上证明了投票为何会失灵。它说:假设有一个无效答案,其出现概率比任何单个有效答案都高出一个固定量。那么随着尝试次数增加,投票选出有效答案的概率会以指数级速度趋向零。具体来说,如果有效答案的总概率是60%,均匀分布在4种不同的正确说法上,而无效答案占了40%,那么投票会越来越确定地选出那个无效答案,尽管大多数推理结果实际上是对的。

研究团队还构造了一个精确的数学模型,描述CALVER在有限次尝试下的精确行为,并证明了随着尝试次数增加,选中正确答案的概率单调上升,上限由"候选答案中至少有一个正确答案的概率"决定。

七、超越因果图:从文字中构建图,以及其他领域的测试

一个自然的疑问是:现实中很多问题不会直接给你一张干净的因果图,而是用文字描述各种关系。CALVER在这种情况下还管用吗?

研究团队设计了三个层次的文字难度测试。第一层是"边陈述式"文字,直接逐条列出变量之间的因果关系,难度接近直接给图。第二层是"机制描述式"文字,描述变量之间的运作机制,但不给出边列表。第三层是"自然叙事式"文字,像普通文章一样描述关系,还夹杂着干扰信息。

结果显示,在第一层文字中,AI准确还原整张图的比例是83%,CALVER相对投票提升了24.2个百分点。在第三层文字中,整图还原率下降到了34%,但CALVER仍然相对投票提升了17.6个百分点。这背后的原因正是研究团队在理论部分所分析的:一个推理过程不需要还原整张图,只需要正确把握与当前问题相关的那几条因果关系,就足以给出正确答案。即便整体还原率很低,问题相关的局部信息往往仍然被保留了下来。

研究团队还在两个完全不同的领域测试了这一方法的通用性。一是"骑士与无赖"谜题(Knights and Knaves),这是一类经典逻辑谜题:有若干人,有人永远说真话,有人永远说谎,根据他们的陈述判断每个人是哪种。这道题有唯一正确答案,可以用真值表计算机械地验证。研究团队把CALVER的因果图判断换成真值表验证,在三人、四人、五人规模的谜题上,相对投票分别提升了27、37和16个百分点。

二是用一个独立实现的"do演算证明器"(DoVerifier)来验证候选答案,让每个候选的推理表达式去尝试被证明,选最先能被证明的那个。这个方法完全独立于CALVER的检查器,却体现了同样的核心逻辑——候选式验证,而不是频率投票。在240道因果识别题上,从第一次采样的49.6%准确率提升到了80%。

八、在十个独立贝叶斯网络上的验证

除了CLEAR数据集,研究团队还在十个来自bnlearn(一个标准贝叶斯网络仓库)的独立网络上做了测试,这些网络涵盖医疗诊断、天气预测、保险风险等多个领域,节点数量从十几到七十多个不等。

总体上,CALVER相对投票提升了17.1个百分点。十个网络中有七个出现了明显提升,三个没有变化。研究团队分析,没有变化的三个网络中,候选答案池里所有高分候选的正确性本来就相同,重新排序没有改变最终结果——这正是理论预期的行为:当候选池里没有"正确与错误混杂"的情况时,任何选择方法都一样。

九、什么时候应该用不同的方法

研究团队诚实地指出了CALVER的适用范围,以及在哪些情况下应该选择其他方法。

当文字描述非常精确,可以可靠地从中提取出一张完整的因果图时,更好的选择是把这张图提取出来,然后直接用算法求解,而不是在候选答案之间做选择。在文字最清晰的第一层测试中,提取一张图再直接求解达到了92.8%的准确率,高于CALVER的83.7%。

当答案空间非常紧凑,几乎只有一个正确答案时,投票本身就已经足够好,CALVER的额外计算也不会带来多少收益。研究团队在另外两个数据集(CLadder和Corr2Cause)上验证了这一点,这两个数据集的答案都是简单的二元判断,CALVER与普通投票的差异几乎可以忽略不计。

简而言之,CALVER最有价值的使用场合,是介于这两者之间的中间地带:问题有多个合法答案,但文字描述又没有精确到可以可靠地一次性提取整张图。

十、研究的边界与局限

研究团队在论文中坦率地说明了这项工作的边界。CALVER只从已有的候选答案中做选择,它无法凭空创造更好的答案。其正确率的上限,由候选答案池中是否包含正确答案来决定——如果AI在所有尝试中都没有产生过正确答案,CALVER也无能为力。

此外,在需要从文字重建因果图的场景中,CALVER评分是基于AI自己构建的图,而不是真实的图。这意味着如果AI误读了文字,评分可能针对一张错误的图进行,结论在逻辑上是一致的,却与真实世界不符。

研究团队的理论保障也是有条件的:当提供的因果图和观测数据本身是正确的,且满足某些统计条件时,CALVER才能给出可证明的正确判断。现实中的因果图往往来自对世界的简化模型,本身可能就不完全准确,这一点需要使用者自行评估。

归根结底,这项研究揭示了一个关于AI推理的重要规律:当正确答案不唯一时,"少数服从多数"的投票逻辑会系统性地偏向错误。不是因为AI不够聪明,而是因为聪明分散了——多种正确的思路各自成为了少数派,反而让一种集中的错误思路占了便宜。解决这个问题的关键,不是让AI更努力地投票,而是给它一套能够直接判断"这个答案合不合理"的规则,完全绕开计票的游戏。

这个思路本身并不复杂,但它指向了一种更普遍的可能性:只要一个领域有可以被计算机执行的正确性标准,就可以用类似的方法替代投票,在更多情况下选出更好的答案。逻辑谜题如此,因果推理如此,或许代码验证、数学证明、合同审查也有类似的机会。感兴趣的读者可以通过论文编号arXiv:2608.03506查阅完整研究细节。

Q&A

Q1:CALVER是什么方法,它和普通AI投票有什么区别?

A:CALVER是一种基于因果推理数学规则的候选答案验证方法。普通投票统计哪个答案出现次数最多,而CALVER对每个候选答案从六个维度逐一检查其逻辑合理性,选出最先通过所有检查的答案。核心区别在于:投票看频率,CALVER看有效性,后者不需要知道正确答案是什么。

Q2:为什么增大AI模型规模不能解决多个正确答案导致的投票失灵问题?

A:投票失灵的根本原因是多个正确答案把选票分散了,让一个集中的错误答案反而胜出。这是聚合机制本身的逻辑缺陷,与模型大小无关。研究实验证明,720亿参数的AI裁判员相比普通投票仅提升0.4个百分点,因为它同样依赖频率或偏好判断,没有从根本上改变投票的逻辑。

Q3:CALVER在什么类型的问题上效果最明显,在什么情况下没有帮助?

A:CALVER在因果推理中存在多个合法答案的问题上效果最明显,比如寻找有效控制变量集合或d-分隔节点集。当答案空间非常紧凑、几乎只有一个正确答案时,CALVER与普通投票差异很小。当文字描述精确到可以可靠提取完整因果图时,直接提取图并算法求解反而更准确。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
《西部世界》第1季隐藏500年秘密:上帝形状竟是人类大脑

《西部世界》第1季隐藏500年秘密:上帝形状竟是人类大脑

山月不知2
2026-08-12 00:28:37
前总统女婿联手迪士尼前CEO,120亿美元收购湖人创纪录

前总统女婿联手迪士尼前CEO,120亿美元收购湖人创纪录

娱圈观察员
2026-08-13 00:27:32
最新!广州11区房价出炉!降幅最狠,居然是这个区...

最新!广州11区房价出炉!降幅最狠,居然是这个区...

羊城攻略
2026-08-10 23:35:28
3:0!中国女排全胜晋级,淘汰赛对手确定,16岁小丁霞独得8分

3:0!中国女排全胜晋级,淘汰赛对手确定,16岁小丁霞独得8分

跑者排球视角
2026-08-12 10:36:14
ESPN:若昂-佩德罗将与切尔西续约至2033年,只差球员签字

ESPN:若昂-佩德罗将与切尔西续约至2033年,只差球员签字

懂球帝
2026-08-13 01:11:08
终于走了!领馆撤离成都,以色列在中国人心中的好感是咋崩盘的?

终于走了!领馆撤离成都,以色列在中国人心中的好感是咋崩盘的?

丁鸊惊悚影视解说
2026-08-09 10:44:44
汉奸石平父母近况曝光!都是老师,父亲很早去世,母亲在新冠时期去世

汉奸石平父母近况曝光!都是老师,父亲很早去世,母亲在新冠时期去世

小徐讲八卦
2026-08-12 10:35:59
HWG!3150万欧敲定英格兰国脚,国米“精打细算”迎来右路新答案

HWG!3150万欧敲定英格兰国脚,国米“精打细算”迎来右路新答案

智道足球
2026-08-12 22:12:33
瑞典大满贯!世界冠军0-3完败,王艺迪轰11-1,林诗栋温瑞博苦战

瑞典大满贯!世界冠军0-3完败,王艺迪轰11-1,林诗栋温瑞博苦战

南海浪花
2026-08-12 22:10:51
大将风范!王艺迪主动让球、3-0速胜!方博遭剃光头、止步首轮

大将风范!王艺迪主动让球、3-0速胜!方博遭剃光头、止步首轮

十点街球体育
2026-08-12 21:00:55
洪晃讲出母亲章含之的人生两面性:对待丈夫前妻的子女分毫不让,自己幼时遭继母虐待险些被迫休学,前后遭遇对照异常讽刺

洪晃讲出母亲章含之的人生两面性:对待丈夫前妻的子女分毫不让,自己幼时遭继母虐待险些被迫休学,前后遭遇对照异常讽刺

磊子讲史
2026-07-27 15:24:28
世体:贝林厄姆回到巴尔德贝巴斯,穆里尼奥集齐全员

世体:贝林厄姆回到巴尔德贝巴斯,穆里尼奥集齐全员

懂球帝
2026-08-12 18:39:11
万万没想到,另一场大战随时可能开打,中国还避得了吗?

万万没想到,另一场大战随时可能开打,中国还避得了吗?

体育小柚
2026-08-11 01:17:21
60岁大爷每月2次性生活,坚持多年后,体检结果让人意外

60岁大爷每月2次性生活,坚持多年后,体检结果让人意外

医学原创故事会
2026-08-06 20:26:05
终于来了!养老金调整主基调定了,让人心心念念,算算你能涨多少

终于来了!养老金调整主基调定了,让人心心念念,算算你能涨多少

流史岁月
2026-08-12 10:00:21
中国广电很多年没见过这么严峻的形势了

中国广电很多年没见过这么严峻的形势了

辉哥说动漫
2026-07-17 10:42:19
特朗普特使将首次访乌,泽连斯基有终战新提议:美国可以帮助乌克兰加强防御,并向俄罗斯施压

特朗普特使将首次访乌,泽连斯基有终战新提议:美国可以帮助乌克兰加强防御,并向俄罗斯施压

每日经济新闻
2026-08-12 23:27:42
65岁后,提醒中老年:存款别只写自己的名字!聪明人这样存,晚年更省心

65岁后,提醒中老年:存款别只写自己的名字!聪明人这样存,晚年更省心

小谈食刻美食
2026-08-10 08:17:04
许晋亨夫妇真的很穷,拥有420亿信托里每月只能领200万港币

许晋亨夫妇真的很穷,拥有420亿信托里每月只能领200万港币

西楼知趣杂谈
2026-06-01 21:30:19
程序员狂喜:8.6万Star项目让DeepSeek省大钱

程序员狂喜:8.6万Star项目让DeepSeek省大钱

半路友人之他
2026-08-12 01:13:51
2026-08-13 02:40:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4406233文章数 9258关注度
往期回顾 全部

科技要闻

Manus第二季,浪子回头

头条要闻

冲上热搜:银行能办结婚证了

头条要闻

冲上热搜:银行能办结婚证了

体育要闻

杜兰特,所谓的“联盟小王”

娱乐要闻

老戏骨杨昆两夺金鹰奖,因物业费被告

财经要闻

华尔街把AI算力炒成下一个房地产?

汽车要闻

全系600km续航/空间表现出色 奇瑞风云T7预售10.99万起

态度原创

本地
亲子
家居
公开课
军事航空

本地新闻

黄州一夜,苏轼写给普通人的月光

亲子要闻

脚底长满小疙瘩?!10岁孩子游泳后确诊HPV感染!很多家长都搞错了...

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

通过“毕业大考” 湖北舰“持证上岗”

无障碍浏览 进入关怀版