![]()
这项由马克斯·普朗克智能系统研究所(德国蒂宾根)、苏黎世联邦理工学院(ETH Zürich)、ELLIS研究所及蒂宾根AI中心联合开展的研究,以预印本形式发布于2026年7月16日,论文编号为arXiv:2607.15277v1,有兴趣深入研究的读者可通过该编号查阅完整论文。
每当我们向ChatGPT或Claude这类大型语言模型提问"美国人平均收入超过5万美元的概率是多少",背后其实藏着一个很少有人追问的深层假设:这个模型给出的答案,真的是基于它所掌握的人口知识做出的可靠估计吗?还是说,它只是按照某种说不清道不明的直觉随口一说?
这支研究团队决定认真追问这个问题,而他们发现的答案,出人意料地令人不安。
**一、一道数学常识题,难倒了顶级AI**
要理解这项研究的核心,先从一道小学数学题说起。假设你想知道班级里所有同学的平均身高,你有两种方法。第一种是直接问老师"这个班平均身高是多少";第二种是先把学生按男女分成两组,分别问两组的平均身高,然后按人数比例加权平均得出全班数据。如果这两种方法得到的答案一致,说明数据是自洽的。如果答案差距很大,那就说明哪里出了问题。
这道题在数学上有一个正式名称,叫做"全概率公式"(Law of Total Probability)。它的意思是:一个整体的概率,必须等于把整体按任何有效方式分割成若干部分后,各部分概率按比例加权求和的结果。这是概率论最基础的公理之一,不是什么高深理论,就像"1加1等于2"一样不容置疑。
研究团队的核心问题是:当AI模型被要求估计某个统计量时,它对"整体"的直接估计,和它对"各部分"的估计加权合并后得到的结果,会不会一致?
答案是:往往不一致,而且差距相当显著。
**二、"分割-提问-合并":一套简洁却揭示深层问题的测试框架**
为了系统地检验这个问题,研究团队设计了一套极为精巧的测试方案,可以用一个生活场景来理解它的运作方式。
假设你是一个侦探,要调查某城市居民的收入情况。你可以直接去市政府问:"这个城市里有多少比例的人年收入超过5万美元?"这是直接询问整体。或者,你也可以先把居民按年龄分成两组——工作年龄段(31至68岁)和非工作年龄段(其余年龄)——分别调查这两组的收入情况,然后按两组人口比例合并结果。如果这个城市的数据是真实可靠的,两种方式应该得到相同的答案。
研究团队把这个逻辑应用到了AI身上,并且做得更加系统化。他们构建了一种叫做"二叉条件树"(Binary Conditioning Tree)的结构,本质上就是一棵不断细分人群的分类树。树的根节点是整体人群(比如"美国所有居民"),第一层按年龄分成两组,第二层在每组内再按就业状态分成两组,第三层再按每周工作时长分组,如此往下,每深入一层人群就被切割得更加细碎具体。
他们使用的真实数据来自2024年美国社区调查(American Community Survey,简称ACS),这是美国最权威的人口调查之一,涵盖380万名受访者的收入、就业、年龄等详细信息。这份数据既用来构建分割方案,也作为检验AI答案准确性的"标准答案"。
在每一个节点(即每一个人群分组),研究团队都会向AI提供该人群的文字描述,例如"一位居住在美国、年龄在31到68岁之间、目前受雇或自雇的人",然后让AI估计该人群中年收入超过某个门槛值的概率。这种通过文字描述来引导AI代入特定群体视角回答问题的方式,在AI研究领域被称为"人物角色提示"(Persona Prompting)。
收集完所有节点的AI估计值后,团队按照全概率公式,从底层节点往上逐层加权合并,重建出整体人群的估计概率。然后,他们把这个重建值与AI对整体人群的直接估计值加以比较,同时也与真实的ACS统计数据进行比对。
**三、"宏观谬误":越细越准,越粗越差**
测试结果揭示了一个令人惊讶的规律,研究团队给它起了一个专门的名字:宏观谬误(The Macro Fallacy)。
所谓宏观谬误,说的是这样一种现象:当AI被要求直接估计整体人群的某个统计量时,它给出的答案往往比从更细分的子群体估计中加权合并得到的答案准确度更低。换句话说,你直接问它"全国人怎样",不如先问它"年轻人怎样、中年人怎样、老年人怎样",再把三个答案按比例拼起来。后者反而更接近真实情况。
这就好比侦探破案的逻辑:与其笼统地猜"案子是怎么发生的",不如逐一盘问每一个证人,把每个人的陈述拼成完整的案情还原。AI在面对宏观整体问题时,似乎会陷入某种模糊的"概括印象",而当它被迫聚焦于具体的子群体时,反而能调动更准确的知识。
这个规律在研究中得到了相当一致的验证。团队在不同收入门槛(从100美元到8万美元,跨越了7个档位)、不同AI模型(包括GPT-5.4、GPT-4o mini、Claude Opus、Claude Sonnet、Gemini 3.1 Pro等多款顶级商用模型)、以及二叉树的不同深度层次上分别进行了测试。结果几乎无一例外:重建后的聚合估计比直接估计更接近真实的ACS统计数据,平均提升幅度相当可观。
不过,这种"越细越好"的趋势并非无限延伸。当树的层级变得非常深、人群被切割得极为细碎时,改善效果会开始下降,有时甚至反而变差。这个现象引导研究团队去追问:误差究竟来自哪里?
**四、拆解误差的来源:两个零件,各有问题**
AI在估算加权合并值时,需要两类输入:一是对每个子群体的概率估计,二是每个子群体在总人口中的比例(也就是权重,或称"先验概率")。团队把这两类误差来源分别独立出来进行了分析。
先看子群体的概率估计。当研究团队用ACS真实数据的人口比例来替换AI自己估计的权重(即给AI一个"作弊码",不用它猜各组的人口占比,直接告诉它),然后让AI估计各子群体的概率,再用真实权重加权合并,结果发现:改善效果依然稳健。这说明"越细越准"这个规律,主要来源于AI对更具体子群体的条件概率估计确实更准确,而不仅仅是权重选择的问题。
背后的直觉是这样的:当你问AI"一个普通美国人年收入超过5万美元的概率是多少",它需要在脑海中同时考虑各种各样的人——学生、退休者、全职工作者、失业者——并把这些差异全部压缩进一个单一的数字。这种"一锅乱炖"的方式容易让某些重要的子群体信息被稀释或遗忘。而当你专门问它"一个31到68岁的在职美国人年收入超过5万美元的概率",它能调用的知识更聚焦,答案也更精准。
再看权重的估计。当分组越来越细,AI需要同时估计的子群体数量呈指数级增长。二叉树每深入一层,节点数量就翻倍。而研究发现,AI对越细碎的人口分组的比例估计误差越大——这通过把AI的权重估计与ACS真实人口比例比较,用全变差距离(Total Variation Distance)来量化衡量,结果确认AI在深层节点的人口比例估计准确性明显下滑。
这就产生了一个两难困境:层级越深,子群体的条件概率估计越好,但权重估计越差。于是整体的提升效果呈现出一条倒U形曲线——先升后降,在某个中间深度达到最佳平衡点。
从更抽象的角度来看,这也可以用统计学中的"全方差定理"来理解。对整体进行估计时,不确定性来自两个方面:各子群体内部的不确定性(within-group variance)和子群体之间的差异(between-group variance)。当你进行分组时,子群体内部的不确定性降低了,子群体之间的差异变得更加显性和可估计。这种"把异质性变得可见"的过程,正是分层估计优于整体估计的数学根源。
**五、"由小见大"的提示技巧:在单次对话中复现分层效果**
发现了分层估计的优势之后,研究团队自然会问:有没有办法不需要繁琐地构建整棵树,也能让AI"主动分层"思考?
于是他们设计了一种叫做"微观到宏观提示"(Micro-to-Macro Prompting)的方法。具体来说,就是在提问的时候加入一段额外的指令,大意是:"在给出最终答案之前,请先考虑美国人口中可能在收入水平上存在差异的几个主要子群体,分别评估它们的人口比例和收入概率,然后综合这些子群体的情况给出总体估计。"
这个方法的关键在于,它不需要研究者预先指定具体的分组方式,而是让模型自己决定如何分割人群,然后在一次对话中完成所有的子群体评估和合并计算。
测试结果显示,这个轻量级的改进在大多数情况下确实有效。在ACS收入估计任务中,多数模型在采用"微观到宏观提示"后,比直接估计的绝对误差更小。在另一组使用全球意见调查数据集(GlobalOpinionQA)的测试中,有一半以上的模型也表现出了改善。
不过,这种方法的效果比直接构建分层树要弱,而且更依赖于具体模型的能力——有些模型从中受益明显,有些则效果不稳定。这说明"让模型自己想到要分层"与"强制要求模型按照特定分层来估计"之间,仍然存在系统性差距。
值得注意的是,这也排除了一种替代解释:也许分层方法之所以更好,仅仅是因为它花了更多的计算步骤?研究给出了否定的答案。"微观到宏观提示"同样需要额外的推理步骤,但效果不如显式分层树稳定;而且分层树在某个深度之后改善效果反而下降,尽管它调用了更多次模型。这些证据都表明,改善来自的不是"更多计算量",而是"更结构化地暴露了子群体差异"。
**六、一致性测试:AI对同一件事的不同问法,答案居然不同**
发现了"宏观谬误"之后,研究团队进一步追问:AI的自相矛盾到底有多严重?为此,他们设计了两种系统化的一致性检验,这两种检验的共同特点是不需要任何外部的"标准答案"——它们完全依靠AI自身的输出来判断是否自洽。
第一种叫做"分割一致性"(Split Consistency)。它检验的是:当AI估计一个整体的某个统计量,以及估计把这个整体按某种方式一分为二后两个子群体的同一统计量,这两种估计是否满足全概率公式?具体操作是对于每一个可能的"父节点-子节点对",计算直接估计与加权合并估计之间的差距,如果差距超过一个容忍阈值(研究中设为0.02,即2个百分点),就判定为"不一致"。分割一致性分数就是通过检验的比例。
第二种叫做"顺序一致性"(Order Consistency)。它检验的是:当AI被问及同一个子群体的统计量,但描述该群体的属性顺序不同,答案是否一致?比如,"一个年龄在31到68岁之间、且目前受雇的人"和"一个目前受雇、且年龄在31到68岁之间的人",这两句话描述的是完全相同的群体,AI对同一个问题的答案应该相同。顺序一致性检验的就是这种对表述顺序的稳定性。
这两种检验覆盖了不同层面的自洽性:分割一致性测试的是概率构成的逻辑,顺序一致性测试的是表述方式的无关性。两者合在一起,构成了一套完整的"AI统计推理健康体检"。
研究团队在多个任务上系统性地运用了这套检验,包括ACS收入预测(四分类收入区间)、ACS通勤时间预测、世界价值观调查(World Values Survey,涵盖加拿大和印度尼西亚两国的五类意见问题),以及两个完全虚构的预测场景——一个是费德勒对纳达尔的网球比赛(按球场类型和首盘结果分组),另一个是一个架空奇幻世界中角色对战的胜率预测(按白天/夜晚和风力条件分组)。
**七、测试结果:即使是顶级模型,表现也令人担忧**
各项测试的结果汇聚成一幅令人担忧的图景。
在ACS收入预测的四分类版本中,被测试的四款顶级模型(GPT-5.4、Claude Sonnet 4.6、Grok 4.3、Qwen3.6 Plus)的分割一致性得分在0到0.33之间,远低于满分1.0。其中最令人惊讶的是Claude Sonnet 4.6和Grok 4.3的分割一致性得分为零——这意味着在所有被测的分割检验中,这两款模型没有一次通过了一致性门槛。顺序一致性方面稍好一些,最高的是GPT-5.4达到满分1.0,但其他模型普遍在0.25到0.50之间。
在ACS通勤时间预测的版本中,即便使用同一批模型和同一套分组结构,只是把预测目标从收入换成了通勤时间,一致性得分就出现了显著变化。这说明一致性并不只是模型本身的固有属性,而是会因预测任务的不同而呈现不同面貌。
世界价值观调查的测试揭示了更普遍的失败模式。研究团队横跨两个国家、五个问题、八个模型进行了全面测试。结果显示,没有任何一个模型在所有问题和所有国家上都保持了一致性,甚至没有任何一个模型在超过一半的检验中通过了分割一致性。在印度尼西亚数据上,DeepSeek V-3.2模型的分割一致性平均得分只有0.23,而整体平均得分最高的Claude Sonnet 4.6也只达到了0.70(顺序一致性)和0.70(分割一致性)。
两个虚构预测场景的结果同样不乐观。网球预测中,没有任何模型通过了超过一半的分割一致性检验。奇幻战斗场景中,模型间的差异较大,从0分到满分都有,但这个场景特别说明了一点:即使在完全没有真实世界参照数据的情况下,一致性检验依然可以运行,因为它只依靠AI自身的内部逻辑。
更大范围的模型横向比较则揭示了一个结论性的发现:研究团队把测试扩展到了24款不同的模型,覆盖了GPT系列、Qwen系列、Gemini系列和Claude系列的多个版本,并参考了"人工分析智能指数"(Artificial Analysis Intelligence Index)这个衡量模型综合能力的第三方基准。结果发现,在同一模型家族内,即便模型的综合能力分数大幅提升,分割一致性和顺序一致性的得分并没有随之系统性地提高。换句话说,AI模型变得更"聪明",并不自动意味着它变得更"自洽"。统计自洽性是一个独立的、尚未被现有训练方法所针对性优化的能力维度。
**八、这意味着什么:AI在扮演"全知统计学家"时存在根本性缺陷**
回到最开始的问题:AI给出的统计估计,真的靠谱吗?
这项研究提供了一个清晰的答案:在相当程度上,并不靠谱——至少不能无条件地靠谱。更准确地说,AI对统计问题的回答,会因为你问问题的方式而产生系统性的差异,即便这些不同的方式在数学上是等价的。
这对很多看似合理的AI应用场景构成了挑战。比如,有研究者用AI来做"合成调查"——让AI模拟不同背景的人对调查问题的回答,以此代替或补充真实的人口调查。如果AI在宏观层面和微观层面的估计之间存在系统性偏差,那么基于这种合成调查的结论就可能存在根本性的方法论问题,不同的研究者选择不同的提问粒度,可能得到截然不同甚至互相矛盾的"结论"。
同理,在预测和预报场景中,如果两个分析师对同一个事件用不同的方式向AI提问——一个直接问整体概率,另一个先按条件情景分类再综合——他们可能得到系统性不同的答案。而这种差异并不是因为他们掌握了不同的信息,仅仅是因为提问方式不同。
研究团队还指出了一个重要的不对称性:对齐(Alignment)和自洽性(Self-Consistency)是两个不同的概念,它们之间没有必然的包含关系。一个模型可以在整体层面上的估计与人类数据高度吻合,但它对子群体的估计却可能一塌糊涂;反之,一个模型可以内部逻辑非常自洽,但整体估计却与真实世界大相径庭。评估AI的统计推理能力,需要同时检验这两个维度,而现有的主流评测体系几乎只关注对齐,对自洽性的系统性评估几乎是空白的。
从这个角度看,这项研究实际上提出了一类新的AI评测基准——完全不需要真实世界的参考数据,只需要对AI自身的输出进行内部一致性检验,就能发现其统计推理能力的缺陷。这对于那些无法获取真实数据的领域(比如预测未来事件、评估假设情景)尤为有价值。
说到底,这项来自德国和瑞士联合研究团队的工作,就像是给AI做了一次"逻辑体检"。检查结果是:AI的逻辑内脏并不总是互相协调的。它可能知道"年轻人收入低"、"老年人收入低"、"中年人收入高",但当你直接问它"平均下来美国人收入怎么样",它给出的答案却未必能反映出这三个已知事实的合理加权——仿佛大脑的左手和右手并不总是知道彼此在做什么。
这不意味着AI毫无用处,恰恰相反,研究的另一面是非常积极的:AI确实储存了大量有用的子群体知识,而通过分层提问的方式,这些知识是可以被更有效地提取出来的。这就为如何更聪明地使用AI提供了实践指南:与其笼统地问大问题,不如先把问题分解成更小的、更具体的子问题,然后手动或引导AI把这些答案合并起来。
至于这个问题的根本解法——如何训练出真正满足概率自洽性的AI模型——则是未来研究需要认真解决的开放课题。有兴趣进一步探索这个方向的读者,可以通过arXiv编号2607.15277查阅完整论文,那里有更详尽的数学证明、实验设置和数据分析,以及对于如何把自洽性检验内化为训练目标的初步讨论。
Q&A
Q1:什么是大语言模型中的"宏观谬误"(Macro Fallacy)?
A:宏观谬误指的是一种AI的系统性偏差现象:当直接询问AI对整体人群的统计估计(比如"美国人年收入超过5万美元的概率"),得到的答案往往比先询问各子群体的估计、再按人口比例加权合并得到的答案偏差更大。也就是说,"先细问再合并"比"直接粗问"更准确,体现出AI在处理整体层面问题时存在知识压缩的系统性失真。
Q2:全概率公式一致性检验是否需要真实数据才能进行?
A:不需要。研究中设计的"分割一致性"和"顺序一致性"两种检验都是参考免基准(Reference-Free)的,只需要比较AI自身在不同提问方式下的输出,不需要任何外部真实数据。这意味着即使在完全虚构的场景(如奇幻游戏战斗)中,只要能构建出逻辑上互斥且完整的分组,就可以运行一致性检验,用来发现AI内部逻辑的不自洽之处。
Q3:使用"微观到宏观提示"方法能否完全替代显式分层聚合?
A:不能完全替代,但在实际应用中是一种有价值的低成本替代方案。显式分层聚合(构建完整的二叉条件树)在改善准确率上更加稳定可靠,而"微观到宏观提示"仅通过在问题中加入引导语就能部分复现分层效果,但效果更依赖模型本身的能力,不同模型和不同任务上的改善幅度差异较大,有时甚至不如直接提问。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.