![]()
这项由Meta AI研究团队完成的研究发表于2026年7月,论文编号为arXiv:2607.19322v1,有兴趣深入了解的读者可以通过该编号查询完整论文。
**评判AI的答案,光看"说错了没"远远不够**
假设你戴着一副智能眼镜,看着桌上一盘热气腾腾的菜,随口问一句:"这是什么菜,怎么做的?"AI助手回答说:"这是西红柿炒鸡蛋,需要用西红柿和鸡蛋。"
这个回答对不对?严格说来,没有一个字是错的。但你心里一定觉得少了什么——它没告诉你要先打散鸡蛋,没说要用油,没提炒的顺序,更没讲火候。这个答案虽然没有说错,但它严重不完整。
这恰恰是当今AI评测领域长期忽视的一个核心问题。Meta AI的研究团队发现,现有的评测方法大多只盯着AI"有没有说错",而完全忽略了另一个同等重要的问题:AI"有没有说全"。为了解决这个缺口,他们构建了一套名为GAMUT(Grounded Assessment of Multimodal Factuality,即"基于真实场景的多模态事实性评估")的全新评测框架与数据集。
GAMUT包含1813道问题,每道题都配有一份经过专家人工核验的详细评分标准。研究团队用它测试了14个当今最强的AI模型,结果发现即使是最顶尖的模型——谷歌的Gemini 3.1 Pro——得分也只有58.7%,远未"及格"。这说明,让AI给出一个真正完整、详尽的答案,至今仍是一个远未解决的难题。
一、现有评测方法的根本缺陷:只检查"错没错",不管"全不全"
要理解GAMUT解决了什么问题,需要先弄清楚目前的AI评测是怎么做的,以及它为什么不够用。
目前学术界最主流的评测方法叫做"分解-搜索-验证"流程。简单说,这套方法把AI的回答拆解成一条条独立的陈述,然后逐一去网上搜索验证这些陈述是否正确。比如AI说"炒鸡蛋需要油",系统就去验证这句话对不对;AI说"西红柿富含维生素C",系统就去核实这个事实。这套方法在发现AI"说错了"的方面相当有效,就像一位严格的监考老师,能准确圈出卷子上的错误答案。
然而,这套方法有一个根本性的盲点:它只检查AI说了什么,从不追问AI漏掉了什么。这就好比你让一个学生描述做一道菜的全部步骤,他只写了"需要西红柿和鸡蛋",监考老师检查后说"这两个事实都正确,满分"——但这显然是荒谬的,因为这道答案几乎什么都没说。
研究团队把这种"有没有说错"叫做"精确度"(precision),而把"有没有说全"叫做"召回率"(recall)。目前学界有一小部分工作开始关注召回率,但仍然面临另一个更深层的问题:所有这些方法,无论是检查精确度还是召回率,都把一道问题的答案视为一张独立事实的清单,每个事实打一个勾或叉,相互之间没有关联。
现实中,知识的组织方式远比这复杂。有些问题需要列出所有必须满足的项目,比如一道菜的核心配料,每一样都缺一不可。有些问题则相反,答案是一个开放性的集合,比如"哪些传统菜肴用到了这种香料",这里没有唯一正确的列表,只要覆盖得足够广就算好。还有一类问题,答案本身是一个有顺序的流程,比如烹饪步骤,说错顺序就是答错了,即使每一步本身描述得都对。这些复杂的结构,用独立打勾的清单完全无法表达。
正是意识到了这个根本性的不足,Meta AI的研究团队设计了一套全新的"两级元评分标准"框架,而GAMUT就是这套框架在现实世界中的具体实例。
二、解决方案的核心:用"结构化菜谱"描述完整答案,再拆解成"逐项检查清单"
GAMUT的核心思路,可以用一个烹饪的比喻来理解。
当一位厨师想把一道复杂菜肴的做法传授给徒弟时,他不会只给出一张杂乱的食材列表,而是会先画出整道菜的结构:哪些食材是必不可少的主料,哪些是可以灵活替换的配料;制作步骤分几个阶段,哪些步骤是绝对不能颠倒顺序的,哪些可以根据实际情况调整。这份"菜谱蓝图"就是GAMUT中所谓的"元评分标准"(meta-rubric),它在结构层面描述了一个完整答案应该包含哪些内容,以及这些内容之间的关系。
但问题在于,如果你直接拿着这份复杂的菜谱蓝图去让一个打分员给AI答案打分,他需要同时考虑覆盖率、顺序、重要性层级等诸多因素,很容易给出主观、不一致的评价——就像让不同的试吃员凭感觉给一道菜打分,每个人标准都不一样。
所以GAMUT在菜谱蓝图之上,还设计了第二层:把这份结构化蓝图,用固定的机械规则,自动转换成一张"逐项检查清单"——每一条都是一个非此即彼的是非题,可以明确判断AI的回答是否满足该条件。这张清单就像一份标准化的验收表,让AI打分员(实际上是另一个大型语言模型)能够客观、一致地逐条判断。
这两层设计的精妙之处在于:复杂的结构和主观判断发生在"菜谱蓝图"这一层,由人类专家负责;而实际的打分工作则在"检查清单"这一层进行,每道题都有明确标准,大大降低了评分的不一致性。
研究团队把元评分标准中的内容分为五种类型,分别对应了知识组织的五种不同方式。第一种叫"简单知识",就是一个单一的离散事实,比如"这道菜叫什么名字"。第二种叫"严格列表",指的是一个有限集合,其中每一项都是必须提到的,比如一道菜的核心配料,少了任何一样都是不完整的。第三种叫"灵活列表",指的是一个有效选项的集合,但不要求全部说到,只需覆盖足够多——比如"用到这种食材的传统菜肴",能列出五道菜和能列出两道菜是不一样的好,但没有哪道菜是必须提到的。第四种叫"流程",指一个有顺序的步骤序列,顺序本身承载着意义,说错了顺序就算回答有误。第五种叫"关系",描述不同事物之间的联系或对比,比如"某种特性导致了某种效果"。
此外,一个列表或流程还可以附带一个"元洞见"——这是对多个具体项目的总结性概括,是一种只看单条项目无法得到的整体认识。比如对于一道使用各种红肉的菜肴,具体用牛肉、猪肉还是羊肉是灵活列表,但"这道菜本质上总是使用某种红肉"这个模式,就是一条元洞见。
三、从"菜谱蓝图"到"检查清单":机械转换规则的设计细节
理解了这两层结构之后,一个自然的问题是:怎么把蓝图转换成清单?这个转换过程是完全确定的、机械的,不依赖任何主观判断,从而保证了体系的可重复性和可审查性。
对于最简单的"简单知识"类型,转换直接:一条知识变成一个检查项。对于"严格列表",每一个列表项都变成一个独立的检查项,它们都继承原列表的重要性级别。
"灵活列表"的转换最为精妙。它会生成两类检查项:第一类是"覆盖基线",形式类似于"在以下六种配料中,至少提到其中两种",并且把所有选项全部列出,让检查项本身就是完全自足的,不需要参考其他任何地方。第二类是"额外加分项",具体形式取决于列表的长度:如果列表较短(七个选项以内),则每个选项单独成为一个加分检查项,放在比基线低一个重要性级别的位置;如果列表很长,则不逐项展开,而是设置几个更高的覆盖门槛作为加分项,避免让清单里充满大量低价值的检查项。
这样的设计意味着:满足基线覆盖是"及格"的门槛,多覆盖几项能拿到更高分,但在七个选项之外另举一个有效例子既不加分也不扣分——这恰好符合直觉,因为这道问题本来就没有唯一标准答案。
"流程"类型的转换同样细致。每个步骤都生成一个"存在性"检查项(即"有没有提到这个步骤"),必须步骤的检查项继承流程的重要性级别,可选步骤的检查项降低一级。除此之外,还会额外生成一个"顺序检查项",专门验证被提到的必须步骤是否按照正确顺序排列——这个顺序检查项措辞非常精确,明确说明"缺少某个步骤不算失败,只要被提到的步骤之间没有顺序颠倒就算通过",这样就避免了因为AI没提某步骤而额外惩罚排序正确性。如果流程中同时有必须步骤和可选步骤,还会在较低重要性级别上再生成一个覆盖全部步骤的整体顺序检查项。
整个清单中的检查项被划分为三个重要性级别:答案关键级(Answer-Critical)、有价值级(Valuable)和背景级(Context)。答案关键级是一个完整答案不可缺少的核心内容;有价值级是能显著提升答案深度和实用性的内容;背景级是有助于理解但不影响答案是否正确的补充信息。
四、打分方式:既区分"说错了"和"忘说了",也区分"大致对"和"完全对"
有了这张检查清单,实际打分是怎么进行的?研究团队设计了一套既简单又精妙的评分机制。
对于清单上的每一条检查项,由一个强大的大型语言模型(充当"评分员")独立判断AI的回答满足情况,返回四种判定之一:完全满足、部分满足、未提及、与要求矛盾。
这四种判定对应的分值设计很有讲究。完全满足得1分,未提及得0分,部分满足得0.5分——这是为了奖励那些方向正确但不够精确的回答,比如说对了属但没说对种。而与要求矛盾则得负分,而且惩罚力度比"未提及"重得多。这是因为在一个以事实可靠性为目标的评测体系里,一个错误答案的危害远大于一个不完整答案——你说错了会误导用户,你没说只是让用户觉得不够完整,两者的性质截然不同。
每个重要性级别内的所有检查项分别汇总成一个级别得分。然后,三个级别的得分按照固定的全局权重合并成最终的GAMUT分数。答案关键级的权重是0.6,有价值级是0.3,背景级是0.1。采用全局固定权重而非每道题按检查项数量动态分配权重,是为了避免一道题里有很多背景级检查项就把答案关键级的重要性稀释掉的情况。GAMUT分数的范围是从负1到正1,负分意味着AI不仅没说全,还在关键问题上给出了错误信息。
五、数据集的构建:一万三千多个问题从哪里来,又如何保证质量
GAMUT数据集的构建过程分为两个阶段:首先生成问题,然后为每道问题构建评分标准。两个阶段都遵循同一个原则:用强大的AI模型产生初稿,再由专业人工标注员审核修改,确保最终成果不依赖未经核验的AI输出。
问题的来源非常有特色。研究团队从CRAG-MM这个可穿戴设备图像数据集中抽取了1938张图片,这些图片大约80%是用智能眼镜拍摄的第一视角照片,被拍摄的目标经常很小、模糊、被遮挡或光线昏暗,覆盖了植物、食物、动物、车辆、本地地点、日常物品、消费品等十个生活领域,实体的知名度也从头部到长尾各有分布。
为每张图片生成的问题必须满足几个严格条件:需要多步骤的网络研究才能回答;答案应该超过一两段话;语言要自然,像真实用户会说的话;对被拍摄对象的称呼必须依赖图像本身,只能用"这辆车""这些浆果"等指代,不能在问题里直接说出实体的名字。
为了确保问题不会"泄露"答案,研究团队设计了一个"陌生人测试":如果一个问题只有在已经知道图片里是什么的情况下才能提出,那这个问题就是"引导性"的,必须淘汰。比如"这款发动机的涡轮增压器相比上一代有哪些改进",只有认出了车型并知道其发动机历史才能问出这个问题;而"这辆车是什么,性能怎么样"则是任何人看到一辆车都可能提出的问题,符合标准。
问题经过AI初步生成后,由专业标注员进行多轮审核,每道问题由两位标注员独立评审,有分歧时由第三位裁决。通过人工审核后,还要经过另一个AI模型的自动过滤,最终入选的问题必须同时通过人工和自动两关审核。整个流程产生了1843道问题,每张图片对应一道。
评分标准的构建比问题生成更为复杂。AI模型先通过网络搜索收集支持证据,以引用网页片段的形式记录下来,然后在这些证据的基础上(而非依靠模型自身的记忆)构建元评分标准,再按规则转换成二进制检查清单。生成初稿后,AI还会进行自我审查——重新浏览每个引用的网页核实片段内容,标记不完整的列表或流程,然后从头独立搜索,把新发现的内容补充进去,最终生成一个覆盖更全面的修订版本。
之后,由研究团队内部的专业人员对评分标准进行多轮人工修订。这里有一个有趣的设计选择:标注员看到的是元评分标准,但实际修改的是二进制检查清单,因为检查清单才是最终用于打分的内容,直接修改它才能同时核验转换过程本身是否正确。在完成第一轮人工修订后,又进行了一轮AI精炼和第二轮人工修订。整个过程中,还发现并纠正了12例CRAG-MM数据集中实体标注错误的问题,并删除了少量无法构建合理评分标准的问题,最终留下1813道完整问题。
六、测试结果:最强AI只拿到58.7分,"说漏了"才是主要问题
研究团队用Gemini 3.1 Pro作为评分模型,对14个当前主流的AI系统进行了全面测试,覆盖了谷歌、Anthropic、OpenAI的旗舰模型以及多个开源模型。
结果相当清晰。在所有被测试的商业闭源模型中,Gemini 3.1 Pro以58.7分排名第一,Gemini 3 Flash以57.9分紧随其后,Claude Opus 4.8排名第三得53.1分,Gemini 2.5 Pro得51.8分,Claude Opus 4.6得50.5分,GPT-5.4得42.6分,Claude Sonnet 4.6得41.5分,GPT-4o得34.2分。在开源模型中,Qwen3-VL 235B以33.0分领先,Llama 4 Maverick得18.3分,Llama 4 Scout得14.1分,Qwen3-VL 8B得13.7分,Llama 3.2 90B得11.8分,Llama 3.2 11B得5.1分。
分析各模型的答题模式,可以发现一个共同规律:主要失分原因不是"说错了",而是"没说到"。对于最弱的模型,大约三分之二的检查项显示为"未提及";即使是最强的模型,也有超过四分之一的检查项显示答案不够完整。与此形成对比的是,明确与要求矛盾的回答比例相对较低,最强的几个模型矛盾率在4%到6%之间,最弱的模型矛盾率也只有8%左右。换句话说,这些AI模型在"说准确"方面做得相对不错,但在"说完整"方面还有很大的提升空间。
研究人员还发现,这份排名具有很好的"区分度"——模型之间的分数差异很大,而且排名结果与学界对这些模型能力的普遍认知高度吻合:更新、更大的模型得分高于更旧、更小的;商业闭源模型整体高于开源模型;各模型在判定分布上也表现出各自已知的特点,比如两个Qwen3-VL模型的"矛盾"判定比例明显高于其他模型,而Claude Opus的"矛盾"比例是所有模型中最低的。
为了验证评分结果不依赖评分模型的选择,研究团队还用Claude Opus 4.8和Qwen3-VL 235B分别重新对全部14个模型打了一遍分。Gemini和Claude给出的排名完全一致,逐个模型的分数差距在1.8分以内;两者都没有表现出偏袒自家答案的倾向——Gemini给自己打的分和Claude给Gemini打的分相差不超过0.3分。Qwen3-VL 235B作为一个相对弱一些的评分模型,整体给分偏高4到11分,但排名顺序基本保持不变,只有相邻且分数接近的模型之间出现了少量换位。这说明GAMUT的评分结果对评分模型的选择具有良好的稳健性。
七、纯文字版本的测试:去掉图片后,模型能答得更好,但差距依然存在
由于GAMUT的元评分标准框架本身与图像无关,研究团队还制作并发布了一个纯文字版本。在这个版本里,每道问题都被改写为把被拍摄实体的名称直接写入问题,不再需要看图才能理解——比如"这辆车是什么,性能怎么样"变成"大众高尔夫GTI的性能怎么样"。1813道问题中有7道在转换后仍然依赖图像本身,被排除,最终保留1806道问题,评分标准和打分方式完全不变。
测试结果显示,所有模型在纯文字版本上的得分都高于多模态版本,提升幅度在8到24分之间。GPT-4o的提升幅度最大(23.9分),从34.2分提升到58.1分,说明对它来说视觉识别是一个较大的瓶颈;Claude Opus 4.8的提升幅度最小(7.8分),从53.1分提升到60.8分,说明它的视觉识别能力相对较强。
一个关键的发现是:这个提升幅度在不同模型之间相当均匀,也就是说,去掉图片对所有模型的帮助程度大致相似。这意味着视觉识别更像是一个加在所有模型头上的"固定税",而不是区分强弱模型的关键因素。换句话说,多模态测试中的排名差异,主要反映的是模型在知识完整性方面的差异,而不是视觉识别能力的差异。即使是最强的Gemini 3.1 Pro,在知道了被拍摄对象是什么的情况下,也只能拿到74.1分,距离完整回答仍有相当距离。
八、数据集的多样性分析:问题覆盖广泛,评分标准结构丰富
研究团队对GAMUT数据集本身的特征进行了详细分析,以证明它不是一个充斥着模板化问题的平庸数据集。
从问题内容来看,每个领域都涵盖了多种不同角度的问题,而不是反复重复同一类型。植物与园艺领域的问题分布在栖息地(35%)、特征(14%)、养护(12%)、比较(12%)等多个方向;本地地点领域的问题涵盖历史(34%)、建筑(25%)、文化(9%)、商业(7%)等;车辆领域包括规格参数(25%)、历史(18%)、比较(16%)、可靠性(15%)、设计(13%)等;食物领域涵盖食材(21%)、历史(17%)、比较(15%)、品牌(11%)、地域变体(10%)等。这种分布表明问题是针对每个领域的具体特点定制的,而不是套用统一模板。
从问题形式来看,问题的中位数长度是23个词,简洁自然。最常见的25种开头短语只覆盖了不到60%的问题,大约六分之一的问题不以标准疑问词开头,而是以"如果我想……""根据……"等形式开始,体现了较高的多样性。
从评分标准的结构来看,每道题平均有15.2个二进制检查项(中位数15个),其中平均5.9个属于答案关键级,5.8个属于有价值级,3.5个属于背景级。最关键的统计数字是:98%的问题需要至少一种超出"简单知识"的结构性元素,平均每道题有1.6种结构类型。灵活列表是最常见的结构,出现在86%的问题中;严格列表出现在49%的问题中;流程出现在17%的问题中;关系出现在6%的问题中。灵活列表的中位数选项数量是4个,有12%的灵活列表超过7个选项(属于"长列表"需要使用覆盖门槛而非逐项检查);流程的中位步骤数是4步,其中57%的流程混合了必须步骤和可选步骤。有13%的问题包含元洞见,全数据集中共有295条元洞见。
所有评分标准都有证据支撑:每道题的元评分标准平均引用约10个网页片段,整个数据集引用了超过9400个不同的网页,97%的元评分标准条目和94%的二进制检查项都有对应的引用。
说到底,GAMUT做的事情,是把我们评价AI的标准往前推进了一大步。过去我们只问"AI有没有说错",现在还要问"AI有没有说全",以及"AI对知识的组织方式有没有忠实地反映现实"。
这项研究表明,最顶尖的AI系统在"说全"这件事上的表现,远不如我们想象的好——哪怕是最强的模型,在知道了图片里是什么的前提下,也只能给出大约74%完整度的答案,而在同时需要识图的情况下,这个数字只有58.7%。更有意思的是,这个差距的主要来源不是AI说了错误的事情,而是AI不知道自己还漏掉了很多该说的事情。
对普通用户来说,这意味着当你用AI助手查询任何需要较为全面答案的问题时——比如了解一种药物的完整使用注意事项,或者学习一项新技能的完整步骤——都应该对AI给出的答案保持警觉,主动追问"还有什么我没问到的",而不是默认AI已经告诉了你所有重要的事情。
GAMUT数据集、纯文字变体以及评测代码已经公开发布在GitHub上,有兴趣深入了解这套评测框架的技术细节的读者,可以通过arXiv编号2607.19322查阅完整论文。
Q&A
Q1:GAMUT评测框架和现有的AI事实性评测方法有什么本质区别?
A:现有方法主要检查AI"有没有说错",而GAMUT同时评估AI"有没有说全"。更根本的区别在于,GAMUT用结构化的"元评分标准"描述知识的内在组织方式,能表达"必须全部说到的项目""可以灵活选择的集合""有顺序的流程"等复杂结构,而现有方法只能把答案视为一张独立事实的清单,无法表达这些结构关系。
Q2:GAMUT测试中,当前最强的AI模型得分为什么只有58.7%?
A:得分低的主要原因不是AI说了错误的内容,而是AI漏掉了大量应该回答的内容。在最强模型Gemini 3.1 Pro的检查项中,超过四分之一的检查项显示答案不够完整,即答案只覆盖了一部分应该涵盖的知识点。这说明让AI给出真正完整、全面的答案,在技术上仍然是一个未解决的难题。
Q3:GAMUT数据集的1813道问题是怎么保证质量的?
A:每道问题都经过双重审核:先由两位专业标注员独立评审,有分歧时由第三位裁决;再经过一个独立AI模型的自动过滤,通过"陌生人测试"(问题能否在不知道实体身份的情况下自然提出)等硬性标准。评分标准同样经过AI自我精炼和专业人工多轮修订,并要求每个评分条目都有网页引用作为证据支撑。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.