网易首页 > 网易号 > 正文 申请入驻

当AI要给文章打分:这句话重要还是不重要,你觉得它靠什么判断?

0
分享至


想象你是个刚入职的编辑,主编扔给你一沓病历、一堆合同、一批财报电话会议记录,让你从每一份文件里挑出"重要的那部分"。医生的病历里,重要的是不能泄露病人隐私的敏感信息。合同里,重要的是能证明某条款是否成立的关键句子。财报会议记录里,重要的是能被写进摘要的核心数据。

问题来了:这些任务的"重要"根本不是一回事。

如果你想用一套死办法应付所有任务,比如写一份万能的说明书告诉AI"请找出重要内容",结果大概率是每份文件都做得平庸。这正是当下大语言模型处理这类任务时普遍在做的事,而这篇来自Signal 1 AI和Layer 6 AI的论文,想解决的就是这个尴尬。

**核心问题:提示词工程正在拖累整个领域**

先说清楚这类任务到底是什么。

内容选择*:从一份文档里挑出"相关"内容的任务,比如摘要(挑出重要句子)、问答(挑出能回答问题的证据)、合同审查(挑出关键条款)、隐私信息检测(挑出需要打码的敏感信息)。

这些任务表面上五花八门,本质上都在做同一件事:给文档里的每一句话打一个"重要不重要"的分,然后把重要的留下,不重要的删掉。

而要给这个过程加上统计学意义上的保证,学界普遍用一种叫**保形预测**的工具。

保形预测(Conformal Prediction):一种不需要假设数据分布、只需要少量校准样本,就能给出"至少百分之多少的正确内容会被保留"这种概率保证的统计方法。

保形预测本身不管你用什么打分方法,它只负责在你已经打好分的基础上,算出一个阈值,卡在哪里能保证覆盖率。这就好比你有一把尺子,尺子本身是准的,但拿这把尺子去量什么,量得对不对,取决于你测量的对象。如果你的打分函数很烂,尺子再准也没用,划出来的范围要么太宽(留了一堆废话),要么直接漏掉了关键信息。

这把"尺子"背后的打分函数,过去几年的做法是什么呢?答案是人工写提示词,让大语言模型给每句话打重要性分数。摘要任务写一个提示词描述"什么是重要的句子",问答任务写另一个提示词描述"什么是没有幻觉的答案",合同审查再写一个。每换一个任务,就要重新琢磨怎么用自然语言把"相关性"这个模糊概念讲清楚给AI听。

这事有多累人?论文里提到,提示词的措辞、顺序、格式都会显著影响大语言模型的表现,这在过去的研究里反复被证实过。也就是说,你不仅要为每个任务单独写提示词,还得不断调试它,因为一个词换了位置,效果可能就变了。这是一种典型的"劳动密集型、脆弱、不可扩展"的做法,论文原话就是这么形容的。

那有没有办法不写这些说明书,让AI自己从例子里悟出"重要"是什么意思?

**方法核心:用例子代替说明书**

这篇论文的思路是:与其告诉AI"什么是重要的",不如给它看几个例子,让它自己总结规律。这套路数叫**上下文学习**。

上下文学习(In-Context Learning,简称ICL):不用重新训练模型,只需要在提示词里放几个"输入-输出"的示范例子,模型看完例子就能照猫画虎完成新任务的一种能力,是大语言模型的一项重要特性。

具体怎么操作?研究团队设计了一套叫**Conformal Relevance**(保形相关性)的框架。核心思路是:不写"什么算重要"的定义,而是从一个已标注的例子池里,挑几个例子(每个例子里标好了哪些句子重要、哪些不重要),塞进提示词里,让大语言模型自己对比、归纳出这次任务的判断标准,再去给新文档打分。

这就像教一个新来的实习生审稿子。你不用长篇大论解释"什么叫好文章",你直接甩给他十篇过去编辑标注过的文章,告诉他"这几段被留下了,那几段被删了",实习生看几遍就明白了套路,甚至能总结出比你说明书写得还准的判断标准。如果不这么做,你非要写一份"重要性认定手册",结果往往是手册写得越详细,实习生反而越死板,遇到手册没提到的情况就懵了。

问题又来了:从例子池里挑哪几个例子给AI看,这本身就是个选择问题。挑得好不好,直接决定了AI学到的"标准"靠不靠谱。

**用四种不同的"眼光"挑例子,再把它们的判断平均**

研究团队没有指望找到一种"万能挑选法",而是设计了四种完全不同思路的挑选策略,让它们各自去挑例子、各自打分,最后把四个分数取平均,作为最终的相关性分数。

这四种策略分别是:

第一种叫anchor_dpp,先找一篇和当前待打分文档最相似的例子作为"锚点",然后再用一种叫**行列式点过程**的算法,在锚点周围挑出几篇既相关又互相不重复的例子。

行列式点过程(Determinantal Point Process,简称DPP):一种数学工具,能在挑选一组元素时同时兼顾"质量高"和"彼此不相似"两个目标,避免挑出的例子都长得差不多。

第二种叫pattern_dpp,它不看整篇文档像不像,而是去看每篇例子里"被选中的句子"和"没被选中的句子"在语义上的差异方向,把这个差异方向当作一种"相关性指纹",再用DPP挑出指纹方向最不一样的几篇例子。

第三种叫bm25,是一种经典的关键词检索算法,专门捕捉文字表面的重叠,比如术语、专有名词、缩写这些语义模型可能会忽略的信息。

第四种叫random,就是纯随机挑选,不做任何智能判断。

你可能会疑惑,随机挑选这么"偷懒"的做法,凭什么也配进这个精心设计的四人组?

这恰恰是设计里最反直觉的一步。随机策略的价值不在于它自己有多准,而在于它和其他三种策略"不来往"。它的错误是完全随机分布的,不会和另外三种策略的系统性偏差凑到一起。这就像一个团队里如果有三个人都从同一个专业背景出发思考问题,容易一起掉进同一个盲区,这时候拉进来一个完全不懂行的外行人,他提出的意见虽然单看没什么水平,却常常能戳破团队里没人注意到的共同误区。论文的实验也验证了这一点:在HotpotQA这个数据集上,四种策略单独用都打不过人工写的提示词,但四个一起平均之后,反而比人工提示词提升了12%。

**为什么"平均"有效:一个数学上的互补条件**

光靠直觉说"多个角度更全面"还不够严谨,论文花了不小的篇幅去证明,什么情况下平均几个打分函数真的能提升效果,什么情况下不能。

这里要理解一个关键设定。保形相关性框架关心的不是"平均打分准不准",而是"最容易被漏掉的那个重要句子,它的分数有没有被拉高"。因为一旦某个真正重要的句子被打了低分,它就可能被算法误判为不重要而删掉,这是保形预测里覆盖率保证会失效的根源。所以研究团队定义了一个概念,叫做**下限分数**,也就是所有真正重要的句子里,得分最低的那一个。

下限分数(Floor Score):在一份文档的所有"应该被保留"的重要内容里,打分函数给出的最低分数,代表了整个预测集合最薄弱的环节。

如果两个打分函数的"薄弱环节"恰好是同一个句子,也就是它们都把同一句话打了低分,那把它们平均起来也没用,低分还是低分。但如果两个打分函数的薄弱环节是不同的句子,也就是A漏掉的句子恰好被B捕捉到了,B漏掉的又恰好被A捕捉到,这时候平均之后,两边的短板互相被补上了,下限分数就能被真正抬高。

论文把这个"薄弱环节是否重叠"的程度量化成了一个叫**互补性**的指标,并且证明了一个数学结论:当两个打分函数的互补性超过它们各自下限分数的差距时,平均之后的效果一定会比单独用更强的那一个还要好。

互补性(Complementarity):衡量两个打分函数是否在同一个"最容易看走眼"的地方犯错的指标,数值越高说明它们犯错的位置越不重合,互相弥补的空间越大。

这个结论翻译成大白话就是,找队友不是要找和自己一样强的人,而是要找和自己"弱点不同"的人。团队实验里专门验证了这条规律:在超过47万个样本上检查,只要互补性条件成立,实际观测到"平均之后确实更好"的比例高达99.55%,几乎是板上钉钉的事情。

但这也带来一个自然的追问:既然多个打分函数互补有用,那是不是打分函数越多越好?加到十个、二十个会不会效果爆炸式提升?

**边际收益递减:为什么四个刚刚好**

论文给出了另一个数学证明,回答了这个问题。结论是:每多加一个打分函数带来的提升,会随着已有打分函数数量的增加而越来越小,具体的上界是1除以打分函数个数,也就是所谓的**O(1/K)递减**。

这个结论其实挺符合直觉的,如果你已经找了三个视角完全不同的审稿人,第四个人再怎么找角度刁钻,能补充的新信息也有限了,因为前三个人已经把大部分盲区照顾到了。这就好比你请了三位来自不同学科背景的专家评审一篇论文,一位懂统计,一位懂领域知识,一位懂写作逻辑,这时候再请第四位专家,除非他的视角和前三位完全不搭界,否则大概率只是在前三人已经覆盖的范围里重复劳动。

论文用实验验证了这个理论预测:从两个打分函数增加到三个,平均精度提升明显;但从三个增加到四个,提升幅度就变小了,而且这种递减趋势在全部七个测试数据集上都成立。基于这个规律,研究团队最终选定了四个打分函数作为默认配置,命名为Ens4,这是一个在效果和计算成本之间取得平衡的选择。

**七个任务、五个领域,一套配置打天下**

理论说得再漂亮,最终还是要看实际效果。研究团队在七个横跨五个领域的数据集上做了测试,包括财经电话会议摘要、维基百科查询式摘要、医疗视角问答、医疗隐私信息检测、多跳问答、临床证据抽取、法律合同条款打分。这些任务的文档长度从14句到461句不等,覆盖了摘要、问答、实体检测、条款打分四种完全不同的任务类型。

关键的实验设置是:全程只用同一套Ens4配置,不针对任何一个数据集做调整,唯一变化的是数据集本身。

结果是Ens4在全部七个数据集上都超过了人工精心设计的提示词基线,提升幅度从12%到59%不等,置信区间全部不包含零,说明这不是偶然波动。更值得玩味的是,四个单独的挑选策略里,没有一个能在所有数据集上都排第一,每个策略都只在某一两个数据集上表现最好,甚至连随机挑选策略也在某个数据集上拔得头筹。这恰恰印证了前面说的互补性逻辑:单打独斗谁都赢不了全场,但组队之后反而稳定超越所有人。

论文还做了大量对照实验,来排除一种可能的质疑:Ens4的提升会不会只是因为它多喂了AI几条标注数据?毕竟四个打分函数拼起来,总共用了8条上下文示例,比单独用一个策略配置8条示例的做法要多花不少标注成本。

研究团队专门做了对照:让单一策略也用满8条示例(也就是把预算全砸在一个方向上),结果发现效果反而没有提升,甚至在部分数据集上还下降了。这说明不是"喂得多"起作用,而是"喂得杂"起作用。

他们还训练了一个传统的监督分类器,用同样规模的标注数据去训练,结果Ens4在七个数据集里的六个上依然胜出。他们甚至测试了"用同一个策略,只是把生成时的随机性调高调低几档"来制造多样性,结果发现这种"伪多样性"远不如真正基于不同检索逻辑产生的多样性有效。这一系列排除法指向同一个结论:起作用的核心机制,就是不同检索策略带来的、真正意义上的判断视角差异,而不是标注数据量或者随机噪声。

**覆盖率保证是否真的兑现了承诺**

保形预测的核心卖点是"覆盖率保证",也就是说不管你的打分函数多聪明或多笨,只要满足一定的统计假设,最终产出的预测集合里,至少能保留住目标比例的重要内容,这个承诺不能是空头支票。

论文在七个数据集上,把目标覆盖率从0.5一路测到接近1,反复做了400次随机的校准/测试集划分,结果显示实际达到的覆盖率和目标值之间的偏差始终控制在1个百分点以内。这说明理论上的保证,在真实场景里确实兑现了,不是纸面上的漂亮话。

而在覆盖率有保证的前提下,Ens4相比人工提示词基线,能删掉更多不相关的内容,也就是论文反复强调的"简洁性"指标。在多数测试的召回率水平下,Ens4都能比人工提示词多筛掉一截废话,这意味着最终交到用户手里的内容更精炼,用户不需要在一堆低质量的"安全但啰嗦"的候选句子里再花时间二次筛选。

**局限和代价:没有免费的午餐**

这套方法当然不是完美的,论文自己也坦承了几处短板。

首先是标注成本,虽然比逐任务写提示词轻松不少,但每个任务依然需要150到440条标注样本,这些样本还得从一个共享的例子池里精心划分出校准集和测试集,本质上还是要人力去标注和维护。

其次是计算成本,Ens4每次打分需要调用四次大语言模型,而不是人工提示词方案的一次,这意味着推理成本直接翻了四倍左右。论文里用实测数据展示了这一点:在某些数据集上,串行调用的延迟甚至达到了十几倍,虽然这四次调用理论上可以并行处理来缓解这个问题,但额外的计算开销是实打实存在的。

还有一处有意思的例外,论文测试去掉提示词里那句简短的任务提示(比如"识别与查询相关的句子"这样一句话)后,六个数据集几乎没受影响,但在隐私信息检测这个任务上,效果从0.879暴跌到0.549。原因不难理解:隐私信息(比如患者姓名、就诊日期)这种"重要"标准,本质上是一种法规定义的类别,不是靠语义相似性就能从几个例子里悟出来的规律,AI光看例子很难总结出"哪些数字模式属于个人隐私"这种带有法律色彩的判断标准。这提示我们,这套"用例子代替说明书"的思路,在语义类任务上很好使,但遇到需要外部规则知识的任务,可能还是得留一点点提示词的痕迹。

写在后面

读完这篇论文,最让我意外的地方不是Ens4的效果有多好,而是那个"随机策略"的角色设定。

我们通常默认,一个系统里的每个组件都应该尽可能强,弱的组件应该被淘汰或替换。但这篇论文用数学和实验一起告诉你,一个"弱但独立"的组件,价值可能高于一个"强但和别人重复"的组件。这跟很多团队管理、决策制定里的直觉是相通的:一群意见高度一致的专家聚在一起讨论,往往比不上三个专家加一个外行人一起讨论,因为外行人的错误不会和专家们的系统性盲区重叠。

另一个值得琢磨的地方是那个O(1/K)的边际递减证明。它给"要不要继续加更多模型/更多专家/更多角度"这个问题提供了一个可以量化的答案,而不是拍脑袋决定。很多实际工作中类似"多找几个人评审一下"的决策,背后其实都隐含着这种边际收益递减的规律,只是很少有人把它写成公式算清楚。

论文里还留了一个没有深挖的问题:如果把"平均"这种固定的融合方式,换成一种能根据具体样本动态调整权重的自适应方式,会不会进一步提升效果?作者在结尾提到这是未来可以做的方向,需要额外的标注数据来支撑。这让我好奇,一个"懂得什么时候该相信谁"的融合机制,是不是比"永远一视同仁地平均"更接近人类专家团队真实的协作方式。

Q&A

Q1:Conformal Relevance框架是什么?

A:这是论文提出的一套框架,用上下文学习示例代替人工编写的提示词,让大语言模型自己从标注好的例子中学习"什么是重要内容",再结合保形预测给出统计意义上的覆盖率保证,适用于摘要、问答、隐私检测等多种内容选择任务。

Q2:为什么要把四种不同的例子挑选策略平均起来,而不是选最好的一种?

A:因为论文证明了,当两个打分函数的"薄弱环节"(容易漏掉的重要内容)不重合时,平均它们的分数能让最终结果比单独使用任何一个都更强,这个现象叫互补性,实验显示满足该条件时提升几乎必然发生。

Q3:Ens4方法相比人工编写提示词效果提升了多少?

A:论文在七个横跨五个领域的数据集上测试,Ens4在保持同等覆盖率保证的前提下,比人工精心设计的提示词平均精度提升12%到59%不等,同时能多删除不相关内容,最多减少约50%的保留长度。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
葡萄牙快速官宣7号球衣新主人遭批!原因曝光:欧足联不允许空号

葡萄牙快速官宣7号球衣新主人遭批!原因曝光:欧足联不允许空号

风过乡
2026-10-01 19:29:58
续航776公里!特斯拉2款车新车,今天上市!

续航776公里!特斯拉2款车新车,今天上市!

电动内参
2026-10-01 17:55:24
央视怒批、戏子误国!这三位明星恶贯满盈,没有一个人值得同情!

央视怒批、戏子误国!这三位明星恶贯满盈,没有一个人值得同情!

秋姐居
2026-08-03 11:54:12
沪昆高速车祸致6死4伤 肇事驾驶员涉嫌疲劳驾驶

沪昆高速车祸致6死4伤 肇事驾驶员涉嫌疲劳驾驶

看看新闻Knews
2026-10-01 14:20:30
医生发现:大量喝茶的糖尿病患者,用不了多久,身体或有5大变化

医生发现:大量喝茶的糖尿病患者,用不了多久,身体或有5大变化

任医生聊健康
2026-09-30 17:20:08
扩军事宜敲定!NBA迎来两支新军,超音速回归,新军锁定状元签

扩军事宜敲定!NBA迎来两支新军,超音速回归,新军锁定状元签

体育大朋说
2026-10-01 14:20:16
利好突袭!刚刚,暴涨1600点

利好突袭!刚刚,暴涨1600点

中国基金报
2026-10-01 11:20:56
估值13.41亿!拟拿下第3家上市公司,“中国最大忽悠”要翻身了?

估值13.41亿!拟拿下第3家上市公司,“中国最大忽悠”要翻身了?

品牌观察官
2026-10-01 19:57:52
三方潜在交易!骑士拆东墙补西墙,送走阿伦,顶级锋线驰援哈登

三方潜在交易!骑士拆东墙补西墙,送走阿伦,顶级锋线驰援哈登

钱说体育
2026-10-01 12:44:57
日本防卫大臣狂言“不设禁忌讨论核武器和核潜艇”,外交部:“拥有核武器”不是日方想不想讨论的问题,没有讨价还价的余地

日本防卫大臣狂言“不设禁忌讨论核武器和核潜艇”,外交部:“拥有核武器”不是日方想不想讨论的问题,没有讨价还价的余地

每日经济新闻
2026-10-01 11:17:46
泽连斯基走出总统府,画面传到俄军指挥中心,基辅无秘密冒头就打

泽连斯基走出总统府,画面传到俄军指挥中心,基辅无秘密冒头就打

吃瓜小侦探
2026-10-01 18:53:55
起底中巅汽车“0公里二手车”骗局:短视频引流,招募背债人套贷,全款购车人拿不到“绿本”

起底中巅汽车“0公里二手车”骗局:短视频引流,招募背债人套贷,全款购车人拿不到“绿本”

时代周报
2026-09-30 20:52:06
卢璐讲述刘欢病情细节:从确诊到离世,跟骨病扛了十七个年头

卢璐讲述刘欢病情细节:从确诊到离世,跟骨病扛了十七个年头

晓肂爱八卦
2026-10-01 20:25:39
1-2韩国刚1夜!国足传来朱辰杰消息,徐彬说的很实在,毛伟杰伤情出炉

1-2韩国刚1夜!国足传来朱辰杰消息,徐彬说的很实在,毛伟杰伤情出炉

旧铁皮往南开
2026-10-01 18:14:20
俄罗斯邀请中国开发库页岛,中国应该拒绝,否则可能为他人做衣裳

俄罗斯邀请中国开发库页岛,中国应该拒绝,否则可能为他人做衣裳

世界地缘档案
2026-10-02 02:55:07
1-2输球后!主帅安东尼奥表态,新民晚报发声,韩国媒体OSEN热评

1-2输球后!主帅安东尼奥表态,新民晚报发声,韩国媒体OSEN热评

宝哥精彩赛事
2026-10-01 21:20:03
249美元的TicNote手表,不带手机也能记完整场会

249美元的TicNote手表,不带手机也能记完整场会

Ping值焦虑
2026-10-01 02:51:39
斯诺克最新战报!吴宜泽被零封优势归零,斯佳辉落后小特,袁思俊1-1!

斯诺克最新战报!吴宜泽被零封优势归零,斯佳辉落后小特,袁思俊1-1!

刘姚尧的文字城堡
2026-10-01 20:19:47
仅仅三天菲国内大乱,菲政府已向中国求助,盼中方出手助渡难关!

仅仅三天菲国内大乱,菲政府已向中国求助,盼中方出手助渡难关!

泠泠说史
2026-10-02 02:42:11
刚刚,GPT-6 Astra破解拿破仑百年悬案!217年密信曝光,信息量太大了

刚刚,GPT-6 Astra破解拿破仑百年悬案!217年密信曝光,信息量太大了

新智元
2026-10-01 18:16:34
2026-10-02 05:08:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10040文章数 569关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

桂林市文促会深夜发布致歉信:向阿丘诚恳致歉

头条要闻

桂林市文促会深夜发布致歉信:向阿丘诚恳致歉

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

健康
数码
本地
公开课
军事航空

刷酸祛痘,为什么有人翻车?

数码要闻

亚马逊发布全新Kindle:取消传统边框 正面屏幕实现全面平整化

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美防长宣布组建“自主作战司令部”

无障碍浏览 进入关怀版