网易首页 > 网易号 > 正文 申请入驻

答案抽取正确率达96.88%,xFinder断了大模型「作弊」的小心思

0
分享至


AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年,机器之心AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com

本文第一作者和通讯作者均来自上海算法创新研究院。其中,通讯作者李志宇博士毕业于中国人民大学计算机专业,并曾在阿里巴巴、小红书等互联网公司从事算法落地与研究工作,曾参与了包括千亿级商品知识图谱、用户图谱和舆情图谱的研发工作,累计发表论文四十余篇。李志宇当前在上海算法创新研究院大模型部门(由熊飞宇博士带领)负责整体的技术研发工作。研究院主页:https://www.iaar.ac.cn/

大语言模型(LLM)的迅速发展,引发了关于如何评估其公平性和可靠性的热议。

尽管现有的评估框架如 OpenCompass、LM Eval Harness 和 UltraEval 以及各种 Benchmark 推动了行业进步,但专注于这些评估框架核心组件可信度或可靠性度量的团队却为数不多。

近日,上海算法创新研究院和中国人民大学的研究团队发布了一篇名为《xFinder: Robust and Pinpoint Answer Extraction for Large Language Models》的论文。这篇论文深入分析了LLM评估框架的整体流程,重点评估了答案抽取器组件在大模型评估中的可靠性和一致性。

论文地址:

https://arxiv.org/abs/2405.11874

Github链接:

https://github.com/IAAR-Shanghai/xFinder

Huggingface链接:

https://huggingface.co/collections/IAAR-Shanghai/xfinder-664b7b21e94e9a93f25a8412

当前的评估框架主要依赖正则表达式(RegEx)来抽取答案,但这种方法存在明显缺陷。人工复核结果显示,其最佳抽取正确率仅为74.38%,评估结果极不可靠。

此外,RegEx方法容易被有意或无意地拟合,增加了「作弊」的可能性,从而影响评估结果的可靠性和一致性。下图展示了LLM评估框架中RegEx组件抽取错误的情况。

为了有效解决这一问题,上海算法创新研究院和中国人民大学的研究团队开发了一个名为 xFinder 的新模型,用于更准确地抽取关键答案。

xFinder 具有以下优势:

(1)不要求特定格式的答案输出,具备较强的答案抽取鲁棒性,抽取准确率高达95.18%,显著优于目前最佳LLM评估框架中的RegEx方法。

(2)支持多样化题型,能够将字母选择题自动转换为问答题,并支持不同题型的混排评估,从而降低测试者拟合题型的可能性。

方法介绍

xFinder的实现过程主要包括LLM响应内容的生成、KAF数据集的标注和xFinder的训练。为了实现 xFinder 模型的有效训练,团队构建了一个专门的数据集——关键答案查找(KAF)数据集。该数据集包含 26,900 个训练样本、4,961 个测试样本和 4,482 个泛化样本,涵盖多种评估任务。

大语言模型响应生成

首先,研究团队从现有的主要评估基准和报告中挑选了多个典型的评估任务数据集,这些任务被分类为四种类型:字母选项任务、短文本选项任务、分类标签任务和数学任务。

接着,团队使用不同系列的 LLM(如 Qwen、InternLM、ChatGLM 等)生成这些任务的数据对。通过多种 LLM,团队生成了丰富多样的数据对,为 xFinder 模型的训练提供了充分的数据支持。

自动标注与人工复核

团队使用了一种策略,从 LLM 响应中提取关键答案并将其用作标签,以构建高质量的 KAF 数据集。为提高训练集的标注效率,他们采用了半自动化流程,通过不同提示使用 GPT-4 生成了两组标注,并利用自一致性策略筛选出标注不一致的项和所有数学问题,提交给人工复查。为了确保测试集和泛化集的有效性和可靠性,所有标签都经过两轮手动注释。

训练 xFinder

为了增强 KAF 数据集的多样性和模型的泛化能力,研究团队采用了两种数据增强策略:

(1)模拟 LLM 响应:对 KAF 训练集中 50% 的字母选项问题进行修改,增加或删除一到两个选项,以模拟 LLM 的多样化响应。

(2)丰富提示形式:提取包含关键答案句子的 LLM 响应的 10%,替换其中的提示部分,例如将「The final answer is A」替换为「Based on the context of the question, A is the most likely answer」。

此外,团队使用 XTuner 工具和 QLoRA 方法,对 Llama 系列、Qwen 系列和 Gemma 系列等基座模型进行微调,最终获得 xFinder。

实验结果

该团队进行了广泛的实验,评估xFinder在不同任务上的表现,并与现有的RegEx方法进行了对比。

KAF 测试集上的结果

在 KAF 测试集上,xFinder-qwen1505 的平均提取准确率达到了 96.88%,显著高于最佳评估框架中的 RegEx 方法的 74.38%。

具体来看,xFinder-qwen1505 在字母选项任务中的提取准确率为 97.35%;在短文本选项任务中为 96.83%;在分类标签任务中为98.05%;在数学选项任务中为 92.76%。这些结果表明,xFinder 在各类任务中均表现出色,显著提升了评估的准确性和可靠性。

KAF 泛化集上的结果

在全新的 KAF 泛化集上(该泛化集使用了与 KAF 数据集中的训练集和测试集不同的 LLM 和测试任务生成的样例构造的),xFinder-qwen1505 展现了卓越的性能,平均提取准确率达到了 93.42%。

实验结果表明,xFinder 的表现不仅优于其他基于 RegEx 的评估框架,甚至显著优于 GPT-4,充分展示了其高鲁棒性和泛化能力。

在现实世界场景中的评估

研究团队使用 xFinder 和传统评估框架对 10 种 LLM 进行了综合评估。评估任务涵盖了 CommonsenseQA、BoolQ 和 GSM8K 等。通过对 10 种不同的 LLM 应用五种答案提取方案,进行了一系列对比实验。

概括起来,实验结果主要揭示了三个关键发现:

(1)同一模型在不同框架下的排名常常出现较大差异,难以准确反映模型的真实能力,显示出一致性较低。

(2)不同的 xFinder 在这些实验中显示出了高度的一致性,并且在提取答案的准确率上也超越了其他评测框架,表明 xFinder 是一种更加可靠的评测方法。

(3)与传统的字母选项设置相比,直接使用选项文本能显著提升排名的一致性,反映了字母选项设置的不稳定性。更多的细节和实验结果已在附录中展示,这些内容进一步证实了上述发现的有效性。

结语

总的来说,xFinder通过优化关键答案提取模块,提高了LLM评估的准确性和可靠性。实验结果表明,xFinder在多种任务上均表现出色,具备较高的鲁棒性和泛化能力。未来,该研究团队将继续优化xFinder,并研究其他评估关键问题,为LLM性能的可靠评估提供坚实基础。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
敲钟仅4天,宇树最大背锅侠出现,终于知道,王兴兴为什么黑脸了

敲钟仅4天,宇树最大背锅侠出现,终于知道,王兴兴为什么黑脸了

刘森森
2026-08-26 00:25:31
四川大学生范宗德确诊癌症,21岁长得帅气,因脚疼确诊,暴瘦20斤

四川大学生范宗德确诊癌症,21岁长得帅气,因脚疼确诊,暴瘦20斤

180视角
2026-08-25 10:53:45
马云太“鸡贼”了!多年前恒大夺冠庆功宴照片再登热搜:举杯瞬间,马云留意许家印的动作,观察对方是否举杯饮酒

马云太“鸡贼”了!多年前恒大夺冠庆功宴照片再登热搜:举杯瞬间,马云留意许家印的动作,观察对方是否举杯饮酒

火山詩话
2026-08-23 07:03:56
天涯老帖分享:低收入人群该怎样积累财富,网友:还好还能刷到!

天涯老帖分享:低收入人群该怎样积累财富,网友:还好还能刷到!

另子维爱读史
2026-08-25 19:59:13
事出反常必有妖?金晨赴美留学,荒唐一幕出现,圈内人自曝离开真相

事出反常必有妖?金晨赴美留学,荒唐一幕出现,圈内人自曝离开真相

徐云流浪中国
2026-08-25 17:42:35
日本想卡脖子,轮到董明珠上了

日本想卡脖子,轮到董明珠上了

南风窗
2026-08-25 14:00:51
太扎心了!“在上海断子绝孙简直就是家常便饭”,一句刺耳的网络吐槽,评论区炸锅

太扎心了!“在上海断子绝孙简直就是家常便饭”,一句刺耳的网络吐槽,评论区炸锅

火山詩话
2026-08-25 16:18:38
北京恭王府旁2.6亿元四合院流拍:买家需自行承担35户租户腾退

北京恭王府旁2.6亿元四合院流拍:买家需自行承担35户租户腾退

界面新闻
2026-08-25 18:37:16
唐师曾走了,芙蓉姐姐也身患重病...

唐师曾走了,芙蓉姐姐也身患重病...

新动察
2026-08-25 10:49:04
6架中国空军歼-16重型战斗机降落在埃及,最慌的会是谁?

6架中国空军歼-16重型战斗机降落在埃及,最慌的会是谁?

浯江孤舟
2026-08-24 10:13:32
要跑!扶老人店主搬空牌桌,房东称店主恐转让店铺,官方证实无责

要跑!扶老人店主搬空牌桌,房东称店主恐转让店铺,官方证实无责

蜜桔娱乐
2026-08-25 14:19:47
后续!湖南扶老人被索赔10万舆论升级:完整视频曝光,发布者全是媒体,协调方担责跑不了

后续!湖南扶老人被索赔10万舆论升级:完整视频曝光,发布者全是媒体,协调方担责跑不了

李晚书
2026-08-25 08:02:04
难以置信!东莞一工厂接连放假5年,发工资不裁员,目前已通知放到2027年,再度引发热议

难以置信!东莞一工厂接连放假5年,发工资不裁员,目前已通知放到2027年,再度引发热议

火山詩话
2026-08-25 10:30:32
重庆渝中警方:两名行人在嘉滨路疑似触电,已被送医全力救治

重庆渝中警方:两名行人在嘉滨路疑似触电,已被送医全力救治

澎湃新闻
2026-08-26 05:53:03
西方为何痛批中国治沙?真相曝光:动了的不是沙子,是老外奶酪!

西方为何痛批中国治沙?真相曝光:动了的不是沙子,是老外奶酪!

史之铭
2026-08-25 17:15:36
炸裂!许家印被员工爆出猛料

炸裂!许家印被员工爆出猛料

财经三分钟pro
2026-08-25 15:36:20
一家6口挤在出租屋 妻子打赏男主播近30万 丈夫:男主播叫她“姐姐”,她打赏他1576次

一家6口挤在出租屋 妻子打赏男主播近30万 丈夫:男主播叫她“姐姐”,她打赏他1576次

封面新闻
2026-08-25 14:49:06
5张高清照片,定格了一名落单志愿军战士被俘全过程

5张高清照片,定格了一名落单志愿军战士被俘全过程

小莜读史
2026-08-24 08:23:18
男子送外卖遇车祸去世,DNA鉴定8岁儿子非亲生,家人索赔19.5万抚养费败诉,申请再审已立案审查

男子送外卖遇车祸去世,DNA鉴定8岁儿子非亲生,家人索赔19.5万抚养费败诉,申请再审已立案审查

大风新闻
2026-08-25 23:19:15
25岁在韩失踪中国女生确认遇害,警方:嫌疑人在女孩失去联系次日自称“男友”报假警

25岁在韩失踪中国女生确认遇害,警方:嫌疑人在女孩失去联系次日自称“男友”报假警

红星新闻
2026-08-25 23:31:26
2026-08-26 07:51:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13843文章数 142725关注度
往期回顾 全部

科技要闻

机器人跑赢博尔特,身体太快,脑子还在追

头条要闻

赴韩遇害中国女生年仅25岁 原计划2天前入职新单位

头条要闻

赴韩遇害中国女生年仅25岁 原计划2天前入职新单位

体育要闻

穆里尼奥如何摆贝林修斯姆巴佩?

娱乐要闻

张韶涵成都演唱会中暑,中途吸氧

财经要闻

宇树科技最低跌破600元 5天缩水超2000亿

汽车要闻

硬派越野+华为智驾 泰钽700上市焕新价24.98万起

态度原创

亲子
游戏
时尚
教育
旅游

亲子要闻

你天天吃零食,你孩子能不吃吗?家长要做榜样!言传身教!

《GTA6》再泄露!游戏货架摆满JS8主机 还有实体盘

出道8年成顶流,却在最红最美时退圈,为什么她至今仍是无数人的白月光?

教育要闻

近日,南京多校家长会透露…

旅游要闻

“我们脚下的道路通向中国”(我和中国的故事)

无障碍浏览 进入关怀版