网易首页 > 网易号 > 正文 申请入驻

港中文&华为联合提出首个大模型推理可靠性评估基准

0
分享至

本文作者是香港中文大学博士三年级薛博阳,导师为黄锦辉教授,目前在伦敦大学学院进行访问交流,他的研究方向包括可信大模型,模型不确定性,对话系统等,在 ACL, EMNLP, TASLP 等会议期刊作为第一作者发表多篇论文,并长期在知乎写作大模型、机器学习等专栏文章,个人主页为:

https://amourwaltz.github.io

研究问题

面对无解问题最强模型也会束手无策?

今年初以 DeepSeek-r1 为代表的大模型在推理任务上展现强大的性能,引起广泛的热度。然而在面对一些无法回答或本身无解的问题时,这些模型竟试图去虚构不存在的信息去推理解答,生成了大量的事实错误、无意义思考过程和虚构答案,也被称为模型「幻觉」 问题,如下图(a)所示,造成严重资源浪费且会误导用户,严重损害了模型的可靠性(Reliability)。

对于复杂的推理任务,一个可靠的模型应当在思考分析后,对可解问题给出正确答案,对不可解问题则指出无解;如果问题超出模型能力范围无法判断可解性,一个次优的选择就是拒答以避免误导用户,如上图(b)和(c)所示,这样回复才是可靠的,同时也能抑制幻觉发生。

近期由港中文和华为诺亚实验室联合提出的ReliableMath基准,旨在探究大模型推理任务的可靠性。该工作文章和数据集均已开源,并持续在 leaderboard 上更新最新模型结果,目前已新增了 Qwen3、豆包、Gemini 等一系列模型的可靠性测试结果,欢迎大家关注补充~

  • 论文题目:ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
  • 论文作者:Boyang Xue, Qi Zhu, Rui Wang, Sheng Wang, Hongru Wang, Fei Mi, Yasheng Wang, Lifeng Shang, Qun Liu, Kam-Fai Wong
  • 论文地址:https://arxiv.org/pdf/2507.03133
  • GitHub 地址:https://github.com/AmourWaltz/ReliableMath
  • 数据集地址:https://huggingface.co/datasets/BeyondHsueh/ReliableMath
  • Leaderboard 地址:https://huggingface.co/spaces/BeyondHsueh/ReliableMath-Leaderboard

可靠性评估准则

知之为知之,不知为不知,是知也

此前大模型可靠性的研究集中在知识任务上,探究是否知道某个知识,缺乏对更难的推理任务的探索。由于推理问题本身可能无解,并且问题可解性以及模型能否回答都需要经过推理才能得出,增加了研究挑战。

根据前文对推理任务可靠性的定义,本工作提出一套推理任务可靠性的评估准则,如下图所示,将问题分为可解(A)和不可解(U),将模型回复分为成功(S),拒答(R)和失败(F)。成功表示对可解问题匹配到正确答案或对不可解问题指出其无解,这是最好的情况;次优是拒答,即对可解和不可解问题都回复我不知道;其余回复均认为是失败。

分别使用精度(Prec.)和谨慎度(Prud.)来表示成功率和拒答率,评估可靠性时优先看精度,其次看谨慎度。

ReliableMath 数据集

首个高质量数学无解问题集

由于缺乏无解的数学问题,本文提出一个评估数学推理可靠性的数据集 ReliableMath,包含可解和不可解的问题。可解问题从当前开源数学问题集中收集,不可解问题通过对可解问题进行改写构造获得,改写方式有两种:删除必要数学条件或增加与已知条件矛盾的条件,如下图所示。

为了得到高质量的无解问题,本文提出一套完整的无解解问题构造流程,如下图所示,包含三步:1)通过对现有可解问题进行改写使其不可解;2)对改写问题使用模型验证,并过滤掉不合格的问题;3)对过滤数据再次进行人工验证评估问题是否无解,保留确实无解的问题,这样就得到了高质量的无解问题构成 ReliableMath 数据集。

ReliableMath 包含不同难度的数学任务,包括奥赛级的 AIME、AMC、Minerva、及高中级的 MATH。人工标注时,对判断问题无解的难度也进行了标注,对那些很容易判断出无解的,比如几何题缺失图片信息等,难度标为 0,而对于需要经过思考才能判断无解的,难度标为 1,数据统计可参考原文。

实验分析

揭示大模型推理可靠性的缺陷

本文在一系列慢思考和快思考模型上做了实验,并指出以下几条关键发现:

  1. 对模型直接输入无解问题时(standard prompt),模型几乎不具备拒答或指出不可解的能力,可靠性极差;我们发现模型能注意到无解问题本身存在问题,但不敢承认其无解或拒答,反而是会不断地回溯、反思导致生成大量无意义的思考过程,直到截断或虚构一个答案,造成严重浪费和幻觉,损害了可靠性;
  2. 当在提示词中加入允许模型拒答或指出问题无解的指令后(reliable prompt),我们发现在可解问题上的可靠性变化不大,但大部分模型在不可解问题上可靠性有明显提升,尽管仍低于可解问题的可靠性,并且生成序列长度也有明显下降,说明使用 reliable prompt 可以在不损害可解问题性能的前提下,提高不可解问题的可靠性,并减少过度思考。
  3. 对较大的模型,使用 reliable prompt 后慢思考模型的可靠性普遍高于对应快思考模型,如 Deepseek-r1 vs. Deepseek-v3;而对于小模型,使用 reliable prompt 后慢思考模型在不可解问题上的可靠性仍然很差,并没有高于对应的快思考模型,如 Distill-7b vs. Qwen-7b,意味着小模型可靠性有进一步提升空间。
  4. 较简单的数学测试集的可靠性要高于较难的测试集的可靠性。

此外,本文也对 ReliableMath 数据集做了分析,下图(a)分别测试了使用移除必要条件和增加矛盾条件两种改写方式构造的问题的可靠性,结果表明移除条件构造的不可解问题可靠性偏低,这是因为模型倾向于假设缺失条件虚构答案。图(b)分别展示了不同难度的无解问题的可靠性,发现难度为 1 的不可解问题可靠性偏低,即这些问题需要模型经过推理才能发现问题无解,这种情况更难也符合预期,说明大模型与人类在识别问题无解难度的相关性是一致的,尽管人工评估难度存在主观性。

可靠性对齐

如何提高大模型可靠性?

本文最后提出一个提高可靠性的对齐策略,在开源训练集上构造一批无解问题。在较强的模型上蒸馏获得成功回复,然后在小模型上自采样获得拒答回复,最后使用监督学习训练小模型提升可靠性,如下图所示。经过对齐后,小模型的可靠性也得到显著提升。

结语和展望

本文提出首个大模型推理任务的可靠性基准,希望借此抛砖引玉,引出更多对新生代推理模型可靠性的关注和优秀工作,让人们更加信任模型的输出,让 AI 更好地服务于人类~

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
马化腾和姚顺雨同框,传递了什么信号?

马化腾和姚顺雨同框,传递了什么信号?

澎湃新闻
2026-10-10 13:52:27
尊界制动踏板支架断裂后,岚图、本田、仰望等多家车企高管晒自家刹车部件

尊界制动踏板支架断裂后,岚图、本田、仰望等多家车企高管晒自家刹车部件

澎湃新闻
2026-10-10 10:54:30
连参保都需要动员,到底哪出了问题?

连参保都需要动员,到底哪出了问题?

凤眼论
2026-10-10 16:49:01
塔利班在莫斯科当众掀桌,拒签联合声明!对华对俄的态度判若两人

塔利班在莫斯科当众掀桌,拒签联合声明!对华对俄的态度判若两人

麓谷隐士
2026-10-10 00:10:04
赵祥松|踩断的不是刹车,是荒诞的盛世

赵祥松|踩断的不是刹车,是荒诞的盛世

祥松谈
2026-10-08 20:09:37
随着莫雷加德0-4,WTT中国大满贯男单4强全部诞生:3大前十悍将在列

随着莫雷加德0-4,WTT中国大满贯男单4强全部诞生:3大前十悍将在列

侧身凌空斩
2026-10-10 14:48:13
天津一公司男领导给女下属发送淫秽露骨照片,母亲上门讨说法,知情人:事发隔壁公司,女孩可能刚毕业,性格比较腼腆,后续有民警到场处理

天津一公司男领导给女下属发送淫秽露骨照片,母亲上门讨说法,知情人:事发隔壁公司,女孩可能刚毕业,性格比较腼腆,后续有民警到场处理

潇湘晨报
2026-10-10 16:49:10
车企证实收到中汽中心对制动踏板总成材质调研问卷 业内:或推动行业标准修订

车企证实收到中汽中心对制动踏板总成材质调研问卷 业内:或推动行业标准修订

红星资本局
2026-10-10 16:42:09
WTT中国大满贯:大爆冷!男单头号种子1:4被淘汰,无缘世界第1

WTT中国大满贯:大爆冷!男单头号种子1:4被淘汰,无缘世界第1

国乒二三事
2026-10-10 15:23:54
男子捉奸后收费改判无罪续:申请四百余万国赔,含父亲丧葬费

男子捉奸后收费改判无罪续:申请四百余万国赔,含父亲丧葬费

南方都市报
2026-10-10 15:29:14
WTT中国大满贯:世界第1输球!决赛1:3无缘冠军,王曼昱冲击双冠

WTT中国大满贯:世界第1输球!决赛1:3无缘冠军,王曼昱冲击双冠

国乒二三事
2026-10-10 15:02:26
英明领袖被虏走,经济反而高增长,像极了那一年……

英明领袖被虏走,经济反而高增长,像极了那一年……

家传编辑部
2026-10-10 10:21:00
仍然晕削球!陈幸同连丢4局遭逆转,佐藤瞳成日乒首位WTT大满贯女单决赛球员

仍然晕削球!陈幸同连丢4局遭逆转,佐藤瞳成日乒首位WTT大满贯女单决赛球员

乒谈
2026-10-10 18:53:37
警方通报国乒男队主教练王皓被围堵辱骂:杨某某(女,19岁)、李某(女,19岁)、陶某某(女,16岁)被行政拘留,其他17人被批评教育

警方通报国乒男队主教练王皓被围堵辱骂:杨某某(女,19岁)、李某(女,19岁)、陶某某(女,16岁)被行政拘留,其他17人被批评教育

极目新闻
2026-10-10 10:48:44
10月10日,人社部发布会公布重要消息,提到2026年养老金调整吗?

10月10日,人社部发布会公布重要消息,提到2026年养老金调整吗?

虎哥闲聊
2026-10-10 11:44:23
15元9斤蜜薯遭“仅退款”,买家称“有本事就过来拿”,商家连夜跨省驱车800公里,仅取回3斤

15元9斤蜜薯遭“仅退款”,买家称“有本事就过来拿”,商家连夜跨省驱车800公里,仅取回3斤

界面新闻
2026-10-10 13:27:54
人均身高不足1.7米,为何高铁站要修60米高?面子工程又一体现?

人均身高不足1.7米,为何高铁站要修60米高?面子工程又一体现?

抽象派大师
2026-10-10 00:53:21
尊界刹车踏板三连断:聊天记录曝出,供应商给的是3000N,设计做了让步

尊界刹车踏板三连断:聊天记录曝出,供应商给的是3000N,设计做了让步

互联网大观
2026-10-09 19:29:12
普京与特朗普通话,“没人愿意先挂电话”!除了战争、柴油,他们还热聊了啥

普京与特朗普通话,“没人愿意先挂电话”!除了战争、柴油,他们还热聊了啥

红星新闻
2026-10-10 14:04:09
A股:重磅传来,证监会出手,释放强烈信号!下周一将迎新的变化

A股:重磅传来,证监会出手,释放强烈信号!下周一将迎新的变化

虎哥闲聊
2026-10-10 13:17:33
2026-10-10 20:00:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14169文章数 142748关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

两名中国男子赴泰旅游失联 乘车"报平安"的背景是树林

头条要闻

两名中国男子赴泰旅游失联 乘车"报平安"的背景是树林

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

宋佳一串三大满贯 争议随之而来

财经要闻

双汇因抗生素超标共被罚1.29亿元

汽车要闻

二十载再越巅峰 第五代全新别克君越今日正式上市

态度原创

本地
旅游
房产
教育
艺术

本地新闻

踏访沙县第一村,寻国民小吃本源

旅游要闻

【图见贵阳】假期落幕,甲秀楼依旧游人如织

房产要闻

海棠湾销冠再出牌:海南顶豪「终局答案」,突然砸出!

教育要闻

真不愧是学霸题,连大学生家长都要想半天

艺术要闻

九成书家没见过的“草书秘诀”,还原章草失传秘法,零基础也能看得懂!

无障碍浏览 进入关怀版