网易首页 > 网易号 > 正文 申请入驻

港中文&华为联合提出首个大模型推理可靠性评估基准

0
分享至

本文作者是香港中文大学博士三年级薛博阳,导师为黄锦辉教授,目前在伦敦大学学院进行访问交流,他的研究方向包括可信大模型,模型不确定性,对话系统等,在 ACL, EMNLP, TASLP 等会议期刊作为第一作者发表多篇论文,并长期在知乎写作大模型、机器学习等专栏文章,个人主页为:

https://amourwaltz.github.io

研究问题

面对无解问题最强模型也会束手无策?

今年初以 DeepSeek-r1 为代表的大模型在推理任务上展现强大的性能,引起广泛的热度。然而在面对一些无法回答或本身无解的问题时,这些模型竟试图去虚构不存在的信息去推理解答,生成了大量的事实错误、无意义思考过程和虚构答案,也被称为模型「幻觉」 问题,如下图(a)所示,造成严重资源浪费且会误导用户,严重损害了模型的可靠性(Reliability)。

对于复杂的推理任务,一个可靠的模型应当在思考分析后,对可解问题给出正确答案,对不可解问题则指出无解;如果问题超出模型能力范围无法判断可解性,一个次优的选择就是拒答以避免误导用户,如上图(b)和(c)所示,这样回复才是可靠的,同时也能抑制幻觉发生。

近期由港中文和华为诺亚实验室联合提出的ReliableMath基准,旨在探究大模型推理任务的可靠性。该工作文章和数据集均已开源,并持续在 leaderboard 上更新最新模型结果,目前已新增了 Qwen3、豆包、Gemini 等一系列模型的可靠性测试结果,欢迎大家关注补充~

  • 论文题目:ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
  • 论文作者:Boyang Xue, Qi Zhu, Rui Wang, Sheng Wang, Hongru Wang, Fei Mi, Yasheng Wang, Lifeng Shang, Qun Liu, Kam-Fai Wong
  • 论文地址:https://arxiv.org/pdf/2507.03133
  • GitHub 地址:https://github.com/AmourWaltz/ReliableMath
  • 数据集地址:https://huggingface.co/datasets/BeyondHsueh/ReliableMath
  • Leaderboard 地址:https://huggingface.co/spaces/BeyondHsueh/ReliableMath-Leaderboard

可靠性评估准则

知之为知之,不知为不知,是知也

此前大模型可靠性的研究集中在知识任务上,探究是否知道某个知识,缺乏对更难的推理任务的探索。由于推理问题本身可能无解,并且问题可解性以及模型能否回答都需要经过推理才能得出,增加了研究挑战。

根据前文对推理任务可靠性的定义,本工作提出一套推理任务可靠性的评估准则,如下图所示,将问题分为可解(A)和不可解(U),将模型回复分为成功(S),拒答(R)和失败(F)。成功表示对可解问题匹配到正确答案或对不可解问题指出其无解,这是最好的情况;次优是拒答,即对可解和不可解问题都回复我不知道;其余回复均认为是失败。

分别使用精度(Prec.)和谨慎度(Prud.)来表示成功率和拒答率,评估可靠性时优先看精度,其次看谨慎度。

ReliableMath 数据集

首个高质量数学无解问题集

由于缺乏无解的数学问题,本文提出一个评估数学推理可靠性的数据集 ReliableMath,包含可解和不可解的问题。可解问题从当前开源数学问题集中收集,不可解问题通过对可解问题进行改写构造获得,改写方式有两种:删除必要数学条件或增加与已知条件矛盾的条件,如下图所示。

为了得到高质量的无解问题,本文提出一套完整的无解解问题构造流程,如下图所示,包含三步:1)通过对现有可解问题进行改写使其不可解;2)对改写问题使用模型验证,并过滤掉不合格的问题;3)对过滤数据再次进行人工验证评估问题是否无解,保留确实无解的问题,这样就得到了高质量的无解问题构成 ReliableMath 数据集。

ReliableMath 包含不同难度的数学任务,包括奥赛级的 AIME、AMC、Minerva、及高中级的 MATH。人工标注时,对判断问题无解的难度也进行了标注,对那些很容易判断出无解的,比如几何题缺失图片信息等,难度标为 0,而对于需要经过思考才能判断无解的,难度标为 1,数据统计可参考原文。

实验分析

揭示大模型推理可靠性的缺陷

本文在一系列慢思考和快思考模型上做了实验,并指出以下几条关键发现:

  1. 对模型直接输入无解问题时(standard prompt),模型几乎不具备拒答或指出不可解的能力,可靠性极差;我们发现模型能注意到无解问题本身存在问题,但不敢承认其无解或拒答,反而是会不断地回溯、反思导致生成大量无意义的思考过程,直到截断或虚构一个答案,造成严重浪费和幻觉,损害了可靠性;
  2. 当在提示词中加入允许模型拒答或指出问题无解的指令后(reliable prompt),我们发现在可解问题上的可靠性变化不大,但大部分模型在不可解问题上可靠性有明显提升,尽管仍低于可解问题的可靠性,并且生成序列长度也有明显下降,说明使用 reliable prompt 可以在不损害可解问题性能的前提下,提高不可解问题的可靠性,并减少过度思考。
  3. 对较大的模型,使用 reliable prompt 后慢思考模型的可靠性普遍高于对应快思考模型,如 Deepseek-r1 vs. Deepseek-v3;而对于小模型,使用 reliable prompt 后慢思考模型在不可解问题上的可靠性仍然很差,并没有高于对应的快思考模型,如 Distill-7b vs. Qwen-7b,意味着小模型可靠性有进一步提升空间。
  4. 较简单的数学测试集的可靠性要高于较难的测试集的可靠性。

此外,本文也对 ReliableMath 数据集做了分析,下图(a)分别测试了使用移除必要条件和增加矛盾条件两种改写方式构造的问题的可靠性,结果表明移除条件构造的不可解问题可靠性偏低,这是因为模型倾向于假设缺失条件虚构答案。图(b)分别展示了不同难度的无解问题的可靠性,发现难度为 1 的不可解问题可靠性偏低,即这些问题需要模型经过推理才能发现问题无解,这种情况更难也符合预期,说明大模型与人类在识别问题无解难度的相关性是一致的,尽管人工评估难度存在主观性。

可靠性对齐

如何提高大模型可靠性?

本文最后提出一个提高可靠性的对齐策略,在开源训练集上构造一批无解问题。在较强的模型上蒸馏获得成功回复,然后在小模型上自采样获得拒答回复,最后使用监督学习训练小模型提升可靠性,如下图所示。经过对齐后,小模型的可靠性也得到显著提升。

结语和展望

本文提出首个大模型推理任务的可靠性基准,希望借此抛砖引玉,引出更多对新生代推理模型可靠性的关注和优秀工作,让人们更加信任模型的输出,让 AI 更好地服务于人类~

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
电动车限速:一场注定失败的执法运动

电动车限速:一场注定失败的执法运动

多村来信
2026-08-10 23:07:05
海南危险货物瞒报曝光人:希望彻查背后的利益链条

海南危险货物瞒报曝光人:希望彻查背后的利益链条

第一财经资讯
2026-08-11 21:19:38
男童被巨浪卷走后续,官媒怒批家属,当地不敢救,救了也必死无疑

男童被巨浪卷走后续,官媒怒批家属,当地不敢救,救了也必死无疑

社会日日鲜
2026-08-11 09:21:27
胖东来把全国房东都干懵了!

胖东来把全国房东都干懵了!

贩财局
2026-08-11 16:28:26
2026年了,为什么国家突然要再扫一年黑?

2026年了,为什么国家突然要再扫一年黑?

李博世财经
2026-08-11 09:51:22
不装了,百花奖没到手,当场“甩脸”的杨幂,不再顾及所谓的体面

不装了,百花奖没到手,当场“甩脸”的杨幂,不再顾及所谓的体面

阿笎评论哥
2026-08-11 14:06:17
伊朗战事致巴拿马运河拥堵,有船支付接近历史最高的400万美元“插队”

伊朗战事致巴拿马运河拥堵,有船支付接近历史最高的400万美元“插队”

界面新闻
2026-08-12 09:47:06
WTT瑞典大满贯:大爆冷!男单头号种子0:3一轮游,被扣2000分

WTT瑞典大满贯:大爆冷!男单头号种子0:3一轮游,被扣2000分

国乒二三事
2026-08-12 03:50:21
男子朋友圈评教体局长被拘4日续:当事人要求公开办案人员处理结果被拒后发起行政诉讼 法院驳回

男子朋友圈评教体局长被拘4日续:当事人要求公开办案人员处理结果被拒后发起行政诉讼 法院驳回

红星新闻
2026-08-11 23:10:00
扛不住了!佛山一房东手握28栋自有公寓,主动下调租金,单间低至299元,明确水电收费标准,宣布退租押金全额退还

扛不住了!佛山一房东手握28栋自有公寓,主动下调租金,单间低至299元,明确水电收费标准,宣布退租押金全额退还

火山詩话
2026-08-12 07:54:27
6项军方任命,全员鹰派!穆杰塔巴关键时刻全面更新军方领导层意欲何为

6项军方任命,全员鹰派!穆杰塔巴关键时刻全面更新军方领导层意欲何为

红星新闻
2026-08-11 15:41:16
世界杯夺冠英雄 5000万送走!巴萨离队第7人敲定 只差官宣

世界杯夺冠英雄 5000万送走!巴萨离队第7人敲定 只差官宣

叶青足球世界
2026-08-12 09:00:44
仰拍裙底+胸部特写,41岁女星AI擦边惹众怒!本人回应,网友炸了

仰拍裙底+胸部特写,41岁女星AI擦边惹众怒!本人回应,网友炸了

头号电影院
2026-08-11 08:54:30
缺席审判,阿萨德被判死刑!

缺席审判,阿萨德被判死刑!

每日经济新闻
2026-08-11 19:16:07
广东24岁美女姜小柔去世!砸观音荒地钉八字,知情人曝死因属横祸

广东24岁美女姜小柔去世!砸观音荒地钉八字,知情人曝死因属横祸

米果说识
2026-08-11 10:12:53
话题度拉满!NBA公布揭幕战+圣诞大战赛程:詹姆斯将战湖人

话题度拉满!NBA公布揭幕战+圣诞大战赛程:詹姆斯将战湖人

全景体育V
2026-08-11 20:34:41
张本美和夺冠后,孙颖莎霸气发声

张本美和夺冠后,孙颖莎霸气发声

最爱乒乓球
2026-08-12 01:19:18
注意防范!暴雨橙色预警持续 河南等地雨势猛烈

注意防范!暴雨橙色预警持续 河南等地雨势猛烈

国际在线
2026-08-12 07:39:18
卫诗雅爆冷拿下百花影后孤身离场!全场只有朱一龙送上拥抱太戳人

卫诗雅爆冷拿下百花影后孤身离场!全场只有朱一龙送上拥抱太戳人

阿废冷眼观察所
2026-08-12 04:26:53
李嘉诚,再一次大撤退!他嗅到了什么?

李嘉诚,再一次大撤退!他嗅到了什么?

包不同
2026-08-12 00:41:01
2026-08-12 10:07:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13733文章数 142718关注度
往期回顾 全部

科技要闻

AI大战变天:扎克伯格突然回头

头条要闻

"我听交警的"事件最新进展:逆行女子被判道歉并赔偿

头条要闻

"我听交警的"事件最新进展:逆行女子被判道歉并赔偿

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

陈思诚恋情疑云再起

财经要闻

李嘉诚,再一次大撤退!他嗅到了什么?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

艺术
教育
健康
房产
军事航空

艺术要闻

色彩的盛宴,视觉的狂欢:西班牙水彩大师福斯蒂诺·马丁·冈萨雷斯的艺术世界

教育要闻

AI时代下的硅谷创新学校:每天学习2小时,成绩全美前1%

心血管专家破解猝死八大谣言

房产要闻

突发,崖州湾又有大动作!

军事要闻

通过“毕业大考” 湖北舰“持证上岗”

无障碍浏览 进入关怀版