网易首页 > 网易号 > 正文 申请入驻

清华、上海AI Lab 23K数据让1.5B小模型逆袭GPT-4o

0
分享至

赵俭,北京邮电大学本科三年级,研究方向为大语言模型。刘润泽,清华大学硕士二年级,师从李秀教授,研究方向为大语言模型与强化学习,特别关注大模型推理能力增强与测试时间扩展,在 NeurIPS、ICML、ICLR、AAAI 等顶级学术会议发表多篇论文,个人主页:ryanliu112.github.io。

随着 OpenAI o1 和 DeepSeek R1 的爆火,大语言模型(LLM)的推理能力增强和测试时扩展(TTS)受到广泛关注。然而,在复杂推理问题中,如何精准评估模型每一步回答的质量,仍然是一个亟待解决的难题。传统的过程奖励模型(PRM)虽能验证推理步骤,但受限于标量评分机制,难以捕捉深层逻辑错误,且其判别式建模方式限制了测试时的拓展能力。

那么,是否有办法通过测试时拓展提升过程奖励模型的过程监督推理能力呢?

为此,清华大学联合上海 AI Lab 提出生成式过程奖励模型 ——GenPRM,将生成式思维链推理(CoT)与代码验证相结合,并引入测试时拓展机制,为过程监督推理提供了新思路。与 DeepSeek 近期发布的逐点生成奖励模型(GRM)类似,GenPRM 也通过生成式建模和测试时扩展增强奖励模型的推理能力,但 GenPRM 更专注于过程奖励模型,弥补了 GRM 在过程监督方面的不足。

论文标题:GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning

论文链接:http://arxiv.org/abs/2504.00891

项目链接:https://ryanliu112.github.io/GenPRM

GitHub:https://github.com/RyanLiu112/GenPRM

HuggingFace:https://huggingface.co/GenPRM

在 ProcessBench 等数学推理基准的测试中,GenPRM 展现出惊人实力:仅 1.5B 参数的模型通过测试时扩展超越 GPT-4o,而 7B 参数版本更是击败 72B 参数的 Qwen2.5-Math-PRM-72B,同时表现出强大的步骤级批评能力。

GenPRM:从评分到推理,再到测试时扩展

现有过程奖励模型依赖分类器式的标量评分,这种 “黑箱” 机制导致两个核心问题:一是无法解释错误根源,仅能判断步骤 “对错”,却无法解释 “为何错”,二是无法通过增加模型测试时间计算资源提升判断精度。

生成式过程奖励模型

为了突破这些瓶颈,GenPRM 引入生成式设计,彻底革新过程监督范式:

思维链推理:GenPRM 模拟人类解题时的逻辑推导,对每一步推理进行自然语言分析,提供透明、可解释的步骤评估。

代码验证:为确保推理的可靠性,GenPRM 还会生成并执行对应数学运算的 Python 代码,将文字推导与实际计算结果交叉验证。例如,在求解三角函数表达式时,模型先分析角度转换的合理性,再通过代码计算具体数值,避免 “符号推导正确但计算失误” 的情况。

其奖励推理过程可以表示为:

其中 s_t 为当前状态,a_t 为当前步骤,v_1:t−1 和 f_1:t-1 分别为之前步骤的推理过程和代码执行反馈,v_t 和 f_t 为当前步骤的推理与反馈。这种 “先解释、再验证” 的机制不仅能判断对错,还能提供步骤级别的批评改进建议和严谨准确的反馈,大幅提升了过程监督的深度和实用性。

测试时扩展

在推理阶段,GenPRM 通过并行采样 N 条推理路径,综合多条路径的奖励值并取平均,得到最终奖励:

这种策略充分利用额外计算资源,进一步提升评估精度,使小模型也能在复杂任务中表现出色。

数据高效:23K 样本背后的合成秘密

GenPRM 的另一个亮点是仅使用 23K 训练样本就取得了优异的性能,远少于许多模型动辄数十万级的数据量(如 PRM800K 需 80 万人工标注),其高效性源于独特的数据合成方法,结合相对进步估计(RPE)和代码验证,生成高质量的过程监督数据。

通过相对进步估计改进硬估计

传统过程奖励模型通过蒙特卡罗(MC)分数进行硬估计,研究者观察到尽管许多步骤的 MC 分数大于 0,但这些步骤是却存在错误。RPE 通过比较当前状态和上一状态的 MC 分数,用 “进步幅度” 评估每步质量,比传统硬标签更准确。其形式化如下:

其中,MC (s_t, a_t) 表示当前步骤的蒙特卡罗分数,MC (s_t) 表示上一步骤的蒙特卡罗分数。若进步幅度低于阈值(ϵ=0.8),则判定步骤无效;若首步错误(MC 为 0),后续步骤分数归零。这种方法显著提升标签准确性,避免了硬估计的误判。

代码验证驱动的数据合成

研究者利用 QwQ-32B 模型合成 CoT 和代码验证推理数据,通过在 Python 环境中真实执行代码重复检验 CoT 推理过程。使用共识过滤(过滤率 51%),保留高质量过程监督数据,最终得到 23K 训练数据集。

测试时扩展:小模型的逆袭

在 ProcessBench 过程监督基准测试中,GenPRM 展现出显著优势:

仅用 23K 训练数据的 1.5B GenPRM,通过多数投票(Maj@8)的测试时计算扩展策略,其 F1 分数超越 GPT-4o;

7B 版本的 GenPRM 以 80.5% 的 F1 分数一举超过 72B 参数的 Qwen2.5-Math-PRM-72B。

这一结果证明,测试时扩展能有效放大过程奖励模型的能力,使小模型实现性能飞跃。

此外,GenPRM 同样适用于策略模型测试时扩展。通过 Best-of-N 实验,GenPRM-7B 展现出相比于基线方法更加优异的筛选能力,并可通过测试时扩展进一步增强过程监督能力。

从验证器到批评者:过程奖励模型新范式

GenPRM 不仅能当 “裁判”,作为验证器(Verifier)筛选答案,还能当 “教练”,作为步骤级别的批评模型(Critic)指导策略模型迭代优化原始回答。实验表明,GenPRM 通过 3 轮反馈将策略模型的回答准确率从 45.7% 提升至 51.5%,性能提升达到基线方法的 3.4 倍。

这种 “生成 - 批评 - 反思” 的闭环,验证了 GenPRM 不仅可以作为验证器验证答案的准确性,还可以作为批评者,为模型完善自身输出提供逐步关键指导,为大语言模型的自我改进提供了可解释的技术路径。

研究者已开源代码、模型及 23K 训练数据集。该工作为大语言模型的可解释过程监督提供了新思路,未来可扩展至代码生成、多模态推理等领域。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
2026 养老金不涨、7 月补发取消?官方真相说透,别再白等吃亏?

2026 养老金不涨、7 月补发取消?官方真相说透,别再白等吃亏?

白昼说故事
2026-07-29 10:06:44
小米,这是来砸场子...

小米,这是来砸场子...

放毒
2026-07-28 17:52:18
当国企工人失去主人翁地位:从上到下,全员开始吃工人的人血馒头

当国企工人失去主人翁地位:从上到下,全员开始吃工人的人血馒头

你在偷看谁
2026-07-29 09:02:12
再不处理后果很严重?港媒发声:中国高铁已被“粪便淹没”!

再不处理后果很严重?港媒发声:中国高铁已被“粪便淹没”!

補懂事的孩紙
2026-07-28 20:50:19
詹姆斯还是你狠!只用了48小时,就打破了弗拉格的NBA纪录

詹姆斯还是你狠!只用了48小时,就打破了弗拉格的NBA纪录

篮球大视野
2026-07-29 12:00:32
国营网约车正式全面上线!老百姓打车终于不再被拿捏

国营网约车正式全面上线!老百姓打车终于不再被拿捏

陈博世财经
2026-07-29 13:49:39
15-25爆冷!张继科回应不敌郑荣植:"球路和10年前一样,只是跑不动了"!百分大战100-93险胜

15-25爆冷!张继科回应不敌郑荣植:"球路和10年前一样,只是跑不动了"!百分大战100-93险胜

好乒乓
2026-07-29 17:17:12
网红“听泉赏宝”突然退出,炸裂全网!

网红“听泉赏宝”突然退出,炸裂全网!

营销头版
2026-07-29 20:16:55
方媛现身安徽老家,又矮又壮,素颜不如路人,一人吃8个菜引争议

方媛现身安徽老家,又矮又壮,素颜不如路人,一人吃8个菜引争议

孤城落日
2026-07-28 21:17:46
难怪遗产一分不要,73岁迟重瑞现状曝光,原来他和coco是一类人

难怪遗产一分不要,73岁迟重瑞现状曝光,原来他和coco是一类人

冰语历史
2026-07-29 03:47:49
比特币,历史级暴跌!

比特币,历史级暴跌!

澳洲财经见闻
2026-07-29 06:54:25
空腹采血=滴水不沾?医生提醒:这些错误千万别犯,别再搞错了!

空腹采血=滴水不沾?医生提醒:这些错误千万别犯,别再搞错了!

小胡军事爱好
2026-07-28 10:24:05
土耳其男排被零封出局!赛前吐槽中国场馆差,质疑鹰眼+黄牌警告

土耳其男排被零封出局!赛前吐槽中国场馆差,质疑鹰眼+黄牌警告

排球黄金眼
2026-07-29 17:34:31
贵州1岁女童熟睡中,被隔壁3岁男孩9次拿被褥捂头,妈妈查看监控直呼后怕:听到哭声下楼时,男孩才慌忙逃走;男孩家长:会对孩子进行教育

贵州1岁女童熟睡中,被隔壁3岁男孩9次拿被褥捂头,妈妈查看监控直呼后怕:听到哭声下楼时,男孩才慌忙逃走;男孩家长:会对孩子进行教育

大风新闻
2026-07-29 19:50:03
《纸牌屋》揭示真相:上位者从来不在乎你能力多强、多有正义感、多有原则底线,真正让你不被轻视并获得资源的,是这两张人性底牌

《纸牌屋》揭示真相:上位者从来不在乎你能力多强、多有正义感、多有原则底线,真正让你不被轻视并获得资源的,是这两张人性底牌

心理观察局
2026-07-29 07:12:07
广东大妈为女儿定四道“铁门槛”,网友怒怼:这婚谁敢结?

广东大妈为女儿定四道“铁门槛”,网友怒怼:这婚谁敢结?

尘埃里的看客
2026-07-29 16:19:08
从月销4万到几乎归零,这些车当年有多风光现在就多狼狈!

从月销4万到几乎归零,这些车当年有多风光现在就多狼狈!

沙雕小琳琳
2026-07-29 14:42:31
詹姆斯连发6条鸡汤文!艾弗森回应GOAT之争:乔丹永远是历史最佳

詹姆斯连发6条鸡汤文!艾弗森回应GOAT之争:乔丹永远是历史最佳

罗说NBA
2026-07-29 07:27:39
王虹、邓煜为何不回国搞研究?同门师兄许晨阳的经历或可作参考!

王虹、邓煜为何不回国搞研究?同门师兄许晨阳的经历或可作参考!

阿纂看事
2026-07-29 13:43:49
江苏徐州90后货车司机服务区去世,三天后异味扩散被发现!事发后多名卡友自费采购消杀用品清理车辆,轮流开车千里护送车辆返回逝者老家

江苏徐州90后货车司机服务区去世,三天后异味扩散被发现!事发后多名卡友自费采购消杀用品清理车辆,轮流开车千里护送车辆返回逝者老家

大风新闻
2026-07-29 10:53:35
2026-07-29 23:39:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13632文章数 142707关注度
往期回顾 全部

科技要闻

Kimi K3火爆,奥特曼:开源一定有一席之地

头条要闻

女子出轨高中老师直言"身心都离不开" 孩子在该校上学

头条要闻

女子出轨高中老师直言"身心都离不开" 孩子在该校上学

体育要闻

毫无存在感的NBA状元,最先谢谢惠顾?

娱乐要闻

55岁影帝黄政民出轨

财经要闻

天丝红牛多地检出成分不合格 企业申诉

汽车要闻

MG 07预售12.59万起 高阶版配激光雷达+CDC

态度原创

本地
游戏
家居
旅游
军事航空

本地新闻

跟着影视去旅行:八仙篇

LPL第三赛段:又是“故意”的?BLG拒绝让一追二击败LGD

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

小学课本里的威尼斯,长大后才看见另一半

军事要闻

美以领导人会晤后 伊朗发射多枚导弹突袭驻中东美军

无障碍浏览 进入关怀版