网易首页 > 网易号 > 正文 申请入驻

无需外部数据!AI自问自答实现推理能力进化

0
分享至

时令 发自 凹非寺
量子位 | 公众号 QbitAI

AI通过自问自答就能提升推理能力?!

这正是卡内基梅隆大学团队提出的新框架SQLM——一种无需外部数据的自我提问模型。



该框架包含提问者(proposer)和解答者(solver)两个角色,提问者生成与给定主题相关的问题,解答者旨在解决问题。

网友们神评,“简直是带有RL的GAN”。



值得一提的是,此团队中又双叒叕现华人身影~

通过强化学习最大化期望奖励

当前大语言模型的训练很大程度上仍依赖人工整理数据集,堪称费时费力。

为了减轻这一负担,研究人员开发了用于强化学习的无监督奖励函数。然而,这些函数仍然依赖于预先提供的高质量输入提示。

因此,问题的难点从“生成答案”转移到了“生成高质量问题”。

这凸显出当前方法的一个关键不足:

缺乏一种可扩展且自我维持的流程,能够在无人干预的情况下自动生成有意义的问题和答案。



为此,研究者提出了SQLM框架

,一种非对称的自我博弈框架,其中提问者

,解答者



回答该问题,两者均通过强化学习进行训练,以最大化期望奖励。



其中,提问者生成问题会对解答者形成条件影响,而解答者的表现又反过来为提问者提供奖励,从而不断优化提问者。

由于缺乏真实答案,研究者设计了基于“生成者–验证者差距”的自监督奖励函数。

若生成器-验证器差距小(例如算数问题),则采用多数投票作为代理奖励。



若生成器-验证器差距大(例如编程问题),先由提问者生成测试用例,奖励则基于通过测试的比例。





这种极小极大式的训练框架通过自博弈实现了稳定训练,并使奖励机制能够针对具体问题进行自适应调整。

为了评估模型的不同能力,研究者进行了三部分任务,并使用Qwen2.5-3B-Instruct运行实验。

算术任务

研究人员让提问者生成一个三位数的算数问题,并将其作为解答器的输入。他们按照TinyZero的设置,构建了一组包含4096个三位数乘法问题的测试集。

代数任务

研究者让模型生成最多包含两个变量的线性方程,并在OMEGA基准中的100道线性方程测试题上进行评估。

编程问题

他们让模型生成类似LeetCode中简单题的问题,输入为整数列表,输出为单个整数或另一个列表,并在Codeforces测试集的一个子集上进行评估。



实验结果显示,SQLM将Qwen2.5-3B-Instruct在算术任务上的准确率提高了14%,在代数任务上提高了16%;在编程任务上的准确率提高了7%。

此外,上表还显示出SQLM显著优于格式奖励基线(用于稳定训练和规范输出格式的参考值),表明推理能力的真正提升。

团队介绍



Lili Chen,本科毕业于加州大学伯克利分校,现博士就读于卡内基梅隆大学。



Katerina Fragkiadaki,卡内基梅隆大学机器学习系计算机科学副教授,博士毕业于宾夕法尼亚大,曾在加州大学伯克利分校担任博士后研究员,并于谷歌研究院工作。



Hao Liu,博士毕业于加州大学伯克利分校,曾任谷歌DeepMind研究员,即将出任卡内基梅隆大学机器学习系的助理教授。



Deepak Pathak,Skild AI创始人,本科就读于印度理工学院坎普尔分校,博士毕业于加州大学伯克利分校,曾在Meta担任了一年的研究员,现任卡内基梅隆大学计算机科学学院的助理教授。

参考链接:
[1]https://x.com/iScienceLuvr/status/1953052817012474353
[2]https://arxiv.org/abs/2508.03682

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
雷军抛出55万辆的小目标,流量反噬教小米做人?

雷军抛出55万辆的小目标,流量反噬教小米做人?

DearAuto
2026-01-09 09:59:32
CBA记者痛批北京队1人:要是客场早被罚出去了,打得什么玩意儿?

CBA记者痛批北京队1人:要是客场早被罚出去了,打得什么玩意儿?

体育哲人
2026-01-10 11:14:54
52票赞成,47票反对,美参议院推进决议限制特朗普对委动武,多名共和党议员“反水”!特朗普怒斥:削弱总统权力!委内瑞拉:不屈服

52票赞成,47票反对,美参议院推进决议限制特朗普对委动武,多名共和党议员“反水”!特朗普怒斥:削弱总统权力!委内瑞拉:不屈服

每日经济新闻
2026-01-09 13:25:05
浙江公示:汪顺、潘展乐、黄雅琼等31人拟记大功

浙江公示:汪顺、潘展乐、黄雅琼等31人拟记大功

大象新闻
2026-01-10 10:49:09
2026新规落地!机关事业退休人员住房补贴申领,4个条件缺一不可

2026新规落地!机关事业退休人员住房补贴申领,4个条件缺一不可

慧眼看世界哈哈
2026-01-09 16:05:15
94年母亲带我回娘家借学费,到了开不了口,临走时大舅拦下我们

94年母亲带我回娘家借学费,到了开不了口,临走时大舅拦下我们

青青会讲故事
2025-05-01 05:00:06
国内解说员:詹姆斯一定是全明星首发,东契奇会把首发让给詹姆斯

国内解说员:詹姆斯一定是全明星首发,东契奇会把首发让给詹姆斯

摸神drose
2026-01-10 22:17:43
最新! 中国新增20.4万颗卫星申请,美国批准SpaceX新增7500颗卫星!下周商业航天还要冲?

最新! 中国新增20.4万颗卫星申请,美国批准SpaceX新增7500颗卫星!下周商业航天还要冲?

价值线传媒
2026-01-10 18:23:19
A股:大家做好准备,不出意外,1月12日,下周一将上演熟悉的剧情

A股:大家做好准备,不出意外,1月12日,下周一将上演熟悉的剧情

深析古今
2026-01-10 09:22:53
乌度卡:杜兰特被换2分钟就被打11-0,其他人心理素质太差了

乌度卡:杜兰特被换2分钟就被打11-0,其他人心理素质太差了

懂球帝
2026-01-10 14:18:13
港影:《九龙城寨之龙头》,郭古番位未定,又传周刘争演雷震东?

港影:《九龙城寨之龙头》,郭古番位未定,又传周刘争演雷震东?

唐泪
2026-01-10 12:29:24
CBA第12轮最佳阵容:王哲林11中10率上海升第一 辽篮双核入选

CBA第12轮最佳阵容:王哲林11中10率上海升第一 辽篮双核入选

醉卧浮生
2026-01-10 14:53:13
宜家变天!家具卖不动狂亏10亿,却靠9.9元套餐成年轻人的避风港

宜家变天!家具卖不动狂亏10亿,却靠9.9元套餐成年轻人的避风港

素衣读史
2026-01-10 18:36:59
3:0?张本再战小勒布伦,11:9旧仇未报,决赛级预演

3:0?张本再战小勒布伦,11:9旧仇未报,决赛级预演

体坛黑馬
2026-01-10 14:44:14
一百多年前,康有为花费 150 万在欧洲购得一座岛,时至今日,这座岛的产权到底归谁所有?

一百多年前,康有为花费 150 万在欧洲购得一座岛,时至今日,这座岛的产权到底归谁所有?

源溯历史
2026-01-02 18:50:36
回国了我才敢说:委内瑞拉,是我去过的所有国家中,最被看轻的!

回国了我才敢说:委内瑞拉,是我去过的所有国家中,最被看轻的!

阿纂看事
2026-01-09 09:48:35
重磅!安踏拟收购德国彪马29%股权

重磅!安踏拟收购德国彪马29%股权

闽商报
2026-01-10 12:57:46
1991 年,邓小平特派代表赴美团聚张学良,邀他重返故土,张学良回应:“回大陆可以,但我有三个要求”

1991 年,邓小平特派代表赴美团聚张学良,邀他重返故土,张学良回应:“回大陆可以,但我有三个要求”

文史明鉴
2025-12-21 17:07:19
黎马良重提中越战争:中方五日不撤谅山主力恐全歼,结局究竟如何

黎马良重提中越战争:中方五日不撤谅山主力恐全歼,结局究竟如何

唠叨说历史
2026-01-06 15:26:32
傅首尔的困境有多难解?一露头就全网抵制,她不再被网友宽容了?

傅首尔的困境有多难解?一露头就全网抵制,她不再被网友宽容了?

小熊侃史
2026-01-09 07:35:03
2026-01-10 23:12:49
量子位 incentive-icons
量子位
追踪人工智能动态
11998文章数 176357关注度
往期回顾 全部

科技要闻

传DeepSeek准备第二次震惊全世界

头条要闻

雷军:SU7是唯一击败Model 3的同档纯电轿车

头条要闻

雷军:SU7是唯一击败Model 3的同档纯电轿车

体育要闻

怒摔水瓶!杜兰特30+12 难阻火箭遭双杀

娱乐要闻

吴速玲曝儿子Joe是恋爱脑

财经要闻

这不算诈骗吗?水滴保诱导扣款惹众怒

汽车要闻

宝马25年全球销量246.3万台 中国仍是第一大市场

态度原创

时尚
旅游
游戏
教育
军事航空

年底大牌返场 || 每次都“秒空”,这次100+真的好值!

旅游要闻

张家口康保“冰雪嘉年华”活动启幕 邀京津冀游客“红火过大年”

二游皇帝十周年整出绝世烂活,玩家被当猴耍后先破防又献上忠诚?

教育要闻

学习的底层逻辑,藏在作息表里

军事要闻

海空英雄高翔逝世 曾驾驶歼-6打爆美军机

无障碍浏览 进入关怀版