网易首页 > 网易号 > 正文 申请入驻

无需外部数据!AI自问自答实现推理能力进化

0
分享至

时令 发自 凹非寺
量子位 | 公众号 QbitAI

AI通过自问自答就能提升推理能力?!

这正是卡内基梅隆大学团队提出的新框架SQLM——一种无需外部数据的自我提问模型。

该框架包含提问者(proposer)和解答者(solver)两个角色,提问者生成与给定主题相关的问题,解答者旨在解决问题。

网友们神评,“简直是带有RL的GAN”。

值得一提的是,此团队中又双叒叕现华人身影~

通过强化学习最大化期望奖励

当前大语言模型的训练很大程度上仍依赖人工整理数据集,堪称费时费力。

为了减轻这一负担,研究人员开发了用于强化学习的无监督奖励函数。然而,这些函数仍然依赖于预先提供的高质量输入提示。

因此,问题的难点从“生成答案”转移到了“生成高质量问题”。

这凸显出当前方法的一个关键不足:

缺乏一种可扩展且自我维持的流程,能够在无人干预的情况下自动生成有意义的问题和答案。

为此,研究者提出了SQLM框架

,一种非对称的自我博弈框架,其中提问者

,解答者

回答该问题,两者均通过强化学习进行训练,以最大化期望奖励。

其中,提问者生成问题会对解答者形成条件影响,而解答者的表现又反过来为提问者提供奖励,从而不断优化提问者。

由于缺乏真实答案,研究者设计了基于“生成者–验证者差距”的自监督奖励函数。

若生成器-验证器差距小(例如算数问题),则采用多数投票作为代理奖励。

若生成器-验证器差距大(例如编程问题),先由提问者生成测试用例,奖励则基于通过测试的比例。

这种极小极大式的训练框架通过自博弈实现了稳定训练,并使奖励机制能够针对具体问题进行自适应调整。

为了评估模型的不同能力,研究者进行了三部分任务,并使用Qwen2.5-3B-Instruct运行实验。

算术任务

研究人员让提问者生成一个三位数的算数问题,并将其作为解答器的输入。他们按照TinyZero的设置,构建了一组包含4096个三位数乘法问题的测试集。

代数任务

研究者让模型生成最多包含两个变量的线性方程,并在OMEGA基准中的100道线性方程测试题上进行评估。

编程问题

他们让模型生成类似LeetCode中简单题的问题,输入为整数列表,输出为单个整数或另一个列表,并在Codeforces测试集的一个子集上进行评估。

实验结果显示,SQLM将Qwen2.5-3B-Instruct在算术任务上的准确率提高了14%,在代数任务上提高了16%;在编程任务上的准确率提高了7%。

此外,上表还显示出SQLM显著优于格式奖励基线(用于稳定训练和规范输出格式的参考值),表明推理能力的真正提升。

团队介绍

Lili Chen,本科毕业于加州大学伯克利分校,现博士就读于卡内基梅隆大学。

Katerina Fragkiadaki,卡内基梅隆大学机器学习系计算机科学副教授,博士毕业于宾夕法尼亚大,曾在加州大学伯克利分校担任博士后研究员,并于谷歌研究院工作。

Hao Liu,博士毕业于加州大学伯克利分校,曾任谷歌DeepMind研究员,即将出任卡内基梅隆大学机器学习系的助理教授。

Deepak Pathak,Skild AI创始人,本科就读于印度理工学院坎普尔分校,博士毕业于加州大学伯克利分校,曾在Meta担任了一年的研究员,现任卡内基梅隆大学计算机科学学院的助理教授。

参考链接:
[1]https://x.com/iScienceLuvr/status/1953052817012474353
[2]https://arxiv.org/abs/2508.03682

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
澳华人美女网红走光照疯传!靠成人平台吸粉百万,怒买数十套房,实现“经济自由”!

澳华人美女网红走光照疯传!靠成人平台吸粉百万,怒买数十套房,实现“经济自由”!

澳洲红领巾
2026-04-20 13:44:46
耗高圆圆5年,又拖瞿颖11年,一句不婚主义,成了最好的挡箭牌?

耗高圆圆5年,又拖瞿颖11年,一句不婚主义,成了最好的挡箭牌?

阿废冷眼观察所
2026-04-21 19:36:37
留下238亿遗产,为何4个孩子没人愿意继承,甚至连花圈都不给他送

留下238亿遗产,为何4个孩子没人愿意继承,甚至连花圈都不给他送

米果说识
2026-03-21 17:02:24
2026款乐道L90上市 售26.58万元起 智能化全面升级

2026款乐道L90上市 售26.58万元起 智能化全面升级

太平洋汽车
2026-04-21 22:36:36
与李晨分手6年后嫁普通人,以为是好牌打烂,其实她才是人生赢家

与李晨分手6年后嫁普通人,以为是好牌打烂,其实她才是人生赢家

悦君兮君不知
2026-04-20 21:07:31
博格巴:把B费放在曼城,以他的数据和表现就是金球奖前三

博格巴:把B费放在曼城,以他的数据和表现就是金球奖前三

懂球帝
2026-04-22 01:14:27
“老实人”任重甘愿成为接盘侠,迎娶内娱第一海王,网友:绝配

“老实人”任重甘愿成为接盘侠,迎娶内娱第一海王,网友:绝配

天天热点见闻
2026-04-21 05:14:09
太超前了,全国唯一!一条冲浪视频走红网络,这居然是杭州的河道?

太超前了,全国唯一!一条冲浪视频走红网络,这居然是杭州的河道?

都市快报橙柿互动
2026-04-22 00:24:21
两大高光消息同时落地,属于孙颖莎的时代,早已稳稳到来

两大高光消息同时落地,属于孙颖莎的时代,早已稳稳到来

小光侃娱乐
2026-04-22 07:10:06
难怪特朗普对伊朗怂了,美国情报部门评估结果出炉,确实没法打了

难怪特朗普对伊朗怂了,美国情报部门评估结果出炉,确实没法打了

温读史
2026-04-22 00:27:49
文章面馆开业4天后,终于有艺人到场!网友:这对比太心酸了

文章面馆开业4天后,终于有艺人到场!网友:这对比太心酸了

娱小余
2026-04-19 23:21:33
儿女有出息,从不是天生的,而是父母做对了这4件事

儿女有出息,从不是天生的,而是父母做对了这4件事

第一桶金学派
2026-02-28 16:20:46
香港楼市被投下了一枚“核弹”

香港楼市被投下了一枚“核弹”

林子说事
2026-04-21 11:41:26
女篮世界杯小组抽签:中国女篮和美国、意大利、捷克同在D组

女篮世界杯小组抽签:中国女篮和美国、意大利、捷克同在D组

懂球帝
2026-04-22 01:03:07
北青:亚足联认定马宁亚冠精英联赛1/4决赛执法无错漏判

北青:亚足联认定马宁亚冠精英联赛1/4决赛执法无错漏判

懂球帝
2026-04-21 20:08:02
合资燃油车集体降价求生:多款经典车型跌成白菜价

合资燃油车集体降价求生:多款经典车型跌成白菜价

快科技
2026-04-21 12:08:07
我醉后对女上司说:再扣工资我就娶了你,第二天她把我叫到办公室

我醉后对女上司说:再扣工资我就娶了你,第二天她把我叫到办公室

千秋文化
2026-04-16 20:15:29
绝了,开拓者绝了!整个NBA最抠门老板......

绝了,开拓者绝了!整个NBA最抠门老板......

篮球实战宝典
2026-04-21 17:25:51
中国女排首张集训大合照有猫腻,三老归队训练,一人已不在现场

中国女排首张集训大合照有猫腻,三老归队训练,一人已不在现场

体育快递小哥哥
2026-04-21 15:34:21
“老实人”任重甘愿成为接盘侠,迎娶内娱第一海王,网友:绝配

“老实人”任重甘愿成为接盘侠,迎娶内娱第一海王,网友:绝配

乡野小珥
2026-04-22 00:11:11
2026-04-22 07:48:49
量子位 incentive-icons
量子位
追踪人工智能动态
12508文章数 176457关注度
往期回顾 全部

科技要闻

创造4万亿帝国、访华20次,库克留下了什么

头条要闻

伊朗极限拉扯拒绝谈判 特朗普宣布:延长停火期限

头条要闻

伊朗极限拉扯拒绝谈判 特朗普宣布:延长停火期限

体育要闻

一到NBA季后赛,四届DPOY就成了主角

娱乐要闻

宋承炫晒宝宝B超照,宣布老婆怀孕

财经要闻

现实是最大的荒诞:千亿平台的冲突始末

汽车要闻

全新坦克700正式上市 售价42.8万-50.8万元

态度原创

本地
游戏
时尚
艺术
健康

本地新闻

春色满城关不住|白鹃梅浪漫盛放,吴山藏了一片四月雪

涨价两周即回调!索尼官方PS5数字版定价重回399美元

顶流复工,已判若两人

艺术要闻

无花不风景

干细胞抗衰4大误区,90%的人都中招

无障碍浏览 进入关怀版