网易首页 > 网易号 > 正文 申请入驻

无需外部数据!AI自问自答实现推理能力进化

0
分享至

时令 发自 凹非寺
量子位 | 公众号 QbitAI

AI通过自问自答就能提升推理能力?!

这正是卡内基梅隆大学团队提出的新框架SQLM——一种无需外部数据的自我提问模型。



该框架包含提问者(proposer)和解答者(solver)两个角色,提问者生成与给定主题相关的问题,解答者旨在解决问题。

网友们神评,“简直是带有RL的GAN”。



值得一提的是,此团队中又双叒叕现华人身影~

通过强化学习最大化期望奖励

当前大语言模型的训练很大程度上仍依赖人工整理数据集,堪称费时费力。

为了减轻这一负担,研究人员开发了用于强化学习的无监督奖励函数。然而,这些函数仍然依赖于预先提供的高质量输入提示。

因此,问题的难点从“生成答案”转移到了“生成高质量问题”。

这凸显出当前方法的一个关键不足:

缺乏一种可扩展且自我维持的流程,能够在无人干预的情况下自动生成有意义的问题和答案。



为此,研究者提出了SQLM框架

,一种非对称的自我博弈框架,其中提问者

,解答者



回答该问题,两者均通过强化学习进行训练,以最大化期望奖励。



其中,提问者生成问题会对解答者形成条件影响,而解答者的表现又反过来为提问者提供奖励,从而不断优化提问者。

由于缺乏真实答案,研究者设计了基于“生成者–验证者差距”的自监督奖励函数。

若生成器-验证器差距小(例如算数问题),则采用多数投票作为代理奖励。



若生成器-验证器差距大(例如编程问题),先由提问者生成测试用例,奖励则基于通过测试的比例。





这种极小极大式的训练框架通过自博弈实现了稳定训练,并使奖励机制能够针对具体问题进行自适应调整。

为了评估模型的不同能力,研究者进行了三部分任务,并使用Qwen2.5-3B-Instruct运行实验。

算术任务

研究人员让提问者生成一个三位数的算数问题,并将其作为解答器的输入。他们按照TinyZero的设置,构建了一组包含4096个三位数乘法问题的测试集。

代数任务

研究者让模型生成最多包含两个变量的线性方程,并在OMEGA基准中的100道线性方程测试题上进行评估。

编程问题

他们让模型生成类似LeetCode中简单题的问题,输入为整数列表,输出为单个整数或另一个列表,并在Codeforces测试集的一个子集上进行评估。



实验结果显示,SQLM将Qwen2.5-3B-Instruct在算术任务上的准确率提高了14%,在代数任务上提高了16%;在编程任务上的准确率提高了7%。

此外,上表还显示出SQLM显著优于格式奖励基线(用于稳定训练和规范输出格式的参考值),表明推理能力的真正提升。

团队介绍



Lili Chen,本科毕业于加州大学伯克利分校,现博士就读于卡内基梅隆大学。



Katerina Fragkiadaki,卡内基梅隆大学机器学习系计算机科学副教授,博士毕业于宾夕法尼亚大,曾在加州大学伯克利分校担任博士后研究员,并于谷歌研究院工作。



Hao Liu,博士毕业于加州大学伯克利分校,曾任谷歌DeepMind研究员,即将出任卡内基梅隆大学机器学习系的助理教授。



Deepak Pathak,Skild AI创始人,本科就读于印度理工学院坎普尔分校,博士毕业于加州大学伯克利分校,曾在Meta担任了一年的研究员,现任卡内基梅隆大学计算机科学学院的助理教授。

参考链接:
[1]https://x.com/iScienceLuvr/status/1953052817012474353
[2]https://arxiv.org/abs/2508.03682

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
激怒中国后高市早苗再树敌,叫嚣夺回韩国领土,韩民:中国骂轻了

激怒中国后高市早苗再树敌,叫嚣夺回韩国领土,韩民:中国骂轻了

叮当当科技
2025-11-14 15:45:49
欧盟将取消小包裹免税政策,外交部回应

欧盟将取消小包裹免税政策,外交部回应

观察者网
2025-11-14 16:36:03
中方召见日大使不到24小时,高市公开诉苦,石破茂罕见站中国一边

中方召见日大使不到24小时,高市公开诉苦,石破茂罕见站中国一边

乐天闲聊
2025-11-14 11:36:30
1962年胡适病逝,其妻问长子为何次子没来,长子:他5年前就死了

1962年胡适病逝,其妻问长子为何次子没来,长子:他5年前就死了

冰语历史
2025-11-11 15:46:42
寒潮蓝色预警:我国北方及中东部地区将出现大幅度降温 局地降温可超过14℃

寒潮蓝色预警:我国北方及中东部地区将出现大幅度降温 局地降温可超过14℃

北青网-北京青年报
2025-11-14 19:15:05
杨过身边的女子,为何只有完颜萍没误了终身?长大后才懂她有多坏

杨过身边的女子,为何只有完颜萍没误了终身?长大后才懂她有多坏

耳东文史
2025-11-15 00:00:54
提前谢幕 C罗踢完最后1场世预赛 2重击:无缘世界杯首轮+主场告别

提前谢幕 C罗踢完最后1场世预赛 2重击:无缘世界杯首轮+主场告别

风过乡
2025-11-14 06:29:29
这次出手比稀土更致命!掐中全球芯片命脉,俄专家:中方很聪明

这次出手比稀土更致命!掐中全球芯片命脉,俄专家:中方很聪明

历史求知所
2025-11-14 11:20:05
大和级战列舰主炮塔前装甲板在华盛顿海军造船厂展出

大和级战列舰主炮塔前装甲板在华盛顿海军造船厂展出

胡侃杂史
2025-11-14 07:05:05
37岁的付辛博给所有男人提了醒,一定要找生理上真正喜欢的妻子

37岁的付辛博给所有男人提了醒,一定要找生理上真正喜欢的妻子

诗意世界
2025-11-14 14:23:59
辽篮全运会只得到第四名的背后:郭艾伦和张镇麟为什么不参赛

辽篮全运会只得到第四名的背后:郭艾伦和张镇麟为什么不参赛

姜大叔侃球
2025-11-14 10:10:00
广西男子建房子遭邻居阻挠,一气之下挖成鱼塘养鱼:等他回来求我

广西男子建房子遭邻居阻挠,一气之下挖成鱼塘养鱼:等他回来求我

唐小糖说情感
2025-10-31 09:04:39
外媒曝哈里在贝索斯豪宅枯坐角落,悔不当初,梅根毁了我的一切

外媒曝哈里在贝索斯豪宅枯坐角落,悔不当初,梅根毁了我的一切

译言
2025-11-14 11:01:48
36岁奥巴梅扬无缘美加墨世界杯,下一届世界杯时他已41岁

36岁奥巴梅扬无缘美加墨世界杯,下一届世界杯时他已41岁

懂球帝
2025-11-14 03:05:41
火箭内讧曝光!伊森赛后与亚当斯激烈冲突,互相拉拽球衣

火箭内讧曝光!伊森赛后与亚当斯激烈冲突,互相拉拽球衣

最美的巧合
2025-11-14 14:55:35
全运会男子200米混合泳:老将汪顺实现四连冠,夺全运会第18金

全运会男子200米混合泳:老将汪顺实现四连冠,夺全运会第18金

全景体育V
2025-11-14 19:28:50
中国成G8最后拼图,德国基本同意,支持马克龙邀请中国参加G7峰会

中国成G8最后拼图,德国基本同意,支持马克龙邀请中国参加G7峰会

潮鹿逐梦
2025-11-13 16:48:14
广州长隆女子带狗上缆车被拒大闹!砸玩偶怼游客,喜提8000元赔偿

广州长隆女子带狗上缆车被拒大闹!砸玩偶怼游客,喜提8000元赔偿

行者聊官
2025-11-14 12:45:28
拒绝摆烂?CBA鱼腩队连续引进三名超级外援,新赛季能否涅槃重生

拒绝摆烂?CBA鱼腩队连续引进三名超级外援,新赛季能否涅槃重生

老叶评球
2025-11-14 23:07:40
太惨了!歌手阿珍因电动座椅架挤压离世,肋骨断裂,更多细节曝光

太惨了!歌手阿珍因电动座椅架挤压离世,肋骨断裂,更多细节曝光

鋭娱之乐
2025-11-14 16:02:02
2025-11-15 01:00:49
量子位 incentive-icons
量子位
追踪人工智能动态
11676文章数 176330关注度
往期回顾 全部

科技要闻

京东“失去的五年”后,找到新增长了吗?

头条要闻

怀疑19.9元"原切牛肉卷"是合成肉消费者送检 多方回应

头条要闻

怀疑19.9元"原切牛肉卷"是合成肉消费者送检 多方回应

体育要闻

7-0狂胜!15万人口小岛离世界杯只差1分

娱乐要闻

王家卫让古二替秦雯写剧情主线?

财经要闻

财政部:加强逆周期和跨周期调节

汽车要闻

小鹏X9超级增程动态评测全网首发 高速实测车内65分贝

态度原创

家居
亲子
游戏
公开课
军事航空

家居要闻

现代简逸 寻找生活的光

亲子要闻

儿童健康展与童书展同步启幕 全产业链赋能孩子身心成长

迟迟没有Switch2版!这三款任天堂第一方游戏太可惜

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

国防部:日方若胆敢铤而走险必将碰得头破血流

无障碍浏览 进入关怀版