网易首页 > 网易号 > 正文 申请入驻

无需外部数据!AI自问自答实现推理能力进化

0
分享至

时令 发自 凹非寺
量子位 | 公众号 QbitAI

AI通过自问自答就能提升推理能力?!

这正是卡内基梅隆大学团队提出的新框架SQLM——一种无需外部数据的自我提问模型。



该框架包含提问者(proposer)和解答者(solver)两个角色,提问者生成与给定主题相关的问题,解答者旨在解决问题。

网友们神评,“简直是带有RL的GAN”。



值得一提的是,此团队中又双叒叕现华人身影~

通过强化学习最大化期望奖励

当前大语言模型的训练很大程度上仍依赖人工整理数据集,堪称费时费力。

为了减轻这一负担,研究人员开发了用于强化学习的无监督奖励函数。然而,这些函数仍然依赖于预先提供的高质量输入提示。

因此,问题的难点从“生成答案”转移到了“生成高质量问题”。

这凸显出当前方法的一个关键不足:

缺乏一种可扩展且自我维持的流程,能够在无人干预的情况下自动生成有意义的问题和答案。



为此,研究者提出了SQLM框架

,一种非对称的自我博弈框架,其中提问者

,解答者



回答该问题,两者均通过强化学习进行训练,以最大化期望奖励。



其中,提问者生成问题会对解答者形成条件影响,而解答者的表现又反过来为提问者提供奖励,从而不断优化提问者。

由于缺乏真实答案,研究者设计了基于“生成者–验证者差距”的自监督奖励函数。

若生成器-验证器差距小(例如算数问题),则采用多数投票作为代理奖励。



若生成器-验证器差距大(例如编程问题),先由提问者生成测试用例,奖励则基于通过测试的比例。





这种极小极大式的训练框架通过自博弈实现了稳定训练,并使奖励机制能够针对具体问题进行自适应调整。

为了评估模型的不同能力,研究者进行了三部分任务,并使用Qwen2.5-3B-Instruct运行实验。

算术任务

研究人员让提问者生成一个三位数的算数问题,并将其作为解答器的输入。他们按照TinyZero的设置,构建了一组包含4096个三位数乘法问题的测试集。

代数任务

研究者让模型生成最多包含两个变量的线性方程,并在OMEGA基准中的100道线性方程测试题上进行评估。

编程问题

他们让模型生成类似LeetCode中简单题的问题,输入为整数列表,输出为单个整数或另一个列表,并在Codeforces测试集的一个子集上进行评估。



实验结果显示,SQLM将Qwen2.5-3B-Instruct在算术任务上的准确率提高了14%,在代数任务上提高了16%;在编程任务上的准确率提高了7%。

此外,上表还显示出SQLM显著优于格式奖励基线(用于稳定训练和规范输出格式的参考值),表明推理能力的真正提升。

团队介绍



Lili Chen,本科毕业于加州大学伯克利分校,现博士就读于卡内基梅隆大学。



Katerina Fragkiadaki,卡内基梅隆大学机器学习系计算机科学副教授,博士毕业于宾夕法尼亚大,曾在加州大学伯克利分校担任博士后研究员,并于谷歌研究院工作。



Hao Liu,博士毕业于加州大学伯克利分校,曾任谷歌DeepMind研究员,即将出任卡内基梅隆大学机器学习系的助理教授。



Deepak Pathak,Skild AI创始人,本科就读于印度理工学院坎普尔分校,博士毕业于加州大学伯克利分校,曾在Meta担任了一年的研究员,现任卡内基梅隆大学计算机科学学院的助理教授。

参考链接:
[1]https://x.com/iScienceLuvr/status/1953052817012474353
[2]https://arxiv.org/abs/2508.03682

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
俄媒:中国如果再用‘战略定力’解释不出手,迟早被当‘试验田’

俄媒:中国如果再用‘战略定力’解释不出手,迟早被当‘试验田’

百态人间
2026-01-04 16:10:18
冯提莫瘦50斤变纸片人,自曝肚皮松成“沙皮狗”:这是减肥送的?

冯提莫瘦50斤变纸片人,自曝肚皮松成“沙皮狗”:这是减肥送的?

湘村大余
2026-01-07 16:31:08
重磅!全球局势不稳,新华社官宣轰20、歼-36或在2026年正式亮相

重磅!全球局势不稳,新华社官宣轰20、歼-36或在2026年正式亮相

闻识
2026-01-08 09:35:46
上海二手房成交量爆了

上海二手房成交量爆了

魔都财观
2026-01-08 07:42:31
我国存款最安全的3大银行,永远都不会倒闭,你知道是哪3家吗?

我国存款最安全的3大银行,永远都不会倒闭,你知道是哪3家吗?

小熊侃史
2026-01-07 11:17:59
张维伊带董璇,小酒窝在朋友家吃饭,一家三口超温馨

张维伊带董璇,小酒窝在朋友家吃饭,一家三口超温馨

手工制作阿歼
2026-01-08 06:34:34
毕锡桢:辽宁省大连市委原书记,辽宁省人大常委会原副主任

毕锡桢:辽宁省大连市委原书记,辽宁省人大常委会原副主任

爱下厨的阿酾
2026-01-08 09:51:54
北京电动自行车也要办行驶证,后座乘员年龄上限放宽至16岁

北京电动自行车也要办行驶证,后座乘员年龄上限放宽至16岁

IT之家
2026-01-07 17:49:13
调整!1月8日央视直播WTT冠军赛有变,王曼昱首秀,向鹏大战张本

调整!1月8日央视直播WTT冠军赛有变,王曼昱首秀,向鹏大战张本

皮皮观天下
2026-01-08 05:39:19
山西悬崖上废弃道观,发现张三丰墓和闭关洞,墓中竟有金身骸骨!

山西悬崖上废弃道观,发现张三丰墓和闭关洞,墓中竟有金身骸骨!

铭记历史呀
2026-01-07 02:43:09
再见周定洋!地球离开谁都会继续转,蓉城没有你,也不会降级!

再见周定洋!地球离开谁都会继续转,蓉城没有你,也不会降级!

田先生篮球
2026-01-07 15:46:30
黄油欧美卖爆,顿顿都离不开,为啥中国人却不爱,超市也很少卖?

黄油欧美卖爆,顿顿都离不开,为啥中国人却不爱,超市也很少卖?

揽星河的笔记
2025-12-08 13:30:38
张梓琳哈尔滨旅游,零下20度快被冻哭,10岁女儿睫毛上都是冰碴

张梓琳哈尔滨旅游,零下20度快被冻哭,10岁女儿睫毛上都是冰碴

娱圈小愚
2026-01-08 10:18:00
44年村口大娘煮了一锅羊汤给日本鬼子喝,大佐却说:你先喝

44年村口大娘煮了一锅羊汤给日本鬼子喝,大佐却说:你先喝

青青会讲故事
2025-07-24 11:00:14
田朴珺再度公开与王石合影,离婚风波反转,粉丝建议她学习邓文迪

田朴珺再度公开与王石合影,离婚风波反转,粉丝建议她学习邓文迪

娱乐E君
2026-01-06 18:04:24
99年,山东一男子预感钢材要大涨,在2千一吨时砸下重金囤了500吨

99年,山东一男子预感钢材要大涨,在2千一吨时砸下重金囤了500吨

卡西莫多的故事
2025-12-31 10:08:32
日本派大学生+以小打大仍5-0叙利亚 黄健翔惊叹 :夺世界杯非玩笑

日本派大学生+以小打大仍5-0叙利亚 黄健翔惊叹 :夺世界杯非玩笑

我爱英超
2026-01-07 21:53:08
曹丕"荒淫无度"在位7年就驾崩?以他的玩法,40岁实属是高寿!

曹丕"荒淫无度"在位7年就驾崩?以他的玩法,40岁实属是高寿!

沈言论
2026-01-07 18:55:03
摊牌了?中企陆续收到光刻机,外媒:ASML公司不“乖”了

摊牌了?中企陆续收到光刻机,外媒:ASML公司不“乖”了

丰谭笔录
2026-01-08 00:11:38
谢娜回应身材嘲讽霸气十足,给无知网友上了一课

谢娜回应身材嘲讽霸气十足,给无知网友上了一课

点燃好奇心
2026-01-08 01:33:04
2026-01-08 16:11:00
量子位 incentive-icons
量子位
追踪人工智能动态
11985文章数 176357关注度
往期回顾 全部

科技要闻

智谱拿下“全球大模型第一股”,凭什么

头条要闻

中方被指正考虑进一步收紧中重稀土出口 日本业界慌了

头条要闻

中方被指正考虑进一步收紧中重稀土出口 日本业界慌了

体育要闻

约基奇倒下后,一位故人邪魅一笑

娱乐要闻

2026春节档将有六部电影强势上映

财经要闻

微软CTO韦青:未来人类会花钱"戒手机"

汽车要闻

从量变到"智"变 吉利在CES打出了五张牌

态度原创

房产
艺术
游戏
健康
手机

房产要闻

三亚新房,又全国第一了!

艺术要闻

颐和园金光穿洞

欧洲评级泄露《奇异人生》新游 但是开发商没公布

这些新疗法,让化疗不再那么痛苦

手机要闻

华为Pura X2曝光:翻书式横向折叠,外屏尺寸增大

无障碍浏览 进入关怀版