网易首页 > 网易号 > 正文 申请入驻

无需外部数据!AI自问自答实现推理能力进化

0
分享至

时令 发自 凹非寺
量子位 | 公众号 QbitAI

AI通过自问自答就能提升推理能力?!

这正是卡内基梅隆大学团队提出的新框架SQLM——一种无需外部数据的自我提问模型。

该框架包含提问者(proposer)和解答者(solver)两个角色,提问者生成与给定主题相关的问题,解答者旨在解决问题。

网友们神评,“简直是带有RL的GAN”。

值得一提的是,此团队中又双叒叕现华人身影~

通过强化学习最大化期望奖励

当前大语言模型的训练很大程度上仍依赖人工整理数据集,堪称费时费力。

为了减轻这一负担,研究人员开发了用于强化学习的无监督奖励函数。然而,这些函数仍然依赖于预先提供的高质量输入提示。

因此,问题的难点从“生成答案”转移到了“生成高质量问题”。

这凸显出当前方法的一个关键不足:

缺乏一种可扩展且自我维持的流程,能够在无人干预的情况下自动生成有意义的问题和答案。

为此,研究者提出了SQLM框架

,一种非对称的自我博弈框架,其中提问者

,解答者

回答该问题,两者均通过强化学习进行训练,以最大化期望奖励。

其中,提问者生成问题会对解答者形成条件影响,而解答者的表现又反过来为提问者提供奖励,从而不断优化提问者。

由于缺乏真实答案,研究者设计了基于“生成者–验证者差距”的自监督奖励函数。

若生成器-验证器差距小(例如算数问题),则采用多数投票作为代理奖励。

若生成器-验证器差距大(例如编程问题),先由提问者生成测试用例,奖励则基于通过测试的比例。

这种极小极大式的训练框架通过自博弈实现了稳定训练,并使奖励机制能够针对具体问题进行自适应调整。

为了评估模型的不同能力,研究者进行了三部分任务,并使用Qwen2.5-3B-Instruct运行实验。

算术任务

研究人员让提问者生成一个三位数的算数问题,并将其作为解答器的输入。他们按照TinyZero的设置,构建了一组包含4096个三位数乘法问题的测试集。

代数任务

研究者让模型生成最多包含两个变量的线性方程,并在OMEGA基准中的100道线性方程测试题上进行评估。

编程问题

他们让模型生成类似LeetCode中简单题的问题,输入为整数列表,输出为单个整数或另一个列表,并在Codeforces测试集的一个子集上进行评估。

实验结果显示,SQLM将Qwen2.5-3B-Instruct在算术任务上的准确率提高了14%,在代数任务上提高了16%;在编程任务上的准确率提高了7%。

此外,上表还显示出SQLM显著优于格式奖励基线(用于稳定训练和规范输出格式的参考值),表明推理能力的真正提升。

团队介绍

Lili Chen,本科毕业于加州大学伯克利分校,现博士就读于卡内基梅隆大学。

Katerina Fragkiadaki,卡内基梅隆大学机器学习系计算机科学副教授,博士毕业于宾夕法尼亚大,曾在加州大学伯克利分校担任博士后研究员,并于谷歌研究院工作。

Hao Liu,博士毕业于加州大学伯克利分校,曾任谷歌DeepMind研究员,即将出任卡内基梅隆大学机器学习系的助理教授。

Deepak Pathak,Skild AI创始人,本科就读于印度理工学院坎普尔分校,博士毕业于加州大学伯克利分校,曾在Meta担任了一年的研究员,现任卡内基梅隆大学计算机科学学院的助理教授。

参考链接:
[1]https://x.com/iScienceLuvr/status/1953052817012474353
[2]https://arxiv.org/abs/2508.03682

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
2026,一轮“涨价潮”悄悄来了

2026,一轮“涨价潮”悄悄来了

深水财经社
2026-03-04 20:27:04
伊朗外长:美国将为开创国际水域袭击先例“后悔”

伊朗外长:美国将为开创国际水域袭击先例“后悔”

新华社
2026-03-05 15:54:35
又揪出来一个巨贪,金额高达9.7亿,首富夫人郝斌跨境逃亡失败了

又揪出来一个巨贪,金额高达9.7亿,首富夫人郝斌跨境逃亡失败了

墨兰史书
2026-01-17 08:30:09
陈冠希为女儿庆9岁生日!头发半白不修边幅似本山大叔,很宠孩子

陈冠希为女儿庆9岁生日!头发半白不修边幅似本山大叔,很宠孩子

乐悠悠娱乐
2026-03-05 09:28:06
瞒不住了,打伊朗只是幌子,美国真正目的是隔山打牛,拖垮中国?

瞒不住了,打伊朗只是幌子,美国真正目的是隔山打牛,拖垮中国?

晓岇就是我
2026-03-04 17:05:56
拉夫罗夫:莫斯科将把所有历史上的俄罗斯土地归还其合法家园

拉夫罗夫:莫斯科将把所有历史上的俄罗斯土地归还其合法家园

番茄说史聊
2026-02-22 14:07:52
杨秀清掌握实权,为何斗不过形同虚设的洪秀全?

杨秀清掌握实权,为何斗不过形同虚设的洪秀全?

掠影后有感
2026-03-05 10:25:39
伊朗刚刚让步德黑兰就挨炸,美国被谁牵着鼻子走?

伊朗刚刚让步德黑兰就挨炸,美国被谁牵着鼻子走?

锋芒点兵
2026-03-05 17:50:28
中超首轮赛前发布会安排:泰山队为宿茂臻携彭啸出席

中超首轮赛前发布会安排:泰山队为宿茂臻携彭啸出席

闪电新闻
2026-03-05 16:18:52
特朗普夫人,“翻车”了

特朗普夫人,“翻车”了

中国新闻周刊
2026-03-04 18:01:09
知名演员夫妇滞留迪拜回国后讲述避难细节:住平房,起飞前告知家人银行卡密码

知名演员夫妇滞留迪拜回国后讲述避难细节:住平房,起飞前告知家人银行卡密码

上观新闻
2026-03-05 10:46:07
矛盾激化!冷血皇马强逼姆巴佩带伤出战曼城 团队发声:绝不接受

矛盾激化!冷血皇马强逼姆巴佩带伤出战曼城 团队发声:绝不接受

篮球看比赛
2026-03-05 17:23:49
母子相认现场:母亲袖口磨破舍不得扔,却给26岁儿子买新衣新鞋

母子相认现场:母亲袖口磨破舍不得扔,却给26岁儿子买新衣新鞋

匹夫来搞笑
2026-03-05 14:26:35
电车内幕,速成车之外,2.6吨车身但最大载重量仅有375公斤

电车内幕,速成车之外,2.6吨车身但最大载重量仅有375公斤

柏铭锐谈
2026-03-03 17:59:13
特朗普:美国海军可以护送船只通过霍尔木兹海峡

特朗普:美国海军可以护送船只通过霍尔木兹海峡

参考消息
2026-03-04 18:07:24
A股:股民要准备好了,明天(3月6日),不出意外要这么走了

A股:股民要准备好了,明天(3月6日),不出意外要这么走了

财经大拿
2026-03-05 13:56:04
霍尔木兹海峡切断不到5天,日本已尝到苦果,中国手握3大底牌

霍尔木兹海峡切断不到5天,日本已尝到苦果,中国手握3大底牌

了舞天下
2026-03-05 17:42:28
20岁后防天才闪耀法甲 攻防俱佳已成转会香饽饽 英超两大豪门疯抢

20岁后防天才闪耀法甲 攻防俱佳已成转会香饽饽 英超两大豪门疯抢

零度眼看球
2026-03-05 18:10:03
小天赐,终为父母当年的“冲动”买了单,年仅6岁活得不像个小孩

小天赐,终为父母当年的“冲动”买了单,年仅6岁活得不像个小孩

奇怪的鲨鱼们
2026-03-02 13:11:54
马筱梅生娃汪家忙翻,全网骂的却不是张兰,是陪了十年的小杨阿姨

马筱梅生娃汪家忙翻,全网骂的却不是张兰,是陪了十年的小杨阿姨

老吴教育课堂
2026-03-04 17:00:03
2026-03-05 18:27:00
量子位 incentive-icons
量子位
追踪人工智能动态
12220文章数 176403关注度
往期回顾 全部

科技要闻

阿里内部邮件回应:批准林俊旸辞职

头条要闻

《武林外传》演员在郑州开免费自助餐厅:付钱全凭自愿

头条要闻

《武林外传》演员在郑州开免费自助餐厅:付钱全凭自愿

体育要闻

不开玩笑,没人想在季后赛碰上黄蜂

娱乐要闻

谢娜下场撕薛之谦,张杰前女友爆猛料

财经要闻

“十五五”开局之年,这么干!

汽车要闻

小鹏第二代VLA如何破解智驾不敢用的技术困局?

态度原创

健康
艺术
时尚
公开课
军事航空

转头就晕的耳石症,能开车上班吗?

艺术要闻

2026年“浩瀚草原 亮丽北疆”美展

打底衫,条纹的最适合春天!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

2026年中国国防预算增长7%

无障碍浏览 进入关怀版