网易首页 > 网易号 > 正文 申请入驻

00后硕士揭开AI推理“黑科技”:两个Token,基模追平强化学习版本

0
分享至


智东西
作者 杨京丽
编辑 李水青

智东西10月10日报道,一项来自麻省理工学院(MIT)等机构的研究发现,只要固定基础模型回答开头的两个Token,就能让模型的数学推理成绩接近对应的强化学习版本。

以艾伦人工智能研究所(Ai2)的基础模型Olmo-3-7B为例,将回答固定为“.\n\nOkay”开头后,模型在MATH-500上的准确率从42%升至78%,超过其强化学习版本的75%。


这个过程没有修改模型参数,也没有给模型增加新的解题示例。模型只是换了一个回答起点,原本没有稳定表现出来的解题能力,似乎就更容易被调用出来。

换句话说,基础模型答错题,有时不一定是完全不会做,而是没有进入能够解题的状态。强化学习的一部分作用,可能正是让模型更容易选择这种有效的回答开头。

这一发现来自论文《基础模型可以借助训练数据中的线索进行推理(Base Models Can Reason By Taking a Cue From Training Data)》。论文于10月5日提交,由MIT、加州大学伯克利分校、华盛顿大学和艾伦人工智能研究所的研究者共同完成。

论文第一作者是麻省理工学院硕士生索菲·L·王(Sophie L. Wang)和加州大学伯克利分校博士生阿米尔·德拉维德(Amil Dravid)。索菲·L·王目前仍是MIT的硕士生,她从2023年进入MIT本科,2026年进入MIT硕士,目前她已先后在ICML和NeurIPS上发表研究成果。


论文链接:

https://arxiv.org/abs/2610.06851

项目链接:

https://www.sophielwang.com/cues

开源地址:

https://github.com/sophicle/cues

一、回答开头只改两个token,基础模型准确率追平强化学习版本

论文将模型回答拆分为“开头token线索”和后续生成内容两部分。研究者通过预先固定回答开头,观察不同开头如何改变模型接下来的生成结果。

他们首先观察Olmo-3-7B在MATH-500上的回答。正确答案中,约有50%的回答以“.\n\n”(句号加两个换行)开头,错误答案中这一比例只有14%。句号和换行本身没有提供数学知识,却与正确率出现了明显关联。

研究者随后从模型可能生成的回答开头中寻找有效线索。他们先用搜索方法找出基础模型较可能生成的短开头,再让模型从每个开头继续回答,比较多次采样结果的一致性。

对Olmo-3-7B,最终选中的开头是“.\n\nOkay”;对Qwen3-14B,选中的是“ Alright,”。研究者把这些文字预先填入模型回答,再让模型自行生成后续内容。

在MATH-500上,Olmo-3-7B基础模型自行生成回答开头时,其准确率约为42%;将回答开头固定为“.\n\nOkay”后,准确率升至约78%,高于其强化学习版本约75%的成绩。

Qwen3-14B使用“ Alright,”作为回答开头后,准确率则从72%提高到87%,与强化学习版本持平。相同开头还被用于GSM8K、AMC 23、AIME 2024等数学测试,在多数测试中都能带来提升。在代码生成测试HumanEval上,固定开头提高了Olmo-3-7B的成绩;Qwen3-14B的成绩则与不固定开头时相近。


论文中展示了一道具体题目的生成差异。题目较为简单,要求计算834名学生占全校人数三分之二时,全校共有多少名学生。

当模型以“.\nAnswer”开头时,它直接给出“1002”,答案错误;当模型以“.\n\nOkay”开头时,它先列出“(2/3)×T=834”,计算出1251,随后又主动检查结果,确认计算没有问题。设置新开头后,模型给出了正确的答案,生成过程中,模型没有获得额外提示,也没有更换参数,仅修改了回答开头。

二、从14%升至65%,强化学习先改变模型的回答开头

如果基础模型在固定开头后已经能达到接近强化学习模型的成绩,强化学习究竟改变了什么?

研究者采用RL-Zero设置,让模型直接根据自己生成答案的对错获得奖励。比较强化学习前后的模型后,他们发现,两者预测分布的最大差异集中在回答最开始的两个token。

对Olmo-3-7B,强化学习将“.\n\nOkay”的生成概率从0.14提高到0.65;对Qwen3-14B,“ Alright,”的生成概率从0.04提高到0.58。强化学习前后,模型的预测差异主要集中在回答最开始的两个token,之后差异明显减小。


研究者还把强化学习模型已经生成的回答开头交给基础模型,让基础模型从相同位置继续回答。Olmo-3-7B在这种条件下可以达到强化学习模型的准确率。

训练曲线显示,预先固定有效开头后,Olmo模型的成绩大约相当于标准强化学习训练100步后的水平,Qwen模型则相当于约50步后的水平。

这说明,在这组实验中,强化学习的一部分作用可能是提高模型选择有效推理开头的概率,让它更容易进入原本已经存在的推理路径。

研究者还控制了回答长度。部分开头会让模型写出更长的回答,但准确率仍低于不固定开头的结果;在相同token预算下,“.\n\nOkay”仍保持优势。因此,成绩提升不能只用回答变长来解释。


三、训练数据改写词语关联,“Chicken”也能诱导推理

“Okay”为什么有效?它可能符合人类开始思考时的表达习惯,但研究者希望进一步确认,效果是否来自训练数据中反复出现的词语关联。

他们将Olmo模型中期训练数据里与推理轨迹共同出现的“Okay”替换为“Chicken”,再从相同检查点继续训练。测试时,模型都被固定为以“.\n\nChicken”开头。

在原始基础模型中,固定“.\n\nChicken”后的MATH-500准确率约为18%,低于不固定开头时的42%。重新训练后,模型则会沿着推理文本的模式继续生成,准确率升至77%,接近“.\n\nOkay”开头的78%。

在使用10B-token中期训练数据的重训实验中,固定“.\n\nChicken”后,MATH-500准确率从2.4%升至37.2%;在使用100B-token数据的另一组实验中,准确率则从18.2%升至76.9%。两组实验的数据规模不同,但都说明,重新建立“Chicken”与推理文本之间的训练关联后,这个词才具备了推理线索的作用。


修改后的模型也没有忘记Chicken的日常含义。面对“A chicken is a”或“She roasted the chicken”这样的句子,它仍然可以生成与鸟类或食物有关的内容。

研究者还将训练数据中的“step by step”替换成“duck duck goose”。重新训练后,“Think duck duck goose”也能像“Think step by step”一样诱导模型推理。

隐藏状态分析显示,不同开头会把模型带向不同类型的训练文本。“.\n\nOkay”更接近合成推理轨迹,“To”更接近解释型数学文本,“Answer”则更接近简短问答文档。研究者还发现,线索越早出现在回答中,产生的影响越持久;等到第三至第六段才插入“Okay”,效果会明显下降。


四、修改回答开头,模型可能拒绝请求

此外,研究者还把同样的方法用于安全测试中,观察不同回答开头会如何影响模型拒绝或遵从请求。

在Olmo-3-7B中,以“I’m sorry”开头的回答更容易拒绝请求,但也会增加对无害请求的误拒绝;“Okay,”会减少拒绝,并增加模型对危险请求给出有害内容的概率。

数学实验中有效的“.\n\nOkay”则呈现出另一种效果:模型会更多拒绝危险请求,同时减少对正常请求的误拒绝,表现出更有选择性的拒绝行为。

论文还发现,仅仅改变空格、标点和换行方式,就可能带来不同结果。“Okay,”和“.\n\nOkay”看起来很接近,但前者可能成为更容易遵从危险请求的开头,后者则更接近先分析、再决定是否拒绝的回答模式。


这说明,回答开头对模型行为的影响并不局限于数学推理,也涉及拒答、安全等问题。

结语:模型能力和稳定发挥之间,还隔着一个“开头”

通过这篇论文可以发现:模型答错题,有时不代表它完全不会做,也可能是没有进入正确的思路。对Olmo-3-7B来说,只是在回答开头加上“.\n\nOkay”,准确率就从约42%提高到了78%。

“Chicken”的实验则说明,词语能起什么作用,和它在训练数据中经常跟什么内容一起出现有关。经过重新训练后,“Chicken”也能引导模型一步步解题。模型记住的可能不只是词语本身,还包括这个词通常会带来什么样的回答。因此,在实验条件下,预先固定有效的回答开头,都可能帮助模型进入更适合解题的状态。

不过,需要注意的是,实验测试的模型主要为Olmo-3-7B和Qwen3-14B,无法确定在其他模型上是否能产生类似的效果。这种方法是否有效,还要看具体模型和任务。这一方法虽然在一定程度上能够提高准确率,但想让模型面对不同问题和不同表达时都能稳定回答,仍然需要高质量的训练数据和充分的模型训练。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

轻扬墨雨
2026-08-14 13:21:23
李辉,主动向组织交代问题

李辉,主动向组织交代问题

大风新闻
2026-10-10 08:51:13
10月喜上加喜!家有这3大生肖,财源持续进账,福气傍身开门迎贵运

10月喜上加喜!家有这3大生肖,财源持续进账,福气傍身开门迎贵运

人閒情事
2026-10-10 15:49:27
为何天安门不挂毛主席照片,反而选择悬挂主席画像?

为何天安门不挂毛主席照片,反而选择悬挂主席画像?

雍亲王府
2026-10-10 08:10:11
被驱逐的老太太死了!这事大了,西班牙民众的怒火被彻底引爆

被驱逐的老太太死了!这事大了,西班牙民众的怒火被彻底引爆

心灵得以滋养
2026-10-09 15:47:48
彻底撕破脸!张继科直播公开控诉刘国梁,揭露师徒决裂真实内幕

彻底撕破脸!张继科直播公开控诉刘国梁,揭露师徒决裂真实内幕

体育见习官
2026-10-05 14:12:07
飞天奖落幕:3人出尽风头,2人镀金成功,1人翻红,唯她不如不来

飞天奖落幕:3人出尽风头,2人镀金成功,1人翻红,唯她不如不来

旧史新谭
2026-10-10 01:02:34
“我们自愿有何罪”?三男三女聚众淫乱,三亚高知换妻游戏案始末

“我们自愿有何罪”?三男三女聚众淫乱,三亚高知换妻游戏案始末

易玄
2026-09-13 11:43:30
苍井空到底和你多大仇,何必呢?

苍井空到底和你多大仇,何必呢?

雷斯林
2026-10-09 12:19:42
iPhone 20:苹果直接跳过19,明年这台二十周年纪念机,变化大到离谱!

iPhone 20:苹果直接跳过19,明年这台二十周年纪念机,变化大到离谱!

明美无限
2026-10-08 20:20:46
笑不活!毛坯的人生,精装的朋友圈,网友:一生要强绝不服输!

笑不活!毛坯的人生,精装的朋友圈,网友:一生要强绝不服输!

水泥土的搞笑
2026-10-09 06:26:12
WTT中国大满贯最新战报:国乒已无缘2冠!三项连输张本美和4场

WTT中国大满贯最新战报:国乒已无缘2冠!三项连输张本美和4场

包饺子ai剪辑
2026-10-10 14:33:51
曝俄军阵亡抚恤金被大幅削减!有的甚至被直接取消

曝俄军阵亡抚恤金被大幅削减!有的甚至被直接取消

项鹏飞
2026-10-07 20:23:33
探访四川巴中“博士之乡”:一个山乡走出33名博士88名硕士,“穷莫丢书富莫丢猪”是信条

探访四川巴中“博士之乡”:一个山乡走出33名博士88名硕士,“穷莫丢书富莫丢猪”是信条

红星新闻
2026-10-09 23:47:54
“这就是不玩手机的下场”,家长拍下初中女孩幼稚行为,还沾沾自喜

“这就是不玩手机的下场”,家长拍下初中女孩幼稚行为,还沾沾自喜

世界圈
2026-09-29 08:53:23
俄方寸步不让:天然气管道非得取道蒙古进入中国

俄方寸步不让:天然气管道非得取道蒙古进入中国

果妈聊娱乐
2026-10-01 16:13:46
江苏一医院门口石狮子拍卖,8人出价26轮以8100元成交

江苏一医院门口石狮子拍卖,8人出价26轮以8100元成交

现代快报
2026-10-10 13:49:20
为什么这届网友怼人功力如此出神入化

为什么这届网友怼人功力如此出神入化

小眼睛小世界
2026-10-10 09:06:10
被叫"富人运动"的高尔夫,她为什么偏要打下去

被叫"富人运动"的高尔夫,她为什么偏要打下去

元气满分吖
2026-10-09 12:10:37
中国电网负债3万亿,外媒称百年难回本

中国电网负债3万亿,外媒称百年难回本

梦想的现实
2026-07-01 01:11:56
2026-10-10 16:20:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12709文章数 117184关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

陪读爸爸自筹200多万把孩子的心事拍成电影 本人发声

头条要闻

陪读爸爸自筹200多万把孩子的心事拍成电影 本人发声

体育要闻

与C罗硬碰硬,一个72岁老人的倔强

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

蹭尊界流量?岚图汽车在“玩火”

汽车要闻

老车主请回避 2026款理想i6升级都是你想要的

态度原创

房产
亲子
本地
公开课
军事航空

房产要闻

475万人,猛增13.1%!国庆海南,又爆了?

亲子要闻

今天是世界精神卫生日。关注孩子的心理健康

本地新闻

踏访沙县第一村,寻国民小吃本源

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美乌将举行新一轮会谈

无障碍浏览 进入关怀版