网易首页 > 网易号 > 正文 申请入驻

1.5B刷新数学代码SOTA!快手清华精细Token管理,LLM推理能力飙升

0
分享至

Archer团队 投稿
量子位 | 公众号 QbitAI

当大模型在数学题和代码任务里“卷”参数规模时,一支来自快手和清华的团队给出了不同答案——

他们用1.5B参数的小模型,在多个推理基准上干过了同量级SOTA。

秘密在于给模型的“学习过程”做了精细化管理:让该记牢的知识稳住,让该灵活的推理放开。

在多个挑战性的数学、代码评测基准上,该团队提出的Archer方法都展现出了强大的实力。



目前,Archer的代码已开源,详细链接可见文末。



“两难”:知识和推理难兼顾

通过预训练,LLM能记住海量的知识。但要让这些知识转化为解决数学题、写复杂代码的推理能力,还得靠后续的强化学习(RL)优化。

其中,带可验证奖励的强化学习(RLVR)是当前的主流方法——简单地说,就是让模型不断尝试解题,通过“是否做对”的反馈调整行为,有点像人类“做题纠错”。

但问题来了:模型输出的内容里,有些是“知识型”的(比如“1+1=2”这类事实),有些是“推理型”的(比如“先算括号里,再算乘除”这类逻辑规划步骤)

过去的RLVR方法要么“一视同仁”,给所有内容用一样的训练信号;要么“粗暴分割”,用梯度屏蔽把两类内容拆开训练。

结果往往是:要么知识逐渐变差(比如把公式记错),要么推理放不开(比如总用老套思路解题)

快手和清华团队发现:这两类内容在模型里其实有明显特征:

  • 低熵Token
  • (确定性高):比如“3.14”、“def函数”,对应事实性知识,训练时不能乱改;
  • 高熵Token
  • (不确定性高):比如“因此”、“接下来”、“循环条件”,对应逻辑推理,需要多尝试。

但关键在于,这两类Token在句子里是“绑在一起”的——比如解数学题时,“因为2+3=5(低熵),所以下一步算5×4(高熵)”,拆开会破坏语义逻辑。

Archer:给Token“差异化训练”

团队提出的Archer方法,核心是“双Token约束”——不拆分Token,而是给它们定制不同的训练规则。

简单说就是两步:

1.先给Token“贴标签”:用熵值分类型

通过计算每个Token的熵值(不确定性),自动区分“知识型”和“推理型”:

  • 高熵Token:比如数学推理里的“接下来”、“综上”,代码里的“循环”、“判断”,是逻辑转折点;
  • 低熵Token:比如“123”、“print”,是必须准确的事实性内容。

团队用“句子级熵统计”替代传统的“批次级统计”——比如同一道数学题,不同解法的Token熵分布不同,按句子单独划分,避免把“关键推理Token”误判成“知识Token”。

2.再给训练“定规矩”:差异化约束

对贴好标签的Token,用不同的规则训练:

  • 推理型(高熵)Token:松约束。用更高的裁剪阈值(允许更大幅度调整)和更弱的KL正则(减少对原始策略的依赖),鼓励模型多尝试不同推理路径;
  • 知识型(低熵)Token:紧约束。用更低的裁剪阈值和更强的KL正则,让模型“死死记住”正确知识,避免越训越错。

这样一来,知识和推理既能同步更新,又不互相干扰——就像老师教学生:基础公式要背牢,解题思路可以大胆试。

从数学到代码:全面碾压同量级模型

在最考验推理能力的数学和代码任务上,Archer的表现都很出色。

数学推理:解题正确率大幅提升



在AIME 2024/2025、Minerva等硬核数学基准上:

  • 相比同基座的原始模型,Archer在AIME24上正确率提升18.1%,AIME25提升10.3%;
  • 对比当前SOTA方法DAPO,Archer在AIME24上多对6.6%的题,AIME25多对5.2%;
  • 1.5B参数的Archer-Math,直接超过了FastCuRL、Nemotron等同量级SOTA模型,平均正确率登顶

代码生成:刷题能力显著增强



在LiveCodeBench(主流代码生成基准)v5/v6上:

  • 相比DAPO,Archer在v5上正确率提升3.4%,v6提升2.6%;
  • 超过了专门优化代码的DeepCoder-1.5B,成为同量级最佳代码生成模型之一。



效率方面,Archer只用单阶段训练、1900H800 GPU小时(对比Nemotron的16000 H100小时),就实现了这些提升。

没有复杂的多轮训练,达到了“花小钱办大事”的效果。

关键在“平衡”

Archer的核心洞察是:LLM推理能力不是“死记硬背”或“盲目试错”,而是知识稳定性和推理探索性的平衡

团队通过实验验证了这种平衡的重要性:





  • 若不给低熵Token加约束(KL=0),模型会很快“记混知识”,输出重复内容,性能崩塌;
  • 若给高熵Token加严约束(裁剪阈值太小),模型推理“放不开”,学不到新方法;
  • 只有让知识Token“”、推理Token“”,才能既不丢基础,又能提升逻辑能力。

这种思路也解释了为什么小模型能逆袭——大模型的参数优势能堆出更多知识,但如果训练时“管不好”知识和推理的关系,能力提升反而受限。

Archer用精细化的Token管理,让小模型的每一个参数都用在刀刃上,学会如何更好的组织使用已有的知识。

论文链接:http://arxiv.org/abs/2507.15778
GitHub:https://github.com/wizard-III/ArcherCodeR

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
传奇落幕:最后一支歼7部队换装,空军又能多上千架无人备用机?

传奇落幕:最后一支歼7部队换装,空军又能多上千架无人备用机?

梁讯
2026-01-19 14:28:07
日本新党中道改革联合发布纲领

日本新党中道改革联合发布纲领

界面新闻
2026-01-19 16:10:03
剧组夜拍雨戏,婴儿长时间淋雨哭得撕心裂肺,片酬仅800元,部分家长因经济压力接受此类拍摄

剧组夜拍雨戏,婴儿长时间淋雨哭得撕心裂肺,片酬仅800元,部分家长因经济压力接受此类拍摄

观威海
2026-01-18 16:34:07
一楼拒交电梯费被告上法庭,败诉后,这张缴费单成了整栋楼的噩梦

一楼拒交电梯费被告上法庭,败诉后,这张缴费单成了整栋楼的噩梦

垛垛糖
2026-01-17 20:25:21
离婚3个月,海哈金喜对李亚鹏的称呼变了,两字之差释放强烈信号

离婚3个月,海哈金喜对李亚鹏的称呼变了,两字之差释放强烈信号

梨花黛娱
2026-01-19 15:33:10
吴冠希:自从格兰主帅上任之后,新疆正朝着正确的方向发展

吴冠希:自从格兰主帅上任之后,新疆正朝着正确的方向发展

懂球帝
2026-01-18 23:19:27
中方潇洒离场,大规模抛售美债,马斯克已通知白宫:美基本没救了

中方潇洒离场,大规模抛售美债,马斯克已通知白宫:美基本没救了

小鬼头体育
2026-01-19 11:46:10
皇马3500万红星崩溃 故意勺子点球踢丢绝杀 非洲杯失冠后含泪领奖

皇马3500万红星崩溃 故意勺子点球踢丢绝杀 非洲杯失冠后含泪领奖

我爱英超
2026-01-19 07:08:25
雷迪克终于看明白了!发布会爆赞蒂米和范德彪作用,早干嘛去了?

雷迪克终于看明白了!发布会爆赞蒂米和范德彪作用,早干嘛去了?

篮球资讯达人
2026-01-19 14:23:48
时机已到!李在明离开日本后,韩国马上喊话中国:请尽快谈判

时机已到!李在明离开日本后,韩国马上喊话中国:请尽快谈判

青辉
2026-01-19 16:10:08
聂卫平人生无憾!一顿饭喝4斤白酒,最爱吃日式烤肉,烟也不离手

聂卫平人生无憾!一顿饭喝4斤白酒,最爱吃日式烤肉,烟也不离手

李健政观察
2026-01-16 19:27:42
掀桌子了,山东某光伏公司放假一年遭员工集体投诉!

掀桌子了,山东某光伏公司放假一年遭员工集体投诉!

黯泉
2026-01-18 21:47:43
稀世铼矿惊现中国!多国携顶尖科技求购,中国硬气表示绝不出手

稀世铼矿惊现中国!多国携顶尖科技求购,中国硬气表示绝不出手

知识TNT
2026-01-17 14:30:03
总统当不成了?就在刚刚,最新投票结果公布,特朗普或提前下台!

总统当不成了?就在刚刚,最新投票结果公布,特朗普或提前下台!

风眼军情
2026-01-18 19:23:07
心中的队长,库利巴利、盖伊执意让马内戴上队长袖标第一个捧杯

心中的队长,库利巴利、盖伊执意让马内戴上队长袖标第一个捧杯

懂球帝
2026-01-19 12:40:15
U23意外收获,欧联豪门本想考察日韩球员,却发现了22岁国足新星

U23意外收获,欧联豪门本想考察日韩球员,却发现了22岁国足新星

体坛风之子
2026-01-19 04:30:02
李亚鹏名下医院欠租破1.1亿!拍片解释房东心寒:我是救狼的东郭先生

李亚鹏名下医院欠租破1.1亿!拍片解释房东心寒:我是救狼的东郭先生

ETtoday星光云
2026-01-19 12:30:05
满屏荷尔蒙!Netflix这一脱,又赢麻了

满屏荷尔蒙!Netflix这一脱,又赢麻了

来看美剧
2026-01-16 20:05:37
吴磊大瓜女主角再发文!信息量大曝两人同居细节,海量生活照流出

吴磊大瓜女主角再发文!信息量大曝两人同居细节,海量生活照流出

娱乐圈圈圆
2026-01-19 14:54:02
万万没想到,6年前反中乱港分子的幕后金主,竟是个“爱国”商人

万万没想到,6年前反中乱港分子的幕后金主,竟是个“爱国”商人

百态人间
2026-01-17 16:16:00
2026-01-19 16:48:49
量子位 incentive-icons
量子位
追踪人工智能动态
12031文章数 176360关注度
往期回顾 全部

科技要闻

这一仗必须赢!马斯克死磕芯片"9个月一更"

头条要闻

嫣然天使基金暂停筹款 工作人员:常规筹款预算已筹满

头条要闻

嫣然天使基金暂停筹款 工作人员:常规筹款预算已筹满

体育要闻

错失英超冠军奖牌,他却在德甲成为传奇

娱乐要闻

离婚三年,孙怡董子健首次公开互动

财经要闻

公章争夺 家族反目 双星为何从顶端跌落?

汽车要闻

徐军:冲击百万销量,零跑一直很清醒

态度原创

家居
本地
房产
旅游
公开课

家居要闻

隽永之章 清雅无尘

本地新闻

云游内蒙|黄沙与碧波撞色,乌海天生会“混搭”

房产要闻

封关刚刚满月,海南真爆了!三亚房价,涨幅冲上全国第三!

旅游要闻

60分钟航程穿越千年,“大运扬州”游船演艺缘何跻身国家级精品?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版