网易首页 > 网易号 > 正文 申请入驻

1.5B刷新数学代码SOTA!快手清华精细Token管理,LLM推理能力飙升

0
分享至

Archer团队 投稿
量子位 | 公众号 QbitAI

当大模型在数学题和代码任务里“卷”参数规模时,一支来自快手和清华的团队给出了不同答案——

他们用1.5B参数的小模型,在多个推理基准上干过了同量级SOTA。

秘密在于给模型的“学习过程”做了精细化管理:让该记牢的知识稳住,让该灵活的推理放开。

在多个挑战性的数学、代码评测基准上,该团队提出的Archer方法都展现出了强大的实力。

目前,Archer的代码已开源,详细链接可见文末。

“两难”:知识和推理难兼顾

通过预训练,LLM能记住海量的知识。但要让这些知识转化为解决数学题、写复杂代码的推理能力,还得靠后续的强化学习(RL)优化。

其中,带可验证奖励的强化学习(RLVR)是当前的主流方法——简单地说,就是让模型不断尝试解题,通过“是否做对”的反馈调整行为,有点像人类“做题纠错”。

但问题来了:模型输出的内容里,有些是“知识型”的(比如“1+1=2”这类事实),有些是“推理型”的(比如“先算括号里,再算乘除”这类逻辑规划步骤)

过去的RLVR方法要么“一视同仁”,给所有内容用一样的训练信号;要么“粗暴分割”,用梯度屏蔽把两类内容拆开训练。

结果往往是:要么知识逐渐变差(比如把公式记错),要么推理放不开(比如总用老套思路解题)

快手和清华团队发现:这两类内容在模型里其实有明显特征:

  • 低熵Token
  • (确定性高):比如“3.14”、“def函数”,对应事实性知识,训练时不能乱改;
  • 高熵Token
  • (不确定性高):比如“因此”、“接下来”、“循环条件”,对应逻辑推理,需要多尝试。

但关键在于,这两类Token在句子里是“绑在一起”的——比如解数学题时,“因为2+3=5(低熵),所以下一步算5×4(高熵)”,拆开会破坏语义逻辑。

Archer:给Token“差异化训练”

团队提出的Archer方法,核心是“双Token约束”——不拆分Token,而是给它们定制不同的训练规则。

简单说就是两步:

1.先给Token“贴标签”:用熵值分类型

通过计算每个Token的熵值(不确定性),自动区分“知识型”和“推理型”:

  • 高熵Token:比如数学推理里的“接下来”、“综上”,代码里的“循环”、“判断”,是逻辑转折点;
  • 低熵Token:比如“123”、“print”,是必须准确的事实性内容。

团队用“句子级熵统计”替代传统的“批次级统计”——比如同一道数学题,不同解法的Token熵分布不同,按句子单独划分,避免把“关键推理Token”误判成“知识Token”。

2.再给训练“定规矩”:差异化约束

对贴好标签的Token,用不同的规则训练:

  • 推理型(高熵)Token:松约束。用更高的裁剪阈值(允许更大幅度调整)和更弱的KL正则(减少对原始策略的依赖),鼓励模型多尝试不同推理路径;
  • 知识型(低熵)Token:紧约束。用更低的裁剪阈值和更强的KL正则,让模型“死死记住”正确知识,避免越训越错。

这样一来,知识和推理既能同步更新,又不互相干扰——就像老师教学生:基础公式要背牢,解题思路可以大胆试。

从数学到代码:全面碾压同量级模型

在最考验推理能力的数学和代码任务上,Archer的表现都很出色。

数学推理:解题正确率大幅提升

在AIME 2024/2025、Minerva等硬核数学基准上:

  • 相比同基座的原始模型,Archer在AIME24上正确率提升18.1%,AIME25提升10.3%;
  • 对比当前SOTA方法DAPO,Archer在AIME24上多对6.6%的题,AIME25多对5.2%;
  • 1.5B参数的Archer-Math,直接超过了FastCuRL、Nemotron等同量级SOTA模型,平均正确率登顶

代码生成:刷题能力显著增强

在LiveCodeBench(主流代码生成基准)v5/v6上:

  • 相比DAPO,Archer在v5上正确率提升3.4%,v6提升2.6%;
  • 超过了专门优化代码的DeepCoder-1.5B,成为同量级最佳代码生成模型之一。

效率方面,Archer只用单阶段训练、1900H800 GPU小时(对比Nemotron的16000 H100小时),就实现了这些提升。

没有复杂的多轮训练,达到了“花小钱办大事”的效果。

关键在“平衡”

Archer的核心洞察是:LLM推理能力不是“死记硬背”或“盲目试错”,而是知识稳定性和推理探索性的平衡

团队通过实验验证了这种平衡的重要性:

  • 若不给低熵Token加约束(KL=0),模型会很快“记混知识”,输出重复内容,性能崩塌;
  • 若给高熵Token加严约束(裁剪阈值太小),模型推理“放不开”,学不到新方法;
  • 只有让知识Token“”、推理Token“”,才能既不丢基础,又能提升逻辑能力。

这种思路也解释了为什么小模型能逆袭——大模型的参数优势能堆出更多知识,但如果训练时“管不好”知识和推理的关系,能力提升反而受限。

Archer用精细化的Token管理,让小模型的每一个参数都用在刀刃上,学会如何更好的组织使用已有的知识。

论文链接:http://arxiv.org/abs/2507.15778
GitHub:https://github.com/wizard-III/ArcherCodeR

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
默森:由于曼城没有大胜伯恩利,我认为阿森纳仍占据争冠优势

默森:由于曼城没有大胜伯恩利,我认为阿森纳仍占据争冠优势

懂球帝
2026-04-25 01:19:05
留力欧冠!图片报:拜仁对美因茨可能大轮换 基米希、奥利塞首发

留力欧冠!图片报:拜仁对美因茨可能大轮换 基米希、奥利塞首发

兰亭墨未干
2026-04-25 00:18:07
美国高规格邀请俄罗斯参加G20峰会,这说明什么?

美国高规格邀请俄罗斯参加G20峰会,这说明什么?

山河路口
2026-04-23 21:04:50
60~75岁老人,除不爬高外,这八件事也没做,你就是一位宝藏老人

60~75岁老人,除不爬高外,这八件事也没做,你就是一位宝藏老人

暖风吹过竹林
2026-04-24 09:22:48
郭冬临现状:住北京老房子,身形消瘦、脸颊凹陷,59岁无儿无女

郭冬临现状:住北京老房子,身形消瘦、脸颊凹陷,59岁无儿无女

娱说瑜悦
2026-04-23 16:04:39
中国三大长寿食物,鱼只能排到第三,第一名很多人想不到!

中国三大长寿食物,鱼只能排到第三,第一名很多人想不到!

江江食研社
2026-02-12 12:30:10
1.5亿打了20分被弃用!为了铁人称号,常规赛全勤,季后赛没劲了

1.5亿打了20分被弃用!为了铁人称号,常规赛全勤,季后赛没劲了

你的篮球频道
2026-04-24 12:18:36
曼联野心勃勃的引援名单曝光!四大引援优先目标出炉,下赛季冲冠

曼联野心勃勃的引援名单曝光!四大引援优先目标出炉,下赛季冲冠

夜白侃球
2026-04-24 10:57:35
伊朗将把美以伊战争纳入教材,伊朗教育部长:将在教材编写中呈现本次战争中的“记忆”

伊朗将把美以伊战争纳入教材,伊朗教育部长:将在教材编写中呈现本次战争中的“记忆”

鲁中晨报
2026-04-24 17:56:01
啊!利拉德有望季后赛复出!NBA又将诞生医学奇迹

啊!利拉德有望季后赛复出!NBA又将诞生医学奇迹

篮球实战宝典
2026-04-24 19:37:25
谢霆锋做梦都想不到儿子最狠的报复不是恨他,而是彻底超越他

谢霆锋做梦都想不到儿子最狠的报复不是恨他,而是彻底超越他

小邵说剧
2026-04-23 16:45:21
中国突然放出话来:以后再也不当那个任劳任怨的冤大头了

中国突然放出话来:以后再也不当那个任劳任怨的冤大头了

阿七说史
2026-03-29 05:30:03
美司法部撤销对美联储及其主席鲍威尔的刑事调查

美司法部撤销对美联储及其主席鲍威尔的刑事调查

每日经济新闻
2026-04-25 00:14:11
55年贺龙拿着授衔名单找毛主席评理,毛主席看后坦言:确实评低了

55年贺龙拿着授衔名单找毛主席评理,毛主席看后坦言:确实评低了

鉴史录
2024-09-05 16:48:36
行程开始,中方专机抵美,G20峰会已出变故,80岁总统硬刚特朗普

行程开始,中方专机抵美,G20峰会已出变故,80岁总统硬刚特朗普

凡知
2026-04-24 18:43:08
白人女性与黑人女性的体味差异,网友真实分享引发热议

白人女性与黑人女性的体味差异,网友真实分享引发热议

特约前排观众
2025-12-22 00:20:06
森林狼大胜掘金!再次证明斯通无能,奇兵25分9助,火箭后悔去吧

森林狼大胜掘金!再次证明斯通无能,奇兵25分9助,火箭后悔去吧

刘哥谈体育
2026-04-25 03:17:17
蒋万安发出强硬警告,“中国台湾省”走向国际,10国选择明智应对

蒋万安发出强硬警告,“中国台湾省”走向国际,10国选择明智应对

悄悄史话
2026-04-25 00:35:24
天雷滚滚,今天3家公司被实施st退市风险警示停牌,12万股东踩雷

天雷滚滚,今天3家公司被实施st退市风险警示停牌,12万股东踩雷

丁丁鲤史纪
2026-04-24 10:58:29
真正的聪明,是学会“躲”着过日子

真正的聪明,是学会“躲”着过日子

青苹果sht
2026-04-03 05:52:19
2026-04-25 04:39:00
量子位 incentive-icons
量子位
追踪人工智能动态
12528文章数 176457关注度
往期回顾 全部

科技要闻

DeepSeek V4牵手华为,价格依然"屠夫级"

头条要闻

航班提前起飞10分钟 大学生把海航告了

头条要闻

航班提前起飞10分钟 大学生把海航告了

体育要闻

上海男篮23连胜+主场全胜 姚明之后最强一季

娱乐要闻

停工16个月!赵露思证实接拍新剧

财经要闻

LG财阀内斗:百亿美元商业帝国争夺战

汽车要闻

零跑Lafa5 Ultra北京车展上市:11.88-12.48万

态度原创

房产
本地
艺术
旅游
军事航空

房产要闻

新一轮教育大爆发来了!海口,开始疯狂建学校!

本地新闻

云游中国|逛世界风筝都 留学生探秘中国传统文化

艺术要闻

世界最高20座大楼,你见过几栋?

旅游要闻

“嗨”在春风里丨盐溪烟树引“仙客”,七灶村里绘“远方”

军事要闻

美伊陷入互相封锁僵局

无障碍浏览 进入关怀版