网易首页 > 网易号 > 正文 申请入驻

X上63万人围观的Traning-Free GRPO:把GRPO搬进上下文空间学习

0
分享至

年初的 DeepSeek-R1,带来了大模型强化学习(RL)的火爆。无论是数学推理、工具调用,还是多智能体协作,GRPO(Group Relative Policy Optimization)都成了最常见的 RL 算法。

GRPO 的核心思路很简单却强大:

  • 对同一个问题,同时生成多条解答路径(rollout)
  • 给这些路径打分,比较组内优劣
  • 再根据优势信号来更新模型参数,让模型越来越偏好高质量解法

这种「多路径并行 + 组内优势」的机制,虽然比传统 PPO 等方法更加简洁,但仍然需要优化模型参数, 太贵了!

  • 在 32B 量级的模型上训练一次 RL,就可能要花掉上万美元
  • 如果是 600B 级别的超大模型,成本和工程难度更是上天

这让 GRPO 虽然强大,却几乎只能由巨头来玩,中小团队和个人开发者根本「玩不起」。

能不能不改模型参数,也来跑一遍 GRPO?

腾讯优图的一篇最新论文就提出了一个非常有意思的答案:既然更新参数这么贵,那就不更新参数,直接把 GRPO 的「学习过程」搬进上下文空间!

  • 论文标题:Training-Free Group Relative Policy Optimization
  • arXiv 链接:
  • https://arxiv.org/abs/2510.08191
  • GitHub 地址:
  • https://github.com/TencentCloudADP/youtu-agent/tree/training_free_GRPO

Training-Free GRPO 是把 GRPO 训练的整个范式迁移到了上下文学习之中:

  • 训练集上多轮迭代学习,然后在独立的测试集上验证
  • 每轮中,对同一道题目并行生成多条解答(Rollout)
  • 对比组内不同解法的差异,提取文本型组内优势(Semantic Group Advantage),对齐 GRPO 里的数值型组内优势
  • 根据这些文本优势优化一个文本型 LoRA,对齐 GRPO 里的参数型 LoRA

举个例子,对于训练集里这道数学几何题,模型会生成多个不同的解答路径(Rollout),可能会出现不同的解题路径,有的做对了有的做错了。

随后,模型总结不同解法的过程与正确性,从而比较同一组内的不同解答。这个过程自然提炼出文本型组内优势:总结出有的做法为什么对,有的做法为什么错。比如例子里:

  • 错误的解法不仅设错方向,还没有做条件约束检查
  • 成功的解法则正确了设定坐标方向,也系统化验证了所有条件

在一个迭代里,得到每道题的文本型组内优势后,模型就把当前批次的优势都更新文本型 LoRA 里,也就是对经验库进行增删改,沉淀学习到的经验。

实验效果

在数学推理上,仅用100 个训练样本,花费约 8-18 美元,就能在已经足够强大的 671B 模型上继续提升性能。

无论是否采用代码工具(CI,code interpreter)帮助解题,在 AIME 榜单上的 Mean@32 指标都能实现提升。

令人惊喜的是,在三个轮次中,训练集和测试集的平均工具调用次数均有所减少。这表明 Training-Free GRPO 不仅能够鼓励正确的推理和行动,还能教会代理找捷径,更高效明智地使用工具。

而在网页搜索场景中,Training-Free GRPO 同样无需更新模型参数,即可在 DeepSeek-V3.1-Terminus 强悍水平之上,实现了 4.6% 的 Pass@1 显著提升。

为什么需要 Training-Free GRPO?


  • 保留 GRPO 的强化学习优势

多路径探索、group advantage、多轮迭代、完全独立的训练与测试集……这些 GRPO 的精华一项不少,全部在上下文层面重现了出来。

  • 成本暴降

不用训练模型参数,仅需少量数据,并且全程只靠 API 随用随付!

只需 8~18 美元以及 100 条训练数据,就能在 671B LLM 上跑完多轮的强化学习训练!远远低于 32B 模型的训练成本。

  • 泛化更好

与 Self-Refine 这类就地改写不同,Training-Free GRPO 是在独立数据集上多轮迭代训练的,对测试集里的 Out-of-Domain (OOD) 数据都有显著提升。

并且,参数微调后的 32B 级别模型往往只能胜任特定窄域任务,可能需要多个专用模型来覆盖完整业务需求,显著增加了系统复杂度和维护成本。而 Training-Free GRPO 只需要一个统一的模型和 API 就可以泛化到不同的场景!

小结:RL 不一定非得有梯度

过去我们默认,强化学习就意味着参数更新。虽然前期有一些上下文空间优化的探索如 Self-Refine、Reflexion、TextGrad 等,但 Training-Free GRPO 与他们不同,完全对齐了参数空间 RL 训练的流程和细节:

  • 把 GRPO 的「独立训练集 + 多轮迭代 + 并行 Rollout + 组内优势」这套 RL 训练范式,整体迁移到上下文空间,在不训练模型的情况下,也能获得强化学习效果。
  • 这让超大模型的 RL 优化变得廉价、灵活、可持续,也给每个开发者的小业务提供了用得起的新方案。

本文方法已开源,欢迎 Star 和试用!

预告:Training-Free GRPO 将作为一个新功能集成到 Youtu-Agent 框架中,帮助开发者们进一步提升各种自定义场景的效果。

注:成本计算基于 DeepSeek API 官方定价,实际可能因使用情况而有所波动。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
19:0 全票通过!集齐 6 国驻军协议,菲律宾会在南海打响第一枪吗?

19:0 全票通过!集齐 6 国驻军协议,菲律宾会在南海打响第一枪吗?

面包夹知识
2026-08-14 14:49:55
中国公开赛周跃龙独创半决赛,塞尔比挡住萝卜,世界第一纷争再起

中国公开赛周跃龙独创半决赛,塞尔比挡住萝卜,世界第一纷争再起

天涯远行人
2026-08-15 09:14:55
央视《重器》:顶着“歪瓜脸”却要演大学生,谁的审美出了问题?

央视《重器》:顶着“歪瓜脸”却要演大学生,谁的审美出了问题?

林轻吟
2026-08-14 14:37:20
布拉德·皮特《兽心》2026年9月25日上映,观众喊话:狗若死了就烧影院

布拉德·皮特《兽心》2026年9月25日上映,观众喊话:狗若死了就烧影院

码上闲叙
2026-08-15 01:24:50
省下 1.5 亿!巴萨王牌封神操作!完美改造复刻巅峰梅西

省下 1.5 亿!巴萨王牌封神操作!完美改造复刻巅峰梅西

澜归序
2026-08-15 09:11:08
上海公开征集涉黑涉恶违法犯罪线索,举报方式公布

上海公开征集涉黑涉恶违法犯罪线索,举报方式公布

澎湃新闻
2026-08-14 18:03:25
WTT大满贯:女乒18岁小将闪耀!连胜日本队2人,从资格赛打进8强

WTT大满贯:女乒18岁小将闪耀!连胜日本队2人,从资格赛打进8强

云隐南山
2026-08-15 07:51:12
又是2-0领先被逆转!21岁的陈熠,为何总在关键时刻“差点意思”

又是2-0领先被逆转!21岁的陈熠,为何总在关键时刻“差点意思”

好球去哪了
2026-08-06 20:09:39
朱总理的魄力

朱总理的魄力

朋笔生辉
2026-08-13 01:07:36
上海70发父亲,被女儿当众骂哭后悄然离世:有些孝顺,比烟更伤人

上海70发父亲,被女儿当众骂哭后悄然离世:有些孝顺,比烟更伤人

叮当当科技
2026-08-15 02:25:30
52岁前成人片女星詹娜·詹姆森与女性伴侣闪婚,婚后自曝“内心从未如此平静”

52岁前成人片女星詹娜·詹姆森与女性伴侣闪婚,婚后自曝“内心从未如此平静”

影视情报室
2026-08-15 01:30:32
朝鲜3万大军杀入!导弹狂轰乌克兰,泽连斯基急了,中国要不要学

朝鲜3万大军杀入!导弹狂轰乌克兰,泽连斯基急了,中国要不要学

霁寒飘雪
2026-08-14 16:34:38
我台湾人,刚从四川成都回来,实在忍不住想说:对成都的6点印象

我台湾人,刚从四川成都回来,实在忍不住想说:对成都的6点印象

夜深爱杂谈
2026-08-14 21:16:13
巨额转会?塔帅:我确实惊讶,但一方愿卖一方愿买也很合理

巨额转会?塔帅:我确实惊讶,但一方愿卖一方愿买也很合理

懂球帝
2026-08-14 23:05:02
从高调官宣到删光合照、退股拆伙,汪峰用沉默“逼”走了第四任森林北

从高调官宣到删光合照、退股拆伙,汪峰用沉默“逼”走了第四任森林北

子芫伴你成长
2026-08-14 20:56:23
比没钱更糟糕!郑爽美国近况被曝,经济状况被扒,这辈子再难翻身

比没钱更糟糕!郑爽美国近况被曝,经济状况被扒,这辈子再难翻身

娱瓜酱
2026-08-14 14:56:30
波兰名将辱华未道歉!波兰队主帅:开玩笑可能会被利用 制造丑闻

波兰名将辱华未道歉!波兰队主帅:开玩笑可能会被利用 制造丑闻

念洲
2026-08-14 08:34:52
很遗憾,就算美国国债到了4000万亿,它也崩不了......

很遗憾,就算美国国债到了4000万亿,它也崩不了......

一个坏土豆
2026-08-13 21:08:04
CCTV直播!国乒男单全部出局!陈熠死磕张本美和!王曼昱战黑马!蒯曼硬刚早田希娜!大满贯15日赛程出炉

CCTV直播!国乒男单全部出局!陈熠死磕张本美和!王曼昱战黑马!蒯曼硬刚早田希娜!大满贯15日赛程出炉

好乒乓
2026-08-15 07:00:59
实习生发了六张手术室照片,整个医疗圈炸了锅

实习生发了六张手术室照片,整个医疗圈炸了锅

网络易不易
2026-08-14 06:45:21
2026-08-15 09:48:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13760文章数 142718关注度
往期回顾 全部

科技要闻

600亿美元收购落地 马斯克正式杀入

头条要闻

牛弹琴:特朗普最新宣布 全世界目瞪口呆

头条要闻

牛弹琴:特朗普最新宣布 全世界目瞪口呆

体育要闻

离开雷霆后,威少再也没成为威少

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

便利蜂加盟遭立案:"0元加盟"生意被查

汽车要闻

红旗“家”年华现场:这一次,智能科技成了主角

态度原创

手机
艺术
家居
房产
军事航空

手机要闻

苹果在意大利撤下“幼儿手持iPhone”争议宣传海报

艺术要闻

吉达塔建设高度突破430米,最终目标1008米!

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

金茂、招商,海南多个岗位招人!

军事要闻

特朗普下令美海军弃用电磁弹射系统 改回蒸汽弹射

无障碍浏览 进入关怀版