Agent强化学习(RL)正撞上一堵墙:环境供给。训练一个Agent,需要源源不断提供难度足够、能教它新东西的环境。但最近的方法,大多从Agent自身rollout(运行轨迹)暴露的弱点里生成新环境——这条路,正暴露出两个致命问题。
腾讯这篇新论文,给出了一个完全不同的解法:环境进化。不观察Agent,不盯弱点,直接从多轮训练目标推导出三种让环境变难的方法,按固定节奏逐代应用。论文发布后,社区反响热烈,被认为是环境演化方向值得一读的重要工作。
![]()
从弱点造环境,为什么走不通?
先看现有方法的困境。基于Agent自身弱点构建环境,听起来合理:哪里不会补哪里。但问题在于,环境继承了Agent的盲区——Agent看不到的,生成器也看不到,导致训练出的模型泛化能力差。更糟的是,随着Agent变强,它暴露的弱点越来越少,可供造环境的素材随之枯竭,学习信号越来越弱,训练陷入停滞。
这就像让学生自己出题考自己:会的题反复出,不会的题永远出不来。训练效率随能力提升而递减,最终卡在瓶颈上。
环境进化:不盯Agent,只盯难度
腾讯的方法绕开了这个死循环。核心思路是:环境难度提升,不需要观察Agent的表现。论文从多轮训练目标(multi-turn training objective)出发,严格推导出三种让环境变难的操作方式,然后按固定时间表,一代一代地应用这些操作,让环境持续进化。
这种方式的好处在于,环境难度的提升是客观的、可验证的,不依赖Agent当前的能力水平。Agent强了,环境照样变难;Agent弱了,环境也不会因此停滞。训练信号始终稳定。
先验证再信任:三个强模型全部翻车
论文在信任生成器之前,先做了严格的难度验证。测试结果显示,Hy4 preview、Claude Opus 5和GPT-5.6 Sol这三个模型,在进化后的环境上表现全部变差。这直接证明了环境难度的提升是真实有效的,不是模型自身能力波动的错觉。
这个验证步骤很关键——如果生成的环境连更强的模型都能轻松应对,那训练信号就毫无意义。三个模型的集体"翻车",恰恰说明进化后的环境确实构成了新的挑战。
实战成绩:两个模型分别涨14.4和18.0分
验证完难度,再看实际训练效果。论文在Qwen3.6-27B和Qwen3.6-35B-A3B两个模型上,用普通的长程RL(long-horizon RL)训练,配合进化后的环境,在Terminal-Bench 2.1基准上分别提升了14.4分和18.0分。
值得注意的是,这里用的是"普通"的RL方法,没有额外花哨的技巧。也就是说,成绩的提升几乎全部来自环境本身的质量——环境进化带来的增益,是实打实的。
为什么这篇论文值得关注?
Agent RL的瓶颈正在从模型能力转向环境供给。过去大家拼模型架构、拼算力,现在拼的是谁能持续产出高质量训练环境。腾讯这篇论文的价值在于,它提供了一个不依赖Agent弱点、可规模化、可验证的环境生成框架,直接回应了当前社区最迫切的痛点。
如果环境进化这条路走通,Agent RL的训练范式可能会迎来一轮新的变化——不再需要盯着Agent的短板打补丁,而是让环境本身成为持续进化的"对手"。论文已发布在academy.dair.ai,值得收藏细读。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.