上下文窗口开到256K、永远不会溢出,通过率却还能再涨——这件事本身就值得琢磨。AutoCompact 训练智能体自己决定什么时候压缩上下文,在 SWE-bench Verified 上通过率提升 9.2 个百分点,在 SWE-PolyBench Verified 上提升 5.0 个百分点。
更关键的是,这个增益在窗口足够大、根本不会溢出的情况下依然成立。也就是说,学会压缩上下文的价值,不只是"省空间"。
![]()
它到底训练了什么
AutoCompact 让智能体自己决定三件事:什么时候压缩、保留哪些工作状态、压缩后怎么继续。这三点合起来,才是"自主压缩"的完整含义。
训练流程分两步。先由一个裁判(judge)审查基础智能体的压缩决策,在决策执行前把有问题的替换掉。修正后的轨迹用来做 SFT,再用任务成功奖励做 RL,把编码和压缩放在一起训练。
作者提到,这种主动压缩属于一种模型-框架协同设计:框架提供压缩机制,模型学习何时调用它、保留什么、之后如何继续。
正方:这是趋势的一部分
从 AutoHarness 到 AutoContext,再到 AutoCompact,一条线索越来越清晰——把原本由框架承担的工作,训练进模型本身。AutoCompact 正是这条线上的一环,专门训练智能体自己决定何时压缩。
支持这个方向的人会指出,增益在 256K 窗口下依然存在,说明学到的压缩能力有独立价值,不是被上下文长度逼出来的权宜之计。
反方:规模与鲁棒性还没答案
问题也很直接。这套方法在更大规模上表现如何,在不同框架之间是否稳健,目前都还没有定论。
另一个悬而未决的点是组合方式:框架里已经打包好的基于规则的压缩技术,和更多由模型主动调用的压缩方式,两者该怎么结合,仍待探索。
换句话说,AutoCompact 证明了"模型自己决定压缩"能带来可测量的提升,但没有证明它在所有场景下都成立。
我的判断
9.2 分和 5.0 分是实打实的数字,且增益不依赖窗口溢出这个前提,这让它比"省 token"类的优化更有分量。但规模化和跨框架鲁棒性这两个问号不解决,它更像一个方向性的验证,而不是可以直接照搬的方案。
论文地址:arxiv.org/abs/2610.02163
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.