AutoHarness、AutoContext,现在又来了个AutoCompact。一条越来越清晰的线索是:把原本由外部框架做的事,训练进模型本身。这次被交出去的权力,是"什么时候压缩上下文"。
AutoCompact 的核心思路很直接——让智能体自己决定何时压缩、保留哪些工作状态、以及压缩后如何接着干。这套机制和 Meta 那篇训练模型原生管理上下文的论文思路相近,但落点更具体:压缩这个动作,从框架的固定规则变成了模型的一项可学习能力。
![]()
先纠错,再训练
训练流程分两步走。第一步,由一个评判者先审查基础智能体的压缩决策,在它真正执行之前,把有问题的决策替换掉。这些被修正过的轨迹,用来做监督微调。
第二步是强化学习,奖励信号直接来自任务是否成功。这样一来,写代码和压缩上下文这两件事被放在一起训练,而不是分开优化。
效果体现在数字上:在 SWE-bench Verified 上通过率提升 9.2 个百分点,在 SWE-PolyBench Verified 上提升 5.0 个百分点。
窗口不溢出,收益依然在
一个值得注意的细节是,即便把上下文窗口开到 256K、根本不会溢出的情况下,这种学出来的压缩能力依然带来增益。这说明它的价值不只是"省空间"——当上下文空间不再是瓶颈时,主动压缩仍然有用。
换句话说,压缩在这里更像是一种主动的信息管理,而不是被动的容量救急。
作者把这种主动压缩归为一种"模型-框架协同设计":框架提供压缩机制,模型学会何时调用它、保留什么、之后怎么继续。分工没有消失,只是边界被重新划了一次。
至于这套方法在更大规模上表现如何、跨不同框架是否稳健,目前还没有答案。
另一个悬而未决的方向是组合问题:框架里已经打包好的那些基于规则的压缩技术,怎么和这种由模型主动调用的压缩方式配合起来用。规则负责兜底,模型负责判断时机,听起来合理,但具体怎么接还没定论。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.