智能体记忆一直有个尴尬:上下文越长,KV 状态越臃肿,推理越慢。KVMEM 给出的思路是——把旧的 KV 状态分页存起来,而不是全部塞在显存里硬扛。
效果直接体现在数字上。在 DeepSWE 上跑 Qwen3.8-27B,Pass@1 从 43.8% 提升到 48.4%。这个成绩优于只用压缩的方案,说明分页旧状态比单纯压缩更管用。
![]()
恢复速度才是关键差异
更值得注意的是恢复速度。在受控基准上,KVMEM 比 Compact+RAG 快 11.4 到 53.8 倍。对于需要反复调取历史记忆的智能体来说,这个差距决定了它能不能在百万 token 级别真正跑起来。
分页这个动作本身不新鲜,难的是在 KV 状态上做对——既要保住精度,又要让旧状态随时可召回。KVMEM 把这两件事同时压进了同一套机制里。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.