网易首页 > 网易号 > 正文 申请入驻

牛津、英伟达等提出记忆压缩新范式:训练时让模型学会断舍离

0
分享至

编辑|Panda


2026 年初,各大 AI 厂商在上下文窗口长度上展开激烈角逐。Google 的 Gemini 3 Pro 已支持 100 万级 token 上下文,Meta 的 Llama 4 Scout 更宣称可处理 1000 万 token。GPT-5 系列也在快速推进长上下文能力。

按这个趋势,今天的大模型已经能够一口气读完整套《哈利・波特》,未来甚至可能直接分析整个大型代码仓库。

但数字背后也隐藏着一个关键问题:上下文越长,模型就越「记不住」。

这并非模型不够聪明,而是 Transformer 架构本身的工程约束。当模型处理长文本时,需要为每个 token 保存 Key-Value(KV)状态,用于后续生成时的注意力计算。这个缓存区域被称为 KV Cache。

KV Cache 的大小会随上下文长度线性增长:输入越长,占用的 GPU 显存越多,推理速度也越慢。对于百万 token 级别的输入,在大型模型和高精度推理场景下,KV Cache 的内存开销可达到数十到数百 GB,远超单张顶级 GPU 的显存容量。

上下文窗口的竞赛,本质上是一场显存的战争。

面对这一困境,研究者们已经开发出多种「事后压缩」方案,也就是在模型训练完成之后,用各种算法对 KV 缓存进行精简。这些方法确实有效,但它们都遗漏了一个更根本的问题:如果模型在最初学习的时候,就没有被引导去生成「容易被压缩」的内部表示,那么后期无论怎么压缩,效果都将受到天花板限制。

就在这一背景下,来自牛津大学、以色列理工学院、AITHYRA 和英伟达的联合研究团队提出了一个新的思路:与其事后弥补,不如训练时就让模型主动学会「压缩友好」的记忆方式。



他们将这套方法命名为KV-CAT(KV 压缩感知型训练,KV-Compression Aware Training)。



  • 论文标题:Training Transformers for KV Cache Compressibility
  • 论文地址:https://arxiv.org/abs/2605.05971

KV 缓存为何如此难压缩?

要理解这项研究的价值,先得弄清楚一个直觉上看似奇怪的事实:两个输出完全相同的模型,其 KV 缓存可能一个极易压缩,另一个根本无法压缩。

这听起来很反直觉。我们通常认为,如果两个系统的「结果」相同,它们的内部过程应该没有本质区别。但在神经网络世界里并非如此。

研究团队用一个简单的例子来说明这一点:「词频统计」。给模型输入一段文字,让它统计每个字母出现了多少次。这是一个只依赖「汇总信息」的任务,与每个字母出现的顺序无关。

同样完成这个任务,可以有两种截然不同的内部实现方式。

第一种是「自然而然」的实现:模型对每个 token 进行独立编码,最后通过注意力机制对全部 token 做平均,得出统计结果。这种方法简单直接,但存在一个致命缺陷:任何对 KV 缓存的压缩都会打破平均计算,导致最终结果出错。研究团队从数学上证明了:这种实现方式,在理论上对任何程度的压缩都不具备容错能力。

第二种是「结构化」的实现:模型在处理每个 token 时,额外记录序列的位置信息(即这段前缀有多长),当 KV 缓存被压缩成一个单一的向量时,模型可以利用位置信息对压缩后的汇总值进行重新校准,从而恢复正确的统计结果。这种实现方式,理论上可以将任意长度的前缀压缩到仅剩一对 KV 向量,同时保持零误差。

两种实现,相同的输出,截然不同的压缩性。

关键在于:标准的模型训练过程,完全没有激励让模型去选择第二种更结构化的实现。因为在没有压缩的场景下,两种方式效果完全一样,训练信号无从区分。

核心方法

让模型在「戴着枷锁」的情况下学习

认识到这一点后,研究团队设计了 KV-CAT 训练方案。核心思路极为直接:如果你想让模型学会在 KV 缓存被压缩的情况下正常工作,就在训练时模拟这种压缩压力。



这类似于一种「记忆障碍训练」。普通的模型训练就像让学生在考试时可以带着完整的笔记本作答 —— 当然表现优异。而 KV-CAT 则是在训练时就没收大部分笔记,逼着学生将最重要的信息内化成真正的「理解」,而非对笔记的依赖。

具体来说,KV-CAT 在原有的预训练模型基础上,引入了一组轻量级的「路由器」模块。这些路由器在训练的每一步会动态判断哪些 KV 槽位是必要的、哪些可以被屏蔽,目标是保留约 50% 的 KV 缓存。每次前向传播,模型需要同时进行两次计算:一次是正常的「全量」计算(所有 KV 槽位都可见),一次是「压缩」计算(仅保留路由器选中的 KV 槽位)。

训练目标由三部分组成:



  • 自蒸馏损失,让压缩模式下的输出尽量逼近全量模式下的输出;
  • 锚定损失,直接对全量模式施加标准的下一个词预测目标,确保模型的基础能力不退化;
  • 预算损失,约束路由器实际保留的 KV 比例不偏离 50% 的目标太多。

整个流程完成后,路由器模块在推理时会被关闭。输出的是一个标准的 Transformer 模型,它的参数与原模型相同,但其内部已经被训练成一种「天然压缩友好」的表示形式。后续可以搭配任意现成的 KV 压缩方法使用。

详细的数学描述请访问原论文。

实验结果

全面领先,且不以基础能力为代价

研究团队将 KV-CAT 应用于 Qwen2.5 的两个规模版本(0.5B 和 1.5B 参数),并在多个维度上对其进行评估。

首先,基础能力没有损失。 这是最关键的验证。在六个标准多选题基准测试上(包括 HellaSwag、WinoGrande、ARC 等),KV-CAT 训练后的模型与原始模型几乎持平:0.5B 版本平均提升了 0.7 个百分点,1.5B 版本平均下降了 0.5 个百分点,均属于正常的训练波动范围。这说明 KV-CAT 没有以牺牲通用能力为代价换取压缩性能。



其次,后期 KV 压缩的效果大幅改善。 在同等压缩预算下,与原始基础模型相比:

  • 使用注意力匹配(Attention Matching)方法对前缀进行压缩后,续写文本的困惑度(perplexity)差距最多缩小了 3.21 倍 —— 也就是说,压缩后模型的表现与压缩前更为接近。
  • 使用梯度优化法进行压缩时,KV-CAT 模型达到相同压缩质量所需的优化步数减少了最多 5 倍。这对实际部署至关重要:压缩本身也需要计算资源,如果压缩速度更快,就意味着可以处理更多请求。



第三,「大海捞针」检索准确率显著提升。 研究团队设计了一个经典的长文检索测试:在一段充满干扰项的长文本(约 1024 个 token)中藏入一个六位数的「密码」,然后将文本的 KV 缓存压缩后,测试模型能否正确回忆出这个密码。



在保留 50% 的 KV 槽位的情况下,KV-CAT 版本的 Qwen2.5-0.5B 检索准确率从 28% 跃升至 47%,Qwen2.5-1.5B 则从 49% 提升至 67%,提升幅度接近 68%。即使在极端压缩(仅保留 10% 的 KV)的情况下,KV-CAT 版本的性能也与基础模型在轻度压缩时相当。

第四,长文问答任务也有明显改善。 在 LongBench v2 的七项长文本问答任务上,KV-CAT 模型在各压缩比例下的平均准确率均高于基础模型,最大提升幅度达到 39%。



结语

KV-CAT 并不声称要取代现有的压缩算法。研究团队明确指出,它的目标是成为现有压缩方法的「底层增强」:同样的压缩算法,作用在 KV-CAT 训练过的模型上,效果更好、速度更快。

这种「训练时为推理做准备」的思路,在 AI 系统工程领域并不陌生。但将其具体应用于 KV 缓存的可压缩性,并从理论上证明这种属性完全由模型的学习表示决定,是这项工作的核心贡献。

当然,这套方案也有其代价:继续预训练引入了额外的训练开销,路由器模块增加了实现复杂度,目前的实验规模也仅限于 0.5B 和 1.5B 两个相对小型的模型。研究者坦承,这套方法能否平滑扩展到百亿甚至千亿参数的大模型,仍是一个开放问题。

但这一方向的逻辑是成立的。随着上下文窗口的竞赛不断推进,显存瓶颈正升级为制约 AI 系统规模化部署的核心挑战。让模型从一开始就「学会压缩」,而不是生成了难以压缩的表示之后再亡羊补牢,将是未来大模型训练工程中越来越值得重视的设计维度。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
随着日本0-2、波兰0-1,U20女足世界杯八强全诞生:2大亚洲劲旅在列

随着日本0-2、波兰0-1,U20女足世界杯八强全诞生:2大亚洲劲旅在列

侧身凌空斩
2026-09-18 02:34:41
别再吹世界第一了!1302根柱子,正在悄悄掀翻中国基建的老套路

别再吹世界第一了!1302根柱子,正在悄悄掀翻中国基建的老套路

刘哥谈体育
2026-09-18 01:42:36
严格按评选标准,金球奖只能是梅西的!

严格按评选标准,金球奖只能是梅西的!

老夏聊球
2026-09-19 00:08:03
怒其不争!中国男篮输球的同时,日本替补席做出哭鼻子的嘲讽动作

怒其不争!中国男篮输球的同时,日本替补席做出哭鼻子的嘲讽动作

十点街球体育
2026-09-18 23:29:04
“中国人不来也没关系”?打脸了!

“中国人不来也没关系”?打脸了!

环球时报国际
2026-09-17 17:15:36
王鹤棣报案风波再失控!发声惹众怒,医院下场,这次谁也'救'不了他

王鹤棣报案风波再失控!发声惹众怒,医院下场,这次谁也'救'不了他

错过美好
2026-09-17 15:14:20
黄宗泽餐厅怒吼服务员视频疯传,反转来得太快

黄宗泽餐厅怒吼服务员视频疯传,反转来得太快

浅遇时光
2026-09-17 09:58:45
快退休的同事在与我交接工作时忽然翻脸:关系从来不是单方面的,反思自己的时候,也要看清局面

快退休的同事在与我交接工作时忽然翻脸:关系从来不是单方面的,反思自己的时候,也要看清局面

LULU生活家
2026-09-18 19:59:43
万亿宁德时代迎至暗时刻:深陷舆论风暴,市值蒸发7000亿,理想、小米等多家车企“去宁化”,风波中的赛力斯坚守

万亿宁德时代迎至暗时刻:深陷舆论风暴,市值蒸发7000亿,理想、小米等多家车企“去宁化”,风波中的赛力斯坚守

金融界
2026-09-18 20:48:18
统一台湾后需多少驻军?香港人口753万,驻军约6000人,澳门人口68万,驻军不足千人,台湾面积是香港的32倍,保守估计,台湾驻军需6-8万人

统一台湾后需多少驻军?香港人口753万,驻军约6000人,澳门人口68万,驻军不足千人,台湾面积是香港的32倍,保守估计,台湾驻军需6-8万人

扶苏聊历史
2026-09-10 15:51:48
特朗普做出“疯狂决定”,成功让全世界破防了!外媒:中国又赢了

特朗普做出“疯狂决定”,成功让全世界破防了!外媒:中国又赢了

关权教授聊经济
2026-09-18 15:31:10
如果中国不让步,就驱逐中方外交官!日本话音刚落,空军王炸登场

如果中国不让步,就驱逐中方外交官!日本话音刚落,空军王炸登场

安珈使者啊
2026-09-18 09:57:19
白举纲敦煌婚礼刷屏!娱乐圈最稀缺的爱情:低调守护,岁岁安稳

白举纲敦煌婚礼刷屏!娱乐圈最稀缺的爱情:低调守护,岁岁安稳

传递满满正能量
2026-09-18 06:24:43
原来他们已离婚!如今一个坚持丁克不再婚,一个儿女双全幸福升级

原来他们已离婚!如今一个坚持丁克不再婚,一个儿女双全幸福升级

林雁飞
2026-09-17 18:37:00
前脚获评“江苏好人”,后脚涉嫌严重违纪违法:“好人校长”姚恒章落马,撕开了什么?

前脚获评“江苏好人”,后脚涉嫌严重违纪违法:“好人校长”姚恒章落马,撕开了什么?

迷世书童
2026-09-18 22:03:12
敬一丹送灵结束,才发现40岁无儿无女的女儿,早被她安排好后路

敬一丹送灵结束,才发现40岁无儿无女的女儿,早被她安排好后路

九号探秘人
2026-09-17 20:26:37
方昊:进球献给老婆和即将出生的孩子,感谢吴总把我带到球队

方昊:进球献给老婆和即将出生的孩子,感谢吴总把我带到球队

懂球帝
2026-09-18 22:03:17
梅西夺冠后,金球奖官方道贺:史上最成功的球员!

梅西夺冠后,金球奖官方道贺:史上最成功的球员!

历史第一人梅西
2026-09-18 10:56:33
广西“替人养子”事件冲上热搜:一个出轨女,害惨三代人……

广西“替人养子”事件冲上热搜:一个出轨女,害惨三代人……

桌子的生活观
2026-09-18 12:45:59
1年倒闭九万家,五个月亏损200万?昔日的暴利生意正批量“失联”

1年倒闭九万家,五个月亏损200万?昔日的暴利生意正批量“失联”

老沮系戏精北鼻
2026-09-18 14:45:02
2026-09-19 00:20:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14023文章数 142733关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

教育
时尚
手机
房产
亲子

教育要闻

小盆友遇到这样的题目,很有可能失分了!

直播|| 私藏几年的小众千元包,这5只越背越香!

手机要闻

iPhone 18 Pro市场需求强于预期 高售价未阻升级热潮

房产要闻

海口房价,降不动了!

亲子要闻

蓉城幸福家・成长助力站|新学期,怎样构建稳定的家庭养育氛围?

无障碍浏览 进入关怀版