网易首页 > 网易号 > 正文 申请入驻

在数学上把稀疏注意力做对!腾讯Hy开源HiLS-Attention: 计算更少效果更好, 外推512倍

0
分享至



让大模型 "读得更长" 一直是 Agent、深度推理和海量资料整合等场景的刚需,但标准全注意力机制的计算量随序列长度呈平方级增长,始终是横亘在长上下文建模面前的三座大山。

本周,腾讯混元团队正式开源 HiLS-Attention(分层地标稀疏注意力),提出了一种全新的分块稀疏注意力范式,首次在数学层面上同时解决了 chunk 重要性估计的 "表达力不足" 和选择过程的 "端到端不可导" 两大根本难题,真正将稀疏注意力做到了 "Done Right"。

在 345M 至 7B 参数规模上的系统验证显示:HiLS-Attention 在短文本场景下语言建模困惑度(PPL)与全注意力几乎重合,在 8K 训练条件下可实现 4M 上下文(512 倍)免训外推,512K 上下文下的 prefill 与单步 decode 分别加速 13.5 倍和 15.7 倍。

更重要的是,该方法在部分长上下文检索任务上反超了全注意力本身 —— 效率与效果的 "二选一" 困境被首次同时打破。相关论文与代码已在 GitHub 上公开。





  • 论文标题:Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling
  • 论文链接:https://arxiv.org/pdf/2607.02980
  • 代码链接:https://github.com/Tencent-Hunyuan/HiLS-Attention

一、长上下文的老大难:

全注意力扛不动,稀疏注意力又 "不准"

让大模型读得更长,几乎是今天所有 Agent、深度推理、海量资料整合任务的刚需。

但 "读得长" 对标准的全注意力(Full Attention)来说,一直是三座大山:

  • 计算量是平方级的:序列翻倍,算力翻四倍;
  • 长度外推差:训练 8K,测试 32K 就开始崩;
  • KV Cache 随长度线性膨胀,显存很快吃不消。

于是大家把目光投向分块稀疏注意力(Chunk-wise Sparse Attention):把上下文切成一个个 chunk,每个 query 只挑最相关的 Top-K 个 chunk去算注意力,多余的 kv cache 卸载到 cpu memory, 计算和显存开销都被控制在常数,看起来思路非常美好。

但现实是:迄今为止,没有任何一种分块稀疏注意力能真正追平全注意力。



图:最直接的证据 —— 即便让 345M 模型在 RULER 任务上训练,现有分块稀疏注意力依然打不满全注意力。

问题的根子在哪?——chunk 选不准。

二、现有方法为什么会 "选错 chunk"?

mean /max logits 的先天缺陷

要选对 chunk,前提是能准确估计每个 chunk 的 "重要性"。



图:从最朴素的 block sparse attention 出发 —— 一个 chunk 的重要性,就是它内部所有 token 注意力质量的总和

基于上图,形式上有:



按 Zc 从大到小取 Top-K,选出来的就是和全注意力完全一致的精确排序。问题在于:想精确算出 Zc,就得把 query 和 chunk 里每一个 token 都点积一遍 —— 这等于又把全注意力算了一遍,稀疏的意义荡然无存。





现有方法是怎么造的?最主流的是均值池化(mean pooling):直接把 chunk 内所有 key 求平均当摘要 key。稍作推导就会发现,它算出来的分数其实就是 token logit 的均值



NSA、InfLLM v2、MoBA 等都属此类;另一类方法(如 MiniMax 稀疏注意力)则改用max logits来近似。





也就是说:

  • mean logits 只在 "chunk 内注意力均匀分布" 时才准;
  • max logits 只在 "单个 token 独占注意力" 时才准。

可真实场景里,logit 分布随 query随 head随数据剧烈变化,根本不会乖乖落在某一种极端。结果就是:无论用 mean 还是 max,都是在用一个只在极端情况才成立的代理去硬凑 LogSumExp,从而系统性地错估 chunk 重要性,打乱 chunk 排序,让真正关键的 chunk 落选

这一点在实验里看得很清楚:在最简单的单针大海捞针任务上,用均值池化的 NSA / DashAttention / InfLLM v2 在 8K 域内就已经明显掉点—— 因为大海捞针恰恰是 "少数针 token 独占注意力" 的高度集中分布,而均值池化会把这种尖峰稀释掉

三、想用 "参数化 summary" 救场?

先过端到端反传这一关

既然非参数化的 mean/max 表达力不够,那很自然的想法是:给每个 chunk 学一个参数化的 summary,让它更有表达力地概括整块内容。

听起来对,但这里藏着一个被几乎所有现有方法忽略的致命断点

现有方法即便用了参数化 summary,也只拿它来打分选 Top-K。一旦 Top-K 的 chunk ID 被 "硬选" 出来,summary 和打分就被丢弃了,不再参与后续的注意力计算。

这意味着什么?

意味着语言建模(LM)loss 的梯度,根本传不到 summary 和选择分数上。

Top-K 选择是一个离散不可导的操作。打分→排序→选 ID,这条链路梯度无法反传到 summary,LM loss 无法告诉 summary:"你这次把重要的 chunk 排低了,下次该调高一点。"

于是 summary 的学习变成了 "盲训"—— 它学不会去抑制无关 chunk、抬高对预测真正有用的 chunk。选择过程没有被端到端优化,再有表达力的 summary 也无济于事。

这就引出了两个 research question:

RQ1. 数学表达能力足够的 chunk 重要性估计.

RQ2. chunk summary 必须能跟着 LM loss 端到端训练.

把这两点同时做到,才算把稀疏注意力"做对"

四、思路:HiLS-Attention ——

把 chunk 选择变成可微分的 "分层 softmax"

腾讯混元提出HiLS-Attention(Hierarchical Landmark Sparse Attention,分层地标稀疏注意力)。它的核心,是把上面两个诉求拆成两个问题逐一攻破。

RQ1:用 "一阶泰勒展开" 构造表征能力足够的 chunk 算分函数

一个直觉的想法是对 LogSumExp 进行一阶泰勒展开,观察数学性质。研究团队发现,chunk 的对数重要性可以被近似成一个非常优雅的形式:



它由两部分组成:







RQ2:如何让 chunk summary 跟着 LM loss 端到端训练?

光有好 summary 还不够 —— 要解决那个致命断点:让梯度真正流到 summary 上。

HiLS 的做法是把注意力权重分层因式分解成两级 softmax:



图:先按 summary 算每个 chunk 应该分摊多少饼,再由 chunk 内 token 继续分饼



  • chunk 内(intra-chunk)softmax:在每个被选中的 chunk 内部,决定 token 之间的相对权重;





断点被打通了。chunk 选择第一次成为了在 LM 目标下端到端可学习的过程,而且训练和推理全程都是真稀疏(native sparse training)。

一个反直觉的彩蛋:它不只是 "模仿" 全注意力,还更准

研究团队最初是想让 HiLS 去逼近 "全注意力诱导的 chunk 选择"(即朴素 BSA)。但实验给了惊喜:

HiLS 不仅追平了朴素 BSA,还在长上下文检索上反超了全注意力本身。

原因可能在于压缩本身能去噪。全注意力有个固有毛病:只要一个 token 的 logit 不是负无穷,它就会分到一点点注意力质量。上下文越长,这些无关 token 的微小噪声越积越多,反而污染了检索信号。而 HiLS 把多个 key 压缩成一个 summary key 时,不对齐的噪声相互抵消共享的语义信号被保留,于是检索反而更干净 —— 这正是它在变量追踪(VT)这类多跳任务上能比全注意力高出多达 50% 的根源。

五、实验:从 345M 到 7B,全面验证

345M → 1.4B → 7B三个尺度上做了系统验证,结论高度一致:

  • 短文本不掉点:345M 与 1.4B 从零训练时,HiLS 在各上下文长度、各训练阶段的 PPL 与全注意力几乎重合,8K 处持平甚至略低;
  • 超长外推炸裂:仅用 8K 训练,外推到 4M(512 倍)仍保持 90%+ 大海捞针准确率,远超全注意力;
  • 低成本改造存量模型:把 OLMo3-7B 这类全注意力模型转成 HiLS,只要续训 50B token 即可实现切换。短程任务不掉点,长序列任务 LongBench 在 in-domain 长度甚至能超越全注意力基线,无缝继承 HiLS 的外推能力,在 out-of-domain length 显著碾压 YaRN 等各类 baseline;
  • 推理还更快:512K 上下文下,prefill 快 13.5×、单步 decode 快 15.7×。

稀疏注意力长期以来的 "效率 — 性能" 二选一困境,被第一次同时打破了。

六、写在最后

回头看这条逻辑链其实很清晰:

1. 稀疏注意力的瓶颈是chunk 选错

2. 选错的根源是mean /max logits 系统性失准

3. 想用参数化 summary 补救,又卡在端到端反传断点上

4.HiLS 用泰勒线性化(提出足够表达力的估分函数)+ 分层 softmax(把代理分数送进前向),一举解决了表达力和可微分两个问题。

HiLS 证明了:稀疏注意力可以同时提升效率和效果。效果提升的根源或许源自压缩导致去噪,带来更纯净的检索表征。

这,才是把分层稀疏注意力 "Done Right" 的样子。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国男篮77-84新西兰 球员评价:3人优秀,5人及格,3人低迷

中国男篮77-84新西兰 球员评价:3人优秀,5人及格,3人低迷

篮球资讯达人
2026-08-17 21:17:13
给千万企退工人一个公道:年年调资不是福利,是缴费换来的权益

给千万企退工人一个公道:年年调资不是福利,是缴费换来的权益

你在偷看谁
2026-08-12 20:02:35
离谱血亏!巴萨夏窗最大昏招!皇马名宿怒斥:完全看不懂

离谱血亏!巴萨夏窗最大昏招!皇马名宿怒斥:完全看不懂

澜归序
2026-08-18 08:03:14
中国人到底在想什么?烂到天际的中国动画爆火,惊动了美国媒体!

中国人到底在想什么?烂到天际的中国动画爆火,惊动了美国媒体!

王嚾晓
2026-08-17 20:52:12
渤海北部部分海域进行军事演习,禁止驶入

渤海北部部分海域进行军事演习,禁止驶入

界面新闻
2026-08-18 09:05:22
李梦拿天价合同走人,张子宇伤停球队崩盘,宫鲁鸣这步棋太狠了

李梦拿天价合同走人,张子宇伤停球队崩盘,宫鲁鸣这步棋太狠了

衔春信
2026-08-18 00:35:36
70岁老人医院下跪求女儿出钱救老伴,女儿一句话,获在场众人支持

70岁老人医院下跪求女儿出钱救老伴,女儿一句话,获在场众人支持

磊子讲史
2025-08-12 14:56:11
武统、和统都没戏了?岛内军事专家:中国大陆已经走上第3条路

武统、和统都没戏了?岛内军事专家:中国大陆已经走上第3条路

混沌录
2026-06-03 12:25:12
44岁京东原高管失业后转行收废品 曾患重度抑郁 因心系家人选择活下来

44岁京东原高管失业后转行收废品 曾患重度抑郁 因心系家人选择活下来

快科技
2026-08-18 09:36:19
袁立,早日康复!

袁立,早日康复!

胖胖说他不胖
2026-05-24 20:30:58
刷来刷去都是同一张脸!平台决定管一管

刷来刷去都是同一张脸!平台决定管一管

扬子晚报
2026-08-17 14:28:46
巨震!A股全线跳水!发生什么了?

巨震!A股全线跳水!发生什么了?

龙行天下虎
2026-08-18 10:34:16
画丑红军时胆子很大,撤画之后胆子却变小了?清华美院,够了!

画丑红军时胆子很大,撤画之后胆子却变小了?清华美院,够了!

小影的娱乐
2026-08-17 11:49:27
大批日本人涌上前线,手举国旗加入乌军:要和朝鲜大军正面厮杀

大批日本人涌上前线,手举国旗加入乌军:要和朝鲜大军正面厮杀

瑛派儿老黄
2026-08-18 10:53:34
黄一鸣自曝:王思聪每次约她,车费都给10万,来给5万,回再给5万

黄一鸣自曝:王思聪每次约她,车费都给10万,来给5万,回再给5万

汉史趣闻
2025-06-24 10:07:59
朝鲜没想到,派遣了1万多人去俄罗斯打仗,结果,现在俄罗斯生产的啤酒、烟草、菜籽油和猪肉都开始大量进入朝鲜了

朝鲜没想到,派遣了1万多人去俄罗斯打仗,结果,现在俄罗斯生产的啤酒、烟草、菜籽油和猪肉都开始大量进入朝鲜了

扶苏聊历史
2026-08-18 14:38:25
学霸女儿中考692.5分,名校毕业父母劝她放弃重点高中读中本贯通遭抵触,父亲刷完近十年中考数学试卷,给女儿算了一笔账

学霸女儿中考692.5分,名校毕业父母劝她放弃重点高中读中本贯通遭抵触,父亲刷完近十年中考数学试卷,给女儿算了一笔账

极目新闻
2026-08-17 08:10:57
康有为罕见老照片:流亡海外,吃香喝辣住豪宅,图7小妾长相漂亮

康有为罕见老照片:流亡海外,吃香喝辣住豪宅,图7小妾长相漂亮

云霄纪史观
2026-08-11 18:10:08
中超官方:第25轮申花vs泰山调整为8月28日19点35开球

中超官方:第25轮申花vs泰山调整为8月28日19点35开球

闪电新闻
2026-08-18 07:25:03
著名演员李立群含泪发视频!表示家被儿子给抄,82年百万级珍藏茅台被喝精光,评论区炸锅

著名演员李立群含泪发视频!表示家被儿子给抄,82年百万级珍藏茅台被喝精光,评论区炸锅

火山詩话
2026-08-10 17:01:43
2026-08-18 16:24:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13787文章数 142720关注度
往期回顾 全部

科技要闻

特斯拉Cybercab有望本月投放运营

头条要闻

男子帮雇主独守深山老宅20余年:没手机 冬天烧火取暖

头条要闻

男子帮雇主独守深山老宅20余年:没手机 冬天烧火取暖

体育要闻

中国男篮,一直被质疑,永远被期待

娱乐要闻

郭德纲风波再升级!德云社跟着遭殃

财经要闻

许家印,崩了东北富二代42个亿

汽车要闻

一条视频读懂华为乾崑WEWA 2.0架构核心:WA世界行为模型

态度原创

本地
数码
亲子
教育
军事航空

本地新闻

邂逅活珊瑚的西沙,感受独属于国人的浪漫

数码要闻

华为MatePad Pro 12英寸系列平板鸿蒙7花粉Beta版招募

亲子要闻

孩子换牙期多啃苹果, 真的能让脸型变好吗?

教育要闻

官宣!北京高考状元回人大附任教,正在“开辟新赛道”

军事要闻

谈判期满前 伊朗悬赏抓美军

无障碍浏览 进入关怀版