网易首页 > 网易号 > 正文 申请入驻

在数学上把稀疏注意力做对!腾讯Hy开源HiLS-Attention: 计算更少效果更好, 外推512倍

0
分享至



让大模型 "读得更长" 一直是 Agent、深度推理和海量资料整合等场景的刚需,但标准全注意力机制的计算量随序列长度呈平方级增长,始终是横亘在长上下文建模面前的三座大山。

本周,腾讯混元团队正式开源 HiLS-Attention(分层地标稀疏注意力),提出了一种全新的分块稀疏注意力范式,首次在数学层面上同时解决了 chunk 重要性估计的 "表达力不足" 和选择过程的 "端到端不可导" 两大根本难题,真正将稀疏注意力做到了 "Done Right"。

在 345M 至 7B 参数规模上的系统验证显示:HiLS-Attention 在短文本场景下语言建模困惑度(PPL)与全注意力几乎重合,在 8K 训练条件下可实现 4M 上下文(512 倍)免训外推,512K 上下文下的 prefill 与单步 decode 分别加速 13.5 倍和 15.7 倍。

更重要的是,该方法在部分长上下文检索任务上反超了全注意力本身 —— 效率与效果的 "二选一" 困境被首次同时打破。相关论文与代码已在 GitHub 上公开。





  • 论文标题:Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling
  • 论文链接:https://arxiv.org/pdf/2607.02980
  • 代码链接:https://github.com/Tencent-Hunyuan/HiLS-Attention

一、长上下文的老大难:

全注意力扛不动,稀疏注意力又 "不准"

让大模型读得更长,几乎是今天所有 Agent、深度推理、海量资料整合任务的刚需。

但 "读得长" 对标准的全注意力(Full Attention)来说,一直是三座大山:

  • 计算量是平方级的:序列翻倍,算力翻四倍;
  • 长度外推差:训练 8K,测试 32K 就开始崩;
  • KV Cache 随长度线性膨胀,显存很快吃不消。

于是大家把目光投向分块稀疏注意力(Chunk-wise Sparse Attention):把上下文切成一个个 chunk,每个 query 只挑最相关的 Top-K 个 chunk去算注意力,多余的 kv cache 卸载到 cpu memory, 计算和显存开销都被控制在常数,看起来思路非常美好。

但现实是:迄今为止,没有任何一种分块稀疏注意力能真正追平全注意力。



图:最直接的证据 —— 即便让 345M 模型在 RULER 任务上训练,现有分块稀疏注意力依然打不满全注意力。

问题的根子在哪?——chunk 选不准。

二、现有方法为什么会 "选错 chunk"?

mean /max logits 的先天缺陷

要选对 chunk,前提是能准确估计每个 chunk 的 "重要性"。



图:从最朴素的 block sparse attention 出发 —— 一个 chunk 的重要性,就是它内部所有 token 注意力质量的总和

基于上图,形式上有:



按 Zc 从大到小取 Top-K,选出来的就是和全注意力完全一致的精确排序。问题在于:想精确算出 Zc,就得把 query 和 chunk 里每一个 token 都点积一遍 —— 这等于又把全注意力算了一遍,稀疏的意义荡然无存。





现有方法是怎么造的?最主流的是均值池化(mean pooling):直接把 chunk 内所有 key 求平均当摘要 key。稍作推导就会发现,它算出来的分数其实就是 token logit 的均值



NSA、InfLLM v2、MoBA 等都属此类;另一类方法(如 MiniMax 稀疏注意力)则改用max logits来近似。





也就是说:

  • mean logits 只在 "chunk 内注意力均匀分布" 时才准;
  • max logits 只在 "单个 token 独占注意力" 时才准。

可真实场景里,logit 分布随 query随 head随数据剧烈变化,根本不会乖乖落在某一种极端。结果就是:无论用 mean 还是 max,都是在用一个只在极端情况才成立的代理去硬凑 LogSumExp,从而系统性地错估 chunk 重要性,打乱 chunk 排序,让真正关键的 chunk 落选

这一点在实验里看得很清楚:在最简单的单针大海捞针任务上,用均值池化的 NSA / DashAttention / InfLLM v2 在 8K 域内就已经明显掉点—— 因为大海捞针恰恰是 "少数针 token 独占注意力" 的高度集中分布,而均值池化会把这种尖峰稀释掉

三、想用 "参数化 summary" 救场?

先过端到端反传这一关

既然非参数化的 mean/max 表达力不够,那很自然的想法是:给每个 chunk 学一个参数化的 summary,让它更有表达力地概括整块内容。

听起来对,但这里藏着一个被几乎所有现有方法忽略的致命断点

现有方法即便用了参数化 summary,也只拿它来打分选 Top-K。一旦 Top-K 的 chunk ID 被 "硬选" 出来,summary 和打分就被丢弃了,不再参与后续的注意力计算。

这意味着什么?

意味着语言建模(LM)loss 的梯度,根本传不到 summary 和选择分数上。

Top-K 选择是一个离散不可导的操作。打分→排序→选 ID,这条链路梯度无法反传到 summary,LM loss 无法告诉 summary:"你这次把重要的 chunk 排低了,下次该调高一点。"

于是 summary 的学习变成了 "盲训"—— 它学不会去抑制无关 chunk、抬高对预测真正有用的 chunk。选择过程没有被端到端优化,再有表达力的 summary 也无济于事。

这就引出了两个 research question:

RQ1. 数学表达能力足够的 chunk 重要性估计.

RQ2. chunk summary 必须能跟着 LM loss 端到端训练.

把这两点同时做到,才算把稀疏注意力"做对"

四、思路:HiLS-Attention ——

把 chunk 选择变成可微分的 "分层 softmax"

腾讯混元提出HiLS-Attention(Hierarchical Landmark Sparse Attention,分层地标稀疏注意力)。它的核心,是把上面两个诉求拆成两个问题逐一攻破。

RQ1:用 "一阶泰勒展开" 构造表征能力足够的 chunk 算分函数

一个直觉的想法是对 LogSumExp 进行一阶泰勒展开,观察数学性质。研究团队发现,chunk 的对数重要性可以被近似成一个非常优雅的形式:



它由两部分组成:







RQ2:如何让 chunk summary 跟着 LM loss 端到端训练?

光有好 summary 还不够 —— 要解决那个致命断点:让梯度真正流到 summary 上。

HiLS 的做法是把注意力权重分层因式分解成两级 softmax:



图:先按 summary 算每个 chunk 应该分摊多少饼,再由 chunk 内 token 继续分饼



  • chunk 内(intra-chunk)softmax:在每个被选中的 chunk 内部,决定 token 之间的相对权重;





断点被打通了。chunk 选择第一次成为了在 LM 目标下端到端可学习的过程,而且训练和推理全程都是真稀疏(native sparse training)。

一个反直觉的彩蛋:它不只是 "模仿" 全注意力,还更准

研究团队最初是想让 HiLS 去逼近 "全注意力诱导的 chunk 选择"(即朴素 BSA)。但实验给了惊喜:

HiLS 不仅追平了朴素 BSA,还在长上下文检索上反超了全注意力本身。

原因可能在于压缩本身能去噪。全注意力有个固有毛病:只要一个 token 的 logit 不是负无穷,它就会分到一点点注意力质量。上下文越长,这些无关 token 的微小噪声越积越多,反而污染了检索信号。而 HiLS 把多个 key 压缩成一个 summary key 时,不对齐的噪声相互抵消共享的语义信号被保留,于是检索反而更干净 —— 这正是它在变量追踪(VT)这类多跳任务上能比全注意力高出多达 50% 的根源。

五、实验:从 345M 到 7B,全面验证

345M → 1.4B → 7B三个尺度上做了系统验证,结论高度一致:

  • 短文本不掉点:345M 与 1.4B 从零训练时,HiLS 在各上下文长度、各训练阶段的 PPL 与全注意力几乎重合,8K 处持平甚至略低;
  • 超长外推炸裂:仅用 8K 训练,外推到 4M(512 倍)仍保持 90%+ 大海捞针准确率,远超全注意力;
  • 低成本改造存量模型:把 OLMo3-7B 这类全注意力模型转成 HiLS,只要续训 50B token 即可实现切换。短程任务不掉点,长序列任务 LongBench 在 in-domain 长度甚至能超越全注意力基线,无缝继承 HiLS 的外推能力,在 out-of-domain length 显著碾压 YaRN 等各类 baseline;
  • 推理还更快:512K 上下文下,prefill 快 13.5×、单步 decode 快 15.7×。

稀疏注意力长期以来的 "效率 — 性能" 二选一困境,被第一次同时打破了。

六、写在最后

回头看这条逻辑链其实很清晰:

1. 稀疏注意力的瓶颈是chunk 选错

2. 选错的根源是mean /max logits 系统性失准

3. 想用参数化 summary 补救,又卡在端到端反传断点上

4.HiLS 用泰勒线性化(提出足够表达力的估分函数)+ 分层 softmax(把代理分数送进前向),一举解决了表达力和可微分两个问题。

HiLS 证明了:稀疏注意力可以同时提升效率和效果。效果提升的根源或许源自压缩导致去噪,带来更纯净的检索表征。

这,才是把分层稀疏注意力 "Done Right" 的样子。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
白宫大门进不去!特朗普交棒退位,万斯要接班?中美关系或变天

白宫大门进不去!特朗普交棒退位,万斯要接班?中美关系或变天

观史搜寻着
2026-07-22 05:15:27
韩国女爱豆舞台“手伸进裤子”引争议,直播道歉:没想太多就拉了

韩国女爱豆舞台“手伸进裤子”引争议,直播道歉:没想太多就拉了

奋斗在韩国
2026-07-22 10:22:27
张帆任广西东兴市副市长,代理市长职务

张帆任广西东兴市副市长,代理市长职务

环球网资讯
2026-07-21 19:59:02
16岁少年见一对大雁殉情而死,落笔成文,写下无人超越的千古名篇

16岁少年见一对大雁殉情而死,落笔成文,写下无人超越的千古名篇

芊芊子吟
2026-07-19 13:20:12
美国在筹备大规模战争?伊朗方面评估威胁。

美国在筹备大规模战争?伊朗方面评估威胁。

真的好爱你
2026-07-22 10:29:47
恢复孩子内驱力的最快方式:让他吃高级的苦

恢复孩子内驱力的最快方式:让他吃高级的苦

呼呼历史论
2026-07-16 03:00:30
被大佬当“玩物”,孕期注射药物百次,最美 “三圣母”落魄至此

被大佬当“玩物”,孕期注射药物百次,最美 “三圣母”落魄至此

文刀贰
2026-07-02 23:19:57
外媒发现不对劲:中国用短短一个下午,就干掉了美国AI领先优势

外媒发现不对劲:中国用短短一个下午,就干掉了美国AI领先优势

有牙的兔纸
2026-07-21 07:43:14
合同约定:“离职后一个月没收到钱,竞业限制义务免除”。公司迟延发放几日,劳动者还要继续履行吗?法院都搞懵了。

合同约定:“离职后一个月没收到钱,竞业限制义务免除”。公司迟延发放几日,劳动者还要继续履行吗?法院都搞懵了。

零言法语
2026-07-20 22:56:39
16岁已是人间尤物,4年换19个男人,找到老实人接盘后收心做人妻

16岁已是人间尤物,4年换19个男人,找到老实人接盘后收心做人妻

温读史
2026-07-22 09:30:43
马特·达蒙揭秘《奥德赛》实拍巨人:没有CGI,选身高差7英尺和5英尺替身搞定

马特·达蒙揭秘《奥德赛》实拍巨人:没有CGI,选身高差7英尺和5英尺替身搞定

晚星归航2
2026-07-21 18:19:58
地方政府,集体撤离民航业!

地方政府,集体撤离民航业!

民航之翼
2026-07-21 20:17:26
伊布世界杯决赛后突然退出评论席,亲口放话:第一次也是最后一次

伊布世界杯决赛后突然退出评论席,亲口放话:第一次也是最后一次

温柔且自由
2026-07-21 01:44:13
谢贤生前谈谢霆锋离婚曾数次落泪:“为什么霆锋会走我的老路,这是不是上天对我有一点偏见?”;其直言这是他一生最难以释怀的心结

谢贤生前谈谢霆锋离婚曾数次落泪:“为什么霆锋会走我的老路,这是不是上天对我有一点偏见?”;其直言这是他一生最难以释怀的心结

大风新闻
2026-07-22 08:47:06
中国4人入围美网正赛!郑钦文递补第22或打资格赛,Ace球赛季第三

中国4人入围美网正赛!郑钦文递补第22或打资格赛,Ace球赛季第三

排球黄金眼
2026-07-22 10:41:30
欧美中产正扎堆去泰国“等死”?清迈芭提雅,悄悄变成人生终点站

欧美中产正扎堆去泰国“等死”?清迈芭提雅,悄悄变成人生终点站

无人倾听无人倾听
2026-07-21 03:34:36
碰见中国人就打?这个国家有多讨厌中国人,为何我们还要去旅游?

碰见中国人就打?这个国家有多讨厌中国人,为何我们还要去旅游?

怪味历史连连看
2026-07-18 20:48:32
下雨天,你主动把伞借给别人,对方只会感谢你一次。但如果你说:“我这把伞有点小,咱俩一起撑吧。”他会记住你的好很久。

下雨天,你主动把伞借给别人,对方只会感谢你一次。但如果你说:“我这把伞有点小,咱俩一起撑吧。”他会记住你的好很久。

美芽
2026-07-17 12:46:37
大码模特现实里到底多大?

大码模特现实里到底多大?

飛娱日记
2026-05-12 08:27:55
桃子被发现!研究发现:吃得越多,糖尿病患者血管或越干净?

桃子被发现!研究发现:吃得越多,糖尿病患者血管或越干净?

白宸侃片
2026-07-22 05:28:32
2026-07-22 12:00:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13572文章数 142698关注度
往期回顾 全部

科技要闻

怕了?美财长扬言:严查中国AI

头条要闻

伊朗无人机让美军工巨头坐不住 逼出"半价"爱国者导弹

头条要闻

伊朗无人机让美军工巨头坐不住 逼出"半价"爱国者导弹

体育要闻

“不会进球”的前锋,在世界杯决赛进球了

娱乐要闻

谢贤离世风波再起!王菲探望细节曝光

财经要闻

被误伤的A股:韧性、预期与底气

汽车要闻

WAIC专访|易启未来余志勇:网易孵化按摩机器人 能识穴会“手法”

态度原创

手机
数码
时尚
房产
教育

手机要闻

2027年发布 iPhone Air 2补齐短板:双摄、A20 Pro、VC散热

数码要闻

299元 小米蓝牙音箱C紫色款开售:18W扬声器 14小时续航

整容、断骨、换血,欧美白男正扎堆服美役

房产要闻

最高奖励15万!免学费!海南民办高中,疯狂抢人!

教育要闻

科技高中教学教研协作体特色课程建设工作推进会在西安召开

无障碍浏览 进入关怀版