网易首页 > 网易号 > 正文 申请入驻

在数学上把稀疏注意力做对!腾讯Hy开源HiLS-Attention: 计算更少效果更好, 外推512倍

0
分享至



让大模型 "读得更长" 一直是 Agent、深度推理和海量资料整合等场景的刚需,但标准全注意力机制的计算量随序列长度呈平方级增长,始终是横亘在长上下文建模面前的三座大山。

本周,腾讯混元团队正式开源 HiLS-Attention(分层地标稀疏注意力),提出了一种全新的分块稀疏注意力范式,首次在数学层面上同时解决了 chunk 重要性估计的 "表达力不足" 和选择过程的 "端到端不可导" 两大根本难题,真正将稀疏注意力做到了 "Done Right"。

在 345M 至 7B 参数规模上的系统验证显示:HiLS-Attention 在短文本场景下语言建模困惑度(PPL)与全注意力几乎重合,在 8K 训练条件下可实现 4M 上下文(512 倍)免训外推,512K 上下文下的 prefill 与单步 decode 分别加速 13.5 倍和 15.7 倍。

更重要的是,该方法在部分长上下文检索任务上反超了全注意力本身 —— 效率与效果的 "二选一" 困境被首次同时打破。相关论文与代码已在 GitHub 上公开。





  • 论文标题:Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling
  • 论文链接:https://arxiv.org/pdf/2607.02980
  • 代码链接:https://github.com/Tencent-Hunyuan/HiLS-Attention

一、长上下文的老大难:

全注意力扛不动,稀疏注意力又 "不准"

让大模型读得更长,几乎是今天所有 Agent、深度推理、海量资料整合任务的刚需。

但 "读得长" 对标准的全注意力(Full Attention)来说,一直是三座大山:

  • 计算量是平方级的:序列翻倍,算力翻四倍;
  • 长度外推差:训练 8K,测试 32K 就开始崩;
  • KV Cache 随长度线性膨胀,显存很快吃不消。

于是大家把目光投向分块稀疏注意力(Chunk-wise Sparse Attention):把上下文切成一个个 chunk,每个 query 只挑最相关的 Top-K 个 chunk去算注意力,多余的 kv cache 卸载到 cpu memory, 计算和显存开销都被控制在常数,看起来思路非常美好。

但现实是:迄今为止,没有任何一种分块稀疏注意力能真正追平全注意力。



图:最直接的证据 —— 即便让 345M 模型在 RULER 任务上训练,现有分块稀疏注意力依然打不满全注意力。

问题的根子在哪?——chunk 选不准。

二、现有方法为什么会 "选错 chunk"?

mean /max logits 的先天缺陷

要选对 chunk,前提是能准确估计每个 chunk 的 "重要性"。



图:从最朴素的 block sparse attention 出发 —— 一个 chunk 的重要性,就是它内部所有 token 注意力质量的总和

基于上图,形式上有:



按 Zc 从大到小取 Top-K,选出来的就是和全注意力完全一致的精确排序。问题在于:想精确算出 Zc,就得把 query 和 chunk 里每一个 token 都点积一遍 —— 这等于又把全注意力算了一遍,稀疏的意义荡然无存。





现有方法是怎么造的?最主流的是均值池化(mean pooling):直接把 chunk 内所有 key 求平均当摘要 key。稍作推导就会发现,它算出来的分数其实就是 token logit 的均值



NSA、InfLLM v2、MoBA 等都属此类;另一类方法(如 MiniMax 稀疏注意力)则改用max logits来近似。





也就是说:

  • mean logits 只在 "chunk 内注意力均匀分布" 时才准;
  • max logits 只在 "单个 token 独占注意力" 时才准。

可真实场景里,logit 分布随 query随 head随数据剧烈变化,根本不会乖乖落在某一种极端。结果就是:无论用 mean 还是 max,都是在用一个只在极端情况才成立的代理去硬凑 LogSumExp,从而系统性地错估 chunk 重要性,打乱 chunk 排序,让真正关键的 chunk 落选

这一点在实验里看得很清楚:在最简单的单针大海捞针任务上,用均值池化的 NSA / DashAttention / InfLLM v2 在 8K 域内就已经明显掉点—— 因为大海捞针恰恰是 "少数针 token 独占注意力" 的高度集中分布,而均值池化会把这种尖峰稀释掉

三、想用 "参数化 summary" 救场?

先过端到端反传这一关

既然非参数化的 mean/max 表达力不够,那很自然的想法是:给每个 chunk 学一个参数化的 summary,让它更有表达力地概括整块内容。

听起来对,但这里藏着一个被几乎所有现有方法忽略的致命断点

现有方法即便用了参数化 summary,也只拿它来打分选 Top-K。一旦 Top-K 的 chunk ID 被 "硬选" 出来,summary 和打分就被丢弃了,不再参与后续的注意力计算。

这意味着什么?

意味着语言建模(LM)loss 的梯度,根本传不到 summary 和选择分数上。

Top-K 选择是一个离散不可导的操作。打分→排序→选 ID,这条链路梯度无法反传到 summary,LM loss 无法告诉 summary:"你这次把重要的 chunk 排低了,下次该调高一点。"

于是 summary 的学习变成了 "盲训"—— 它学不会去抑制无关 chunk、抬高对预测真正有用的 chunk。选择过程没有被端到端优化,再有表达力的 summary 也无济于事。

这就引出了两个 research question:

RQ1. 数学表达能力足够的 chunk 重要性估计.

RQ2. chunk summary 必须能跟着 LM loss 端到端训练.

把这两点同时做到,才算把稀疏注意力"做对"

四、思路:HiLS-Attention ——

把 chunk 选择变成可微分的 "分层 softmax"

腾讯混元提出HiLS-Attention(Hierarchical Landmark Sparse Attention,分层地标稀疏注意力)。它的核心,是把上面两个诉求拆成两个问题逐一攻破。

RQ1:用 "一阶泰勒展开" 构造表征能力足够的 chunk 算分函数

一个直觉的想法是对 LogSumExp 进行一阶泰勒展开,观察数学性质。研究团队发现,chunk 的对数重要性可以被近似成一个非常优雅的形式:



它由两部分组成:







RQ2:如何让 chunk summary 跟着 LM loss 端到端训练?

光有好 summary 还不够 —— 要解决那个致命断点:让梯度真正流到 summary 上。

HiLS 的做法是把注意力权重分层因式分解成两级 softmax:



图:先按 summary 算每个 chunk 应该分摊多少饼,再由 chunk 内 token 继续分饼



  • chunk 内(intra-chunk)softmax:在每个被选中的 chunk 内部,决定 token 之间的相对权重;





断点被打通了。chunk 选择第一次成为了在 LM 目标下端到端可学习的过程,而且训练和推理全程都是真稀疏(native sparse training)。

一个反直觉的彩蛋:它不只是 "模仿" 全注意力,还更准

研究团队最初是想让 HiLS 去逼近 "全注意力诱导的 chunk 选择"(即朴素 BSA)。但实验给了惊喜:

HiLS 不仅追平了朴素 BSA,还在长上下文检索上反超了全注意力本身。

原因可能在于压缩本身能去噪。全注意力有个固有毛病:只要一个 token 的 logit 不是负无穷,它就会分到一点点注意力质量。上下文越长,这些无关 token 的微小噪声越积越多,反而污染了检索信号。而 HiLS 把多个 key 压缩成一个 summary key 时,不对齐的噪声相互抵消共享的语义信号被保留,于是检索反而更干净 —— 这正是它在变量追踪(VT)这类多跳任务上能比全注意力高出多达 50% 的根源。

五、实验:从 345M 到 7B,全面验证

345M → 1.4B → 7B三个尺度上做了系统验证,结论高度一致:

  • 短文本不掉点:345M 与 1.4B 从零训练时,HiLS 在各上下文长度、各训练阶段的 PPL 与全注意力几乎重合,8K 处持平甚至略低;
  • 超长外推炸裂:仅用 8K 训练,外推到 4M(512 倍)仍保持 90%+ 大海捞针准确率,远超全注意力;
  • 低成本改造存量模型:把 OLMo3-7B 这类全注意力模型转成 HiLS,只要续训 50B token 即可实现切换。短程任务不掉点,长序列任务 LongBench 在 in-domain 长度甚至能超越全注意力基线,无缝继承 HiLS 的外推能力,在 out-of-domain length 显著碾压 YaRN 等各类 baseline;
  • 推理还更快:512K 上下文下,prefill 快 13.5×、单步 decode 快 15.7×。

稀疏注意力长期以来的 "效率 — 性能" 二选一困境,被第一次同时打破了。

六、写在最后

回头看这条逻辑链其实很清晰:

1. 稀疏注意力的瓶颈是chunk 选错

2. 选错的根源是mean /max logits 系统性失准

3. 想用参数化 summary 补救,又卡在端到端反传断点上

4.HiLS 用泰勒线性化(提出足够表达力的估分函数)+ 分层 softmax(把代理分数送进前向),一举解决了表达力和可微分两个问题。

HiLS 证明了:稀疏注意力可以同时提升效率和效果。效果提升的根源或许源自压缩导致去噪,带来更纯净的检索表征。

这,才是把分层稀疏注意力 "Done Right" 的样子。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
彻底翻盘!波音、空客死守的欧美适航证壁垒彻底失效!

彻底翻盘!波音、空客死守的欧美适航证壁垒彻底失效!

流逝的颜值
2026-09-06 16:08:39
热身赛:广东86-80深圳!球员评分:3人满分,2人良好,2人不合格

热身赛:广东86-80深圳!球员评分:3人满分,2人良好,2人不合格

多特体育说
2026-09-06 22:33:57
炖肉20年的老师傅:猪肉只配这3种香料,别再瞎放了

炖肉20年的老师傅:猪肉只配这3种香料,别再瞎放了

阿莱美食汇
2026-09-04 13:34:16
已确认!上海,踩刹车了!

已确认!上海,踩刹车了!

财经要参
2026-09-06 16:00:04
事业没了、婚也离了,被封5年后赵薇再曝近况,瘦到脱相不敢认

事业没了、婚也离了,被封5年后赵薇再曝近况,瘦到脱相不敢认

阿讯说天下
2026-08-30 06:10:34
美网男单16强出炉:星光不足,阿卡陷本土帮围剿!

美网男单16强出炉:星光不足,阿卡陷本土帮围剿!

网球之家
2026-09-06 23:19:52
离谱!上海站赛车起火后,工作人员打不开灭火器,扔下灭火器就跑

离谱!上海站赛车起火后,工作人员打不开灭火器,扔下灭火器就跑

风过乡
2026-09-06 12:49:45
真相来了!李月汝护照丢失内幕曝光,美国公共系统这么拉胯?

真相来了!李月汝护照丢失内幕曝光,美国公共系统这么拉胯?

打小我就醜
2026-09-06 18:54:01
研究发现:每天饭后午睡的人,用不了多久,这4个变化或找上门!

研究发现:每天饭后午睡的人,用不了多久,这4个变化或找上门!

芹姐说生活
2026-09-06 22:45:10
《镖人:战起江都》备案即封神,吴京亲手把C位让给了他?

《镖人:战起江都》备案即封神,吴京亲手把C位让给了他?

东方不败然多多
2026-09-07 00:52:21
武汉大学权色风波升级,女教授社死,教育厅介入,付某退路没了!

武汉大学权色风波升级,女教授社死,教育厅介入,付某退路没了!

叨唠
2026-09-06 05:45:14
久违!郑钦文时隔2年重返中心球场 冲7连胜+美网8强 再遇前世界第1

久违!郑钦文时隔2年重返中心球场 冲7连胜+美网8强 再遇前世界第1

我爱英超
2026-09-07 02:39:33
奇葩!家长投诉老师不结婚,给学生起负面作用,学校介入后,要求老师立刻道歉,网友忍不了!

奇葩!家长投诉老师不结婚,给学生起负面作用,学校介入后,要求老师立刻道歉,网友忍不了!

眼光很亮
2026-09-06 11:31:37
马克龙42岁继女爱上小20岁男友,再度上演妈妈的忘年恋剧情?

马克龙42岁继女爱上小20岁男友,再度上演妈妈的忘年恋剧情?

新民周刊
2026-09-06 13:08:31
比亚迪天神之眼,差距天差地别!90%车主都搞混

比亚迪天神之眼,差距天差地别!90%车主都搞混

侃故事的阿庆
2026-09-06 02:28:37
中国女篮加时逆转捷克!数据一清二楚,不是杨舒予,最大功臣是她

中国女篮加时逆转捷克!数据一清二楚,不是杨舒予,最大功臣是她

侃球熊弟
2026-09-06 21:15:04
普京会见美国总统特使细节:时长超3小时,普京给美特使提要求

普京会见美国总统特使细节:时长超3小时,普京给美特使提要求

政知新媒体
2026-09-06 09:15:58
摸一下胸,拘留5天,图啥?

摸一下胸,拘留5天,图啥?

张晓磊
2026-08-22 11:37:55
何勇治丧委员会发布声明:目前无任何线上线下募捐等活动

何勇治丧委员会发布声明:目前无任何线上线下募捐等活动

北青网-北京青年报
2026-09-06 22:25:19
中国女篮74 70捷克,不得不承认5个事实 韩旭下半场限制了对手3分

中国女篮74 70捷克,不得不承认5个事实 韩旭下半场限制了对手3分

清欢可期a
2026-09-07 04:36:27
2026-09-07 06:12:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13933文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

本地
旅游
艺术
时尚
房产

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

旅游要闻

浙江绍兴葫芦娃爷爷,游客太多影响休息:狠心剪掉7个葫芦娃

艺术要闻

毛泽东写《兰亭序》,史上最霸气版本!

金秋最流行的鞋子,“红色”更时髦!

房产要闻

突发重磅!海口出台楼市新政!

无障碍浏览 进入关怀版