来源:市场资讯
(来源:口罩哥本哥口罩哥研报60秒)
线性注意力省下 KV cache,却把瓶颈推向 HBM 与机柜级互连
2026.07.19 · 技术前沿
[CHIP]市场把线性注意力读成"利空英伟达"。SemiAnalysis 说反了——省的是 KV cache,涨上来的是 HBM、专家路由与机柜级互连。
7月16日,月之暗面发布Kimi K3,2.8 万亿参数,全球最大开源权重模型。当天英伟达收跌 2.2%,像极了 DeepSeek R1 那一夜。
空头逻辑很直接:KDA 属线性注意力,KV cache 的网络带宽压力最高降约 10 倍。一听,卡是不是要卖不动了。
SemiAnalysis 直接反驳:"the opposite is true"(事实恰恰相反)。KDA 省的是注意力状态,省不掉 2.8 万亿权重——单模型权重就要占1.5TB 以上 HBM。—— SemiAnalysis 2026.07.18
更关键的是 WideEP:896 个专家摊到多卡,每卡只放一部分,代价是每个 token 都要跨卡 all-to-all。省了这头,互连那头反而更饿。
瓶颈迁移:省下的与涨上来的
KDA 降 KV cache,WideEP 与 2.8T 权重把压力推向 HBM 与互连
KDA 线性注意力
KV 带宽 ↓ 最高 10x
2.8 万亿权重
≥1.5TB HBM 常驻
WideEP 896 专家
token 跨卡 all-to-all
HBM + 互连
需求 ↑ 不降反升
64 卡超节点起步
来源:SemiAnalysis 2026.07.18 · Moonshot AI 官方技术说明 · Tenten AI 2026.07.18
于是官方建议 64 卡以上超节点部署。
这正是 GB300 NVL72 的主场:72 卡、20TB 显存、130 TB/s NVLink,机柜内带宽是 DGX B200 的 18 倍。
delta 在瓶颈迁移:省下的是单卡 FLOPS 叙事,涨上来的是 HBM、铜背板与 scale-up 域。
HBM 2026 年已被 SK 海力士、美光订到售罄,DRAM 一季 ASP 同比涨 136%。
![]()
被忽视的赢家是昇腾 950——同走 64 卡超节点、自研 HBM。
出口管制逼出的,恰是国产 scale-up 的需求。越省,越买。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.