![]()
![]()
编辑:前沿在线 编辑部
最近半年跑了十多家智算中心并做了调研,一个很直观的感受是:大家都在拼命堆算力,GPU、NPU 的规模翻着番涨,但真到了生产环境跑推理,卡脖子的往往不是算力本身。
聊到推理成本,几乎所有团队都绕不开 KV Cache 的问题。长上下文模型和智能体用得越多,这个问题就越突出。
已经算过的上下文数据存不下、调不动,最后算力只能反复做重复计算,钱投进去了,产出没跟上。
最近在华为全联接大会 2026 上,OceanStor M900 AI 记忆存储在主论坛重磅发布。
![]()
这款产品之所以在AI基建领域引起讨论,核心不是存储本身的参数升级,而是它刚好踩中了现在全行业都在面对的痛点:KV Cache 越来越大,原有存储体系接不住了。
![]()
为什么 KV Cache 突然成了问题?
先简单说下 KV Cache 是什么。
大模型推理的时候,每做完一次计算,都会把对应的中间结果存下来,后面再用到这段上下文的时候,就不用重新计算,直接调用就行。
这部分存下来的中间数据,就是 KV Cache。它就是一个提升推理效率的缓存机制,一直都存在,只是过去没人太当回事。
前几年对话式 AI 为主的时候,一轮对话结束,上下文清空,KV Cache 量小,用完就扔,基本都放在显存里,占不了多少空间。
![]()
但这两年情况变了。一边是 Agentic AI 开始落地,智能体跑任务是多轮连续的,写代码、查资料、调工具,一跑就是几十步,上下文保存的时间变长;另一边是大模型的上下文窗口越做越大,百万词元已经成了主流配置。两个因素加在一起,KV Cache 的数据量直接就涨了上去。
过去它更多只是推理框架里的一个缓存机制,现在实实在在的影响着整个集群的资源分配。
![]()
现有存储的两头堵困境
问题是,现有的存储体系,从设计之初就不是为这么大量的 KV Cache 准备的。现在行业普遍遇到的是两头堵的情况。
一头是显存不够用。
显存离计算最近,速度最快,但容量小、成本高。KV Cache 全都堆在显存里,占掉大量空间之后,留给模型权重、计算中间态和并发请求的显存就少了,推理的并发量和效率自然受影响。
![]()
在我们走访的十余家智算中心里,长上下文推理场景下,KV Cache 占用的显存比例普遍偏高。
更麻烦的是,超节点集群里每个节点的显存都是独立的,没法跨节点共享,很容易出现资源错配。有的节点被上下文占满接不了新任务,有的节点还有富余却用不上。
![]()
最终反映到算力利用率上,我们接触到的千卡级推理集群,实际跑推理的有效算力大多不到五成,其中很大一部分浪费,就来自缓存没命中导致的重复计算。
另一头是传统存储跟不上。
既然显存放不下,放到传统的外部存储行不行?实际跑下来效果并不好。
传统存储本来就是为数据持久化设计的,容量大但延迟高,数据读写要经过 CPU 转发、多层协议转换,通常是毫秒级的延迟。
但 KV Cache 是典型的热数据,要高频反复调用,对延迟的敏感度极高。用传统存储存 KV Cache,数据供给的速度追不上计算的节奏,GPU/NPU 就只能等着,直接表现就是首 Token 时延慢、Token吞吐率上不去,大量算力空转。
![]()
两个问题加在一起,就形成了现在的尴尬局面:算力越堆越贵,却因为存储的问题,大量算力都浪费掉了。
![]()
行业的两种解决思路
问题摆在这里,行业也试了不少办法。
早期大多是打补丁的思路,比如扩显存、加缓存层、用软件调度优化,但都只能缓解局部问题,到了超大规模集群的场景,还是解决不了根本问题。
![]()
过去一年多,全球的头部厂商都在往这个方向布局,慢慢形成了两种不同的技术路径。
第一种还是围绕计算节点做延伸,通过更大的本地缓存、更高速度的节点互联,让每个计算单元能用到更多的 KV Cache。
这种方式对现有架构改动小,部署快,但本质上还是没跳出单个节点的框架,集群大了之后,调度和容量还是会碰到天花板。
![]()
第二种思路是把 KV Cache 从计算节点里独立出来,专门做一层共享的 AI 记忆数据基础设施。
所有节点的 KV Cache 统一管理,形成一个共享的资源池,整个集群的计算单元都可以调用,不用每个节点各自存一份。
![]()
不只是华为,英伟达、阿里云等厂商也都在从各自的技术栈出发,探索类似的方向。这条路架构上更彻底,能从根本上解决规模和调度的问题,但对厂商的全栈技术能力要求也更高。
![]()
华为 AI 记忆存储的落地路径
这次华为发布的OceanStor M900 AI 记忆存储,走的就是第二条路线,把 AI 记忆存储作为独立的一层来做。根据华为官方发布的技术参数,它主要从三个维度解决问题。
首先是容量。它通过灵衢高速互联网络把显存、内存、AI 记忆存储等资源整合起来,实现全局池化和分级存储,打破节点的物理边界,把承载的介质从显存、内存延伸到 SSD。
![]()
官方数据显示,单集群可以提供 64PB 的共享记忆容量,对单个 NPU 来说,可调度的 KV Cache 逻辑容量从 GB 级升到了 TB 级。
容量上去了,能放下的上下文就多了,缓存命中率自然会提升,重复计算的情况也就少了。
![]()
然后是性能。它用了 CPU、网络、盘控三芯合一的架构,支持原生 KV 语义,省去了传统架构里 CPU 转发、多层协议转换的环节,让 NPU 可以直接访问存储里的 KV 数据。
![]()
根据华为官方给出的数据,这套架构可以把访问时延降到 60μs,相比传统方案缩短 90%;单集群的聚合带宽可以达到 40TB/s,比业界主流方案提升 1.5 倍。
官方给出的测试结果是典型 AI 编程场景下 Token 吞吐率翻倍、首 Token 时延减半。
最后是寿命和成本。KV Cache 是高频读写的数据,对 SSD 的磨损很大,普通SSD 用不了多久,长期运维成本很高。
OceanStor M900 AI 记忆存储提供了 KV-Aware 自适应存储算法,根据数据的访问频率和生命周期,把不同的数据放到不同的介质上,减少无效磨损。
![]()
官方参数显示它最高支持 24 DWPD,也就是每天可以完成 24 次的全盘数据写入,SSD 的使用寿命比业界标准提升 16 倍,可以稳定运行三年。算下来全生命周期的介质更换量可以大幅减少,运维成本更低。
整体看下来,这是一套完整的商用产品方案,而不是单点的技术验证,也让 AI 记忆存储这个方向,有了可以大规模落地的参考样本。
![]()
基建重心正在发生变化
在我们看来,OceanStor M900 AI 记忆存储的发布,更值得注意的不是一款产品本身,而是它背后反映的产业变化。
前几年 AI 基建的核心逻辑很简单:堆算力。谁的卡多、谁的峰值性能高,谁的基建就强。但到了现在规模化推理的阶段,大家慢慢发现,只堆算力的边际效益越来越低。数据供给跟不上,再强的算力也跑不起来。
![]()
行业的共识正在慢慢形成:AI 基建最终看的不是峰值算力,而是能产出多少有效 Token。接下来的竞争,不只是比谁的算力多,更是比谁能让算力更高效地产出。
AI 记忆存储这一层,补上的就是数据供给的短板。它让 AI 基建不再只围绕计算转,而是开始走向算力、网络、存储的协同。
从目前的产业走向来看,这大概率是接下来几年 AI 基建演进的一个核心方向。毕竟到了规模化阶段,效率永远是核心命题。
![]()
说到底,KV Cache 本来只是推理过程中的一个缓存机制,没人会想到它有一天会成为影响基建架构的核心因素。
但现在的情况是,随着长上下文和 Agent 的普及,它正在逐渐从一个技术细节,变成一类需要独立规划、管理和调度的数据基础设施资源。从全球头部厂商的投入和产品落地的速度来看,这个方向已经越来越清晰了。
![]()
AI 基础设施的下半场,核心一定是数据。数据供得上、管得细,才能真正释放算力的潜能。
![]()
前沿动态前沿大会
前沿人物
点「在看」,给前前加鸡腿
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.