网易首页 > 网易号 > 正文 申请入驻

破解 AI 推理效率困局,详解华为 OceanStor M900 AI记忆存储新基建 | 前沿在线

0
分享至



编辑:前沿在线 编辑部

最近半年跑了十多家智算中心并做了调研,一个很直观的感受是:大家都在拼命堆算力,GPU、NPU 的规模翻着番涨,但真到了生产环境跑推理,卡脖子的往往不是算力本身。

聊到推理成本,几乎所有团队都绕不开 KV Cache 的问题。长上下文模型和智能体用得越多,这个问题就越突出。

已经算过的上下文数据存不下、调不动,最后算力只能反复做重复计算,钱投进去了,产出没跟上。

最近在华为全联接大会 2026 上,OceanStor M900 AI 记忆存储在主论坛重磅发布。


这款产品之所以在AI基建领域引起讨论,核心不是存储本身的参数升级,而是它刚好踩中了现在全行业都在面对的痛点:KV Cache 越来越大,原有存储体系接不住了。


为什么 KV Cache 突然成了问题?

先简单说下 KV Cache 是什么。

大模型推理的时候,每做完一次计算,都会把对应的中间结果存下来,后面再用到这段上下文的时候,就不用重新计算,直接调用就行。

这部分存下来的中间数据,就是 KV Cache。它就是一个提升推理效率的缓存机制,一直都存在,只是过去没人太当回事。

前几年对话式 AI 为主的时候,一轮对话结束,上下文清空,KV Cache 量小,用完就扔,基本都放在显存里,占不了多少空间。


但这两年情况变了。一边是 Agentic AI 开始落地,智能体跑任务是多轮连续的,写代码、查资料、调工具,一跑就是几十步,上下文保存的时间变长;另一边是大模型的上下文窗口越做越大,百万词元已经成了主流配置。两个因素加在一起,KV Cache 的数据量直接就涨了上去。

过去它更多只是推理框架里的一个缓存机制,现在实实在在的影响着整个集群的资源分配。


现有存储的两头堵困境

问题是,现有的存储体系,从设计之初就不是为这么大量的 KV Cache 准备的。现在行业普遍遇到的是两头堵的情况。

一头是显存不够用。

显存离计算最近,速度最快,但容量小、成本高。KV Cache 全都堆在显存里,占掉大量空间之后,留给模型权重、计算中间态和并发请求的显存就少了,推理的并发量和效率自然受影响。


在我们走访的十余家智算中心里,长上下文推理场景下,KV Cache 占用的显存比例普遍偏高。

更麻烦的是,超节点集群里每个节点的显存都是独立的,没法跨节点共享,很容易出现资源错配。有的节点被上下文占满接不了新任务,有的节点还有富余却用不上。


最终反映到算力利用率上,我们接触到的千卡级推理集群,实际跑推理的有效算力大多不到五成,其中很大一部分浪费,就来自缓存没命中导致的重复计算。

另一头是传统存储跟不上。

既然显存放不下,放到传统的外部存储行不行?实际跑下来效果并不好。

传统存储本来就是为数据持久化设计的,容量大但延迟高,数据读写要经过 CPU 转发、多层协议转换,通常是毫秒级的延迟。

但 KV Cache 是典型的热数据,要高频反复调用,对延迟的敏感度极高。用传统存储存 KV Cache,数据供给的速度追不上计算的节奏,GPU/NPU 就只能等着,直接表现就是首 Token 时延慢、Token吞吐率上不去,大量算力空转。


两个问题加在一起,就形成了现在的尴尬局面:算力越堆越贵,却因为存储的问题,大量算力都浪费掉了。


行业的两种解决思路

问题摆在这里,行业也试了不少办法。

早期大多是打补丁的思路,比如扩显存、加缓存层、用软件调度优化,但都只能缓解局部问题,到了超大规模集群的场景,还是解决不了根本问题。


过去一年多,全球的头部厂商都在往这个方向布局,慢慢形成了两种不同的技术路径。

第一种还是围绕计算节点做延伸,通过更大的本地缓存、更高速度的节点互联,让每个计算单元能用到更多的 KV Cache。

这种方式对现有架构改动小,部署快,但本质上还是没跳出单个节点的框架,集群大了之后,调度和容量还是会碰到天花板。


第二种思路是把 KV Cache 从计算节点里独立出来,专门做一层共享的 AI 记忆数据基础设施。

所有节点的 KV Cache 统一管理,形成一个共享的资源池,整个集群的计算单元都可以调用,不用每个节点各自存一份。


不只是华为,英伟达、阿里云等厂商也都在从各自的技术栈出发,探索类似的方向。这条路架构上更彻底,能从根本上解决规模和调度的问题,但对厂商的全栈技术能力要求也更高。


华为 AI 记忆存储的落地路径

这次华为发布的OceanStor M900 AI 记忆存储,走的就是第二条路线,把 AI 记忆存储作为独立的一层来做。根据华为官方发布的技术参数,它主要从三个维度解决问题。

首先是容量。它通过灵衢高速互联网络把显存、内存、AI 记忆存储等资源整合起来,实现全局池化和分级存储,打破节点的物理边界,把承载的介质从显存、内存延伸到 SSD。


官方数据显示,单集群可以提供 64PB 的共享记忆容量,对单个 NPU 来说,可调度的 KV Cache 逻辑容量从 GB 级升到了 TB 级。

容量上去了,能放下的上下文就多了,缓存命中率自然会提升,重复计算的情况也就少了。


然后是性能。它用了 CPU、网络、盘控三芯合一的架构,支持原生 KV 语义,省去了传统架构里 CPU 转发、多层协议转换的环节,让 NPU 可以直接访问存储里的 KV 数据。


根据华为官方给出的数据,这套架构可以把访问时延降到 60μs,相比传统方案缩短 90%;单集群的聚合带宽可以达到 40TB/s,比业界主流方案提升 1.5 倍。

官方给出的测试结果是典型 AI 编程场景下 Token 吞吐率翻倍、首 Token 时延减半。

最后是寿命和成本。KV Cache 是高频读写的数据,对 SSD 的磨损很大,普通SSD 用不了多久,长期运维成本很高。

OceanStor M900 AI 记忆存储提供了 KV-Aware 自适应存储算法,根据数据的访问频率和生命周期,把不同的数据放到不同的介质上,减少无效磨损。


官方参数显示它最高支持 24 DWPD,也就是每天可以完成 24 次的全盘数据写入,SSD 的使用寿命比业界标准提升 16 倍,可以稳定运行三年。算下来全生命周期的介质更换量可以大幅减少,运维成本更低。

整体看下来,这是一套完整的商用产品方案,而不是单点的技术验证,也让 AI 记忆存储这个方向,有了可以大规模落地的参考样本。


基建重心正在发生变化

在我们看来,OceanStor M900 AI 记忆存储的发布,更值得注意的不是一款产品本身,而是它背后反映的产业变化。

前几年 AI 基建的核心逻辑很简单:堆算力。谁的卡多、谁的峰值性能高,谁的基建就强。但到了现在规模化推理的阶段,大家慢慢发现,只堆算力的边际效益越来越低。数据供给跟不上,再强的算力也跑不起来。


行业的共识正在慢慢形成:AI 基建最终看的不是峰值算力,而是能产出多少有效 Token。接下来的竞争,不只是比谁的算力多,更是比谁能让算力更高效地产出。

AI 记忆存储这一层,补上的就是数据供给的短板。它让 AI 基建不再只围绕计算转,而是开始走向算力、网络、存储的协同。

从目前的产业走向来看,这大概率是接下来几年 AI 基建演进的一个核心方向。毕竟到了规模化阶段,效率永远是核心命题。


说到底,KV Cache 本来只是推理过程中的一个缓存机制,没人会想到它有一天会成为影响基建架构的核心因素。

但现在的情况是,随着长上下文和 Agent 的普及,它正在逐渐从一个技术细节,变成一类需要独立规划、管理和调度的数据基础设施资源。从全球头部厂商的投入和产品落地的速度来看,这个方向已经越来越清晰了。


AI 基础设施的下半场,核心一定是数据。数据供得上、管得细,才能真正释放算力的潜能。


前沿动态前沿大会
前沿人物

点「在看」,给前前加鸡腿

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
刘德华南京演唱会审批通过,连开六场!

刘德华南京演唱会审批通过,连开六场!

乡野小珥
2026-10-10 13:56:11
《生化危机:爆发夜》尺度太大,家长们又不舒服了

《生化危机:爆发夜》尺度太大,家长们又不舒服了

八卦南风
2026-10-10 13:12:04
一场2-0完胜,中网女单决赛首人诞生,小米辣杀疯,郑钦文收2利好

一场2-0完胜,中网女单决赛首人诞生,小米辣杀疯,郑钦文收2利好

大秦壁虎白话体育
2026-10-10 16:25:22
WTT中国大满贯:陈幸同逆转失败!第2局输3分,佐藤瞳追到1-1!
 

WTT中国大满贯:陈幸同逆转失败!第2局输3分,佐藤瞳追到1-1!  

刘姚尧的文字城堡
2026-10-10 17:31:15
中国大满贯!4强诞生,国乒劲敌0-4惨败,雨果逆转,林昀儒剃光头

中国大满贯!4强诞生,国乒劲敌0-4惨败,雨果逆转,林昀儒剃光头

南海浪花
2026-10-10 16:10:25
中国体坛最伟大7名运动员,林丹上榜,苏炳添第3,第1当之无愧

中国体坛最伟大7名运动员,林丹上榜,苏炳添第3,第1当之无愧

娱说瑜悦
2026-10-03 14:49:56
2016年叫嚣“今夜开战”!美国日裔上将哈里斯,擅自调遣航母闯南海,最后竟因一撮胡子翻车了!

2016年叫嚣“今夜开战”!美国日裔上将哈里斯,擅自调遣航母闯南海,最后竟因一撮胡子翻车了!

z千年历史老号
2026-10-09 17:23:20
服了!真受够最近广州这堆“半成品”商场了!

服了!真受够最近广州这堆“半成品”商场了!

广州PLUS
2026-10-10 17:27:05
别只靠黑服修身,自己也要拿出态度来!

别只靠黑服修身,自己也要拿出态度来!

穿的像个人样
2026-10-10 07:08:55
马斯克拒绝台积电

马斯克拒绝台积电

让心灵得以栖息
2026-10-10 14:51:29
赢完广东赢天津,山东2连胜!法耶2双态度拉满,班顿17分暗藏隐患

赢完广东赢天津,山东2连胜!法耶2双态度拉满,班顿17分暗藏隐患

萌兰聊个球
2026-10-10 17:12:46
连夜清空500条动态!张家齐母亲高调享乐,挥霍女儿奖金引众怒

连夜清空500条动态!张家齐母亲高调享乐,挥霍女儿奖金引众怒

手工制作阿歼
2026-10-10 14:40:08
10月9日,财政部释放社保新消息,2026年养老金调整还有可能吗?

10月9日,财政部释放社保新消息,2026年养老金调整还有可能吗?

云鹏叙事
2026-10-09 08:52:30
1.67-2.20!郑钦文冲首个中网决赛,若输球出局,请球迷别怒喷她

1.67-2.20!郑钦文冲首个中网决赛,若输球出局,请球迷别怒喷她

侃球熊弟
2026-10-10 00:22:39
纪委连打10个电话让我配合核查,我怒了:我入职才3天哪来的问题

纪委连打10个电话让我配合核查,我怒了:我入职才3天哪来的问题

千秋文化
2026-07-25 19:50:42
突发!富士康、立讯精密被调查

突发!富士康、立讯精密被调查

感知芯视界
2026-10-10 19:16:33
原国防部长耿飚的长女,巨额资产被封后赴美,她立誓要东山再起

原国防部长耿飚的长女,巨额资产被封后赴美,她立誓要东山再起

扬平说史
2026-10-06 23:32:39
开拓者主帅:瀚森传球出色能当进攻支点 机会出现完全放心派他上场

开拓者主帅:瀚森传球出色能当进攻支点 机会出现完全放心派他上场

罗说NBA
2026-10-10 06:26:35
摊牌了!世界级神锋逼宫离队!弗里克点名巴萨终极补强

摊牌了!世界级神锋逼宫离队!弗里克点名巴萨终极补强

奶盖熊本熊
2026-10-10 08:05:38
Win11 26H2又变了!免登录方法失效,微软账户越来越难绕过

Win11 26H2又变了!免登录方法失效,微软账户越来越难绕过

小8说科技
2026-10-10 13:40:17
2026-10-10 19:52:49
前沿在线 incentive-icons
前沿在线
前沿在线官方账号,关注AI、机器人、智能车等前沿领域;
472文章数 1236关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

两名中国男子赴泰旅游失联 乘车"报平安"的背景是树林

头条要闻

两名中国男子赴泰旅游失联 乘车"报平安"的背景是树林

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

宋佳一串三大满贯 争议随之而来

财经要闻

双汇因抗生素超标共被罚1.29亿元

汽车要闻

二十载再越巅峰 第五代全新别克君越今日正式上市

态度原创

教育
游戏
房产
公开课
军事航空

教育要闻

真不愧是学霸题,连大学生家长都要想半天

《堡垒之夜》预告金属索尼克加入,暂未公布上线日期

房产要闻

海棠湾销冠再出牌:海南顶豪「终局答案」,突然砸出!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美乌将举行新一轮会谈

无障碍浏览 进入关怀版