作者 | 陈悦琳
编辑 | 包永刚
HBM热潮之外,其他存储形式也站在风口。
这是今年第五届GMIF2026全球存储器行业创新峰会释放的第一个明显信号。以全球云数据中心资本支出为例,摩根士丹利执行董事、大中华区半导体分析师颜志天指出,在未计入HBM的情况下,2026年存储占比接近五成,2027年预计进一步升至53%。
热钱涌向存储,背后是前所未有的推理需求增加。截至今年3月,中国日均Token调用量已突破140万亿。对此,三星电子副总裁、Memory事业部首席技术官Kevin Yoon做了一个简单换算:中国每天消耗的Token,是中国国家图书馆全部藏书对应Token量的20倍以上,也接近人类历史上所有出版图书总量的6倍。
面对140万亿量级的推理负载,存储要应对的不只是数据量的增长,还有不同数据在访问频率和生命周期上的巨大差异。这意味着不同存储介质需要为此补齐各自在容量、带宽、时延和耐久性上的短板。
除此之外,Solidigm亚太区销售副总裁倪锦峰还在现场提到,以前存储成本较低时,行业倾向于尽量简化存储层级;随着AI数据需求快速增长和成本压力加剧,原有的“存储金字塔”也在被进一步细分。
规模化推理下,三重压力「夹击」存储
当AI的发展阶段从训练端的模型竞赛进一步走向推理侧的规模化应用后,存储面对的压力也更为具体。倪锦峰将其概括为三个维度。
最直观的是数据丰富度。星河智联现场展示的车载Agent,可以用来说明AI系统如何同时处理和保存多模态数据:除了理解语音、视觉、车辆信号等不同形式的信息之外,Agent还要结合对话历史、长期记忆、用户画像以及实时变化的车身状态完成判断。
这意味着数据丰富度不只体现为数据形式和数量的增加。不同数据的来源、形态和更新频率各不相同,直接导向第二层压力——推理复杂度。
Arm全球存储业务负责人John Xavier Lionel对推理数据的拆解恰好解释这一维度:模型变大,会带来更多权重和运行时状态;上下文越长,需要为后续Token生成保留的KV Cache也在增加;同时服务的用户越多,系统还要为每个请求分别保留KV Cache;进入逐Token生成的Decode阶段,模型权重和KV Cache还会被反复访问。
而当推理模式从一次性问答转向持续运行的Agent时,单个任务持续时间被拉长,随着任务规模扩大,需要长期维护的上下文和运行状态也不断累积,这也引出了倪锦峰所说的第三个维度“运营持久性”。
Dify联合创始人陈璐莎判断,未来企业运行的Agent,数量可能将从个位数上升至数百个,并且能够24小时待命、执行长程任务和承担高并发请求。
这种持续运行,也对应不同的企业AI服务模式。例如并行科技提供的MaaS(Model as a Service,模型即服务)模式允许企业通过API持续调用不同模型并按Token付费。这意味着服务商需要持续保障模型调用的首Token时延、成功率和吞吐量,并监控调用费用;
针对企业本地Token工厂的建设规划,相比追求峰值性能,联想更关注算力资源的实际利用率、服务运行的稳定性,以及最终能以多低的成本持续产出Token。
当SSD、HDD和NAND开始「越界」
当数据、推理和运营三种因素的变化进一步叠加,存储容量扩张、带宽提升、时延降低、耐久性保障等多重挑战随之袭来,不同存储介质自我能力的提升变得更加紧迫。其中,变化最明显的当数过去更多负责大容量和持久化存储的SSD,目前多家企业已经从多个维度展开升级。
不同任务正向同一款SSD提出不同的性能要求。以Agent的工作环节为例,规划阶段强调低时延、检索阶段要求高吞吐,执行阶段则更指向高带宽。对此,慧荣科技通过主机软件和存储软件栈识别任务类型,再由SSD控制器按QoS(Quality of Service,服务质量)等级调整资源配置,使同一块SSD能够响应不同AI负载。
SSD不只是在内部做差异化分配。结合存储与计算单元之间的距离,闪迪资深产品市场总监张丹将SSD拆成三类:直接连接GPU的SSD主要承接热KV等高频访问数据,为计算持续“备料”;通过网络连接GPU的SSD仍然服务计算,但部署规模可以更大;位于计算集群之外的存储型SSD则更强调容量,主要承载不需要被频繁访问的数据。
SSD向上承接更多靠近计算的数据之外,也在向存储金字塔的下层延伸。据倪锦峰观察,为了减少机房空间占用和功耗开销,北美大型互联网公司已经开始用大容量QLC SSD替代部分HDD。
当然,这并不意味着HDD的影响力式微。定位于传统HDD与企业级SSD之间,大数极限设计的PMD试图在传统机械硬盘基础上通过多路并行、扩大I/O请求队列,并结合请求聚合、预取和缓存等方式提高存储带宽和随机访问能力。
工作负载的变化也影响了SSD的测试环节。传统SSD测试常以固定4K、128K数据块进行读写,而AI负载会出现突发、高并发等更加复杂的I/O行为。欧康诺因此在AI SSD测试中加入深度学习I/O负载,以及KV Cache、断点恢复等场景。
更值得注意的是,构成SSD底层介质的NAND,本身也在沿着不同方向突破原有的能力边界。
一种思路是直接提高NAND器件本身的性能。在意识到端侧推理向DRAM施加的成本压力后,三星设计的Z-NAND,其核心Die基于SLC(Single-Level Cell,单层式存储),并集成TSV(Through-Silicon Via,硅通孔)等技术提高读取性能。在Kevin展示的架构中,操作系统和KV Cache仍留在DRAM,大容量、读取密集的模型权重则被放入Z-NAND。
另一种思路则将NAND升级成为HBF(高带宽闪存)。据北京大学集成电路学院院长蔡一茂介绍,目前主要有两条技术路径:一条从NAND阵列本身入手,通过缩小阵列尺寸降低读取时延;另一条则借鉴HBM提高并行度的思路,通过增加接口数量来提升带宽。他同时指出,尽管两种方案都在试图补足传统NAND读取速度和带宽的短板,但仍需要解决如缩小阵列会牺牲部分存储密度、NAND的读取时延仍然偏高、有限的写入寿命难以承受KV Cache等数据的频繁更新等问题。
更加激进的NAND变化体现在从存储继续向计算延伸。蔡一茂提到,当前北大和燕芯微等合作伙伴正在探索利用NAND阵列直接完成部分存内计算,减少数据在存储和计算单元之间的往返。
数据分层管理从「兜底」走向主动调度
传统存储层级建立在速度、容量与成本的权衡之上:越靠近计算单元,速度越快、容量越小、单位成本越高;越向下则相反。这套分工能够长期保持稳定,也与不同数据相对固定的访问需求有关。
如今,软硬件都在发生变化。一边是存储载体自身的能力边界不断外扩:从存储“金字塔”层级出发,SSD同时向计算侧存储和大容量存储侧延伸,更靠近塔底部的HDD试图向更高性能靠拢;聚焦具体存储介质,NAND进一步向高带宽乃至计算能力拓展。
另一边,AI带来更多类型的数据,同一份数据的访问频率和生命周期也会随着计算过程不断变化。原本相对稳定的数据与介质对应关系由此开始松动。
在多位与会嘉宾看来,数据跨层移动本身并不是AI时代的新现象,真正的变化在于,数据管理正从“HBM不够给DRAM、DRAM不够给SSD”的兜底式分层,转化为系统设计之初的主动分层和运行过程中的动态调度。
芯展速副总裁李蓁进一步用三个关键词拆解了当前AI数据供给体系:存储决定什么数据由什么介质承载,连接负责数据稳定、高效地流动,解决方案则通过软件完成调度和应用适配。
而联芸与寅谱联合推出的AI SSD方案则将这种分工落到了推理运行过程中。针对MoE模型参数,当前需要调用的专家权重留在CPU内存和GPU显存中,暂时不会被调用的权重则放入SSD。考虑到SSD访问速度更慢,系统还会预测下一阶段可能调用的专家,提前将相应模型和参数预取回来。针对KV Cache,高频访问的留在内存,低频部分则下沉到SSD。
把范围从单个计算节点放大到整个算力集群,杰创智能搭建的常青云平台还进一步大同“数据——存储——计算”的链路,提前把任务所需的数据准备到相应节点,并结合任务类型、GPU代际和网络带宽等信息,将数据与合适的算力资源匹配起来。
这也呼应了佰维存储董事长孙成思在现场的判断——“数据供给的效率决定算力的产出”。当AI推理走向规模化、高并发和持续运行,存储最终要回答的,已经不只是数据放在哪里,还有如何让数据及时抵达算力。
雷峰网雷峰网
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.