网易首页 > 网易号 > 正文 申请入驻

当推理撞上“内存墙”,Solidigm如何抓住AI工厂的新机遇?

0
分享至

KV Cache的激增,足以催生出一个全新的存储市场,这是英伟达CEO黄仁勋在GTC 2026上提及的一个重要判断。

当大模型越来越大、能力越来越强,并逐步通过Copilot、智能体等形态进入企业应用,推理开始从幕后走向台前。相较于模型训练,模型推理发生得更高频、更持续,也更直接关系到企业AI应用的成本与体验。

作为全球AI产业的风向标,英伟达已经意识到,模型推理太贵、上下文管理太重,正在成为大模型规模化落地的新瓶颈。于是,在其AI基础设施技术栈中,一个以太网连接、专为KV Cache优化的闪存层被提出,也就是G3.5层。

这背后并不只是多了一层存储,而是AI基础设施的重心正在发生变化。

过去,行业习惯用GPU数量、模型参数和集群规模来衡量AI能力,但在AI工厂时代,真正决定系统产能的,越来越是数据能否快速、稳定、高效地抵达GPU。

这也意味着,存储正在从数据中心的后台容量池,走向AI算力生产线的关键位置。

对于专注于面向数据中心、云计算和AI工作负载研发存储产品的Solidigm而言,这一变化不仅意味着SSD市场需求的扩大,也意味着存储技术在AI架构中的战略价值正在被重新定义。


01 AI工厂改变存储角色

传统数据中心更像通用IT基础设施。

它的任务是承载数据库、ERP、网站、虚拟化、数据分析、备份归档等多种应用,核心指标围绕稳定运行、容量管理、批量计算、多租户隔离和成本控制展开。

在这样的体系中,存储首先是数据容器。行业讨论存储时,通常谈的是容量、可靠性、IOPS、吞吐、每TB成本和数据保护。存储当然重要,但更多是后台系统,是支撑业务运行的基础设施。

但AI工厂的提出,正在悄然改变存储的角色。

什么是AI工厂?

所谓AI工厂,实则一个原生AI的生产环境,旨在以工业规模将数据转化为“智能”,通过可衡量的吞吐量持续训练、微调和提供模型服务,以确保有效的推理。


它不是简单运行应用,而是持续把数据转化为模型能力、推理结果、token输出、预测、推荐和智能体行动。

它更像一条智能生产线:数据被摄取、清洗、转换、训练、微调、评估、部署,再进入大规模推理和持续迭代。

因此,AI工厂关注的指标不再只是系统是否在线,而是训练时间有多短、微调速度有多快、每秒生成多少token、GPU空闲时间有多低、每瓦能产生多少智能输出、每次推理成本能否下降。

AI工厂的核心不是单块GPU的峰值性能,而是从数据进入系统到模型输出结果的端到端吞吐,计算、网络、内存、存储、调度和软件栈必须协同运转,任何一个环节变慢,都会拖累整条生产线。

在AI工厂中,存储成为AI生产线中对性能至关重要的一个环节,不再仅仅是一个存储库。

过去,存储是“仓库”,负责把数据放好。

现在,存储更像“传送带”,必须持续、低延迟地把数据送到GPU。

接下来,存储还会逐渐成为扩展内存层,承载推理上下文、KV Cache、向量检索数据和智能体状态。

这也让企业级SSD的价值被重新审视,对于强于SSD存储技术的Solidigm而言,AI工厂并不是简单带来更多容量采购,而是让高性能、高密度、低功耗SSD开始进入AI系统的关键数据路径。


与此同时,存储行业的评价体系已经悄然改变,客户不再只是问一套存储系统有多少容量、多少IOPS,而会追问:

它能否提高GPU利用率?能否降低推理尾延迟?能否提升token吞吐?能否减少数据移动带来的能耗?能否让同样规模的AI集群产生更多输出?

也正因如此,英伟达提出了G3.5层的概念。

在传统分层中,GPU HBM和系统内存负责最热数据,本地SSD承担缓存和热数据,远端文件系统、对象存储、数据湖负责持久化和长期保存。但推理负载增长后,中间出现了一个新缺口,有些数据太大,无法长期放在HBM或DRAM里,有些数据又太热、访问太频繁,不能放到远端传统存储里慢慢读取。

这个缺口,就是由G3.5层补齐,英伟达认为,G3.5层应该位于近GPU内存和后端共享存储之间,面向机柜级、低延迟、高容量的推理上下文存储,它不是普通冷数据层,也不是简单SSD缓存,而是为了AI推理中持续增长的上下文状态而设计的新型闪存层。

对存储行业来说,这意味着存储不再只为保存数据而优化,而是要为生产智能而优化。

02 推理撞上“内存墙”,高并发、长上下文成新瓶颈

在ChatGPT问世和百模大战期间,大模型基础设施的主要矛盾集中在训练阶段。

模型越来越大,训练数据越来越多,GPU集群规模越来越庞大,行业自然把注意力放在训练算力、并行通信和数据集吞吐上。

但随着AI商业化深入,推理正在成为新的主战场。

训练是阶段性的,推理却是持续发生的,每一次用户提问、每一次企业知识库检索、每一次智能体调用工具、每一次代码生成或文档分析,都会触发推理。AI应用越普及,推理负载越会以高频、高并发、长周期的方式增长。

更重要的是,今天的推理已经不再是一问一答。

在ChatGPT问世初期,大模型更像是一个聊天机器人,一个提示词可能对应一次模型调用,到了Copilot和智能体阶段,一个请求可能被拆解为理解任务、检索资料、调用工具、生成中间结果、反思修正、再次调用模型,最后输出答案。一次用户交互背后,可能产生数十次甚至上百次的模型操作。


这让模型推理场景呈现出四个鲜明特点:

第一,高并发,企业级AI服务需要同时响应大量用户、应用和智能体任务,单个会话看似不大,但汇聚到系统层面,就会形成巨大的上下文工作集;

第二,长上下文,模型要处理更长文档、更长对话和更复杂任务,KV Cache随之膨胀,它保存模型生成过程中可复用的中间状态,可以减少重复计算,但也会持续占用内存空间;

第三,小IO高频读写,推理上下文、KV Cache、RAG检索结果、向量索引和智能体状态,并不总是大文件顺序读写,而是大量小块数据的频繁访问;

第四,低时延刚需,推理服务面对的是实时体验,一次慢读取、一次上下文调度延迟,都可能影响token生成速度,拉高尾延迟。

这些特点共同放大了行业长期存在的“内存墙”和“存储墙”。

所谓内存墙,是指靠近GPU的高速内存容量有限、成本高昂,HBM和DRAM很快,但不能无限扩展。面对长上下文和高并发推理,系统往往不是先达到GPU算力上限,而是先遇到内存容量上限。

所谓存储墙,是指传统共享存储或对象存储虽然容量大,但离计算端较远,延迟和网络路径难以满足token生成关键路径上的实时需求。如果把活跃KV Cache或推理上下文放到传统远端存储中,就可能出现不可预测的延迟波动,让GPU等待数据。


这正是AI基础设施的新现实,GPU仍然关键,但AI算力顶峰不再主要由GPU定义。

如果数据不能持续抵达GPU,如果上下文不能快速调入,如果存储层延迟不稳定,再强的GPU也无法充分释放性能。

这也解释了为什么闪存在AI推理中的位置会前移,过去SSD更多承担本地缓存、热数据加速和容量替代,但在长上下文、高并发推理场景下,SSD开始具备“有效内存扩展”的意义,它既比DRAM更具容量经济性,又比传统远端存储更靠近计算。

对于Solidigm而言,这正是其产品能力与AI新需求发生交汇的地方。

AI工厂需要的不只是更大的存储池,而是在有限机架空间、功耗预算和时延约束下,提供更高密度、更稳定性能和更优能效的闪存基础设施。

英伟达提出的G3.5层理论,也正是在为这个问题提供新的架构位置。

它将一部分推理上下文、KV Cache、多轮对话历史和智能体状态,放在比传统数据湖更近、比DRAM更具容量经济性的闪存层中,这样既可以减少重复计算,也可以提高上下文复用效率,降低GPU等待时间。

换句话说,闪存正在从存储介质变成AI有效内存的扩展层。

03 在新存储体系中,Solidigm如何找到自己的位置

当AI工厂和G3.5层概念逐渐清晰并成为英伟达造就的又一个时代潮流后,一个自然的问题也随之出现:什么样的存储产品,才能真正承接这个新层级?

答案并不是单纯更大或更快的存储产品,而是要同时满足AI推理对性能、容量、密度、能效和稳定性的复合要求。

推理规模化会持续拉动高容量SSD需求,长上下文、多轮对话、RAG和智能体工作流,会不断产生KV Cache、向量索引、会话状态和模型工件,仅靠DRAM和HBM承载并不现实,高容量NVMe SSD因此成为扩展上下文空间的重要选择。

高并发推理也会提升对稳定低延迟SSD的需求,AI服务不只看平均吞吐,更看高负载下的尾延迟和服务质量,如果SSD能在真实混合IO场景下保持稳定读写性能,就能帮助减少上下文调度等待,提高GPU利用率。

与此同时,AI工厂还受机柜空间、电力和散热约束。单位机架能提供多少TB、每瓦能承载多少数据、能否减少数据搬移,会直接影响AI基础设施的扩展效率。

这也意味着,SSD正在参与AI单位经济性的优化。企业最终关心的是每次推理成本、每千token成本、每瓦token数。如果合适的闪存层可以减少GPU空闲、降低重算、提升并发和吞吐,它创造的价值就不只是降低存储成本,而是优化整个AI服务成本结构。

在这样的背景下,Solidigm的机会就不再只是提供SSD,而是以不同类型的企业级SSD,承接AI工厂中不同层级的数据访问需求。


从产品布局来看,Solidigm已经形成了比较清晰的产品路线图,既包括面向性能敏感场景的D7-PS1010等产品,又包括面向高容量密度场景的D5-P5336。

D7-PS1010是一款PCIe Gen5 NVMe SSD,更适合高吞吐、低延迟、高并发的AI工作负载,放在AI工厂场景中,它可以服务于热数据访问、本地缓存、KV Cache卸载、RAG检索、检查点读写,以及对延迟更敏感的推理上下文调度。

如果放到英伟达的G3.5层存储概念中,D7-PS1010对应的是性能敏感的热路径,当AI推理需要频繁调入上下文、复用中间状态、快速访问向量索引时,高性能SSD就是维持推理连续性的关键部件。

而G3.5层不仅需要快,也需要足够大的容量。

它要承载大量并发会话、长上下文状态和动态KV数据,容量需求会随着GPU数量、用户规模和智能体复杂度同步增长。如果每个AI机柜都需要更多闪存容量,那么单位空间、单位功耗下能提供多少TB,就会成为关键指标。

这正是Solidigm的D5-P5336的价值所在。

作为高容量NVMe SSD,D5-P5336可提供高达122TB级别的容量配置,天然更适合AI数据湖、高密度训练数据集、模型工件、向量数据库和推理上下文容量池等场景,它的意义在于,帮助AI工厂在有限机架和功耗预算内,获得更高的数据承载能力。

面向当下的AI工厂,Solidigm的产品布局很清晰:

GPU HBM和DRAM负责最热、最即时的计算状态,本地高性能NVMe SSD负责热数据、缓存、数据混洗和低延迟访问,G3.5层闪存负责机柜级共享KV Cache、推理上下文和智能体状态,后端数据湖和对象存储负责长期数据、日志、模型工件和归档。

在这个体系中,D7-PS1010更偏向性能敏感的热路径,D5-P5336更偏向容量密集的上下文与数据池,二者共同覆盖了AI工厂对快和大的双重需求。

AI工厂的竞争,不是单颗芯片的竞争,而是整个系统的竞争。

这其中,GPU决定计算潜力,但存储决定这种潜力能否被持续释放,英伟达提出3.5层存储理论,本质上是在提醒行业,AI的下一轮扩展,不只发生在GPU内部,也发生在GPU之外的数据路径上。

谁能让数据更快、更近、更节能地抵达GPU,谁就能帮助客户提高AI工厂的智能产出效率,而Solidigm要抓住的,正是闪存在AI推理链路中从后台走向核心的这一刻。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
20点!山东男篮迎好消息,签约3大强援后,NBA选秀首轮级外援曝光

20点!山东男篮迎好消息,签约3大强援后,NBA选秀首轮级外援曝光

王大发不懂球
2026-08-13 00:19:11
百花奖最狠的不是冷落哪吒,而是让观众看清:圈子早就不带你玩了

百花奖最狠的不是冷落哪吒,而是让观众看清:圈子早就不带你玩了

小冠说娱
2026-08-12 11:29:48
演员陈好:我这辈子最正确的决定,就是30岁嫁给那个二婚的踏实人

演员陈好:我这辈子最正确的决定,就是30岁嫁给那个二婚的踏实人

飘飘然的娱乐汇
2026-08-01 19:00:06
吃着不甜,却能让血糖飙升的8种食物!还是公认健康粗粮!

吃着不甜,却能让血糖飙升的8种食物!还是公认健康粗粮!

果壳
2026-08-12 12:40:58
段永平,泡泡玛特持仓创新高

段永平,泡泡玛特持仓创新高

上海证券报
2026-08-12 22:04:12
公安部通报!第一轮就抓了8200人,暴力催收的末日来了!

公安部通报!第一轮就抓了8200人,暴力催收的末日来了!

云景侃记
2026-08-12 09:32:29
《花开锦绣》差评满天飞!看6集后,我想说:丁禹兮退出古装剧吧

《花开锦绣》差评满天飞!看6集后,我想说:丁禹兮退出古装剧吧

青橘罐头
2026-08-12 19:32:20
低挑衅成本陷阱:正在掏空中国几十年攒下的战略威慑家底

低挑衅成本陷阱:正在掏空中国几十年攒下的战略威慑家底

小马姨
2026-08-02 16:31:10
上海“大巨蛋”选址之争,普陀、杨浦、闵行谁将胜出?

上海“大巨蛋”选址之争,普陀、杨浦、闵行谁将胜出?

林子说事
2026-08-12 11:10:52
弘一法师:当你的福报开始变大,身边的人会渐渐离开,原因很现实

弘一法师:当你的福报开始变大,身边的人会渐渐离开,原因很现实

牛锅巴小钒
2026-08-10 14:01:26
手机从2700米高空摔进怒江大峡谷:靠华为云空间查找功能精准找回

手机从2700米高空摔进怒江大峡谷:靠华为云空间查找功能精准找回

快科技
2026-08-12 18:50:15
当你接触的男人越多,就会发现:那些情商极高,会哄你,情绪价值拉满的男人,爱最飘,钱最不舍得花,心也最容易变

当你接触的男人越多,就会发现:那些情商极高,会哄你,情绪价值拉满的男人,爱最飘,钱最不舍得花,心也最容易变

犀利强哥
2026-08-12 06:59:52
2026年,江苏过渡性养老金改革第3年,2025年补了290元,2026年全额能领多少?

2026年,江苏过渡性养老金改革第3年,2025年补了290元,2026年全额能领多少?

碎月导师
2026-08-11 10:35:33
刘备一生没重用赵云,临死前才告诉他为什么:你有三件事办砸了!

刘备一生没重用赵云,临死前才告诉他为什么:你有三件事办砸了!

墨策讲历史
2026-08-12 23:35:57
上半年全国结婚登记327.5万对

上半年全国结婚登记327.5万对

第一财经资讯
2026-08-12 13:51:12
“他的智商已经不是普通人了”,宝妈公开厌恶天才儿子:只想揍他

“他的智商已经不是普通人了”,宝妈公开厌恶天才儿子:只想揍他

泽泽先生
2026-08-06 11:01:17
风暴眼 | 曾年销超76万的神车,要退场了

风暴眼 | 曾年销超76万的神车,要退场了

凤凰网财经
2026-08-10 18:58:21
最牛美女处长,1000天和男上司开房410次,临时工晋升财务副处长

最牛美女处长,1000天和男上司开房410次,临时工晋升财务副处长

三石记
2026-06-26 07:16:19
斯诺克战报:6-2,6-4,新科世锦赛冠军出局了,中国名将晋级8强

斯诺克战报:6-2,6-4,新科世锦赛冠军出局了,中国名将晋级8强

小火箭爱体育
2026-08-12 17:45:16
以军士兵当场把枪口对准戴着PRESS标识的中国记者,8小时铁证画面震动全球,中方罕见5次点名批评,这次后果不是道歉能解决的

以军士兵当场把枪口对准戴着PRESS标识的中国记者,8小时铁证画面震动全球,中方罕见5次点名批评,这次后果不是道歉能解决的

林杰论事
2026-08-10 17:48:37
2026-08-13 01:47:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9496文章数 568关注度
往期回顾 全部

科技要闻

Manus第二季,浪子回头

头条要闻

冲上热搜:银行能办结婚证了

头条要闻

冲上热搜:银行能办结婚证了

体育要闻

杜兰特,所谓的“联盟小王”

娱乐要闻

老戏骨杨昆两夺金鹰奖,因物业费被告

财经要闻

华尔街把AI算力炒成下一个房地产?

汽车要闻

全系600km续航/空间表现出色 奇瑞风云T7预售10.99万起

态度原创

游戏
亲子
教育
本地
公开课

《羊蹄山之魂 完整版》预购开启!568港币 10月发售

亲子要闻

脚底长满小疙瘩?!10岁孩子游泳后确诊HPV感染!很多家长都搞错了...

教育要闻

教老师们把背的词写成一道题。

本地新闻

黄州一夜,苏轼写给普通人的月光

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版