网易首页 > 网易号 > 正文 申请入驻

当大模型开始按Token计价,SSD正在成为AI推理核心

0
分享至



过去几年,AI 基础设施的竞争主要围绕 GPU 和高带宽内存(HBM)展开。随着模型规模不断扩大,训练和推理需要越来越多的算力,GPU 集群、HBM 容量和互连带宽成为衡量系统能力的重要指标。

但进入长上下文、多轮对话和 AI 智能体时代,推理系统面对的问题开始发生变化。一次请求往往不仅涉及模型计算,还需要加载模型权重、读取历史上下文、检索知识、调用工具,再将结果返回模型继续推理。数据需要在 GPU、CPU、内存、存储和网络之间持续流动,只要其中任何一个环节无法及时供给数据,再强的 GPU 也只能等待。

因此,企业评估 AI 基础设施的方式也开始改变。客户真正购买的,并不是一块 GPU ,而是系统能够持续、稳定地完成推理并生成结果的能力。对于在线推理来说,真正被交付的产品,其实是 Token。

企业开始关注的不再只是拥有多少 GPU,而是相同硬件在单位时间内能够交付多少符合服务质量要求(SLO)的 Token,以及完成这些 Token 所需要付出的成本。

然而,一个 Token 的成本已经不仅由 GPU 决定,还受到 CPU、HBM、DRAM、SSD(固态硬盘)、网络、电力、散热以及软件和运维等整个推理系统的影响。与此同时,也不是所有 Token 都具有同样价值。只有满足首 Token 延迟(TTFT)、生成速度(TPOT)、响应质量和稳定性要求的 Token,才是真正能够交付给客户的有效 Token。

当评价标准从“买了多少 GPU”转向“交付了多少有效 Token”时,存储在推理系统中的角色也开始发生变化,其中最具代表性的便是 SSD。它正从传统的数据存储设备,逐渐成为 AI 推理基础设施的重要组成部分。

AI SSD,开始重写存储价值

相比内存,SSD 拥有更低的容量成本;相比远端对象存储,又离计算节点更近,可以保存那些暂时放不进内存、但很快还会再次使用的模型和上下文数据。

一方面,它能够承担更多模型权重、KV Cache、MoE 专家参数等运行数据,减少系统为了扩容而增加内存或 GPU 的压力;另一方面,又能够提前完成模型加载、复用已经计算过的内容,减少重复计算和等待时间,让同样数量的 GPU 在相同时间内完成更多推理请求。

这种思路已经出现在越来越多的推理系统中。例如,月之暗面(Moonshot AI)开源的 Mooncake,把 CPU、内存、本地 SSD 和高速网络组织成共享的 KV Cache 池,让不同 GPU 可以直接复用已经计算好的上下文,而不必重新计算。


(来源:月之暗面)

还有 ServerlessLLM 将本地 SSD 纳入模型调度,在模型启动前提前完成加载,减少冷启动等待;TensorRT-LLM、vLLM 和 CachedAttention 等推理框架,则通过复用已经计算好的 KV Cache 或共享 Prefix,避免相同内容反复执行 Prefill。从某种意义上说,这些系统缓存的不只是数据,也是在保存已经付出过的计算结果。

当然,把 SSD 放进推理系统,并不意味着 Token 成本一定会下降。如果缓存没有命中,系统仍然需要重新读取甚至重新计算;预取策略不合理,还可能占用宝贵的 PCIe 带宽和内存空间。因此,评价 AI SSD 不能只看带宽、IOPS 等传统存储指标,更重要的是它是否能够缩短模型启动时间、提高缓存命中率、减少 GPU 等待,并最终让整个推理系统以更低成本交付更多满足服务要求的 Token。

消费级和企业级,AI SSD 是两种生意

不过,AI SSD 的价值并不会体现为一种统一的产品形态。不同的部署环境和客户群体,面临的瓶颈并不相同,对存储的需求自然也会有所差异。

从目前来看,AI SSD 很可能沿着两条市场路线发展:一条面向消费级市场,服务 AI PC、工作站等端侧设备;另一条面向企业级市场,服务边缘计算和云端 AI 推理基础设施。

对于消费级用户来说,最大的挑战是在有限的内存和功耗条件下,让设备运行更大的模型、保存更多本地知识,并在离线状态下继续使用 AI。消费级 AI SSD 最现实的形态,仍然是一块安装在 AI PC、工作站等设备中的固态硬盘。它依然承担系统盘和数据盘的功能,但会进一步加入面向 AI 的数据管理能力,让模型、缓存和用户数据能够更高效地保存在本地,而不需要改变现有 PC 的硬件架构。

苹果在《LLM in a Flash》中展示过一种思路:把大部分模型参数保存在 Flash 存储中,需要计算时再按需加载到内存。沿着这一思路,AI SSD 不仅可以存放大模型本身,还可以保存多个专业模型、个人知识库、AI 助手的长期记忆,以及暂时不用的数据,让系统根据不同任务动态组合所需内容,而不用一直占用宝贵的内存。

消费级 AI SSD 带来的首先是本地 AI 的可用性。会议记录、文档检索、代码生成、个人知识库等任务,不需要每次都重新从云端下载模型或上传数据,在网络较差甚至离线的情况下,仍然能够完成一部分工作,同时减少网络传输和云端推理成本。当然,数据保存在本地并不意味着天然安全,权限管理、数据加密和安全删除等机制仍然不可或缺。

企业级市场则完全是另一套逻辑。企业客户购买的不是一块 SSD,而是整个 AI 推理系统的效率。无论部署在企业边缘节点还是云端数据中心,更重要的问题都是如何减少 GPU 等待、提高 GPU 利用率,并持续降低每个 Token 的生成成本。

在企业边缘,AI SSD 可以帮助设备在弱网甚至离线环境下运行模型,支撑工厂、门店、医院等场景的本地 AI 应用;而在云端数据中心,它承担的角色则更加重要。本地 SSD 可以缓存模型和检查点(Checkpoint),减少反复从远端对象存储加载;机架或服务器集群中的共享 Flash 存储,则可以保存仍有复用价值的推理数据,让不同 GPU 在处理相似请求时直接利用已有结果,而不必重复计算。


图|消费级与企业级AI SSD在端侧和云侧的典型角色。

这一思路也已经开始进入商业产品。英伟达推出的 CMX Context Memory Storage,就在 GPU 高带宽内存(HBM)、主机内存和共享存储之间增加了一层基于 Flash 的上下文存储,用来保存暂时放不下、但仍有复用价值的数据。它并不是让每一次推理都访问 SSD,而是尽量把这些数据保留在离 GPU 更近的位置,需要时能够快速取回,从而减少数据搬运带来的等待时间。


图|CMX Context Memory Storage(来源:英伟达)

虽然都叫 AI SSD,但消费级和企业级产品解决的是两类完全不同的问题。消费级 AI SSD 关注的是本地 AI 能力,让设备能够运行更大的模型、保存更多个人知识,并提升离线体验;企业级 AI SSD 关注的则是整个推理系统的效率,通过减少模型加载和数据等待,提高 GPU 利用率,降低每个 Token 的生成成本。未来,这两条路线很可能长期并存,并分别沿着端侧设备和云端推理基础设施不断演进。

AI SSD,开始出现不同的产业路径

面对不同的应用场景,厂商们也开始沿着各自擅长的方向进入这一市场。有人希望提供完整的 AI 部署方案,有人从 SSD 控制器出发,让存储主动参与推理,也有人尝试同时打通计算和存储两侧,共同定义下一代 AI SSD。

群联(Phison)选择的是第一条路径。其 aiDAPTIV 将 SSD、中间件和部署工具组合在一起,通过分层管理模型权重,让超过显存容量的大模型也能够运行在消费级 GPU 上。相比单独销售一块 SSD,它交付的是一整套 AI 部署方案,客户不需要从裸设备重新搭建推理环境。最终,这类产品的竞争力仍然要落到可运行模型规模、启动时间、Token 吞吐、兼容性和整体部署成本等指标上。

江波龙则把重点放在 SSD 本身。其提出的 SPU+iSA 架构,希望把压缩、缓存、混合介质管理和智能预取等能力进一步放到存储侧,让 SSD 从被动响应 I/O,逐渐成为能够参与运行时数据管理的主动存储组件。进一步来看,这一思路也指向一种更加主动的 AI 存储节点:存储不仅负责保存数据,也开始参与模型、KV Cache 和专家参数等数据对象的组织、迁移与调度。当然,目前公开的数据主要来自厂商资料,不同方案之间仍缺乏统一的第三方评测,因此更适合作为一种产品方向来观察。

寅谱(Infplane)与联芸科技(Maxio Technology)的合作,则更强调计算和存储的协同设计。

联芸长期深耕 SSD 控制器、固件和闪存管理,并公开提出 AI 推理的价值尺度正逐渐从容量和价格,转向每 Token 成本和系统能效;寅谱则从 AI 芯片、Runtime 和操作系统切入,希望把模型运行过程中的调度信息更快传递到控制器和固件。

在之前提到的几种方案中,寅谱也是唯一从 AI 计算与系统软件出发的 AI Native 企业,其优势在于能够把模型和 Runtime 的需求直接映射到控制器、固件、NAND 管理以及 OEM 参考设计,让存储系统与推理框架形成更紧密的协同,而不仅仅停留在存储性能优化层面。


图|推理参与型AI SSD探索:群联aiDAPTIV、江波龙SPU+iSA

另一类产品则更接近传统企业级 SSD 的演进路线。英韧科技(InnoGrit)的洞庭 N3X、华为(Huawei)OceanDisk LC 560 等产品,主要围绕 AI 场景强化性能、容量密度、耐久性和服务质量(QoS),为模型加载、KV Cache、向量数据库和推理数据层提供更加稳定的存储基础。它们并没有改变 SSD 在系统中的基本角色,而是在现有架构下进一步提升企业级存储能力。


图|英韧科技洞庭N3X与华为OceanDisk LC 560。

这些探索并不是彼此取代,而是分别覆盖 AI 推理系统的不同层次。有人负责把 AI 更容易部署起来,有人负责让存储更主动地参与推理,也有人继续夯实底层存储能力。随着 AI 推理规模持续扩大,这些能力很可能在同一套系统中融合,共同服务于一个目标:让相同的算力交付更多有效 Token。

从目前的发展来看,AI SSD 的价值正在不断延伸。最初,它帮助内存有限的设备运行更大的模型;随后,它开始保存模型缓存、上下文和其他可复用的数据,减少重复计算和数据搬运;未来,它还可能进一步成为端侧和云侧 AI 存储节点中的核心组成部分,在模型加载、上下文管理和推理调度中承担更加主动的角色。不过,无论产品形态如何变化,兼容现有硬件和软件生态,仍然是 AI SSD 大规模普及的重要前提。

它在端侧和云侧的发展重点也会有所不同。在端侧,AI SSD 的价值主要体现在支持更大的本地模型、更丰富的个人知识库、更好的离线体验,以及减少对云端推理的依赖;在云侧,它更关注模型冷启动、上下文复用、GPU 利用率以及每 Token 成本等推理基础设施指标。随着端、边、云协同不断成熟,未来计算任务也可能根据成本、时延、隐私和数据位置,在终端设备、边缘节点和云端之间动态分配。

从更长远的角度来看,AI SSD 争夺的并不仅仅是存储市场中的一个新品类,而是 AI 推理基础设施中的一个新角色。它既要以远低于内存的成本保存更大的智能工作集,又要比传统共享存储更高效地服务模型推理,把模型加载、上下文复用和弹性启动带来的效率提升,最终转化为更多有效 Token。

过去,人们评价一块 SSD,看的是容量、带宽和 IOPS;未来,衡量 AI SSD 的标准可能会变成另一组指标:它是否能够让相同数量的 GPU,在相同的时间和功耗下,交付更多满足服务要求的 Token。如果能够证明这一点,AI SSD 才有机会从一块“面向 AI 的高端硬盘”,真正成为下一代 AI 推理基础设施的重要组成部分。

1.https://developer.nvidia.com/blog/introducing-nvidia-bluefield-4-powered-inference-context-memory-storage-platform-for-the-next-frontier-of-ai/

2.https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/

3.https://www.usenix.org/conference/fast25/presentation/qin

4.https://kvcache-ai.github.io/Mooncake/design/ssd-offload.html

5.https://www.usenix.org/conference/osdi24/presentation/fu

6.https://www.usenix.org/conference/atc24/presentation/gao-bin-cost

7.https://machinelearning.apple.com/research/efficient-large-language

8.https://developer.nvidia.com/blog/5x-faster-time-to-first-token-with-nvidia-tensorrt-llm-kv-cache-early-reuse/

9.https://docs.vllm.ai/en/stable/design/prefix_caching/

10.https://phisonaidaptiv.com/zh-tw/how-aidaptiv-works/

11.https://cn.longsys.com/about/news/13353.html

12.https://www.maxio-tech.com/news/11645/13048.html

13.https://www.eeo.com.cn/2025/1222/774317.shtml

14.https://www.yingren.cn/news/%E4%BB%8En3x%E5%88%B0gen6%EF%BC%9A%E8%8B%B1%E9%9F%A7%E7%A7%91%E6%8A%80%E5%A6%82%E4%BD%95%E7%94%A8%E4%B8%89%E5%A4%A7%E8%A6%81%E7%B4%A0%E6%89%93%E9%80%A0%E5%9B%BD%E4%BA%A7ai-ssd/

15.https://e.huawei.com/en/documents/products/storage/97dc7a1dc98f4d3d90b268db03235cf7

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
买家嫌香菜“大小不符合,太老了”,申请仅退款,商家驱车千里取回:争的是8块钱,更是经营者的合法权益

买家嫌香菜“大小不符合,太老了”,申请仅退款,商家驱车千里取回:争的是8块钱,更是经营者的合法权益

封面新闻
2026-09-29 17:10:04
追光 | 今天,中国男足亚运队冲击决赛

追光 | 今天,中国男足亚运队冲击决赛

新华社
2026-09-30 06:27:35
新加坡政府亲自下场帮年轻人找对象!连第一次约会吃饭都包了

新加坡政府亲自下场帮年轻人找对象!连第一次约会吃饭都包了

爆角追踪
2026-09-30 07:13:35
杭州女孩天天坐高铁去上海上班,每天通勤6小时每月花3000元,她算了一笔账……

杭州女孩天天坐高铁去上海上班,每天通勤6小时每月花3000元,她算了一笔账……

都市快报橙柿互动
2026-09-29 16:22:10
房地产板块跳水,万科A、深物业A跌停

房地产板块跳水,万科A、深物业A跌停

界面新闻
2026-09-30 09:36:43
柬埔寨反贪局披露中国籍电诈头目张建强资金链:涉2.5亿美元,通过25岁本地兑换商洗钱,并向乡长、移民警察转款行贿

柬埔寨反贪局披露中国籍电诈头目张建强资金链:涉2.5亿美元,通过25岁本地兑换商洗钱,并向乡长、移民警察转款行贿

大风新闻
2026-09-29 15:08:03
恒安集团发布讣告:施文博逝世

恒安集团发布讣告:施文博逝世

政知新媒体
2026-09-30 07:42:30
最后一棒极限逆转,17岁陈妤颉:“比完了,下班了,三金一银,我真牛啊!”

最后一棒极限逆转,17岁陈妤颉:“比完了,下班了,三金一银,我真牛啊!”

都市快报橙柿互动
2026-09-30 00:59:10
裴轶被北理工解聘后,网友又扒出她老公疑似违规兼职,涉事院校被网友点名催查

裴轶被北理工解聘后,网友又扒出她老公疑似违规兼职,涉事院校被网友点名催查

Mr王的饭后茶
2026-09-29 23:06:39
真相来了,裴轶被盯住的原因终于找出来了!

真相来了,裴轶被盯住的原因终于找出来了!

叒女紫121
2026-09-29 11:36:51
个人提现新规,10月1日起执行!

个人提现新规,10月1日起执行!

秦皇岛发布
2026-09-29 17:30:34
随着中国男排3-2韩国,诞生5个不可思议,第五个最让人开心

随着中国男排3-2韩国,诞生5个不可思议,第五个最让人开心

南海浪花
2026-09-30 00:37:45
“这才是真躺平!"34岁男子在自家小区当保安,房贷还有9年,每月还2100,月薪4200,下楼就能上班,网友:活明白了

“这才是真躺平!"34岁男子在自家小区当保安,房贷还有9年,每月还2100,月薪4200,下楼就能上班,网友:活明白了

犀利强哥
2026-09-30 06:54:41
又美又飒,0.09秒优势摘桂,小孩姐最后一棒生吃泰国选手,亚运3金1银,球迷建议担任闭幕旗手

又美又飒,0.09秒优势摘桂,小孩姐最后一棒生吃泰国选手,亚运3金1银,球迷建议担任闭幕旗手

我就是一个说球的
2026-09-29 20:54:43
中国乡村何以发生巨变(我眼中的中国)

中国乡村何以发生巨变(我眼中的中国)

人民网
2026-09-30 06:27:52
维尼修斯:我以为吉马良斯想罚点,但他知道我需要进球找信心

维尼修斯:我以为吉马良斯想罚点,但他知道我需要进球找信心

懂球帝
2026-09-29 22:47:08
巴黎时装周透视装刷屏:48岁佐伊几乎全裸上阵,52岁超模也跟了

巴黎时装周透视装刷屏:48岁佐伊几乎全裸上阵,52岁超模也跟了

追星雷达站
2026-09-30 07:04:55
董路:我也不知道陈妤颉的名字咋念咋写 但我发现她100米跑了55步

董路:我也不知道陈妤颉的名字咋念咋写 但我发现她100米跑了55步

风过乡
2026-09-30 08:02:15
加州科技高管命案曝新细节:婚前完成性别转换,亚裔岳父母被指对他长期辱骂

加州科技高管命案曝新细节:婚前完成性别转换,亚裔岳父母被指对他长期辱骂

译言
2026-09-30 08:25:42
10月1日起房贷贴息1%,最高省5万:现在连财政都开始替你付利息了,可想而知...

10月1日起房贷贴息1%,最高省5万:现在连财政都开始替你付利息了,可想而知...

大何日拱一卒
2026-09-29 22:23:35
2026-09-30 09:59:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17323文章数 515223关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

牛弹琴:全部美军灰溜溜走了 伊拉克举国兴奋放假4天

头条要闻

牛弹琴:全部美军灰溜溜走了 伊拉克举国兴奋放假4天

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

教育
游戏
手机
亲子
旅游

教育要闻

全美顶尖公立大学,未来两年将狂砍2.25亿美金预算!

《GTA6》12张全新截图!沙滩|泳装|夜店|野生动物等

手机要闻

涉及约5000人:古尔曼称苹果已搁置AI替代AppleCare客服计划

亲子要闻

超长长长长蛋挞店的规则~老板也太有爱心啦!

旅游要闻

江西婺源:晒出红火小日子

无障碍浏览 进入关怀版