544GiB/s。这是焱融全闪AI存储F9000X在MLPerf Storage v3.0测试中跑出的三节点聚合带宽,位列该场景第一,也是历届公开测试成绩中的最高水平。
9月1日,全球权威AI性能评测组织MLCommons发布MLPerf Storage v3.0基准测试榜单。焱融F9000X在多项基准测试中拿下第一,验证的是同一件事:在极限AI训练负载下,存储系统对高速网络带宽的利用效率。
![]()
存储这个环节平时不太出风头,但它卡住的是GPU的利用率。数据供不上,再贵的卡也得等着。
三节点,544GiB/s是怎么跑出来的
大模型训练需要持续从存储系统读取数据。参与训练的GPU数量越多,存储要同时供给的计算节点就越多。吞吐能力不足,GPU就会因为等数据而降低利用率。
训练过程中还要定期写入Checkpoint。它的读写性能直接影响模型状态的保存,以及训练中断后的恢复耗时。
F9000X是面向大规模AI训练推出的全闪存储产品。这次测试环境包括3台F9000X存储节点和9台x86客户端服务器,节点之间通过NDR400高速网络互联。
3D U-Net模型训练测试考的是持续带宽输出能力和极限负载稳定性。F9000X三节点集群实现544GiB/s聚合带宽,位列该场景第一。相比此前v2.0测试的478GiB/s,聚合带宽进一步提升。
Checkpoint 70B测试中,焱融存储集群实现539GiB/s的读带宽和314GiB/s的写带宽,读写性能均位居第一,同样刷新了历届MLPerf Storage公开测试成绩。
对千亿级、万亿级模型训练来说,Checkpoint是保存阶段性训练状态的关键数据。读写更快,模型存档和恢复的耗时就更短,训练中断造成的算力浪费也更少。
对企业来说,更高的带宽表现除了加快训练数据读写,也有望在满足同等训练需求的情况下减少存储节点投入,从而降低整体硬件投入成本。
推理阶段,存储要管的是上下文
AI从训练走向规模化推理之后,存储系统关注的重点转向模型上下文的管理与复用。
长文本、多轮对话和Agent应用会产生大量KV Cache。这些缓存如果无法被保存和复用,模型就需要反复计算相同的上下文。与此同时,推理请求的上下文更长、并发更高,KV Cache需要在不同节点之间共享、迁移和复用。
焱融推出的AI原生推理存储系统YRCache,对不同层级的KV Cache资源进行统一管理,并将部分缓存从GPU显存卸载至主机内存和本地SSD,减少重复计算。
在YRCache的多级缓存架构中,四层分工是这样的:
- G1是GPU HBM,保存当前最活跃、访问频率最高的KV Cache
- G2是主机DRAM,承接暂时无法放入GPU显存的缓存
- G3是本地SSD,容量更大、单位成本更低,适合保存单节点中的更多缓存
- G4是传统共享分布式存储,主要承载模型、数据集和Checkpoint等需要长期保存的数据
随着推理集群扩大,本地SSD与传统共享存储之间出现了新的能力空档。参考英伟达CMX架构对G3.5 Context Memory的设计,焱融在YRCache体系中引入了G3.5共享缓存层,并推出YRCache ContextBox一体机,面向长上下文、多轮对话和Agent推理提供跨节点共享的KV Cache空间。
单台120GB/s,缓存不再绑在单机上
YRCache ContextBox面向G3.5共享缓存层设计,把计算、网络、存储和软件协同起来,为推理集群提供独立的共享KV Cache空间。
焱融科技称,ContextBox单台实测带宽达120GB/s,可支持8个推理节点并发接入,缓存容量可扩展至PB级。
它解决的第一个问题是共享。不同推理节点可以共享已经生成的KV Cache,请求即使被调度到另一台服务器,也不必重新计算相同的上下文。
第二个问题是扩展。缓存不再受单台服务器的显存、内存和SSD容量限制,企业可以单独扩展缓存空间;即使计算节点增减,已经保存的缓存也不会随之丢失。
据焱融科技介绍,在某头部AI企业测试中,8张NVIDIA H20-3e GPU运行SGLang和GLM-5.1,输入上下文为31K至129K时,接入ContextBox后首Token时延降低89%至94%,Token吞吐提升3至6倍。
ContextBox还兼容YRCache、LMCache、Mooncake等管理软件,为长上下文、多轮对话和Agent推理提供共享、可扩展的上下文基础设施。
训练和推理,最后都要算效率和成本账
焱融是国内较早、较完整面向AI全流程构建全栈AI存储能力的厂商之一,已形成覆盖AI训练与推理的存储方案,以F9000X、YRCache推理存储系统和YRCache ContextBox一体机为代表,覆盖训练数据读取、模型状态保存以及KV Cache管理等关键环节。
这套布局对应AI应用的不同阶段。训练时,F9000X提升数据和Checkpoint的读写效率,减少GPU等待;推理时,YRCache和YRCache ContextBox管理、共享并复用KV Cache,减少重复计算。
对企业而言,这套方案的价值不只是提升带宽或降低时延,更在于让现有算力基础设施承载更多训练任务和推理请求。存储效率提高后,企业不必只依靠增加GPU或存储节点来扩大AI服务能力。
性能之外,成本也是AI基础设施建设的重要考量。焱融科技称,其单位性能硬件成本较行业市场平均水平降低约35%,同时Token效能提升120%。
从训练数据的高速读写,到推理上下文的共享与复用,AI存储的竞争已经不只是单点性能的比拼,而是能不能把训练和推理两个阶段的需求接上。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.