快科技8月5日消息,英伟达在FMS 2026峰会上宣布,将旗下的GPU存储加速API cuFile全面开源,同时公布SCADA全新存储架构,彻底打破传统CPU主导IO的传输瓶颈,实测场景下GPU存储IOPS最高实现5倍提升。
长期以来,GPU读取数据必须通过CPU进行调度,这种宿主模式在处理AI推理产生的大量512字节微小请求时,会造成严重的微秒级延迟。
虽然之前的GPUDirect Storage(GDS)实现了数据链路的CPU绕过,但指令控制仍需CPU参与,使得系统在小粒度读写任务中提前触发性能瓶颈、IO资源率先耗尽。
![]()
此次推出的SCADA技术彻底解决了这一难题,SCADA允许GPU直接发起存储I/O请求,管理NVMe硬盘的队列深度,实测数据显示,在处理数据分析任务时,SCADA的速度是CPU触发模式的5.3倍,而硬件成本最高可降低21.7倍。
在美光展示的参考设计中,使用3颗H100显卡成功驱动了44块PCIe Gen6 SSD,实现了惊人的2.3亿次随机读IOPS。这意味着单台服务器的存储吞吐达到了118GB/s,且负责调度的单颗CPU在整个过程中几乎处于空闲状态。
![]()
同时针对AI推理中KV缓存频繁产生的小数据读写,英伟达正式推出Storage-Next产业联盟计划,重点优化512字节扇区的读写表现,以解决传统硬盘在4KB扇区下造成的8倍读取放大问题。
该构想最早在2025年GTC大会提出,目前联盟成员已超40家闪存与存储厂商,包含DDN、铠侠、美光,还有存储控制器企业、散热厂商以及标准化组织,各方将共同制定一套新标准:当GPU取代CPU成为存储访问主体时,固态硬盘应当如何适配运行。
硬件层面上,为承载cuFile开源生态与SCADA全新存储架构的落地,英伟达打造了新一代基于Vera BlueField-4存储处理器的STX架构系统,并计划在2026年下半年正式推出商用整机。
![]()
虽然目前英特尔也已加入开源组织并参与代码维护,标志着传统CPU主导IO调度的格局被颠覆,cuFile与SCADA也从英伟达私有技术,升级为全行业通用开源标准,有效改善了跨平台兼容性。
但该技术的规模化普及仍受两大核心条件制约,一是STX+SCADA新架构的跨硬件、跨平台适配优化进度。二是美光、三星等厂商能否针对512字节小包场景完成主控与固件的底层重写。
这两点最终决定了这套新一代AI存储架构的商用普及节奏。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.