来源:市场资讯
(来源:电子技术应用ChinaAET)
大模型推理中,算力成本是绕不开的坎。尤其在Agent、高并发对话、代码生成等场景中,推理过程会产生大量中间数据KV Cache,高效保存并复用这些高价值缓存数据,就能减少重复计算,降低算力消耗和AI运行成本。
但内存方案成本高,本地SSD方案又受单机容量、故障和扩容限制。外置分布式存储,成为破解这一痛点的关键路径。
近日,中科曙光分布式存储ParaStor成为业界首家接入Mooncake社区的商用分布式存储,首次完成商用分布式存储后端的生产环境落地,并输出完整可复制的商业化落地方案。目前,相关技术能力已全部合入Mooncake社区主干。
![]()
作为业界主流开源大模型分布式KV Cache缓存平台,Mooncake已提供内存池化、本地SSD卸载两种方案。相比之下,外置分布式存储具备大容量、弹性扩展和资源池化等优势,可与AI训推业务共用一套存储基础设施,进一步压缩企业IT投入。
Mooncake虽可提供外置存储接入能力,但要真正用于生产环境,仍需要解决容量弹性扩展、数据恢复、批量读写性能、异常场景下的稳定运行等关键问题。
面对这些痛点,中科曙光ParaStor分布式存储研发团队对Mooncake DFS的存储分配逻辑进行模块化改造,并围绕标准化接入、动态扩容和IO链路持续优化。由此,商用分布式存储首次进入大模型推理核心业务链路,承接长尾KV Cache卸载工作。
方案核心优势
方案在硬件性能、标准化接口、弹性扩容等方面独具优势。
生产环境验证,性能与SLA(服务等级协议)双达标
曙光联合SGLang,基于国产加速卡与ParaStor F9000搭建端到端实测环境,模拟真实大模型业务负载。在64K上下文、单卡7并发下,KV Cache卸载实现16倍吞吐提升,达到DRAM池吞吐值的80%;平均首Token延迟和P90首Token延迟均保持在10s以内,充分满足企业实际SLA要求。
接口标准化,接入门槛更低
曙光完成Mooncake接口标准化改造,无需修改上层程序,满足通用文件访问即可快速适配。复杂架构改造变为轻量化开发,为更多商用存储接入大模型缓存场景铺路,缓存分配策略也可独立选择、并行迭代,企业可按业务灵活配置。
容量弹性扩展,缓存不再“一锤定音”
改造后的DFS接口支持缓存空间随业务负载按需弹性扩容,实现以完整存储段为单元完成冷数据回收,系统重启后缓存数据仍可恢复使用;同时优化批量读写,兼容不同硬件环境,保障客户业务稳定运行。
这套方案可以为用户提供更低的AI运行成本、更高的GPU利用率,保障业务稳定运行,同时以完整可复制的商业化落地方案,为国产全栈AI基础设施补上关键一环。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.