开源推理优化库Mooncake正在与TPU展开集成工作,双方合作聚焦于将TPU接入Mooncake Store存储体系。这一动向意味着TPU在推理场景下的性能优化路径正在拓宽。
据相关消息,此次集成中KVCache的DRAM P2P池化将首先通过scale-out网络上的TENT协议实现,而非使用ICI或NVLink。这一技术选型与NVL72方案有相似之处,表明在跨节点场景下,TENT正成为KVCache共享的关键通道。
![]()
KVCache池化的网络路径选择
在大型语言模型推理中,KVCache的显存占用往往成为瓶颈。通过P2P池化,多个设备可以共享DRAM中的缓存数据,减少重复存储和传输开销。此次选择TENT而非ICI/NVLink,意味着TPU集群在scale-out网络层面即可完成缓存共享,无需依赖节点内的专用互联。
这一设计对大规模部署有实际意义:当推理负载分布在多个节点时,TENT路径能够更灵活地调度缓存资源,降低对特定互联硬件的依赖。
Mooncake对推理TCO的改善逻辑
Mooncake的核心价值在于提升生产环境推理的性能成本比(performance per TCO)。通过优化缓存利用率和减少冗余计算,它能让同样的硬件资源支撑更多推理请求。
与TPU的集成,意味着这一优化能力将覆盖更广泛的硬件生态。对于使用TPU进行推理的团队来说,Mooncake的接入可能带来两方面的变化:一是缓存管理效率提升,二是整体推理成本结构的优化。
集成尚处初期,效果有待验证
目前这一合作仍处于推进阶段,KVCache池化在TENT网络上的实际表现尚未有公开的基准数据。后续是否会扩展到ICI/NVLink路径,也取决于初期验证的结果。
对于关注推理优化的开发者而言,这一动向值得跟踪——TPU生态与开源推理工具链的结合,正在变得更紧密。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.