【元脑服务器推出支持Mooncake KV缓存共享的G3.5层全闪方案】财联社9月14日电,元脑服务器面向大模型推理场景,推出支持Mooncake KV缓存共享的G3.5层全闪方案。方案以元脑全闪服务器NF5286为核心,与Mooncake缓存组件、推理框架的缓存感知调度协同,为推理集群提供独立于计算节点、可按业务需求单独规划的KV Cache共享空间。当上下文需求增长时,可以单独扩展缓存资源;当GPU节点扩容、调整或维护时,缓存资源也不必完全随计算节点变化。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.