网易首页 > 网易号 > 正文 申请入驻

让KV Cache流动起来,中科曙光用ParaCache为大模型“吐字”提速

0
分享至

作者:王聪彬


使用大模型时,往往要先等待片刻,才能看到第一个Token生成。但第一个Token出现,后续内容便会持续、流畅地输出。这还要从背后一项关键的工程机制KV Cache说起。

中科曙光把提升推理效率的突破口放在了KV Cache上。8月28日,在2026中国国际大数据产业博览会期间,中科曙光提出从“存数据”到“存智能”的概念,发布新一代词元加速方案ParaCache。该方案聚焦大模型推理的Token交互场景,为企业带来计算性能提升、计算成本降低、技术生态适配三大收益。

为什么KV Cache值得专门做一套管理方案?因为一次完整的推理过程,通常可以分为Prefill和Decode两个阶段。Prefill阶段负责处理输入内容,并生成相应的KV Cache。进入Decode阶段后,模型会基于这些结果逐个生成Token,形成用户看到的连续输出。

在实际应用中,不同请求之间经常存在重复内容。如果能够保存并复用已经生成的KV Cache,模型便可以减少重复计算,释放更多GPU算力。中科曙光分布式存储产品部总经理石静表示,通过KV Cache“以存换算”,已经成为业界提升推理效率的一条重要路径。

但新的问题随之出现,KV Cache会占用大量显存,尤其是在长上下文和高并发场景下,如果全部存放在HBM中,很快就会触及容量上限。即使GPU仍有计算余力,也可能因为显存不足而无法承接更多请求,这就是大模型推理过程中常说的“显存墙”。

破解“显存墙”主要有两个方式:一是在算法和模型侧压缩KV Cache,减少其占用空间;另一个是将KV Cache从HBM卸载至容量更大的CPU DRAM、SSD或分布式存储。

因此,KV Cache需要在不同存储层级之间进行统一管理和调度,但这一过程中也出现了两个瓶颈。一是缺少全局视角,不同层级的元数据相互割裂,KV Cache难以在多个推理实例之间共享,也无法实现准确调度;二是分布式存储虽然具备共享和池化优势,但受访问延迟等因素影响,目前大多只能作为冷数据仓库使用。

ParaCache的思路,正是让KV Cache在不同存储层级和计算节点之间高效流动。

ParaCache管起整个KV Cache池

KV Cache被视为推理过程中沉淀下来、可以重复利用的“智能化数据”,需要一套贯穿不同存储层级的管理机制。

ParaCache能够统一管理GPU显存、CPU内存、固态硬盘和分布式存储,根据使用频率对计算结果进行分层存放和智能调度,并支持在不同请求、不同计算节点之间共享,实现“一次计算、多次使用”。

从架构上看,ParaCache覆盖四个存储层级:L1对应GPU HBM,L2对应CPU DRAM,L3包括本地SSD和集中式全闪存储FlashNexus,L4是基于POSIX协议的曙光分布式存储ParaStor。“目前ParaCache已经实现L2、L3和L4的池化,并对不同层级中的KV Cache进行全局管理和动态调度,打破各层之间的元数据孤岛。”石静说道。


ParaCache通过业界主流的vLLM、SGLang等推理框架就可以无缝对接上层应用。无论采用Prefill与Decode一体化部署,还是在GPU侧对KV Cache进行分类管理,ParaCache都能够提供相应支持。

在具体的调度过程中,ParaCache还可以与推理框架的调度层配合,提前预测下一次请求所需的KV Cache。如果相关数据位于L3或L4,系统可以在请求到来前完成调取,减少数据迁移对响应时间的影响。

L3层除了常见的本地SSD,ParaCache还将面向推理场景的FlashNexus Neo集中式存储纳入这一层级,使多个计算节点能够共享同一套存储资源。实际测试显示,在延迟、吞吐量和并发请求处理等指标上,综合表现达到了本地SSD方案的两倍。

L4层是基于曙光ParaStor F9000,并进行了一系列针对KV Cache的优化。例如,首先是将部分Offset覆盖写调整为追加写,减少写入带来的延迟;其次是对分布式锁进行轻量化处理,按目录取消部分锁机制,降低强一致性和排他锁对访问效率的影响;最后在PD分离架构下仅传输增量KV Cache,从而减少集群网络带宽消耗。

ParaCache还通过XDS打通加速卡与分布式存储之间的数据通路。XDS可以同时支持GPU和国产加速卡,使KV Cache可以直接在L1与L4之间卸载和回迁,绕过CPU DRAM和本地SSD。优化使得ParaStor在L4层也能够直接参与KV Cache调度,具备承载生产级推理业务的能力。

首词元时延最高降低98.5%,词元吞吐量提升27倍

ParaCache让KV Cache从“用完即弃”的临时数据,变成可反复调用的数据资产。ParaCache带来的价值,可以概括为“多、快、好、省”。

“多”:高并发场景下,系统每秒处理的词元量最高达到原来的27倍,同样的硬件资源能够承接更多业务请求。

“快”:输入约12万词元时,单轮对话开始回答前的等待时间最多可降低98.5%至0.4秒;连续20轮对话中,这一时间也降低超80%,由43.1秒降至4.9秒。

“好”:兼容主流推理框架和国产AI加速卡,可在现有系统基础上接入,降低部署和迁移成本。

“省”:高频内容保留在显存,其他内容转移至成本更低的存储设备,减少对高成本显存和新增硬件资源的依赖。

KV Cache复用的价值,在多轮对话和Agent应用中更为明显。随着对话不断推进,此前生成的KV Cache可以被后续请求重复调用,从而减少重复计算。

ParaCache也进行了多轮对话场景的测试,初始输入长度分别设置为30K和120K,并在此基础上连续进行20轮对话,每轮增加0.5K输入。测试结果显示,在约12万词元输入下,ParaCache可使模型开始回答前的等待时间最高降低98.5%;

测试还模拟了多轮对话下的高并发请求。与KV Cache全部存放在HBM中的方案相比, ParaCache加速方案,使系统每秒处理的词元量最高达到原来的27倍。

目前,ParaCache已经进入实际业务。ParaCache支撑某头部互联网厂商的在线推理业务,模型开始回答前的平均等待时间降低50%以上;在同等硬件条件下,系统可承载的业务请求也提升数倍。

针对具体的行业案例,在某银行的信用卡及办卡业务中,超节点与ParaCache配合使用,使并发吞吐量提升约3倍;在教育行业的RAG知识库和智能助学场景中,部分测试的并发能力提升了15至20倍。

“从大模型训练、在线推理,到自动驾驶、具身智能和智算中心,ParaStor积累的存储实践成为ParaCache的重要基础。”石静强调。当KV Cache成为可管理、可复用的数据资产,分布式存储也由此进入大模型推理的核心链路。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
宇树科技上市11个交易日,彻底腰斩!一股民1100元买入已亏超72万

宇树科技上市11个交易日,彻底腰斩!一股民1100元买入已亏超72万

财经智多星
2026-09-03 08:47:36
iPhone Ultra配置基本确认:折痕无法消除,国行或14999元起

iPhone Ultra配置基本确认:折痕无法消除,国行或14999元起

TechWeb
2026-09-03 11:20:06
情况很严重了!大家立刻做准备吧,随时会变天!

情况很严重了!大家立刻做准备吧,随时会变天!

蓝钻故事
2026-09-02 11:16:11
太恶心了!一女乘客发帖吐槽,足足4小时啊,快被旁边大哥的屁股,熏得想“跳飞机”

太恶心了!一女乘客发帖吐槽,足足4小时啊,快被旁边大哥的屁股,熏得想“跳飞机”

火山詩话
2026-09-03 08:55:21
这丑校服是非穿不可吗?!

这丑校服是非穿不可吗?!

基本常识
2026-09-02 22:55:20
家长群显摆翻车:我是市人民医院纪委书记

家长群显摆翻车:我是市人民医院纪委书记

原某报记者
2026-09-03 11:14:38
科大讯飞出轨女主朱倩旧照疑曝光!小眼睛大脸盘,身材一般,和网传照片天差地别

科大讯飞出轨女主朱倩旧照疑曝光!小眼睛大脸盘,身材一般,和网传照片天差地别

小徐讲八卦
2026-09-03 11:53:43
快讯!关于郭德纲的消息!

快讯!关于郭德纲的消息!

故事终将光明磊落
2026-09-03 10:59:34
震惊!网传上海女房东二手房交易进行到一半,突然当场飙泪,中介坐在旁边手足无措

震惊!网传上海女房东二手房交易进行到一半,突然当场飙泪,中介坐在旁边手足无措

火山詩话
2026-09-03 07:28:46
给非洲53国全免关税!结果人家先把中国货买爆了,出口暴涨29%

给非洲53国全免关税!结果人家先把中国货买爆了,出口暴涨29%

说故事的阿袭
2026-09-03 04:36:54
美财长当场破防!中国一票否决G20公报,英国紧跟表态:我们不跟

美财长当场破防!中国一票否决G20公报,英国紧跟表态:我们不跟

王姐懒人家常菜
2026-09-03 09:32:03
打通吉隆!“最后一公里,一定要进去”

打通吉隆!“最后一公里,一定要进去”

环球网资讯
2026-09-03 11:42:10
三部门部署加强水上运输和渔业船舶安全风险防范工作

三部门部署加强水上运输和渔业船舶安全风险防范工作

界面新闻
2026-09-02 09:17:44
河北保定一中学家长在班级群自称“系医院纪委书记,妻子系学校人事处副处长,希望老师关照孩子”,学校回应:会对所有学生一视同仁

河北保定一中学家长在班级群自称“系医院纪委书记,妻子系学校人事处副处长,希望老师关照孩子”,学校回应:会对所有学生一视同仁

三湘都市报
2026-09-03 00:12:23
一而再再而三,皇马必须给我们一个交代!

一而再再而三,皇马必须给我们一个交代!

火锅局
2026-09-02 15:26:22
快讯!伊朗这回彻底被美军打疼了!

快讯!伊朗这回彻底被美军打疼了!

故事终将光明磊落
2026-09-03 09:56:10
致敬队长!阿根廷宣布下轮所有赛事在第10分钟暂停 为梅西鼓掌1分钟

致敬队长!阿根廷宣布下轮所有赛事在第10分钟暂停 为梅西鼓掌1分钟

我爱英超
2026-09-03 05:57:59
电梯造谣女伏法!舆论再次失控,网友疯狂抵制,关联品牌被拉下水

电梯造谣女伏法!舆论再次失控,网友疯狂抵制,关联品牌被拉下水

社会日日鲜
2026-09-03 11:00:32
卡茨:“我们的战机已准备好随时起飞”

卡茨:“我们的战机已准备好随时起飞”

鲁中晨报
2026-09-02 22:06:10
机务闯大祸!加油车未拔油管就开走 国航747-8客机被扯坏加油口 狂撒一地燃油

机务闯大祸!加油车未拔油管就开走 国航747-8客机被扯坏加油口 狂撒一地燃油

中国能源网
2026-09-02 17:20:06
2026-09-03 14:51:00
至顶科技 incentive-icons
至顶科技
科技产业媒体与 AI 产业服务机构
21491文章数 49729关注度
往期回顾 全部

科技要闻

大模型扎堆!谷歌刚发,Meta就跟上

头条要闻

星宇股份"股价跌到惨不忍睹" 有公司邀请被劝退者加入

头条要闻

星宇股份"股价跌到惨不忍睹" 有公司邀请被劝退者加入

体育要闻

小卡回应处罚:不知晓任何规避工资帽意图

娱乐要闻

德云社停更20天再营业!

财经要闻

再见了,期房!商品房预售制卒于2026

汽车要闻

实拍捷途旅行者7 风格更潮/混动版配上华为乾崑ADS 5

态度原创

房产
家居
数码
公开课
军事航空

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

宏碁推出5G移动网卡Connect D5P与5G CPE设备Connect X6ES

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

乌特工内战街头对射 互认对方为"俄特工"

无障碍浏览 进入关怀版