【赛迪网讯】当下大模型行业竞争聚焦算力军备竞赛,业界普遍陷入“堆GPU、拼显存”的惯性思维,试图通过算力扩容破解推理落地难题。但随着长上下文模型普及、多轮对话业务规模化落地,单纯算力堆叠的边际效益持续递减,显存墙、高延迟、高成本、低复用四大痛点愈发凸显,成为制约大模型从测试走向大规模产业化落地的核心瓶颈。当全行业扎堆攻坚算力短板时,AI基础设施的另一核心解题思路——存算协同优化,正在成为破局关键。
![]()
2026中国国际大数据产业博览会期间,中科曙光分布式存储产品部总经理石静接受赛迪网采访时,抛出颠覆性判断,跳出传统算力内卷逻辑,重新定义存储在AI大模型体系中的核心价值:KV Cache 本身就是一种智能化数据,存储的角色要从存数据走向存智能。这一观点不仅点破了当前大模型推理效率低下的核心症结,更拉开了AI基础设施从“算力单一驱动”向“存算协同”范式升级的序幕,为行业破解推理落地困境提供了全新路径。
这一革新性判断,源于真实的大模型推理运行数据。在处理一条16K长度的序列时,大模型单次推理需要完成约2.56亿次键值对计算。大模型自回归生成的特性,自带天然的“计算冗余短板”:每生成一个新字词,都需要重新计算一遍历史对话的Key/Value向量,重复计算造成海量算力浪费。为解决这一问题,业界普遍采用KV Cache技术,将预计算的键值对缓存于显存,通过“以存换算”的方式规避重复计算、提升推理效率。
![]()
但现有方案存在无法逾越的短板:GPU HBM显存容量极其有限,面对长上下文、多轮对话场景极易被快速占满,“显存墙”由此成为大模型推理规模化落地的第一道、也是最核心的拦路虎。针对行业普遍面临的存算失衡、缓存复用率低、层级调度混乱等痛点,中科曙光推出全层级KV Cache管理方案ParaCache,从存储侧重构大模型推理架构,为行业提供差异化破局解法。
算力内卷无解:推理落地的双重困境与行业技术瓶颈
随着生成式AI产业落地提速,推理算力需求在AI算力服务中的占比持续攀升,已然超越训练成为算力消耗主力。大模型推理分为Prefill预填充与Decode逐字生成两大核心阶段:Prefill阶段负责批量处理输入内容、生成基础KV Cache,Decode阶段则逐字输出文本、完成对话响应。在真实产业场景中,AI对话业务高度重复、单轮对话动辄十几轮迭代,海量重复计算、重复缓存成为行业最大的算力与资源浪费源头。
石静将当前大模型推理的核心困境拆解为两大核心矛盾,直指行业痛点本质:一是时间困境,多轮对话、长文本输入下,重复计算叠加显存调度压力,导致模型推理速度持续变慢,用户响应体验下滑;二是空间困境,KV Cache缓存成本居高不下,显存资源稀缺昂贵,缓存扩容成本持续攀升,模型推理的商业化落地成本大幅增加。
更关键的是,传统KV Cache加速方案仅能优化单对话、单节点内部的重复计算问题,跨对话、跨集群的缓存复用效率大幅衰减。各节点、各会话的KV缓存相互独立、无法共享,行业陷入“缓存越存越多、硬件成本越堆越高、资源利用率却持续走低”的恶性循环。
目前业界主流厂商的优化路线仅有两条,要么通过算法压缩KV Cache占用空间,要么将缓存数据卸载至SSD等大容量、低成本存储介质。但两条路线落地均面临致命瓶颈,始终无法实现规模化生产落地。
一方面,LMCache等主流开源方案仅支持单实例内的KV Cache隔离管理,无法实现跨机器、跨集群缓存共享,且缺乏全局元数据视图,形成严重的“元数据迷雾”,行业始终无法精准判定KV缓存的最优存储层级,调度混乱问题无解;另一方面,分布式存储本具备天然的资源池化、跨节点共享优势,契合大模型规模化缓存复用需求,但受限于分布式锁机制、缺失GPU直通能力,读写延迟偏高,长期以来仅被用于冷数据归档,无法参与实时推理调度,算力存力协同价值无法释放。
针对行业双重技术瓶颈,ParaCache给出了全维度、全层级的系统性解法。方案打通GPU HBM、CPU DRAM、本地SSD+集中式存储、分布式存储四级缓存架构,构建完整的KV Cache分层调度体系。其中L1层级依托GPU HBM承载热数据高速读写,L2层级借助CPU DRAM实现中层缓存调度,L3层级创新融入FlashNexus Neo集中式存储,依托共享阵列实现多计算节点共用存储资源,实测时延、吞吐、并发能力较传统Local SSD提升约2倍;L4层级由ParaStor分布式存储兜底,搭载对标NV GDS、兼容国产AI卡的XDS技术,实现GPU与分布式存储的直接交互,支持L1越级直达L4卸载、L4回迁L1的灵活调度模式。
整体方案以自研ParaStor分布式存储为核心底座,融合FlashNexus高速存储能力,向下实现全域存储资源调度,向上兼容vLLM、SGLang等主流推理框架,可适配PD一体、PD分离各类主流部署模式。核心能力聚焦三大核心优势:全层级缓存池化实现资源最大化复用、全局元数据统一视图消除调度迷雾、基于KV语义的智能预取与精细化目录淘汰策略,从架构底层解决推理效率与资源浪费问题。
突破生产落地壁垒:四级缓存架构实现性能与成本双优化
行业多级缓存架构并非新鲜概念,但多数方案仅停留在技术演示层面,无法适配严苛的生产级场景。石静强调,ParaCache并非闭门造车的小众技术方案,而是深度贴合产业落地需求、兼容行业主流生态的成熟产品,最大限度保护客户现有技术投入。一方面,ParaCache与行业主流第三方KV管理软件完成联合定制适配,另一方面全面对齐LMCache开源事实标准,推理侧技术栈改动极小,可快速落地各类在线推理、RAG知识库等业务场景。
针对KV Cache随机读写、高频访问、动态迭代的专属特征,中科曙光对L4层级ParaStor分布式存储完成多项定向深度优化。将传统offset覆盖写模式升级为低延迟适配的追加写模式,大幅降低缓存读写延迟;基于目录架构重构分布式锁机制,实现锁轻量化或完全去除,规避强一致性协议带来的延迟损耗;在PD分离架构集群中,仅传输增量KV缓存数据,大幅节约网络带宽资源,提升跨节点调度效率。方案底层搭载于今年斩获IO500生产型全节点与十节点全球双冠的ParaStor F9000分布式全闪存存储,为大规模推理业务提供稳定底座支撑。
实测数据充分验证了ParaCache的落地价值,在真实复杂业务场景中实现性能跨越式提升。在30K/120K超长文本输入+20轮多轮对话的实景测试环境下,模型首次推理延迟大幅降低89%;其中120K超长文本输入场景下,单轮对话TTFT最高降幅达98.5%,延迟降至400ms级别,多轮会话TTFT降幅超80%,稳定控制在4.9s。在高并发核心场景中,相较于仅依靠HBM显存的传统方案,Token吞吐量最高提升近27倍,常规场景稳定提升26倍。同时,L4分布式存储的接入大幅降低了L2缓存的容量依赖,底层存储性能可对标L3层级,实现低成本、高性能的缓存调度。
在产业最关注的成本维度,ParaCache实现了实打实的硬件降本。石静表示,大模型存算架构的成本并非简单的“单体硬件能力×数量”,而是随业务场景、对话轮次、上下文长度动态变化,但从规模化落地效果来看,可帮助企业节省约1/3的内存、SSD硬件采购成本,在不牺牲推理性能的前提下,大幅降低大模型推理服务的整体TCO。
十万卡超集群验证:国产存算架构的规模化落地能力
小规模场景的性能优化不足以证明技术实力,十万卡级超大规模集群的落地适配,才是检验AI基础设施方案成熟度的核心标准。今年7月10日,中科曙光曙光8000全国产十万卡AI超集群正式落成并接入国家超算互联网,标志着国内AI基础设施正式从万卡级迈入十万卡规模化部署新阶段,也为ParaCache提供了最严苛的实战测试场景。
石静介绍,在曙光8000十万卡超集群中,ParaCache核心承担两大核心职能,成为集群高效运行的关键支撑。其一,依托四级分布式共享缓存池架构,彻底打破节点壁垒,实现全域跨推理任务的KV缓存复用,解决大规模集群资源碎片化问题;其二,构建精细化冷热分级调度机制,将高频访问的热数据驻留于HBM、内存等高速介质,低频冷数据直接下沉至分布式存储,实现资源分层最优利用,平衡性能与成本。
同时,十万卡超大规模集群也带来了极致技术挑战。十万级计算节点协同交互,叠加跨节点KV缓存高频读取,对网络时延、吞吐、稳定性提出极致要求;多会话超高并发读写场景下,若缓存调度、数据管控不当,极易产生脏数据、垃圾数据,直接导致推理结果出错、业务瘫痪。
针对规模化集群的核心痛点,ParaCache搭建了双重保障体系。硬件层面,依托中科曙光自研scaleFabric 原生RDMA无损高速网络,凭借低时延、零拷贝核心能力,搭配智能流控与链路自愈技术,彻底解决大规模集群的网络拥塞问题;架构层面,创新性采用元数据持久化设计,实现“元数据不乱,数据就不会乱”,即便出现节点故障、网络波动,也可通过元数据精准找回、读取缓存数据,保障业务稳定运行。
目前ParaCache已在多行业头部客户场景完成落地验证,适配全产业AI推理需求。除曙光8000超集群外,国内头部互联网厂商通过ParaStor+ParaCache的KV缓存管理优化,实现在线推理业务TTFT、P99 TTFT与吞吐量的全方位提升;金融领域,某银行信用卡及办卡中心依托超节点+ParaCache方案,业务并发吞吐提升3倍;教育科研RAG知识库场景中,系统并发度实现15-20倍跨越式增长,适配科研级高频检索、多任务推理需求。
行业范式重构:存算协同开启AI基础设施新周期
当行业被问及AI基础设施是否从“单纯堆GPU”转向“算力存力协同”新赛道时,石静给予了肯定答复,并进一步提出更具前瞻性的范式判断:ParaCache代表的KV缓存智能管理技术,正在重塑大模型推理的底层架构范式。
过去行业架构以GPU算力为绝对核心,KV Cache只是模型推理过程中产生的临时数据、中间状态,无复用价值、无资产属性;而在全新的存算协同架构下,KV Cache升级为核心智能化数据资产,GPU算力不再是单一核心,转而围绕KV缓存数据提供精准的Prefill、Decode算力支撑。未来大模型的性能迭代、能力升级,核心取决于KV Cache的精细化管理能力,直接决定推理服务成本、用户响应速度、AI Agent的规模化扩展上限。
这一范式变革正在重塑整个AI产业的硬件采购与集群建设逻辑。行业采购标准从此前单一的GPU算力比拼,升级为算力、存力、网络、缓存一体化统筹规划,以整体TCO最优为核心标尺,平衡硬件成本与服务性能,彻底告别算力盲目内卷。而在国内高端算力供给受限、国产化替代加速的行业背景下,以ParaCache为代表的国产存算协同方案,正迎来换道超车的核心窗口期,有望打破海外技术垄断,构建自主可控的AI基础设施生态。
同时石静也清晰界定了技术适用边界,避免行业盲目跟风。她指出,ParaCache并非适配所有推理场景的普适性方案,主要聚焦集群级部署、长上下文交互、高并发复用的规模化生产场景,是产业级AI推理效率优化的核心工具,而非通用解药。
从行业长期发展来看,AI规模化落地时代,性能瓶颈已从计算侧逐步转移至数据调度、缓存复用、IO传输的数据路径侧。存储的价值彻底重构,从传统被动响应IO请求的底层硬件,升级为主动调度数据、复用缓存、卸载算力、优化架构的核心智能载体,完成“存数据”到“存智能”的终极升级。未来,“以存换算”将从行业共识落地为标准化架构,而ParaCache等国产方案的规模化生产落地,将持续验证存算协同范式的可行性,推动国内AI基础设施产业迈入高质量发展新周期。(文/徐培炎)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.