网易首页 > 网易号 > 正文 申请入驻

中科曙光石静:破局大模型推理不在算力在存力

0
分享至

【赛迪网讯】当下大模型行业竞争聚焦算力军备竞赛,业界普遍陷入“堆GPU、拼显存”的惯性思维,试图通过算力扩容破解推理落地难题。但随着长上下文模型普及、多轮对话业务规模化落地,单纯算力堆叠的边际效益持续递减,显存墙、高延迟、高成本、低复用四大痛点愈发凸显,成为制约大模型从测试走向大规模产业化落地的核心瓶颈。当全行业扎堆攻坚算力短板时,AI基础设施的另一核心解题思路——存算协同优化,正在成为破局关键。



2026中国国际大数据产业博览会期间,中科曙光分布式存储产品部总经理石静接受赛迪网采访时,抛出颠覆性判断,跳出传统算力内卷逻辑,重新定义存储在AI大模型体系中的核心价值:KV Cache 本身就是一种智能化数据,存储的角色要从存数据走向存智能。这一观点不仅点破了当前大模型推理效率低下的核心症结,更拉开了AI基础设施从“算力单一驱动”向“存算协同”范式升级的序幕,为行业破解推理落地困境提供了全新路径。

这一革新性判断,源于真实的大模型推理运行数据。在处理一条16K长度的序列时,大模型单次推理需要完成约2.56亿次键值对计算。大模型自回归生成的特性,自带天然的“计算冗余短板”:每生成一个新字词,都需要重新计算一遍历史对话的Key/Value向量,重复计算造成海量算力浪费。为解决这一问题,业界普遍采用KV Cache技术,将预计算的键值对缓存于显存,通过“以存换算”的方式规避重复计算、提升推理效率。



但现有方案存在无法逾越的短板:GPU HBM显存容量极其有限,面对长上下文、多轮对话场景极易被快速占满,“显存墙”由此成为大模型推理规模化落地的第一道、也是最核心的拦路虎。针对行业普遍面临的存算失衡、缓存复用率低、层级调度混乱等痛点,中科曙光推出全层级KV Cache管理方案ParaCache,从存储侧重构大模型推理架构,为行业提供差异化破局解法。

算力内卷无解:推理落地的双重困境与行业技术瓶颈

随着生成式AI产业落地提速,推理算力需求在AI算力服务中的占比持续攀升,已然超越训练成为算力消耗主力。大模型推理分为Prefill预填充与Decode逐字生成两大核心阶段:Prefill阶段负责批量处理输入内容、生成基础KV Cache,Decode阶段则逐字输出文本、完成对话响应。在真实产业场景中,AI对话业务高度重复、单轮对话动辄十几轮迭代,海量重复计算、重复缓存成为行业最大的算力与资源浪费源头。

石静将当前大模型推理的核心困境拆解为两大核心矛盾,直指行业痛点本质:一是时间困境,多轮对话、长文本输入下,重复计算叠加显存调度压力,导致模型推理速度持续变慢,用户响应体验下滑;二是空间困境,KV Cache缓存成本居高不下,显存资源稀缺昂贵,缓存扩容成本持续攀升,模型推理的商业化落地成本大幅增加。

更关键的是,传统KV Cache加速方案仅能优化单对话、单节点内部的重复计算问题,跨对话、跨集群的缓存复用效率大幅衰减。各节点、各会话的KV缓存相互独立、无法共享,行业陷入“缓存越存越多、硬件成本越堆越高、资源利用率却持续走低”的恶性循环。

目前业界主流厂商的优化路线仅有两条,要么通过算法压缩KV Cache占用空间,要么将缓存数据卸载至SSD等大容量、低成本存储介质。但两条路线落地均面临致命瓶颈,始终无法实现规模化生产落地。

一方面,LMCache等主流开源方案仅支持单实例内的KV Cache隔离管理,无法实现跨机器、跨集群缓存共享,且缺乏全局元数据视图,形成严重的“元数据迷雾”,行业始终无法精准判定KV缓存的最优存储层级,调度混乱问题无解;另一方面,分布式存储本具备天然的资源池化、跨节点共享优势,契合大模型规模化缓存复用需求,但受限于分布式锁机制、缺失GPU直通能力,读写延迟偏高,长期以来仅被用于冷数据归档,无法参与实时推理调度,算力存力协同价值无法释放。

针对行业双重技术瓶颈,ParaCache给出了全维度、全层级的系统性解法。方案打通GPU HBM、CPU DRAM、本地SSD+集中式存储、分布式存储四级缓存架构,构建完整的KV Cache分层调度体系。其中L1层级依托GPU HBM承载热数据高速读写,L2层级借助CPU DRAM实现中层缓存调度,L3层级创新融入FlashNexus Neo集中式存储,依托共享阵列实现多计算节点共用存储资源,实测时延、吞吐、并发能力较传统Local SSD提升约2倍;L4层级由ParaStor分布式存储兜底,搭载对标NV GDS、兼容国产AI卡的XDS技术,实现GPU与分布式存储的直接交互,支持L1越级直达L4卸载、L4回迁L1的灵活调度模式。

整体方案以自研ParaStor分布式存储为核心底座,融合FlashNexus高速存储能力,向下实现全域存储资源调度,向上兼容vLLM、SGLang等主流推理框架,可适配PD一体、PD分离各类主流部署模式。核心能力聚焦三大核心优势:全层级缓存池化实现资源最大化复用、全局元数据统一视图消除调度迷雾、基于KV语义的智能预取与精细化目录淘汰策略,从架构底层解决推理效率与资源浪费问题。

突破生产落地壁垒:四级缓存架构实现性能与成本双优化

行业多级缓存架构并非新鲜概念,但多数方案仅停留在技术演示层面,无法适配严苛的生产级场景。石静强调,ParaCache并非闭门造车的小众技术方案,而是深度贴合产业落地需求、兼容行业主流生态的成熟产品,最大限度保护客户现有技术投入。一方面,ParaCache与行业主流第三方KV管理软件完成联合定制适配,另一方面全面对齐LMCache开源事实标准,推理侧技术栈改动极小,可快速落地各类在线推理、RAG知识库等业务场景。

针对KV Cache随机读写、高频访问、动态迭代的专属特征,中科曙光对L4层级ParaStor分布式存储完成多项定向深度优化。将传统offset覆盖写模式升级为低延迟适配的追加写模式,大幅降低缓存读写延迟;基于目录架构重构分布式锁机制,实现锁轻量化或完全去除,规避强一致性协议带来的延迟损耗;在PD分离架构集群中,仅传输增量KV缓存数据,大幅节约网络带宽资源,提升跨节点调度效率。方案底层搭载于今年斩获IO500生产型全节点与十节点全球双冠的ParaStor F9000分布式全闪存存储,为大规模推理业务提供稳定底座支撑。

实测数据充分验证了ParaCache的落地价值,在真实复杂业务场景中实现性能跨越式提升。在30K/120K超长文本输入+20轮多轮对话的实景测试环境下,模型首次推理延迟大幅降低89%;其中120K超长文本输入场景下,单轮对话TTFT最高降幅达98.5%,延迟降至400ms级别,多轮会话TTFT降幅超80%,稳定控制在4.9s。在高并发核心场景中,相较于仅依靠HBM显存的传统方案,Token吞吐量最高提升近27倍,常规场景稳定提升26倍。同时,L4分布式存储的接入大幅降低了L2缓存的容量依赖,底层存储性能可对标L3层级,实现低成本、高性能的缓存调度。

在产业最关注的成本维度,ParaCache实现了实打实的硬件降本。石静表示,大模型存算架构的成本并非简单的“单体硬件能力×数量”,而是随业务场景、对话轮次、上下文长度动态变化,但从规模化落地效果来看,可帮助企业节省约1/3的内存、SSD硬件采购成本,在不牺牲推理性能的前提下,大幅降低大模型推理服务的整体TCO。

十万卡超集群验证:国产存算架构的规模化落地能力

小规模场景的性能优化不足以证明技术实力,十万卡级超大规模集群的落地适配,才是检验AI基础设施方案成熟度的核心标准。今年7月10日,中科曙光曙光8000全国产十万卡AI超集群正式落成并接入国家超算互联网,标志着国内AI基础设施正式从万卡级迈入十万卡规模化部署新阶段,也为ParaCache提供了最严苛的实战测试场景。

石静介绍,在曙光8000十万卡超集群中,ParaCache核心承担两大核心职能,成为集群高效运行的关键支撑。其一,依托四级分布式共享缓存池架构,彻底打破节点壁垒,实现全域跨推理任务的KV缓存复用,解决大规模集群资源碎片化问题;其二,构建精细化冷热分级调度机制,将高频访问的热数据驻留于HBM、内存等高速介质,低频冷数据直接下沉至分布式存储,实现资源分层最优利用,平衡性能与成本。

同时,十万卡超大规模集群也带来了极致技术挑战。十万级计算节点协同交互,叠加跨节点KV缓存高频读取,对网络时延、吞吐、稳定性提出极致要求;多会话超高并发读写场景下,若缓存调度、数据管控不当,极易产生脏数据、垃圾数据,直接导致推理结果出错、业务瘫痪。

针对规模化集群的核心痛点,ParaCache搭建了双重保障体系。硬件层面,依托中科曙光自研scaleFabric 原生RDMA无损高速网络,凭借低时延、零拷贝核心能力,搭配智能流控与链路自愈技术,彻底解决大规模集群的网络拥塞问题;架构层面,创新性采用元数据持久化设计,实现“元数据不乱,数据就不会乱”,即便出现节点故障、网络波动,也可通过元数据精准找回、读取缓存数据,保障业务稳定运行。

目前ParaCache已在多行业头部客户场景完成落地验证,适配全产业AI推理需求。除曙光8000超集群外,国内头部互联网厂商通过ParaStor+ParaCache的KV缓存管理优化,实现在线推理业务TTFT、P99 TTFT与吞吐量的全方位提升;金融领域,某银行信用卡及办卡中心依托超节点+ParaCache方案,业务并发吞吐提升3倍;教育科研RAG知识库场景中,系统并发度实现15-20倍跨越式增长,适配科研级高频检索、多任务推理需求。

行业范式重构:存算协同开启AI基础设施新周期

当行业被问及AI基础设施是否从“单纯堆GPU”转向“算力存力协同”新赛道时,石静给予了肯定答复,并进一步提出更具前瞻性的范式判断:ParaCache代表的KV缓存智能管理技术,正在重塑大模型推理的底层架构范式。

过去行业架构以GPU算力为绝对核心,KV Cache只是模型推理过程中产生的临时数据、中间状态,无复用价值、无资产属性;而在全新的存算协同架构下,KV Cache升级为核心智能化数据资产,GPU算力不再是单一核心,转而围绕KV缓存数据提供精准的Prefill、Decode算力支撑。未来大模型的性能迭代、能力升级,核心取决于KV Cache的精细化管理能力,直接决定推理服务成本、用户响应速度、AI Agent的规模化扩展上限。

这一范式变革正在重塑整个AI产业的硬件采购与集群建设逻辑。行业采购标准从此前单一的GPU算力比拼,升级为算力、存力、网络、缓存一体化统筹规划,以整体TCO最优为核心标尺,平衡硬件成本与服务性能,彻底告别算力盲目内卷。而在国内高端算力供给受限、国产化替代加速的行业背景下,以ParaCache为代表的国产存算协同方案,正迎来换道超车的核心窗口期,有望打破海外技术垄断,构建自主可控的AI基础设施生态。

同时石静也清晰界定了技术适用边界,避免行业盲目跟风。她指出,ParaCache并非适配所有推理场景的普适性方案,主要聚焦集群级部署、长上下文交互、高并发复用的规模化生产场景,是产业级AI推理效率优化的核心工具,而非通用解药。

从行业长期发展来看,AI规模化落地时代,性能瓶颈已从计算侧逐步转移至数据调度、缓存复用、IO传输的数据路径侧。存储的价值彻底重构,从传统被动响应IO请求的底层硬件,升级为主动调度数据、复用缓存、卸载算力、优化架构的核心智能载体,完成“存数据”到“存智能”的终极升级。未来,“以存换算”将从行业共识落地为标准化架构,而ParaCache等国产方案的规模化生产落地,将持续验证存算协同范式的可行性,推动国内AI基础设施产业迈入高质量发展新周期。(文/徐培炎)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日本果然参战了!伊朗暴怒:喊话1亿日本人,要找高市早苗算账

日本果然参战了!伊朗暴怒:喊话1亿日本人,要找高市早苗算账

军机Nova
2026-09-01 00:19:52
华为没错,就是演砸了

华为没错,就是演砸了

正言智驾
2026-08-31 12:35:35
开学三件套齐涨价,不少家长直呼吃不消了:预算直冲20000元,提醒:理性消费,按需选购

开学三件套齐涨价,不少家长直呼吃不消了:预算直冲20000元,提醒:理性消费,按需选购

每日经济新闻
2026-08-31 00:11:03
招录比2000:1!此前吉隆出入境边防检查站招录1人,报名2006人,网友:直到泥石流袭来,才读懂这份岗位的千钧重量

招录比2000:1!此前吉隆出入境边防检查站招录1人,报名2006人,网友:直到泥石流袭来,才读懂这份岗位的千钧重量

火山詩话
2026-08-30 15:55:35
什么叫裁员裁到大动脉了?网友:写退党申请,省委组织部都来人了

什么叫裁员裁到大动脉了?网友:写退党申请,省委组织部都来人了

夜深爱杂谈
2026-08-30 20:39:39
双预警齐发:浙江福建等地部分地区有大暴雨、特大暴雨

双预警齐发:浙江福建等地部分地区有大暴雨、特大暴雨

界面新闻
2026-09-01 06:55:30
一辆不值钱的“奔驰E300L”,让学生家长被嘲笑:现实点吧,别心比天高

一辆不值钱的“奔驰E300L”,让学生家长被嘲笑:现实点吧,别心比天高

熙熙说教
2026-08-31 14:59:44
“沙德尔”可能复活!暴雨、大暴雨继续影响江苏!

“沙德尔”可能复活!暴雨、大暴雨继续影响江苏!

江南晚报
2026-09-01 03:34:31
景甜千字长文回击孙宇晨:“不是只有你会写小作文,我也会写…”

景甜千字长文回击孙宇晨:“不是只有你会写小作文,我也会写…”

大熊欢乐坊
2026-08-29 23:51:43
悲剧!又一女生8月初在泰国被人接走,绑架到缅甸妙瓦底!向家属索要30万赎金,家属筹10万交过去,但绑匪依然不放人

悲剧!又一女生8月初在泰国被人接走,绑架到缅甸妙瓦底!向家属索要30万赎金,家属筹10万交过去,但绑匪依然不放人

火山詩话
2026-08-31 05:33:18
杨瀚森准绝杀!中国男篮险胜黎巴嫩收获两连胜

杨瀚森准绝杀!中国男篮险胜黎巴嫩收获两连胜

体坛周报
2026-08-31 21:24:12
突围战开打,中俄已联手,美国老底被抄,普京代表先给中国报喜了

突围战开打,中俄已联手,美国老底被抄,普京代表先给中国报喜了

说历史的老牢
2026-08-31 05:40:12
闹大了!为期仅仅五天的学生军训还在进行,家委会提议全班出资,给教官赠送价值117元的保温杯,引发争议

闹大了!为期仅仅五天的学生军训还在进行,家委会提议全班出资,给教官赠送价值117元的保温杯,引发争议

火山詩话
2026-08-30 06:03:49
男篮晋级世界杯形势更新:杨瀚森准绝杀改变D组大局 余下4场胜3场就稳了

男篮晋级世界杯形势更新:杨瀚森准绝杀改变D组大局 余下4场胜3场就稳了

颜小白的篮球梦
2026-08-31 21:27:51
星宇股份举报信迎来新进展!奔驰、大众、港交所三方陆续回复,态度各不相同

星宇股份举报信迎来新进展!奔驰、大众、港交所三方陆续回复,态度各不相同

火山詩话
2026-08-31 09:50:41
2-1疯狂4连胜!郑钦文逆转16岁新星,狂揽128万奖金,进美网64强

2-1疯狂4连胜!郑钦文逆转16岁新星,狂揽128万奖金,进美网64强

侃球熊弟
2026-09-01 01:58:40
39岁梅西宣布退出阿根廷队!结束21年国脚生涯 世界杯决赛成谢幕战

39岁梅西宣布退出阿根廷队!结束21年国脚生涯 世界杯决赛成谢幕战

我爱英超
2026-08-31 23:19:15
“真刀真枪”,又打起来了

“真刀真枪”,又打起来了

中国新闻周刊
2026-08-31 18:14:15
28岁内地女主播诬告强奸在澳门被捕,因与男子发生性关系索2万港元未果

28岁内地女主播诬告强奸在澳门被捕,因与男子发生性关系索2万港元未果

可达鸭面面观
2026-08-31 13:50:36
离婚的妇人都是咋和前夫相处的?网友:我就好奇,有没有睡在一起

离婚的妇人都是咋和前夫相处的?网友:我就好奇,有没有睡在一起

带你感受人间冷暖
2026-08-31 00:05:16
2026-09-01 07:40:49
侃故事的阿庆
侃故事的阿庆
几分钟看完一部影视剧,诙谐幽默的娓娓道来
720文章数 9412关注度
往期回顾 全部

科技要闻

起售不足18万!特斯拉在港澳推廉价Model 3

头条要闻

"崩老头"APP招募女聊天员:日赚1万元 不卡颜值卡情商

头条要闻

"崩老头"APP招募女聊天员:日赚1万元 不卡颜值卡情商

体育要闻

中国女婿用一份满分答卷,刺痛中国女排

娱乐要闻

女歌手陈粒疑被男子骚扰,本人回应

财经要闻

沃什美联储百日新政剧变:没有给答案

汽车要闻

A0级最长续航 极狐贝塔T1 550km版上市 7.68万起

态度原创

艺术
亲子
旅游
手机
公开课

艺术要闻

被皇帝赶出画院的金匠,死后封神五百年

亲子要闻

上学第一天,有星光落在了这群萌娃身上

旅游要闻

美大峡谷国家公园山洪已致两人死亡 超14人失联

手机要闻

安卓首款1:1方形前摄降临!荣耀Magic9系列率先落地 对标苹果

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版