网易首页 > 网易号 > 正文 申请入驻

120T全闪塞进一台服务器!给DGX Spark造一块“外置内存”

0
分享至

一台2U服务器里,塞进8块15TB级E1.S SSD,接上100GbE网络,连NVMe都纳入水冷系统,这已经不是常见的家庭实验室配置。

但Raid Owl折腾这台机器,并不只是为了做一台高速存储服务器。

最近一段时间,他一直在自己的DGX Spark集群上运行本地AI,也开始注意到推理过程中一个越来越占资源的问题:KV Cache。

大模型处理完Prompt后,会把一部分中间计算结果保留下来,后续生成Token时继续使用。上下文越长、并发越高,这部分缓存占掉的内存也越多。通常它就放在GPU附近,占用的也是最宝贵的一类资源。


他因此想做一个实验:如果把KV Cache放到另一台服务器,甚至进一步写进NVMe,实际效果会怎么样?

为了测试这个问题,他专门搭了一台120TB级的全闪服务器,然后把它接入DGX Spark集群。

先解决存储:8块E1.S组成120TB全闪池

这台服务器使用Sliger CX2257G 2U机箱。选择它的一个重要原因,是前面能够提供四个5.25英寸设备位,同时内部还能容纳一套水冷系统。

其中一侧放置水泵和储液罐,另一侧安装了两组NVMe硬盘仓。上面一组支持8块M.2,下面一组支持8块E1.S,每个盘位都可以提供PCIe x4连接,并通过MCIO接入主板。


硬盘仓本身也带有液冷设计。SSD插入后会直接贴合冷板,通过水路带走热量。因为两组NVMe冷板内部的管路比较细,他还额外加入第二个水泵,提高水路压力,同时给散热系统留出冗余。

这次实际安装的是8块Solidigm D5-P5430,每块容量15.36TB,总容量接近120TB。这是一款面向数据中心的QLC SSD,重点考虑高容量、功耗和单位容量成本。

为了测试最高吞吐,他直接把这些SSD组成RAID 0。

本地测试中,这套阵列的顺序读取达到约46GB/s,顺序写入约20GB/s,随机读取超过100万IOPS。这样的速度已经超过100GbE网络能够实际承载的水平,因此到了远程访问环节,限制性能的因素不会只来自SSD。

液冷效果也比较明显。连续对SSD和CPU进行压力测试时,硬盘温度只到40多摄氏度;后续长时间运行缓存测试,温度基本保持在40℃以内。整机空闲功耗约130W,缓存持续工作时约170W。

硬件准备完成后,这台服务器被接入他的DGX Spark集群,接下来才进入这次实验的核心部分。

从本地到远程,把KV Cache分成四层

KV Cache可以理解为大模型在推理过程中保存下来的中间计算结果。

模型第一次处理Prompt时,需要进行Prefill,把整段上下文计算一遍。完成之后,对应的Key和Value会被保存下来。之后继续生成Token时,模型可以直接利用这些结果,不必再次计算前面的全部内容。

问题也随之出现。Prompt越长,同时运行的请求越多,KV Cache占用的内存就越大。在一些推理场景里,它消耗的空间甚至可能超过模型权重。

vLLM本身支持在空间不足时,把KV Cache转移到系统内存。这次实验使用的LMCache,又把缓存范围扩展到了其他计算节点和远程存储。

他在多台DGX Spark上运行Qwen3-8B FP16,每台机器部署一个独立的模型实例,然后为KV Cache设置了几层不同的位置。


最靠近计算的是本地缓存,也就是L0;L1通过P2P从其他Spark节点获取KV Cache;L2进入那台远程服务器的系统内存,并使用Redis和Valkey作为后端;L3则落到120TB NVMe存储池,通过NFS over RDMA进行访问。

这样一来,同一段已经计算过的上下文,就有机会在不同模型实例之间重复利用。GPU本地空间有限时,也可以把部分缓存放到容量更大的远程设备上。

这个思路在结构上很清楚,但实际跑起来之后,他很快遇到了问题。最初的测试结果中,本地缓存明显最快,后面的P2P、远程内存和NVMe差距却很小。经过几天排查,他才发现P2P缓存一直在静默失败,系统直接跳过了这一层。

问题修复后,P2P的性能明显提高,这也符合预期:从相邻Spark节点直接获取缓存,数据路径比访问远程服务器更短。

但继续往下,远程内存和NVMe的优势就没有那么明显了。

远程缓存只快约10%,但重启之后还能继续使用

在他的测试中,通过Redis访问远程内存,以及从NVMe读取KV Cache,与直接重新计算相比都没有拉开很大差距,大致只有10%左右的优势。

原因也比较容易理解。Redis的数据虽然放在内存里,但节点之间还要经过TCP通信;NVMe服务器使用了RDMA,数据访问前面仍然有NFS这一层。整套系统最终性能取决于完整的数据路径,底层SSD的46GB/s读取速度只是其中一个环节。

如果只看TTFT,也就是首Token延迟,这组结果并不算突出。但随后的一次重启测试,让NVMe缓存表现出了另一项特性。


他先按照固定方式向模型发送一批请求,让生成的KV Cache进入NVMe存储池。之后把整套系统完全关闭,再重新启动,然后重复发送相同请求。

此前保存在SSD里的缓存依然存在,重新启动后可以直接命中,测试中的命中率达到100%。模型因此省去了重新构建对应上下文的Prefill过程。

实验进行到后期,他已经在NVMe池里积累了超过1TB的KV Cache。

对于他的家庭实验室,这套方案显然有些重。他平时主要使用DGX Spark集群运行一个大型模型,本地缓存和节点间共享已经能够满足多数需求,因此暂时没有计划长期保留完整的远程KV Cache架构。

但这次测试至少验证了一件事:KV Cache可以离开单台GPU,也可以离开单台计算节点,继续存放在远程内存和NVMe中。

更值得注意的是持久性。放在显存和系统内存中的KV Cache,服务器重启后通常就会消失;写进NVMe后,之前已经完成的计算结果可以继续保留。

对个人用户来说,这种能力未必有多大意义。可如果推理集群同时服务大量用户,长期积累的KV Cache达到数TB甚至更大规模,服务器维护、升级和重启之后是否需要全部重新计算,就会成为一个实际的成本问题。

这也是他做完整个实验后留下的一个观察:随着AI推理规模扩大,存储系统除了放模型权重和数据集,也可能开始承担一部分推理缓存。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
罚分全还回去,成都蓉城的冠军成色会变吗?

罚分全还回去,成都蓉城的冠军成色会变吗?

刘哥谈体育
2026-08-19 10:12:34
真是没想到!卸任乒协主席仅10个月又回训练馆!刘国梁一句话划清边界:不干预教练组,王励勤当家作主!这才是国乒真传承

真是没想到!卸任乒协主席仅10个月又回训练馆!刘国梁一句话划清边界:不干预教练组,王励勤当家作主!这才是国乒真传承

锐评利物浦
2026-08-18 18:26:05
双考上岸法学才女发表“觉醒宣言”:拒绝成为原生家庭的养老人质

双考上岸法学才女发表“觉醒宣言”:拒绝成为原生家庭的养老人质

观世记
2026-08-17 16:11:46
看看朝鲜的下场,就能明白咱们为什么不支援俄罗斯了,虽朝鲜倾尽弹药与兵力援俄,换来的却是俄方冷淡回馈

看看朝鲜的下场,就能明白咱们为什么不支援俄罗斯了,虽朝鲜倾尽弹药与兵力援俄,换来的却是俄方冷淡回馈

扶苏聊历史
2026-08-18 15:25:49
人在家中坐,祸从天上来!52岁董卿又被曝猛料,也步入刘晓庆后尘

人在家中坐,祸从天上来!52岁董卿又被曝猛料,也步入刘晓庆后尘

王瑄自驾
2026-08-19 12:01:02
43岁范冰冰受封拿督,事业疑获新大佬支持,全面进军海外市场

43岁范冰冰受封拿督,事业疑获新大佬支持,全面进军海外市场

萌神木木
2025-08-24 13:52:35
条件不符别尬演警察!苦瓜脸配香肠嘴,说话全程面无表情太出戏

条件不符别尬演警察!苦瓜脸配香肠嘴,说话全程面无表情太出戏

梦醉为红颜一笑
2026-08-19 11:25:29
广东儿子每月转父亲5800生活费,父亲哭诉未收到,查账后父亲懵了

广东儿子每月转父亲5800生活费,父亲哭诉未收到,查账后父亲懵了

有态度网友19Dsym
2026-08-19 09:05:00
弟弟太狠了!哥哥上班4年要赔360万,湘潭大学学籍疑案,一场没有结局的罗生门

弟弟太狠了!哥哥上班4年要赔360万,湘潭大学学籍疑案,一场没有结局的罗生门

火山詩话
2026-08-19 06:38:42
天安门广场70年未解谜:纪念碑上155字竟藏毛主席的深谋远虑

天安门广场70年未解谜:纪念碑上155字竟藏毛主席的深谋远虑

兴趣知识
2026-08-12 16:14:31
大量本田小电驴流入闲鱼,外观神似行李箱,价格直接翻倍

大量本田小电驴流入闲鱼,外观神似行李箱,价格直接翻倍

科技拌饭
2026-02-25 17:40:09
网传小米汽车招普工了,25元/小时,2班倒,每天上班11个小时,上13天休1天,网友直言:在北京,钱太少了!

网传小米汽车招普工了,25元/小时,2班倒,每天上班11个小时,上13天休1天,网友直言:在北京,钱太少了!

谭谈社会
2026-08-16 12:05:18
天才陨落?2年前还是英超MVP,如今才26岁,无缘世界杯+主力位置不保

天才陨落?2年前还是英超MVP,如今才26岁,无缘世界杯+主力位置不保

篮球圈里的那些事
2026-08-19 12:55:50
再见了,纽约!詹姆斯被劝诫:必须住在费城...

再见了,纽约!詹姆斯被劝诫:必须住在费城...

詹姆斯吧
2026-08-19 13:43:43
梭子蟹价格“大跳水”

梭子蟹价格“大跳水”

界面新闻
2026-08-18 21:47:19
不战而胜!王曦雨收8号种子退赛大礼,首进硬地1000赛16强

不战而胜!王曦雨收8号种子退赛大礼,首进硬地1000赛16强

全景体育V
2026-08-19 06:15:27
作家李娟:父亲去世,骨灰被河冲走,继父中风,与母亲10年不联系

作家李娟:父亲去世,骨灰被河冲走,继父中风,与母亲10年不联系

洲洲影视娱评
2026-08-18 17:05:09
为报父仇积蓄10年,侄子枪杀叔叔全家13口,湖南特大灭门惨案始末

为报父仇积蓄10年,侄子枪杀叔叔全家13口,湖南特大灭门惨案始末

易玄
2026-08-13 10:41:45
大争议!爱德华兹认为杜兰特是GOAT 硬荣誉远逊乔丹詹姆斯

大争议!爱德华兹认为杜兰特是GOAT 硬荣誉远逊乔丹詹姆斯

醉卧浮生
2026-08-19 07:35:44
18号台风沙德尔生成锁定:到江浙沪?新一轮暴雨、大暴雨范围扩大

18号台风沙德尔生成锁定:到江浙沪?新一轮暴雨、大暴雨范围扩大

阿芒娱乐说
2026-08-19 11:20:33
2026-08-19 14:12:49
至顶AI实验室 incentive-icons
至顶AI实验室
一个专注于探索生成式AI前沿技术及其应用的实验室。
3510文章数 182关注度
往期回顾 全部

科技要闻

宇树科技1100元开盘,较发行价上涨629%

头条要闻

"山西前首富"曾向多名省部级官员行贿 牵出最高法副院长

头条要闻

"山西前首富"曾向多名省部级官员行贿 牵出最高法副院长

体育要闻

在国际球探眼中,中国年轻球员是什么水平?

娱乐要闻

230万变3亿,章子怡活成自己的靠山

财经要闻

内部反腐,让大疆错过宇树250亿收益?

汽车要闻

小米澎程N70体验 后排空间夸张亦可旋转对坐

态度原创

家居
健康
本地
时尚
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

女孩更易侧弯?几类孩子风险偏高

本地新闻

邂逅活珊瑚的西沙,感受独属于国人的浪漫

秋天流行穿粉色,减龄又好看!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版