网易首页 > 网易号 > 正文 申请入驻

Hot Chips | KV Cache爆炸、延迟加剧,NVIDIA 亮出“异构”解法

0
分享至

作者:毛烁

老黄曾说:“Computing demand is growing exponentially,the agentic AI inflection point has arrived."(计算需求正呈指数级增长,Agentic AI 的拐点已然到来)


事实上,Agentic AI的运行模式不同于传统模型推理,其需要自主进行逻辑推理,调用外部工具(如代码解释器、搜索引擎),跨系统读取海量数据,并完成多步迭代。

这类复杂工作流在硬件层面具有三个关键物理挑战:

其一,超长上下文带来了内存与访存瓶颈。Agentic AI在执行任务时,往往需要处理数万甚至数百万行代码、系统日志等长链路信息。在Transformer架构中,输入序列长度(Sequence Length)的增加,会让标准全局注意力机制(Attention Mechanism)的计算复杂度呈平方级增长。

更大的压力来自KV Cache(键值缓存)的持续膨胀。在模型推理的预填充(Prefill)阶段,系统需要为输入Token计算保存对应的KV 状态。而上下文长度增加,KV Cache所占用的内存空间也随之线性增长。

当上下文规模达到10万Token 级别时,硬件不仅需要具备足够高的计算吞吐能力来处理海量输入,还需要提供更大的HBM(高带宽内存)容量来承载KV Cache。

而当模型权重与KV Cache合计超过HBM容量后,系统需要将部分缓存卸载到CPU内存或外部存储,并通过“CPU—GPU”互连或存储网络在不同内存层级之间迁移。但由于这些路径的带宽和访问延迟弱于HBM,GPU就会因等待数据而降低利用率,形成“内存墙”。

其二,解码阶段的低延迟压力。AI推理的第二阶段是解码(Decode),具体来说就是模型以自回归(Autoregressive)的方式逐个生成 Token。

与预填充阶段不同,在小批量解码场景下,计算吞吐往往不是主要限制因素,内存带宽和指令调度延迟才是决定性能的关键。比方说,生成单个Token 时,系统需要读取此前所有Token对应的 KV Cache,并基于历史状态完成当前步的注意力计算。

但是,这一过程的数据访问量大,计算量相对有限,导致计算强度(Compute Intensity,即单位内存访问对应的浮点运算次数)较低,硬件性能更容易受限于数据搬运效率。

在智能体(Agent)任务中,这类延迟会被进一步放大。

我们用一个coding任务作比方,其通常需要经历“分析问题—生成代码—运行测试—分析错误—修改代码”多轮循环。所以,每一次生成Token的微小延迟,都会在多轮推理链路中不断累积。

因此,如果底层硬件无法在极短时间内完成单个Token的生成,Agent的整体响应速度和交互体验就会受到严重影响,难以支撑实时、高频的智能体应用。

其三,吞吐量与响应速度难以兼顾。在单一GPU架构下,为了提升吞吐量(Throughput)并摊薄硬件成本,推理系统通常会采用大批次(Large Batch Size)方式并发处理请求。

但Batch Size增大后,请求排队时间也会随之增加,进而拉高响应延迟。

放在Agentic AI负载下,这一现象更加明显。

一方面,智能体需要处理超长上下文、调用大量外部数据和工具,这要求系统具备足够高的吞吐能力;另一方面,智能体的任务通常由多个连续步骤组成,每一步推理结果都会影响下一步行动,因此单次响应需要具备极低的延迟。

而反观传统GPU架构,其在提升吞吐和降低延迟方面的逻辑存在冲突:增加Batch Size可以提高资源利用率,但请求等待时间也会增加;而缩小Batch Size 可以降低延迟,却又会牺牲整体吞吐效率。

因此,仅依靠优化单颗芯片的微架构,难以同时满足Agentic AI对高吞吐和低延迟的双重需求。

01 NVIDIA解法:异构协同,Rubin GPU+ Groq 3 LPX

面对这些挑战,2026年Hot Chips期间,NVIDIA展示了Vera Rubin NVL72平台+Groq 3 LPX的异构计算设计思路。

在这一架构中,NVIDIA将面向特定AI推理负载优化的LPU(Language Processing Unit)架构引入GPU计算体系,通过不同计算单元承担不同阶段的推理任务,实现计算路径的重新划分,从而应对Agentic AI对吞吐、延迟和效率的复杂需求。


NVIDIA Groq 3 LPX机架级系统,由256颗LP30组成

(截取自NVIDIA)

先说架构级分工方面,Vera Rubin NVL72并没有采用单一芯片覆盖全部推理流程的方式,而是根据Transformer不同推理阶段的计算特征,将Prefill与Decode路径进行解耦。

NVIDIA公布了三种协同配置:

1、Prefill—Decode解耦:Rubin负责Prefill并移交KV Cache,LPX负责完整Decode;

2、Attention—FFN解耦:Rubin负责Prefill、KV Cache和Decode Attention,LPX负责FFN、MoE专家层;

3、推测解码:LPX运行小型草稿模型,Rubin运行大型目标模型。


NVIDIA Dynamo协调Rubin GPU与Groq 3 LPX执行异构推理

(截取自NVIDIA)

为什么这样设计?

具体来看,Transformer推理通常包含预填充(Prefill)和解码(Decode)两个阶段,而这两个阶段对硬件能力的需求并不相同。

Prefill阶段需要一次性处理大量输入Token,计算规模大、并行度高,更依赖芯片的矩阵计算能力和内存带宽。

因此,Vera Rubin NVL72 机柜内的 Rubin GPU 主要承担该阶段工作。依托高并发算力、多级缓存体系与高带宽 HBM4 显存,GPU 可高效执行大规模输入矩阵运算,快速构建初始 KV Cache,并持续承担后续的 Attention 注意力计算。

而Decode解码阶段则需要逐Token迭代生成输出,对端到端响应延迟更为敏感。

所以,Groq 3 LPX则负责对该类自回归负载的专项优化,主要承担解码流程中的FFN前馈网络、MoE专家层,以及部分逐点运算。

再说到性能层面,该架构的解耦方案显著弱化了推理系统吞吐量与延迟之间的固有取舍。第三方评测机构Artificial Analysis针对NVIDIA在自有数据中心搭建的Groq 3 LPX系统进行了测试,测试环境采用具备复杂推理能力的开源模型Gemma 4 31B,并将上下文长度设定为10万Token,以模拟高压力长上下文推理场景。

在这一极端负载下,搭载Groq 3 LPX的系统实现了3400 Output Tokens/second的解码速度,也就是每秒输出3400个Token,约为当时最快公开端点870 output tokens/s的3.9倍。


Groq 3 LPX在 Gemma 4上处理 10 万个上下文长度输入标记的速度

(截取自NVIDIA)

从系统工程角度看,性能的提升也进一步降低了智能体在多步骤任务执行过程中的等待时间。对于代码生成、测试调试、多模态数据分析等需要持续推理迭代的复杂任务而言,能够显著压缩任务周期。

除了提升单节点计算能力,还需要解决规模化部署的问题。如何在有限的电力和空间约束下,提高单位资源内的Token处理效率,是设计数据中心级架构的关键考量。

而完整的NVIDIA Groq 3 LPX机架级部署包含256个通过“chip-to-chip”直连链路互连的LP30加速器。这些加速器组成了统一计算系统,共同执行推理任务。

为了衡量该架构在数据中心环境中的实际效率,NVIDIA采用“每兆瓦吞吐量”(Throughput per Megawatt,TPS per MW)作为核心的衡量指标,用于评估单位功耗下的Token处理能力。

在具体测试场景的测试中,NVIDIA使用SemiAnalysis AgentX记录的真实Agentic Coding轨迹评估Vera Rubin NVL72。该工作负载的输入长度中位数约为14万Token。在DeepSeek V4 Pro模型上,当单用户生成速度达到160 Token/s时,Vera Rubin NVL72的每兆瓦吞吐量最高达到GB300 NVL72的30倍;每百万Token成本最低可降至GB300 NVL72的1/35。

目前,AI云服务商Nebius已宣布采用该平台,并计划将其接入Nebius Token Factory,通过统一API向开发者提供基于该架构的推理服务。

02 Scale-In :用 DPU 破解多租户 AI 基础设施瓶颈

在解决了计算引擎的性能瓶颈后,数据中心内部的基础设施管理成为了下一个技术堵点。

打个比方,在一个多租户AI环境中,系统不仅需要完成模型计算,还需要同时处理用户隔离、数据访问、网络通信以及安全策略等大量基础设施任务。这些工作如果仍然由主机CPU承担,就会与业务计算争夺有限的资源。

那么传统架构下,多租户网络隔离、存储I/O调度,以及安全加密等功能通常依赖主机处理器(Host CPU)和操作系统内核完成。而现在,AI工作负载将数据流量推到Tbps级别,CPU需要频繁处理中断、执行协议栈操作并进行任务切换,系统开销也随之增加,影响整体资源利用效率。

因此,NVIDIA这次也公布了其Scale-In(向内扩展)基础设施架构,将原本由主机承担的基础设施服务通过专用DPU硬件进行卸载。

作为NVIDIA AI网络技术体系中的五大支柱之一,Scale-In的核心思路是让网络、存储、安全等底层服务由专用处理器承担,从而释放主机计算资源,并提升多租户AI环境下的运行效率。


NVIDIA AI基础设施的Scale-Up、Scale-Out、Scale-Across与Scale-In

(截取自NVIDIA)

Scale-In架构由NVIDIA BlueField-4 DPU(数据处理器)和DOCA软件栈共同驱动,其核心价值是在服务器数据路径中引入独立的数据处理层。

BlueField-4 DPU可以在网卡级芯片层面(In-silicon)直接处理进出服务器的数据包,包括IPsec/TLS加解密、安全策略匹配以及路由转发等操作。这些任务无需再经过主机CPU和操作系统内核路径,从而减少CPU在基础设施服务上的资源占用。

基础设施任务被迁移到DPU之后,网络处理能力和资源隔离方式也随之变化。

部署Scale-In架构后,Vera Rubin系统的VPC(虚拟私有云)策略可以覆盖每个计算托盘总计7.2Tbp/s的聚合接口带宽,存储网络访问吞吐量最高可达到通用以太网方案的1.45倍。

这意味着,当Agent需要频繁访问远端NVMe存储集群、加载大型数据集时,数据传输链路能够提供更高的处理能力,降低存储访问对任务执行效率的影响。

除了网络性能,多租户环境下的安全隔离是另一个关键问题。

在云环境中,不同智能体共享计算、网络及存储资源,所以必须确保其权限边界不会因为主机软件层面的变化而被突破。

于是,在Scale-In架构中,安全策略的执行被下沉到DPU硬件层。这样一来,即使主机操作系统中的租户软件想要修改网络配置、访问策略,也无法绕过DPU中的硬件控制路径。

总体看,这种基于硬件的隔离方式,为企业级Agentic AI在多租户环境中的部署提供了更好的基础安全保障。

03 NVLink Fusion+MGX 生态,NVIDIA构建标准化异构基础设施

当AI基础设施规模进一步扩大,节点内部的性能优化依然不足,如何让不同计算单元实现系统级高效互连,成为影响整体效率的关键因素。

尤其是定制芯片逐渐进入AI基础设施之后,如何将这些XPU(Custom Silicon)高效集成到现有系统中,成为新的工程挑战。

回过头看,传统PCIe连接方式虽然具备通用性,但在AI工作负载下,带宽密度有限,而且PCIe链路本身并不提供统一的缓存一致性(Cache Coherence)机制。不同类型计算芯片之间的数据交换,需要额外的数据复制和同步操作,由此带来更高的延迟和功耗。

但大家都知道,NVIDIA的NVLink Fusion,能通过高速互连能力,让不同计算单元能够接入统一的AI基础设施体系。


NVLink Fusion支持第三方XPU、CPU与NVIDIA机架级基础设施集成

(截取自NVIDIA)

NVLink Fusion整合了NVLink 6、NVLink Switch及NVLink-C2C等技术。其中,Vera CPU与Rubin GPU可通过NVLink-C2C获得1.8 TB/s一致性带宽,使LPDDR5X与HBM4形成统一地址空间,减少CPU与GPU之间的显式数据复制。

简而言之,该互连机制的核心价值是减少跨芯片的显式数据拷贝,各计算单元间的数据交互效率得以提升,有效削减系统通信开销。

另一方面,NVLink Fusion与NVIDIA MGX生态的结合,也为异构算力部署提供了标准化机架体系。

NVIDIA MGX对服务器机械结构、液冷散热、供电模块,以及集群管理等基础设施进行统一规范,使数据中心能够提前建设标准化硬件底座,而无需等待某一款定制XPU完成研发后再重新设计整机系统。

当不同类型的第三方XPU进入量产阶段,只要符合MGX规范,即可复用已有基础设施。运维方也能够基于同一套硬件平台,根据业务负载需求灵活调整GPU与加速芯片的组合比例,从而提升异构计算的部署灵活性。

04 写在最后

AI 智能体逐渐进入生产环境,模型推理面临的新问题已经超出了传统GPU擅长的范畴:超长上下文带来的KV Cache 膨胀、多轮推理中的低延迟响应需求,以及频繁调用外部工具形成的复杂工作流,都要求计算、存储、网络和调度体系进行重新设计。

根据这几个变化,从NVIDIA此次的更新不难看出,其技术重心正转向异构计算、系统互连、数据中心架构。具体可以理解为“三个变化”。

第一,计算范式变化。Agentic AI兴起,Transformer 推理过程中的不同阶段开始呈现出明显不同的计算特征。其中,Prefill 阶段需要处理大量输入Token,更依赖计算能力和显存带宽;而 Decode阶段则需要逐 Token 生成结果,更容易受到内存访问延迟、通信效率以及调度开销的限制。

而此次NVIDIA将Groq 3 LPX引入Rubin 平台,并与GPU形成协同,本质上是在系统层面提升不同类型加速器的分工价值。结合Dynamo 调度体系,可以进一步拆分Prefill、Decode以及Attention、FFN 等不同计算环节,并能根据工作负载特点分配到更适合的硬件上运行。

第二,基础设施变化。BlueField-4 DPU与Scale-In架构可将网络处理、安全加速、存储卸载等任务从CPU 剥离,并在数据路径上直接完成处理,计算资源也可以更加集中地服务于AI推理。对于企业而言,这意味着更高的资源利用率,也为混合云、多租户,以及大规模智能体部署提供了更清晰的硬件隔离边界。

第三,生态的变化。

NVLink Fusion和MGX为部分第三方加速器进入NVIDIA AI 基础设施体系提供接口。所以,无论计算节点中包含GPU、LPU 还是其他专用芯片,只要希望融入高性能AI系统,都可以与NVIDIA 定义的互连和机架体系进行适配。

进入 Agentic AI 时代,算力竞争的逻辑已经发生改变。单纯追逐单芯片峰值性能已经不足以形成优势,竞争焦点转移到计算资源编排、数据通路效率与基础设施协同能力之上。

而NVIDIA于HotChips发布的多项架构革新,或许也指明了下一代AI超算的发展路径:未来AI超算不会依靠单一芯片堆出性能,而是要依靠多类型计算单元、高速互连、硬件底座相互配合的异构系统。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
蔡英权当选龙岗区人民政府区长

蔡英权当选龙岗区人民政府区长

南方都市报
2026-08-28 17:59:08
从巅峰跌落谷底!郑钦文无缘美网正赛,重回资格赛起点引唏嘘!

从巅峰跌落谷底!郑钦文无缘美网正赛,重回资格赛起点引唏嘘!

张发林
2026-08-23 16:07:13
孙宇晨起诉景甜后续,律师最新发声:两人谈了7个月,3000万是彩礼不是赠予,景甜代孕是事实

孙宇晨起诉景甜后续,律师最新发声:两人谈了7个月,3000万是彩礼不是赠予,景甜代孕是事实

叨唠
2026-08-28 00:51:04
8月26日俄乌最新:神秘的C-17

8月26日俄乌最新:神秘的C-17

西楼饮月
2026-08-26 21:47:07
湖人给钱更多库明加偏不选 苏群:动机没森林狼单纯

湖人给钱更多库明加偏不选 苏群:动机没森林狼单纯

竞技风云录
2026-08-27 18:19:25
河北康保1.1万亩白菜趴地里,农户:谈定金时消息曝光,商贩转身全走了;政府人员:“甲醛白菜”系外地采购商所为,与本地菜农无关

河北康保1.1万亩白菜趴地里,农户:谈定金时消息曝光,商贩转身全走了;政府人员:“甲醛白菜”系外地采购商所为,与本地菜农无关

大风新闻
2026-08-27 21:37:29
曾有人当面问特朗普:“世界上还有谁能管得了你?”他的回答不同寻常,却又在情理之中,他说:“唯一能管我的,只有我自己的道德标准。”

曾有人当面问特朗普:“世界上还有谁能管得了你?”他的回答不同寻常,却又在情理之中,他说:“唯一能管我的,只有我自己的道德标准。”

扶苏聊历史
2026-08-27 15:06:56
彭欣力遭重罚!停赛4场罚款4万,推击马德鲁加染红,曾公开道歉

彭欣力遭重罚!停赛4场罚款4万,推击马德鲁加染红,曾公开道歉

奥拜尔
2026-08-28 14:21:54
脊背发凉!25岁留学女孩遇害案聊天记录流出:郑某与受害人之间扭曲的纠葛,在当地中国留学小圈子里成为心照不宣的“公开秘密”

脊背发凉!25岁留学女孩遇害案聊天记录流出:郑某与受害人之间扭曲的纠葛,在当地中国留学小圈子里成为心照不宣的“公开秘密”

火山詩话
2026-08-27 08:35:16
亲眼见证藏族少女天葬过程,场面真震撼,颠覆了我对生死的认知

亲眼见证藏族少女天葬过程,场面真震撼,颠覆了我对生死的认知

古怪奇谈录
2025-07-30 15:23:44
胖东来拒绝房东续租请求,整条街商户跟着遭殃

胖东来拒绝房东续租请求,整条街商户跟着遭殃

爱看剧的阿峰
2026-08-26 12:34:48
“手段残忍”!中国女留学生被肢解抛尸,嫌疑人突然反悔,拒做精神病态测试

“手段残忍”!中国女留学生被肢解抛尸,嫌疑人突然反悔,拒做精神病态测试

南方都市报
2026-08-28 16:09:27
媒体人:刘翔有点怨种,这事不该发网上,该学习前辈姚明让别人说

媒体人:刘翔有点怨种,这事不该发网上,该学习前辈姚明让别人说

风过乡
2026-08-28 16:56:29
地方附加税法向社会公开征求意见

地方附加税法向社会公开征求意见

第一财经资讯
2026-08-28 15:33:33
癌的源头已发现?咸菜没上榜,第1名大家或天天都在吃

癌的源头已发现?咸菜没上榜,第1名大家或天天都在吃

垚垚分享健康
2026-08-26 16:21:31
台湾问题即将突破临界点,两大迹象表明:大陆或要准备出手了

台湾问题即将突破临界点,两大迹象表明:大陆或要准备出手了

超级无敌美少女何
2026-08-27 14:37:52
房价不仅会收复过去的跌幅,而且大概率会再创新高。

房价不仅会收复过去的跌幅,而且大概率会再创新高。

流苏晚晴
2026-08-25 12:39:49
中国游客土耳其玩滑翔伞与教练双双坠亡后,涉事飞伞公司停飞,大使馆工作人员:一直在协助家属处理善后

中国游客土耳其玩滑翔伞与教练双双坠亡后,涉事飞伞公司停飞,大使馆工作人员:一直在协助家属处理善后

极目新闻
2026-08-28 17:56:06
34岁特尔施特根门前失误遭批,阿贾克斯总比分9-5晋级

34岁特尔施特根门前失误遭批,阿贾克斯总比分9-5晋级

懂球帝
2026-08-28 16:41:14
星宇股份校招裁员引众怒:中国资本家为何比国外老牌资本还坏?

星宇股份校招裁员引众怒:中国资本家为何比国外老牌资本还坏?

徐云流浪中国
2026-08-27 16:37:48
2026-08-28 20:03:00
至顶科技 incentive-icons
至顶科技
科技产业媒体与 AI 产业服务机构
21328文章数 49729关注度
往期回顾 全部

科技要闻

AI牛马永不下班!OpenAI让智能体自己找活

头条要闻

湖北21岁大学生3年考了100本证书 自称三本证"最难啃"

头条要闻

湖北21岁大学生3年考了100本证书 自称三本证"最难啃"

体育要闻

曼城花1个亿,买下了摩洛哥的“国民女婿”

娱乐要闻

景甜分手风波,网友:难怪张继科抽身

财经要闻

刑自强:AI投资下半场中国蓄势待发

汽车要闻

东风日产NX8“喜柿橙意”限定色正式上市

态度原创

数码
旅游
游戏
本地
公开课

数码要闻

苹果白送千元!苹果M4版Mac mini升级新款:不用花钱、无需申请

旅游要闻

旅业采购 | 寻找上海入境旅行社、韩国酒店资源等合作

《暗影火炬城》新作官方放出新动态 探索玩法揭晓

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版