网易首页 > 网易号 > 正文 申请入驻

英伟达Vera Rubin首秀,DeepSeek V4 Pro 跑出30倍Agent吞吐

0
分享至

机器之心编辑部


过去几年,AI 基础设施的竞争核心是 GPU。更大的模型、更高的参数规模、更强的推理能力,都推动着数据中心不断堆叠 GPU。

但随着 AI Agent 开始执行越来越复杂的任务,新的计算需求出现。一个 Agent 不再只是完成一次模型推理,它需要持续规划任务、调用工具、执行代码、处理数据,并在多个步骤之间保持上下文。

根据 NVIDIA 引用的 OpenRouter 数据,真实 AI 流量中平均 Prompt 长度已增长约 4 倍,单次 Agentic 请求消耗的 token 数量最高可达普通聊天请求的 15 倍。这意味着,AI 系统需要的不只是更强的模型,也需要一套专门支撑 Agent 运行的计算架构。

就在今天早上,NVIDIA 首次公布了基于真实芯片的 Vera Rubin 性能测试结果。

在针对 Agent 工作负载的测试中,Vera Rubin 相比上一代 GB300 NVL72 最高实现每兆瓦吞吐提升 30 倍,并将 token 成本最高降低 35 倍。



就在同一时间,SpaceXAI 宣布将部署 NVIDIA Vera CPU,并计划基于 Vera Rubin 架构扩展支撑 Grok 的 AI 基础设施,进一步探索将优化后的 Vera Rubin NVL72 系统部署到轨道计算环境。



从 Agent 性能测试,到 SpaceX 的轨道计算探索,NVIDIA 展示了一个新的方向:未来 AI 竞争的关键,不只是模型能力,还有支撑 Agent 持续行动的计算基础设施。

Vera Rubin 首次面向 Agent 工作负载测试

过去的大模型性能测试,更多关注固定输入长度下的推理速度。但 AI Agent 改变了这一标准。衡量 Agent 基础设施能力,不能再依赖传统的固定 Prompt 测试,而需要接近真实生产环境的工作负载。这也是 NVIDIA 此次测试的重点。

NVIDIA 采用SemiAnalysis 的 AgentX 工作负载,对 Vera Rubin NVL72 的 Agent 性能进行评估。AgentX 是一个面向 Agentic Coding Inference(智能体代码推理)的基准测试,通过回放真实生产风格的 Agent 会话,评估计算系统处理真实 Agent 请求的能力。



智能体(Agent)会话会产生动态变化的推理序列。

与传统聊天任务不同,Agent 会话具有明显的长链路特征:一次任务中可能包含连续的模型调用、工具使用以及不断累积的上下文。AgentX 会保留原始任务中的上下文长度、输入输出序列、推理时间以及工具调用延迟,以模拟真实 Agent 运行状态。

例如,一个代码 Agent 完成开发任务时,可能需要理解需求、分析代码库、修改程序、执行测试,并根据测试结果继续调整方案。随着任务推进,系统不仅需要处理更长的上下文,还需要持续复用此前已经处理的信息。

NVIDIA 展示的一条真实 Agent 轨迹中,主 Agent 的上下文可以从约 6 万 token 一路增长到接近 40 万 token,同时穿插多个子 Agent 请求。也就是说,对 Agent 而言,「长上下文」是在任务推进过程中自然形成的运行状态,而非偶尔出现的极端情况。



NVIDIA 将这样的指标定义为 AI 工厂级的「每兆瓦吞吐量」(tokens per megawatt)。AgentX 同时关注吞吐效率、端到端延迟、首 token 时间等指标,以衡量系统是否能够在高效率下保持良好的交互体验。

在测试中,NVIDIA 使用 DeepSeek V4 Pro 模型运行 AgentX 工作负载。结果显示,在每位用户 160 tokens/s 交互目标下,Vera Rubin NVL72 相比 GB300 NVL72 最高实现 30 倍更高的 AI 工厂级每兆瓦吞吐量,意味着在相同能源预算下,可以支撑更多 Agent 推理任务。



NVIDIA 将 Vera 定义为「首款为 AI Agent 打造的 CPU」。它采用 88 个 NVIDIA 设计的 Olympus 核心,并搭载高带宽 LPDDR5X 内存,最高提供 1.2TB/s 内存带宽。

当然,Vera 并不是要替代 GPU,它在 AI 系统中承担新的角色:GPU 继续负责大规模模型计算,Vera 则负责支撑 Agent 运行过程中的任务调度、代码执行和数据处理。

30 倍从哪里来?

如果只把 30 倍归因于 Rubin GPU 本身,就会低估 Vera Rubin 真正发生的变化。NVIDIA 此次展示的性能,本质上是一项 rack-scale system result,而不是单颗 chip result。



Agent 运行到后期,会不断处理越来越长的上下文。推理系统不仅需要执行 Transformer 计算,还必须高效保存和复用 KV Cache,并在不同 GPU 之间交换模型专家、上下文状态和中间结果。随着上下文长度、用户交互速度和并发规模不断提高,瓶颈也开始从单纯的 GPU 算力扩展到内存、通信、缓存管理和系统调度。

为此,Vera Rubin NVL72 将 Rubin GPU、HBM4、NVLink 6 以及新的推理软件栈放在一起进行协同设计。Rubin 单 GPU 配置 288 GB HBM4,内存带宽达到 22 TB/s;NVLink 6 则为单 GPU 提供 3.6 TB/s scale-up 双向带宽。对于 72 颗 GPU 组成的 NVL72 而言,更大的统一 scale-up domain 能够让 MoE 专家并行、分布式 KV Cache 等机制在整个机架内运行。

软件层面的变化同样重要。NVIDIA 列出的关键机制包括 Prefill/Decode 分离、Distributed KV Cache、KV Cache offloading、KV-aware routing 以及大规模 Expert Parallelism。

以 KV-aware routing 为例,当一个 Agent 再次发起请求时,系统可以尽量将任务路由到已经保存对应上下文缓存的 GPU,从而避免重新计算此前处理过的大量 token。对于上下文可能持续增长到几十万 token 的 Agent 而言,这种缓存复用会直接影响吞吐、延迟以及每个 token 的实际成本。

换句话说,Rubin 真正升级的并不只是一颗 GPU,而是一条完整的「token 生产流水线」:从读取长上下文、执行模型,到交换 KV Cache 和 MoE 专家,再到持续生成 token,每一层都会共同决定最终能够服务多少 Agent。

而 NVIDIA 还在进一步拆分这条 token 生产流水线。

就在公布 Vera Rubin Agent 性能测试的同一天,NVIDIA 宣布 Groq 3 LPX 进入全面量产,并将其纳入 Vera Rubin 平台。Groq 3 LPX 被定位为面向交互式 AI 的低延迟推理加速器,它并不是替代 Rubin GPU,而是针对 Agent 推理中另一类计算特征进行专门优化。

大模型推理通常可以粗略分成两个阶段:首先是 Prefill,即读取和处理 Prompt 以及已经积累的大量上下文;随后是 Decode,即模型一个接一个地生成新的 token。

对于拥有几十万 token 上下文的 Agent 而言,这两个阶段对硬件的要求并不相同。Prefill 需要较高的计算能力和内存吞吐,而 Decode 则更加关注单 token 生成延迟和用户能够实际获得的 tokens/s。



因此,NVIDIA 正在开始把不同类型的 Agent 计算分配给不同处理器:Vera CPU 负责模型之外的任务编排、代码执行和数据处理;Rubin GPU 承担大规模模型计算、长上下文以及高吞吐推理;Groq 3 LPX 则进一步针对高交互、低延迟 token 生成进行优化。

第三方机构 Artificial Analysis 在 Gemma 4 31B 模型、100K 上下文测试中,测得 Groq 3 LPX 达到 3431 output tokens/s;NVIDIA 自己的 SPEED-Bench 测试中,其编码任务中位生成速度达到 4767 output tokens/s。

更重要的是,Groq 3 LPX 可以直接与 Vera Rubin NVL72 组合运行。一种方案是让 Rubin 负责 Prefill,再将 Decode 交给 Groq 3 LPX;也可以进一步拆分 Attention 和 FFN 计算,或者让 LPX 承担 speculative decoding 中的 draft model。



这意味着,Agent 背后的计算系统可能不会再由一种通用处理器承担全部工作,而会越来越接近一座异构计算工厂:不同芯片处理最适合自己的计算阶段,再由高速互联、缓存和软件系统把它们组合成一条完整的 token 生产线。



事实上,NVIDIA 目前的 Vera Rubin 平台已经扩展为一个包含多类芯片的系统,包括 Vera CPU、Rubin GPU、Groq 3 LPU、NVLink 6 Switch、BlueField-4 DPU、ConnectX-9 SuperNIC 以及 Spectrum-6 Ethernet。

GPU 仍然位于整个系统的核心位置,但它已经不再独立承担 AI 基础设施的全部竞争任务。

SpaceX 加入:从 AI 工厂走向轨道计算

Vera Rubin 的另一项重要应用来自 SpaceXAI。

NVIDIA 宣布,SpaceXAI 将部署 Vera CPU,用于加速下一代 Agentic AI 应用,包括任务编排、代码执行和数据处理。同时,SpaceXAI 计划基于 NVIDIA Vera Rubin 架构扩展支撑 Grok 的 AI 基础设施,并计划随着计算基础设施继续扩张,向吉瓦级计算容量发展。

据马斯克透露,SpaceX 与 NVIDIA 已经设计了一套针对太空环境优化的 Vera Rubin NVL72 系统,计划于明年第四季度发射进入轨道,并在 2028 年实现更大规模部署。



不过,轨道计算并不是简单把地面服务器搬到太空。太空环境对于计算系统提出了完全不同的要求:有限能源、更复杂散热条件、更高可靠性要求,以及长期无人维护能力。

因此,SpaceX 和 NVIDIA 正在探索如何将 Vera Rubin 架构适配到轨道环境,同时保持统一的软件生态。

AI 基础设施竞争进入 Agent 时代

过去,AI 产业竞争围绕模型展开。谁拥有更强的大模型,谁就拥有优势。但 Agent 时代改变了竞争规则。

当 AI 开始执行长链路任务,计算系统需要同时解决性能、成本、能源效率和任务调度问题。

Vera Rubin 代表的是 NVIDIA 对下一阶段 AI 基础设施的判断:未来的 AI 工厂,不只是训练模型的地方,也将成为大量 Agent 持续运行的计算平台。

而 SpaceX 探索的轨道计算,则进一步拓展了这种架构的边界。从地面 AI 工厂,到未来可能出现的轨道计算节点,AI 基础设施进入到了一个新的阶段。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1952年抗美援朝,美军俘虏了个志愿军伙夫,审了半天才发现,这人竟是失踪14个月的180师最高指挥官之一吴成德

1952年抗美援朝,美军俘虏了个志愿军伙夫,审了半天才发现,这人竟是失踪14个月的180师最高指挥官之一吴成德

磊子讲史
2026-08-25 17:56:04
情况有变!油价调整通知!

情况有变!油价调整通知!

金昌小城大事
2026-08-25 14:32:59
老人被质疑从自助餐厅带出食物,怒而倒空背包自证清白,餐厅回应:已道歉并批评店员

老人被质疑从自助餐厅带出食物,怒而倒空背包自证清白,餐厅回应:已道歉并批评店员

潇湘晨报
2026-08-25 21:00:30
我老公对我真的是生理性喜欢,我俩今年四十五,他每天晚上都要抱着我睡,不是那种敷衍的搭把手,是真抱

我老公对我真的是生理性喜欢,我俩今年四十五,他每天晚上都要抱着我睡,不是那种敷衍的搭把手,是真抱

徐侠客有话说
2026-08-13 11:03:24
到了染胡须的年纪?美媒晒照直言勒布朗真老了 美记:早已前无古人

到了染胡须的年纪?美媒晒照直言勒布朗真老了 美记:早已前无古人

颜小白的篮球梦
2026-08-25 19:45:36
小薰出道21年了!「被冷眼让我更坚强」吐真实心声:谢谢给我机会的人

小薰出道21年了!「被冷眼让我更坚强」吐真实心声:谢谢给我机会的人

ETtoday星光云
2026-08-25 16:11:06
台风“紫檀”在广东省徐闻县沿海再次登陆

台风“紫檀”在广东省徐闻县沿海再次登陆

新京报
2026-08-26 07:12:03
估值130亿美元,Hugging Face为何急着卖身

估值130亿美元,Hugging Face为何急着卖身

陆弃
2026-08-24 14:28:32
记者:利瓦科维奇加盟巴萨后不外租,担任球队二门

记者:利瓦科维奇加盟巴萨后不外租,担任球队二门

懂球帝
2026-08-25 20:49:08
前NBA球员自嘲手机像1942年古董,主播当场送苹果17 Pro Max

前NBA球员自嘲手机像1942年古董,主播当场送苹果17 Pro Max

竞技风云录
2026-08-24 10:23:19
重庆渝中警方:两名行人在嘉滨路88号附近疑似触电,已被送医全力救治

重庆渝中警方:两名行人在嘉滨路88号附近疑似触电,已被送医全力救治

澎湃新闻
2026-08-26 06:26:06
新一轮机关事业单位大清理 , 这6种人员将被辞退 , 多地重拳出击!

新一轮机关事业单位大清理 , 这6种人员将被辞退 , 多地重拳出击!

细说职场
2026-08-25 20:18:37
卡地亚大秀这天!文咏珊干瘪,宋佳瘦脱相,被丰腴的三线小花艳压

卡地亚大秀这天!文咏珊干瘪,宋佳瘦脱相,被丰腴的三线小花艳压

暖心萌阿菇凉
2026-08-24 18:51:55
上海一奥迪女销售请客户吃饭,细节被爆出,父母:脸都被丢尽了

上海一奥迪女销售请客户吃饭,细节被爆出,父母:脸都被丢尽了

红豆讲堂
2025-04-14 12:25:10
乡镇干了26年派出所副所长,马上要退休了,公安部副部长老同学短信:先别退,来北京

乡镇干了26年派出所副所长,马上要退休了,公安部副部长老同学短信:先别退,来北京

户外阿崭
2026-08-26 00:21:04
刚刚!澳洲警员公厕强奸女留学生!当事人:害怕丢掉签证,只能照做...

刚刚!澳洲警员公厕强奸女留学生!当事人:害怕丢掉签证,只能照做...

澳洲红领巾
2026-08-25 15:34:22
他是著名演员,从发病到去世仅20分钟,主持人儿子比他更有名

他是著名演员,从发病到去世仅20分钟,主持人儿子比他更有名

铁锤妹妹是只猫
2026-08-25 20:54:44
人民币涨疯了!汇率又创新高,美元跌了又跌,央行都压不住升值!

人民币涨疯了!汇率又创新高,美元跌了又跌,央行都压不住升值!

快乐彼岸
2026-08-26 01:14:27
马修·麦康纳与伍迪·哈里森新剧预告曝光,9月23日开播

马修·麦康纳与伍迪·哈里森新剧预告曝光,9月23日开播

浅遇时光
2026-08-26 01:36:55
一架美军运输机降落在俄罗斯莫斯科,克宫回应

一架美军运输机降落在俄罗斯莫斯科,克宫回应

环球网资讯
2026-08-25 20:49:06
2026-08-26 08:04:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13843文章数 142725关注度
往期回顾 全部

科技要闻

机器人跑赢博尔特,身体太快,脑子还在追

头条要闻

赴韩遇害中国女生年仅25岁 原计划2天前入职新单位

头条要闻

赴韩遇害中国女生年仅25岁 原计划2天前入职新单位

体育要闻

穆里尼奥如何摆贝林修斯姆巴佩?

娱乐要闻

张韶涵成都演唱会中暑,中途吸氧

财经要闻

宇树科技最低跌破600元 5天缩水超2000亿

汽车要闻

硬派越野+华为智驾 泰钽700上市焕新价24.98万起

态度原创

家居
旅游
艺术
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

“我们脚下的道路通向中国”(我和中国的故事)

艺术要闻

启功手填简历曝光

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

“林肯”号离开中东 留下“一地鸡毛”

无障碍浏览 进入关怀版