随手先关注,不错过每日AI热讯速递
①
英伟达在Hot Chips 2026(全球顶级芯片架构会议,厂商在此公布下一代芯片细节)上首次公布下一代机柜Vera Rubin NVL72的实测数据,并宣布推理加速器Groq 3 LPX全面量产[1][3]。
测试采用SemiAnalysisAgentX基准,运行开源模型DeepSeek V4 Pro,回放真实智能体编码会话[3]。
结果显示:Vera Rubin NVL72 每兆瓦吞吐量(每消耗 1 兆瓦电力能产出的 AI Token 数,衡量算力能效的核心指标)最高达到上一代GB300 NVL7230 倍[1][3]。
每百万 Token 成本最高降低35 倍[1][3]。
传统基准已失效是英伟达反复强调的前提。固定长度 8K/1K 序列的旧测试无法衡量智能体——一次 Agent 任务要读取文件、调用工具、执行代码、循环验证[3][4]。
智能体上下文从 1K-32K 一路涨到100K 甚至 400K[3][4]。
英伟达援引 OpenRouter 数据称,智能体工作负载消耗的 Token 可达简单聊天的15 倍[3]。
![]()
图:英伟达官方新闻稿封面图,Groq 3 LPX 推理机架(来源:[1]NVIDIA 官方新闻稿)
②
30 倍不是芯片速度的 30 倍,而是机架级协同设计的结果。Rubin GPU 采用大容量HBM4内存与第六代 NVLink 全互联架构,配合 NVFP4 量化、Prefill/Decode 分离、KV 感知路由等软件栈优化[4]。
100MWAI 工厂口径下,Rubin GPU 的 NVFP4 推理性能达2 ZFLOPS、训练1.4 ZFLOPS,配备11 PBHBM4 内存与800 PB/s带宽[4]。
同场量产的Groq 3 LPX专攻低延迟 Token 生成:在 Artificial Analysis 测试中,Gemma 4 31B 模型、10 万 Token 上下文下达到每秒3400 个输出 Token[1]。
这是该模型有史以来的最快纪录[1]。
智能体任务响应速度最高为最近竞争平台的4 倍[1]。
黄仁勋称“推理是 AI 的增长引擎”,LPX 把智能体编码任务从小时级压缩到分钟级[1]。AI 云服务商Nebius将成为首家采用 Groq 3 LPX 的云厂商[1]。
![]()
图:英伟达 Hot Chips 演讲中 Rubin GPU 能效规格幻灯片(来源:[4])
③
英伟达同步宣布,SpaceXAI将部署首款为 AI Agent 打造的 CPU——Vera,用于加速下一代智能体应用[2]。
Vera 拥有88 个英伟达自研 Olympus 核心与高带宽 LPDDR5X 内存,最高1.2TB/s内存带宽,相比 x86 CPU 任务完成快最高1.8 倍[2]。
SpaceXAI 总裁Mike Nicolls表示,Vera 提供了执行大量编排、代码与数据处理所需的 CPU 性能与内存带宽,让 GPU 专注本职[2]。
更受关注的是“上天”计划:SpaceXAI 的第一代Starmind AI 卫星将基于优化版 Vera Rubin NVL72 机架系统,把英伟达加速计算从地球数据中心延伸到轨道[2]。
随着 SpaceXAI 向吉瓦级算力扩张,Vera Rubin 平台成为其地面与太空统一的计算架构[2]。
④
数据需要谨慎看待。英伟达公布的 30 倍图表明确标注“非正式结果,待 SemiAnalysis 复核”——测试用的是英伟达选择呈现的第三方基准,独立复现前应视为厂商口径[4]。
当前数据也尚未计入 Vera CPU 对工具调用环节的加速[1][3]。
不过,评价体系的迁移已是明确趋势:硬件迭代重心从“训练更大模型”转向单位能耗有效 Token 产出、单位成本任务处理能力[3]。
对国内算力生态而言,这意味着评价逻辑正在迁移:在电力受限的 AI 工厂中,每兆瓦吞吐量与单位 Token 成本正成为比峰值算力更关键的经营指标[3]。
30 倍吞吐与 35 倍成本下降,你觉得会先改变哪类 AI 应用的商业模式?欢迎在评论区聊聊。
参考来源:
[1] NVIDIA 官方新闻稿:Groq 3 LPX Now in Full Production With World-Class Speed for Agentic AIhttps://nvidianews.nvidia.com/news/nvidia-groq-3-lpx-now-in-full-production-with-world-class-speed-for-agentic-ai
[2] NVIDIA 官方新闻稿:SpaceXAI Adopts NVIDIA Vera CPU to Accelerate Agentic AI at Massive Scalehttps://nvidianews.nvidia.com/news/spacexai-adopts-nvidia-vera-cpu-to-accelerate-agentic-ai-at-massive-scale
[3] 科创板日报:英伟达新一代算力平台补齐拼图 结合DeepSeek模型Token成本可降35倍https://www.chinastarmarket.cn/detail/2463176
[4] ServeTheHome:NVIDIA Vera Rubin NVL72 Rack at Hot Chips 2026https://www.servethehome.com/nvidia-vera-rubin-nvl72-rack-at-hot-chips-2026
欢迎分享、点赞、推荐
一起拥抱AI
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.