NVIDIA CEO 黄仁勋(Jensen Huang)曾将 AI 比喻为一个五层蛋糕——由能源、芯片、基础设施、模型和应用组成。构建前三层的产业组织本周正在 AI Infra Summit(AI 基础设施峰会)上集中展示。历时九年的盛会,今年参会人数比去年翻了一倍以上,AI 热潮和基础设施建设的规模达到了前所未有的高度。
![]()
自 2022 年 11 月下旬 ChatGPT 惊艳亮相以来,几乎每一天这场热潮都在刷新我们的认知。Gartner 给出了一个扎实的定量方式来理解这种增长:2.7 万亿美元。这是 Gartner 预计 2026 年全球用于构建这个五层蛋糕的支出总额,比去年惊人的增长了 50%。
仅仅 15 年前,整个全球 IT 行业的规模约为 8250 亿美元( Gartner 数据)。2015 年达到约 1.14 万亿美元,2020年得益于云计算支出的激增翻倍至 2.5 万亿美元(这些数字未计入通信领域,通信传统上占据比硬件、软件和服务更大的份额)。而在短短四年间,新兴的 AI 业务已经超越了整个全球 IT 行业。
AI 服务未来巨大需求的预期,正推动企业今天大规模投资于芯片、服务器、网络、设备和云容量——尽管面临内存芯片短缺、数据中心引发的社会不满以及对 AI 本身的质疑等负面影响。
![]()
Gartner 杰出副总裁分析师John-David Lovelock 表示:“AI 数据中心建设,是人类有史以来最大的基础设施项目。”
AI Infra Summit 是为期三天的盛会,集中展示 AI 芯片、内存、网络、电力和冷却领域的最新技术。换句话说,这是硅谷心脏地带硬件爱好者的天堂。NVIDIA 的 Ian Buck、Google Fellow Dave Patterson 和 Intel 的Lip-Bu Tan 等重量级人物在主题演讲中分享了他们的见解,来自数百家供应商和企业的专家则跨越四个主要专题——计算、数据移动、AI 数据中心、数据与模型——分享了他们的洞见。
大会的一个共同主题是技术栈的解耦。客户将无法依赖单一供应商(如 NVIDIA)提供完整的 AI 硬件解决方案。自主智能体的兴起将焦点推向了为 AI 推理构建最佳系统——这需要多样化的芯片和系统组合,以及充足的网络、电力和冷却支持。
在题为「为 AI 工厂供料:大规模解决数据移动、内存和存储瓶颈」的专场中,HPE 副 CTO 兼 HPE Labs副总裁兼总监 Andrew Wheeler 将构建 AI 基础设施比作建造超级计算机。“我认为我们在构建大规模 HPC 系统中学到的很多经验——构建那些大规模缓存一致性系统——我们已经将大量这些组件和方法应用到如今的 AI 工作中。从 HPC 的角度来看,一切都关于紧耦合和高吞吐量。”
AMD 架构与策略企业副总裁Robert Hormuth 表示,与生态组件的紧耦合——包括20 到 30 个不同的开源计算项目(OCP:Open Compute Project)——体现在该公司今年早些时候发布的 Helios 机架系统中。“Helios 的需求简直超出了预期。”Hormuth 说。“我认为是因为我们不只是把一堆开放组件扔出来说'大家自己搞定'。我们与合作伙伴以及作为解决方案组成部分的其他芯片供应商协作,进行了全面优化,最终让用户获得完全集成的解决方案。”
![]()
大量芯片供应商参加了此次大会:除了 NVIDIA、Intel 和 AMD 等家喻户晓的名字,还有 SambaNova、Rebellions、Qualcomm、d-Matrix、FuriosaAI、Tenstorrent、HyperAccel、SiMa.ai 和 Dnotitia 等厂商。
随着 AI 热潮的展开,数据移动的重要性正在重新受到关注,这在 AI Infra Summit 上表现得非常明显。互连制造商 Cornelis Networks 宣布通过推出 Active Compute Fabric 进入 scale-up 领域。Delos Data 也在展会上发布了一系列支持多种协议、fabric 和网络架构的下一代 NIC。
硅光子技术(silicon photonics)在 AI Infra 上无处不在,这项技术似乎已准备好在铜缆走到尽头之处接棒。Lightmatter CEO 兼创始人 Nick Harris 谈到了他的公司如何将硅光子集成到机架网络中。Harris 在与 AMD 和 HPE 的专场讨论中表示:“在当下这个时刻——摩尔定律走到尽头、Dennard 缩放走到尽头——计算的未来,一切都在于网络。我们要做的就是确保向光学的过渡顺利进行,让人们知道如何构建这些系统,知道如何真正部署这些东西。”
随着硅光子技术的兴起,有可能出现堪比目前正在经历的 NVMe 短缺的产品短缺。“所有人都在谈论 HBM 以及内存如何影响系统架构,”Harris 说。“我有个新消息要告诉你们。激光器供应、光纤——这些也将对你们的工作产生巨大影响。”
![]()
电力和冷却也是 AI 工厂的重要投入,AI Infra Summit 上相关专场座无虚席。在题为「从挑战到机遇:重新思考 AI数据中心的电力」的专场中,讨论小组成员对巨大的电力需求、电网连接审批的缓慢以及需要更高效利用可用电力表示忧虑。TransGrid Energy 业务拓展副总裁 Terrill Laughton 表示:“我认为五年后我们会回头看——为什么我们当时不能更快推进?为什么我们没有清除这些障碍?”
Dell'Oro Group 研究总监Alex Cordovil 在题为「市场展望:过去 12 个月告诉我们未来 24 个月的走向」的专场中讨论了 AI 数据中心建设的电力和冷却问题。几年前,大多数能源分析师预计到本十年末美国每年将新增 10 GW 的电力容量。但这些预期已经发生了巨大变化。“这是一个庞大的数字,”他说。“到本十年末,每年将新增 40、50 甚至 60 千兆瓦(GW)。”
闭环冷却系统已成为常态,这将消除人们对数据中心饮用水消耗的大部分担忧。但对于许多运营商来说,管理闭环系统是一个全新的挑战。Cordovil 说:“学习曲线很大,需要理解如何维护、如何检修。我们很多在数据中心工作的技术人员,以前不需要讨论化学、讨论腐蚀问题。所以需要重新回到课堂学习很多东西。”
![]()
说到基础设施本身,AI Infra Summit 今年吸引了 8500 名参会者,是去年的两倍多。人流给 Santa Clara 会议中心造成了巨大压力。明年的 AI Infra Summit——也就是大会十周年——将迁往几英里外更大的圣何塞 McEnery 会议中心。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.