公众号记得加星标⭐️,第一时间看推送不会错过。
Meta 对大规模计算并不陌生,其日活跃用户超过 35 亿,并拥有世界顶尖的人工智能实验室之一。将如此庞大的用户数据传输到所需位置绝非易事,需要多种网络、拓扑结构和互连方式的巧妙结合。在 Hot Interconnects 展会上,Meta 的顶级网络专家之一 Omar Baldonado 分享了一些构建支持公司庞大运营所需的各种网络的技巧。
在日前于圣何塞举行的 IEEE 2026 年热门互连研讨会上,Meta 数据中心和 AI 网络高级总监 Baldonado 发表了主题演讲,概述了 Meta 使用的三种主要互连类型——向上扩展(scale up)、向外扩展(scale out)和横向扩展(scale across)——以及如何充分利用它们的一些建议。
“13年前我刚加入Facebook(现在的Meta)时,我们的基础设施预算是数百万美元,我们的电力规模是兆瓦级的,”Baldonado说道。他负责管理开发和运营Meta数据中心网络的团队,以支持社交媒体平台以及开发Llama(一种流行的开放权重前沿模型)的人工智能实验室。
“但大约六七年前,我们开始专注于人工智能专用网络,这才真正推动了速度的提升,”他说道。“我从2019年开始见证了这一变化,现在数百万变成了数十亿,兆瓦变成了吉瓦。而我们现在开始以泽巴为单位来衡量性能了。”
Meta 的 AI 训练集群规模在此期间显著增长。几年前,最大的集群最多拥有约 32,000 个 GPU(或等效于 Nvidia H100 的 GPU,这是 Meta 的首选指标)。2024 年,该公司推出了迄今为止规模最大的集群:拥有 129,000 个等效于 H100 的 GPU。到 2025 年底,Meta 的集群中已拥有 130 万个等效于 H100 的 GPU。该公司仍计划在 2026 年底前上线其 1GW 的 Prometheus 超级集群,并在未来几年内推出 5GW 的 Hyperion 超级集群。
让所有这些计算变得易于访问、可靠且高效是一项极其艰巨的任务。巴尔多纳多的工作就是让这一切看起来很容易,即使事实并非如此。
“如果你看看构建这套系统所需的网络和所有基础设施,你会发现它包含很多组件,规模非常庞大,”巴尔多纳多说道。“用户们都希望网络能像一个无限端口、无限带宽、零延迟的交换机。你把所有东西都插上去,GPU、CPU 和存储设备就能正常工作。但显然这并非现实,但这却是他们想要的。我们在处理 AI 工作负载时所做的所有网络工作,都是为了实现这个目标。但其中也存在一些妥协。我们必须考虑到物理学、技术、光速和经济性等因素。但这才是我们的最终目标。”
Scale Up
纵向扩展系统本质上就像一台独立的计算机,由一个操作系统控制所有硬件,通常跨越一个或多个机架。由于众多处理器连接在一起,构成一个共享内存的大型统一计算引擎,因此纵向扩展系统的互连必须速度极快、延迟极低。
![]()
一些要求极高的应用需要可扩展系统,包括LLM训练、传统的高性能计算工作负载(如建模和仿真)以及内存分析。Meta拥有多种运行Nvidia和AMD GPU的可扩展系统,主要用于训练AI模型。
“低延迟是关键因素,因为工作负载的某些部分需要以低延迟完成单独的矩阵乘法和张量并行计算,”巴尔多纳多说。“这是人工智能作业中最紧凑的计算循环,他们希望它零延迟运行。”
巴尔多纳多表示,将规模化网络的选型以及规模化网络本身的设计与特定的目标应用联系起来至关重要。“任何从事规模化工作的人都必须认真思考你的目标应用领域,”他说道。
巴尔多纳多表示,扩展网络所需的技术、供应商和设备都在不断变化,这使得制定三到五年的规划变得困难。“如果你在做研究或开发产品,你必须了解机架上其他设备的情况,”他说。
Meta 已投资于以太网扩展网络 (ESUN),这是一项开放计算项目 (OCP) 技术。
Scale Out
当您的工作负载规模超过纵向扩展网络的处理能力(通常铜缆网络的传输距离约为 5 米,如果使用硅光子技术,传输距离可能会更长),您可能需要迁移到横向扩展系统。这类系统为了应对最大的工作负载,牺牲了单一操作系统带来的稳定性。
传统上,横向扩展系统承载着人工智能、大数据和高性能计算领域规模最大的机器集群。Meta 构建了两个 32K 横向扩展集群,采用了英伟达的 InfiniBand 互连技术。Baldonado 表示,这些集群用于训练 Llama3 模型。之后,Meta 将其 129k GPU 集群的互连方式改为以太网。
巴尔多纳多说,Meta公司曾一度乐于使用大型机箱交换机(例如Arista 1700或Cisco 8000)来构建小型集群。“你可以把很多GPU连接到一台交换机上,而且运行效果相当不错,”他说道。“所以有一段时间,我们中的一些人都在思考,是否应该只用一台交换机连接128、256甚至512个GPU来构建小型集群,因为这台交换机能够为其所有端口提供非常稳定且高性能的性能。”
巴尔多纳多表示,Meta并没有采用传统的基于背板信用的逻辑,而是将其拆分并整合到一个大型架构中,该架构被Meta称为“解耦调度架构”(Disaggregated Scheduled Fabric,简称DSF)。这使得Meta能够运行来自Nvidia和AMD的各种AI加速器,以及其自主研发的MTI芯片。
他说:“在处理横向扩展和连接人工智能系统时,你会发现需要进行大量调整,才能了解如何才能最大限度地发挥该架构的性能。但鉴于这种架构 DSF 就像一个巨大的背板,这让我们更容易引入这组异构加速器。”
Baldonado表示,切换到专用后端网络的决定对Meta扩展其AI训练工作负载的能力起到了至关重要的作用。
![]()
“早在2020年初,我们就决定建立一个独立的后端AI网络,主要目的是为了能够快速迭代AI系统,并利用现有的大量带宽,”他说道。“因此,RDMA后端网卡的速度通常已经接近其极限,而AI系统对带宽的需求远高于前端计算架构和计算网卡的需求。这就是我们采用这种分离式架构的原因。”
巴尔多纳多还谈到了数据中心架构如何影响网络设计和拓扑结构。理想情况下,您应该确切地知道需要哪些工作负载、数据中心将使用哪些处理器、网络需求是什么,以及随之而来的电力和散热要求。
“但你无法确定何时才能获得所需的加速效果,而且随着时间的推移,情况也会发生变化。所以我们最终决定尽可能地为这些面料提供更多选择,”他说道。
构建横向扩展网络以满足特定工作负载的需求,需要考虑诸多变量。您使用的是哪些ASIC芯片供应商?交换机的基数是多少?如果您要构建多层网络,它有多少层?或者您要构建的是一个扁平化的多平面网络?您如何进行负载均衡?如何处理网络故障?
“这正是Meta公司大力推进FBOSS交换机网络操作系统开发的原因之一,”Baldonado说道。“因为尤其是在如今的AI架构中,我们可以精确地对交换机ASIC进行编程,从而获得我们所需的功能,无论是为了提升性能还是为了调试,并且能够在横向扩展架构上快速迭代。”
![]()
Scale Across
如果您的工作负载规模超过了单个数据中心甚至特定地理区域内多个数据中心的能源或处理器容量,则您需要升级到跨网络扩展。
这个限制并没有一个明确的界限。超过几百米(这是 InfiniBand 和 RoCE(基于融合以太网的 RDMA)所能处理的极限)之后,通常会被降级为跨域扩展(尽管一些 RoCE 系统可以处理远至 50 公里的距离)。
这种权衡取舍与从纵向扩展转向横向扩展时的情况类似:随着延迟的增加,一致性会进一步降低。另一方面,这可能是处理一些最庞大任务的最佳方式,例如训练包含万亿个参数的模型,这类任务需要消耗巨量的能源——远超单个数据中心的供电能力。
![]()
对于 Meta 而言,计算类型的多样性比跨域网络涉及的距离更为重要。
“异质性才是跨尺度传输真正要解决的问题,”巴尔多纳多说。“有时人们想到跨尺度传输,只想到距离,这固然是一个重要因素。但你必须真正思考你连接的是什么,你连接的距离,你连接的带宽,这些都会非常多样化。”
例如,Prometheus 超级集群实际上是由多个数据中心组成的集合,其中一些数据中心采用液冷基础设施,而另一些则采用风冷。
“你试图连接的每个区域的容量都不一样,”巴尔多纳多说。“从逻辑上讲,这些区域之间的拓扑结构是怎样的?……它们在这里都是完全连接的。但是,区域之间是否存在生成树?在我的跨区域扩展中,区域之间需要多少冗余?所以,各个层面的情况都非常复杂:距离、带宽、技术。”
Meta拥有部分自有数据中心,同时也租用第三方数据中心以及全球各地云服务提供商的空间。凭借其在跨域网络方面的专业知识,Meta能够确保这些数据中心之间的无缝连接。
Baldonado表示,随着网络规模的扩大,工作安排和工作安置问题会变得更加复杂。
“生命总会找到出路,对吧?”他说道。“我想这句话出自《侏罗纪公园》。我在这里喜欢说的是,工作总会找到合适的岗位。所以,如果我是一名研究人员,我在某个地区拥有5000个GPU,然后我得知,嘿,那边还有30000个GPU——他们总会找到办法把它们连接起来,开始使用。”
巴尔多纳多和他在网络领域的同事们不喜欢研究人员这样做。他们没有预料到人工智能工作负载会以这种方式、在这样的距离内遍历系统,而且他们无法提供在纵向扩展或横向扩展级别上能够提供的保证。
巴尔多纳多表示,了解工作负载对于所有类型的网络都至关重要。这意味着要在生产环境中对工作负载进行测试和基准测试,以确保其不会超出网络的处理能力。他指出,随着新的智能体人工智能工作负载上线并对网络提出新的要求(例如维护键值缓存),这一点尤为重要。
“归根结底,我们只是想提供网络,”他说。“这种按规模扩展、横向扩展和纵向扩展的思路是一种思考方式。它实际上就是这样运作的。作业在网络上运行,而运行地点并不重要——它们期望网络能够正常工作。”
![]()
(来源:编译自hpcwired )
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
今天是《半导体行业观察》为您分享的第4506内容,欢迎关注。
加星标⭐️第一时间看推送
![]()
![]()
求推荐
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.