公众号记得加星标⭐️,第一时间看推送不会错过。
传统云基础设施的设计初衷是用于可预测的通用工作负载和标准接口。而智能体人工智能工厂则将各种用户、代理、应用程序、数据源和存储系统连接起来,以每台服务器数太比特带宽实现大规模加速计算,因此专用的DPU处理对于线速网络、存储和安全至关重要。NVIDIA正在推出Scale-In网络基础设施,这是NVIDIA AI网络的第五大支柱,旨在为智能体人工智能工厂提供专用的加速功能,以保障其安全、管理和运行。
Scale-In 将南北向网络演进为 AI 工厂构建一个协调的基础设施域。Scale-In 由NVIDIA BlueField-4和NVIDIA DOCA提供支持,并通过NVIDIA Spectrum-X 以太网连接,可加速保障整个 AI 堆栈安全运行的服务,并在整个 AI 工厂内传输应用程序、数据和存储流量。专用的、独立于主机的处理能力使这些基础设施服务摆脱了主机 CPU 的束缚,从而有助于防止安全性、数据访问和运维在 AI 计算规模扩大时成为瓶颈。最终,随着需求的增长,用户可以获得更安全、更高效的共享 AI 基础设施,并持续访问 AI 服务和数据。
本文探讨了 BlueField-4 架构,并解释了 Scale-In 如何为智能 AI 工厂提供安全访问、高性能数据移动、租户隔离、更简单的操作和更可预测的性能。
规模化加速南北人工智能工厂基础设施建设
人工智能工厂在不同规模下有着不同的基础设施需求:
规模化:NVIDIA NVLink将 GPU 连接成一个统一的加速器。
横向扩展: NVIDIA Spectrum-X 以太网和NVIDIA Quantum InfiniBand连接 AI 工厂中的服务器。
跨域扩展:NVIDIA Spectrum-XGS 以太网连接分布式 AI 工厂。
上下文内存:NVIDIA CMX是基于NVIDIA STX模块化基础构建的 AI 原生存储,可在工厂内提供共享的 KV 缓存存储。
规模化: NVIDIA BlueField-4、NVIDIA DOCA 和 NVIDIA Spectrum-X 以太网加速了 AI 计算相关的访问、安全、数据传输和基础设施运营。
南北向网络提供数据中心的进出路径,将用户、应用程序、数据源、存储系统和服务连接到各个系统。传统的云数据中心围绕软件定义基础设施、可组合性和弹性构建这些网络,以便根据需求变化配置和扩展资源和访问权限。
智能体人工智能提高了对基础设施的需求。软件定义网络、可组合性和弹性仍然至关重要,但它们已不再足够。人工智能工厂将海量加速计算与不断增长的用户、智能体、应用程序、企业数据源和存储系统整合在一起,所有这些都在持续且大规模地进行交互。
基础设施必须加速建设,并作为人工智能工厂的一部分进行协同设计。安全性、多租户网络、数据和存储访问以及基础设施运维不能仅仅依赖于运行在通用主机 CPU 上的软件,也不能作为独立管理的层级运行。这些功能必须作为一个统一的基础设施域协同工作,使运维人员能够对整个人工智能工厂的访问、数据传输、安全性、资源配置和可观测性进行一致的控制。
Scale-In 通过将南北向访问演进为 AI 工厂内统一、加速的基础设施域来满足这些需求。BlueField-4 提供与主机无关的加速和卸载功能,DOCA 提供用于编程和运行基础设施服务的统一模型,而 Spectrum-X Ethernet 则在 Scale-In 访问路径(包括外部存储和数据源)上提供高性能以太网连接。它们共同为运营商提供对支持加速计算和数据存储的基础设施的访问、数据传输、安全性、资源配置和可观测性的一致控制。
![]()
AI 工厂依赖于互补的存储基础设施来存储持久化数据和推理上下文。Scale-In 提供对 AI 原生存储的高性能访问,包括用于训练、推理和分析的 AI 工厂存储,以及用于检索和多模态索引的企业级 AI 数据系统。此外,CMX 为工厂内部共享的键值缓存和可重用的推理状态提供 pod 级存储。BlueField-4 既是 Scale-In 的基础设施处理器,也是 CMX 的数据和存储处理器。Scale-In 将 AI 工厂和企业数据连接到 AI 计算,而 CMX 则负责保存和共享上下文,以实现更快、更高效的推理。
这五大基础设施支柱共同满足了人工智能工厂各个环节的不同需求。只有当数据访问、存储、网络安全和运维能力也随之扩展时,扩展GPU、机架和数据中心才能真正发挥价值。
BlueField-4 为可扩展基础设施提供支持
BlueField-4 可加速 GPU 服务器、代理 CPU 系统、AI 工厂存储系统和云服务中的横向扩展 (Scale-In) 服务。在NVIDIA Vera Rubin NVL72中,NVIDIA ConnectX-9 SuperNIC通过横向扩展网络承载租户工作负载流量,而 BlueField-4 则运行并加速连接、保护和管理每台服务器的基础设施服务。BlueField-4 为运营商提供了一个独立于租户主机的基础设施处理域,运营商可以在其中管理安全策略、服务状态和遥测数据,而无需依赖主机 CPU 或消耗其资源。
NVIDIA BlueField Astra将可信控制从南北向访问扩展到东西向横向扩展架构。Astra 为服务提供商提供了一个统一的、独立于主机的控制点,用于跨两个域进行配置、租户隔离和网络策略管理。BlueField-4 负责安装和更新策略并监控遥测数据,而 ConnectX-9 则直接在数据路径中强制执行这些策略。这种闭环架构可在横向扩展和横向接入之间实现一致的控制,而无需在租户主机上部署设备管理。
BlueField-4 将可编程控制平面处理与加速数据通路处理相结合。软件负责制定基础架构决策,而内联引擎则在本地执行这些决策,无需将工作返回给主机 CPU。这种设计使得策略能够在整个工厂内协调一致,并以线速在本地执行。表 1 总结了主要组件如何支持这种处理模型。
![]()
与 BlueField-3 相比,BlueField-4 的内存带宽提升了 4 倍,网络带宽提升了 2 倍。这种额外的容量支持更多并发服务、更大的策略和遥测数据集,以及更高的流量处理和安全吞吐量。
NVIDIA DOCA 程序缩放服务
NVIDIA DOCA 将 BlueField-4 的硬件加速器转化为可编程且可部署的 Scale-In 服务。生产就绪的容器化 DOCA 微服务可以直接在 BlueField-4 上运行,而 DOCA 库和 SDK 则为开发人员提供了加速的网络、安全、存储和遥测功能,以用于自定义服务。DOCA Flow 对硬件数据包处理管道进行编程,DOCA PCC 支持可编程拥塞行为,DOCA Telemetry 提供设备和服务运行状况信息,而 DOCA 平台框架 (DPF) 则负责管理配置、部署和更新。BlueField-4 的多服务架构和原生服务功能链可引导每个流量流按所需顺序经过相应的服务。这些功能为 Scale-In 提供了一个统一的软件模型,用于在 BlueField-4 系统上运行服务,而无需管理单独的服务器管道。
NVIDIA Spectrum-X 以太网连接 Scale-In 架构
NVIDIA Spectrum-X 以太网为横向扩展访问路径(包括外部存储)提供高性能架构。BlueField-4 在每个系统上处理基础架构服务,而 Spectrum-X 以太网则承载 AI 工厂与其周围的用户、应用程序、数据源、服务和外部存储之间的流量。Spectrum-X 以太网可大规模解决负载均衡冲突和拥塞问题,提高资源利用率,有助于保持高有效带宽,并隔离并发流量,从而使访问和存储流获得更一致、更可预测的性能。
BlueField-4 DPU、DOCA 微服务和 Spectrum-X 以太网是与 NVIDIA Vera Rubin 共同设计的,旨在确保处理器性能、内存带宽、PCIe 连接、网络带宽、加速和软件能够协同工作。它们共同提供了一条可扩展的路径,能够处理传输、服务处理和控制,而不会占用分配给 AI 工作负载的资源。
智能体人工智能工厂的关键规模化应用案例
智能体人工智能工厂必须安全地共享加速的基础设施,为其提供企业数据,确保系统上线运行,并持续监控性能。以下用例展示了 BlueField-4 加速和 DOCA 服务如何满足这些生产需求。
构建独立的AI工厂虚拟私有云
AI 工厂虚拟私有云 (VPC) 在共享的物理基础设施上隔离租户和应用程序流量。DOCA 基于主机的网络 (HBN) 加速了 BlueField-4 上的南北向三层路由和多租户隔离。DOCA Flow 对流量进行分类和访问控制规则编程,而 DOCA 加速的 Open vSwitch (OVS-DOCA) 则在东西向接口上应用相应的策略。BlueField Astra 将相同的 VPC 策略扩展到东西向横向扩展接口,因此一个策略模型即可同时管理访问流量和横向扩展流量。
在 Vera Rubin 数据中心,这种协调模型覆盖了 7.2 Tb/s 的总接口带宽,包括南北向 BlueField-4 路径上的 800 Gb/s 带宽,以及每个计算托架上的四条 1.6 Tb/s 东西向路径。这确保了接入流量和横向扩展流量的策略一致性,而无需将所有东西向流量都路由到 800 Gb/s 接口。运营商集中配置隔离的 AI 工厂 VPC,而租户则继续使用加速的架构。这种架构提供了类似云的弹性、一致的隔离性、更低的宿主机 CPU 开销,以及更高效的共享 AI 基础设施利用率。
在硅芯片中加强安全
BlueField-4 将安全策略执行点置于硬件中,而非主机操作系统内部。租户软件无法禁用或绕过这些控制措施,同时,卸载的安全处理流程可以节省主机 CPU 资源,避免额外的软件跳转。BlueField-4 能够以线速加速威胁检测并强制执行网络、文件和对象访问策略。DOCA Argus 提供运行时威胁检测,DOCA Vault 强制执行文件访问策略,而 DOCA Flow 则负责线速网络策略的执行。BlueField Astra 协调每台服务器上不同网络的加密、隔离和策略。Astra 能够跨南北和东西向流量同步策略、遥测数据、密钥和策略执行,从而将特权安全控制置于租户主机之外,为共享 AI 服务提供一致的保护,并为 AI 工作负载保留主机资源。
加速存储访问
Scale-In 将 AI 计算与来自外部存储的训练数据、模型资产、企业知识和应用程序数据连接起来。如果存储协议处理、存储虚拟化或数据移动速度跟不上,即使拥有可用的计算能力和 Scale-Up/Scale-Out 网络带宽,GPU 也只能等待数据。
BlueField-4 可加速基于 RDMA 和 TCP 的 NVMe-oF、文件和对象存储协议、存储虚拟化以及专用基础设施上的数据传输。Spectrum-X 以太网在整个存储路径上提供 AI 优化的以太网架构,其拥塞管理和性能隔离功能有助于在并发存储流中维持高有效带宽,存储吞吐量比标准以太网高出 1.45 倍。这降低了主机 CPU 开销,有助于保障 AI 计算资源,并为训练、检索和推理提供更一致的企业数据访问。此外部数据路径与 CMX 相辅相成。
![]()
运行人工智能工厂控制平面
AI 工厂节点必须先完成配置、部署、安全保护和连接,才能运行 AI 工作负载。BlueField-4 负责节点上线、网络和存储资源配置、服务器启动以及通过网络加载主机操作系统。由于此控制平面独立于主机运行,因此它会在租户软件启动之前建立策略并配置资源。DOCA 平台框架是一个 Kubernetes 原生编排框架,它以 Kubernetes 节点的形式配置、管理和扩展 BlueField DPU。它负责管理整个 AI 工厂的 DPU 发现、配置、服务部署和更新。这缩短了部署时间,提高了配置一致性,节省了主机 CPU 资源,并能更快地将新的 AI 容量上线。
观察并优化人工智能操作
大规模运行 AI 工厂需要持续监控网络流量、存储访问、服务运行状况、性能和资源利用率。DOCA 遥测技术收集这些信息并将其导出到网络监控平台,而 DOCA 库则使可观测性提供商能够将相同的基础设施信号集成到他们自己的工具中。通过 BlueField-4 收集遥测数据,运营商可以保持独立于租户主机软件的可见性。当基础设施遥测扩展到 GPU 和网络利用率时,运营商可以识别与访问、流量、存储、策略执行或工作负载部署相关的限制。这种全集群可见性有助于检测异常、定位瓶颈并在事件影响 AI 工作负载之前将其解决。
Scale-In 将扩展计算转化为 AI 工厂性能
Scale-In 将南北向网络演进为一个协调、加速的基础设施域,用于数据访问、安全和运维。NVIDIA BlueField-4 提供网络加速、DOCA 程序运行和服务运维,而 Spectrum-X Ethernet 则在 Scale-In 的访问和存储路径上提供高效带宽和性能隔离。它们共同将扩展计算转化为安全可靠的 AI 工厂平台。
(来源:编译自英伟达)
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
今天是《半导体行业观察》为您分享的第4510期内容,欢迎关注。
加星标⭐️第一时间看推送~
求推荐
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.