训练和推理前沿模型,网络问题已经和算力问题同等重要。在训练过程中,全归约和全对全这类集合通信操作需要同步数千个加速器,最慢的一次传输会拖慢整个任务的节奏。哪怕只是很小的网络摩擦,也会直接造成大量算力闲置。
本周,Meta 推出了 MetaRoCE。按照官方描述,这是一套从零设计的 RDMA 传输协议,专门面向运行在通用以太网上的 AI 负载。它的核心假设与标准 RoCE 完全不同。
标准 RoCE 要求网络按顺序交付每一个帧,依赖 PFC,并且不鼓励数据包喷洒。而数据包喷洒恰恰能在多平面和大规模网络中带来性能优势。MetaRoCE 反其道而行之:它把网络视为有损环境,把排序、路径选择和恢复都下沉到网卡里完成。Meta 将通过开放计算项目(OCP)发布协议规范、参考软件实现和合规测试套件。
现在能部署吗?
还不能。相关成果可能在 2026 年 10 月发布。Meta 或许会在 2026 年 OCP 全球峰会上放出 MetaRoCE 规范、面向 DPDK 优化的软件参考实现,以及生产级合规框架。硬件支持还处于早期阶段:Meta 已经在 AMD Pensando 可编程网卡上完成了验证,其他厂商的实现也在推进中。目前这还只是一个网络架构层面的决策,不是采购层面的决策。
问题在于:网络看到的是数据包,网卡看到的是意图。
Meta 已经把集群扩展到跨多个数据中心和区域的数十万个 GPU。在这个规模下,网络处在每一次训练步骤的关键路径上。全归约和全对全这类集合通信操作需要同步数千个加速器,最慢的一次传输决定整个任务的进度。
标准 RoCE 是瓶颈所在。它要求网络按顺序交付每一个帧,依赖 PFC,并且不鼓励数据包喷洒。MetaRoCE 把这个逻辑颠倒过来:智能被移到端点,网络被分解成许多细粒度的逻辑路径,每条路径都有自己的实时遥测数据——包括逐路径 RTT、ECN 状态和利用率。
这一设计直接建立在 Meta 2024 年的大规模 RoCE 工作以及更广泛的基础设施演进之上。
六个关键设计决策
- 乱序交付成为默认行为:数据包被喷洒到多条路径上,天然会乱序到达。每个数据包都携带自己的目的地信息,因此数据落地时可以直接写入最终内存位置——没有重排缓冲区,也没有队头阻塞。发送操作会匹配到已提交的接收缓冲区,所以即使前面的消息还没到达,当前发送也能正确落位。
- 多路径是原生能力:每条路径使用不同的 UDP 源端口作为 ECMP 熵,网卡可以随时改变端口,把流量从故障路由上移开。由于每条路径独立维护自己的窗口和往返时间估计,传输状态不会互相干扰。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.