当算力扩张走到靠堆卡已经越堆越亏的拐点,华为这次发布Peerium,本质不是又出一款加速卡,而是换一套计算机的生成规则。
9月17日发布的这套架构,目标是把百万级处理器在逻辑上合并成单一整机,而不是一堆独立服务器靠网络互相凑活。
在所有人都把资源砸在单卡算力、机柜内互联的时候,直接动冯·诺依曼和主从集群的根基,是行业里非常少有人敢选的路。
![]()
为什么行业主流都在堆卡,堆着堆着就走不通了?
过去十几年AI扩容的默认套路,就是以加速卡为中心,卡不够就加卡,节点不够就加节点,柜内高速互联、柜间走交换网络分层拼接。
这个方案在千卡规模还好用,一旦摸到十万卡,结构性浪费会直接吞掉绝大多数新增算力。
业界公开数据里,十万卡集群的有效算力利用率大多只有两成,绝大多数时间芯片不是在算,而是在等数据同步、跨节点转发、调度握手。
问题不出在单卡算力,而是传统架构从根上就是为顺序执行、单机主从、分离内存设计,天然把每台机器锁在独立地址空间里。
![]()
跨节点访问内存要走完整网络协议栈、打包转发、远端取回,同步开销随集群规模非线性暴涨,AllReduce这类核心通信操作占比越来越高。
同时这条路线天然把强扩展锁死在机柜内部,也就是常成提到的不出柜困境。
电互联稳定低时延,但传输距离卡死在几米内,想跨机柜做同等级直连就触物理天花板;纯光互联能拉远距离,200G光模块年化故障率是电连接十倍,可靠性又扛不住大规模集群。
我觉得堆卡路线已经走到边际收益断崖,再往上堆,投入翻几倍,有效算力涨不动,钱都花在通信等待和冗余备份上。
为什么非要做到百万处理器成为一台计算机?
不是为了做一个噱头级规模数字,是大模型、长上下文、Agent原生工作负载已经长出了旧容器装不下的需求。
![]()
万亿以上参数模型、MoE、持续推理、海量Agent调度,要的不只是更多FLOPS,而是巨大的共享内存池、低开销全局寻址、分层递归并行,以及CPU/NPU/异构算力平等调度。
Peerium给出的解法拆成三件事:嵌套并行对应Nested BSP新编程模型,替代传统主从BSP做任务分层递归拆分;统一内存寻址让百万处理器共享同一个全局地址空间;全节点平等互联彻底拿掉主控-从属层级。
不再是一堆机器跑分布式软件假装协同,而是从系统层面对外呈现为一台更大的计算机。
灵衢UnifiedBus是整套架构能成立的互联底座,作为开放高速总线直接平等连接CPU、NPU、内存、SSD、网卡与交换机,把过去分开的PCIe、IB、存储网络合并成一套可跨柜扩展的统一互联。
![]()
把单机边界往外推到百万处理器,本质是去解决利用率、通信开销、异构调度、内存墙这几个堆卡绕不开的核心矛盾。
把百万处理器做成一台计算机,技术难度到底有多大?
它不是单点升级,是从物理互联、协议层、内存模型、编程范式、硬件芯片到软件生态的全栈改造,难度分层非常清晰。
第一层是互联与光电融合的物理工程难度,也是最显性的一关。
要把总线语义从机柜内延伸到跨机柜、大规模集群,还要兼顾电互联的低时延高可靠、光互联的距离扩展,不能拆成两套割裂协议,还要控制光模块、交换机数量、故障率和功耗,等于重做整个超节点互联体系。
![]()
华为为超节点配套开发了十多颗互联、存储、计算类专用芯片,灵衢协议本身也是为统一内存对等访问设计,不是在现有TCP/RoCE上小修小补。
第二层难度在内存模型和Nested BSP新并行范式。
跨百万节点做真正的统一内存寻址、内存一致性、故障域划分、分层同步,和传统分布式集群靠软件模拟共享内存完全不是一回事。
传统BSP是单一层级批量同步,放到百万规模同步爆炸,Nested BSP靠嵌套分层递归组织并行任务,匹配超节点-集群的层级结构,这是计算范式层面的新增东西,同时还要兼容现有大模型训练推理负载平滑迁移。
第三层是软硬件生态、编程工具、调度、故障恢复、编译适配的隐性难度,也是周期最长的部分。
![]()
推翻沿用几十年的主从集群习惯,让开发者面向单一大整机思维写程序,而不是面向分布式节点写程序,同时还要兼容原有业务、迁移工具链、验证大规模下的MTBF、容错、增量扩容。
单做一个能点亮的原型不难,做成可部署、成本可控、25万卡级别稳定运行的产品集群,才是绝大多数团队跨不过去的坎。
单卡、单柜、万卡集群大家或多或少都能摸到,完整做到统一寻址+对等互联+嵌套并行+跨柜光电强扩展,目前只有这一条公开路线。
统一成一台机之后,到底改变了什么实际体验?
最直观的变化是跨卡跨柜访问的语义变了,远端资源不再是网络对端节点,而是全局地址空间里的普通内存页。
![]()
很多过去要专门做分片、通信编排、缓存搬运、角色拆分的分布式代码,可以大幅简化,MoE All-to-All、KV Cache池化、Agent弹性调度、大模型长上下文这些通信密集场景收益最明显。
当然这不代表所有场景都适合百万级单整机,很多业务依然可以拆成独立分区运行,Peerium是提供了往上走的新选项,替代不了所有传统集群。
它真正划开的分界线,是算力竞争从单卡参数竞赛,转入系统架构、互联、内存模型、编程范式的底层竞争,华为继续加油!
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.