7月19日消息,未来图灵在2026世界人工智能大会现场获悉,华为昇腾950超节点(Atlas 950 SperPoD)真机首次在2026世界人工智能大会公开亮相,成为全场焦点。这台业界最大规模超节点将1024张NPU卡高速互联,“像一台计算机一样工作”,直指万亿至十万亿级参数大模型的训练与推理需求。
要理解这意味什么,得先看当前大模型对算力的饥渴。大模型竞争已从“拼参数量”升级为“拼思维链长度”——模型不仅要大,还要能处理超长上下文、支持多步推理。传统计算集群跨服务器通信时,数据需要“打包、运输、拆包”,延迟动辄数十微秒,千亿参数模型的并行计算中,大量算力空转等待数据。
![]()
超节点要解决的,是传统架构中跨服务器通信的瓶颈——数据在节点间频繁“打包、运输、拆包”,延迟动辄数十微秒,算力空转等数据。昇腾950通过华为自研的灵衢互联协议,将物理上分离的1024张NPU卡在逻辑上融合为“一台计算机”。
这台“计算机”具备三项核心能力:超大带宽、超低时延,以及最关键的一项——256TB全局统一内存编址。所谓统一内存编址,指的是超节点内所有NPU共享同一个地址空间,任一处理器可直接读写远端内存,无需经过传统的“序列化-网络传输-反序列化”流程。通俗讲,不管数据存在哪块卡上,所有卡都能当自己的内存直接访问,真正实现“One NPU”级别的协同。
把1024张卡当一张卡用,带来的不是简单的速度提升,而是模型训练方式的范式变化。在大模型训练场景,结合统一内存编址,长序列训练时全局Batch Size可大幅提升,无需频繁跨节点保存和重分布参数。在RL后训练场景,Rollout生成的Token流可直接通过超节点内部纳秒级注入训练端,打破传统“推理等训练、训练等推理”的同步阻塞。在低时延推理场景,单卡推理性能相较传统服务器提升3倍,千亿参数模型权重可全部驻留在节点内,Decode请求直接命中内存,避免了KV Cache跨节点迁移的巨大延迟。
除了液冷版950,华为还展示了Atlas 850E风冷超节点,无需改造现有IDC机房即可直接部署,支持96卡商用规模,将超节点技术送进了普通数据中心。
商用数据印证了超节点并非实验室展品。昇腾384超节点已规模商用750多套,落地互联网、金融、制造等行业,国内唯一训练出SOTA级模型的超节点。本次WAIC昇腾集中展出了20多个行业标杆案例,覆盖60多种真实业务场景。
生态层面,昇腾CANN已全面开源,社区月活跃开发者突破3500人,日均代码下载量6万次。华为同步将研发经验沉淀为技能包开源,推出面向开发者的全流程自动化工具,降低创新门槛。在大会同期,全球计算联盟与鹏城实验室联合发布《超节点定义与实践白皮书》,中国首次在这一领域建立自主产业标准。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.