![]()
在改变整个世界之前,先重塑底层基础设施——这几乎是每一次技术革命的主旋律。作为ICT底座的中流砥柱,数据中心网络在潮起潮落间不断变换角色定位。
古早的IDC发轫阶段,网络在数据中心里主要发挥“连通管道”的作用,与计算、存储各自独立演进;到了云计算大行其道的时期,虚拟化技术加快资源池化进程,数据中心网络必须承担起更多职责,但依然是“穿针引线”的辅助角色。
伴随人工智能变革迈向纵深,Agentic AI逐步替代对话式AI占据主流地位,多轮超长上下文推理飞速发展,单任务存储数据量级从百GB攀升至TB级,KV-Cache与算卡传输量提高5~8倍。这造成传统样本面网络易发生拥塞,出现明显的“算等存”现象,对数据中心网络的综合能力提出前所未有的高要求。
不难看出,数据中心网络已成为AI算力释放的关键载体,算网存能否协同演进堪称Agentic时代的核心议题。更为重要的是,当海量的智能体深入工作流程,业务可靠性的权重变得越来越高,为最大限度减少发生链路闪断或丢包问题,数据中心网络必须做到7×24小时不间断稳定运行;当GPU从千卡扩展到万卡,传统CLOS组网两层变三层,会带来设备数量与网络成本激增,数据中心网络亟需优化拓扑结构,完成举重若轻的华丽转身。
![]()
这就像一首交响曲,算网存协同的主题贯穿始终,高效率、高可靠的配乐声部水乳交融,数据中心网络有望谱写Agentic时代的新乐章。但伟大的作品不会从天而降,需要躬身前行的卓越实践。在近日举办的华为全联接大会2026上,全新升级的星河AI数据中心网络方案重磅亮相,面向智算场景的星域超融合架构备受瞩目,全球首发100T UBG灵衢+RoCE双模交换机CloudEngine SF9300系列以及全自研100T/51.2T NPO数据中心智算交换机CloudEngine XH9300系列颇为吸睛——算力满载、业务永续的数据中心网络落地生根,“欢乐颂”的歌声渐行渐近。
第一乐章:以架构创新破解算网存协同难题
“欢乐颂”的第一乐章是以弦乐的震音起步,从混沌中慢慢升华,提出整部交响乐的核心矛盾,铺就全曲的宏大叙事框架。
![]()
这与数据中心网络在Agentic AI时代谋求突围的路径选择高度相似。面对存储数据量的几何级数增长,“算等存”的瓶颈亟待突破,数据中心网络要达成KV数据低等待、高吞吐的预期目标,必须抓住算网存协同进化的主要矛盾,打破传统存算分离架构迫在眉睫。
正是在这样的背景下,星河AI数据中心网络开创性地推出星域超融合架构,将高吞吐网络从计算节点延伸至存储节点,实现NPU直通、存算一网承载,从根本上化解数据搬运痛点,KV带宽提升8倍;同时,基于算网存一体化协同能力,促进Token生产效率提高15%~20%,TPS性能比存算分离架构增强5.8倍。
网络整体架构的实质性跃迁,离不开算法创新的鼎力支撑。在算网协同方面,交换机通过AI-CM端网协同拥塞控制算法,不仅可反馈拥塞问题,还能判断拥塞程度,将剩余的队列带宽反馈到源端,源端网卡根据获得的带宽大小发送数据进行精准控速,长尾时延降低逾20%,为Agentic AI进入生产环境创造了必要条件。
尤值一提的是,星域超融合架构注重算网存一体化突围,既要打通算网协同的“堵点”,也要清除网存协同的障碍。借助AI-QoS存储全业务调度算法,交换机可识别大数据量流量并做优先调度,实现整个任务的流量“几乎同时到达”,使KV读取时间FCT降低30%,大幅压缩“算等存”的时间,驱动数据中心网络充分释放AI算力,为企业生产力的跃升保驾护航。
第二、三乐章:探索兼顾降本增效与高可靠性的最优路径
经过了第一乐章的主题定调之后,“欢乐颂”的第二、三乐章进入漫长的权衡与求索阶段,在节奏动力与旋律表达之间不断校准声部强弱,以克制简约的配器承载厚重情感。
![]()
打破坚冰的数据中心网络同样需要应对接踵而至的诸多挑战。如果说算网存协同演进有效化解了KV-Cache传输拥塞、算力等待存储的困境,那么面对大规模集群建网带来的成本激增和智能体推理场景对高可靠的迫切需求,华为星河AI数据中心网络又该如何探寻多重诉求的平衡之道?
根据行业研究机构的测算,网络设备投入占AI集群建设总额的比例已超过20%,且集群规模越大,网络成本会呈现超线性上升;与此同时,Agentic AI多步链式推理任务的完成效果,依赖于每一步成功率相乘,网络的微小故障或链路抖动都可能使损失数倍放大。
显而易见,数据中心网络需要在降低成本、提高效率、增强可靠性等维度找到最佳平衡点,UBG灵衢+RoCE双模交换机SF9300系列由此应运而生。其可灵活搭载昇腾A5、A6,践行全栈UB算网一体解决方案,使数据中心网络成为Agentic AI加速落地的超级引擎。
对行业客户而言,降低AI集群的建网成本是首要任务。SF9300系列通过极简的两层多平面架构,达成十万卡组网规模,省去传统三层结构中的核心层,大幅减少交换机级联跳数和光模块数量,建网成本直降30%。更重要的是,全栈UB实现Scale UP、Scale Out协议统一,突破昇腾单集群千卡组网瓶颈,支撑各种AI负载顺畅运行。
在降本增效的基础上,提高数据中心网络的可靠性刻不容缓。SF9300系列基于独家LLR链路层重传能力,在出现故障时快速感知并做到微秒级重传,无需等待上层超时,链路故障下业务0丢包;十万卡集群全年业务损失时间减少100 小时,显著增强大型智算集群的可靠性。此外,SF9300系列还借助灵衢实现协议统一降低端到端时延,将时延从20微秒降至11微秒,使数据“零等待”直达算核,为AI智能体施展身手铺平了道路。
第四乐章:让下一代智算网络的梦想照进现实
“欢乐颂”的第四乐章对过往的冲突、挣扎和矛盾进行了复盘,随后一层层叠加乐器,不断变奏、升华,最终以独唱、四重唱与宏大合唱递进的方式,描绘未来世界的美好图景。
![]()
当数据中心网络以架构创新达成算网存协同进化的目标,并构筑起高效率、高可靠的坚实底座,探索Agentic时代的更多可能自然成为新的追求。NPO架构作为下一代智算网络的关键前沿技术,其发展走向备受关注,星河AI数据中心网络率先交出了答卷。
在华为全联接大会2026上,全自研100T/51.2T NPO交换机CloudEngine XH9300系列惊艳登场,可适配不同规模AI集群的建网需求,为客户打造业界领先的数据中心光互连底座。这一系列新品堪称Agentic AI时代的开路先锋,在互联功耗、转发时延、运维效率等维度树立起新的标杆。
首先,其采用光源集约化设计,每个3.2T OE光引擎可替代4个800GE光模块,互联功耗整体降低40%;其次,受益于NPO近封装架构,芯片到OE互连电缆长度由18cm缩短至约5cm,电路损耗降低,免去oDSP信号处理环节,转发时延降低26%;最后,基于创新可插拔卡扣结构,支持OE光引擎现场拆装更换,故障发生时可就地快速排障,将设备维护效率提升10倍。
就像“欢乐颂”以合唱的方式抵达巅峰,谱写下一代智算网络的新乐章也需要更多力量的参与。华为星河AI数据中心网络将与伙伴们携手前行,共同攀登AI变革的下一座山峰。
作者关健,《IT创事记》合伙人、主笔:曾任《电脑商报》常务副社长兼执行总编、《中国计算机报》助理总编。
他长期关注科技产业动态及趋势,与逾百位高科技公司领导者进行过对话,亦在众多科技会议与论坛中担任嘉宾主持。
![]()
—— 越看越精彩 ——
【IT创事记】聚焦于企业级科技生态、策略及商业知识。你可以在各主流媒体平台看到IT创事记的同名文字专栏和【IT创事记·短视频】专栏。如果你有相应的内容希望分享,记得在公众号留言告诉我们。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.