来源:市场资讯
(来源:锐捷网络)
2024年,杭州桐庐。
一座投资20亿的数据中心,迎来了一场充满挑战的算力转型。
7月方案定稿,10月设备到货,11月完成验收。从一张拓扑图到千卡集群真正跑起来,留给项目团队的落地交付时间,只有4个月——其中真正在现场调试的时间,不到30天。
![]()
为杭州市重大建设项目、“十四五”数字浙江重点基础设施,金茂云数桐庐算力中心按国家A级、Tier III标准打造,计划落地本地首个千卡规模智算集群,面向云游戏、云渲染、数字孪生、万亿参数大模型训练提供算力底座。
项目核心目标明确:一期落地1024卡算力集群(对应128台高性能计算服务器),长期具备平滑扩容至4096卡的扩展能力,面向头部AI产业客户提供长期算力租赁服务。
客户内部仅具备传统IDC运维团队,他们曾管理过上千个机柜的电力、制冷和布线,但面对一张大规模智算网络拓扑图——IB与RoCE如何取舍、三层CLOS架构如何设计、400G/200G多速率端口如何规划——这些问题的答案,不在该团队的知识储备里。
回望2024年国内市场,完整落地千卡级智算集群的项目数量稀缺,无损网络成套交付门槛极高。这并非金茂云数一家面临的难题——
项目建设周期短、算力性能指标高、业务连续性要求严。
![]()
三重挑战叠加,让每一个智算项目都像是在高压下走钢丝。金茂云数急需一家具备全流程规划、定制化方案、现场落地、产业配套综合能力的网络厂商深度协同。
算力堆上去
不代表能高效跑通大模型
2024年AI建设热潮下,大量机房批量采购高性能算力服务器,却普遍遭遇同一个问题:传统以太网不支持无损传输(即无法保证数据在传输过程中不丢包),多卡分布式训练时梯度同步频繁拥塞、延迟飙升,GPU算力大量空耗,出现"硬件算力充足、训练效率低迷"的行业通病。
金茂云数桐庐项目同样面临这一风险。合作客户对集群的allreduce通信带宽(多卡梯度同步的核心指标,直接影响训练效率)和存储跨云传输稳定性有严苛标准,每一项都必须达标。客户需要的是一套经过大厂业务验证、可落地、可调优的RoCE无损组网方案(在以太网上实现零丢包传输,避免因网络丢包导致GPU空转等待),而非停留在纸面的理论架构。
“你有没有完整落地经验?”
2024 年行业最难答的问题
面对客户这句提问,绝大多数厂商难以给出完整答复。彼时国内千卡智算落地案例稀缺,只有少数提前布局的厂商,沉淀了真实组网、调优、交付实战经验,锐捷便是其中之一。
“客户内部只有传统机房运维人员,完全没有算力网络设计经验,整套方案从架构选型到设备布局都无从下手。”当年驻场交付的工程师回忆道,“我们的售前团队相当于客户专属技术外脑,全程协同梳理整体规划,从顶层架构、设备选型、机房机柜分区到部署节奏,完成了全套落地方案。”
但智算项目的落地,从来不是单靠一套网络方案就能推进的。从算力硬件选型、机房配套落地、后期算力业务运营到AI模型适配,整条产业链任意环节缺少配套资源,都会拉长项目周期。
依托多年深耕算力赛道积累的全链路产业生态,锐捷可向客户开放上下游多元配套资源:联动机房园区、算力租赁平台、AI模型服务商、多规格硬件供应渠道,提供项目共建、算力运营配套等多元合作路径,一站式补齐客户项目全生命周期配套资源缺口。
成熟的算力网络专业能力,叠加覆盖资金、算力合作、机房配套的产业生态资源——这是金茂云数最终选择锐捷的核心原因。
桐庐的4个月,一场高压交付攻坚战
2024 年 7 月,适配高端 AI 训练业务的 AI Fabric RoCE 无损三层 CLOS 方案正式定稿。
整网分层规划:32 台 Leaf、32 台 Spine 训练网承载一期128台算力服务器,64 台 Core 交换机实现横向扩容;存储网配套独立 Leaf/Spine 架构,带内、带外、出口安全网络物理隔离;单服务器搭载多路 400G/200G 高速网卡,整网均衡收敛比设计,原生支持后续扩容至 4096 卡规模。
方案选型阶段同步对比传统 IB 组网,本项目实测同等大模型分布式训练效果下,AI Fabric 整体建设成本仅为 IB 方案的三分之二,同时具备供货稳定、生态开放、运维简单的多重优势。
![]()
纸面方案落地机房,才是真正的考验。锐捷成立30余人跨部门专项保障团队,供应链、研发、售前、现场交付全员协同。受全球芯片周期影响,当年算力交换机元器件供货周期普遍长达数月,项目开通最高优先级备货通道,设备下单后快速齐套出库。10月9日,交换机大批量抵达桐庐机房,现场实施攻坚正式启动。
![]()
![]()
![]()
设备到货当天,团队发现了一个意料之外的挑战:算力服务器与交换机的光模块兼容性问题导致链路反复震荡,网络时断时续。问题排查需要时间,但项目交付deadline不会等人。
那段时间,谁都不敢说‘再等等’。”交付团队负责人回忆,“每耽误一天,客户业务上线就晚一天,验收节点也往后推一天。没有试错空间,必须一次过。”
团队连夜做了三组不同光模块的交叉测试,确定了一套临时替代方案,同时紧急协调原厂备件。3天后,稳定方案落地,链路震荡问题彻底解决。
同期更多技术难题同步爆发:
算力网、存储网、带内外多网并行配置调试;
存储链路需要打通跨域高速专线,路由、VPN、安全策略反复迭代;
布线规划、存储端口容量不足等问题接连出现。
交付团队分两班驻场,依托自研「小锐云服」自动化工具批量下发配置、一键巡检400G光模块误码、批量调整拥塞水线,累计输出30余份标准化实施文档,前后迭代12版拓扑。同时15名研发专家远程支撑,将原定10天的性能调优周期压缩至5天。
10月9日设备到货,不足30天完成上架、联调、压力测试。11月5日项目顺利通过合作方验收,满足业务运行标准。在2024年算力硬件供给紧张的大环境下,这样的交付效率尤为难得。
![]()
![]()
![]()
从 2024 千卡样板到 2026 全场景适配
方案持续迭代进化
站在 2026 年回看,千卡集群已是行业常规建设规模,万卡、十万卡成为主流需求,但桐庐项目沉淀的整套落地体系价值长期不变。
项目落地期间积累的三层CLOS标准化拓扑、多网分区规划、端网协同调优参数、自动化批量交付流程,全部转化为锐捷智算标准化落地底座,全国各大智算项目均可复用这套成熟实施体系。
桐庐项目之后,锐捷接触了更多客户需求——有的只需要千卡规模快速上线,有的直接要求十万卡级别的长期扩展能力。同一套架构能不能同时覆盖?研发团队从桐庐的经验出发,重新思考产品定义。两年间,方案持续迭代升级:
![]()
组网矩阵迭代:从单一 AI Fabric 架构,升级为 AI Fabric+Flexforce 双产品线,同时适配中小千卡集群与十万卡超大型智算园区;
运维工具迭代:由早期批量配置工具,升级为Rocket 全链路智能监测平台,自动识别、收敛海量集群告警,大幅降低长期运维人力投入;
交付与供应链升级:搭建多型号算力设备备选供应机制,缓解行业芯片、硬件供货周期波动问题;
技术调优体系完善:沉淀 RGCCL 通信库、ECN 动态调优、多路径负载均衡算法全套端网协同优化方案,适配各类大模型训练业务。
从项目经验到服务产品:
AIGC智算“规建优维”一站式服务
桐庐项目的成功交付,让锐捷意识到:客户需要的不仅是产品和技术方案,更是一套从规划到运维的全生命周期服务能力。
基于桐庐项目及后续众多智算项目的实战经验,锐捷正式推出了AIGC智算“规建优维”一站式服务解决方案。这套服务体系覆盖智算中心建设的四个核心阶段:
规划:整网规划设计、机房环境工勘、整网互联规划、设备配置规划。
建设:线缆模块与网络设备部署、服务器上架、设备配置调试。
优化:GPU服务器与网络设备联合调优,端网协同性能优化。
运维:整网运维托管、设备维保、专业技术团队支撑、智能化工具平台全栈监控。
![]()
从桐庐到全国:
上百家客户的共同选择
时至今日,从桐庐起步的这套CLOS RoCE无损网络架构,已累计服务上百家头部AI企业、运营商、区域IDC服务商,覆盖千卡至十万卡算力建设场景。
![]()
这些项目的技术底座,都可以回溯到桐庐——那个从零开始、用4个月跑通的项目。
如果您正在规划智算中心
若你正在筹备智算中心新建或扩容,正为网络技术路线选型、交付周期、集群性能调优反复论证,金茂云数桐庐样板项目可提供完整的落地参考。
欢迎联系锐捷网络,了解AIGC智算“规建优维”一站式服务解决方案,领取AI Fabric智算中心完整方案资料,也可预约销售团队上门拜访交流。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.