![]()
黄河下游约800公里的河道,被切分成米级网格。水流、泥沙和河床演变,由计算机一遍遍推演。“十米级可能还是可以叫算得动;到了米级,就是原来不可想象的问题。”曙光8000应用优化总负责人卜景德在央视纪录片《超级工程》中说。
![]()
近日,央视大型纪录片《超级工程——曙光8000》热映。镜头从黄河水沙模型转到数字孪生脑、万亿原子模拟,再到全球5公里分辨率的气象预报——问题只有一个:十万张计算卡,究竟怎样一起干这些活?
一张卡可以独立完成的任务有限。十万张卡共同处理一个问题时,计算单元必须持续交换中间结果;数据晚到一步,先完成工作的卡就要等待。存储供数跟不上、网络出现波动、任务调度失去节奏,都会让账面上的算力停在纸面上。纪录片用了一个形象的比喻:这像十万名桨手同时划动一艘巨型龙舟。船能走多快,不只取决于每个人的力气,还取决于他们能否保持同一个节奏。
这也是曙光8000更值得观察的部分。
十万卡提供了规模,但把分立的设备耦合成一个系统,靠的是另一种能力:让计算、互连、存储、供电、散热和软件调度保持同一个节奏。
卡越多,越考验系统工程
原因并不复杂。大模型训练会把任务拆给许多计算单元,它们需要频繁同步参数;科学计算则可能在很长时间内持续交换高精度数据。卡的数量越多,通信关系越复杂。
![]()
纪录片里有一个不太起眼的细节:曙光8000AI超集群主任架构师钟于义爱好古典音乐,他形容自己想让芯片间的数据通信,达成一种“完美的交响”。
“信号在高速网络中的传输会发生错误,这是一个概率性的事件。”曙光8000AI超集群高速互连网络总架构师万伟说,“再小的错误,也会被庞大的基数放大成不可避免的问题。”在十万卡和大量高速链路同时工作的环境里,小概率故障会变成系统必须日常处理的问题。
因此,从万卡走向十万卡,增加的不只是一个零,而是系统复杂度。竞争也由芯片的“单兵作战”,转向计算、存储、网络和软件的“体系作战”。科研人员真正需要的,不是一张更快的卡,而是一套能让大量计算单元长期协同、稳定完成任务的系统。
超节点由此成为一个关键概念。如果把传统集群理解为许多独立房间,卡与卡交换数据,往往需要反复“出门、上路、再进门”;超节点则把一组计算单元组织进更紧密的空间,通过高带宽、低时延的Scale-up互连,让它们先像一台计算机一样工作,再通过Scale-out网络继续扩大规模。
![]()
纪录片第一集里,曙光8000AI超集群系统结构设计师阳欢从古建筑斗拱中获得启发。曙光8000的单个节点要把多达9层部件装进不足9厘米的空间,高密度排布虽然缩短了数据传输距离,也带来结构形变、接口对位和信号质量等难题。“斗”负责承重,“拱”负责连接,不同零件各司其职,再组合成一个稳定整体。
这不是对古建筑外形的模仿,而是一种结构方法的迁移。它揭示了超节点的工程本质:首先是整机工程,而不是板卡拼装。结构、互连、散热和供电必须共同设计,才能让高密度算力长期稳定运行。
![]()
曙光8000将这种系统方法推到了十万卡规模。超1万个计算节点不再是各自运行的孤岛,而是被组织成一套能够协同工作的系统。
40卡,连接更多需求
不过,大多数企业并不需要、也无力建设十万卡集群。它们面对的是一个更现实的问题:模型已经大到单卡放不下,训练和推理也需要多卡协同,但传统超节点的采购、部署与运维门槛仍然太高。
![]()
3月26日,北京中关村。scaleX40在这里首次亮相,瞄准的正是这段市场空隙——它采用标准19英寸箱式设计,在一个系统中内置40张AI加速卡,并支持40卡Scale-up全互连。曙光把40卡称为兼顾性能收益与投入成本的“甜点区”:规模足以承接大模型训练、高通量推理和智能体应用,又不必一开始就进入大型集群的建设逻辑。如果曙光8000解决的是“把分立设备耦合成一个系统”,scaleX40要解决的,就是让企业用更低的门槛,买到同样的“耦合”能力。
这里更值得关注的仍不是一串峰值数字,而是产品试图解决的问题。超过5TB的总显存,面向的是“模型太大、单卡放不下”;40卡聚合带宽超过17TB/s,面向的是多卡通信中的等待;无线缆正交对接,则试图减少复杂布线带来的故障点和维护负担。外部看到的是40张卡,产品真正出售的却是40张卡之间的协同关系。
需要厘清的是,scaleX40并不是曙光8000的缩小型号,二者面向不同规模和用户。它们的相通之处,是都把问题从“拥有多少卡”转向“怎样组织这些卡”:一个回答十万卡基础设施如何运行,另一个回答企业如何以较低门槛获得高密度协同算力。
但超节点从“能买”到“能用”,中间还隔着数据、软件和运维。
企业采购超节点之后,模型需要迁移,任务需要调度,数据需要持续送入,故障发生后还要恢复。缺少这些能力,再强的硬件也可能变成昂贵而忙闲不均的资源。
这也是scaleX40之外,ParaStor存储与SothisAI平台被放进同一套方案的原因。ParaStor负责让数据及时抵达计算单元,避免“算力在等数据”;SothisAI覆盖训练、推理、调度和运维,处理部署、监控、断点续训与故障恢复。简单地说,scaleX40把算力聚起来,ParaStor把数据送到位,SothisAI让任务跑起来,并持续跑下去。
这套组合面向的并不只是训练一个更大的模型。金融机构的智能投研和风险控制,需要同时处理大量实时请求;科研与教育机构希望获得更容易部署的高密度计算能力;行业智能体则把训练、推理、工具调用和数据处理放进同一条工作流。它们关心的共同问题,不是某个参数能否刷新纪录,而是系统能否稳定交付结果。
128核,不只是多了几个核心
不过,AI超节点并不是曙光计算产品的全部。scaleX40用40张加速卡回答大模型训练、推理和智能体应用中的多卡协同;另一边,新一代通用高性能计算平台以国产通用CPU为核心,面向的是气象、工业仿真、生命科学和材料计算等高精度科学与工程计算。
![]()
这套平台最醒目的数字是128核:单颗CPU拥有128个核心,FP64双精度理论峰值约10T。但它的价值并不只是“核数更多”。原生兼容x86、支持AVX-512,意味着不少已经成熟的科学计算软件不必推倒重来;用户过去积累的软件、流程和工程经验,也能更平滑地延续。
与超节点一样,128核也不是一颗芯片的独角戏。HPC-Kit负责软件优化,ParaStor和scaleFabric分别承接数据供给与高速互连;从2U风冷服务器到冷板、浸没式液冷机柜,平台再把这种能力扩展到不同规模。外部看到的是128个核心,产品真正要交付的,仍是一套能够稳定运行的计算系统。
如果说scaleX40解决的是“怎样把一组AI加速卡组织起来”,新一代通用高性能计算平台解决的,就是“怎样让国产CPU真正承担高性能计算”。一边是超节点,一边是高性能计算,两条产品线面对的任务不同,背后的方法却相通:不只提供芯片,而是组织算力。
从40卡超节点到128核通用计算平台,产品形态不同,指向的却是同一件事:把芯片能力变成稳定可用的系统能力。
从这个角度看,央视纪录片提供的并不只是一场超级工程的展示。它把一个正在发生的产业变化放大到了足够清晰的尺度:当计算规模持续增长,真正稀缺的开始从单颗芯片,转向组织算力的能力。
十万卡怎样一起干活,答案并不只在十万张卡里,而在如何把它们耦合成一个系统,并让它们稳定服务于真实任务。当这种系统方法被装进标准机柜,超节点也就从纪录片中的技术主角,变成更多企业可以部署的计算基础设施。
![]()
—— 越看越精彩 ——
【IT创事记】聚焦于企业级科技生态、策略及商业知识。你可以在各主流媒体平台看到IT创事记的同名文字专栏和【IT创事记·短视频】专栏。如果你有相应的内容希望分享,记得在公众号留言告诉我们。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.