大模型跨过万亿参数后,AI算力竞争正从“谁的芯片更强”,转向“谁能把成千上万颗芯片真正拧成一台机器”。
作者声明:该图片由AI生成![]()
超节点,不是简单把卡堆起来
所谓“超节点”,不是把大量 GPU 塞进机房就结束了。它要把计算、存储、网络、调度软件、供电和散热整合起来,让分散的芯片像一台超级计算机那样协同工作。
真正难的,是芯片之间如何高速通信、共享内存、稳定调度。系统做得好,算力利用率可显著提升,网络带宽也能翻倍;做不好,再多芯片也会在等待数据、通信堵塞和故障中空转。
比的已不是单颗芯片参数
今年上海世界人工智能大会上,华为、壁仞、曙光、中兴等厂商集中展示超节点和超集群方案。华为的 Atlas 950 SuperPoD 以64卡机柜为基础,最高可扩展至8192张卡;中兴展示的方案称可支持16384张 GPU;曙光则展示了10万卡级的国产芯片超集群。
这意味着国内 AI 基础设施竞争,正在从单颗加速器性能,转向互连、软件栈、存储、散热和整机可靠性的系统能力。
作者声明:该图片由AI生成![]()
电和光,两条路都很难
目前的互连路线大致分成电互连和光互连。前者通过更紧凑的架构缩短信号传输距离;后者则尝试把光引擎推近芯片,用更低功耗支撑更高带宽。
光互连仍多处于原型和早期部署阶段。它的想象空间很大,但从实验室走到大规模稳定运行,中间还隔着成本、封装、维护和软件调度等多道门槛。
算力瓶颈不会被一键解决
超节点能把更多国产芯片组织起来,为训练超大模型提供新的路径,也有助于缓解先进芯片供应受限带来的压力。但它并不能自动消除算力短板。
一套系统的前期设计成本可能超过1亿元,单个原型机也可能达到数千万元。网络调度平台往往需要一年多优化,等系统跑顺,硬件迭代又可能已经开始。高密度机柜还会逼着数据中心升级供电和液冷能力,800V 高压直流供电、液冷系统都逐渐成为刚需。
不是所有人都需要“巨无霸”
超节点适合训练万亿参数模型、天气预测等重型任务,但并非所有 AI 应用都需要上千张卡。医院做特定影像分析,可能只需要几张卡;训练内部模型,也未必需要万卡集群。
AI 算力的下一轮竞争,拼的不只是把机器做大,而是把系统做得更稳、更省电、更容易用。谁能让大量芯片真正高效协作,谁才有机会把“纸面算力”变成可持续的生产力。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.