很长一段时间里,数据中心的设计遵循着一套几乎不容商量的优先级排序:确保系统在任何条件下都可用、有韧性且表现可预测。就像支撑这些设施运转的电网一样,数据中心被设计成无论发生什么——即使个别组件出现故障——都能提供高度一致的服务。这意味着运营商会在电力、冷却和网络基础设施中层层叠加冗余。
但人工智能的出现改写了这套故事脚本。当各类组织都在竞相大规模铺开AI工具时,数据中心行业正逐渐认识到:并非所有工作负载都对基础设施提出同样的要求。训练一个大语言模型、跑实时推理、支撑企业应用、处理事关业务成败的关键交易,这几个任务对底层基础设施施加的压力完全不同。InfraPartners的联合创始人兼CTO分享了他的看法。
![]()
如今一个数据中心不再需要对每一种用途都提供同等水平的服务。业界越来越清晰地看到,设施既可以保持灵活性,也能够针对特定负载需求量身定制。
历史上,“五个九”的可用性没有商量余地。数据中心传统上支撑着银行、应急网络和面向客户的数字服务等系统,这些系统要求持续可用。在停机会带来极端冲击的环境里——大至巨额财务损失,小至把真实的人命置于风险之中——这种设计思路完全成立。由于运营商此前无法总是精准预判哪些应用真正属于关键任务级别,许多设施干脆默认按照最高的韧性标准来建造。
但AI让情况变得不一样了。“大锅饭式”的冗余不再必要。不同的模型、训练过程和推理过程各自需要截然不同的服务级别。比方说,用于AI训练负载的设施,正在被设计成不配备备用发电机、不搭建复杂冗余系统、也不追求高层级架构的形态。
一个值得注意的好现象是,行业对AI训练所需环境和AI推理所需环境之间的区分,理解正在加深。训练设施越来越多地被布置在任何能拿到电力的地方。此时此刻真正的约束条件变成了能源供给、冷却能力和部署速度。很多场景下,把计算密度拉满、把交付时间线压缩到最短,远比追求最高级别的冗余更为重要。
推理基础设施则呈现出一套完全不同的优先级排序。这些工作负载往往被部署在离用户更近的地方,支撑着人们日常交互的服务。在这些场景下,时延、可用性和客户体验的重要性显著上升,这就为保持韧性提供了远为充分的理由。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.