昨日,在2026世界人工智能大会(WAIC)上,阿里云正式发布灵骏真武 M890 超节点实例,以超节点形态,为客户提供高速互联、开箱即用的 64 卡算力单元。这是阿里云首次通过公共云对外提供超节点形态的AI算力服务,目前已在乌兰察布地域开放邀测。
![]()
阿里云弹性计算产品线负责人吴结生表示
“Agent 时代正在重新定义基础设施的形态,‘单一领域的优化’已经无法满足AI应用的大规模、高性能、持续更新的需求。真正的答案是把数据中心中的芯片、服务器、网络、存储、基础设施软件凝聚成一个整体,提供一台能训练、能推理、能被开箱即用的‘AI超级计算机’。”
灵骏真武M890超节点实例支持 FP8/FP4 低精度计算,通过 ICN Switch 1.0 芯片Scale-up 互联规模由 16 卡拉升至 64 卡,卡间互联提升至 800GB/s。在智能驾驶、具身智能等训练场景中,相比上一代真武810E,其训练性能提升三倍;同时,凭借超大显存与全对称高速互联,一台超节点实例即可承载十万亿参数级 MoE 大模型的推理。日前,灵骏超节点实例现已于乌兰察布地域开放邀测。
![]()
依托 HPN 8.0 训推一体高性能网络架构,智算灵骏单集群最高支持 13万卡异构算力混布,支持PD分离部署需求,并可进一步扩展至百万卡级;同时,通过实例故障主动监控、分钟级故障自恢复与 99.7% 的平均可用性,让算力真正被用在训练本身。前端网络使用CIPU 2.0 ,增强稳定和安全能力,加速数据传输和存储访问。在存储侧,阿里云基于飞天盘古对高性能并行文件存储 CPFS 进行全栈重构,采用数据面与控制面分离、原生水平扩展,单文件系统支持百 PiB 容量、百 TB/s 吞吐与亿级 IOPS。
从网络、存储到平台的全栈优化与创新,才是释放 Token 生产力的关键。网络层推出专为 Token 性能设计的 TPN,同时承载 PD、AF 之间的通讯以及 KVCache 与云服务访问,存储层新发布 KVCacheStore,满足百万QPS与千亿级 KV 的存储规模,平台层 PAI-EAS TokenWorks 提供模型部署和推理的平台服务,开箱即用,让模型上线缩短至几十分钟,并提供立体化SLO保障。面向自建推理,阿里云同步提供基于容器 ACK的推理解决方案。
![]()
面向Agent场景,阿里云以CIPU结合虚拟化提供MicroVM级安全隔离沙箱环境,每分钟可并发拉起10万个沙箱、单区域支撑百万级,深度休眠使成本下降60%。同时发布AgenticFS,为百万级Agent提供独立安全的存储空间。
从超节点到万卡集群,从存储、网络全栈自研到Agent运行优化,阿里云正以全栈创新的姿态持续革新AI Native基础设施。
来源:阿里云公众号
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.