算力圈都知道,大模型训练最吃显存和带宽,谁能解决内存瓶颈,谁就能拿下AI算力市场话语权。就在AMD Advancing AI年度大会现场,苏姿丰直接亮出行业重磅新品,全球首颗2nm制程GPU Instinct MI455X正式登场,也是AMD目前综合性能拉满的旗舰AI加速器。
![]()
很多从业者此前一直蹲守AMD新一代CDNA架构芯片,上一代MI355X跑超大模型时,多并发推理很容易出现显存溢出、吞吐量拉胯的问题。这颗MI455X直接完成代际升级,从底层架构到制程工艺全部重做,彻底解决前代算力、内存两大短板。
更重要的是,MI455X采用芯粒拆分的Chiplet方案,没有把所有电路塞进单一晶圆。负责核心AI计算的计算芯粒,直接用上台积电2nm先进工艺;缓存、通信配套芯粒搭配3nm工艺,再通过2.5D、3D封装整合24颗独立芯粒,兼顾性能与量产良率。
芯片内部塞满3200亿颗晶体管,相比上代MI355X晶体管规模提升70%,硬件基础直接拉满。架构层面升级到全新CDNA 5,直接砍掉前代依赖的超大Infinity缓存,替换成单颗96MB的独立L2缓存,总缓存带宽是上代缓存聚合速度的3倍,数据读取不用反复调取主机内存,跑模型加载速度更快。
单卡标配432GB HBM4高速显存,这个内存规格放在当前所有AI加速卡中优势明显,比竞品主流高端方案显存容量高出50%。简单说,百亿参数大模型、多模型并发微调时,不用拆分多张显卡分摊参数,单卡就能完整容纳模型权重与KV缓存,减少多卡互联带来的延迟损耗。
![]()
显存理论带宽冲到23.3TB/s,是上一代MI355X的2.9倍,海量文本、图像数据流传输不堵车。AI训练推理最常用的低精度算力提升幅度更夸张,MXFP8峰值浮点算力20 PFLOPS,MXFP4峰值算力40 PFLOPS,两类主流精度算力全部达到上代的4倍,跑轻量化推理、批量数据预处理速度直接翻倍,告别长时间等待算力输出。
在主流开源大模型DeepSeek-V3的运行测试中,MI455X的Token生成吞吐量对比MI355X拉开巨大差距,最高能冲到上代的34倍。换算成落地成本优势更直观,单次Token生成的硬件开销,最高能压缩到原先的1/18,企业搭建AI推理机房,同等算力规模硬件采购、电力损耗成本大幅下降,中小AI团队也能负担超大模型线上部署。
不少算力从业者会疑惑,单纯纸面参数强,实际集群协同表现会不会拉胯?AMD配套推出Helios专用AI机架,单台机架最多可搭载72张MI455X,全部显卡实现统一算力调度,72卡集群总HBM显存容量突破31TB,同规格竞品机架显存总量仅有20.7TB,差距一目了然。
这套完整算力方案不止单卡性能领先,软硬件全栈配套同步完善,搭配Zen6架构2nm EPYC处理器、800G高速以太网,从CPU、GPU到网络传输全部针对AI负载优化,不用额外搭配第三方硬件做适配,开箱就能搭建超大规模训练集群。
放在当下AI算力赛道来看,MI455X的发布直接打破现有高端加速卡的市场格局。此前高端AI算力市场长期被竞品产品垄断,多数企业搭建算力机房没有太多备选方案,硬件采购议价空间极小。这颗全球首款2nm GPU MI455X落地后,大模型厂商、云服务商拥有全新高性能硬件选择,算力市场竞争加剧,长期来看会持续压低行业算力租赁价格,对所有AI从业者都是利好。
对于普通开发者、中小AI工作室而言,这颗芯片带来的改变同样直观。以往本地部署70B、百亿参数大模型,至少需要多块高端加速卡堆叠,硬件投入动辄几十万;MI455X凭借超大单卡显存,单卡即可流畅运行超大模型,小型工作室搭建本地训练环境的硬件门槛大幅降低,普通人做AI模型微调、本地对话机器人开发不用再受硬件限制。
从行业技术发展维度来看,MI455X作为全球第一颗落地商用的2nm GPU,标志着AI加速器正式迈入全新制程时代。此前数据中心GPU最高仅用到3nm工艺,2nm制程首次落地AI加速卡,意味着未来高端算力芯片会持续往更小制程、更高晶体管密度方向迭代,后续模型训练、推理的算力上限还会持续突破。
苏姿丰在发布会现场也公布了AMD后续芯片路线,2027年会推出新一代MI500系列AI芯片,继续沿用2nm工艺,升级CDNA 6架构,配套更新HBM4e显存,算力、内存规格还会迎来新一轮提升,长期布局高端算力赛道的意图十分明确。
目前Meta、微软、甲骨文多家头部云厂商已经确定接入MI455X算力集群,OpenAI、Anthropic等头部大模型企业也规划大规模部署该芯片,行业落地进度远超同期竞品新品。
AI算力内卷时代已经到来,MI455X凭借2nm制程、432GB超大显存、数十倍提升的推理吞吐量,给行业树立全新性能标杆。不管是大型科技企业搭建超算集群,还是中小开发者本地部署大模型,这款全新旗舰AI加速卡都会成为绕不开的硬件选择。
你平时部署大模型最头疼显存不够还是推理速度慢?有没有遇到过单卡装不下模型、多卡协同延迟过高的问题?
如有侵权,联系删除
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.