512块GPU同时开跑,每秒吐出575万个token。这个数字来自AMD在MLPerf Inference v6.1上的最新提交,也是这家公司迄今为止规模最大的一次参赛。
MLPerf Inference由MLCommons维护,是衡量不同硬件在AI推理任务中吞吐和延迟表现的基准测试套件。最新6.1版的重点集中在推理吞吐、扩展效率,以及不同GPU配置下的实际表现。
![]()
AMD的512卡答卷
在DeepSeek R1测试中,AMD派出了512个Instinct MI355X GPU。离线场景成绩为2,901,950 tokens/s,服务器场景成绩为2,405,310 tokens/s。
这两个数字对应的是两种不同的使用环境。离线强调批量处理能力,通常用来衡量系统在非实时场景下的最大吞吐;服务器则强调在线服务场景中的吞吐与响应能力,更接近实际部署中的请求处理环境。
AMD方面表示,这次提交再次证明了其性能、规模、软件成熟度和可复现性。
英伟达的288卡对照
英伟达在同一项目中提交了GB300和GB200的288 GPU配置。GB300离线成绩为2,705,130 tokens/s,服务器成绩为2,028,030 tokens/s。
需要注意的是,两家的GPU数量并不相同——AMD用了512块,英伟达用了288块。配置存在差异,以上数据仅供参考,不能直接当作同规模下的性能对比。
Vera Rubin首次现身
英伟达的Vera Rubin VR200首次进入MLPerf推理基准,共出现了36 GPU和72 GPU两种配置。
在相同72个GPU配置下,Vera Rubin(VR200)要比GB300快95%。此外,36 GPU配置版本要比72-GPU GB200配置更快。
AMD、NVIDIA等厂商在MLPerf Inference v6.1发布后同步提交了结果。从512卡到288卡,从已量产的GB300到首次亮相的VR200,这一轮提交把推理吞吐的竞争推到了新的量级。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.