html
英伟达刚发布RTX Spark笔记本后,我在Computex上参加了一场AMD和惠普的圆桌会谈。一位同行记者向AMD的Rahul Tikoo和惠普的Jim Nottingham(两位均为各自公司的副总裁)提问,他们欢不欢迎这位新对手。毕竟,这两家公司一直在推能在本地跑大AI模型的小机器,英伟达这是也来插了一脚。
作为回应,Tikoo站起身来,指了指桌上摆着的那些惠普造、AMD驱动的产品。他拿起桌上的惠普Strix Halo迷你主机,举起来给在座的人看,然后转向Nottingham问了一个简单的问题:“Jim,你们是什么时候推出这款系统的?”
Nottingham回答得很简短,但嘴角带着一丝笑意——“2025年CES展会。”Tikoo还站着,慢慢重复了Nottingham的话,然后四下看了看,又从桌上抓起另一台惠普笔记本。再次转向Nottingham时,Tikoo也学着他笑了起来:“那这款产品呢,Jim——你们是什么时候推出的?”
到这时候,Tikoo想说什么已经很明显了。
“两个月后。2025年2月或3月,”对方回答道。
Tikoo将笔记本递给我们桌边的人,然后回到自己的座位上,笑着绕回最初的问题,给出了回答。“我们已经有35款搭载Strix Halo的产品在卖了,”他说。“欢迎英伟达,来加入现代计算的旅程吧。”
显然,AMD信心十足,而且从外部来看,不难理解其原因。毕竟,我们还没有RTX Spark的定价细节,实际体验环节也经过了精心安排,而且这款芯片本身要到今年晚些时候才会发货。值得一提的是,Tikoo还表示,他真心想看看Nvidia具体搞了什么名堂,但他有信心,Gorgon Halo(Strix Halo的更新版)在第三季度推出时将会是更好的产品。
那位询问AMD是否欢迎新竞争对手的记者,还问到了一个大多数人会认为Nvidia拥有明显优势的方面:软件栈。毕竟,CUDA是“直接买Nvidia”能成为真正有效策略的原因,而AMD的替代品ROCm历来缺乏开发者在本地部署和开发AI所需的许多功能。AMD已经取得了长足的进步,虽然它仍然不是CUDA,但如今如果说不能在AMD上做本地AI,那就不准确了。对于软件栈问题的回答更为微妙,但说白了就是:AMD正在努力解决这个问题,而且作为在7900 XTX上运行ROCm已有一段时间的人,以前对AMD和本地AI的那些老看法,现在很快就过时了。
AMD自2025年初以来一直在销售这类机器
Nvidia这回可是姗姗来迟
Nvidia的RTX Spark本质上是为笔记本电脑和小型Windows PC重新推出的GB10。它已经为DGX Spark桌面设备提供支持,这一点Nvidia首席执行官黄仁勋本人也在将消费级N1和N1X芯片与相同设计联系起来时予以确认。它把20核的Arm“Grace”CPU和一块带6,144个CUDA核心的Blackwell GPU搭在一起,统一内存从16GB起步,最高能到128GB,并标称最高300 GB/s的带宽,且声称拥有1 PFLOP的FP4算力。它在Computex上发布,将于秋季出货,Nvidia除了表示其瞄准高端市场外,尚未给出定价。
AMD的同类产品已经销售了一年多。Ryzen AI Max+ 395,代号Strix Halo,配备16个Zen 5核心和32线程,以及40个CU的RDNA 3.5集成显卡,最高支持128GB统一内存,其中多达96GB可用作显存。它于2025年初出现在惠普ZBook Ultra G1a等笔记本电脑中,不久后又出现在一波迷你PC中。Tikoo问Nottingham那些产品时,指的就是这一系列。
在今年的Computex上,AMD还推出了一款与Nvidia DGX Spark直接竞争的交钥匙产品——Ryzen AI Halo开发者迷你PC。这玩意儿是Strix Halo架构,带128GB内存,能跑2000亿参数的模型,支持启动Windows 11和Linux,并于本月开启预购,售价为3,999美元。这价格也是冲着对手去的,因为跟Nvidia当初给DGX Spark定的价一模一样,之后Nvidia将其提高到了4,699美元。
按照AMD自己的说法,硬件并不是Halo的真正重点。Tikoo将其描述为一次让软件层隐形的实践,ROCm、PyTorch以及少量模型被预装并锁定在他所谓的“最佳配置”中。AMD将其作为Ryzen AI开发者中心推出,机器上预置了AI操作手册并可供下载,经过验证的模型包确保首次启动即可运行,并且承诺每月重新认证整个软件栈,以便在底层组件变化时保持其正常工作。Tikoo表示,即使你熟悉操作,搭建像OpenClaw这样的环境也可能耗费整个周末,而这机器就是帮你把那个周末省出来。
规格表非常接近
纸面规格基本相同
从规格表上看,两者非常接近。两者最高都支持128GB统一内存,Nvidia的20核Arm CPU与AMD的16核32线程x86处理器对标。AMD的下一步,即Gorgon Halo,将在第三季度将内存提升至192GB并支持3000亿参数模型。Nvidia的低配版也值得一提,因为其配置将从16GB内存起步。当被问及AMD是否为不想购买4000美元机器的买家提供了选择时,答案非常简单:你现在就能买到,这要归功于已经满足入门级需求的、更便宜的Ryzen AI 300和400系列芯片。
Nvidia确实拥有一些纸面优势。其300 GB/s的内存带宽略超AMD 256 GB/s的理论上限。此外,配备FP4张量硬件的Blackwell GPU应该会在原始计算能力和提示处理方面领先,而提示处理是推理过程中决定你等待第一个令牌时间长短的部分。顺便说一句,这个300 GB/s的数字有个坑:在去年的Hot Chips会议上,GB10也被称为具有300 GB/s内存带宽的芯片,但实际上,最终结果是273 GB/s。
在桌面端,在笔记本还没开打之前,计算优势就已经偏向AMD。Ryzen AI Halo开发机价格不菲(尽管目前比DGX Spark便宜),但像GMKtec的EVO-X2这样的128GB Strix Halo迷你电脑售价约为3300美元,Framework的Desktop起价也大致相同。你多付的700美元溢价是为了获得经过验证和认证的软件栈,而不是硬件本身,这正是Tikoo说这机器要解决的麻烦。
ROCm悄悄变得能跑大家真正用的软件了
PyTorch这些现在都能用了
Tikoo在回答关于AMD软件栈的问题时宣称,ROCm已经取得了长足的进步,开源是AMD的“赌注”,并且“开源才是正道”。Tikoo在这一点上是对的,因为ROCm不再是AI生态里硬贴上去的小项目。PyTorch可能是最好的证明。PyTorch 2.9将ROCm纳入其实验性的wheel变体工作中,通过兼容工具让安装不那么别扭,但更重要的部分是此后发生的事情。2.11版本为AMD GPU添加了设备端断言和TopK/基数选择优化,2.12版本则增加了可扩展内存段、rocSHMEM对称内存集合以及FlexAttention流水线。现在,很多现代AI工作底下的框架都把AMD当正经加速器来支持,而不是靠社区凑合着用。
HIP 正是填补剩余鸿沟的关键。在基于 ROCm 的 PyTorch 版本中,许多熟悉的 torch.cuda API 仍然存在,但这些调用是通过 HIP 在 AMD GPU 上执行,而不是通过 CUDA 跑在 Nvidia 硬件上。在日常使用中,这意味着许多基于 CUDA 假设编写的 PyTorch 代码可以在 AMD 硬件上运行,而无需围绕单独的 AMD 专用 API 进行重写。
本地推理工具链的其余部分也陆续跟上。llama.cpp 同时拥有 Vulkan 和 ROCm 后端,而 Ollama、LM Studio 和 ComfyUI 现在都支持在 AMD 上运行。在 Strix Halo 上,Vulkan 通常是最简单的选择,并且在许多类似 llama.cpp 的配置中,其令牌生成速度可能更快,而 ROCm 则在提示处理、长上下文行为、Flash Attention、rocWMMA 以及任何受益于 AMD HIP 计算栈的方面更为重要。哪个后端更占优,要看模型、上下文长度、量化方式和应用程序,但重要的是现在有了选择。两年前,这还是一个需要反复编译、测试、调试并碰运气的周末。现在,大部分功能装上就能用。
版本情况也好多了。ROCm 7.2.4 是最新的 Linux 端优化版,专注于 Instinct GPU 的推理性能和稳定性,而 AMD 的 Radeon 和 Ryzen 文档则分别列出了对 Radeon RX 9000、部分 RX 7000 显卡以及 Ryzen AI Max、AI 300 和部分 AI 400 APU 的 ROCm 7.2.1 支持。Windows 现在也是 AMD 面向消费级硬件的 ROCm 布局的一部分,尤其是在 PyTorch 方面,尽管 Linux 仍然是更广泛、更成熟的主战场。
我用 ROCm 年头不短了,还记得当年 7900 XTX 得手动编译大半个技术栈,还得认命其中有些部分永远跑不起来。如今,该显卡及其周边硬件已列入官方支持列表。“非 CUDA 不可”这话越来越站不住脚了,这真是令人欣喜。
ROCm 在某些方面还是赶不上 CUDA
但问题可能没有你想象的那么严重
这倒不是说 ROCm 就能跟 CUDA 平起平坐了,但 AMD 心里有数,这点挺难得。当我问 Tikoo 还有哪些差距需要填补时,他头一个提的就是给新式智能体场景做沙盒隔离。“这是我们希望尽快解决的问题之一,”他说。
不过,更大的问题是他所说的“在终端上实现首发即支持”。目标是让AMD面向数据中心的Instinct显卡的ROCm开发在终端集成显卡解决方案上“100%可用”,即像Strix Halo这类机器中的集成GPU。“所以我们不断扩大这个软件库,”他说。这话说得很实在,因为它点出了AMD还得补上的短板:ROCm比过去好多了,但AMD仍需要更多数据中心软件工作能顺利延伸到消费级和集成显卡上。
NPU也有同样的问题,只是软件栈不同。“当你追求性能时,你会用GPU,但当你追求效率时,你会用NPU,”Tikoo说。这意味着AMD也需要一个面向NPU用例的第三方软件库,他称这是“一个重点方向”。
从历史上看,AMD在实现这种软件对等性方面一直很吃力。ROCm上的Flash Attention经常落后,而Strix Halo已经暴露了那种让ROCm仍显不成熟的边缘情况,例如在某些版本里,PyTorch的Flash Attention在gfx1151上会出错。像bitsandbytes这类量化库,以前只支持CUDA,现在不是了,但它们仍然是这个问题的一个典型例子:CUDA是默认路径,而AMD支持往往来得更晚,附带更多限制,并且需要AMD、维护者和用户付出更多努力。
训练这块是最拿不出手的,尽管这种情况也在改变。Zyphra的ZAYA1-8B是在AMD Instinct MI300X集群上训练的,这是AMD需要跨越的一个重要里程碑。该公司称这是首个完全在AMD Instinct MI300X GPU、AMD Pensando网络和ROCm上训练的大规模MoE基础模型。这令人印象深刻,但你品品这里面的意思:我们已进入LLM热潮好几年了,如果这种事还能上新闻,那就说明训练领域仍然以CUDA为先。
更广泛的生态系统也以CUDA为先。新模型?CUDA优先。AI软件包?CUDA优先。ROCm最终会到来,但通常会有延迟,而且往往比Nvidia路径有更多粗糙之处。比如Ollama在Strix Halo上,老是找GPU时超时,然后偷偷改用CPU。这些都不是啥大问题,只要你爱折腾,但你会碰上CUDA用户压根碰不上的麻烦。
硬件本身对 AMD 来说可能是另一个障碍。Nvidia 的 Tensor Cores 和 CUDA 库仍然是这些工作负载所依赖的低精度矩阵运算的参考标准,尤其是当你进入 FP8、FP4 以及评测者将密切关注的高速提示处理环节时。如果 Nvidia 的笔记本等年底消费者拿到手后,在提示处理速度上更快,我一点也不会惊讶。
话虽如此,ROCm 已经够好了,不至于再成为不买 AMD 的借口。它还没到 CUDA 那种程度,但对在 Strix Halo 机器上跑本地大语言模型的发烧友来说,PyTorch 配合 llama.cpp、Ollama 或 LM Studio 是一条受支持且能跑通的路子。你想跑的很多本地 AI 应用,比如 ComfyUI,也都能跑。以前大家因为软件差距而忽视 AMD,现在这个差距已经缩得比你想的小多了。虽然 Nvidia 可能会在秋季推出优秀的产品,但你现在就能买 AMD 的版本,马上跑起来,这比 Nvidia 那台被玻璃罩住、定价还没谱的机器强多了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.