网易首页 > 网易号 > 正文 申请入驻

AMD一年前就推出了搭载Nvidia新AI笔记本的产品,软件终于跟上来了

0
分享至

html

英伟达刚发布RTX Spark笔记本后,我在Computex上参加了一场AMD和惠普的圆桌会谈。一位同行记者向AMD的Rahul Tikoo和惠普的Jim Nottingham(两位均为各自公司的副总裁)提问,他们欢不欢迎这位新对手。毕竟,这两家公司一直在推能在本地跑大AI模型的小机器,英伟达这是也来插了一脚。

作为回应,Tikoo站起身来,指了指桌上摆着的那些惠普造、AMD驱动的产品。他拿起桌上的惠普Strix Halo迷你主机,举起来给在座的人看,然后转向Nottingham问了一个简单的问题:“Jim,你们是什么时候推出这款系统的?”

Nottingham回答得很简短,但嘴角带着一丝笑意——“2025年CES展会。”Tikoo还站着,慢慢重复了Nottingham的话,然后四下看了看,又从桌上抓起另一台惠普笔记本。再次转向Nottingham时,Tikoo也学着他笑了起来:“那这款产品呢,Jim——你们是什么时候推出的?”

到这时候,Tikoo想说什么已经很明显了。

“两个月后。2025年2月或3月,”对方回答道。

Tikoo将笔记本递给我们桌边的人,然后回到自己的座位上,笑着绕回最初的问题,给出了回答。“我们已经有35款搭载Strix Halo的产品在卖了,”他说。“欢迎英伟达,来加入现代计算的旅程吧。”

显然,AMD信心十足,而且从外部来看,不难理解其原因。毕竟,我们还没有RTX Spark的定价细节,实际体验环节也经过了精心安排,而且这款芯片本身要到今年晚些时候才会发货。值得一提的是,Tikoo还表示,他真心想看看Nvidia具体搞了什么名堂,但他有信心,Gorgon Halo(Strix Halo的更新版)在第三季度推出时将会是更好的产品。

那位询问AMD是否欢迎新竞争对手的记者,还问到了一个大多数人会认为Nvidia拥有明显优势的方面:软件栈。毕竟,CUDA是“直接买Nvidia”能成为真正有效策略的原因,而AMD的替代品ROCm历来缺乏开发者在本地部署和开发AI所需的许多功能。AMD已经取得了长足的进步,虽然它仍然不是CUDA,但如今如果说不能在AMD上做本地AI,那就不准确了。对于软件栈问题的回答更为微妙,但说白了就是:AMD正在努力解决这个问题,而且作为在7900 XTX上运行ROCm已有一段时间的人,以前对AMD和本地AI的那些老看法,现在很快就过时了。

AMD自2025年初以来一直在销售这类机器
Nvidia这回可是姗姗来迟

Nvidia的RTX Spark本质上是为笔记本电脑和小型Windows PC重新推出的GB10。它已经为DGX Spark桌面设备提供支持,这一点Nvidia首席执行官黄仁勋本人也在将消费级N1和N1X芯片与相同设计联系起来时予以确认。它把20核的Arm“Grace”CPU和一块带6,144个CUDA核心的Blackwell GPU搭在一起,统一内存从16GB起步,最高能到128GB,并标称最高300 GB/s的带宽,且声称拥有1 PFLOP的FP4算力。它在Computex上发布,将于秋季出货,Nvidia除了表示其瞄准高端市场外,尚未给出定价。

AMD的同类产品已经销售了一年多。Ryzen AI Max+ 395,代号Strix Halo,配备16个Zen 5核心和32线程,以及40个CU的RDNA 3.5集成显卡,最高支持128GB统一内存,其中多达96GB可用作显存。它于2025年初出现在惠普ZBook Ultra G1a等笔记本电脑中,不久后又出现在一波迷你PC中。Tikoo问Nottingham那些产品时,指的就是这一系列。

在今年的Computex上,AMD还推出了一款与Nvidia DGX Spark直接竞争的交钥匙产品——Ryzen AI Halo开发者迷你PC。这玩意儿是Strix Halo架构,带128GB内存,能跑2000亿参数的模型,支持启动Windows 11和Linux,并于本月开启预购,售价为3,999美元。这价格也是冲着对手去的,因为跟Nvidia当初给DGX Spark定的价一模一样,之后Nvidia将其提高到了4,699美元。

按照AMD自己的说法,硬件并不是Halo的真正重点。Tikoo将其描述为一次让软件层隐形的实践,ROCm、PyTorch以及少量模型被预装并锁定在他所谓的“最佳配置”中。AMD将其作为Ryzen AI开发者中心推出,机器上预置了AI操作手册并可供下载,经过验证的模型包确保首次启动即可运行,并且承诺每月重新认证整个软件栈,以便在底层组件变化时保持其正常工作。Tikoo表示,即使你熟悉操作,搭建像OpenClaw这样的环境也可能耗费整个周末,而这机器就是帮你把那个周末省出来。

规格表非常接近
纸面规格基本相同

从规格表上看,两者非常接近。两者最高都支持128GB统一内存,Nvidia的20核Arm CPU与AMD的16核32线程x86处理器对标。AMD的下一步,即Gorgon Halo,将在第三季度将内存提升至192GB并支持3000亿参数模型。Nvidia的低配版也值得一提,因为其配置将从16GB内存起步。当被问及AMD是否为不想购买4000美元机器的买家提供了选择时,答案非常简单:你现在就能买到,这要归功于已经满足入门级需求的、更便宜的Ryzen AI 300和400系列芯片。

Nvidia确实拥有一些纸面优势。其300 GB/s的内存带宽略超AMD 256 GB/s的理论上限。此外,配备FP4张量硬件的Blackwell GPU应该会在原始计算能力和提示处理方面领先,而提示处理是推理过程中决定你等待第一个令牌时间长短的部分。顺便说一句,这个300 GB/s的数字有个坑:在去年的Hot Chips会议上,GB10也被称为具有300 GB/s内存带宽的芯片,但实际上,最终结果是273 GB/s。

在桌面端,在笔记本还没开打之前,计算优势就已经偏向AMD。Ryzen AI Halo开发机价格不菲(尽管目前比DGX Spark便宜),但像GMKtec的EVO-X2这样的128GB Strix Halo迷你电脑售价约为3300美元,Framework的Desktop起价也大致相同。你多付的700美元溢价是为了获得经过验证和认证的软件栈,而不是硬件本身,这正是Tikoo说这机器要解决的麻烦。

ROCm悄悄变得能跑大家真正用的软件了
PyTorch这些现在都能用了

Tikoo在回答关于AMD软件栈的问题时宣称,ROCm已经取得了长足的进步,开源是AMD的“赌注”,并且“开源才是正道”。Tikoo在这一点上是对的,因为ROCm不再是AI生态里硬贴上去的小项目。PyTorch可能是最好的证明。PyTorch 2.9将ROCm纳入其实验性的wheel变体工作中,通过兼容工具让安装不那么别扭,但更重要的部分是此后发生的事情。2.11版本为AMD GPU添加了设备端断言和TopK/基数选择优化,2.12版本则增加了可扩展内存段、rocSHMEM对称内存集合以及FlexAttention流水线。现在,很多现代AI工作底下的框架都把AMD当正经加速器来支持,而不是靠社区凑合着用。

HIP 正是填补剩余鸿沟的关键。在基于 ROCm 的 PyTorch 版本中,许多熟悉的 torch.cuda API 仍然存在,但这些调用是通过 HIP 在 AMD GPU 上执行,而不是通过 CUDA 跑在 Nvidia 硬件上。在日常使用中,这意味着许多基于 CUDA 假设编写的 PyTorch 代码可以在 AMD 硬件上运行,而无需围绕单独的 AMD 专用 API 进行重写。

本地推理工具链的其余部分也陆续跟上。llama.cpp 同时拥有 Vulkan 和 ROCm 后端,而 Ollama、LM Studio 和 ComfyUI 现在都支持在 AMD 上运行。在 Strix Halo 上,Vulkan 通常是最简单的选择,并且在许多类似 llama.cpp 的配置中,其令牌生成速度可能更快,而 ROCm 则在提示处理、长上下文行为、Flash Attention、rocWMMA 以及任何受益于 AMD HIP 计算栈的方面更为重要。哪个后端更占优,要看模型、上下文长度、量化方式和应用程序,但重要的是现在有了选择。两年前,这还是一个需要反复编译、测试、调试并碰运气的周末。现在,大部分功能装上就能用。

版本情况也好多了。ROCm 7.2.4 是最新的 Linux 端优化版,专注于 Instinct GPU 的推理性能和稳定性,而 AMD 的 Radeon 和 Ryzen 文档则分别列出了对 Radeon RX 9000、部分 RX 7000 显卡以及 Ryzen AI Max、AI 300 和部分 AI 400 APU 的 ROCm 7.2.1 支持。Windows 现在也是 AMD 面向消费级硬件的 ROCm 布局的一部分,尤其是在 PyTorch 方面,尽管 Linux 仍然是更广泛、更成熟的主战场。

我用 ROCm 年头不短了,还记得当年 7900 XTX 得手动编译大半个技术栈,还得认命其中有些部分永远跑不起来。如今,该显卡及其周边硬件已列入官方支持列表。“非 CUDA 不可”这话越来越站不住脚了,这真是令人欣喜。

ROCm 在某些方面还是赶不上 CUDA
但问题可能没有你想象的那么严重

这倒不是说 ROCm 就能跟 CUDA 平起平坐了,但 AMD 心里有数,这点挺难得。当我问 Tikoo 还有哪些差距需要填补时,他头一个提的就是给新式智能体场景做沙盒隔离。“这是我们希望尽快解决的问题之一,”他说。

不过,更大的问题是他所说的“在终端上实现首发即支持”。目标是让AMD面向数据中心的Instinct显卡的ROCm开发在终端集成显卡解决方案上“100%可用”,即像Strix Halo这类机器中的集成GPU。“所以我们不断扩大这个软件库,”他说。这话说得很实在,因为它点出了AMD还得补上的短板:ROCm比过去好多了,但AMD仍需要更多数据中心软件工作能顺利延伸到消费级和集成显卡上。

NPU也有同样的问题,只是软件栈不同。“当你追求性能时,你会用GPU,但当你追求效率时,你会用NPU,”Tikoo说。这意味着AMD也需要一个面向NPU用例的第三方软件库,他称这是“一个重点方向”。

从历史上看,AMD在实现这种软件对等性方面一直很吃力。ROCm上的Flash Attention经常落后,而Strix Halo已经暴露了那种让ROCm仍显不成熟的边缘情况,例如在某些版本里,PyTorch的Flash Attention在gfx1151上会出错。像bitsandbytes这类量化库,以前只支持CUDA,现在不是了,但它们仍然是这个问题的一个典型例子:CUDA是默认路径,而AMD支持往往来得更晚,附带更多限制,并且需要AMD、维护者和用户付出更多努力。

训练这块是最拿不出手的,尽管这种情况也在改变。Zyphra的ZAYA1-8B是在AMD Instinct MI300X集群上训练的,这是AMD需要跨越的一个重要里程碑。该公司称这是首个完全在AMD Instinct MI300X GPU、AMD Pensando网络和ROCm上训练的大规模MoE基础模型。这令人印象深刻,但你品品这里面的意思:我们已进入LLM热潮好几年了,如果这种事还能上新闻,那就说明训练领域仍然以CUDA为先。

更广泛的生态系统也以CUDA为先。新模型?CUDA优先。AI软件包?CUDA优先。ROCm最终会到来,但通常会有延迟,而且往往比Nvidia路径有更多粗糙之处。比如Ollama在Strix Halo上,老是找GPU时超时,然后偷偷改用CPU。这些都不是啥大问题,只要你爱折腾,但你会碰上CUDA用户压根碰不上的麻烦。

硬件本身对 AMD 来说可能是另一个障碍。Nvidia 的 Tensor Cores 和 CUDA 库仍然是这些工作负载所依赖的低精度矩阵运算的参考标准,尤其是当你进入 FP8、FP4 以及评测者将密切关注的高速提示处理环节时。如果 Nvidia 的笔记本等年底消费者拿到手后,在提示处理速度上更快,我一点也不会惊讶。

话虽如此,ROCm 已经够好了,不至于再成为不买 AMD 的借口。它还没到 CUDA 那种程度,但对在 Strix Halo 机器上跑本地大语言模型的发烧友来说,PyTorch 配合 llama.cpp、Ollama 或 LM Studio 是一条受支持且能跑通的路子。你想跑的很多本地 AI 应用,比如 ComfyUI,也都能跑。以前大家因为软件差距而忽视 AMD,现在这个差距已经缩得比你想的小多了。虽然 Nvidia 可能会在秋季推出优秀的产品,但你现在就能买 AMD 的版本,马上跑起来,这比 Nvidia 那台被玻璃罩住、定价还没谱的机器强多了。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
西班牙"狼孩"80岁安详离世,被狼群"收养"12年后被抓回现代社会,直言:我最后悔的事情就是被带了回来!

西班牙"狼孩"80岁安详离世,被狼群"收养"12年后被抓回现代社会,直言:我最后悔的事情就是被带了回来!

LULU生活家
2026-09-05 18:36:16
“养条狗都比你强!”老公主在雨中崩溃痛哭,评论区里没有一点同情!

“养条狗都比你强!”老公主在雨中崩溃痛哭,评论区里没有一点同情!

林林先生
2026-09-03 11:14:07
全网社死!武大女教授更多猛料曝光:从小是公认乖乖女,父母都是老师

全网社死!武大女教授更多猛料曝光:从小是公认乖乖女,父母都是老师

小鋭有话说
2026-09-05 22:09:37
彻底内讧!美国众议院封杀对俄制裁法案,86票大胜直接作废?

彻底内讧!美国众议院封杀对俄制裁法案,86票大胜直接作废?

老马拉车莫少装
2026-09-04 21:11:23
花200块看《坠落2》,座位是湿的,智商是被按地上摩擦的

花200块看《坠落2》,座位是湿的,智商是被按地上摩擦的

乡野小珥
2026-09-05 12:26:05
意外走红游客连日打卡,失独“葫芦娃爷爷”挂出休息牌,当地文旅:恳请大家多体谅,他不是网红,是可亲可爱的绍兴长者

意外走红游客连日打卡,失独“葫芦娃爷爷”挂出休息牌,当地文旅:恳请大家多体谅,他不是网红,是可亲可爱的绍兴长者

极目新闻
2026-09-05 00:28:51
80后博士方靖辞去常州市副市长,1月夏思军也辞去常州市副市长

80后博士方靖辞去常州市副市长,1月夏思军也辞去常州市副市长

江南江南
2026-09-04 20:44:37
英国公开赛:90后黑马被淘汰!名将6-3进决赛,塞尔比冲击第27冠

英国公开赛:90后黑马被淘汰!名将6-3进决赛,塞尔比冲击第27冠

越岭寻踪
2026-09-06 03:43:07
景甜被除名,震动全网!

景甜被除名,震动全网!

互联网品牌官
2026-09-04 10:18:08
德比斯回应无缘冠军:有些失望,我犯了一些错误,但感谢张雪机车

德比斯回应无缘冠军:有些失望,我犯了一些错误,但感谢张雪机车

风过乡
2026-09-05 21:10:43
九旬独居老人去世无人继承遗产,法院指定民政局管理

九旬独居老人去世无人继承遗产,法院指定民政局管理

封面新闻
2026-09-05 19:06:14
奥迪新车上市即腰斩,库存积压背后的残酷真相,豪华车市场变天了吗?

奥迪新车上市即腰斩,库存积压背后的残酷真相,豪华车市场变天了吗?

侃故事的阿庆
2026-09-06 05:23:56
为什么现在社会上挤满了平庸到令人发指的高学历?网友说:985学历在如今就是坨shi!

为什么现在社会上挤满了平庸到令人发指的高学历?网友说:985学历在如今就是坨shi!

黯泉
2026-09-05 16:26:10
一场74-58,让世界杯A组大乱套,日本队爆冷,三分战术被打回原形:27中3

一场74-58,让世界杯A组大乱套,日本队爆冷,三分战术被打回原形:27中3

南海浪花
2026-09-06 03:14:39
每体:瓦伦西亚球迷战巴萨将等第19分钟进场抗议林荣福

每体:瓦伦西亚球迷战巴萨将等第19分钟进场抗议林荣福

懂球帝
2026-09-06 06:05:12
8.99万大众油耗2.82L续航2000公里,合资车杀疯了

8.99万大众油耗2.82L续航2000公里,合资车杀疯了

娱乐圈的笔娱君
2026-09-04 14:44:40
A股:大家准备好了,种种迹象表明,后天周一,或将迎来新的转变?

A股:大家准备好了,种种迹象表明,后天周一,或将迎来新的转变?

云鹏叙事
2026-09-06 00:00:06
3-2,1-0!英超悲喜夜!热刺获首分 曼城领跑 8队遭平局 积分榜更

3-2,1-0!英超悲喜夜!热刺获首分 曼城领跑 8队遭平局 积分榜更

安海客
2026-09-06 00:22:49
沉默六天,终于瞒不住了!中方拦截秋刀渔船,日本政府罕见失声

沉默六天,终于瞒不住了!中方拦截秋刀渔船,日本政府罕见失声

策前论
2026-09-05 18:06:36
美网网红观赛引争议:大坂直美、高芙、佩古拉谈网球礼仪

美网网红观赛引争议:大坂直美、高芙、佩古拉谈网球礼仪

甜份超标的我
2026-09-05 04:43:47
2026-09-06 07:04:49
生活魔术专家
生活魔术专家
里是「生活百科全书」,汇集了独特的生活小妙招和所见所得,让你轻松发现生活的美好与智慧
839文章数 8022关注度
往期回顾 全部

数码要闻

英伟达在PAX West游戏展现场原价直供公版显卡 RTX 5090售1999美元

头条要闻

江西遂川泥石流1死11失联 男子:母亲电话一直打不通

头条要闻

江西遂川泥石流1死11失联 男子:母亲电话一直打不通

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

阿Sa蔡卓妍首度求婚细节,感动落泪

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

科技要闻

华为何庭波,再次更新韬定律论文

汽车要闻

千里浩瀚H5/30英寸大屏 星越L PLUS让你看到油车越级的一面

态度原创

旅游
房产
健康
教育
时尚

旅游要闻

让每一次抵达都多一份期待(香江在线)

房产要闻

突发重磅!海口出台楼市新政!

脑梗取栓成功≠活下来,还有这三关

教育要闻

全国小学初中教材全部换新,这三科变化最大

推广中奖名单-更新至2026年8月25日推广

无障碍浏览 进入关怀版