网易首页 > 网易号 > 正文 申请入驻

两台AMD小主机跑起3970亿参数!10GbE拼出一座桌面AI集群

0
分享至

两台巴掌大小的AMD主机,接上一台10GbE交换机,能不能跑起接近4000亿参数的大模型?

YouTuber Alex Ziskind真动手试了。他拿出两台AMD Ryzen AI Halo小主机,每台配备128GB统一内存,按照AMD官方Playbook搭建双机集群,先后运行GLM-4.7 358B和Qwen 3.5 397B。


整个过程没有昂贵的InfiniBand,也没有服务器机柜。两台小盒子、一台交换机和几根网线,就在桌面上拼出了一套迷你分布式推理系统。

两块128GB内存,不能直接相加

Ryzen AI Halo搭载AMD Strix Halo芯片,CPU和GPU可以共享128GB内存。按照AMD的说法,单台设备有机会运行约2000亿参数的量化模型,两台机器组成集群后,理论上可以把模型规模推到4000亿参数左右。

问题在于,两台电脑不会因为插上网线,就自动变成一台拥有256GB显存的电脑。

模型需要被拆分到两台机器上。生成每一个Token时,两侧GPU都要交换中间结果,网络延迟和带宽会直接影响推理速度。Ryzen AI Halo只有一个10GbE接口,这条万兆链路也成了整个测试里最值得关注的变量。

Alex最初想直接用网线连接两台主机,但AMD的两套集群方案都要求使用10GbE交换机。最后,他选用了一台UniFi Flex XG。这台交换机拥有四个10GbE接口和一个千兆接口,最多可以连接四台计算节点,千兆口则用于接入日常管理网络。


通过iPerf3测试,两台机器之间的实际带宽达到9.41至9.44Gbps,基本跑满万兆网络。硬件链路准备完成后,真正麻烦的部分才刚刚开始。

为了多拿几十GB内存,他重装了两台机器

AMD目前提供的初级和中级AI应用Playbook可以在Windows或Linux上运行,双机集群Playbook只支持Linux。

Alex手里的两台机器系统并不一致,一台装有Windows,另一台运行Linux。为了避免重复配置驱动、ROCm环境和各种依赖,他先在Linux机器上下载好模型,再把整块系统盘克隆到另一台主机。


克隆系统也会复制主机身份,两台机器接入同一个网络前,他又分别修改主机名,将它们设置为Halo 1和Halo 2。这样一来,两台设备拥有相同的软件环境、驱动版本和模型文件,也减少了分布式部署中常见的版本冲突。

内存分配带来了更隐蔽的麻烦。

虽然每台机器标称128GB统一内存,操作系统会占用一部分容量。Linux环境下,AMD允许将GPU可用共享内存提高到120GB,两台合计约240GB。Windows最多只能分配96GB,部分机器默认甚至只有64GB。

其中一台主机原本安装Windows,后来换成Linux后,GPU内存仍然被锁在64GB。BIOS里找不到相关设置,AMD提供的命令也没有生效。Alex排查许久后发现,必须进入AMD Ryzen AI Developer Center,手动修改GPU内存分配。

经过这一步,两台设备才真正获得每台约120GB的模型装载空间。

RPC跑358B,搭建简单但并发有限

AMD给出的第一种方案,是使用llama.cpp的RPC功能。

在这套架构里,Halo 1作为主节点,负责启动模型服务;Halo 2将GPU和内存暴露为远程RPC工作节点。主节点可以借用第二台机器的内存,把单机装不下的模型分散到两台设备上。


Alex选择了GLM-4.7 358B,并使用Unsloth提供的UD-Q4_K_XL量化版本。这个模型仅靠一台128GB主机无法完整装入,双机集群让他有机会保留质量更高的4bit量化,避免使用压缩程度更高的IQ2或IQ1版本。

模型成功启动后,单并发对话速度大约为每秒7.6至8.2个Token。对于一个3580亿参数的模型,这个速度已经能够支撑正常聊天。


当并发提高到4时,短输入场景下的总吞吐达到每秒13至13.5个Token。不过,当提示词长度增加到2048 Token,吞吐会下降到约每秒5.5个Token。


由此可以看出,llama.cpp RPC更适合个人使用、单轮聊天和低并发任务。它的配置过程相对直接,第二台机器更像主节点的远程显存扩展。输入变长、请求数量增加后,通信和调度开销会迅速暴露出来。

397B跑到18 Token,桌面上搭出迷你数据中心

为了测试更复杂的分布式推理,Alex 又尝试了AMD的第二套方案:RCCL、vLLM和Ray。

这套方案使用张量并行,将同一层模型计算拆到两块GPU上。Ray负责两台节点之间的任务组织,RCCL承担GPU通信,vLLM负责模型服务和并发调度。整体技术栈已经接近数据中心常见的多节点推理架构。

代价也很明显。整个环境通过Podman容器运行,大模型启动一次大约需要15分钟。任何启动参数写错,都可能意味着重新执行整套加载流程。Alex因此建议先用架构相同的小模型验证环境,再加载数百GB的大模型。

正式测试中,他运行了Qwen 3.5 397B。模型在两台机器上各占用约110GB,总占用约220GB,张量并行度设置为2。


运行期间,两侧GPU利用率达到100%,单机功耗约60W,温度约52℃。通过10GbE传输数据时,单并发生成速度约为每秒7.81个Token,四并发总吞吐接近每秒18个Token。

至顶AI实验室洞见

10GbE虽然谈不上理想的高速互联,但依然能够支撑两台Ryzen AI Halo协同运行近4000亿参数的量化模型。RPC方案容易搭建,适合少量交互;RCCL配合vLLM的部署门槛更高,在多用户、智能体和并发API场景中更有优势。

两台小主机没有获得一块真正统一的256GB显存,网络通信也会留下性能损耗。它们却把原本属于服务器集群的模型拆分、张量并行和多节点调度带到了桌面上。

对需要本地运行超大模型的人来说,这次测试真正展示的价值,或许不只是“能不能装下3970亿参数”,还包括一条更加现实的路径:用多台统一内存主机逐步扩展容量,在办公室里搭出一座低功耗的小型AI集群。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
2元买走了8亿?多名公职人员被查!衡水中学背后真相浮出水面!

2元买走了8亿?多名公职人员被查!衡水中学背后真相浮出水面!

社会日日鲜
2026-07-29 10:09:44
再打下去可能灭国,4年前乌克兰还有4300多万人,如今还有多少?

再打下去可能灭国,4年前乌克兰还有4300多万人,如今还有多少?

怪味历史连连看
2026-07-29 02:33:21
敬一丹丈夫发文后的沉默背后

敬一丹丈夫发文后的沉默背后

小椰的奶奶
2026-07-29 11:00:31
比特币,历史级暴跌!

比特币,历史级暴跌!

澳洲财经见闻
2026-07-29 06:54:25
张柏芝阿娇为何同意陈冠希拍摄?18年过去,终于可以换个角度看了

张柏芝阿娇为何同意陈冠希拍摄?18年过去,终于可以换个角度看了

正直小墨
2026-07-28 22:53:27
7月29日最新消息!职工养老金会统一每人涨一样多吗?答案说透了

7月29日最新消息!职工养老金会统一每人涨一样多吗?答案说透了

白昼说故事
2026-07-29 10:03:30
8月7日立秋,今年立秋是“闭眼秋”,老辈说的“闭眼秋”是什么意思?是好还是坏?

8月7日立秋,今年立秋是“闭眼秋”,老辈说的“闭眼秋”是什么意思?是好还是坏?

小谈食刻美食
2026-07-29 07:59:35
江苏打人乒乓球选手家境曝光,疑国手亲弟弟,被打11:0恼羞成怒

江苏打人乒乓球选手家境曝光,疑国手亲弟弟,被打11:0恼羞成怒

蜜桔娱乐
2026-07-29 10:26:52
网传上海户籍含金量喋喋不休,上海还是那个上海吗?评论区炸锅…

网传上海户籍含金量喋喋不休,上海还是那个上海吗?评论区炸锅…

慧翔百科
2026-07-29 12:00:05
2026 养老金不涨、7 月补发取消?官方真相说透,别再白等吃亏?

2026 养老金不涨、7 月补发取消?官方真相说透,别再白等吃亏?

白昼说故事
2026-07-29 10:06:44
曾有俄罗斯高官语出惊人:沙俄时期侵占的中国领土,如今可以明码标价再卖回给中国!这背后,其实折射出远东开发已陷入停滞的残酷现实

曾有俄罗斯高官语出惊人:沙俄时期侵占的中国领土,如今可以明码标价再卖回给中国!这背后,其实折射出远东开发已陷入停滞的残酷现实

人生录
2026-07-29 00:05:09
内马尔:我想我在巴西队的时光已经结束,2030世界杯看不到我

内马尔:我想我在巴西队的时光已经结束,2030世界杯看不到我

懂球帝
2026-07-29 13:19:16
新疆阿克苏地区乌什县发生4.6级地震,震源深度10千米

新疆阿克苏地区乌什县发生4.6级地震,震源深度10千米

界面新闻
2026-07-29 14:22:12
14岁女生提醒同学上课不要睡觉,被巡查老师扯发打脸,当地通报:基本属实,已对涉事教师记过处分,并进行全县通报,责令学校全面整改

14岁女生提醒同学上课不要睡觉,被巡查老师扯发打脸,当地通报:基本属实,已对涉事教师记过处分,并进行全县通报,责令学校全面整改

蓬勃新闻
2026-07-29 09:56:09
FIFA地震!因凡蒂诺与特朗普合作圈钱 欧足联怒斥:或抵制世界杯

FIFA地震!因凡蒂诺与特朗普合作圈钱 欧足联怒斥:或抵制世界杯

念洲
2026-07-29 06:43:11
太焦虑了!一湖北考生录取通知书运输途中,被高校招生办拦截退回,网友安慰:可能印刷错误

太焦虑了!一湖北考生录取通知书运输途中,被高校招生办拦截退回,网友安慰:可能印刷错误

火山詩话
2026-07-28 09:38:43
美强硬派访华吃闭门羹,回国后做出无耻决定,称中国发展远超认知

美强硬派访华吃闭门羹,回国后做出无耻决定,称中国发展远超认知

共工之锚
2026-07-29 00:18:03
我们的下一代,大概率比我们难很多,也穷很多。

我们的下一代,大概率比我们难很多,也穷很多。

老陆不老
2026-07-29 09:12:22
网友称343斤吃播博主“良子”在峨眉山徒步途中晕倒,后被担架抬下山,景区回应:确有参与救援,游客购票时均会发放风险告知提示

网友称343斤吃播博主“良子”在峨眉山徒步途中晕倒,后被担架抬下山,景区回应:确有参与救援,游客购票时均会发放风险告知提示

大风新闻
2026-07-29 12:40:07
孙俪14岁儿子火了!五官雌雄同体,网友:化个妆,就是甄嬛2.0...

孙俪14岁儿子火了!五官雌雄同体,网友:化个妆,就是甄嬛2.0...

东方不败然多多
2026-07-29 11:36:24
2026-07-29 14:39:00
至顶AI实验室 incentive-icons
至顶AI实验室
一个专注于探索生成式AI前沿技术及其应用的实验室。
3501文章数 182关注度
往期回顾 全部

数码要闻

古尔曼爆料苹果今秋推2026款Apple TV和HomePod mini

头条要闻

泽连斯基称与伊朗处于战争中 学者:释放极度危险信号

头条要闻

泽连斯基称与伊朗处于战争中 学者:释放极度危险信号

体育要闻

毫无存在感的NBA状元,最先谢谢惠顾?

娱乐要闻

吴镇宇儿子自曝小学时遭同学霸凌

财经要闻

“轻AI”策略重塑科技股叙事?

科技要闻

千名AI员工联署:别让AI快到人类跟不上

汽车要闻

24K金LOGO,纯手工打磨腰线,第二代腾势D9暗夜鎏金高定色,一天只能造3台?

态度原创

艺术
游戏
教育
亲子
数码

艺术要闻

LV中国总部所在大楼,获“最佳建筑奖”

纹花黑丝小洋裙!《魔女审判》联动知名哥特萝莉服装

教育要闻

turn out不是“转出去”!高考这个短语三种考法,80%的同学只知其一

亲子要闻

原来你命中注定就是帅哥美女

数码要闻

罗技效仿任天堂!欧洲版鼠标才能换电池

无障碍浏览 进入关怀版