两台巴掌大小的AMD主机,接上一台10GbE交换机,能不能跑起接近4000亿参数的大模型?
YouTuber Alex Ziskind真动手试了。他拿出两台AMD Ryzen AI Halo小主机,每台配备128GB统一内存,按照AMD官方Playbook搭建双机集群,先后运行GLM-4.7 358B和Qwen 3.5 397B。
![]()
整个过程没有昂贵的InfiniBand,也没有服务器机柜。两台小盒子、一台交换机和几根网线,就在桌面上拼出了一套迷你分布式推理系统。
两块128GB内存,不能直接相加
Ryzen AI Halo搭载AMD Strix Halo芯片,CPU和GPU可以共享128GB内存。按照AMD的说法,单台设备有机会运行约2000亿参数的量化模型,两台机器组成集群后,理论上可以把模型规模推到4000亿参数左右。
问题在于,两台电脑不会因为插上网线,就自动变成一台拥有256GB显存的电脑。
模型需要被拆分到两台机器上。生成每一个Token时,两侧GPU都要交换中间结果,网络延迟和带宽会直接影响推理速度。Ryzen AI Halo只有一个10GbE接口,这条万兆链路也成了整个测试里最值得关注的变量。
Alex最初想直接用网线连接两台主机,但AMD的两套集群方案都要求使用10GbE交换机。最后,他选用了一台UniFi Flex XG。这台交换机拥有四个10GbE接口和一个千兆接口,最多可以连接四台计算节点,千兆口则用于接入日常管理网络。
![]()
通过iPerf3测试,两台机器之间的实际带宽达到9.41至9.44Gbps,基本跑满万兆网络。硬件链路准备完成后,真正麻烦的部分才刚刚开始。
为了多拿几十GB内存,他重装了两台机器
AMD目前提供的初级和中级AI应用Playbook可以在Windows或Linux上运行,双机集群Playbook只支持Linux。
Alex手里的两台机器系统并不一致,一台装有Windows,另一台运行Linux。为了避免重复配置驱动、ROCm环境和各种依赖,他先在Linux机器上下载好模型,再把整块系统盘克隆到另一台主机。
![]()
克隆系统也会复制主机身份,两台机器接入同一个网络前,他又分别修改主机名,将它们设置为Halo 1和Halo 2。这样一来,两台设备拥有相同的软件环境、驱动版本和模型文件,也减少了分布式部署中常见的版本冲突。
内存分配带来了更隐蔽的麻烦。
虽然每台机器标称128GB统一内存,操作系统会占用一部分容量。Linux环境下,AMD允许将GPU可用共享内存提高到120GB,两台合计约240GB。Windows最多只能分配96GB,部分机器默认甚至只有64GB。
其中一台主机原本安装Windows,后来换成Linux后,GPU内存仍然被锁在64GB。BIOS里找不到相关设置,AMD提供的命令也没有生效。Alex排查许久后发现,必须进入AMD Ryzen AI Developer Center,手动修改GPU内存分配。
经过这一步,两台设备才真正获得每台约120GB的模型装载空间。
RPC跑358B,搭建简单但并发有限
AMD给出的第一种方案,是使用llama.cpp的RPC功能。
在这套架构里,Halo 1作为主节点,负责启动模型服务;Halo 2将GPU和内存暴露为远程RPC工作节点。主节点可以借用第二台机器的内存,把单机装不下的模型分散到两台设备上。
![]()
Alex选择了GLM-4.7 358B,并使用Unsloth提供的UD-Q4_K_XL量化版本。这个模型仅靠一台128GB主机无法完整装入,双机集群让他有机会保留质量更高的4bit量化,避免使用压缩程度更高的IQ2或IQ1版本。
模型成功启动后,单并发对话速度大约为每秒7.6至8.2个Token。对于一个3580亿参数的模型,这个速度已经能够支撑正常聊天。
![]()
当并发提高到4时,短输入场景下的总吞吐达到每秒13至13.5个Token。不过,当提示词长度增加到2048 Token,吞吐会下降到约每秒5.5个Token。
![]()
由此可以看出,llama.cpp RPC更适合个人使用、单轮聊天和低并发任务。它的配置过程相对直接,第二台机器更像主节点的远程显存扩展。输入变长、请求数量增加后,通信和调度开销会迅速暴露出来。
397B跑到18 Token,桌面上搭出迷你数据中心
为了测试更复杂的分布式推理,Alex 又尝试了AMD的第二套方案:RCCL、vLLM和Ray。
这套方案使用张量并行,将同一层模型计算拆到两块GPU上。Ray负责两台节点之间的任务组织,RCCL承担GPU通信,vLLM负责模型服务和并发调度。整体技术栈已经接近数据中心常见的多节点推理架构。
代价也很明显。整个环境通过Podman容器运行,大模型启动一次大约需要15分钟。任何启动参数写错,都可能意味着重新执行整套加载流程。Alex因此建议先用架构相同的小模型验证环境,再加载数百GB的大模型。
正式测试中,他运行了Qwen 3.5 397B。模型在两台机器上各占用约110GB,总占用约220GB,张量并行度设置为2。
![]()
运行期间,两侧GPU利用率达到100%,单机功耗约60W,温度约52℃。通过10GbE传输数据时,单并发生成速度约为每秒7.81个Token,四并发总吞吐接近每秒18个Token。
至顶AI实验室洞见
10GbE虽然谈不上理想的高速互联,但依然能够支撑两台Ryzen AI Halo协同运行近4000亿参数的量化模型。RPC方案容易搭建,适合少量交互;RCCL配合vLLM的部署门槛更高,在多用户、智能体和并发API场景中更有优势。
两台小主机没有获得一块真正统一的256GB显存,网络通信也会留下性能损耗。它们却把原本属于服务器集群的模型拆分、张量并行和多节点调度带到了桌面上。
对需要本地运行超大模型的人来说,这次测试真正展示的价值,或许不只是“能不能装下3970亿参数”,还包括一条更加现实的路径:用多台统一内存主机逐步扩展容量,在办公室里搭出一座低功耗的小型AI集群。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.