![]()
同样准备八九千美元,一台M5 Max和两台DGX Spark,该怎么选?
按美国目前的零售价,一台16英寸M5 Max MacBook Pro,128GB内存、4TB硬盘,售价7999美元。DGX Spark单台4699美元,两台合计9398美元。
两套设备相差1399美元,已经进入同一个预算区间。
M5 Max是一台主力电脑,可以剪片、写代码,也能运行本地模型。两台DGX Spark共有两组128GB统一内存和8TB硬盘,通过高速网络连接,主要任务就是跑AI。
只看配置,双Spark占了不少优势:内存更多,支持CUDA,还能把模型拆到两台机器上运行。但这些配置值不值钱,最后还得看Agent能不能把任务做完。
最近我在LocalLLaMA看到一组很有针对性的测试。用户anvarazizov同时拥有一台128GB M5 Max和4台DGX Spark/GX10,他从中拿出两台Spark,在两边运行DeepSeek-V4-Flash,再交给同一个Agent完成Terminal-Bench 2.1的89项终端任务。
![]()
M5 Max:47项,54% 双DGX Spark:45项,52.3%
这里的“打成平手”只指任务完成率。生成速度、并发和上下文容量,双Spark依然占优。
89项任务,Mac多做对了两项
Terminal-Bench不会用选择题考模型,而是直接给Agent一个Linux终端。
Agent需要自己读文件、执行命令、修改代码,最后由程序检查任务有没有完成。测试内容包括修复代码仓库、恢复数据库、编译扩展、处理数据、训练小模型和破解哈希。
模型写了多少分析不计分,程序修好、测试通过,才算完成。
受到运行错误影响,M5 Max有87项获得有效成绩,完成47项;双Spark有86项获得有效成绩,完成45项。
在两边都得到结果的86项任务中,66项结果相同:36项两边都完成,30项两边都失败。
另外20项出现分歧,M5 Max单独完成11项,双Spark单独完成9项。两项任务的差距不足以分出胜负,原帖作者给出的结论也是:这一轮没有检测到明显的任务完成能力差异。
80.8GB版本为什么没有掉队
两边运行的都是DeepSeek-V4-Flash,但模型文件和推理软件并不相同。
DeepSeek-V4-Flash共有2840亿参数,采用MoE架构。模型每次生成内容,只会调用其中约130亿参数。M
ac上运行的是一份80.8GiB的GGUF量化版本,平均每个参数约2.45bit。体积最大的专家权重被大幅压缩,注意力、路由和输出层等容易影响结果的部分保留较高精度。
它没有把所有部分压到同一精度。占空间最多的专家权重负责减小体积,容易影响能力的关键部分则尽量保留。
负责运行模型的是DwarfStar 4,也就是ds4。这个项目由Redis创始人Salvatore Sanfilippo主导开发,专门优化DeepSeek-V4、GLM-5.2等少数大模型。
测试中的Mac还把部分KV缓存放到了SSD上。KV缓存相当于模型执行长任务时需要保存的临时记忆,放到硬盘后,可以把更多内存留给模型权重。
依靠量化和磁盘缓存,这份80.8GiB的模型可以在128GB统一内存中运行,并向Agent提供100K上下文。这里的100K代表模型一次可以保留的代码和文档量。
双Spark的优势没有写进得分里
双DGX Spark运行的是约167GB的FP8和FP4混合精度权重,压缩程度比Mac上的版本低得多。
每台DGX Spark配备128GB统一内存和4TB硬盘。两台机器通过ConnectX-7的200Gbps链路连接,再用张量并行把模型分到两个节点上运行。
两组128GB内存不会自动变成一块256GB内存,推理软件需要负责拆分模型,并协调两台机器共同计算。
双Spark使用针对GB10修改过的vLLM,并启用了DSpark推测解码。原帖记录的单路生成速度为54至58 token/s。token是模型生成内容时的计量单位,这里可以直接看成输出速度。
同时运行8路任务时,双Spark的总生成速度达到253 token/s,平均每路约31.6 token/s。它还能提供262K服务端上下文,本次测试向Agent开放了200K,是Mac端的两倍。
Terminal-Bench只检查任务成功或者失败,不会因为提前完成而多给分,多Agent并发也不会反映在最终成绩中。
双Spark的价值会在长任务和多人使用时体现出来。一个Agent运行和八个Agent同时运行,对个人用户区别不大,对团队却是两种体验。
这笔钱怎么花
只给一个人使用,我会买M5 Max。
独立开发者、内容创作者和需要移动办公的人,可以把它作为主力电脑。白天写代码、剪视频,空闲时运行本地模型。128GB+4TB版本还能比双Spark节省1399美元,也不用维护两台Linux主机。
它的限制也很明确:没有完整的CUDA生态,多Agent并发和长上下文不如双Spark。
机器固定放在办公室,同时供多人调用,双DGX Spark更合适。
两台设备一共有256GB物理内存和8TB硬盘,支持CUDA、vLLM和200K上下文,可以同时运行多个Agent。像实验室、小型开发团队和本地AI服务器,更容易用到这些能力。
只做本地聊天、文档问答和普通编程,两套都没有必要买。
其实32GB到64GB内存配合更小的模型,已经能覆盖大部分轻量需求。
80.8GiB的量化版本,在这轮测试中的任务完成率并没有明显落后于167GB版本。对个人用户来说,量化方法和推理引擎可以弥补不少硬件差距;到了多人并发和长任务,双Spark多出来的配置才会转化成时间优势。
M5 Max适合一个人的完整工作流,双DGX Spark适合多个Agent持续运行。预算接近,用途完全不同。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.