网易首页 > 网易号 > 正文 申请入驻

M6 Mac mini 本地跑大模型:买哪档才不后悔

0
分享至

8 月 25 日发布,9 月 22 日发售,RMB 6,999 起。苹果这次把 M6 Mac mini 的宣传重心压在了本地 AI 上:2nm 制程、双 16 核神经网络引擎、GPU 里第一次内置神经网络加速器、AI 性能比 M4 最高提升 4 倍。

先给结论。如果你买它主要是为了本地跑大模型,芯片参数基本可以忽略,真正决定体验的只有两个数字:统一内存容量,和内存带宽。而这两个数字,苹果在宣传稿里都没讲全。

一、四款机型,一张表看明白

苹果中国官网的技术规格页列了四个机型,我按本地 AI 相关的项做了整理:

机型

起售价

芯片

统一内存

内存带宽

起始存储

雷电口

1

¥6,999

M6

16GB(可选 24/32GB)

153GB/s

256GB

3×TB4

2

¥8,499

M6

16GB(可选 24/32GB)

153GB/s

512GB

3×TB4

3

¥9,999

M6

24GB(可选 32GB)

170GB/s

512GB

3×TB4

4

¥12,999

M5 Pro

24GB(可选 48/64GB)

307GB/s

512GB

3×TB5

M6 芯片本身是 12 核 CPU(2 个超级核心 + 4 个性能核心 + 6 个能效核心)、12 核 GPU、双 16 核神经网络引擎,支持硬件加速光线追踪和 AV1 解码。M5 Pro 则是 15 核 CPU、16 核 GPU、16 核神经网络引擎,可加钱升到 18 核 CPU 和 20 核 GPU。

补齐各档位的实际售价:16GB/256GB 是 ¥6,999,16GB/512GB 是 ¥8,499,24GB/512GB 是 ¥9,999,32GB/512GB 是 ¥11,499,M5 Pro 24GB/512GB 是 ¥12,999。

其他值得一提的:Apple N1 无线芯片,Wi-Fi 7、蓝牙 6,还首次支持 Thread;2.5Gb 以太网,可选配 10Gb;机身 12.70×12.70×4.97 厘米,M6 版重 0.67 千克;最大持续功率 155 瓦,闲置噪音 5 dBA。

二、三个数字,苹果没大声说

第一个:16GB 版的带宽是 153GB/s,不是 170GB/s。

宣传稿里那句「最高可达 170GB/s」,那个「最高」是有条件的。翻到官网技术规格页才写得清楚:配 16GB 统一内存时带宽是 153GB/s,只有升到 24GB 或 32GB 才是 170GB/s。差 11%。

为什么这事重要?因为跑本地大模型时,决定「吐字快不快」的瓶颈通常不是算力,而是内存带宽。模型每生成一个 token,权重就要被完整读一遍。买 16GB 基础款的人,是同时输掉了容量和带宽两样东西。

第二个:内存最高 32GB,而且出厂焊死。

M6 版的天花板就是 32GB。SSD 不够可以外接,机器慢了可以忍,内存不够是整个工作流当场停摆,而且后期没法补。

第三个:M6 版是 Thunderbolt 4,不是 Thunderbolt 5。

这一点最容易被忽略,但它直接决定了一整条路线的生死。M6 机型背面是三个雷雳 4 口(40Gb/s),只有 M5 Pro 机型才是三个雷雳 5 口(120Gb/s)。

后面会讲到,多台 Mac 组集群跑大模型,最关键的 RDMA over Thunderbolt 5 需要 TB5 才能开。M6 版走 TB4,只能回落到 TCP/IP,跨机通信慢一个数量级。想玩集群,M6 这台机器从硬件上就被挡住了。

三、为什么带宽比算力重要

本地推理有个反直觉的地方:它基本是个「搬运」活儿,不是「计算」活儿。

生成一个 token 的过程,本质上把模型权重从内存搬到计算单元过一遍。所以吞吐量的上限约等于「内存带宽 ÷ 模型权重大小」。这也是为什么一台 12 核 GPU 的 Mac mini,在某些场景下能追平看起来规格高得多的显卡。

三条可以直接用的经验法则:

  • Q4 量化下,每 10 亿参数约占 0.5 到 0.6GB
  • macOS 默认不会把全部统一内存交给 GPU,实际能给模型的大约是 70% 到 75%
  • 别把模型权重顶到内存上限,要给系统、推理软件和 KV Cache 留 25% 到 30% 的余量

按这个算,三档内存的实际可用空间大概是:16GB 约 11 到 12GB,24GB 约 18GB,32GB 约 24GB。

四、三档内存,各能跑什么

档位

能流畅跑

勉强能跑

跑不动

适合谁

16GB

7B 到 9B 级(Qwen3 8B、Qwen3.5 9B)、Whisper large

12B 到 14B Q4,需关掉所有后台,长上下文容易爆

27B 及以上

以办公为主,偶尔体验本地 AI

24GB

7B、14B 全系列,Gemma 4 12B 多模态

Qwen3.8-27B Q4,上下文不能拉太长

32B 原生

绝大多数人的最优解

32GB

7B/14B 常驻,27B 量化稳定,可同时挂 1 到 2 个 Agent

部分 32B 量化,速度一般

无压缩 32B

长期挂本地服务的深度玩家

具体到模型和估计速度(Q4 量化、中等上下文):

16GB 档:Qwen3 8B(约 6.5GB,估 28 tok/s)、Qwen3.5 9B(约 7GB,估 25 tok/s)、Gemma 4 12B 4bit(7 到 8GB,约 20 tok/s)、gpt-oss-20b MXFP4(约 12GB,MoE 架构省算力)、Whisper large(3 到 4GB,转录比实时快)。

32GB 档:Qwen3.8-27B 4bit(约 18GB,8 到 12 tok/s)、GLM-4.7-Flash 4bit(约 19GB,MoE 只有 3.6B 激活参数)、Qwen3-Coder-30B-A3B 4bit(约 19GB,256K 上下文,在 MLX 上很快)。

跑不动的那栏要单独说清楚。GLM-5.3-Flash 有 3200 亿参数,DeepSeek V4 Flash 光权重就 167GB,这些需要 170GB 以上的内存。一台 M6 Mac mini 连边都摸不到,就算压到极限量化也不行。想要真正对标付费服务的模型能力,这台机器的定位就够不着。

五、四个真实案例

案例一:Jeff Geerling 的 Mac Studio 集群。

苹果直接提供了一组 Mac Studio 给他测 RDMA over Thunderbolt 5。4 台 M3 Ultra、合计 1.5TB 统一内存,跑 Qwen3 235B 达到 32 tok/s。

最有意思的是对照组。同样的硬件,用 llama.cpp 做分布式,从单机的 20.4 tok/s 掉到 4 机的 15.2 tok/s,加机器反而更慢。换成 exo 加 RDMA,是单机的 19.5 tok/s 涨到 4 机的 31.9 tok/s,方向完全相反。差别就在互联:RDMA 把跨机内存访问延迟从约 300 微秒压到 50 微秒以下。

代价是这套集群总成本接近 4 万美元。

案例二:exo 官方基准测试。

LLaMA 3.2 3B 跨 M4 Pro 机器:1 台 49.3 tok/s;2 台单请求 44.4、多请求 95.7;3 台单请求 39.7、多请求 108.8。

看明白了吗?单请求延迟是随着加机器变差的,每一次跨机跳转都在加网络开销。但总吞吐能到 3 台 2.2 倍。官方 README 给的张量并行加速是 2 设备 1.8 倍、4 设备 3.2 倍。所以集群的价值在多并发,不在单条对话更快。

案例三:Alex Cheema 的 8 台 Mac mini。

exo 的联合创始人演示过用 8 台 M4 Pro Mac mini(每台 64GB,合计 512GB)跑 DeepSeek V3 671B。最初约 5 tok/s,优化后 2 节点 27.8 tok/s、4 节点 32.5 tok/s。

注意这里用的是 M4 Pro,因为要 TB5。换成 M6 版 Mac mini,这条路走不通。

案例四:长上下文会崩。

独立测评者 Ivan Fioravanti 用 2 台 M3 Ultra 512GB Mac Studio 跑完整 8bit 的 DeepSeek R1 671B:442 token 上下文时 18.6 tok/s,1074 token 时降到 15.4,13140 token 时只剩 6.4,到 16K 直接内存耗尽。

这是官方基准很少强调的一条:短提示很好看,长对话会断崖式掉速。买机器之前,先想清楚你的场景是短问答还是长文档。

还有一个更接地气的参照。有人用 M4 16GB 的 Mac mini 日常跑 Qwen3.6-35B-A3B,llama.cpp 和 Ollama 约 17 tok/s、活跃内存仅 3GB、零 swap;换成 LM Studio 的 MLX 版本能到 25 到 35 tok/s,但驻留内存涨到 10 到 12GB。17 tok/s 已经够用了,算是「对话级」而不是「阅读级」。

六、怎么部署:四个工具选一个

Ollama,最省心。装完一行命令就能跑,ollama run qwen3:8b 自动下载并启动,同时在 localhost:11434 提供 OpenAI 兼容 API,可以接各种前端和应用。2026 年的版本已经全面接入 MLX 后端,预填充和解码速度比旧版提升近一倍。新手建议从这里开始。

LM Studio,图形界面最友好。不想碰终端就选它,鼠标点几下就能搜模型、下载、切换,也自带 OpenAI 兼容的本地服务。

MLX,Apple 官方框架,速度最快。苹果为 Apple Silicon 专门写的,在统一内存上效率最高。想压榨速度、或者做 LoRA 微调,用这个。命令是 pip install mlx-lm,然后 python -m mlx_lm.generate --model mlx-community/xxx --prompt "..."。注意一点:mlx-lm 目前还不支持 tool calling,所以要做能读写文件的编码 Agent,得用 llama.cpp、Ollama 或 LM Studio。

llama.cpp,控制力最强。从源码编译带 Metal 支持,可以精细调线程数、batch size、上下文长度。典型命令是 ./llama-cli -m model-q8_0.gguf -c 8192 -ngl 99,-ngl 99 是把所有层都卸载到 GPU。

一个实战里总结出来的小技巧:用 Ollama 让模型常驻后台,别随便杀进程。冷启动第一次请求要等 5 到 10 秒,热的页面留在缓存里,后续请求会快很多。

七、我的购买建议

只是办公,偶尔玩一下:16GB 够用,硬盘按需。但如果你买这台机器的主要目的就是本地大模型,别买 16GB,它是同时输掉容量和带宽的一档。

想认真跑本地模型:直接上 24GB,硬盘 512GB 起步。这是真正的甜点档,一次性同时买到更大的容量和完整的 170GB/s 带宽,也是绝大多数人的最优解。

长期挂本地服务、多模型切换:32GB。M6 的天花板,能常驻 27B 量化模型。

要跑原生 32B,或者想组集群:M6 满足不了。要么上 M5 Pro 版 Mac mini(最高 64GB、307GB/s、TB5),要么上 Mac Studio(M5 Max 基础 36GB、最高 128GB、460GB/s 带宽、四个 TB5 口)。

最后提醒一句:内存一定要在下单时选对,后期没法加。硬盘反而可以先抠一点,模型文件放外接 SSD 就行。

M6 Mac mini 值不值得买,取决于你怎么定义它。

它不是「穷人的 H100」,甚至不是一台 AI 工作站。散热比笔记本好、功耗 155 瓦封顶、闲置 5 dBA 几乎听不见,这些加起来的真正定位是:一台可以 7×24 小时开机、放在办公桌角落的个人私有推理节点。

在这个定位上,24GB 那档 ¥9,999 的机器,能给你一个完全离线、数据不出门、随时可调用的 14B 级模型。这个能力在三年前还得靠几万块的设备。

而如果你要的是替代云端的前沿模型能力,那答案很直接:这台机器做不到,加钱也做不到。真正的分界线在 32GB 到 128GB 之间,不在 M6 这一代 Mac mini 上。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
国际时装周,张柏芝嫩了,宋佳干瘪消瘦,被膀大腰圆的朱珠抢了镜

国际时装周,张柏芝嫩了,宋佳干瘪消瘦,被膀大腰圆的朱珠抢了镜

洲洲影视娱评
2026-09-07 13:55:02
22岁小伙把40岁女友娶回了家,村里面的40岁左右的光棍不淡定了

22岁小伙把40岁女友娶回了家,村里面的40岁左右的光棍不淡定了

皮蛋儿电影
2026-09-08 13:15:34
武大风波原配终于发声:婚没离,忍了多年,就等一个彻查结论

武大风波原配终于发声:婚没离,忍了多年,就等一个彻查结论

一盅情怀
2026-09-08 12:24:37
大海在后退?我国东部地区2000年来,已多出将近一个省的面积!

大海在后退?我国东部地区2000年来,已多出将近一个省的面积!

抽象派大师
2026-09-06 00:35:22
他汀最大骗局:90%的人只知道降血脂,真正救命的核心根本没人懂

他汀最大骗局:90%的人只知道降血脂,真正救命的核心根本没人懂

九哥聊军事
2026-08-27 21:50:42
前跳水奥运冠军张家齐坦言感情没有很顺,自曝前两任男友皆因对方出轨分手,朋友吐槽自己是恋爱脑

前跳水奥运冠军张家齐坦言感情没有很顺,自曝前两任男友皆因对方出轨分手,朋友吐槽自己是恋爱脑

全接触狐狐
2026-09-08 12:48:21
联合国突发最高预警!千年一遇灾难将临,2027年人类还有退路吗?

联合国突发最高预警!千年一遇灾难将临,2027年人类还有退路吗?

历史点行
2026-09-07 13:26:48
丰田新车官宣:9月21日,正式上市

丰田新车官宣:9月21日,正式上市

科技堡垒
2026-09-06 11:39:30
丈夫出差一周回来就往卧室冲,把我按在床上一顿猛亲说想死我了,正激烈时他手机响了

丈夫出差一周回来就往卧室冲,把我按在床上一顿猛亲说想死我了,正激烈时他手机响了

周哥一影视
2026-09-01 12:18:04
星宇事件后培训HR“如何依法合规体面优化”,律所合伙人自称:没有对错,只是探讨

星宇事件后培训HR“如何依法合规体面优化”,律所合伙人自称:没有对错,只是探讨

澎湃新闻
2026-09-07 19:52:28
斯诺克英格兰公开赛: 赵心童首轮出局,丁俊晖险胜过关

斯诺克英格兰公开赛: 赵心童首轮出局,丁俊晖险胜过关

南方都市报
2026-09-08 12:50:25
彻底闹掰!中美敲打日本后,高市不敢得罪,遂将怒火全部迁怒俄方

彻底闹掰!中美敲打日本后,高市不敢得罪,遂将怒火全部迁怒俄方

乌克兰小静
2026-09-08 07:21:29
《蜘蛛侠:崭新之日》全球累计票房已达24亿美元,位列全球影史票房榜第三,超越《阿凡达:水之道》

《蜘蛛侠:崭新之日》全球累计票房已达24亿美元,位列全球影史票房榜第三,超越《阿凡达:水之道》

鲁中晨报
2026-09-07 19:51:03
6岁永久失明,全网心疼的郭斌(高考721分,在武汉求学12年),今天大学报到

6岁永久失明,全网心疼的郭斌(高考721分,在武汉求学12年),今天大学报到

极目新闻
2026-09-06 16:54:51
美媒:轰-20遇困境飞不起来,轰-20:我是比六代机更大的局

美媒:轰-20遇困境飞不起来,轰-20:我是比六代机更大的局

巅峰高地
2026-09-06 17:37:40
房价涨跌的争论可以停了!2027年,楼市将出现4个变化,能不能买房有答案了

房价涨跌的争论可以停了!2027年,楼市将出现4个变化,能不能买房有答案了

爱看剧的阿峰
2026-09-08 07:45:09
美媒:若中国高超武器保持继续发展,美国不得不考虑与中国谈判

美媒:若中国高超武器保持继续发展,美国不得不考虑与中国谈判

趣文说娱
2026-09-08 13:08:34
1991年,江青在北京自杀,临终前留下最后一句话:主席,我爱你!

1991年,江青在北京自杀,临终前留下最后一句话:主席,我爱你!

南书房
2026-09-01 06:45:10
45岁男子与女友合租一年吃30次他达拉非,一年后房颤,医生:无知

45岁男子与女友合租一年吃30次他达拉非,一年后房颤,医生:无知

垚垚分享健康
2026-09-04 11:20:15
海航双胞胎空姐,同时怀孕:飞行十三年的双胞胎空姐一起怀孕啦!一起孕育两个新的生命。

海航双胞胎空姐,同时怀孕:飞行十三年的双胞胎空姐一起怀孕啦!一起孕育两个新的生命。

毒舌八卦
2026-09-05 18:10:16
2026-09-08 13:52:49
小柱解说游戏
小柱解说游戏
每天更新有趣的小游戏
131文章数 1112关注度
往期回顾 全部

数码要闻

玩家自制Mod复活多GPU架构 实现最高127%帧率暴涨

头条要闻

德国极右翼赢得历史性大胜感谢马斯克 欧洲或连番变天

头条要闻

德国极右翼赢得历史性大胜感谢马斯克 欧洲或连番变天

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲乱改抗战歌曲被重罚!

财经要闻

全球黄金“回家”

科技要闻

小米再次背水一战

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

家居
游戏
房产
本地
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

GTA6露西娅演员晒美照:酒红紧身裙下都是肌肉 不好惹

房产要闻

真快啊!海口这个超级城更,又有大动作!

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版