我这台 M1 Pro 的 MacBook Pro 买了两年多,风扇基本没转过。直到前阵子开始跑本地大模型,好家伙,天天呼呼转。
![]()
起因说起来有点好笑:开发 app 的时候 token 花得肉疼。9块9 也是钱啊,就琢磨能不能在自己电脑上跑个模型,不花钱,随便问。于是装了 Ollama。
装不难,难的是选模型。
16GB 内存是个硬约束。我先下了 Qwen2.5-Coder 的 7B 和 14B,还有个 DeepSeek Coder V2 Lite。14B 跑起来是真卡——参数大,机器喂不动,回答一个问题等半天。7B 倒是流畅,就是明显笨一点。
![]()
后来发现一个专门给 Apple 芯片做的运行器 Rapid-MLX,能跑 4bit 量化过的模型(Quantize 4-bit 指用更低位精度存储权重,占内存更少、更快)。下了 Qwen3.5-9B-4bit,速度和聪明程度都比那个 7B 好,之前下的几个就全删了。
![]()
用下来还明白一件事:模型和模型不一样,不光看参数。后来又试了 GLM-4-9B,参数差不多,但它对工具调用的理解就是不如 Qwen——同一句话,Qwen 听懂就开干,GLM-4 就是不行。下一步看看还要不要搞别的模型再试试。
本来想着开发 app 呢,结果变成鼓捣 AI 大模型了。应该有跟我一样的朋友吧,遇到这种情况就忍不住想研究一下,一研究就发现是个大坑。
内存的账也算了:模型往内存里一加载,剩下给系统的就不多了。16GB 跑 9B 的模型已经紧巴巴,这还没算你同时开着的浏览器和微信。我下一台电脑大概直接上 32GB,甚至64GB 都想上。本地大模型这玩意实在太吃内存了。
之前写过一篇讲 Mac 内存的(搜:Mac 内存 16GB 是底线),这篇算它的下半场:日常使用 16GB 是底线,想跑本地模型,至少从 32GB 开始。
说到底:本地大模型不是"能跑就行",是内存的军备竞赛——参数小的笨,参数大的卡,4bit 量化能救急但救不了根本。真想在 M 芯片 Mac 上玩得舒服,内存不能省。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.