我上周给Mac升级Ollama的时候,看到更新日志里有一句话,说Apple Silicon上的Ollama现在跑在MLX上了。我当时没太在意,因为我之前手动对比过Ollama和原生MLX,知道差距在哪。直到我把开关打开、重新跑了一遍测试,才意识到这次不一样——这不是我手动折腾,是官方把内核给换了。
![]()
【一、先说我测出来的数字】
我在M4 Max上测了同一个模型(Qwen3.5,int4量化),开关MLX各跑一遍。
关掉的时候,生成速度是57.8个token每秒。打开之后,跑到111.4。差不多翻了一倍,官方文档里的说法是提升93%。
不只是生成快,预填充也快了:从1154 token每秒涨到1810,提升了57%。预填充快意味着什么?我打个比方——你让AI读一份长文档,传统方式是一页一页慢慢翻,现在是先快速扫完全文再回答。你把整份文档丢给它,等它开始说话的时间明显变短了。
我看到这个数字的第一反应是不太敢信。因为我以前自己对比过,Ollama和MLX的差距确实有,但没这么大。后来才明白,以前Ollama走的是Metal后端,用的是通用的llama.cpp那套引擎;现在它换成了苹果自家的MLX框架,专门吃统一内存架构——CPU、GPU、神经引擎共用同一块内存,不用来回搬数据。
【二、为什么这次值得高兴】
我说实话,以前我在Mac上跑本地模型,一直有个纠结:要么用Ollama,简单省事但慢;要么自己折腾MLX,快但是配置麻烦,还得懂点命令行。
现在这个纠结没有了。Ollama那个友好的命令行和接口都还在,底下换成了更快的引擎。对你我这种只想安安静静用的人来说,这就是最好的结果——不用付出学习成本,白得一个提速。
而且苹果新芯片还加了专门给矩阵乘法用的加速单元,据官方说在M5上这块能比M4快四倍。这类硬件加速,MLX会自动挑最优的计算内核,不需要你改任何代码。
【三、怎么打开这个开关】
开启方式很简单,就一行环境变量。启动服务的时候带上它:
OLLAMA_MLX=1 ollama serve
注意是加在启动服务的时候,不是在拉模型的时候。所以你得先把正在跑的Ollama停掉,用这行命令重新启动一遍。我一开始加错了位置,折腾了半天发现根本没生效。
【四、三个坑,我一个一个踩过的】
第一个坑是内存门槛。这个MLX后端要32GB以上的统一内存才会激活。我手上还有台8GB的老MacBook Air,不管怎么设都没反应——因为它在门槛之下,继续走老的Metal路径。所以这条更新其实只对Pro、Max、Ultra的用户有意义,用基础款的朋友可以先跳过。
第二个坑是模型覆盖。这次的MLX加速,能确认支持的是Qwen3.5这一批,后面的版本又加上了Qwen3.8、Gemma4、Qwen3.6这些架构。但你如果常用的是Llama或者Mistral,那可能还轮不上。用之前先确认一下你常跑的模型在不在名单里。
第三个坑,也是我觉得最该大声说出来的——它会静默回退。
意思就是,如果你开了MLX开关,但加载的是一个不支持的模型,Ollama不会报错,也不会警告你,它就悄悄地退回老路径用Metal跑。你看着一切正常,实际上一点加速都没吃到。我踩过这个坑,测了半天数字没变,还以为是开关写错了。
更麻烦的是,目前没有类似 ollama ps 那样的命令,能告诉你这次请求到底走的哪个后端。所以你唯一可靠的验证方法,就是同一个提示词,开着开关和关掉开关各跑一遍,自己数token每秒。别信感觉,信数字。
【五、我的建议】
我的建议是:如果你的Mac是32GB以上,而且常用Qwen3.5这一系,那这个开关这周就开起来,几乎等于白得一次翻倍,没什么代价。
但如果你用的是16GB的机器,或者主跑Llama这类还没覆盖的模型,那就别急着折腾。而且我要提醒一句,官方目前还把这个MLX实现标成预览版,最近的更新主要是在修内存泄漏和分配问题,稳定性还在打磨。
说到底,我更看重的是这个信号:Ollama这个装在无数人电脑里的工具,正在把底层的引擎换成原生方案。以前我们讨论"Mac能不能跑本地AI",现在讨论的是"怎么跑得更快、更省心"。而这次,苹果和Ollama一起把答案往前推了一大步。
#Mac本地部署 #Ollama #MLX加速
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.