我先说个数:同样一台M5 Max的Mac,同一个模型,普通推理大概三四十个token每秒,换成MTP加速之后跑到了125.8。差距差不多三倍。这个数字不是我编的,是MTPLX官方在2026年9月16日一次OpenCode请求里测出来的。我把原理和部署方式都捋了一遍,今天讲清楚这个"快"到底从哪来。
![]()
【一、先说清楚这个数字有多大】
我自己在Mac上跑过不少本地模型,Qwen 3.8 27B那个量级,日常能跑到30到40个token每秒,我已经觉得很流畅了。125.8是什么水平?基本上你打字的速度赶不上它出字的速度。
那个测试条件是:MacBook Pro M5 Max、128GB统一内存、Optimized Speed档、temperature 1.0、top-p 0.95、top-k 20。官方也提醒了,这个数字不能直接套到所有Mac上,芯片、模型版本、上下文长度都会影响结果。
【二、MTP到底是什么】
MTP的全称是Multi-Token Prediction,多Token预测。这个词最早是DeepSeek-V3提出来的。
我用大白话解释:普通大模型生成文字,是"一个字一个字往外蹦"——每算完一个token,要等整个模型前向传播跑完,才知道下一个token是什么。这是个串行过程,快不起来。
MTP的思路是"先大胆猜,再一起验"。它让模型带几个额外的预测头,一次往前猜好几个token(这一步叫draft),然后把猜出来的这几个token一起塞回主模型做一次验证(这一步叫verify)。猜对的直接采纳,猜错的丢掉重来。
DeepSeek-V3的技术报告里给的数据是:第一个MTP模块的接受率能到80%以上,整体推理加速约1.8倍。这1.8倍不是靠降低质量换来的,验证机制保证了输出结果和不用MTP时完全一致。
【三、和普通推理、和推测解码的区别】
我一开始把MTP和"推测解码"搞混了,后来才理清楚。
普通的推测解码,需要一个额外的"草稿模型"——通常是另外训练一个小模型来快速猜,主模型负责验证。多了个模型,就要多占内存,还要保证两边配合得上。
MTP不一样的地方在于,这个"猜"的能力是烤进模型预训练里的。模型本来就在训练时被要求预测多个未来token,所以推理时直接用自己内置的MTP头就能当草稿器,不需要额外加载一个草稿模型。
代价也有:DeepSeek-V3在训练阶段多花了大概10%的算力,换来671B模型上14B的额外参数(约2%)。但这个成本是"一次性"的,你第一次跑推理就把本捞回来了。这也是为什么现在各家推理框架都在支持MTP。
【四、按你的Mac内存选模型】
MTPLX官方给了一份按统一内存的选型表,我直接抄给你:
16GB内存:选 Qwen 3.5 的 4B 或 9B 版本,够日常聊天和简单问答。
32GB内存:选 Qwen 3.8 27B Optimized Speed,官方推荐用它做本地编程和日常聊天,这是甜点档。
36GB内存:可以上 Qwen 3.8 27B Optimized Quality(8-bit版),优先保精度。
96GB内存:才能跑 Qwen 3.8 Flash Next,就是跑出125.8那个模型。
我多说一句:96GB是Flash Next的起步配置,不代表你在这个配置下就能开满上下文。长上下文还要额外吃内存,这一点官方特意提醒过。
【五、安装其实很快】
MTPLX是开源的,装起来不复杂。我用Homebrew装:
brew install youssofal/mtplx/mtplx
mtplx start
启动之后,直接连你的编程工具,比如:
mtplx start opencode
它同时提供兼容OpenAI和Anthropic的接口,所以Claude Code、Cursor这类工具也能直接指向它。M1和M2的用户注意一下,去选目录里对应的FP16兼容模型包,别直接上新版。
【六、为什么它值得一试】
我的判断是这样:MTP不是那种"跑分好看实际没用"的技术,它快得很实在,而且不掉质量。
对Mac用户来说,这件事的意义在于——我们之前一直在讨论"Mac的统一内存能不能跑大模型",现在话题已经变成"能跑多快了"。M5的Neural Accelerator加上MTP这类加速手段,Mac在本地推理这条路上确实越跑越顺。
最后提醒一句:MTPLX的实测数据来自M5 Max顶配,你手里的机器是什么水平,还得自己跑一遍才知道。别看到125就以为自己的M1也能到,那是不现实的。
#Mac本地部署 #MTP加速 #本地大模型
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.