LM Studio 终于把 MTP(Multi-Token Prediction)推测解码做上了
事情还挺有故事性的:5 月 17 日 llama.cpp 合并了 MTP 支持,5 月 18 日就有用户在 LM Studio 的 issue 区开帖催更:
❝ "llama 合并 MTP 三天了,LM Studio 怎么还没支持?我快焦虑发作了,没有 MTP 我整个世界会塌的(我看到征兆了…),LM Studio 的开发者们要是能听见我说话,求求你们加上 MTP,我感觉留给我的时间不多了,请,LM Studio,救救我们。"
这哥们是真急
幸运的是,5 月 20 日 LM Studio 官方开发者 yagil 直接在 issue 下面回复:"Fear not, it is here (in beta)",0.4.14 Build 2 beta 上线,5 月 22 日 Build 4 正式稳定版发布
简介
先快速科普一下,MTP(Multi-Token Prediction)是什么?
简单讲就是:传统语言模型一次只能预测一个 token,每生成一个字都要把整个网络跑一遍,慢。MTP 让模型一次预测多个 token,然后用验证机制保证质量,本质上是推测解码(speculative decoding)的一种,但比传统的 draft model 方案更优雅
它有两个好处:
不用额外的 draft 小模型:MTP head 是和主模型一起训练的,自带"草稿能力"
天然对齐:因为是同一个模型出来的预测,验证通过率高,加速倍数稳定
这里有几个坑要避开,按官方和社区实测的步骤来:
升级 LM Studio 到 0.4.14 Build 4
打开 LM Studio,开启 Developer Mode(开发者模式)
进入模型设置,确认 llama.cpp 引擎版本是 2.15.0 以上

下载支持 MTP 的模型 推荐:
unsloth/Qwen3.6-35B-A3B-MTP-GGUF
unsloth/Qwen3.6-27B-MTP-GGUF
上一篇刚介绍过 ,作者也发了 MTP 头版本,吞吐能跟 Qwen3.6 官方 MTP 跑出 1.66× 的对比
![]()
加载模型时勾选 MTP ,享受 ~2× 速度

❝ ⚠️ 关键提示:普通 GGUF 模型开 MTP 不会变快,反而可能更慢,必须是带 MTP head 的专用 GGUF。这点社区已经有不少坑货反馈了实测速度有多炸?
直接看社区跑出来的数据:
硬件
模型
不开 MTP
开 MTP
加速比
RTX 3090
Qwen3.6-27B MTP
~20.69 tok/s
~42 tok/s~2.0×
高端配置
Qwen3.6-35B-A3B MTP
~130 tok/s
已知问题(提前避坑)
按 issue 区扒下来的踩坑清单:
问题
状态
Build 2 代码输出空白符被吞掉
✅ Build 3 已修复
非 MTP 推测解码在 MTP 开启时报错
✅ Build 4 已修复
小模型(4B 级别)MTP 反向加速
⚠️ 待优化,建议先用大模型
Gemma 4 MTP 不可用
⚠️ 已知 bug
MTP 默认关闭,新手容易找不到
⚠️ 必须开 Dev Mode + 选加载参数
llama.cpp 引擎版本要求 2.15.0
⚠️ 在 beta 频道,部分人要手动升级
和原生 llama.cpp 对比
也有网友提到一个值得关注的点:原生 llama.cpp 命令行可以用ubatch等更多调参选项,理论上优化空间比 LM Studio 大
我感觉这个需要分场景:
想最快上手、不折腾:LM Studio 0.4.14 + MTP 一键开,无脑享受 2× 提速
想压榨到极限:还是回到 llama.cpp 原生命令行,手动调 ubatch、n_gpu_layers、KV cache 这些
配合 froggeric 修复模板:Qwen-Fixed-Chat-Templates 在 LM Studio 上也能用,工具调用稳定性能再上一档
.cpp
制作不易,如果这篇文章觉得对你有用,可否点个关注。给我个三连击:点赞、转发和在看。若可以再给我加个,谢谢你看我的文章,我们下篇再见!
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.