网易首页 > 网易号 > 正文 申请入驻

比英伟达会玩,本地部署 Qwen3.6 ,速度翻了 2.5 倍

0
分享至

大家好,我是 Ai 学习的老章

NVFP4一直是英伟达专属,前几天我也刚介绍:

没想到大模型量化巨星 Unsloth 比英伟达还会玩,他们发布了全新的 Dynamic NVFP4 量化技术,直接让本地跑 Qwen3.6 的速度翻了 2.5 倍,而且精度几乎无损,就问你猛不猛吧


先说结论

如果你手上有一张 RTX 5090 或者 B200 这样的 Blackwell 架构 GPU,那这次的 NVFP4 量化绝对值得关注:

  • Qwen3.6-27B:跑在 24GB VRAM 里,速度比标准 NVFP4 快 2.5 倍

  • Qwen3.6-35B-A3B:高并发下在 B200 上飙到17,561 tokens/s

  • 精度呢?MMLU-Pro、GPQA、AIME 2025 全线对齐 BF16 水平

  • 附赠FP8 KV Cache 校准,上下文长度直接翻倍

一句话总结:又快又准,还省显存


Qwen3.6 NVFP4 吞吐量对比 Qwen3.6 速览

先快速回顾一下 Qwen3.6 本身——这是阿里 4 月份发布的新一代混合思维多模态模型家族,包含两个版本:

模型

参数量

特点

Qwen3.6-27B

270 亿(Dense)

旗舰级编码能力,SWE-bench Verified 77.2

Qwen3.6-35B-A3B

350 亿总参/30 亿激活(MoE)

每 token 只激活 3B 参数,推理效率极高

关键能力:

  • 256K 原生上下文,YaRN 可扩展到 100 万

  • 201 种语言支持

  • Agentic Coding:前端工作流和仓库级推理表现优异

  • Thinking Preservation:保留历史思维链,多轮对话更连贯

  • 多模态:支持图片、视频理解

Qwen3.6-27B 在 SWE-bench Verified 上拿到 77.2 分,Terminal-Bench 2.0 上 59.3 分——这是跟 Claude 4.5 Opus 同档的成绩,就这么说吧,27B 的密集模型做到这个水平,确实离谱


Qwen3.6-27B 官方 Benchmark Dynamic NVFP4 到底做了什么

这是整篇文章的重头戏,先解释一下为什么 Unsloth 的 NVFP4 比 NVIDIA 官方的 NVFP4 快这么多

核心差异:W4A4 vs W4A16

NVIDIA 官方的 NVFP4 量化方案是W4A16——权重是 4-bit,但激活值(Activation)仍然是 16-bit,这意味着矩阵乘法时,GPU 需要把 4-bit 权重先反量化到 16-bit,再做计算

Unsloth 的方案是W4A4——权重和激活值都压到 4-bit,直接利用 Blackwell 架构的FP4 Tensor Core做原生计算,少了反量化这一步,吞吐量直接起飞

下面这张图一目了然地展示了两种方案的核心区别:


W4A4 vs W4A16 对比 动态层量化

"Dynamic" 不是随便起的名字,Unsloth 不是把所有层一刀切量到 4-bit,而是:

  1. 重要层保留更高精度——对模型输出影响大的层会被上采样

  2. 校准数据集精选——混合 Unsloth 自有数据集 + UltraChat,专门针对编程、工具调用、对话三个场景优化

  3. Chat Template 改进——修复了编码和工具调用的一致性问题,减少循环和其他已知问题

这就是为什么精度能保住——不是暴力压缩,而是"该省省、该花花"

内置 MTP 加速

MTP(Multi-Token Prediction)是 Qwen3.6 的独门武器,可以一次预测多个 token,Unsloth 这次把 MTP 张量直接内置到 NVFP4 量化模型里,相当于开箱即用,不需要额外加载 MTP 模块


FP8 KV Cache 校准

另一个实用改进:通过 FP8 KV Cache 校准,上下文长度可以翻倍,对于 Agent 场景来说,更长的上下文意味着可以记住更多的对话历史和工具调用结果

性能跑分:说数据 吞吐量对比(1×B200,128 并发)

Unsloth 官方在 B200 上做了完整测试:

  • Qwen3.6-27B NVFP4:比 NVIDIA 官方 NVFP4 快2.5 倍

  • Qwen3.6-35B-A3B NVFP4:1.56 倍提速(精准版)

  • Qwen3.6-35B-A3B NVFP4-Fast:1.79 倍提速(全 W4A4 版本)

  • 高并发场景下,35B-A3B 可以飙到17,561 tokens/s

解码速度(Decode Speed)方面:27B 提升 1.03 倍,35B-A3B 提升 1.17~1.22 倍

精度对比:几乎无损

这是最让人放心的部分——量化后精度跟 BF16 基本持平:

Qwen3.6-27B NVFP4 精度 Benchmark:

Provider

MMLU-Pro

GPQA

AIME 2025

Unsloth NVFP4

NVIDIA NVFP4

FP8

BF16

Qwen3.6-35B-A3B NVFP4 精度 Benchmark:

Provider

MMLU-Pro

GPQA

AIME 2025

Unsloth NVFP4

Unsloth Fast

NVIDIA NVFP4

FP8

BF16

Unsloth 还特别检查了输出长度——NVFP4 量化后的模型并没有"思考更久"来弥补精度,所以加速是实打实的,不是靠多想来凑的

两个 35B-A3B 版本的选择

Unsloth 给 35B-A3B 出了两个版本:

版本

特点

加速比

NVFP4

部分层保留高精度,更准确

1.56x

NVFP4-Fast

全 W4A4,最大速度

1.79x

如果你跑 Agent 或者工具调用场景,建议用标准版;如果纯聊天或者对速度更敏感,Fast 版本更合适

硬件要求

这是最关键的限制——NVFP4 需要 Blackwell 架构 GPU

  • ✅ RTX 50 系列(5090、5080 等)

  • ✅ DGX Spark

  • ✅ B200 / B300

  • ❌ RTX 40 系列及更早的卡不支持

如果你的 GPU 不是 Blackwell 架构,别急——Unsloth 的 Dynamic GGUF 量化同样优秀,配合 MTP 在旧卡上也能跑出不错的速度:

Qwen3.6

3-bit

4-bit

6-bit

8-bit

BF16

27B

15 GB

18 GB

24 GB

30 GB

55 GB

35B-A3B

17 GB

23 GB

30 GB

38 GB

70 GB


怎么跑起来 方案一:vLLM(推荐)

# 安装 vLLM
uv venv myenv --python 3.12
uv pip install --python myenv/bin/python \
"vllm==0.24.0" "nvidia-cutlass-dsl==4.5.2" --torch-backend=auto

# 启动 27B NVFP4
vllm serve unsloth/Qwen3.6-27B-NVFP4 \
--speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'

# 或者 35B-A3B Fast 版本
vllm serve unsloth/Qwen3.6-35B-A3B-NVFP4-Fast \
--speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'
方案二:SGLang

python -m sglang.launch_server \
--model-path unsloth/Qwen3.6-27B-NVFP4 \
--speculative-algorithm NEXTN \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4
方案三:Unsloth Studio(最简单)

如果你不想折腾命令行,Unsloth Studio 提供了完整的 Web UI:

# 安装
curl -fsSL https://unsloth 。ai/install。sh | sh


# 启动
unsloth studio -p 8888

打开浏览器搜索 Qwen3.6,下载模型就能直接跑,Studio 会自动帮你设置最优的推理参数,包括 MTP 配置

部署为 API 服务

跑起来之后,可以直接用 OpenAI 兼容的 API 调用:

from openai import OpenAI

client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="sk-no-key-required",
)

completion = client.chat.completions.create(
model="unsloth/Qwen3.6-27B-NVFP4",
messages=[{"role": "user", "content": "帮我写一个 Snake 游戏"}],
temperature=0.6,
top_p=0.95,
extra_body={"top_k": 20},
)
print(completion.choices[0].message.content)

这意味着你可以把它接入 Claude Code、Codex、或者任何支持 OpenAI API 的工具链

和其他方案的对比

Unsloth NVFP4

NVIDIA NVFP4

Unsloth GGUF + MTP

Ollama

速度

⭐⭐⭐⭐⭐

⭐⭐

⭐⭐⭐

⭐⭐

精度

⭐⭐⭐⭐⭐

⭐⭐⭐⭐

⭐⭐⭐⭐

⭐⭐⭐

易用性

⭐⭐⭐⭐

⭐⭐⭐

⭐⭐⭐⭐⭐

⭐⭐⭐⭐⭐

GPU 要求

Blackwell

Blackwell

任意

任意

推荐场景

高吞吐生产部署

生产部署

个人开发/本地

入门体验


总结

Unsloth 这次的 Dynamic NVFP4 量化,核心创新就三个字:W4A4——把权重和激活值都压到 4-bit,直接用 Blackwell 的 FP4 Tensor Core 做原生计算,绕过了传统方案的反量化瓶颈

对于有 Blackwell GPU 的用户来说,这基本是目前跑 Qwen3.6 最快的方案,27B 模型只需要 24GB VRAM,精度还跟 BF16 齐平,对于还在用 40 系卡的同学,Unsloth 的 Dynamic GGUF + MTP 依然是最优选择

最后的最后,提醒一下:不要用 CUDA 13.2(会输出乱码),用 13.2 以下或者 13.3 版本

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
不可思议!邹市明对冉莹颖就是生理性喜欢,3个儿子都是意外怀孕,评论炸锅

不可思议!邹市明对冉莹颖就是生理性喜欢,3个儿子都是意外怀孕,评论炸锅

火山詩话
2026-07-26 07:57:26
太贪婪!130 亿石油巨款仅到账 3 亿!美议员:钱全被特朗普私吞了?

太贪婪!130 亿石油巨款仅到账 3 亿!美议员:钱全被特朗普私吞了?

麓谷隐士
2026-07-26 07:10:03
洪洞黄土崩塌致5人死亡,其中一人中考730分,已被学校录取

洪洞黄土崩塌致5人死亡,其中一人中考730分,已被学校录取

映射生活的身影
2026-07-25 22:58:54
炸裂!台媒曝锋菲复合内幕:张柏芝恨透王菲,离婚看清丈夫伪面孔

炸裂!台媒曝锋菲复合内幕:张柏芝恨透王菲,离婚看清丈夫伪面孔

小鋭有话说
2026-07-24 09:01:57
里奇保罗爆料:一开始詹姆斯选择重返热火,但76人交易得到了布朗

里奇保罗爆料:一开始詹姆斯选择重返热火,但76人交易得到了布朗

夜白侃球
2026-07-25 14:20:27
高盛说中国正在“科技向上、消费向下”:劳动力市场处于十年来最弱(除疫情)

高盛说中国正在“科技向上、消费向下”:劳动力市场处于十年来最弱(除疫情)

时尚的弄潮
2026-07-26 11:49:59
王虹获菲尔兹奖,日本网民:日本人提出的数学猜想由中国人来解决,我们必须得进行更多合作才行,日本从中学考试开始就落后了

王虹获菲尔兹奖,日本网民:日本人提出的数学猜想由中国人来解决,我们必须得进行更多合作才行,日本从中学考试开始就落后了

极目新闻
2026-07-24 12:52:31
强台风级!凌晨,“红霞”在惠州登陆,系近10年以来登陆珠江口以东最强台风

强台风级!凌晨,“红霞”在惠州登陆,系近10年以来登陆珠江口以东最强台风

南方都市报
2026-07-26 09:06:54
你见过自己“作死”的吗?网友:为一个小姐,从复旦大学退学结婚

你见过自己“作死”的吗?网友:为一个小姐,从复旦大学退学结婚

小虎新车推荐员
2026-07-25 00:28:23
必须拥核!日本或成第二个乌克兰?不用中国出手,2.5万人直接冲

必须拥核!日本或成第二个乌克兰?不用中国出手,2.5万人直接冲

冰语历史
2026-07-26 11:26:37
小S一家现身上海一酒吧被偶遇,小S举着酒杯,摇头晃脑,很开心!

小S一家现身上海一酒吧被偶遇,小S举着酒杯,摇头晃脑,很开心!

爱八卦的晓请
2026-07-26 08:47:22
心照不宣地放任失业,是大国经济崩盘的根源?

心照不宣地放任失业,是大国经济崩盘的根源?

文化纵横
2026-07-14 16:45:46
梅洛尼成绩单出炉,欧洲目瞪口呆,和中国的生意,意大利一件没落

梅洛尼成绩单出炉,欧洲目瞪口呆,和中国的生意,意大利一件没落

锅锅爱历史
2026-07-25 23:37:16
王虹回国任教应该没戏!马克龙直接电话祝贺,法国教育部长、国防部长都祝贺,还有终身教授身份,一网友发帖,引发轩然大波

王虹回国任教应该没戏!马克龙直接电话祝贺,法国教育部长、国防部长都祝贺,还有终身教授身份,一网友发帖,引发轩然大波

火山詩话
2026-07-25 11:52:42
闹得全网刷屏的传闻,说71岁敬一丹突发重病抢救,最新真实情况终于澄清

闹得全网刷屏的传闻,说71岁敬一丹突发重病抢救,最新真实情况终于澄清

情感大头说说
2026-07-26 09:58:38
邓煜大二转学美国拿菲尔兹奖,回国仅能评A3人才,级别不如省级专家!

邓煜大二转学美国拿菲尔兹奖,回国仅能评A3人才,级别不如省级专家!

眼光很亮
2026-07-26 10:33:39
美以终于意识到闯了大祸,可以轰炸伊朗,但斩首哈梅内伊真错了!

美以终于意识到闯了大祸,可以轰炸伊朗,但斩首哈梅内伊真错了!

一叶禅林
2026-07-26 01:06:12
我53岁,守寡20年早没了那想法,今年跟43岁小伙搭伙一切都变了

我53岁,守寡20年早没了那想法,今年跟43岁小伙搭伙一切都变了

风起见你
2026-07-25 09:30:49
美前国务卿语出惊人:日本可能先发动三战,且会对3个国家动手

美前国务卿语出惊人:日本可能先发动三战,且会对3个国家动手

旧窗老街
2026-07-25 14:32:36
30岁女生徒步318国道六个半月,从苏州走到西藏,路上捡了只巨贵犬

30岁女生徒步318国道六个半月,从苏州走到西藏,路上捡了只巨贵犬

捣蛋窝
2026-07-25 16:43:33
2026-07-26 13:00:49
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3483文章数 11186关注度
往期回顾 全部

科技要闻

传DeepSeek 100亿元新一轮融资突然放缓

头条要闻

高考699分的河南女孩被清华录取 此前因提建议遭网暴

头条要闻

高考699分的河南女孩被清华录取 此前因提建议遭网暴

体育要闻

拿过两个金球奖,却说它只值10英镑

娱乐要闻

谢贤前女友Coco直播崩溃落泪!

财经要闻

德法带头反水 欧盟制裁俄罗斯沦为笑话

汽车要闻

轿跑姿态+大空间/标配655km续航 奇瑞风云A9置换价10.68万起

态度原创

亲子
游戏
时尚
家居
军事航空

亲子要闻

初一竟然第一次学会走路啦!

PS6内存或被限制在30GB 次世代主机升级幅度引热议

夏天裤子别越买越多,还是黑色长裤最不挑人,百搭舒适又显瘦

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

美国考虑对第8国动武

无障碍浏览 进入关怀版