网易首页 > 网易号 > 正文 申请入驻

老平台+3060 12G硬扛Qwen3.6 35B:实测10+ tokens/s

0
分享至

21GB 大模型塞进 24G 内存,老平台也能跑 35B 带推理的ai模型

最近折腾本地大模型,主流声音都是"3060 12G 跑 14B 到顶了,35B 模型要 24G 显存,AI 推理是高端显卡的天下。

但实测发现是被 dense 模型经验带偏的偏见**。

我手头这台机器是几年前攒的:
- **GPU**:RTX 3060 12G
- **内存**:24G DDR4(21GB 装下整个模型)
- **CPU**:i5-3820(Intel 第三代 Ivy Bridge,2012 年发布,4 核 4 线程)

跑 Qwen3.6 35B(35B 总参 MoE + MTP,激活 5-8B)Q4 量化 GGUF(21GB 文件),32K context,**实测 10+ tokens/s**。

是的,老平台 + 入门显卡 + 24G 内存,跑 35B 大模型。

下面把完整方案、原理、调优、误区一次性讲清楚。

一、为什么"反常识"可行?—— MoE 模型的工作方式

传统 dense 模型(比如 Qwen2.5-32B-Instruct):
- 总参数 32B** = 每次前向传播用到的参数
- 显存 = 模型大小
- Q4 量化下要 **~18G 显存**,3060 12G 跑不动

而 MoE(Mixture of Experts)模型**完全不同:
- 总参数 35B,但每次只激活 5-8B**
- 显存 = 全量(所有专家都要能访问到)
- 但**计算量只跟激活参数有关**——跟你跑 5-8B dense 模型差不多

所以 Qwen3.6 35B 的真实需求是**:
- 模型文件:**21GB**(Q4_K_M 量化)
- 显存:**只需要装下"被路由到的几个专家"**——5-8B Q4 也就 3-6GB
- 剩下的层:**放在内存甚至 SSD 上**,通过 mmap 按需加载

这就是为什么"35B 大模型"听起来吓人,但**实际资源占用比 14B dense 还小**。

二、硬件配置(极限案例)

| 组件 | 配置 | 说明 |
|------|------|------|
| GPU | RTX 3060 12G | 入门游戏卡,AI 推理性价比之王 |
| 内存 | 24G DDR4 | **关键**——21GB 模型主力放这里 |
| CPU | i5-3820(Ivy Bridge,2012)| 老平台,计算量小所以够用 |
| 存储 | NVMe SSD | mmap 直接读模型文件,速度比 HDD 快 10x |

24G 内存跑 21GB 模型是极限——理论需要 21GB 模型 + 系统开销。靠 Ollama 的自动 mmap + 部分层 SSD swap 才能稳定跑。

如果你有 32G / 48G 内存,体验会更从容**,KV cache 完全在内存,32K context 不卡。

三、实测性能

| 指标 | 数值 |
|------|------|
| 模型 | **Qwen3.6 35B MoE + MTP** Q4_K_M(GGUF) |
| 模型文件大小 | 21GB |
| GGUF 来源 | 千问社区官方(huggingface.co/Qwen)|
| 框架 | Ollama |
| Context | 32K |
| 速度 | 10+ tokens/s(日常输出稳定 10-12)|
| GPU 占用 | ~45%(约 5-6GB,热点专家)|
| 内存占用 | ~54%(约 13GB)|
| 启动命令 | `ollama run qwen3.6:35b` |

**关键观察**:24G 内存只占 13GB——**不是因为没加载完整模型**,而是剩下的 8GB 专家在 SSD 上通过 mmap 透明加载。Ollama 自动按访问频率调度。

四、上手步骤(5 分钟跑起来)

1. 安装 Ollama(Windows)

去 [ollama.com](https://ollama.com) 下载 Windows 安装包,建议问一下豆包,找个国内网速快的网站下载,然后一路 Next。

2. 拉取模型

```bash
ollama pull qwen3.6:35b
```

或者如果上面 tag 不可用:

```bash
ollama pull qwen3:35b
ollama pull qwen3-35b-a3b
```

任选一个能拉到的,Ollama 会自动选 Q4 量化。

3. 跑起来

```bash
ollama run qwen3.6:35b
```

第一次启动会等几秒加载模型,之后就是对话界面。

4. 验证效果

```bash
ollama ps
```

看 GPU/内存分配是否符合预期。

五、调优(从 10 → 14-18 tokens/s)

默认配置能跑 10+ token/s,但通过几个环境变量可以再榨 30-50%。

1. KV cache 量化(最大收益)

```bash
set OLLAMA_KV_CACHE_TYPE=q8_0
```

32K context 的 KV cache 占显存很大,量化到 Q8 能省 40-50% 显存 → 给 GPU offload 更多空间 → 速度直接上 14+。

2. Flash Attention 开启

```bash
set OLLAMA_FLASH_ATTENTION=1
```

长 context 必备,节省显存 + 加速计算。

3. 智能 GPU offload

```bash
set OLLAMA_NUM_GPU=99
```

让 Ollama 智能决定哪些层上 GPU。

4. Context 按需用

```bash
set OLLAMA_CONTEXT_LENGTH=8192
```

日常聊天/写代码用 8K 足够(KV cache 减少 75%),长文本分析才用 32K。

一键调优脚本(Windows)

把下面内容存成 `start_qwen3_6_35b.bat`:

```bat
@echo off
set OLLAMA_KV_CACHE_TYPE=q8_0
set OLLAMA_FLASH_ATTENTION=1
set OLLAMA_NUM_GPU=99
set OLLAMA_CONTEXT_LENGTH=8192
ollama run qwen3.6:35b
```

双击就用最优配置启动。

六、关键原理:三层 offload 策略

跑 35B Q4 21GB 模型的本质是**把模型按"访问频率"分三层**:

```
┌──────────────────────────────────────┐
│ GPU (5-6GB) │ ← 热点专家
│ - 当前激活的 5-8B 路由 │ 每 token 都用
│ - 32K KV cache │
└──────────────────────────────────────┘
↑ 按需调度(PCIe 几百 GB/s)
┌──────────────────────────────────────┐
│ 内存 (13GB) │ ← 主力专家池
│ - 高频访问的专家 │ 几十 token 触发一次
│ - 上下文缓存 │
└──────────────────────────────────────┘
↑ mmap 按需加载(NVMe 几 GB/s)
┌──────────────────────────────────────┐
│ SSD (剩余 8GB 模型 + 系统) │ ← 冷门专家
│ - 不常激活的专家 │ 几乎不访问
│ - 通过 mmap 透明加载 │
└──────────────────────────────────────┘
```

**这就是 24G 内存能跑 21GB 模型的关键**——不是把所有模型都塞内存,而是**用访问频率分层**,老平台也能跑得飞起。

**冷门专家在 SSD 上靠 mmap 加载,速度瓶颈是 NVMe 带宽**。NVMe 一般 3-7 GB/s 顺序读,21GB 模型按需访问只触发几 MB/s 的流量——足够支撑 10+ token/s。

七、适用场景

| 场景 | 推荐度 | 备注 |
|------|--------|------|
| 日常聊天 / 写代码 / 数据分析 | ⭐⭐⭐⭐⭐ | 主力场景 |
| 量化交易回测 / 财报分析 | ⭐⭐⭐⭐⭐ | 写代码快 |
| 长文本总结(32K context)| ⭐⭐⭐⭐ | 完全够用 |
| 大批量 token 输出(>10K)| ⭐⭐⭐ | 受限于 CPU-SSD 带宽 |
| 实时语音对话(要 30+ t/s)| ⭐ | 不适合,需要更高端卡 |
| 多用户并发 | ⭐ | 单请求最佳 |

八、常见误区澄清

**❌ "35B 模型需要 35G 显存"**
→ 错。MoE 模型激活参数小(5-8B),3060 12G 也能跑。

**❌ "24G 内存装不下 21GB 模型"**
→ 极限但可行。靠 mmap + SSD swap,模型文件直接映射到虚拟地址空间。

**❌ "CPU 太老跑不动 AI"**
→ 错。计算量小(5-8B 激活),CPU 瓶颈不在算力而在数据搬运,**SSD 速度决定一切**。

**❌ "Q4 精度会严重影响效果"**
→ 不会。Q4_K_M 在大多数任务上和 FP16 几乎无差别,速度却快 2-3 倍。

**❌ "必须用 Linux + vLLM 才能跑"**
→ 不一定。Ollama 在 Windows 上完全够用,vLLM 的 Linux 优势主要在多卡 + 生产级吞吐。

**❌ "老 CPU + 老平台跑 AI 是浪费电"**
→ 错。激活参数小 + MoE 路由对算力要求低,老 CPU 主要是数据搬运瓶颈,NVMe 速度够就行。

九、Q&A

**Q:为什么不直接用 Qwen2.5-32B dense 模型?**
A:Qwen2.5-32B 是 dense,Q4 要 ~18G 显存,3060 12G 跑不动;Qwen3.6 35B MoE 激活 5-8B 只需 3-6G 显存。

Q:MTP 是什么?有什么用?**
A:Multi-Token Prediction,训练时让模型一次预测多 token,推理时如果接受预测能加速 1.5-2 倍。

Q:21GB Q4 文件怎么算出来的?**
A:Q4_K_M 量化每个参数约 0.6 字节,35B × 0.6 ≈ 21GB。如果 Q8 量化就是 35GB,FP16 是 70GB。

Q:和云端 API 比,本地跑有什么优势?**
A:① 隐私(数据不出本机)② 离线可用(断网也能跑)③ 不限量 ④ 单位时间成本低(边际电费)。

Q:3060 12G 跑 70B 模型可行吗?**
A:可以,但体验会差。70B Q4 量化下模型 ~40GB,得大量 SSD swap,速度 1-3 token/s。24G 内存建议跑到 35B MoE 为止**。

Q:要不要升级到 4060 Ti 16G / 3090 24G?**
A:看你需求。
- 4060 Ti 16G:显存多了 4G,能跑更多 dense 模型,但内存瓶颈仍在
- 3090 24G:显存够跑 35B dense(不用 MoE),但二手价格 ¥3500+
- 当前配置已经够用,如果不是刚需,先熟练一段时间,ddr5最近价格小幅下降,ai预测明年下半年会有显著降幅,升级前先想清楚 ROI

Q:i5-3820 不是 2012 年的吗?真能跑 AI?**
A:能跑。AI 推理在老 CPU 上的瓶颈是数据搬运,不是算力。CPU 只负责:
1. 调度专家路由
2. 搬运 SSD → 内存 → GPU 的数据
3. 不参与矩阵运算(那是 GPU 的事)

老 CPU 完全够用。

## 十、给"AI 入门者"的话

2026 年跑本地大模型的成本已经低到不可思议了。

3 年前跑 7B 模型都要 RTX 3090 24G,现在 **3000 块的 3060 12G 就能跑 35B MoE**。

**AI 不会抛弃普通人**——它正在被硬件和工程优化推平。

如果你手里有:
- 任何 6G 以上的 N 卡(1060 6G 起步)
- 16G 以上内存
- 一块 NVMe SSD

就能跑 Qwen3.6 35B Q4 量化版,**速度 5-10 token/s,日常用完全够**。

门槛从来没这么低过。

有问题欢迎评论区讨论。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
御用名医曝谢贤生前猛料,难怪被曝不许柏芝再嫁,三胎生父藏不住

御用名医曝谢贤生前猛料,难怪被曝不许柏芝再嫁,三胎生父藏不住

讯崽侃天下
2026-07-26 04:30:51
非法收受财物超22亿元,杨有林一审被判死刑:犯罪情节特别严重,社会影响特别恶劣

非法收受财物超22亿元,杨有林一审被判死刑:犯罪情节特别严重,社会影响特别恶劣

每日经济新闻
2026-07-06 21:58:54
公开喊话LV,如果要离开中国市场,请干净利索的走,我们不需要你

公开喊话LV,如果要离开中国市场,请干净利索的走,我们不需要你

江启
2026-07-23 09:32:20
好消息 四川自研抗癌新药获批,疗效直接碾压传统化疗!

好消息 四川自研抗癌新药获批,疗效直接碾压传统化疗!

坠入二次元的海洋
2026-07-23 16:59:47
多名院士呼吁快停止食用,吃一口等于14斤塑料袋,女子因肾衰走了

多名院士呼吁快停止食用,吃一口等于14斤塑料袋,女子因肾衰走了

任医生聊健康
2026-06-18 22:00:09
奉劝所有上年纪的人:夫妻感情淡了,分屋睡,各花各的,跟外人似的,也别离婚

奉劝所有上年纪的人:夫妻感情淡了,分屋睡,各花各的,跟外人似的,也别离婚

十点读书
2026-07-24 20:40:13
注意:发现手机上有月亮图标,请及时关闭

注意:发现手机上有月亮图标,请及时关闭

小柱解说游戏
2026-07-17 14:02:13
又一小学通知了!北京多区中小学开学时间安排出炉!速戳了解→

又一小学通知了!北京多区中小学开学时间安排出炉!速戳了解→

辉哥说动漫
2026-07-26 03:35:31
爱德华兹警告詹皇选队内幕曝光:若不迅速决定,我就扯掉你脑袋

爱德华兹警告詹皇选队内幕曝光:若不迅速决定,我就扯掉你脑袋

坠入温柔晚风
2026-07-26 02:20:12
中国对等反制,不到24小时,欧盟急了:要求中方给他一个解释

中国对等反制,不到24小时,欧盟急了:要求中方给他一个解释

风流女汉
2026-07-25 12:09:47
同样出自北大,王虹、邓煜斩获菲尔兹奖,为何韦东奕不得奖?网友:韦神只是个网红!

同样出自北大,王虹、邓煜斩获菲尔兹奖,为何韦东奕不得奖?网友:韦神只是个网红!

谭谈社会
2026-07-25 09:25:03
电影《三国第一部:争洛阳》宣布撤档

电影《三国第一部:争洛阳》宣布撤档

澎湃新闻
2026-07-25 21:58:06
越谈越挑衅!美国已介入,11艘舰船同步逼近,菲律宾逼中方出手

越谈越挑衅!美国已介入,11艘舰船同步逼近,菲律宾逼中方出手

芳芳历史烩
2026-07-26 04:53:40
笑麻了!终于明白为啥你们一回老家就掉秤,网友:原来不止是我

笑麻了!终于明白为啥你们一回老家就掉秤,网友:原来不止是我

夜深爱杂谈
2026-07-25 22:38:33
24岁女孩找3名黑人抢劫父母,母亲被强奸杀害,父亲挨了2枪

24岁女孩找3名黑人抢劫父母,母亲被强奸杀害,父亲挨了2枪

胖胖侃咖
2026-07-21 20:00:08
江苏机关单位科室改名解读

江苏机关单位科室改名解读

娱乐圈见解说
2026-07-25 12:53:44
全体注意!A股放大招!下周超级周!

全体注意!A股放大招!下周超级周!

龙行天下虎
2026-07-25 22:48:16
台风“红霞”增强、红色预警拉响,京津冀是否会再现“台风雨”?

台风“红霞”增强、红色预警拉响,京津冀是否会再现“台风雨”?

新京报
2026-07-25 23:50:20
沙特王子伦敦酒店身亡确认死于药物混合物,年仅29岁

沙特王子伦敦酒店身亡确认死于药物混合物,年仅29岁

生活观察员啊
2026-07-25 00:25:57
勒布朗官宣加盟76人:2年800万,生涯最后一站联手马克西爱德华兹

勒布朗官宣加盟76人:2年800万,生涯最后一站联手马克西爱德华兹

林间小温柔
2026-07-26 03:11:37
2026-07-26 05:48:49
小蜜情感说
小蜜情感说
每日分享情感
456文章数 18670关注度
往期回顾 全部

数码要闻

飞利浦推出26.5" QHD 144Hz QD-OLED显示器27M2N6500NS/11

头条要闻

伊朗:摧毁美军F-15、C-17运输机等11架战机

头条要闻

伊朗:摧毁美军F-15、C-17运输机等11架战机

体育要闻

拿过两个金球奖,却说它只值10英镑

娱乐要闻

王祖贤这么缺钱吗 竟然把自己卖给了AI

财经要闻

滥用市场支配地位 携程被罚没51.79亿元

科技要闻

星舰13飞全中!20颗真卫星出舱

汽车要闻

轿跑姿态+大空间/标配655km续航 奇瑞风云A9置换价10.68万起

态度原创

本地
亲子
家居
教育
公开课

本地新闻

跟着影视去旅行:西游篇

亲子要闻

比没人生娃更可怕的事情发生了!幼儿园里的男孩开始越来越多

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

今年第一道必考题来了!!!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版