网易首页 > 网易号 > 正文 申请入驻

Strata让2080Ti跑起了125B大模型,速度比llama.cpp快了一个量级

0
分享至



在自己电脑上跑大模型,2026 年不算新闻。但用两张 2018 年的 2080 Ti,跑一个总参数 1250 亿的 MoE 模型,生成速度 75 token/s——这事搁一年前我不敢想。这台机器现在天天在我家跑着,我的 AI 编程助手就连着它用。这篇把机器配置、环境、部署步骤、应用接入全写清楚,想折腾的照着来就行。

一、先说结果

  • 模型:Qwen3.8-Flash-Next,125B 总参数 MoE,IQ3_XXS 量化(文件 71GB)
  • 硬件:2× RTX 2080 Ti 22G + 64GB 内存 + 十年前的服务器 CPU
  • 实测:生成 75 token/s,262K 上下文,专家缓存命中率 97.7%
  • 用途:局域网 OpenAI/Anthropic 双兼容 API,直接接 opencode / Claude Code / Codex
二、机器配置

部件

我的配置

GPU

2× RTX 2080 Ti22G

改装卡,原厂 11G;官方支持列表要求 12GB 起

CPU

Xeon E5-2696 v4,22 核 44 线程

仅 AVX2、无 AVX-512,引擎自动走 AVX2 内核

内存

64GB DDR3

系统实际可见 62GB;IQ3_XXS 需要引擎锁约 40GB 进内存

磁盘

NVMe SSD,预留 80GB+

模型 71GB + 引擎数据 9.4GB

系统

Ubuntu 24.04.4 LTS

Windows 同样支持,双击 START-HERE.bat



选型上两句话:

  • 显存容量比显卡新旧重要。官方在 RTX 5070(12G)单卡测 IQ3_XXS 是 62 token/s,我两张老卡合计 44G 反而跑到 75——专家装不进显存的时候,显存里塞得下的专家越多,速度越快。
  • 内存决定能跑哪个量化档。我这样 64GB 跑 IQ3_XXS 刚好够用;32GB 机器选 Coder 版(砍一半专家、专攻代码);想跑最大的 IQ3_S,备 96GB。
三、环境准备
  1. 显卡驱动:我装的是 595.84(自带 CUDA 13.2)。NVIDIA 官方驱动即可,AMD 走 HIP 后端,同一引擎。
  2. 磁盘:给模型留 80GB 以上,强烈建议 NVMe——引擎运行时要持续读一张 28.8GB 的 n-gram 表。
  3. 其他都不用管:Strata 的 setup 脚本会检测你的卡、自动编译引擎。我的机器上它编译出 sm_75(图灵架构,正是 2080 Ti)的 CUDA 引擎,版本 0.1.39,全程没有手动装依赖。
四、部署步骤(Linux,Windows 同理)

git clone https://github.com/Niko1221/Strata
cd Strata
HF_ENDPOINT=https://modelscope.cn ./setup.sh

HF_ENDPOINT 是关键:Strata 的安装脚本原生支持这个环境变量切换下载源。国内直接指向ModelScope(同一个 GSQ-RCO 量化版在 ModelScope 上有同名仓库);备选 hf-mirror.com,它代理 HF 原站,能拿到脚本锁定的快照版本。ModelScope 的 commit 历史和 HF 独立,脚本找不到锁定的 commit 时会自动回退到仓库当前版本——我实测走得通。71GB 下载中断后重跑即续传。之后 setup 编译引擎、生成配置 strata-iq3_xxs.json、启动服务并打开自带 Web App。

setup 依次问你四个问题,回车即推荐项:

  1. 模型与尺寸:我选 IQ3_XXS(它按你的内存推荐,32GB 会推荐 Coder)
  2. 上下文长度:我选 262144(262K)
  3. 是否读图:是(额外下载 866MB 的 mmproj)
  4. 多卡:检测到两张卡自动启用

第一次启动会卡 1–3 分钟,先说在前面:日志里 loaded 39.97 GiB at 1.46 GiB/s,是它把 40GB 专家权重锁进内存,不是装坏了。窗口有进度显示,别慌、别关。之后每次启动几秒就绪。

五、我的关键配置分享

这些参数配置在 Strata 文件夹下的 strata-iq3_xxs.json 里——setup 生成的,"args" 数组就是引擎的全部启动参数。想改配置(上下文、并行数这些),直接编辑这个 json 再重启;或者重跑 ./setup.sh --setup 重新选一遍(注意:重跑 setup 会重写它管理的参数,你手动加进 "args" 的参数要再加一次)。引擎实际收到的命令长这样(路径为官方默认位置:模型文件放在 Strata 文件夹旁边的 Strata-data/ 里):

strata --serve \--pack ../Strata-data/packs/iq3_xxs \ # 预打包专家权重(1.5GB, 最大块仅2.33MB)--native ../Strata-data/models/IQ3_XXS/Qwen3.8-Flash-Next-GSQ-RCO-IQ3_XXS-00001-of-00002.gguf \--ple-gguf ../Strata-data/models/IQ3_XXS/Qwen3.8-Flash-Next-GSQ-RCO-IQ3_XXS-00002-of-00002.gguf \ # PLE 分片(n-gram 表)--expert-profile data/expert-profile.bin \ # 24576 个专家的热度排序(仓库自带)--expert-cache auto \ # 自动决定显存装多少专家--prefill auto \ # 自动选最大 prefill 分块--spec 4 --spec-min-p 0.5 \ # 推测解码: 猜4验4, 接受阈值0.5--mtp ../Strata-data/mtp/rt \ # MTP 草稿层(787MB)--max-context 262144 \ # 262K 上下文--kv int8 --kv-resident 32768 \ # KV int8 量化, 32K 常驻显存--remote-expert-opt \ # 允许跨卡借用专家--vision --vram-reserve-mib 700 \ # 每卡预留 700MB 给视觉进程--layer-split auto # 双卡自动分层(实测切在 K=26)

几点心得:

  • 双卡能不能跑好,全看 --layer-split auto 和 --expert-cache auto:引擎实测两卡各 0.65ms/层,自动决定 48 层怎么切(K=26)、每张卡显存装哪些专家(合计 11,466 个,16.65GB),不用手工调。
  • --kv int8 --kv-resident 32768是 262K 上下文开起来的原因:KV 量化成 int8,最热 32K 段常驻显存,其余从内存流式读(实测 96.9% 读命中显存)。
  • --spec 4比默认激进一点,配合 0.5 接受阈值,草稿接受率约六成,净赚 1.6 倍以上。
  • --vram-reserve-mib 700:开视觉时每卡留 700MB,代价是专家缓存略小、文本慢几个百分点,要不要视觉自己权衡。



六、怎么接进你的应用

局域网里任何应用,填对 base URL 就能接。服务端没配 key 时客户端的 API key 随便填;我配了自定义 key,客户端要填同一个:

// opencode(以及任何 OpenAI 兼容客户端){ "baseURL": "http://192.168.1.71:8080/v1", "model": "qwen3.8-flash-next-iq3_xxs" }// Claude CodeANTHROPIC_BASE_URL=http://192.168.1.71:8080// Codex CLI: 用 /v1/responses 端点

几个要注意的:

  • 它是思考型模型,max_tokens 给够(≥2048),否则只输出推理段、没有正文。
  • 思考强度可在请求里调 reasoning_effort: off/low/medium/high,日常代码任务用 medium 就够。
  • 默认一次只处理一个请求;多人共用要开 "parallel": 2,小显存卡会变慢。

不接应用也有自带入口:打开 http://127.0.0.1:8080 的 Chat 页直接聊。



七、实测成果

指标

实测值

生成速度

75 token/s(IQ3_XXS,双 2080 Ti)

专家缓存命中率

97.7%(11,466 个专家常驻显存,覆盖 99.4% 的实际路由)

上下文

262K token

视觉输入

支持(独立 strata-vision 进程,每图 0.1–0.5s)

API

OpenAI /v1 + Anthropic /v1/messages + Responses

75 token/s 什么概念?人一分钟读三四百字,它一分钟吐四五千 token,聊天时你完全不用等它。



八、“比 llama.cpp 快一个量级”——实测依据,也说适用条件

  1. 我自己的对照:同一台机器,llama.cpp 跑 IQ2_XS(比 IQ3_XXS 更小更快的档),即使上下文很短,解码也只有十几 token/s;IQ3_XXS 只会更慢。Strata 跑 IQ3_XXS 是 75 token/s——专家装不进显存的情况下,差距确实是一个数量级
  2. 为什么差这么多:这个模型量化后 71GB,我两卡显存合计 44GB 装不下全部专家,llama.cpp 只能每 token 从内存/SSD 随机抓 10 个专家权重,每层都在等 IO。需要说明:llama.cpp 也支持 MTP 推测解码(--mtp),推测谁都能开——但它救不了专家装不进显存的情况:草稿层同样是 MoE,权重也在外面,猜词本身就贵;验证一遍仍要逐层从内存/SSD 读专家,省下来的有限。Strata 的推测解码是架在”97.7% 专家读命中显存”这个缓存之上的,所以能实打实快 1.6 倍。差距的大头在专家缓存和 CPU/GPU 并行计算,推测解码只是把这个差距进一步拉开。
  3. 不过有一说一:官方社区在同型机器(2× MI50 16GB + Xeon E5 v3)上,用能整个装进显存的 Coder IQ1_M 测过:llama.cpp 26.9 token/s,Strata 50 token/s。模型能整个塞进显存时,差距是 2 倍左右,不是一个量级

它凭什么快?懂行的看这一段就够:模型 24,576 个专家每 token 只激活 10 个,Strata 把最热的装显存(边聊边学、动态换入换出)、全部专家钉在内存里、没命中的由 CPU 和 GPU并行计算;再用 MTP 层猜 3 个词 + n-gram 表猜 5 个词、一次前向验证,平均一轮产出 2.4–3.2 个词——把 offload 最贵的”取权重”成本摊薄了近 3 倍。稀疏性、量化、推测解码、小 KV,这几件事环环相扣,缺一样都到不了这个速度。





九、总结

一张 12G 以上的老卡 + 64GB 内存 + 一块 NVMe,2026 年就能全离线跑一个够聪明的大模型当 Agent 后端。我的两台 2080 Ti 大概还能再战两年。

模型:Qwen3.8-Flash-Next(Qwen 团队);引擎:Strata(MIT 开源,github.com/Niko1221/Strata);量化:ISTA-DASLab GSQ-RCO。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
网传董明珠被停职审查、转移资产、搞办公室恋情?董明珠真假辩!

网传董明珠被停职审查、转移资产、搞办公室恋情?董明珠真假辩!

乐天闲聊
2026-10-08 13:28:50
俄罗斯为啥会突然破例向中国供应重型发动机?因为俄方心里明白:所谓中国发动机的动力短板,对中方而言绝不可能永远是道坎!

俄罗斯为啥会突然破例向中国供应重型发动机?因为俄方心里明白:所谓中国发动机的动力短板,对中方而言绝不可能永远是道坎!

扶苏聊历史
2026-10-08 13:30:18
匈牙利公开秘密警察档案:告密者就是你意想不到的那一个

匈牙利公开秘密警察档案:告密者就是你意想不到的那一个

通往远方的路
2026-10-08 09:03:59
中国大满贯!女单4强赛对阵,国乒4人出局,王艺迪再战张本美和

中国大满贯!女单4强赛对阵,国乒4人出局,王艺迪再战张本美和

南海浪花
2026-10-09 04:33:41
难以置信!网传山东考生620分考入哈工程自动化,国庆毅然返乡复读,宿舍床位已全部清空

难以置信!网传山东考生620分考入哈工程自动化,国庆毅然返乡复读,宿舍床位已全部清空

火山詩话
2026-10-08 08:30:15
高芙因种族歧视退赛?小威教练发文怒怼:这是种族主义

高芙因种族歧视退赛?小威教练发文怒怼:这是种族主义

绿茵狂热者
2026-10-08 21:39:36
贵州女子在恒信奔驰4S店花37.2万元买GLC300L,交付当天迟迟不见车,多方追问才知被撞了;车主要退换车,4S店提出补偿5000元+1年延保遭拒

贵州女子在恒信奔驰4S店花37.2万元买GLC300L,交付当天迟迟不见车,多方追问才知被撞了;车主要退换车,4S店提出补偿5000元+1年延保遭拒

扬子晚报
2026-10-08 18:34:03
随着大藤沙月0-3,WTT中国大满贯女单八强已诞生7席:4大前十悍将在列

随着大藤沙月0-3,WTT中国大满贯女单八强已诞生7席:4大前十悍将在列

侧身凌空斩
2026-10-08 20:53:55
“遇见你,这辈子都到头了!”苏州电网的清华硕士相亲被嫌弃,女方自制“简历式”表格,阐述自己的优势!

“遇见你,这辈子都到头了!”苏州电网的清华硕士相亲被嫌弃,女方自制“简历式”表格,阐述自己的优势!

林林先生
2026-10-08 11:13:30
今年十一,县城没人吃喜酒了,婚姻成了奢侈品

今年十一,县城没人吃喜酒了,婚姻成了奢侈品

每日人物
2026-10-06 10:28:02
江淮跌停,尊界翻车,华为回应为何如此傲慢?

江淮跌停,尊界翻车,华为回应为何如此傲慢?

凤眼论
2026-10-08 19:17:27
河南警嫂赵君杰为夫喊冤被抓,被告人、被害单位均要求异地审理

河南警嫂赵君杰为夫喊冤被抓,被告人、被害单位均要求异地审理

法治边角料
2026-10-08 08:55:42
网友直播猛踩尊界V800刹车:上万人观看,狂收礼物

网友直播猛踩尊界V800刹车:上万人观看,狂收礼物

三言科技
2026-10-08 22:47:16
央视曝光电诈头目!涉案超27亿,赵薇也被卷入舆论,事情不简单!

央视曝光电诈头目!涉案超27亿,赵薇也被卷入舆论,事情不简单!

娱乐洞察点点
2026-10-08 16:55:56
高三老师面相吓到网友,堪称“骨灰级别”,就算这样也舍不得化妆

高三老师面相吓到网友,堪称“骨灰级别”,就算这样也舍不得化妆

世界圈
2026-10-08 09:21:41
中国计划提名宋莉竞选下一任世卫组织总干事,中方:相信如果宋莉博士当选,将有助于这一组织在提升全人类健康福祉方面发挥更为积极的作用

中国计划提名宋莉竞选下一任世卫组织总干事,中方:相信如果宋莉博士当选,将有助于这一组织在提升全人类健康福祉方面发挥更为积极的作用

政知新媒体
2026-10-08 15:39:26
莫迪开启“惩罚性威慑”,特朗普派五代机助阵,中印边境或将大乱

莫迪开启“惩罚性威慑”,特朗普派五代机助阵,中印边境或将大乱

面包夹知识
2026-10-08 17:10:19
鼠疫北来,不寒而栗

鼠疫北来,不寒而栗

神不隆通
2026-10-08 10:25:58
高芙:我被中国球迷网暴,我不是小偷!谁料美国网友抨击更猛烈

高芙:我被中国球迷网暴,我不是小偷!谁料美国网友抨击更猛烈

军情观察家
2026-10-08 16:22:34
曾拒唱国歌!前U17国足核心消失18个月后改过自新:我热爱中国

曾拒唱国歌!前U17国足核心消失18个月后改过自新:我热爱中国

念洲
2026-10-08 21:37:15
2026-10-09 05:47:00
侃故事的阿庆
侃故事的阿庆
几分钟看完一部影视剧,诙谐幽默的娓娓道来
642文章数 9602关注度
往期回顾 全部

科技要闻

江淮汽车回应"尊界V800刹车踏板支架断裂"

头条要闻

女局长被举报婚内出轨至少9人 大量亲密聊天记录公布

头条要闻

女局长被举报婚内出轨至少9人 大量亲密聊天记录公布

体育要闻

30天30队·鹈鹕:胖虎又一年“如果”

娱乐要闻

演员王晓慧刚担女主,就被曝已婚生子

财经要闻

央行:中国从不搞竞争性货币贬值

汽车要闻

特别版配色/碳纤尾翼 2027款深蓝L06将于10月9日上市

态度原创

教育
本地
艺术
健康
公开课

教育要闻

愤怒!学校没布置作业,有家长提议做手抄报博好感,老师一句话让全班家长被迫“加班”

本地新闻

转型再出发 奋勇打头阵

艺术要闻

炸裂!龙门石窟首次发现造像琉璃眼珠,千年佛像竟“睁眼”了,熠熠闪光品相逆天!

痘坑留下后,还能填平吗?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版