刚看到消息,感觉太扯了,又是噱头?半天憋一个字的那种,能部署,不能用,有啥意义?
仔细研究了一下,牛X!
确实在RTX 5070 12GB显卡上,跑起了 Qwen3.8-Flash-Next,这是125B的大模型,1000多亿参数!
![]()
而且不是便秘输出,短文本最高能到90多个token/s,单显卡最强模型不再是Qwen3.8-27B了,现在新王是Qwen3.8-Flash-Next了。
具体什么技术?咋实现的千亿模型塞进12G显存的?
这个项目是Strata,是一个推理引擎,简单来说,就是一个”模型运行工具“,它基于llama.cpp,专门针对Qwen3.8-Flash-Next(125B MoE)做的深度优化。
Strata最大特点就是把模型分层存储:(不只放显存了)
- 显卡:只放最高频的专家(experts)
- 内存:全部专家权重,显卡没缓存的专家,由CPU在内存中计算,CPU和显卡可以同时干活。
- 固态硬盘:放巨大的n-gram查找表。
这么操作一番,直接把千亿大模型,压到游戏电脑显卡,12G显存就能跑,同时叠加MTP推测解码技术,增加1.6倍输出速度,每秒输出50+,正经能用,不是样子货。
具体需要什么配置,我的电脑能不能跑?
黑虾整理一个简单对照:
配置
建议尝试
简评
12GB显卡+32GB 内存
Coder 版本
它删掉了一半专家,主攻代码;有网友实测,有点智障,不太建议。
12GB显卡+48GB 内存
Q2_0 或 IQ2_XS
完整专家版本。
12GB显卡+64GB 内存
IQ2_XS 优先;也可试 IQ3 版本
IQ3版本最好,输出53t/s左右。
12GB显卡+96GB内存
IQ3_S,或 Unsloth 的 UD-IQ4_XS(约 4-bit)
可以探索IQ4量化了,属于常规不降智量化了。
12GB显卡+128GB内存
UD-IQ4_XS
为所欲为,模型随便选。
1、表里的12G显卡,大于12G当然也可以,比如16G的5060Ti或5070Ti 16G,然后内存最好是64G。
2、这个项目大大降低了,对显卡显存的要求,但显存仍然有价值。更多显存可以留下更多常用专家,让 CPU 少接手一些活,项目也明确表示,增加显存会增加输出速度。
3、输出速度并不统一,不同CPU和内存,会有差异。具体来讲,高性能CPU,DDR5高频内存,高速固态硬盘,PCIe5.0的主板,这些都有利于提升输出速度。
4、给准备新装机的小白,也别只看”12GB 能跑 125B"这一句话。显卡要求是低了些,但内存要求没低,内存也不便宜 。5070 12G显卡8000多块、64G的DDR5内存又得8000多块,这就1万6了,所以整机下来,至少也要到2万块档了,而这个价格可以订阅10多年GPT Plus会员了,所以不要太冲动买硬件,具体还是要看个人使用需求。
如何部署:
不同电脑的配置不同,能部署的模型版本也不完全一样,所以这里就不贴详细部署教程了。
另外现在有Agent了,直接让Agent安装最省事,把下面这段话发给Agent就行(比如WorkBuddy,Codex,豆包工作模式)。
Set up Strata on this PC for me: https://github.com/Niko1221/Strata - follow docs/AI_SETUP.md in that repository.它会检查你的显卡、内存和硬盘,选出合适的模型,然后安装并启动。
![]()
如果想手动探索安装也可以,项目介绍里有的,这里是项目开源地址:https://github.com/Niko1221/Strata
显卡价格会因此崩吗?
笔者个人判断:应该不会,起码短期不会。
这个技术路径,把部署门槛降低了,不必须顶级显卡了,但还是需要显卡,且因为能够得着的用户变多,甚至有可能推升显卡需求。
最后:
这次Strata比较牛的就是,它开启了一个很好的技术路径,就是不只依赖显卡显存了,它把内存、硬盘和处理器都用起来。这个项目开了个头,就像“龙虾Agent”给Agent开了个头一样,后面随着技术迭代,本地部署模型的门槛,会越来越低,能力越来越强,输出速度越来越快,未来可期。
以上,希望对你有帮助。
如果想了解更多 AI 大模型本地部署,可以关注我,我会分享各种模型的部署方法和教程。
有问题评论区见。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.