消费级显卡的显存天花板,被一张RTX 4090捅穿了。海外极客在Ubuntu系统上,用一张普通24G显存的RTX 4090,外加110G白菜价DDR4内存,把125B参数的Qwen 3.8 Flash Next模型跑了起来。上下文窗口直接拉到25万,解码速度稳定在每秒21个词。
过去跑这种百亿千亿级模型,通常要租几张A100组成数据中心集群。这次跑出的成绩单里,预填充速度达到每秒364词,解码速度每秒21词。更关键的是,全程没开MTP、没开dflash,连KV缓存都没做任何量化。
![]()
24G显存怎么塞下125B模型还带25万上下文
核心秘密藏在llama.cpp最新分支的一个参数里:-cmoe。这个功能把512个专家层全部卸载到廉价的系统内存,只把最吃计算的注意力机制留在4090显存里。显存占用从24G暴跌到11.6G,解码速度几乎没有损耗。
空出来的12G显存全部拿去放上下文,窗口一路顶到250,000的绝对上限。跑完之后,显存还剩5个多G的余量。再把batch设到4096,提示词处理速度直接翻倍。
消费级显卡能跑的模型规模被重新定义
以前大家普遍认为,消费级显卡只能跑7B到27B的小模型。这次MoE架构加上内存卸载的组合,把数据中心级别的模型能力塞进了家用电脑。本地折腾私有大模型和超长Agent的场景,门槛被大幅拉低。
整套方案的关键点可以拆成三块:
- 512个专家层全部卸载到DDR4系统内存,注意力机制留在显卡显存
- 显存占用从24G降到11.6G,空出的空间全部用于扩展上下文
- batch设为4096后,提示词处理速度翻倍,解码速度保持每秒21词
从结果看,这套组合拳没有牺牲推理速度,也没有依赖量化手段。对想在本地跑大模型、处理超长上下文的开发者来说,硬件门槛第一次被压到了单张消费级显卡的级别。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.