想本地跑大模型,硬件配置往往跟着模型规模一起攀升。
参数越大,对显存、算力和整机性能的要求就越高。
至于千亿参数级别的旗舰模型,在家用电脑上跑,那更是想都不敢想
今天介绍的开源项目:Colibri 则提出了不一样的思路。
![]()
01 项目介绍
Colibri 是一个用纯 C 写的专跑 MoE 大模型推理引擎。
MoE 架构特点:
744B 参数的模型,每生成一个 token,真正激活的参数只有约 400 亿。
而激活这一部分,相邻的两个 token 之间被换掉的大约只有 11 GB。
![]()
02 项目亮点
1.磁盘流式加载专家:
Colibri 把显存、内存和硬盘看成同一层存储。
模型权重以 int4 格式躺在 NVMe 上,需要哪层专家就按路由热度流式读上来。
它还会把我们常用的专家记一个学习缓存,每次对话更新,并把最热门的专家记在内存里。
2.压缩状态,不篡改模型:
KV 缓存比原来压缩了 57 倍。
每个 token 为 576 个 浮点数,而非原本的 32768 个。
并支持跨重启持久保存 :
对话可暖启恢复,不需重新预填充,结果与之前相同。
3.原生 MTP 推测解码:
GLM-5.2 原生 MTP head 会起草 token,再由主模型一次前向验证 2.2 到 2.8 个 token。
PS:MTP head 必须是 int8,选错就不会有作用。
4.OpenAI 兼容 API:
上述命令可以起一个 OpenAI 兼容的 API。
任何支持自定义 OpenAI 端点的客户端都能接入。
03 快速入门
1.前置: 程序(几百 KB)和模型(372 GB)。
2.安装:
从 Releases 下载对应平台的预编译包,Linux、macOS、Windows 都有:
mkdir colibri && tar xzf colibri-v1.8.0-linux-x86_64.tar.gz -C colibri && cd colibripython3 coli info # engine ready ✓
解压即用,只需装好 Python 3 就行(Python 只负责启动器和 API 网关)。
至于模型,在 Hugging Face 上有转好的 int4 版本,约 372GB:
也支持自己从 FP8 源转换,无需一次性腾出 756GB:
./coli convert --model /nvme/glm52_i4 # 逐 shard 下载并转换(仅此一次需要 python)3.运行:
COLI_MODEL=/nvme/glm52_i4 ./coli chat # 自动检测 RAM 预算、缓存与 MTPCOLI_MODEL=/nvme/glm52_i4 ./coli plan # 查看规划的 VRAM/RAM/磁盘配置COLI_MODEL=/nvme/glm52_i4 ./coli doctor # 只读就绪检查./coli web --model /nvme/glm52_i4 # 在同一端口提供 API 与网页仪表盘./coli serve --model /nvme/glm52_i4 # 仅提供 OpenAI 兼容 API
04 结语
Colibri 价值在于:25 GB 内存也可以跑千亿参数大模型。
如果你也硬件有限,但又想持有而非租用智能,不妨试试。
谢谢你阅读我的文章~
我们下期再见!
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.