一个27B参数的大模型,体积从54GB压到7.89GB,然后跑在一台16GB内存的普通笔记本上。这不是概念演示,是已经放出来的预览版模型,名字叫Saluki。
它的底座是Qwen3.8-27B,做法是约2-bit量化。体积缩了将近7倍,硬件门槛跟着一起掉下来——16GB内存的设备就能本地跑起来,兼容llama.cpp,适合自己部署。
![]()
它到底能干什么
官方给出的定位很明确:本地Agent和工具调用。这类场景不需要模型什么都懂,但需要它在关键动作上别掉链子。
看数据,工具调用选择正确率是47/48,这个数字相当能打。编程修复任务上,SWE-bench拿到30/50,全精度原模型是33,差距不大。
换句话说,在它主打的这两件事上,压缩带来的损失被控制住了。
代价也很清楚
数学能力保留原模型的82%–85%,这个降幅不算小。复杂并行工具调用则卡在格式解析上:严格评分只有42/100,换成宽松格式解析能提到55/100。
也就是说,模型知道该调什么工具,但多个工具一起调的时候,输出格式容易出问题。这是量化之后比较典型的瓶颈。
整体基准略逊于全精度版本,这个结果不意外。取舍的逻辑是:牺牲一部分通用能力,换本地可运行。
为什么这件事值得看一眼
27B级别的模型过去基本和消费级笔记本无缘,要么上云端,要么配大显存。7.89GB这个体积把门槛拉到了另一个区间。
目前Saluki是Apache 2.0许可的预览版,可以自由使用和修改。对想在本地搭Agent、又不想依赖云服务的人来说,这是一个新的选项。
它不完美,数学弱了,并行调用还不稳。但它证明了一件事:把大模型塞进普通电脑,路子是通的。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.