![]()
本地大模型 · 版本解读 · 阅读约5分钟
先说结论:这波更新含金量很高
说白了,llama.cpp 的 0.3.0 就是一次“补短板 + 上新菜”的组合拳。最抓眼球的是新加入的 dots3-note 多模态模型——它自带一种全新的 KV 缓存类型,叫 DSA-ISWA。听不懂没关系,你就理解成给模型的“记忆本”换了个更聪明的记法。
除了新模型,这次还有三个实打实的升级:GLM-4.5-Air 支持 MTP(多词预测),生成速度有望更上一层楼;DeepSeek 4 加入了 -sm tensor 张量拆分模式,多卡用户狂喜;底层的 ggml 库也一并升到了 v0.22.0,Metal 内核改成按算子拆分、支持并行编译,编译体验明显变快。
![]()
重点提示:ggml 升级到 v0.22.0 是本次的底层重头戏,包含 meta 后端的张量拆分、按算子拆分的 Metal 内核并行编译,以及修正为非原地操作的:ggml_clamp。
dots3-note:会看图、能听声的新面孔
![]()
● WebP 图片:借助 ffmpeg 解码,以后网上扒下来的 WebP 图不用再手动转格式了。
● 视频修复:moov atom 在文件末尾的视频也能正常加载了,不再一导入就报错。
● 缩放算法:全面改用与 Pillow 一致的精确缩放算法,各模型统一纠正 resize_algo,图片喂进去不再“变形走样”。
● CLIP 图计算:同样用上了 ggml_rope_set_offset,位置编码处理更规范。
你品品,这些全是日常使用里最容易踩的坑——格式不支持、视频读不了、图片被压糊,这一版几乎挨个填平了。
DeepSeek 4 与 GLM:多卡党的福音
![]()
家里塞了好几张显卡的朋友,这次有两条好消息。
第一,DeepSeek 4 支持张量拆分了。以前想跑大模型只能按层切(pipeline),现在加个 -sm tensor 就能把每一层摊到多张卡上一起算,负载更均匀,吞吐也更容易打满。
第二,多序列回滚的 bug 修好了。说白了就是多个请求同时跑的时候,DeepSeek 4 不会再出现“串台”式的状态错乱。同时张量并行的 meta 张量拆分状态传播问题也被修复(#27574),稳定性上了一档。
另一边,GLM-4.5-Air 拿到了 MTP 多词预测支持。传统模型一个字一个字往外蹦,MTP 相当于一步预测好几个字,解码速度自然就上去了。另外 mamba2 把输入输出投影压平后从 GEMV 调度成了 GEMM,也算是个隐藏的性能甜点。
温馨提示:本次还移除了 CLI 的-no-cnv参数,如果你的老脚本还在用它,升级前记得改一下启动命令。
服务端与网页 UI:细节控狂喜
服务端这边新增了一个调试用的环境变量 LLAMA_SERVER_SLOTS_N_DIFF,可以拉宽 slot 调试差异窗口,排查并发问题时更好定位。slot 的适配逻辑也被抽到了公共的 fit 函数里,还会把 n_streams 算进去,逻辑更统一。
网页 UI 最直观的变化是——聊天对话支持标签页导航了(#27263)。你可以像开浏览器标签一样在多个会话之间来回切,快捷键也在后续修复中调顺了(#27609)。对于把 llama.cpp 当私人 ChatGPT 用的人来说,这个体验提升是肉眼可见的。
底层 ggml v0.22.0 还顺带带来了 POOL_1D、PAD_REFLECT_1D 新算子、SYCL 的 Q2_K 内核、OpenCL 上的 MoE bias 融合,以及 CUDA / Metal / Vulkan / WebGPU 等一堆后端的零散修复。grammar 解析器也修了一个小坑:\- 现在会被正确解析成字面连字符。
─── ⋆⋅☆⋅⋆ ───
总结一下:0.3.0 不是那种“改了个版本号”的水更新,而是模型支持、多卡调度、多模态体验三条线同时推进的一版。如果你在用 DeepSeek 4 或 GLM-4.5-Air,建议直接升;如果你还没玩过本地大模型,现在上车的好时机,说实话比半年前友好太多了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.