9月30日,YC S25 批次的 Magnitude 团队把自研推理引擎完整开源:不换模型、不换硬件,同一个开源模型在你自己的电脑上最快能比 llama.cpp 快一倍,Apache 2.0 协议,零 token 费用。
一、发生了什么:开源一天,5700 颗星
9月30日,YC S25 批次初创团队 Magnitude 在 Hacker News 上发布 v0.2.0:一个用 Rust 写的本地推理引擎,专门给 AI 编程智能体(Codex、Claude Code、Cline 这类)当「本地发动机」。开源不到一天,GitHub 星标冲过 5700,登上 HN 首页。
它解决的问题很具体:开源模型的能力已经够用,但想跑在自己电脑上,速度总差一口气。llama.cpp、Ollama、LM Studio 这些主流引擎,出厂时内核是为「一类硬件」预编译好的——你的那块具体芯片,总有性能被白白浪费掉。
![]()
二、为什么快:内核在你机器上「现场编译」
Magnitude 的思路来自编译器领域的老办法——按设备调优。模型运行前,引擎先在你的设备上现场编译、实测多组计算内核参数,挑出对这块芯片最快的实现。权重一份不改,速度直接受益。
官方给出的对比数据(Qwen 3.6 35B-A3B,4-bit 量化,64K 上下文,关闭投机解码):
• Mac M4 Pro 48GB(Metal):解码从 30 tok/s 提到 57 tok/s,快 92%,接近翻倍;预处理 466→507 tok/s,快 9%
• 英伟达 DGX Spark(CUDA):解码 49→58 tok/s,快 19%;预处理 2033→2507 tok/s,快 23%
![]()
简单说,苹果芯片用户收益最大,N 卡用户也有约两成提升。要提醒的是,这些数字全部来自官方自测,尚无第三方复现,但方向已经足够诱人。
三、不只是快:省显存、抗并发、数据不出门
• 内存弹性伸缩:只为模型权重常驻保留内存,会话结束即释放,官方实测每个智能体省 27% 内存
• 并发不打架:多个智能体同时干活时共享前缀缓存,开第二个窗口不会把速度腰斩
• 自带投机解码:DFlash、DSpark、DFlash2 草稿模型开箱即用,速度还能再往上叠
• 隐私天然达标:模型下载完即可全程断网使用,提示词、文件、输出都不离开本机
![]()
一键接入 Codex、Claude Code、Cline 等主流编程智能体
四、8GB 显存能跑什么?官方目录直接查
Magnitude 内置了 15 个模型的目录,覆盖 Qwen、Gemma、Meta、NVIDIA、OpenBMB 等主流开源家族,每个模型按 Q4—Q8 不同量化档标好体积,并给出「智能指数」——即相对当前最强模型的智力百分比。装好后它会先给你的机器做体检,下载之前就告诉你这块显卡大概能跑出多少 token 每秒。
![]()
档位
代表模型(Q4 体积)
参考硬件
能干什么
2GB 级
MiniCPM5 2B(2.2GB)
几乎任何电脑
随手问答、工具调用
8GB 档
Gemma 4 E4B(5.2GB)、Qwen3.5 9B(7.1GB)
16GB 内存笔记本
日常写作、摘要、补全
16GB 档
Gemma 4 12B QAT(6.9GB)、Gemma 4 26B-A4B(15.4GB)
RTX 4060 Ti 16GB
复杂推理、智能体任务
24GB 档
Muse Glimmer 30B(19.6GB)、Qwen3.8 27B(20.5GB)
RTX 3090 / 4090
接近旗舰的多模态与编程
Mac 大内存
Nemotron 3.5 Lightning 30B(23.6GB,1M 上下文)
Mac 48GB 统一内存
长文档、仓库级分析
五、三步上手,老机器也能试
• 第一步:到 magnitude.dev 下载桌面版,支持 Windows、macOS、Linux,装完自带命令行
• 第二步:在 Discover 里挑一个推荐模型下载,软件按你的硬件自动匹配量化档位
• 第三步:在 Connections 里一键接入你正在用的智能体(Codex、Claude Code、Cline、OpenCode 等),或者对接本地 10100 端口的 OpenAI 兼容 API
不想开窗口的,命令行 magnitude serve 可以无界面常驻;magnitude hardware 和 magnitude catalog recommendations 两条命令,就能查硬件评估和适配清单。
![]()
本地模型直接驱动编程智能体干活
六、冷思考:三个别急着迷信的地方
• 数字是官方自测:测试环境由项目方掌控,「最快 2 倍」取的是 Metal 最好成绩,N 卡上 19% 的提升要冷静看
• 本地不会让模型变聪明:引擎提速不改变能力上限,27B 模型再快也是 27B
• 生态还在早期:llama.cpp 和 Ollama 背后是多年积累的社区,格式兼容性仍是最稳妥的兜底
务实的用法是双轨制:日常私密、高频、重复性任务交给本地模型——边际成本为零;需要最强能力的硬任务再上云端。对天天开着编程智能体的人来说,本地这一侧从「能用」到「好用」的临界点,可能就由这类引擎推开。
同期值得关注
• 谷歌发布 Gemini 4 Argon:1M 上下文、定价每百万 token 输入 2 美元/输出 10 美元,目前仅向受邀的网络安全防御者开放;官方透露其智能体已把 Fuchsia 内核 80 多万行 C/C++ 迁到 Rust
• 英伟达重打包 Qwen3.8-Flash-Next NVFP4 版:125B MoE 压到约 135GB,单台 128GB 统一内存的 DGX Spark 即可运行
• OpenAI 披露阻断大规模「推理提取」:涉案账户超 1.5 万,点名部分活动与月之暗面(Moonshot AI)关联个人有关
• 社区剪枝版 Victoria 开源:把 Qwen3.8-Flash-Next 的专家砍掉 44%,GGUF Q4 版约 49GB,编码能力仅小幅下降
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.