智猩猩AI整理
编辑: 没方
苹果刚刚发布的新款 Mac,把一个趋势推到了台前:Mac 正在变成越来越重要的本地 AI 计算平台。
大容量统一内存、Apple Silicon,再加上苹果专为自家芯片打造的 MLX 框架,让原本依赖 NVIDIA GPU 或云端服务器的大模型,可以直接在 Mac 上运行。
但模型能塞进 Mac,不代表就能用得舒服。
比如,多个模型怎么切换?内存怎么控制?长上下文越来越大怎么办?几个 Agent 同时请求时,会不会直接把机器拖垮?
这时候,光有算力已经不够了,还需要一套真正面向本地 AI 的推理基础设施。
所以今天这个 21.1k 星标的开源项目oMLX,很值得介绍一下。
![]()
它是一个专门为 Apple Silicon 打造的 LLM 推理服务器,加入了连续批处理、多模型调度、内存管理,以及 RAM+SSD 分层 KV Cache。
其中最有意思的一点,就是它把 Mac 的 SSD 也变成了大模型缓存的一部分。
下一次碰到相同上下文,直接调回来继续用,不必重新算一遍。甚至服务器重启后,这些缓存还能继续复用。
![]()
01
使用教程
从 Releases 下载 .dmg,拖到 Applications 即可。
![]()
首次打开 oMLX 后,欢迎界面会引导用户完成基础配置。
这里主要需要确定 oMLX 的数据目录、模型存储目录,以及服务监听端口。默认端口为 8000,同时还可以设置 API Key,用于之后通过 API 调用本地模型。
![]()
oMLX 已经把模型搜索直接集成进了管理后台。用户可以搜索 Hugging Face 上采用 MLX 格式发布的模型,查看模型大小和基本信息,然后直接点击下载。
![]()
接着可以把 oMLX 里运行的本地模型,直接集成到 Claude Code、Codex、OpenCode 这些 AI 编程工具里使用。
![]()
除了直接推理,oMLX 还内置了一套 Benchmark 工具。
用户可以从管理后台直接运行性能测试,分别测量预填充阶段(PP)和 Token 生成阶段(TG)的每秒 Token 数,还支持部分前缀缓存命中测试。
这样更换模型、量化版本或者并发参数之后,不需要凭感觉判断快慢,可以直接看到真实吞吐数据。
![]()
02
把 Mac 做成一台
真正的 AI 推理服务器
(1)RAM+SSD 分层缓存
大模型每生成一个新的 Token,都需要利用前面已经读过的上下文。
为了避免每次都从头计算,推理框架会把此前生成的一部分注意力状态保存下来,这就是 KV Cache。
问题是,对话越长,KV Cache 占用的内存就越大。
特别是在 Mac 上,CPU 和 GPU 共用统一内存。模型本身已经占掉几十 GB,再碰上十几万 Token 的长上下文,内存压力很快就会上来。
oMLX 借鉴了 vLLM 的块式缓存思路,把 KV Cache 拆成一个个可以独立管理的块。经常使用的缓存继续留在 RAM 里,保证读取速度;当内存里的热缓存满了,不活跃的缓存块就会以 safetensors 格式转存到 SSD。
之后如果新的请求再次用到相同的历史前缀,oMLX 可以直接把对应缓存从磁盘恢复回来,而不必重新计算一遍。
更关键的是,这些 SSD 缓存不会随着服务器重启一起消失。
(2)连续批处理
oMLX 通过 mlx-lm 的 BatchGenerator 支持连续批处理。
新的请求可以加入正在运行的推理批次,让服务器更高效地处理多个请求,而不是让每个请求长时间排队等待。
最大并发请求数也可以直接通过 CLI 或管理后台调整。
(3)多模型管理机制
oMLX 能够同时管理文本 LLM、视觉语言模型、OCR、Embedding 和 Reranker 等不同类型的模型。
为了保证内存的有效分配,它加入了一套自动模型管理机制。
常用模型可以固定在内存里保持常驻。不常用的模型可以设置独立 TTL,长时间没有请求就自动卸载。如果内存开始吃紧,系统还会按照 LRU 策略,优先卸载最近最少使用的模型。
同时,oMLX 还提供进程级内存上限,默认会为 macOS 系统预留 8GB 内存,尽量避免模型把整机内存吃满,降低系统级 OOM 的风险。
(4)专门为 Claude Code 优化
很多本地模型的上下文窗口比 Claude 官方模型更小。如果 Claude Code 仍然按照原来的 Token 规模判断什么时候压缩上下文,就可能等到上下文已经快塞满了才开始 Compact。
为此,oMLX 提供了 Context Scaling,可以调整向 Claude Code 上报的 Token 数,让上下文自动压缩更早在合适的位置触发。
同时,它还加入了 SSE Keep-Alive。
因为长上下文第一次 Prefill 可能要等待很久,如果中间一直没有数据返回,客户端可能误以为服务器已经断开。Keep-Alive 会在等待期间持续维持连接,避免长时间预填充造成读取超时。
03
总结
苹果把算力塞进桌面,oMLX 则试图把一整套 AI 推理基础设施也搬进 Mac。
它让本地模型不只是“能跑起来”,还能够长期、稳定地服务 Claude Code、Codex 等 Agent。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.