做 AI agent 的人,迟早会撞上同一个问题,模型放云端怕数据外泄,放本地又嫌工具太简陋。Ollama 火了一年多,成了默认答案。但上周我把一个 4.8 万星的项目从头扒了一遍,发现它是从另一个角度解决这个问题的,而且解决的深度远超大多数人的想象。
这个项目叫 LocalAI,4.8 万星,MIT 协议,Go 写的,2023 年 3 月创建,三天前还在发新版。只看星数你会以为它是又一个 Ollama 的同类,我最初也这么想。翻完 3423 个文件之后我改主意了,它是给 agent 用的本地 AI 引擎,不是给你跑个聊天模型的玩具。
先说结论,它跟 Ollama 不是一类东西
Ollama 解决的是「把模型跑起来」,LocalAI 解决的是「把 agent 需要的一切都本地化」。这是两个完全不同的目标。
我扒它的方式很直接,GitHub 实时数据加整个 README 逐行读。几个数字先放这
- 3423 个文件,仓库 88MB
- 60 多个后端引擎,从 llama.cpp 到 vLLM 到 whisper.cpp 全覆盖
- 近 20 个后端是它自己用 C 和 C++ 从零写的,推理全程不碰 Python
- 4.8 万星里,创始人 mudler 一个人贡献了 3242 次提交
这些数字合起来就一个意思,这不是个人项目,是重资产工程。
从 agent 角度,本地部署到底好在哪
先说最实在的。你让 agent 干活,最怕两件事,数据外泄和账单失控。本地部署把这两件事一起解决了
第一,隐私是硬边界。模型跑在你自己的机器或内网里,agent 读的资料、写的代码、调的工具,全程不出你的基础设施。对企业来说这是合规问题,不是体验问题。
第二,费用是固定成本。云端按 token 计费,agent 跑一个复杂任务烧掉几块钱很正常,跑一天自动化就是一笔开销。本地跑满不花钱,成本封顶在你买硬件的钱。
第三,离线可用。断网环境下 agent 照样干活,这对工厂、医疗、政务这些内网环境是刚需。
第四,多用户配额。LocalAI 有完整的 API key 体系、用户配额、角色权限,团队几个人共用一台机器,谁的用量多少一目了然。这一点绝大多数本地工具都没有,Ollama 也没有。
它跟 agent 的适配度,比你想的深
这才是重点。LocalAI 从 v4.0 开始就不是「模型服务器」了,它自己长出了 agent 能力
- 内置 agents,带工具调用、RAG 检索、技能库,还有一个叫 Agenthub 的社区中心
- 原生支持 MCP,agent 圈的事实标准协议,2025 年 10 月就上了
- Realtime API,音频到音频的实时对话,agent 可以直接跟人说话
- 语音识别、说话人分离、人脸识别、活体检测这些后端都齐了
翻译成人话就是,一个 agent 需要的眼睛、耳朵、嘴巴、大脑,它一个引擎全包了。你想想 Ollama 现在只能跑文本和部分视觉,差距就出来了。
最硬核的地方,它给自己重写引擎
我扒的时候有个细节特别震惊。它不止包装上游引擎,还自己从零移植了一堆
最典型的是 vllm.cpp,把整个 vLLM 用 C++20 重写了一遍,分页 KV 缓存、连续批处理、前缀缓存全都有,还支持纯 CPU 跑。vLLM 是云厂商的看家引擎,它直接给你搬本地了。
还有 parakeet.cpp,把 NVIDIA 的语音识别模型移植成 C++ 版本,流式转写。face-detect.cpp 做人脸识别和活体检测。甚至有个后端能把单张照片直接生成 3D 模型。
这些工作量的意义在于,agent 的多模态需求不用再靠 Python 环境撑着,一个 GGUF 模型文件就够,部署干净利落。
怎么入手,官方路径照抄就行
我这次没实际安装跑一遍,下面步骤全部来自官方文档,装过的朋友可以在评论区补充实际体验
方式一,Docker 一条命令
docker run -ti --name local-ai -p 8080:8080 localai/localai:latest方式二,macOS 直接下 DMG 安装包,注意未签名,装完要跑一句 xattr 解除隔离。
起服务之后拉模型
local-ai run llama-3.2-1b-instruct:q4_k_m模型来源很灵活,官方模型库、HuggingFace 的 GGUF、甚至 Ollama 的模型仓库都能拉。它从 v4.2 起直接兼容 Ollama 的 API,你原来写给 Ollama 的代码改个地址就能用。
起好之后用 OpenAI 兼容接口测
curl http://localhost:8080/v1/chat/completions -d '{"model":"llama-3.2-1b-instruct","messages":[{"role":"user","content":"你好"}]}'整个链路就是一个标准 OpenAI 格式,agent 框架接起来没有任何学习成本。
和 Ollama 的横向对比,七个维度
上手难度。Ollama 安装包一键装,LocalAI 要 Docker 或者 DMG,Ollama 赢。
架构。Ollama 是单体,所有能力打包在一起。LocalAI 是小核心加按需后端,用到什么拉什么,不用的不占资源。
模态覆盖。Ollama 以文本和视觉为主。LocalAI 全模态,文本、视觉、语音、图像、视频、3D、生物识别,差距是代差级的。
多用户管理。Ollama 单机单用户为主。LocalAI 有 API key、配额、角色权限、OIDC 登录,团队场景完胜。
分布式。Ollama 没有集群能力。LocalAI 支持 PostgreSQL 加 NATS 的水平扩展,多机拼算力,还能做 P2P 推理。
agent 能力。Ollama 不内置。LocalAI 有 Agenthub、MCP、工具调用、RAG、技能库,原生长在引擎里。
![]()
模型生态。Ollama 官方库一键拉最顺滑。LocalAI 兼容 Ollama 仓库、HuggingFace、自己的模型库,更广但上手略杂。 LocalAI对比Ollama.png一句话总结,个人开发者本地跑模型选 Ollama,省心。要搭 agent 全家桶,多模态加多用户加分布式,LocalAI 是唯一把这件事做完整的开源方案。
我的判断,说点不好听的
优点说完了,说风险
第一,这个项目是单点依赖。创始人 mudler 一个人写了 3242 次提交,加上机器人贡献基本占了全部。哪天他不干了,项目就是断崖。138 个 open issues 挂着,功能面铺得这么宽,维护压力肉眼可见。
第二,它太重了。3423 个文件、88MB 仓库、60 多个后端,对个人开发者就是杀鸡用牛刀。你只想跑一个 7B 模型聊天,装它属于自找麻烦。
第三,版本迭代快到有点吓人。6 月 30 日到 7 月 14 日,半个月发了五个版本。功能多当然是好事,但也意味着 API 和配置一直在变,追版本是要成本的。
所以我的建议分两档。个人场景,一个 agent 一个模型,Ollama 加你本地的模型就够,别折腾。团队场景,要多人共用、要全模态、要数据不出内网,LocalAI 值得花一个下午部署起来试,反正 Docker 一条命令的事,试错成本低。
最后留个问题给评论区,你本地跑 agent 用的什么方案,Ollama 还是 LocalAI 还是别的,卡在哪一步了。我自己最想知道的,是你们在真实项目里,数据隐私这件事到底是不是刚需,评论区聊聊。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.