网易首页 > 网易号 > 正文 申请入驻

本地跑agent别急着选Ollama,4.8万星的全家桶在这

0
分享至

做 AI agent 的人,迟早会撞上同一个问题,模型放云端怕数据外泄,放本地又嫌工具太简陋。Ollama 火了一年多,成了默认答案。但上周我把一个 4.8 万星的项目从头扒了一遍,发现它是从另一个角度解决这个问题的,而且解决的深度远超大多数人的想象。

这个项目叫 LocalAI,4.8 万星,MIT 协议,Go 写的,2023 年 3 月创建,三天前还在发新版。只看星数你会以为它是又一个 Ollama 的同类,我最初也这么想。翻完 3423 个文件之后我改主意了,它是给 agent 用的本地 AI 引擎,不是给你跑个聊天模型的玩具。

先说结论,它跟 Ollama 不是一类东西

Ollama 解决的是「把模型跑起来」,LocalAI 解决的是「把 agent 需要的一切都本地化」。这是两个完全不同的目标。

我扒它的方式很直接,GitHub 实时数据加整个 README 逐行读。几个数字先放这

  • 3423 个文件,仓库 88MB
  • 60 多个后端引擎,从 llama.cpp 到 vLLM 到 whisper.cpp 全覆盖
  • 近 20 个后端是它自己用 C 和 C++ 从零写的,推理全程不碰 Python
  • 4.8 万星里,创始人 mudler 一个人贡献了 3242 次提交

这些数字合起来就一个意思,这不是个人项目,是重资产工程。

从 agent 角度,本地部署到底好在哪

先说最实在的。你让 agent 干活,最怕两件事,数据外泄和账单失控。本地部署把这两件事一起解决了

第一,隐私是硬边界。模型跑在你自己的机器或内网里,agent 读的资料、写的代码、调的工具,全程不出你的基础设施。对企业来说这是合规问题,不是体验问题。

第二,费用是固定成本。云端按 token 计费,agent 跑一个复杂任务烧掉几块钱很正常,跑一天自动化就是一笔开销。本地跑满不花钱,成本封顶在你买硬件的钱。

第三,离线可用。断网环境下 agent 照样干活,这对工厂、医疗、政务这些内网环境是刚需。

第四,多用户配额。LocalAI 有完整的 API key 体系、用户配额、角色权限,团队几个人共用一台机器,谁的用量多少一目了然。这一点绝大多数本地工具都没有,Ollama 也没有。

它跟 agent 的适配度,比你想的深

这才是重点。LocalAI 从 v4.0 开始就不是「模型服务器」了,它自己长出了 agent 能力

  • 内置 agents,带工具调用、RAG 检索、技能库,还有一个叫 Agenthub 的社区中心
  • 原生支持 MCP,agent 圈的事实标准协议,2025 年 10 月就上了
  • Realtime API,音频到音频的实时对话,agent 可以直接跟人说话
  • 语音识别、说话人分离、人脸识别、活体检测这些后端都齐了

翻译成人话就是,一个 agent 需要的眼睛、耳朵、嘴巴、大脑,它一个引擎全包了。你想想 Ollama 现在只能跑文本和部分视觉,差距就出来了。

最硬核的地方,它给自己重写引擎

我扒的时候有个细节特别震惊。它不止包装上游引擎,还自己从零移植了一堆

最典型的是 vllm.cpp,把整个 vLLM 用 C++20 重写了一遍,分页 KV 缓存、连续批处理、前缀缓存全都有,还支持纯 CPU 跑。vLLM 是云厂商的看家引擎,它直接给你搬本地了。

还有 parakeet.cpp,把 NVIDIA 的语音识别模型移植成 C++ 版本,流式转写。face-detect.cpp 做人脸识别和活体检测。甚至有个后端能把单张照片直接生成 3D 模型。

这些工作量的意义在于,agent 的多模态需求不用再靠 Python 环境撑着,一个 GGUF 模型文件就够,部署干净利落。

怎么入手,官方路径照抄就行

我这次没实际安装跑一遍,下面步骤全部来自官方文档,装过的朋友可以在评论区补充实际体验

方式一,Docker 一条命令

docker run -ti --name local-ai -p 8080:8080 localai/localai:latest

方式二,macOS 直接下 DMG 安装包,注意未签名,装完要跑一句 xattr 解除隔离。

起服务之后拉模型

local-ai run llama-3.2-1b-instruct:q4_k_m

模型来源很灵活,官方模型库、HuggingFace 的 GGUF、甚至 Ollama 的模型仓库都能拉。它从 v4.2 起直接兼容 Ollama 的 API,你原来写给 Ollama 的代码改个地址就能用。

起好之后用 OpenAI 兼容接口测

curl http://localhost:8080/v1/chat/completions -d '{"model":"llama-3.2-1b-instruct","messages":[{"role":"user","content":"你好"}]}'

整个链路就是一个标准 OpenAI 格式,agent 框架接起来没有任何学习成本。

和 Ollama 的横向对比,七个维度

上手难度。Ollama 安装包一键装,LocalAI 要 Docker 或者 DMG,Ollama 赢。

架构。Ollama 是单体,所有能力打包在一起。LocalAI 是小核心加按需后端,用到什么拉什么,不用的不占资源。

模态覆盖。Ollama 以文本和视觉为主。LocalAI 全模态,文本、视觉、语音、图像、视频、3D、生物识别,差距是代差级的。

多用户管理。Ollama 单机单用户为主。LocalAI 有 API key、配额、角色权限、OIDC 登录,团队场景完胜。

分布式。Ollama 没有集群能力。LocalAI 支持 PostgreSQL 加 NATS 的水平扩展,多机拼算力,还能做 P2P 推理。

agent 能力。Ollama 不内置。LocalAI 有 Agenthub、MCP、工具调用、RAG、技能库,原生长在引擎里。



模型生态。Ollama 官方库一键拉最顺滑。LocalAI 兼容 Ollama 仓库、HuggingFace、自己的模型库,更广但上手略杂。 LocalAI对比Ollama.png一句话总结,个人开发者本地跑模型选 Ollama,省心。要搭 agent 全家桶,多模态加多用户加分布式,LocalAI 是唯一把这件事做完整的开源方案。

我的判断,说点不好听的

优点说完了,说风险

第一,这个项目是单点依赖。创始人 mudler 一个人写了 3242 次提交,加上机器人贡献基本占了全部。哪天他不干了,项目就是断崖。138 个 open issues 挂着,功能面铺得这么宽,维护压力肉眼可见。

第二,它太重了。3423 个文件、88MB 仓库、60 多个后端,对个人开发者就是杀鸡用牛刀。你只想跑一个 7B 模型聊天,装它属于自找麻烦。

第三,版本迭代快到有点吓人。6 月 30 日到 7 月 14 日,半个月发了五个版本。功能多当然是好事,但也意味着 API 和配置一直在变,追版本是要成本的。

所以我的建议分两档。个人场景,一个 agent 一个模型,Ollama 加你本地的模型就够,别折腾。团队场景,要多人共用、要全模态、要数据不出内网,LocalAI 值得花一个下午部署起来试,反正 Docker 一条命令的事,试错成本低。

最后留个问题给评论区,你本地跑 agent 用的什么方案,Ollama 还是 LocalAI 还是别的,卡在哪一步了。我自己最想知道的,是你们在真实项目里,数据隐私这件事到底是不是刚需,评论区聊聊。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
比亚迪被骂黑心企业!内部员工爆料饭菜发黑发烂、清汤寡水,直言难怪招不到人!评论区:不把员工当人看!

比亚迪被骂黑心企业!内部员工爆料饭菜发黑发烂、清汤寡水,直言难怪招不到人!评论区:不把员工当人看!

谭谈社会
2026-08-03 19:16:11
研究实锤:早上断食和晚上断食,减重效果相差近80%,别再白挨饿

研究实锤:早上断食和晚上断食,减重效果相差近80%,别再白挨饿

健身狂人
2026-07-28 01:19:37
王某为卖腊肉花10万元请明星带货,直播公司承诺上百万成交额,结果170万的货只卖出一单,王某血本无归,公司人去楼空,法院判了

王某为卖腊肉花10万元请明星带货,直播公司承诺上百万成交额,结果170万的货只卖出一单,王某血本无归,公司人去楼空,法院判了

农民日报
2026-08-02 17:12:36
1951 年志愿军救下韩国女兵,相守二十八载才知妻子另有身份

1951 年志愿军救下韩国女兵,相守二十八载才知妻子另有身份

唠叨说历史
2026-05-29 16:08:04
iPhone 即将全系涨价,涨价幅度约 1000 元!

iPhone 即将全系涨价,涨价幅度约 1000 元!

XCiOS俱乐部
2026-08-03 14:59:42
《蜘蛛侠:崭新之日》观后感:没想到,片尾彩蛋里藏着这个小细节

《蜘蛛侠:崭新之日》观后感:没想到,片尾彩蛋里藏着这个小细节

叶秋臣
2026-08-03 22:44:26
(走进中国乡村)“中国钢制家具之都”:四年外贸翻两番 市场覆盖逾百国

(走进中国乡村)“中国钢制家具之都”:四年外贸翻两番 市场覆盖逾百国

环球网资讯
2026-08-03 18:50:07
美国换了一条咬中国的“狗”!还没上任就放话,要对中国往死里整

美国换了一条咬中国的“狗”!还没上任就放话,要对中国往死里整

7号观察室
2026-08-02 11:57:49
马杜罗,有新消息

马杜罗,有新消息

新京报
2026-08-03 11:43:08
首轮综述:U17国足3-2绝杀阿森纳领跑!上海连追2球3-3平C罗母队

首轮综述:U17国足3-2绝杀阿森纳领跑!上海连追2球3-3平C罗母队

我爱英超
2026-08-03 22:03:21
小米徐洁云发文:“要鼓励真牛逼,打击真牛逼”

小米徐洁云发文:“要鼓励真牛逼,打击真牛逼”

凤凰网科技
2026-08-03 10:38:35
不用自己做饭!广州长者饭堂铺开,高龄老人吃饭更省心

不用自己做饭!广州长者饭堂铺开,高龄老人吃饭更省心

智慧生活笔记
2026-08-03 18:37:27
江苏南京一辆逆行的电动摩托撞上200万的迈凯伦引发网友热议,目击者:迈凯伦的挡风玻璃被撞碎了,迈凯伦后面是一辆1300万的兰博基尼

江苏南京一辆逆行的电动摩托撞上200万的迈凯伦引发网友热议,目击者:迈凯伦的挡风玻璃被撞碎了,迈凯伦后面是一辆1300万的兰博基尼

潇湘晨报
2026-08-03 16:23:08
穆里尼奥发话:6000万欧天才不准回河床!3大意甲下家疯抢,本周揭晓

穆里尼奥发话:6000万欧天才不准回河床!3大意甲下家疯抢,本周揭晓

锐评利物浦
2026-08-03 09:37:51
日本网友买中国车,评论区 400 条留言狂喷!车主:没知识太可怕

日本网友买中国车,评论区 400 条留言狂喷!车主:没知识太可怕

雪莉故事汇
2026-08-03 11:03:45
博主炮轰小米澎程:“汽车界红米”,“标准低端货”

博主炮轰小米澎程:“汽车界红米”,“标准低端货”

金融界
2026-08-02 15:47:12
瑞幸店员被曝用奶油发泡器给同事喂食嬉戏,瑞幸官方:两人使用门店打烊后废弃奶油拍摄,严重违规,将严肃处理,涉及物料和奶油枪已废弃

瑞幸店员被曝用奶油发泡器给同事喂食嬉戏,瑞幸官方:两人使用门店打烊后废弃奶油拍摄,严重违规,将严肃处理,涉及物料和奶油枪已废弃

都市快报橙柿互动
2026-08-02 17:49:04
记者:辽宁铁人与徐正源签的是一份3+1长期合同

记者:辽宁铁人与徐正源签的是一份3+1长期合同

懂球帝
2026-08-03 21:34:12
亿万女装商家做梦也没想到,自己被高达70%的退货率逼得濒临破产

亿万女装商家做梦也没想到,自己被高达70%的退货率逼得濒临破产

流苏晚晴
2026-08-02 16:19:26
2000亿存储龙头,封跌停

2000亿存储龙头,封跌停

第一财经资讯
2026-08-03 14:23:26
2026-08-04 00:03:00
侃故事的阿庆
侃故事的阿庆
几分钟看完一部影视剧,诙谐幽默的娓娓道来
782文章数 9108关注度
往期回顾 全部

科技要闻

“像魔法一样”的AI,只卖几分钱

头条要闻

银鹭与男子因兑奖发生纠纷后 转账1万元并附言"敲诈"

头条要闻

银鹭与男子因兑奖发生纠纷后 转账1万元并附言"敲诈"

体育要闻

马克龙介入FIFA危机 致电因凡蒂诺勿搞分裂

娱乐要闻

陈璇半蹲采访诺兰惹争议

财经要闻

美日联手,救得了日元吗?

汽车要闻

方程S系列将于成都车展发布内饰 9月上旬新车上市即交付

态度原创

艺术
房产
亲子
公开课
军事航空

艺术要闻

冉茂芹油画风景 22幅

房产要闻

120亿注册资本,新巨头出现!崖州湾,真的要爆发了!

亲子要闻

看哭了!#泪目 #心疼

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

东风系列导弹家族罕见同框画面公开

无障碍浏览 进入关怀版