网易首页 > 网易号 > 正文 申请入驻

开源模型正在重写 AI 的经济学逻辑

0
分享至

你有没有想过,企业用AI这件事的底层逻辑,正在被彻底重写?过去几年,大家默认的路径是:接OpenAI或Anthropic的API,按token付费,跟着大厂的节奏走,能用就行。但现在,越来越多的企业正在悄悄做一件事——把工作负载从闭源模型切换到开源模型(open models),不是因为闭源模型不够好,而是因为他们意识到,长期依赖一个自己完全不能控制的黑盒,本质上是把企业AI能力的命脉交了出去。

最近我看了一期Y Combinator的Lightcone Podcast,嘉宾是Ollama联合创始人兼CEO Jeffrey Morgan。Ollama是目前全球最主流的开源模型运行平台,有900万开发者在用,GitHub上有17.8万颗星,财富500强里有85%的公司都在使用它。Jeffrey坐在开源模型分发链路最核心的位置上,他看到的token流量数据,比任何市场报告都更真实。这期访谈让我重新想了一遍整个开源模型的格局,也让我对AI基础设施未来的演变路径有了一些新的判断,想在这里完整分享出来。

成本是入场券 控制权才是真正的目标

Jeffrey说了一句话我觉得非常准确:成本是企业转向开源模型的最直接驱动力,但真正的北极星(north star)是控制权,是能把模型定制成真正懂自己业务的工具。成本只是一个短期问题,解决之后,企业才能腾出手去做真正重要的事。

我观察到很多企业用AI的路径有一个共同规律。第一阶段,先把API接上,能跑就行,不太在乎成本;第二阶段,token消耗涨上来之后,成本压力出现,开始考虑怎么降;第三阶段,成本控下来了,但发现模型对自己业务场景的理解还是不够精准,于是开始认真考虑fine-tuning(微调)或者部署开源模型。走到第三阶段的企业,才算真正进入了AI能力建设的深水区。

这个从"能用"到"好用"再到"可控"的路径,在我看来是不可跳过的。很多企业想直接跳到第三阶段,但技术积累和业务理解都是需要时间沉淀的。开源模型不是省钱的捷径,而是一种需要企业自身能力配套的战略选择。Jeffrey提到的那些真正走通这条路的企业,背后都有一支对AI基础设施有深刻理解的技术团队。这本身就是一种门槛,而不是人人都能轻松绕过的捷径。

Token用量爆炸的背后:Coding Agent打开了新世界

Jeffrey在访谈里展示了一张Ollama云端的token用量曲线。从今年年初到访谈录制时,整体token用量增长了150倍。但更有意思的是另一张图——每个开发者每周的token用量,也就是人均消耗,同样出现了指数级增长。这说明不是用户变多了,而是每个人用的量都在快速增加。

这背后有两个关键节点。第一个是今年年初,Qwen(通义千问)、GLM(智谱)、Minimax等开源模型开始真正有能力驱动coding agent(编程智能体)。Coding agent的token消耗量本来就远高于普通对话,因为它需要反复调用工具、检索代码、写测试、执行命令,完成一个任务可能要消耗数十万token。第二个节点是今年四月,OpenClaw这个开源coding agent框架崛起,随后Hermes agent项目也跟着起来。Jeffrey说Hermes的出现让长时间自动化任务的能力从开发者群体扩展到了非技术人员——无论是财务、市场还是销售,都能用上这套能力。Context window(上下文窗口)从128K扩展到百万token级别,也是这一波爆发的重要基础,因为长上下文直接决定了agent能处理多复杂、多长链的任务。

我对这个趋势有一个很强烈的感受。Coding agent不只是程序员的工具,它本质上是一种把复杂任务分解、执行、验证的通用能力框架。当这个框架真正开放给非技术人员的时候,才算是AI生产力革命真正落地的起点。而这一切的前提,是开源模型的能力足够支撑起这套框架的运转。Qwen、GLM这些模型的能力跃升,不只是一个技术里程碑,更是一个产业节点。

Fine-tuning:不是在跟潮流走 是在跟模型发布周期赛跑

主持人问了一个很有意思的问题:2024年初fine-tuning很热,然后热度消退,大家觉得自己花时间训的模型会被下一个大版本直接踩平。现在fine-tuning又回来了,这到底是另一个周期,还是真的站稳了?

Jeffrey的回答很直接。他说开源模型的迭代节奏只会越来越快。就拿今年夏天来说,DeepSeek Flash模型已经迭代了三次,而以前类似的迭代周期可能要六个月。节奏加快确实让自定义训练变得更难,你刚把模型调好,新版本出来了,部分工作可能白费。但他同时说,fine-tuning的工具链在同步变好,让想做微调的团队能更快速地跟上迭代节奏。

我觉得这里有一个更底层的逻辑值得挖一下。Fine-tuning的本质价值不是让模型更聪明,而是让模型更懂你的业务语言、你的数据格式、你的输出规范。这种业务特异性的需求不会因为基础模型变强而消失。所以fine-tuning不会死,但它的定位会变:从一种追求通用能力提升的手段,变成一种专注在业务适配层的精细化工具。能在快速迭代的节奏里持续跟进的团队,反而会因此建立起真正的壁垒,因为这种积累是累计性的,不是从零开始的。

开源模型的天然优势:不是所有事情闭源模型都能做

访谈里有一个点我觉得很少被讨论,但非常重要。Jeffrey说,当有人问哪些场景开源模型比闭源模型有压倒性优势时,安全测试是最典型的答案之一。

逻辑很简单。如果你让Claude帮你对自己的产品做渗透测试(pentest),它大概率会拒绝,因为闭源模型的安全策略非常保守,很难区分你是真正的安全研究员还是有其他意图的用户。而在Hugging Face上可以找到专门为安全研究训练的开源模型,它们在合理使用场景下能更好地完成这类任务。这不是说开源模型没有安全边界,而是它的安全策略更贴近实际的专业使用场景,而不是一刀切地拒绝。

我认为这个现象背后指向了一个更大的问题:闭源模型的安全策略本质上是面向最大公约数用户设计的,它牺牲了专业用户的使用灵活性来换取通用场景下的安全保障。但真实世界的需求是分层的,有些专业场景需要模型能做闭源模型不允许做的事情。开源模型在这里不只是一个便宜的替代品,而是真正不可替代的工具。

Ollama的角色:开源世界的操作系统层

主持人用了一个比喻我觉得很到位。他说Ollama有点像旧时代的操作系统,需要深度整合驱动、硬件和应用层,是整个生态的胶水层。Jeffrey认同这个类比,他说Ollama做的事情就是把三件东西打包成一个箱子:适合这个模型的harness(推理框架和SDK);模型本身,确保可用、稳定,云端有足够容量;以及硬件和推理提供商层,确保模型跑得够快。

这个工作听起来不复杂,但Jeffrey说实际上是一个"组合爆炸"的问题。每个新模型都有不同的架构变化和tool calling(工具调用)机制,要确保所有这些在不同硬件、不同推理引擎上都能正确运行,而且往往在模型发布前24小时才能拿到最终版本,基本是在救火状态下完成的。以今早DeepSeek发布首个多模态大模型为例,Ollama不仅要支持模型本身的运行,还要同步更新能支持这个新能力的harness,让开发者在发布当天就能真正用起来。

我觉得这个定位的护城河比很多人想象的深。不是因为Ollama做了什么独特的技术创新,而是它积累了一套处理这种复杂性的playbook(操作手册)和工程能力。开发者信任Ollama,核心原因是:每次新模型发布,他们只需要调Ollama的API,token就会出来,干净、一致、可靠。这种"永远能跑通"的体验,是靠无数次高强度的工程工作堆出来的,不是靠一个好的商业模式设计出来的。

开源和闭源的终态:合伙人和助理的分工

Jeffrey对开源和闭源模型长期格局的判断,是整个访谈里我觉得最有价值的洞察。他预测,在企业内部,绝大多数token消耗——大概80%到90%——最终会流向开源模型。但这不等于80%到90%的预算会花在开源模型上,因为开源模型的token成本极低,可能你只花了10%到20%的预算,但完成了绝大多数的任务量。

他用了一个比喻很形象:就像律师事务所里,合伙人(partner)负责最复杂、最关键的判断,把具体工作分给助理(associates)去执行。闭源前沿模型是合伙人,处理真正难的问题;开源模型是助理,跑大量的日常任务。两者不是竞争关系,而是协作分工。这和云计算时代的格局非常像:AWS有自己的专有数据库DynamoDB,但大量用户同时在用开源的PostgreSQL,最终结果是两者并存,各占其位,而不是谁消灭谁。

我对这个判断非常认同,而且我觉得这个分工会变得越来越精细。未来的企业AI基础设施,很可能是一个智能路由层(router)在做调度:简单任务自动路由到本地开源模型或便宜的云端开源模型,复杂任务路由到Claude或GPT-4这类前沿闭源模型。这个路由层本身,将是下一波AI基础设施创业的核心战场,因为它决定了整个企业AI体系的效率和成本结构。

本地和云端的混合执行:硬件在追赶 本地迟早回来

Jeffrey对本地模型和云端模型的分工有一个很清晰的判断。难度较低、流程相对固定的任务,比如文档处理工作流,本地模型就能跑得很好,成本几乎为零。但对于coding agent这类需要解决复杂问题、写代码、跑测试的高难度任务,还是需要云端的大模型。

他提到了一个让我重新估算本地部署边界的数据:Qwen 3 38B在编程能力的benchmark(基准测试)上表现已经接近Claude Opus的水平,而这个模型可以在第二低配的MacBook上运行。与此同时,Nvidia的DGX Spark——一台可以放在桌上的工作站级硬件——提供128GB统一内存,可以运行20B到120B参数范围的模型,多台叠放甚至能运行400B级别的模型。Jeffrey说,Ollama从本地起家,因为coding agent的需求把大家拉到了云端,但他预判随着硬件能力的提升,这个需求最终会回到本地。当你桌上有一台GB300级别的机器,你想要最低延迟的coding循环,在本地运行比云端更快,就像当年GitHub Copilot在100毫秒内给出自动补全那种即时感。

我觉得"本地—云端—再回本地"这个路径非常值得关注。它说明本地部署不是一种退而求其次的选择,而是一种等待硬件曲线到达临界点的耐心。这也提示了一个更大的判断:AI的算力不会永远集中在云端,随着硬件的普及,边缘侧的算力会越来越强,企业对数据主权和低延迟的需求也会越来越明确。这个趋势对AI基础设施的格局影响,可能不亚于当年从集中式主机到PC的那次迁移。

Flash模型:当token变得足够便宜 问题就变了

Jeffrey提到了一类被严重低估的模型:flash模型。以DeepSeek Flash为代表,这类模型的特点是token成本极低、推理速度极快,对于80%的任务来说足够好用。他说这类模型的出现标志着一个关键拐点:token会变得接近无限量供应。他用了ChatGPT早期的例子——那时候用户不需要考虑用了多少token,直接用就行。他认为开源模型正在往这个方向走。

更有意思的是他讲到的编排(orchestration)效应。便宜的flash模型不只是让单个任务更便宜,它还开启了一种新的架构思路:把多个flash模型协调起来,各自处理不同的子任务,组合在一起解决一个大模型才能处理的问题。这种编排方式不仅成本更低,而且因为任务分解得更细,每一步的结果更可预测、更可验证,整体可靠性反而更高。

我对这个判断有一个延伸思考。Flash模型的出现,实际上是在把AI的使用门槛从"我能不能负担得起"这个经济问题,转变成"我能不能设计好任务分解和编排逻辑"这个工程问题。前者是钱的问题,后者是能力的问题。这个转变对初创公司来说是一个真正的机会窗口,因为大公司在token预算上有天然优势,但在编排能力上并没有护城河。谁能设计出最高效的任务分解逻辑,谁就能用最低的成本跑出最好的结果。

大一统模型还是协作编排:现实已经给出了答案

早期讨论AGI的时候,有人预测会出现一个"神级模型"把所有事情都包了。Jeffrey对这个问题的回答很务实:对于大多数企业用例,模型到了一个"足够好"的水平之后,用户就会停在那里继续使用,不会去追更强的模型。他们需要的不是更聪明,而是更快、更便宜、更稳定。真正需要最强模型的场景是存在的,但占比并不高。

他提到了一个细节让我印象很深。Kimi模型在网页开发这个垂直领域成为了最好的模型,在市场上引发了一波震动。这说明一个重要的趋势:模型竞争的维度已经从整体智力水平的高低,转向了特定垂直场景的专精能力。在某个具体领域做到最好,比在所有任务上做到平均最好,要有意义得多,也更容易实现差异化。这对所有在垂直场景深耕的团队来说,是一个值得认真对待的信号。

我的整体判断是,"神级模型统一一切"的叙事本质上是一种商业叙事,而不是市场的真实需求。真实需求是分层的:不同复杂度的任务需要不同级别的模型,不同业务场景需要不同专精方向的模型。编排能力才是这个时代的核心竞争力,不是单个模型的绝对强度。这也是为什么Ollama这类做基础设施的公司,护城河会越来越深——当模型数量越来越多,把它们统一调度起来的能力,价值只会越来越高。

模型的选择:不只是技术问题 也是信任问题

访谈里Jeffrey聊到了企业在选择模型时的决策逻辑,这部分我觉得说得很实在。他把企业分成两类:一类不太在意模型的来源,更在意的是模型在哪里运行、运行环境是不是安全可控的;另一类会认真考虑模型的来源,不只是安全问题,还包括模型的"表达方式"——它用什么语气说话、对某些话题的处理是否符合企业的沟通风格和价值观。

他提到了一个很有意思的场景:芬兰一家电厂在用Llama模型监测电力系统的电涌峰值,确保电网稳定运行。在这类关键任务场景下,对模型的整个链路有完整的可解释性和可审计性,是不可妥协的硬性要求。他提到Neotron Ultra这类训练数据来源完全透明可查的模型,对需要完整溯源能力的企业来说是刚需。对于安全问题,他的判断是:Fortune 500的IT和安全团队其实非常有经验,开源软件的安全审计是他们一直在做的工作,从大型开源库到现在的开源模型,处理逻辑是一脉相承的。通过系统级的安全检测机制,大多数安全问题是可以有效管控的。

我觉得这个问题在未来会越来越重要,而且会从一个模糊的政策讨论变成具体的采购决策标准。值得关注的一个信号是:Ollama的数据显示,在云端大规模token消耗里,中国来源的模型——Qwen、GLM、DeepSeek等——占据了主导地位。这背后是能力驱动的选择,不是政治驱动的选择。开发者用什么模型,最终看的是这个模型在他的任务上跑得够不够好、够不够快、够不够便宜。能力说话,市场自然会给出判断。

Ollama的创业故事:两年迷失 两周起飞

Jeffrey讲了一段Ollama的创业历程,我觉得这段故事本身的价值不亚于他对市场的所有判断。

Jeffrey和联合创始人Michael此前在Docker工作,后来创立公司并在2021年参加了YC。但他们申请YC时做的事情,跟后来Ollama真正的方向完全不同——当时做的是Kubernetes的安全工具。在那之后,他们花了将近两年时间在不同方向上摸索,一直没有找到真正让用户兴奋的产品,一度陷入Jeffrey所说的"在荒野里迷失"的状态。他说那段时间最可怕的不是看不到增长,而是不确定自己是不是真的在解决一个真实存在的问题。

真正的转折点很戏剧性。他们在一次内部会议上说,把过去所有的东西都扔掉,如果现在重新开始,我们会做什么?两个方向浮出水面:一个是做所有LLM的统一接入网关;另一个是发挥他们VMware和Docker出身的系统工程能力,帮助开源模型真正能跑起来。他们选了后者,给自己定了两周时间来验证。结果就在那两周快结束的时候,Llama 2发布了,他们立刻把第一版Ollama推出去,获得了比以前所有产品加起来还多的用户,而且是在几天内发生的。

Jeffrey说了一句话我觉得特别诚实:"如果当时在YC期间就做这件事会更好,但那时候也不可能,因为Llama还没出来。" 这句话包含了一个很重要的创业逻辑:时机本身是不可控的,但你能控制的是,当时机出现的时候,你有没有足够轻量的执行力去立刻抓住它。他们两周做出第一版,这种高度偏执行的风格,才是那个关键节点上真正有价值的能力。

从Reddit上的小众爱好者工具,到财富500强85%在用,这个跨越不到两年。Jeffrey解释了为什么速度这么快:开源模型不需要申请权限就能开始用,这对企业内部的IT开发者来说是天然的低摩擦入口。爱好者喜欢它的原因和企业开发者喜欢它的原因,在早期高度重叠——都是因为可以直接开始,不需要走审批流程。而LLM本身是无状态的,这让从个人到企业的迁移比数据库工具顺滑得多。

我的整体判断

把这期访谈完整听下来,我有一个越来越强烈的感受:开源模型的崛起,本质上是一次AI使用权的重新分配。过去,用最好的AI是有门槛的——你得付得起token的价格,接受闭源模型的安全策略,依赖几个大厂的发布节奏。现在,开源模型正在把这个权力下放:企业可以自己部署、自己定制、自己控制数据,成本大幅降低。

Jeffrey说的那句"开源模型的token正在走向丰盛"(abundance of tokens),我觉得是被严重低估的判断。当token变得足够便宜,AI使用的决策逻辑会从"我能不能用"变成"我要怎么用得更好"。这是一个质的转变。前者是资源约束下的决策,后者是能力约束下的决策。在这个新的范式里,真正稀缺的不再是token,而是知道怎么把任务设计好、怎么把模型编排起来、在正确的场景用正确的模型的判断力。

这种判断力,不是钱能直接买到的。而且随着开源模型能力的持续提升、flash模型让token成本趋近于零、硬件算力回到本地,这场AI基础设施的重构才刚刚开始。真正的竞争,发生在token之上的那一层。

结尾

也欢迎大家留言讨论,分享你的观点!

觉得内容不错的朋友能够帮忙右下角点个赞,分享一下。您的每次分享,都是在激励我不断产出更好的内容。

欢迎关注深思圈,一起探索更大的世界。

两个“特别坑”的AI产品创业方向,你知道吗


速度将成为AI时代唯一的护城河


a16z重磅预测:Vibe coding赢者通吃?错了,垂直专业化才是未来


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
曼联官方:俱乐部与SumUp达成队史最大袖标赞助

曼联官方:俱乐部与SumUp达成队史最大袖标赞助

懂球帝
2026-09-08 18:05:11
24集《早春晴朗》大结局:井柏然至死不知,明明自己靠栾念出圈,为何火的却是金世佳

24集《早春晴朗》大结局:井柏然至死不知,明明自己靠栾念出圈,为何火的却是金世佳

胖六聊剧
2026-09-07 23:41:32
被“诅咒”的常州首富

被“诅咒”的常州首富

说财猫
2026-09-08 23:33:51
70年未见!超强厄尔尼诺逼近,联合国发警告:4900万人或面临断粮

70年未见!超强厄尔尼诺逼近,联合国发警告:4900万人或面临断粮

梦想的现实
2026-09-07 20:11:36
揭秘:高质量性生活的黄金时长,多少分钟最容易让人满足?

揭秘:高质量性生活的黄金时长,多少分钟最容易让人满足?

精彩分享快乐
2026-09-08 21:00:03
大幅涨价,创历史新高!

大幅涨价,创历史新高!

君临财富
2026-09-08 18:41:17
原来她是王思雨母亲,身份职业受人尊敬,难怪女儿频频给她争光

原来她是王思雨母亲,身份职业受人尊敬,难怪女儿频频给她争光

娱圈办事处
2026-09-08 18:43:42
美股芯片、光通信概念深夜爆发,中概股走弱

美股芯片、光通信概念深夜爆发,中概股走弱

21世纪经济报道
2026-09-08 23:08:04
蒋介石初次携宋美龄前去拜见杜月笙,杜月笙看了她落座的姿态后,悄悄跟心腹说了一番话,没想到这话成了他一辈子最准的预言

蒋介石初次携宋美龄前去拜见杜月笙,杜月笙看了她落座的姿态后,悄悄跟心腹说了一番话,没想到这话成了他一辈子最准的预言

磊子讲史
2026-08-15 18:39:40
央视直播!中国男排今日决战伊朗,两连胜零失局,两连胜零失局!

央视直播!中国男排今日决战伊朗,两连胜零失局,两连胜零失局!

体坛侃侃球
2026-09-09 00:10:07
2-0晋级后,郑钦文激动回应,美媒惊叹表态,WTA官网发声!

2-0晋级后,郑钦文激动回应,美媒惊叹表态,WTA官网发声!

聚焦分享每日热点
2026-09-09 02:12:03
太懒散,踢得太差! 罗德里场边下吐槽瓦伦西亚,被镜头完整拍下

太懒散,踢得太差! 罗德里场边下吐槽瓦伦西亚,被镜头完整拍下

夜白侃球
2026-09-08 10:03:50
胡适直言:毛泽东不是我学生,他的水平考不上北大!主席从容回应

胡适直言:毛泽东不是我学生,他的水平考不上北大!主席从容回应

小豫讲故事
2026-08-28 06:00:11
英国政府要求民众提前存粮存水,呼吁家家户户储备罐头食品,确保为国家紧急情况做好准备

英国政府要求民众提前存粮存水,呼吁家家户户储备罐头食品,确保为国家紧急情况做好准备

第一财经资讯
2026-09-07 19:51:03
迷乱过后我将重生

迷乱过后我将重生

青苹果sht
2026-09-08 05:52:09
中日若开战,将是地狱模式!全球终于清醒了:中国这次不是在演戏

中日若开战,将是地狱模式!全球终于清醒了:中国这次不是在演戏

叶葉夜
2026-08-31 11:23:21
彻底撕破脸!4000名被裁员工再爆西贝猛料:贾国龙单方面撕毁协议

彻底撕破脸!4000名被裁员工再爆西贝猛料:贾国龙单方面撕毁协议

坠入二次元的海洋
2026-09-08 05:18:12
刚刚,突破“心理防线”!全球美元敞口,风险飙升!

刚刚,突破“心理防线”!全球美元敞口,风险飙升!

证券时报
2026-09-08 14:03:04
新政后,开发商强势涨价了

新政后,开发商强势涨价了

大嘴説
2026-09-08 15:55:51
小姨子和我老婆是双胞胎,有一次我喝醉后,把小姨子当成了老婆

小姨子和我老婆是双胞胎,有一次我喝醉后,把小姨子当成了老婆

千秋文化
2026-08-15 20:23:02
2026-09-09 05:03:00
深思圈
深思圈
挖掘和深度分析海外最新AI产品,分享实用出海战略
302文章数 19关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

律师:摸臀事件女子拉伤男童系人身伤害 男童父母可索赔

头条要闻

律师:摸臀事件女子拉伤男童系人身伤害 男童父母可索赔

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

家居
游戏
房产
健康
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

《塞尔达》40周年汇总:电影|时之笛|限定主机|周边等

房产要闻

真快啊!海口这个超级城更,又有大动作!

同样是脑梗,为何康复结局大不同?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版