![]()
Z Highlights
对于许多工作负载,使用前沿模型的API和Agent依然是合适的选择。Sequoia在投资组合中观察到,越来越多公司开始为产品中的部分功能构建自有AI能力,通过纵向整合逐步拥有并塑造模型权重。
在决定拥有自己的智能之前,企业必须先有eval。当每次前向传播都有评测结果可供参考时,选择模型就有了量化依据,无需再凭猜测做决定。
前沿实验室会继续构建巨型“大脑”,所有人都应该使用它们。与此同时,最优秀的产品公司也在培养自己的“小天才”:速度快、有自己的判断、专注于特定领域,并根据实际工作持续调优。
Sonya Huang是Sequoia Capital合伙人,长期关注AI基础模型、应用层与开发者工具。随着开放权重模型逼近前沿水平、后训练基础设施逐渐成熟,越来越多AI应用公司开始重新评估哪些智能能力应当自建、哪些能力适合继续向前沿实验室购买。
01 开放模型追上来之后,企业AI开始争夺控制权
要求企业“拥有自己的智能”的声音越来越响。Alex Karp最近鼓励企业“掌握生产资料”;不久后,Satya Nadella表示,从前沿实验室购买智能相当于付费两次:第一次支付金钱,第二次交出让智能真正有用的专有知识。所有人都在问同一个问题:企业核心的智能究竟应该由谁拥有?
这里需要说明,企业并非一定要拥有自己的智能,也不等于建议企业离开前沿实验室。对于许多工作负载,使用前沿模型的API和Agent依然是合适的选择。Sequoia在投资组合中观察到,越来越多公司开始为产品中的部分功能构建自有AI能力,通过纵向整合逐步拥有并塑造模型权重。
几周前,Sequoia召集一批AI公司的创始人和开发者,围绕“拥有自己的AI栈”举办活动。Harvey从客户需求出发分享实践,Mercor、LangChain、Trajectory和Fireworks则介绍后训练技术栈的各个组成部分。这些分享共同勾勒出一套清晰的方法。
第一,开放权重模型追赶前沿水平的速度超出预期。Kimi K3和GLM 5.2表现非常出色。过去,在开放模型上训练像在跑步机上奔跑:团队花数月微调,下一款前沿模型一发布,这些努力带来的优势就可能消失。如今,企业可以从非常接近前沿水平的基线开始。
第二,独立后训练栈已经成熟。Mercor和Fireworks等公司让每家企业都能使用前沿研究实验室级别的技术栈,从训练、推理到真人或合成数据一应俱全。借助扎实的evals、Harness工程、后训练和在线学习,开放模型如今可以在特定领域超过前沿模型。
一年前,选择开放权重意味着愿意牺牲性能;今天,是否采用开放权重模型,正成为关乎企业生存的战略问题。最新战场是智能层,产品与权重都只是这场竞争的一部分。
![]()
图片来源:Sequoia Capital
02 当AI成为核心成本,企业开始重新算账
不存在适用于所有公司的统一答案。除性能外,产品的一些环节可能因以下因素而受制于“租用智能”的方式。
成本。AI产品越成功,AI COGS越高。如果推理成本随使用量同步增长,自有模型是保护利润率的最佳方式。
速度。在代码补全或网络安全等领域,速度极为重要,经过蒸馏的小型定制模型可能优于大型通用模型。
专有数据。如果反馈、evals、客户互动或领域数据能够让系统进步,企业可能更希望这些数据留在内部。
掌控自己的命运。应用层与智能层开始融合。实验室向上进入产品,应用公司向下进入决定产品如何思考的训练循环。要掌控产品,就越来越需要掌控学习循环和智能本身。Harvey Research、RampLabs、Glean、Factory等公司已经在探索这条路径。
图片来源:Sequoia Capital
03 从0到1路线图:评测、Harness、后训练与在线学习
当企业确定哪些智能能力要自建、哪些继续采购,接下来的问题是:如何从零走到一?
组建团队。不要把这项工作硬塞给平台团队。拥有智能需要一支主动探索的团队:构建evals、打磨数据、试验开放模型、调优Harness,并持续提升模型在特定领域的表现。小型新团队与少数生态伙伴合作,就能取得很大进展。Harvey仅用七人团队就完成了数量惊人的研究。
让外界看见并理解你的工作。如今,每位买家都在挑选自己看好的AI公司;当候选公司的实力相近时,公开的研究成果、基准测试或技术文章越来越能左右最终选择。如果企业在内部完成了优秀研究,应与生态分享。
执行技术步骤。下面是一套总体框架。
![]()
图片来源:Sequoia Capital
1.Evals
Harvey的Gabe Pereyra概括得很好:“没有好的基准,就无法训练模型。”eval是一组用来衡量系统能否把工作做好的任务。每项任务包含Prompt、模型可使用的上下文,以及评分机制。许多eval最初都始于创始人查看模型输出、凭经验判断结果是否正确;目标是把这种判断转化为可重复的流程。
Harvey把真实法律工作拆解成离散任务,建立Legal Agent Benchmark。第一版涵盖24个法律实践领域的1200多项Agent任务,并使用专家编写的75000多条评分准则进行评估。
在决定拥有自己的智能之前,企业必须先有eval。当每次前向传播都有评测结果可供参考时,选择模型就有了量化依据,无需再凭猜测做决定。
2.Harness与上下文工程
一个Agent由三部分组成:模型、上下文和Harness。Harness管理模型周围的产品逻辑,包括路由、检索、工具、记忆、回退和Trace。Harrison Chase的简洁定义是:“Harness的主要职责,是在正确的时间把上下文交给模型。”任务越偏离模型训练分布,开箱即用的Harness表现就越差。
优秀的Harness可以把任务路由到最合适的模型,在不同模型间复用同一组evals,并决定Agent可获得哪些上下文和工具。它也让Agent的运行过程可供检查:团队能够追踪输入了什么上下文、调用了哪些工具,以及流程卡在何处。
3.后训练
后训练涵盖多种技术,具体采用哪种技术,取决于团队希望改善什么。Lin Qiao给出了一套清晰的判断方法:模型缺少事实时无需后训练,使用上下文或RAG即可;输出格式或行为不正确时,使用监督微调;需要调整产品的风格与偏好时,使用偏好调优;模型需要提升专项任务能力时,使用RL;模型太慢或太贵时,对它进行蒸馏。
目标是选择能够改善 eval 结果、投入最少的方法,再通过同一套 Harness 提供模型服务,并在运行中测量质量、延迟和成本。
4.在线学习
系统拥有evals、Harness和模型之后,最后一步是在生产环境中持续改进。Arjun Karanam提出一个重要观察:模型不断变聪明,每次开启新Session,却仍像第一天上班。把Terence Tao放进会计师事务所,他至少在第一天很可能还不是最好的会计师。系统缺少的是经验,而非智能;Agent会在运行过程中创造这种经验。
Trajectory是Agent执行任务所经过的路径,包括模型看到的上下文、调用的工具和sub-agents、生成的答案,以及用户编辑、撤销或重试的内容。要建立在生产环境中持续改进的循环,就必须使用LangChain的LangSmith等工具捕获这些Trajectory。失败的任务可以转化为eval,缺失的信息可以补入上下文或记忆,工具响应中的错误则可以用来指导Harness修复。
04 更低的下限,更高的上限
买家需要警惕:拥有自己的智能会打开潘多拉魔盒。闭源模型栈很简单:调用前沿模型,使用Claude Code或Codex等开箱即用Harness,加入Prompt和上下文,然后发布。它提供较高的能力下限,但上限也相对较低。
拥有技术栈意味着自行承担更多系统工作。生产栈由开源模型、定制Harness、工具和上下文组成;开发栈由专有evals、领域数据和在线学习循环组成。工作量确实更大,能力下限可能更低,但上限也会更高。
![]()
图片来源:Sequoia Capital
前沿实验室会继续构建巨型“大脑”,所有人都应该使用它们。与此同时,最优秀的产品公司也在培养自己的“小天才”:速度快、有自己的判断、专注于特定领域,并根据实际工作持续调优。当更多公司拥有自己的智能,生态会更加繁荣,各自的特色也将得到充分发挥。
这就是企业拥有自有智能后,有望实现的未来。我们很高兴看到“小公司”不断进步,这些创业公司正努力让这样的世界成为现实。
原文:Own Your Intelligence: A How-To Guide
https://sequoiacap.com/article/own-your-intelligence-a-how-to-guide
请注意,本文编译自文末说明的原始链接,不代表Z Potentials立场。如果您对本文有任何想法或见解,欢迎在评论区留言互动探讨。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.