2026 年 8 月,一个过去主要在工程师圈子里讨论的词,突然被推到了台前:Harness。
过去两年,人们反复追问 GPT 和 Claude 谁更强,DeepSeek 能不能以更低的价格追上闭源模型。但最近,竞争的焦点开始发生变化。
短短一周,多件事情密集发生:
DeepSeek 发布 DeepSeek Harness,提出“Everything is a Plugin”;
OpenAI 更明确地展现 Codex 作为开放 Agent 基础设施的形态;
![]()
8 月 20 日,Earendil Product 发布《What is a Harness?》,解释 Harness 的组成,也强调用户为什么应该拥有自己的 Harness。
与此同时,DeepSeek-V4-Flash 在没有改变模型架构和规模的情况下,通过重新后训练显著提升了多项 Agent 基准表现。公开说明还特别提到,部分代码 Agent 测试使用了 DeepSeek Harness 的极简模式。
把这些变化放在一起看,一个更重要的趋势正在浮现:
Harness 正在从“模型外面的运行时”,变成“模型如何被训练和评估”的一部分。
这可能才是本轮 Agent 竞争最值得关注的变化。
Agent 的能力,不只属于模型
过去,人们习惯把 Agent 的强弱归因于模型:
Claude 强,所以 Claude Code 强;GPT 强,所以 Codex 强;只要 DeepSeek 的模型追上来,它的 Agent 自然也会追上来。
![]()
但真正长期使用过 Coding Agent 的人往往会发现:同一个模型接入不同产品,表现可能完全不像同一个模型。
差别很大程度上来自 Harness。
如果做一个极度简化的表达,今天的 Agent 能力更接近:
Agent 能力 = Model × Harness
模型提供推理、生成和判断能力;工具决定它能对外部世界做什么;Harness 则负责把两者组织成一个能够持续执行任务的系统。
它决定模型能看到哪些上下文,什么时候调用什么工具,工具结果以什么形式返回,失败以后如何重试和恢复,上下文过长时如何压缩,什么时候启动子 Agent,哪些操作必须经过人工审批。
它还决定一个最容易被忽略的问题:什么时候应该停止。
因此,Harness 本身就是性能变量。
同一个模型运行在不同 Harness 中,任务成功率、Token 消耗、执行速度和单次成功成本都可能相差很大。过去一些被归因于“模型能力”的结果,实际上测试的是模型与 Harness 的组合能力。
Harness 做得好,功劳经常被算给模型;Harness 做得差,模型也会跟着背锅。
当头部模型的基础能力逐渐接近,这一层差异只会越来越重要。以后评价一个 Agent,不能只问“用了什么模型”,还要再问一句:
这个模型运行在什么 Harness 上?
Harness 开始进入训练过程
DeepSeek-V4-Flash 最近的更新提供了一个值得注意的信号。
据其公开信息,新版本保持了原有模型架构和规模,主要调整后训练,却在多项 Agent 任务上获得明显提升;部分代码 Agent 评测则运行在 DeepSeek Harness 的极简模式中。
这并不能单独证明 Harness 已经决定模型能力,却揭示了一个明确方向:
模型与 Harness 的关系,正在从“先训练模型,再把它装进运行时”,走向联合设计和协同优化。
因为真正面向 Agent 任务的后训练,不可能在真空中进行。模型必须学习如何选择和调用工具,如何理解错误反馈,如何维持跨越多轮的任务,如何从失败路径中恢复,如何避免重复调用和无效探索,何时分派子任务,以及什么情况下应该结束执行。
这些规则并不完全来自模型本身。它们很大程度上由 Harness 定义。
换句话说,Harness 不再只是模型训练完成后的“外壳”。它也可能成为训练任务、组织轨迹、设计奖励和进行评估的环境。
Harness 正在从运行环境,延伸为训练环境。
真正稀缺的资产,可能是执行轨迹
Agent 每完成一次真实任务,都会产生一条执行轨迹。
![]()
它与普通聊天数据不同。一条完整的 Agent 轨迹可能包含:用户提出了什么目标,Agent 如何拆解任务,调用了哪些工具,在哪一步失败,失败后如何恢复,什么时候出现重复调用,Token 从哪里开始被浪费,用户在哪一步进行了干预,以及最终通过哪条路径完成任务。
传统对话数据主要告诉模型“一个问题应该怎样回答”;Agent 轨迹则有机会教会模型:
一件事情应该怎样完成。
![]()
如果某种 Harness 获得广泛采用,并且厂商能在获得授权、保护隐私和妥善处理商业数据的前提下收集部分轨迹,就可能形成一套新的增长飞轮:
定义 Harness → 吸引开发者 → 承载更多真实任务 → 获得可用于评估或训练的轨迹 → 优化模型与调度策略 → Agent 表现提升 → 吸引更多开发者。
这有一点像 CUDA,但又比 CUDA 多了一层。
CUDA 通过编程接口和软件生态构建平台壁垒;Harness 除了形成开发生态,还可能在运行过程中产生新的行为数据。因此,它潜在地同时拥有两种飞轮:平台飞轮与数据飞轮。
不过,这里必须加上一条边界:开源 Harness 本身不会自动给维护者带来用户数据。数据飞轮能否成立,取决于托管服务、遥测设计、用户授权、企业隐私要求,以及社区是否愿意回传评测和轨迹。
代码可以开源,数据不会凭空出现。
三家公司,三种 Harness 定义
![]()
DeepSeek Harness 最醒目的主张是“Everything is a Plugin”。模型、工具、会话、沙箱、调度循环、子 Agent 和界面都可以被替换。
它强调的是可组合性:
你想重新拼装一个什么样的 Agent?
OpenAI 的路线则更强调可嵌入性。Codex SDK 可以把 Codex Agent 嵌入工作流和应用;App Server 对外提供线程、审批、技能、应用和认证等基础能力。
它回答的问题更接近:
你想把 Agent 放进什么系统?
DeepSeek 倾向于形成开放、可替换的运行时生态;OpenAI 则拥有模型、Codex、API、工具体系和真实任务之间更紧密的一体化条件,更容易在内部形成“模型—Harness—使用反馈—模型优化”的闭环。
Earendil 代表的第三种路线,则强调 Harness 的独立性和用户所有权。
![]()
在《What is a Harness?》中,Earendil 将 Harness 定义为“为 AI 模型提供运行环境的软件”,并将其主要组成概括为系统提示词、工具、Agent 循环和连接不同模型的转换层。
但文章真正强调的,是一个控制权问题:
Harness 应该属于谁?
Earendil 的答案很明确:模型通常掌握在 AI 公司手中,但 Harness 可以由用户拥有。
如果 Harness 独立于模型,用户今天可以运行 Claude,明天可以换成 GPT,后天也可以接入 DeepSeek 或其他开放权重模型。真正留在用户手里的,是自己积累的工具、扩展、会话、工作流和历史状态。
这并不是中立的技术描述,而是一套关于控制权的产品主张。
Earendil 将 Pi 定位为一个开源、模型中立、运行在用户本地设备上的极简 Harness。它希望建立的市场结构是:模型可以替换,Harness 才是用户长期拥有和持续改造的资产。
因此,三方虽然都在谈 Harness,背后代表的却是三种不同的路线:
DeepSeek 强调可组合:用户可以重新拼装一个 Agent;
OpenAI 强调可嵌入:把成熟的 Agent 运行能力接入各种业务系统;
Earendil 强调可拥有:模型可以更换,但 Harness、工具和历史状态应该留在用户手中。
所谓“什么是 Harness”,已经不只是一道技术定义题,也是一场关于 Agent 控制层归属的叙事竞争。
谁定义了这个词,谁就在影响开发者以后如何理解 Agent。而一种 Harness 一旦形成事实标准,还可能反过来影响工具协议、Agent 循环、基准测试,甚至模型的后训练方式。
最终争夺的,是谁来定义 Agent 应该如何行动。
Harness 将成为按照效果付费的最后一关
Harness 不仅影响性能,也直接决定企业为 Agent 支付多少成本。
过去,市场关注的是每百万 Token 的价格。但企业真正关心的并不是模型消耗了多少 Token,而是:
完成一个任务到底需要多少钱。
同一个任务,是八步完成还是八十步?第一次工具调用就成功,还是连续走错十次?需要一个 Agent,还是临时拉起三个子 Agent?是否频繁需要人工介入?
![]()
这些都与 Harness 的决策有关。
因此,Agent 的商业模式可能逐渐从按 Token 计价,转向按任务计价,甚至按结果计价。而 Harness 恰好掌握完成这种计价所需要的信息:任务有没有完成,一共执行了多少步骤,调用了哪些工具,是否有人类介入,以及最终产生了什么结果。
如果 AI 服务最终从“按计算资源收费”走向“按任务或效果收费”,Harness 很可能成为模型与业务结果之间的计量和结算基础设施。
下一轮竞争,是 Model × Harness 的复利
回头再看 Harness,它已经不只是一个 Agent Framework。
它同时连接着运行时、开发者生态、任务成本、用户资产、执行轨迹、评估体系和模型后训练。
工具可以复制,API 可以兼容,插件可以重写。真正难以复制的是:数百万个真实 Agent 究竟如何一步一步把事情做成。
哪些步骤有效?哪些调用只是浪费?什么时候应该继续?什么时候应该停下?什么时候应该交给人?什么时候第二个 Agent 真能提高成功率?
这些轨迹长期积累下来,可能形成一套新的 Agent 行为数据库。
![]()
过去,模型公司争夺的是互联网文本;进入 Agent 时代,竞争对象可能逐渐变成:
现实世界中的任务,是如何被模型一步一步完成的。
谁定义主流 Harness,谁就更有机会影响 Agent 的行动方式;谁拥有规模最大、质量最高并且合法可用的真实执行轨迹,谁就更可能获得下一代 Agent 后训练的优势。
模型战争当然没有结束,但战场正在向下移动一层。
竞争不再只是“谁拥有最强模型”,而是:
谁能率先转动最强的 Model × Harness 飞轮。
一旦这个飞轮形成,真正难以追赶的可能不再是基准测试上的几分差距,而是生态、数据和训练之间不断累积的复利。
参考资料
DeepSeek Harness:Everything is a Plugin
DeepSeek-V4-Flash 模型说明
Codex SDK
Codex App Server
Earendil Product:《What is a Harness?》
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.