千呼万唤始出来,DeepSeek Harness 发布了,先说个冷知识,DeepSeek Harness 是用 Claude Code 开发出来的
如果你还在好奇 Harness 到底是什么,最简单理解:
除模型本身以外的所有工作,都属于Harness的范畴
基座大模型相当于智能体的“大脑”,负责推理、理解需求、生成代码;读文件、改代码、执行命令、组织上下文、调用工具、保存会话、申请权限、派发子 Agent,这些模型之外的工作都在 Harness 这一层
同一个模型放进不同 Harness,体验可能差得非常远,细节大家可以看我这篇文章,会有感受:被Harness圈捧成圣的 Pi Agent,接上 DeepSeek-V4-Flash,如虎添翼
下面一起看看 DeepSeek Harness 到底如何,是不是 Claude Code 平替?
安装极简单:npx @deepseek-ai/dsh web
![]()
比较意外,它甚至没有 TUI,也没有客户端,只能网页端打开
目前还在内测,初步感觉:半成品上桌了,maybe 功夫都用在了看不见的地方吧
![]()
看 Github 上 DeepSeek Harness的设计,已经把一套完整运行环境搭出来了:
- Web 界面负责会话、工作区和设置
- Agent Loop 负责组织模型请求与工具调用
- 工具系统负责执行命令、文件操作等动作
- 会话记录负责恢复、分叉和重放上下文
- 权限策略负责在高风险操作前拦一道
- 插件系统负责把上面这些能力替换、组合和扩展
配置模型
把官网开放平台获取的 API Key 填进去就行了
![]()
使用
界面可以用“陋室”形容,你甚至感觉来到了 DeepSeek 官网
![]()
第一步要做的是选择一个本地文件夹作为工作区
它有几种Agent预设模式,大致看了下,默认标准模式就可以,全县更大点的是 PTC 模式,可以通过 Code Mode SDK 让模型用 TypeScript 程序组合多步操作
![]()
Agent 预设可以自定义
预设即一个会话的 Agent 所运行的插件组装 —— 它的工具、提示词与能力。复制一份既有预设改成自己的,或用「创造模式」让 Agent 帮你创建。
我没来得及细致研究预设,玩深了在倒腾吧
选择一个工作区以后,输入框才会真正解锁
![]()
设置
剩下的东西都藏在设置了
比如权限设置,我都已经麻木了,直接 Full access
![]()
前面有一步模型添加,在设置中也可以,支持第三方大模型的接入
![]()
重头戏——插件 ![]()
一切皆插件,才是这次开源的重点
DeepSeek Harness 的核心设计叫「一切皆插件」
模型适配器是插件,工具注册表是插件,会话日志是插件,连 Agent Loop 本身也是插件
很多 Agent 产品允许你装几个工具,dsh 往前又走了一步:Agent 怎么循环、工具怎么执行、上下文怎么进入模型,都可以在配置层被替换
它的底层由 Cordis 驱动,一个正在运行的 dsh,本质上是一棵启动时组合出来的插件树
官方目前提供两种主要形态:
web:带浏览器界面的完整应用headless:没有服务器,接收一次任务并返回结果
每种形态都由多层配置叠起来,基础能力放在底层,用户自己的修改放在上层
想看机器实际启动了哪些插件,可以运行:
dsh --profile web --dump-config实测
照惯例,所有模型我都会让其先做一下《背影》阅读理解+SVG 代码生成 + 审美测试
Harness 是否真的可以给 DeepSeek-V4-Flash 注入神秘力量呢
请看
整整4分钟鏖战
![]()
输出结果:差点意思,第二次背景原文没的不对呢
![]()
Token消耗情况:1 轮 · 14 步
- LLM 3m55s
- 工具调用 18.2s
- 首 token 平均 1.2s
- 112 tok/s
- 缓存命中 93%
- 输入 680K tok
- 输出 24.5K tok
作为对比,看下我最近常用的 Pi+DeepSeek-V4-Flash
确实稍微好一点点,虽然第二个识别也不行
![]()
Token消耗情况
![]()
找GPT分析了一下:
指标 DeepSeek Harness Pi + DeepSeek-V4-Flash 对比 输入 680,000 245,232 Harness 约 2.77 倍 输出 24,500 6,794 Harness 约 3.61 倍 总量 704,500 252,026 Harness 约 2.80 倍 缓存命中率 93% 98.2% Pi 高 5.2 个百分点 估算未缓存输入 47,600 4,464 Harness 约 10.7 倍
核心差异:
- DeepSeek Harness 多消耗约 452,474 tokens。
- DeepSeek Harness 平均每步携带约 48.6K 输入、产生约 1.75K 输出。
- DeepSeek Harness 的输出占总量约 3.48%,Pi 约 2.70%,说明 Harness 每次任务生成得更多。
- 未缓存输入:Harness 约 4.76 万,Pi 只有 4464,差距达到 10.7 倍。
简单结论:Pi+V4-Flash 的上下文复用效率更高,整体 token 压力约为 DeepSeek Harness 的 36%;DeepSeek Harness 主要成本来自 14 步 Agent 流程中反复携带的大上下文。
说明:该测试干扰因素巨多,不代表两者真实水平
DeepSeek Harness 知否值得玩
如果你现在只想找一个成熟工具写代码,Claude Code、Codex 这类成品更省心
它们已经把交互、权限、工具和日常开发流程磨了很久,装好就能干活
DeepSeek Harness 更适合:
- 想研究 Agent Loop、上下文和工具执行机制的开发者
- 想做自有 Agent 产品,又不想从零搭运行骨架的团队
- 想自己替换模型、工具、沙箱、界面和权限策略的重度玩家
dsh 现在的优势是开放和可组合,短板也很明显:版本早、变化快、文档偏开发者、生态刚起步。这也是我暂时不会把它当主力工具的原因
趋势 第一,Harness 已经成为模型厂商必须争的位置
模型能力越来越接近以后,真正影响任务完成率、成本和体验的,会逐渐转到上下文组织、工具设计、权限策略和任务循环
DeepSeek 亲自开源 Harness,说明它也在往模型之上的产品层走
第二,Agent 的扩展单位正在从工具走向整套运行机制
过去大家给 Agent 加一个搜索、一个终端、一个 MCP,就叫扩展
dsh 把模型、会话、循环、工具、权限都做成可替换插件,扩展范围明显更大
第三,开源 Agent 会越来越像发行版
同一套底层,换一个 Profile、叠几层插件和配置,就能变成 Web Agent、无界面自动化工具,甚至企业内部的专用 Agent;以后选 Agent,可能会越来越像选 Linux 发行版:底层能力接近,真正决定体验的是默认组合和生态
本文由作者@Ai学习的老章,授权发布于平台,未经许可禁止转载。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.