网易首页 > 网易号 > 正文 申请入驻

DeepSeek Harness开启内测?看来V4正式版也不远了

0
分享至



从2026年3月崔添翼加入DeepSeek开始组建Harness团队到今天,憋了5个月,DeepSeek的Harness工具这回真的要来了?

一张截图在各大AI社区流传,内容是DeepSeek Harness的内部测试招募通知。



按照截图的说法,Harness计划于本周晚些时候开启内测,首批用户从小范围群组中筛选,入选者需要提交个人资料、签署《保密承诺函》,才能拿到产品访问权限。

并且截图显示,一旦泄密,不只是当次资格取消,还会影响日后DeepSeek各类模型、产品内测以及合作机会的入选。

虽然截图真伪无法验证,但结合DeepSeek此前关于V4正式版发布日期的公告,以及崔添翼曾表示Harness将和V4同时发布,那么这条传闻很有可能是真的。

然而目前市面上没有任何关于DeepSeek Harness产品形态的报道,按照DeepSeek以往的作风来看,Harness是重要产品,它的研发与设计一定是严格保密的。

不过我们还是能通过DeepSeek的各种蛛丝马迹,大致推断出这个产品大概长什么样。

01

DeepSeek Harness到底长什么样

DeepSeek Harness究竟长什么样?目前公开的信息只有两块,第一块是负责人崔添翼的量化背景,第二块是DeepSeek关于Harness部分的招聘职位描述(JD)。

先来说第一块,崔添翼不是做AI出身的。他在Jane Street做了九年的量化交易系统。

在量化交易系统里,最值钱的是执行系统。它讲究的是软件能不能在毫秒级别把策略变成交易?能不能在出了异常的时候自动恢复?能不能在每一步都留下可追溯的日志?

如果把这个思维搬到Harness上,那么其大体逻辑可能会是这样的:

量化交易里,慢一毫秒,钱就被别人赚走了。所以系统的每一步都得抠着毫秒级优化,不能有多余的步骤。

所以Agent循环的每一轮推理-执行-反馈都要快,不能有冗余开销。你跟AI说一句话,它不能半天没反应。从它想一下、到调用工具、到拿到结果、到再想下一步,整个循环必须得快。

同时,量化系统必须得非常可靠。如果量化系统崩了,那亏的是真金白银。所以哪怕行情再诡异、数据再离谱,系统本身不能挂,得能自己恢复。



模型可能会犯错,甚至输出一些离谱的东西给你,但Harness这个框架本身不能崩,得能兜住结果,想办法把模型拉回来继续干活。

其实在量化交易里,网络断了、交易所接口挂了、行情数据异常了,这些都是家常便饭。系统不能一遇到问题就死,得有重试、有备用方案、实在不行就降级,比如实时行情拿不到,就先用延迟数据顶着。

模型也是同理,调用工具失败了、文件读不出来、网络超时了,这些都是常事。好的Harness不会因为一个工具调用失败就整个任务废掉,它会自动重试、换个方法、实在不行就降级处理,继续推进任务。

另外,由于量化系统涉及大量的金钱,交易出问题了,得能查到是哪一步出错的,可能是下单的时候错了,也有可能是行情解析错了。每一步都得有日志,这样才能复盘。

Harness也一样,AI把活干砸了,你得能回看它是怎么一步步走到坑里的。是哪一步想错了?哪个工具调用返回了异常结果?它为什么做了那个错误的决定?

在整个量化系统里,订单状态也非常重要。不能出现“我以为下单了但其实没下”或者“重复下单”这种情况,每一步的状态都得是确定的、一致的。

放到Harness上,在所有人都押注长程任务、复杂任务的当下,能否维持模型中间的状态,将决定整个Harness的成功率。不能前面改了A文件,后面改B文件的时候把A的改动忘了。

最后是风控和安全了,量化交易有熔断机制,行情异常的时候自动停止交易,防止一个bug把钱亏光。另外,高风险的操作必须有审批,不能说下单就下单。

那么回到Harness里,在让AI删文件、格式化硬盘、跑sudo rm -rf这种高危操作之前,就必须得停下来进行确认。不能它自己想干啥就干啥,Harness得有个安全闸门。

02

从DeepSeek的JD里看产品

说完了第一块再说第二块,DeepSeek官方挂出来的岗位JD。

JD里提到了KV Cache、长上下文裁剪与压缩算法,说明Harness会做智能的上下文管理。

配合DeepSeek V4的前缀缓存能力,相同上下文的任务不重复计算。长对话中自动对历史消息做摘要,保留关键信息,释放token空间。根据任务复杂度动态调整上下文策略,简单任务用短上下文省成本,复杂任务拉满百万token的长上下文。



相当于是把每一份算力都花在刀刃上,小事能省则省,大事算力拉满。

JD里还提到了向量存储方案选型、会话状态持久化与回放,这也就意味着Harness有长期记忆系统,会记住你项目的架构、编码规范、常用模式,下次打开项目自动加载。

会话持久化代表就算你关掉终端后再打开,之前的对话状态、修改记录、执行轨迹依然都在。甚至DeepSeek Harness还可能记住你的命名风格、喜欢的框架版本,跨对话记忆你的各种习惯。

JD里提到了Tool Use链式调用、错误回退与自动重试,这是指Harness有完整的工具调用编排能力,能编排多步工具调用的有向无环图。工具调用失败自动重试,重试不行就降级换方案,再不行就回滚到上一个稳定状态。

划重点,DeepSeek Harness还可能支持动态注册新工具,Agent能自动发现并学会使用。

JD里提到了多Agent间通信协议设计、任务分解与结果聚合。这说明Harness有子Agent架构,一个主Agent负责任务规划和协调,多个子Agent负责具体执行。

不同子Agent有不同的系统提示词、工具权限、上下文窗口。主Agent把复杂任务拆成子任务,分发给子Agent,再把结果聚合成最终输出。每个子Agent运行在独立上下文或进程中,互不干扰,出错了不影响主流程。

JD里还提到了任务规划图生成、执行路径在线优化。这意味着Harness有规划与自进化的能力。

规划说的是接到任务后先生成执行计划,分几步、每步用什么工具、预期产出是什么。执行过程中根据实际情况动态调整,不是死板地按原计划走。每完成一步就自我检查,不对就自动修正。

而且,DeepSeek Harness很可能有一套内部benchmark,每次架构改动都跑一遍,看是进步了还是退步了,以此实现工具的自我进化。

最有意思的一点在JD最后,DeepSeek说,要让模型与Harness共同进化,实现模型与Harness的深度适配。

这也就代表了,Harness会利用DeepSeek-V4模型的特性,比如V4的稀疏注意力、前缀缓存。它不是通用Harness 框架,而是跟DeepSeek模型深度绑定的一体化产品。

其实这也是OpenAI现在的理念。

此前。OpenAI是有两条独立的后训练线。一条是代码专用的Codex线,一条是通用推理的GPT线。到GPT-5.5的时候,两条线合并了,GPT-5.5-Codex将代码能力和通用推理能力整合进了同一个模型。

这就好比汽车,原厂就像汽车厂家自己做发动机+变速箱,知道发动机的扭矩曲线、转速特性,变速箱换挡逻辑可以精准匹配。但是如果把这事交给第三方来做,发动机对他们来说是黑盒,只能凭感觉调变速箱,这就导致永远调不到原厂那么丝滑。

03

V4正式版,跳票一个月

Harness不是一个人来的。崔添翼曾表示,V4正式版和Harness将同步发布。

4月24日,DeepSeek发布V4 Preview,Pro和Flash两个版本同步开源。两个月后,在6月29日那天,DeepSeek向API用户发送邮件,明确说V4正式版计划于7月中旬上线。结果眼瞅着要到8月了,依然没有任何关于V4正式版的消息。

曾有传闻称,由于7月24日,DeepSeek旧的API deepseek-chat和deepseek-reasoner正式退役,所以V4正式版将会同期发布。毕竟更换API接口,通常是给新版本让路的前置动作。

可V4正式版依然没有发布。只是两个旧模型名正式停用,所有调用必须换成新的deepseek-v4-flash和deepseek-v4-pro。换句话说,API接口名换了,但模型本身还是预览版那套。

那么正式版比预览版强在哪?

综合多个内测信源的说法,称V4正式版在三个方向上做了升级:

核心推理能力再上一个台阶。

日常对话的响应速度明显优化。

Agent能力针对性迭代。

有参与灰度测试的人总结,V4正式版整体表现接近Opus 4.8级别,编码能力不弱于GPT-5.6 Sol,Agent能力和3D、SVG生成能力大幅提升。同样的任务比Claude Fable 5迭代轮数还少。



不过这些说法都来自非官方渠道,DeepSeek没有公开确认。

预览版的问题其实社区里讨论得不少。V4 Preview在编程能力上和Kimi K2.7、GLM 5.1接近,但仍然逊色当前的主流模型。

尤其是在那些复杂的任务上。有测试者发现,即便要求模型“不使用外部依赖”,模型依然引用了外部CDN。

遇到真正复杂的任务,需要手动加reasoning_effort=max(推理强度最高)才能拿到更深的思考深度,但变成agent往往会忽略这个提示词,导致模型思考的强度不够。

还有一点,虽然目前DeepSeek已上线识图模式(OCR),不过DeepSeek-V4的多模态能力也是短板。

按照DeepSeek官方的说法,预览版是纯文本,正式版首次原生支持图像推理,DeepThink引擎可以在同一个思考流程中分析图片、解读截图。这变相也增加了Harness工具的压力。

以及V4正式版会加入一些企业功能,但具体如何,DeepSeek官方并没有进一步透露。

再说价格,这是争议最大的部分。

V4正式版将引入峰谷定价机制,高峰时段(北京时间9:00-12:00和14:00-18:00)API价格直接翻倍。具体来看,V4 Pro缓存命中输入平时0.025元/百万 token,高峰0.05元;缓存未命中平时3元,高峰6元;输出平时6元,高峰12元。V4 Flash 缓存命中平时0.02元,高峰0.04元;缓存未命中平时1元,高峰2元;输出平时2元,高峰4元。

峰谷定价这件事,往好了说是把算力选择权还给用户,不急的任务挪到低谷时段跑,成本更低。可另一方面,在平时的办公时间,跑相同的任务,成本就会增加。

这不是DeepSeek第一次在定价上换思路。

2025年2月搞过夜间错峰优惠,V3五折、R1二五折。2025年9月 V3.1发布,取消夜间优惠,全天统一价,输出价格还往上抬了50%。

但关键问题不在于价格涨没涨,而在于结合Harness之后,整体使用成本会如何?

第三方测试显示,不同的harness 在完成同样任务时,token消耗差异巨大。测试机构用DeepSeek V4 Flash,分别测试了Claude Code、OpenCode和Pi这三个市面上最常见的Harness工具。发现,三种工具的代码质量基本一致,但Claude Code 每个任务平均跑约70次工具调用,OpenCode只有约22次。

此外,同一个任务,在弱Harness(Pi)里失败了,换到强Harness(Claude Code)里居然成功了。

因此,如何去平衡价格与性能,这是DeepSeek做Harness必须要面对的问题。

不过有一点我很放心,在省钱这件事上,梁文锋还是太权威了。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
为让央企子公司高管认罪,洛阳监委办案人员“留置其妻并索财”

为让央企子公司高管认罪,洛阳监委办案人员“留置其妻并索财”

法治边角料
2026-07-28 22:49:39
詹皇签约后最大的鱼!四大豪强有意36岁6届全明星:想联手三状元

詹皇签约后最大的鱼!四大豪强有意36岁6届全明星:想联手三状元

你的篮球频道
2026-07-29 08:24:41
父亲晒200万海归女儿,放话啥男孩才配,网友一句话戳破残酷现实

父亲晒200万海归女儿,放话啥男孩才配,网友一句话戳破残酷现实

阿郎娱乐
2026-07-22 09:58:39
79岁王奎荣将北京140平房子、2000多万存款,全部赠予小37岁妻子

79岁王奎荣将北京140平房子、2000多万存款,全部赠予小37岁妻子

国际阿尝
2026-07-04 09:05:08
别吹了!《女足》首映2.61亿,难看的在预告片里,《蜘蛛侠4》首映仅2.2亿?最精彩的都在预告片里了?

别吹了!《女足》首映2.61亿,难看的在预告片里,《蜘蛛侠4》首映仅2.2亿?最精彩的都在预告片里了?

娱乐故事
2026-07-29 16:10:09
王虹没参加过数学竞赛但摘得菲尔兹奖,丘成桐:顶尖数学家靠竞赛、刷题是培养不出来的

王虹没参加过数学竞赛但摘得菲尔兹奖,丘成桐:顶尖数学家靠竞赛、刷题是培养不出来的

华商网
2026-07-24 15:31:21
跨界存储,603221连续涨停!充电基础设施同比大增,17只概念股市盈率低于40倍

跨界存储,603221连续涨停!充电基础设施同比大增,17只概念股市盈率低于40倍

数据宝
2026-07-29 19:17:07
罕见!3元绿电横盘573天,外资、社保、北向、保险却集体加仓?

罕见!3元绿电横盘573天,外资、社保、北向、保险却集体加仓?

长风价值掘金
2026-07-29 17:11:35
难怪遗产一分不要,73岁迟重瑞现状曝光,原来他和翁帆是一类人

难怪遗产一分不要,73岁迟重瑞现状曝光,原来他和翁帆是一类人

小椰的奶奶
2026-07-28 14:53:13
桑多河谷冲突中,第13、21、54军已蓄势待发,本打算一役了结中印争端,为何最终取消了作战任务?

桑多河谷冲突中,第13、21、54军已蓄势待发,本打算一役了结中印争端,为何最终取消了作战任务?

人生录
2026-07-28 00:05:06
西安碑林区一写字楼室温高达33℃!员工靠降温贴办公

西安碑林区一写字楼室温高达33℃!员工靠降温贴办公

石辰搞笑日常
2026-07-29 17:05:44
有种赚钱方式叫“信息差”网友:一年赚到了几辈子都花不完的钱!

有种赚钱方式叫“信息差”网友:一年赚到了几辈子都花不完的钱!

另子维爱读史
2026-07-26 22:26:01
2026年起,不再组织职称评审!统一考试,合格直接发放证书

2026年起,不再组织职称评审!统一考试,合格直接发放证书

新浪财经
2026-07-04 14:43:55
高铁上要求男生搬行李被拒后就网暴?女生的操作让全网炸锅

高铁上要求男生搬行李被拒后就网暴?女生的操作让全网炸锅

许三岁
2026-07-12 05:30:10
打蛇打七寸!伊朗开窍了,革命卫队炸掉美国亚马逊算力中心

打蛇打七寸!伊朗开窍了,革命卫队炸掉美国亚马逊算力中心

爱吃醋的猫咪
2026-07-29 18:59:30
我剖腹产坐月子无人管,婆婆全天伺候姑姐带娃,这一刻我彻底寒心

我剖腹产坐月子无人管,婆婆全天伺候姑姐带娃,这一刻我彻底寒心

阿凯销售场
2026-07-29 19:09:04
《年会不能停2》最大的失败,是抽走了大鹏这个“灵魂”

《年会不能停2》最大的失败,是抽走了大鹏这个“灵魂”

光辉记
2026-07-29 00:22:49
小米新款商务双肩包 2 开启众筹:多仓分区、悬空防磕,首发价 449 元

小米新款商务双肩包 2 开启众筹:多仓分区、悬空防磕,首发价 449 元

灰度测试中
2026-07-28 18:04:33
国民党不抗日,南京不战而降?传播此类谣言良知何在?

国民党不抗日,南京不战而降?传播此类谣言良知何在?

涛哥锐评
2026-07-23 07:40:07
姐弟恋,美媒:29岁布克与40岁伊莲娜正在交往,恋情刚刚开始

姐弟恋,美媒:29岁布克与40岁伊莲娜正在交往,恋情刚刚开始

懂球帝
2026-07-29 10:10:06
2026-07-29 19:40:49
字母榜 incentive-icons
字母榜
让未来不止于大。
2645文章数 8076关注度
往期回顾 全部

科技要闻

Kimi K3火爆,奥特曼:开源一定有一席之地

头条要闻

金正恩女儿"高调"亮相 且场合、形式和以往有所不同

头条要闻

金正恩女儿"高调"亮相 且场合、形式和以往有所不同

体育要闻

毫无存在感的NBA状元,最先谢谢惠顾?

娱乐要闻

55岁影帝黄政民出轨

财经要闻

天丝红牛多地检出成分不合格 企业申诉

汽车要闻

24K金LOGO,纯手工打磨腰线,第二代腾势D9暗夜鎏金高定色,一天只能造3台?

态度原创

亲子
游戏
教育
数码
公开课

亲子要闻

近期,孩子出现这些不适,家长要第一时间带孩子去医院,及时干预

《哈迪斯2》还在更新!游戏再优化 体验更舒适

教育要闻

最低575!2026年47所985高校在山东招录情况!

数码要闻

最大解热260W!骨伽FRZ 612 ARGB风冷发布:配6根6mm热管

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版