网易首页 > 网易号 > 正文 申请入驻

DeepSeek Harness开启内测?看来V4正式版也不远了

0
分享至



从2026年3月崔添翼加入DeepSeek开始组建Harness团队到今天,憋了5个月,DeepSeek的Harness工具这回真的要来了?

一张截图在各大AI社区流传,内容是DeepSeek Harness的内部测试招募通知。



按照截图的说法,Harness计划于本周晚些时候开启内测,首批用户从小范围群组中筛选,入选者需要提交个人资料、签署《保密承诺函》,才能拿到产品访问权限。

并且截图显示,一旦泄密,不只是当次资格取消,还会影响日后DeepSeek各类模型、产品内测以及合作机会的入选。

虽然截图真伪无法验证,但结合DeepSeek此前关于V4正式版发布日期的公告,以及崔添翼曾表示Harness将和V4同时发布,那么这条传闻很有可能是真的。

然而目前市面上没有任何关于DeepSeek Harness产品形态的报道,按照DeepSeek以往的作风来看,Harness是重要产品,它的研发与设计一定是严格保密的。

不过我们还是能通过DeepSeek的各种蛛丝马迹,大致推断出这个产品大概长什么样。

01

DeepSeek Harness到底长什么样

DeepSeek Harness究竟长什么样?目前公开的信息只有两块,第一块是负责人崔添翼的量化背景,第二块是DeepSeek关于Harness部分的招聘职位描述(JD)。

先来说第一块,崔添翼不是做AI出身的。他在Jane Street做了九年的量化交易系统。

在量化交易系统里,最值钱的是执行系统。它讲究的是软件能不能在毫秒级别把策略变成交易?能不能在出了异常的时候自动恢复?能不能在每一步都留下可追溯的日志?

如果把这个思维搬到Harness上,那么其大体逻辑可能会是这样的:

量化交易里,慢一毫秒,钱就被别人赚走了。所以系统的每一步都得抠着毫秒级优化,不能有多余的步骤。

所以Agent循环的每一轮推理-执行-反馈都要快,不能有冗余开销。你跟AI说一句话,它不能半天没反应。从它想一下、到调用工具、到拿到结果、到再想下一步,整个循环必须得快。

同时,量化系统必须得非常可靠。如果量化系统崩了,那亏的是真金白银。所以哪怕行情再诡异、数据再离谱,系统本身不能挂,得能自己恢复。



模型可能会犯错,甚至输出一些离谱的东西给你,但Harness这个框架本身不能崩,得能兜住结果,想办法把模型拉回来继续干活。

其实在量化交易里,网络断了、交易所接口挂了、行情数据异常了,这些都是家常便饭。系统不能一遇到问题就死,得有重试、有备用方案、实在不行就降级,比如实时行情拿不到,就先用延迟数据顶着。

模型也是同理,调用工具失败了、文件读不出来、网络超时了,这些都是常事。好的Harness不会因为一个工具调用失败就整个任务废掉,它会自动重试、换个方法、实在不行就降级处理,继续推进任务。

另外,由于量化系统涉及大量的金钱,交易出问题了,得能查到是哪一步出错的,可能是下单的时候错了,也有可能是行情解析错了。每一步都得有日志,这样才能复盘。

Harness也一样,AI把活干砸了,你得能回看它是怎么一步步走到坑里的。是哪一步想错了?哪个工具调用返回了异常结果?它为什么做了那个错误的决定?

在整个量化系统里,订单状态也非常重要。不能出现“我以为下单了但其实没下”或者“重复下单”这种情况,每一步的状态都得是确定的、一致的。

放到Harness上,在所有人都押注长程任务、复杂任务的当下,能否维持模型中间的状态,将决定整个Harness的成功率。不能前面改了A文件,后面改B文件的时候把A的改动忘了。

最后是风控和安全了,量化交易有熔断机制,行情异常的时候自动停止交易,防止一个bug把钱亏光。另外,高风险的操作必须有审批,不能说下单就下单。

那么回到Harness里,在让AI删文件、格式化硬盘、跑sudo rm -rf这种高危操作之前,就必须得停下来进行确认。不能它自己想干啥就干啥,Harness得有个安全闸门。

02

从DeepSeek的JD里看产品

说完了第一块再说第二块,DeepSeek官方挂出来的岗位JD。

JD里提到了KV Cache、长上下文裁剪与压缩算法,说明Harness会做智能的上下文管理。

配合DeepSeek V4的前缀缓存能力,相同上下文的任务不重复计算。长对话中自动对历史消息做摘要,保留关键信息,释放token空间。根据任务复杂度动态调整上下文策略,简单任务用短上下文省成本,复杂任务拉满百万token的长上下文。



相当于是把每一份算力都花在刀刃上,小事能省则省,大事算力拉满。

JD里还提到了向量存储方案选型、会话状态持久化与回放,这也就意味着Harness有长期记忆系统,会记住你项目的架构、编码规范、常用模式,下次打开项目自动加载。

会话持久化代表就算你关掉终端后再打开,之前的对话状态、修改记录、执行轨迹依然都在。甚至DeepSeek Harness还可能记住你的命名风格、喜欢的框架版本,跨对话记忆你的各种习惯。

JD里提到了Tool Use链式调用、错误回退与自动重试,这是指Harness有完整的工具调用编排能力,能编排多步工具调用的有向无环图。工具调用失败自动重试,重试不行就降级换方案,再不行就回滚到上一个稳定状态。

划重点,DeepSeek Harness还可能支持动态注册新工具,Agent能自动发现并学会使用。

JD里提到了多Agent间通信协议设计、任务分解与结果聚合。这说明Harness有子Agent架构,一个主Agent负责任务规划和协调,多个子Agent负责具体执行。

不同子Agent有不同的系统提示词、工具权限、上下文窗口。主Agent把复杂任务拆成子任务,分发给子Agent,再把结果聚合成最终输出。每个子Agent运行在独立上下文或进程中,互不干扰,出错了不影响主流程。

JD里还提到了任务规划图生成、执行路径在线优化。这意味着Harness有规划与自进化的能力。

规划说的是接到任务后先生成执行计划,分几步、每步用什么工具、预期产出是什么。执行过程中根据实际情况动态调整,不是死板地按原计划走。每完成一步就自我检查,不对就自动修正。

而且,DeepSeek Harness很可能有一套内部benchmark,每次架构改动都跑一遍,看是进步了还是退步了,以此实现工具的自我进化。

最有意思的一点在JD最后,DeepSeek说,要让模型与Harness共同进化,实现模型与Harness的深度适配。

这也就代表了,Harness会利用DeepSeek-V4模型的特性,比如V4的稀疏注意力、前缀缓存。它不是通用Harness 框架,而是跟DeepSeek模型深度绑定的一体化产品。

其实这也是OpenAI现在的理念。

此前。OpenAI是有两条独立的后训练线。一条是代码专用的Codex线,一条是通用推理的GPT线。到GPT-5.5的时候,两条线合并了,GPT-5.5-Codex将代码能力和通用推理能力整合进了同一个模型。

这就好比汽车,原厂就像汽车厂家自己做发动机+变速箱,知道发动机的扭矩曲线、转速特性,变速箱换挡逻辑可以精准匹配。但是如果把这事交给第三方来做,发动机对他们来说是黑盒,只能凭感觉调变速箱,这就导致永远调不到原厂那么丝滑。

03

V4正式版,跳票一个月

Harness不是一个人来的。崔添翼曾表示,V4正式版和Harness将同步发布。

4月24日,DeepSeek发布V4 Preview,Pro和Flash两个版本同步开源。两个月后,在6月29日那天,DeepSeek向API用户发送邮件,明确说V4正式版计划于7月中旬上线。结果眼瞅着要到8月了,依然没有任何关于V4正式版的消息。

曾有传闻称,由于7月24日,DeepSeek旧的API deepseek-chat和deepseek-reasoner正式退役,所以V4正式版将会同期发布。毕竟更换API接口,通常是给新版本让路的前置动作。

可V4正式版依然没有发布。只是两个旧模型名正式停用,所有调用必须换成新的deepseek-v4-flash和deepseek-v4-pro。换句话说,API接口名换了,但模型本身还是预览版那套。

那么正式版比预览版强在哪?

综合多个内测信源的说法,称V4正式版在三个方向上做了升级:

核心推理能力再上一个台阶。

日常对话的响应速度明显优化。

Agent能力针对性迭代。

有参与灰度测试的人总结,V4正式版整体表现接近Opus 4.8级别,编码能力不弱于GPT-5.6 Sol,Agent能力和3D、SVG生成能力大幅提升。同样的任务比Claude Fable 5迭代轮数还少。



不过这些说法都来自非官方渠道,DeepSeek没有公开确认。

预览版的问题其实社区里讨论得不少。V4 Preview在编程能力上和Kimi K2.7、GLM 5.1接近,但仍然逊色当前的主流模型。

尤其是在那些复杂的任务上。有测试者发现,即便要求模型“不使用外部依赖”,模型依然引用了外部CDN。

遇到真正复杂的任务,需要手动加reasoning_effort=max(推理强度最高)才能拿到更深的思考深度,但变成agent往往会忽略这个提示词,导致模型思考的强度不够。

还有一点,虽然目前DeepSeek已上线识图模式(OCR),不过DeepSeek-V4的多模态能力也是短板。

按照DeepSeek官方的说法,预览版是纯文本,正式版首次原生支持图像推理,DeepThink引擎可以在同一个思考流程中分析图片、解读截图。这变相也增加了Harness工具的压力。

以及V4正式版会加入一些企业功能,但具体如何,DeepSeek官方并没有进一步透露。

再说价格,这是争议最大的部分。

V4正式版将引入峰谷定价机制,高峰时段(北京时间9:00-12:00和14:00-18:00)API价格直接翻倍。具体来看,V4 Pro缓存命中输入平时0.025元/百万 token,高峰0.05元;缓存未命中平时3元,高峰6元;输出平时6元,高峰12元。V4 Flash 缓存命中平时0.02元,高峰0.04元;缓存未命中平时1元,高峰2元;输出平时2元,高峰4元。

峰谷定价这件事,往好了说是把算力选择权还给用户,不急的任务挪到低谷时段跑,成本更低。可另一方面,在平时的办公时间,跑相同的任务,成本就会增加。

这不是DeepSeek第一次在定价上换思路。

2025年2月搞过夜间错峰优惠,V3五折、R1二五折。2025年9月 V3.1发布,取消夜间优惠,全天统一价,输出价格还往上抬了50%。

但关键问题不在于价格涨没涨,而在于结合Harness之后,整体使用成本会如何?

第三方测试显示,不同的harness 在完成同样任务时,token消耗差异巨大。测试机构用DeepSeek V4 Flash,分别测试了Claude Code、OpenCode和Pi这三个市面上最常见的Harness工具。发现,三种工具的代码质量基本一致,但Claude Code 每个任务平均跑约70次工具调用,OpenCode只有约22次。

此外,同一个任务,在弱Harness(Pi)里失败了,换到强Harness(Claude Code)里居然成功了。

因此,如何去平衡价格与性能,这是DeepSeek做Harness必须要面对的问题。

不过有一点我很放心,在省钱这件事上,梁文锋还是太权威了。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
全网愤怒的“土豆红烧肉”事件:远离你身边的“伪人朋友”

全网愤怒的“土豆红烧肉”事件:远离你身边的“伪人朋友”

小椰子专栏
2026-09-19 13:05:12
十几亿工厂被烧毁的热议背后:月薪三千,凭什么让派遣工拼命?

十几亿工厂被烧毁的热议背后:月薪三千,凭什么让派遣工拼命?

娱乐圈见解说
2026-09-20 00:22:02
亚运会开幕式太诡异,日本又玩砸了!伊朗提前离场,退场秩序混乱

亚运会开幕式太诡异,日本又玩砸了!伊朗提前离场,退场秩序混乱

十点街球体育
2026-09-19 22:30:53
0-3!英超卫冕冠军爆冷崩盘 开局7连胜终结+丢榜首 憾失123年神迹

0-3!英超卫冕冠军爆冷崩盘 开局7连胜终结+丢榜首 憾失123年神迹

我爱英超
2026-09-20 00:11:29
美国太强大了!核电今年集中爆发,要像造车一样成为流水线

美国太强大了!核电今年集中爆发,要像造车一样成为流水线

爆角追踪
2026-09-19 16:30:02
凌晨一点的北京家属院里,72岁的濮存昕用一根绳子,将自己与94岁患阿尔茨海默症的母亲紧紧系在一起

凌晨一点的北京家属院里,72岁的濮存昕用一根绳子,将自己与94岁患阿尔茨海默症的母亲紧紧系在一起

笨鸟摘文
2026-09-19 21:35:47
进口垄断彻底终结?挪威三文鱼空运到中国的时代,正在加速落幕

进口垄断彻底终结?挪威三文鱼空运到中国的时代,正在加速落幕

抽象派大师
2026-09-17 14:33:45
举全国之力,陪一人演戏

举全国之力,陪一人演戏

老达子
2026-09-19 06:30:03
九旬老人下公交车后原地站了几秒,被突然关闭的车门刮倒摔成十级伤残,起诉索赔16.6万余元,法院:公交公司承担全部赔偿责任

九旬老人下公交车后原地站了几秒,被突然关闭的车门刮倒摔成十级伤残,起诉索赔16.6万余元,法院:公交公司承担全部赔偿责任

扬子晚报
2026-09-20 07:16:11
5年3.6亿美元!一个前无古人的NBA纪录诞生了

5年3.6亿美元!一个前无古人的NBA纪录诞生了

篮球大视野
2026-09-19 11:36:37
50岁马伊琍被曝有新恋情,和神秘男约会被拍,两人坐姿过于亲密!

50岁马伊琍被曝有新恋情,和神秘男约会被拍,两人坐姿过于亲密!

小嵩
2026-09-20 08:40:52
十二天屠城七十万,却被专家吹捧为千古完人、民族英雄,实在可笑

十二天屠城七十万,却被专家吹捧为千古完人、民族英雄,实在可笑

小豫讲故事
2026-09-20 06:00:17
从这两条“荒诞”新闻,看清了普通人最无力的悲哀

从这两条“荒诞”新闻,看清了普通人最无力的悲哀

清书先生
2026-09-19 16:53:53
蒋锋任无锡市委书记

蒋锋任无锡市委书记

扬子晚报
2026-09-19 21:10:10
菲律宾急得跳脚!平陆运河刚通航,菲代表团就来了,中方正式摊牌

菲律宾急得跳脚!平陆运河刚通航,菲代表团就来了,中方正式摊牌

铜臭的历史味
2026-09-20 02:55:39
伊朗这一仗打下来,其实留下一笔很现实的账:未来50年,中美之间爆发全面战争的可能性,大概率会非常低

伊朗这一仗打下来,其实留下一笔很现实的账:未来50年,中美之间爆发全面战争的可能性,大概率会非常低

扶苏聊历史
2026-09-19 16:31:41
永别了,娱乐圈的“三聚氰胺”!

永别了,娱乐圈的“三聚氰胺”!

断翼的鸟儿
2026-09-18 14:22:10
西贝被曝将彻底倒闭:贾国龙将揽下绝大部分债务,放弃股份

西贝被曝将彻底倒闭:贾国龙将揽下绝大部分债务,放弃股份

DoNews
2026-09-19 15:08:08
口角变群架!昆山电子厂群殴事件:线长带3名亲属参战,5人全部被开除无补偿

口角变群架!昆山电子厂群殴事件:线长带3名亲属参战,5人全部被开除无补偿

火山詩话
2026-09-20 05:47:12
审美翻车了!名古屋亚运举牌引导员出圈,引发集体吐槽:是松弛感还是太随意?

审美翻车了!名古屋亚运举牌引导员出圈,引发集体吐槽:是松弛感还是太随意?

火山詩话
2026-09-20 06:55:31
2026-09-20 10:04:49
字母榜 incentive-icons
字母榜
让未来不止于大。
2787文章数 8092关注度
往期回顾 全部

科技要闻

谷歌承认:AI模型“黑”进3家公司

头条要闻

牛弹琴:中东传来一个好消息 美国真打不下去了

头条要闻

牛弹琴:中东传来一个好消息 美国真打不下去了

体育要闻

2026亚运会开幕式 胡明轩吴愉担任旗手

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

伪造票据洗白药品 回流药黑色产业链曝光

汽车要闻

大五座布局 车身尺寸不变 吉利银河M8申报信息公布

态度原创

手机
健康
亲子
艺术
公开课

手机要闻

分析师:苹果“拆分iPhone 18发布节奏”策略已奏效,部分用户转购Pro机型

脑动脉瘤的治疗方法,该选哪一种?

亲子要闻

从“世界高品质”到“透明真安心”,好奇诠释48年品质坚守

艺术要闻

国宝级!石涛书画全集大公开,搜尽奇峰打草稿,这才是中国画天花板!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版