网易首页 > 网易号 > 正文 申请入驻

DeepSeek V4 Flash正式版能力暴涨背后,一支新团队浮出水面

0
分享至

为什么DeepSeek-V4-Flash-0731的后训练如此有效?

今天DS在官宣中提到这次的更新,Flash架构没变,但实际效果提升如此巨大。

很疑惑,为什么如此有效?

一个不能忽视的变量是DeepSeek刚刚成立的Harness团队,以及这个团队背后的一位核心人物:崔添翼Tianyi Cui。



DS突然开始疯狂招兵买马

如果你关注过这个人的推特的话,你会发现他发的帖子里面绝大多数都是关于 DeepSeek 招人的,而他本人是 DeepSeek Harness 团队的一个技术 staff,有可能就是 leader 级别的。



因为从他 7 月 21 号发的新帖子来看,Harness 这个部门是新成立的。他提到部门的目标非常远大,很可能就是 ASI 或者 AGI。

目前他们工作非常繁重,非常缺人,正在招三种职位:

1. Harness 研究员

2. 工程师

3. 产品经理

公开报道通常将崔添翼称为DeepSeek Harness团队负责人;他个人公开身份则是Harness团队的技术成员。换句话说,不管DeepSeek内部的正式职级如何划分,他至少是这个团队目前最核心的人物之一。

特别是他提到了最终的终面是由他来面,这也是我判断他是 leader 的主要原因。



甚至在 LinkedIn 上,我看到他在很多平台上都在招聘 Harness 相关的人员。



崔添翼的履历也很有意思。

他本科毕业于浙江大学计算机学院,在校期间长期参加ACM-ICPC竞赛。据国内公开报道,他曾六次获得亚洲区区域赛金牌。毕业后,他进入Jane Street,在香港从事软件开发和研究接近9年,业务覆盖交易系统、固定收益和股票;2022年,他又联合创办了量化交易公司TSY Capital,直到2026年3月加入DeepSeek。



量化系统和Agent,底层能力高度相似

这条职业路线与传统的大模型研究员不太一样。

他不是一路从语言模型论文、对齐算法或者自然语言处理实验室走出来的,而是长期在真实的量化交易系统里工作。

我个人认为,他量化背景对于 Agent 的加持其实非常直接。

其实我觉得这也是很多时候为什么“无心插柳柳成荫”—高频交易和量化系统本质上就是“高可靠性、低延迟、多步骤决策、实时工具/数据集成、不确定环境下的长程策略执行”。这些能力与Agent几乎一一对应。

比如规划、工具链式调用、错误自动回退与重试、多Agent协调、上下文与状态管理。

这是在大方向确立以及核心的框架确定之后,再加上疯狂招人的策略,也让这个 Agent Harness 的能力(也就是后训练效果)倍增。

特别是他最新发的一个帖子,他在招募 Agent 相关开源项目的开发者。

其实这个意思有点像 build in public,也就是招募在 Agent 方面有丰富经验的开发者。这些人其实可以不是我们以前通俗理解的大模型从业者,比如你可以是医疗方面的从业者,也可以是歌曲生成方面的从业者。只要你有相关经验,特别是在大量的 Agent 对话或者测试过程中发现过问题、总结出经验,这反而才是后训练阶段最需要的人。



你要知道,DeepSeek 可以说是这个地球上最火热的科技IP之一。DeepSeek 发布的招募有很多人自愿响应。靠着 DeepSeek 的声望,再加上 Agent Harness 团队,我觉得 DeepSeek V4 Pro 的效果有很大概率能和 Fable 5 打平,甚至有可能超越它。

这是为什么有人提到了DeepSeek 的新模型甚至已经达到了帕累托最优。



另外还有个点,那就是 DeepSeek V4 Flash 其实跟它的正式版之间的架构没有任何差别,唯一的区别就是后训练做得更充分。

这非常有可能跟上面这位大佬提到的思路是一致的。他认为在 4 月份的时候,DeepSeek V4 只是后训练做得不够充分,没有完全发挥出它的架构潜力。



这就说明,其实 DeepSeek 自从发布以来,不管是它的 V3、R1 还是现在的 V4,在架构上面可能已经优化到头了。

对于后训练来说,就是是将一个模型从智商正常的成年人,训练成一个可以干各种复杂工作的全能手。而这个全能手的一个前提,就是它在所有的基础知识上面是没有短板的。目前看来,DeepSeek V4 预训练模型的架构依旧是非常优质的。

这次上涨,不能全部算在模型权重上

这里还有一个很关键的细节。

DeepSeek在V4-Flash-0731的模型卡中明确写道,公开的代码Agent测试使用了尚未发布的DeepSeek Harness,运行的是minimal模式,同时开启了max推理强度。

这意味着,我们看到的成绩严格来说并不是一个完全脱离外部系统的“裸模型成绩”,而是:

DeepSeek-V4-Flash-0731模型+DeepSeek Harness+最大推理强度。

所以,这次能力暴涨很可能包含两部分。

一部分是模型权重经过新一轮后训练后,确实更擅长规划、调用工具和处理长流程任务;另一部分则是Harness更好地管理了工具、文件、上下文和任务循环,把模型原本已经具备、但以前没有稳定发挥出来的能力释放了出来。

这并不是说崔添翼一个人主导了0731版本的模型训练。目前没有公开资料能够证明这一点。

但从时间线看,他3月加入DeepSeek,4月发布的V4还是Preview版本,随后Harness团队快速成立并扩招,7月底正式版Flash的提升又主要集中在Agent和工具使用上。

因此,我更倾向于认为:崔添翼和Harness团队未必是这轮后训练的唯一原因,但很可能是DeepSeek Agent能力迅速补强的重要变量之一。

V4的后训练,为什么特别适合提升Agent?

最后,分享下来自于V4技术报告中关于后训练的细节:

第一阶段是领域专家独立训练。

DeepSeek并不是直接把数学、编程、知识问答、指令遵循和Agent工具使用等所有任务混在一起训练,而是先针对不同领域分别培养专家模型。

每一个专家先使用高质量领域数据进行监督微调,也就是SFT;随后再通过GRPO进行强化学习,并使用与该领域对应的奖励信号。数学题可以根据答案进行验证,编程任务可以直接运行测试用例,Agent任务则可以放进真实或模拟环境中,检查它究竟有没有完成目标。

这样做的好处是,每个专家都可以集中解决自己的问题。

Agent专家不需要同时考虑怎么写好一篇文章,它可以专门练习工具调用、长程规划、错误恢复和任务执行。数学专家也不需要为了兼顾普通聊天而牺牲推理强度。

第二阶段,则是多教师在线策略蒸馏,也就是On-Policy Distillation。

DeepSeek使用了十多个不同领域的专家作为教师,然后让统一的学生模型在自己生成的轨迹上,学习最相关专家的输出分布。

这里学的并不只是“标准答案是什么”。

学生模型在每一步生成过程中,都要学习专家对整个词表的概率判断。DeepSeek还使用了完整词表的reverse KL,而不是只模仿最终选中的那个token。这样得到的更接近一种行为策略,而不是简单背下专家给出的答案。

这对于Agent尤其重要。

因为Agent的好坏往往不是由最后一句答案决定的,而是由中间几十甚至几百个动作决定的:

什么时候搜索,什么时候打开文件,什么时候执行代码,发现错误后是否重试,以及什么时候停止继续探索。

传统的监督微调可能只告诉模型“正确答案长什么样”,而在线策略蒸馏可以让学生模型在自己的行动轨迹上,逐步靠近Agent专家的行为分布。

真正稀缺的是可以大量产生失败轨迹的环境

DeepSeek技术报告里还有一部分非常容易被忽略:它专门搭建了用于Agent后训练和评测的沙箱系统DeepSeek Elastic Compute,也就是DSec。



根据报告,一个DSec集群可以管理数十万个并发沙箱实例,支持函数调用、容器、虚拟机以及完整的软件工程环境。

这件事可能比多增加一些训练文本更加重要。

普通语言模型可以从互联网文本中学习知识,但Agent必须通过行动学习。模型需要真的运行代码、修改文件、调用工具、观察结果,然后根据失败继续调整。

如果只有少量人工演示,模型很难学会处理各种边缘情况。只有当你能大规模创建执行环境,让模型不断尝试、不断失败,再通过测试用例或者环境反馈自动打分,Agent强化学习才真正有可能扩大规模。

这也是为什么DeepSeek这次的后训练会显得格外有效。

V4的底座并不是一个缺乏知识的弱模型。它已经使用超过32万亿token进行预训练,Flash基础模型虽然每个token只激活较少参数,但在知识、编程和长上下文测试中已经表现很强。

它缺少的未必是“再学一点知识”,而是把已有知识组织成稳定行为的能力。

打个不完全准确的比方,预训练相当于培养出一个知识很全面的成年人;后训练则是在教他如何使用终端、管理项目、检查错误、调用外部工具,并在没人一直监督的情况下把一项复杂工作做完。

底子已经在那里了,后训练只是在把能力接到真实世界的接口上。

一旦训练环境、奖励机制和Harness同时改善,成绩就可能出现跳跃,而不是一点点上涨。

结论

从目前公开的Agent测试看,新版Flash已经在不少项目上接近GLM-5.2和Claude Opus 4.8,同时API价格低得多。至少在Agent性能和调用成本这两个维度上,它已经非常接近性价比前沿。

因此,我依然很看好后续的V4-Pro。

如果Pro版本能够吃到和Flash类似的后训练红利,那么它逼近甚至在部分Agent任务上超过Opus 4.8,并不是一个特别夸张的判断。

至于能不能直接打平Fable 5,现在还没有足够的数据。

但至少可以确定,DeepSeek接下来最值得关注的,可能已经不只是下一篇模型架构论文,而是崔添翼和这支仍在疯狂招人的Harness团队,最终会把DeepSeek的模型变成一个什么样的Agent。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
查了一下王虹的婚姻状况,结果让人感慨,不是身份有多特殊,而是感觉她可能不会公开自己的婚姻状态…

查了一下王虹的婚姻状况,结果让人感慨,不是身份有多特殊,而是感觉她可能不会公开自己的婚姻状态…

LULU生活家
2026-08-01 09:05:32
王虹不再回避!公开回应是否回国发展,与邓煜的态度如出一辙

王虹不再回避!公开回应是否回国发展,与邓煜的态度如出一辙

粤语音乐喷泉
2026-08-02 01:31:24
桑切斯痛斥移民危机:“这是对西班牙领土完整的侵犯”

桑切斯痛斥移民危机:“这是对西班牙领土完整的侵犯”

参考消息
2026-08-01 19:48:11
养老金调整预期讨论:江苏、广东今年上调幅度,能否达到人均60元

养老金调整预期讨论:江苏、广东今年上调幅度,能否达到人均60元

白昼说故事
2026-08-02 09:06:55
离谱!女排瓦尔加斯通过官方基因检测,千万网友以貌取人引热议!

离谱!女排瓦尔加斯通过官方基因检测,千万网友以貌取人引热议!

草莓解说体育
2026-08-02 04:48:16
中信证券:调整基本结束,8月修复可期,但并非简单超跌反弹

中信证券:调整基本结束,8月修复可期,但并非简单超跌反弹

金融界
2026-08-02 17:10:45
俄朝1亿美元跨境大桥将完工,中俄关系引关注

俄朝1亿美元跨境大桥将完工,中俄关系引关注

拾这一抹残妆月
2026-08-02 11:42:21
老板娘问我她身材好不好?我该怎么回答?

老板娘问我她身材好不好?我该怎么回答?

太急张三疯
2026-08-02 04:59:57
哈里诉《每日邮报》案败诉,面临最高4.6亿元诉讼费,为搞钱他是否孤注一掷再次向王室开刀?

哈里诉《每日邮报》案败诉,面临最高4.6亿元诉讼费,为搞钱他是否孤注一掷再次向王室开刀?

译言
2026-08-02 16:38:49
代总统不再掩饰!百亿石油全被拿下,委内瑞拉真正主人浮出水面

代总统不再掩饰!百亿石油全被拿下,委内瑞拉真正主人浮出水面

开车要双手
2026-08-01 23:20:30
航班延误4小时,给旅客发放延误餐食竟是过期泡面;祥鹏航空:已回收,无旅客食用,提供200元的现金补偿

航班延误4小时,给旅客发放延误餐食竟是过期泡面;祥鹏航空:已回收,无旅客食用,提供200元的现金补偿

大风新闻
2026-08-02 14:17:19
王虹在清华大学讲课竟然还用英文,不用文言文,太不像话!

王虹在清华大学讲课竟然还用英文,不用文言文,太不像话!

廖保平
2026-08-01 09:33:42
名记:郑钦文别把自己当女王了!奥运冠军去打最低级别比赛不丢人

名记:郑钦文别把自己当女王了!奥运冠军去打最低级别比赛不丢人

念洲
2026-08-02 13:51:21
44岁姚笛现状:回老家吃烧烤,与丈夫长期分居,在家带孩子难复出

44岁姚笛现状:回老家吃烧烤,与丈夫长期分居,在家带孩子难复出

洲洲影视娱评
2026-08-01 15:07:12
访华回国就变脸?阿努廷突然叫停陆桥项目,中方明白泰国的苦衷

访华回国就变脸?阿努廷突然叫停陆桥项目,中方明白泰国的苦衷

新一说史
2026-08-01 14:41:58
一天5瓜!索赔504万、当庭认罪、塌房、互撕,李小璐最令人意外

一天5瓜!索赔504万、当庭认罪、塌房、互撕,李小璐最令人意外

叨唠
2026-08-01 21:40:23
谢贤离世!谢婷婷最大支柱不是狄波拉谢霆锋,而是隐身43年的她

谢贤离世!谢婷婷最大支柱不是狄波拉谢霆锋,而是隐身43年的她

手工制作阿歼
2026-08-02 09:31:02
欧盟宣布向菲律宾军队提供经济援助!24小时内,14对14,1500万,欧盟这一手,真是连装都懒得装了

欧盟宣布向菲律宾军队提供经济援助!24小时内,14对14,1500万,欧盟这一手,真是连装都懒得装了

橙色书卷
2026-07-30 19:39:13
曹操撩寡妇说的金句,如今成约会开场白,男人常挂在嘴边

曹操撩寡妇说的金句,如今成约会开场白,男人常挂在嘴边

小豫讲故事
2026-08-02 06:00:12
拒绝3000万!失业流浪!24岁新星!场均20+!赌输了?

拒绝3000万!失业流浪!24岁新星!场均20+!赌输了?

篮球盛世
2026-08-01 17:03:42
2026-08-02 17:48:49
侃故事的阿庆
侃故事的阿庆
几分钟看完一部影视剧,诙谐幽默的娓娓道来
922文章数 9085关注度
往期回顾 全部

科技要闻

零跑月销10万破纪录!比亚迪奇瑞海外卖爆

头条要闻

中央编办批复同意组建新机构 领导班子、主要职责公布

头条要闻

中央编办批复同意组建新机构 领导班子、主要职责公布

体育要闻

1米76的他,为什么是史上最强中卫之一?

娱乐要闻

一天5瓜!“做头发”事件另有玄机?

财经要闻

长鑫科技四万亿市值背后的资本与周期

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

亲子
游戏
教育
房产
军事航空

亲子要闻

辅酶q10备孕期怎么吃?卵巢功能下降怎样调理吃什么?

名记者称《光环》新作上PS是自取其辱!损害品牌形象

教育要闻

日常英语:我只是在游泳

房产要闻

1700亿砸下!信息量巨大!海南甩出又一个超级规划!

军事要闻

特朗普:在伊朗和中东多国请求下 同意取消打击伊朗

无障碍浏览 进入关怀版