![]()
![]()
284B 总参数,13B 激活量,1M 上下文配合 384K 输出,专攻 Agent 的 deepseek-v4-flash(版本号 0731)于昨天正式开启 API 公测。
虽然这仅是一次后训练层面的更新,但其在代码智能体领域表现亮眼:Terminal Bench 2.1 得分 82.7,CyberGym 76.7,Toolathlon-Verified 70.3。这组数据涵盖了终端实操、安全防护与多工具调度等 Agent 最核心的应用场景。
![]()
图片来源:更新日志 | DeepSeek API Docs
跑分之外,真实交付能力才是硬通货。本次测评在 Codex 环境下,通过三道完全开放的实战任务对模型进行极限压测:
从零开发: 无脚手架状态下自主搭建个人知识管理系统(考察需求分析与闭环落地);
长链研究:全局联网生成全球 AI 产业五层研究报告(考察多步骤执行下的目标对齐);
异地接续:零历史记忆接管上一轮代码并完成审查重构(考察陌生上下文理解与安全修改)。
这三道题分别对应 Agent 落地最易溃败的三个断层。不设标准答案,只看最终交付。
![]()
看清新模型的身份
DeepSeek-V4-Flash-0731 延续了 284B 总参数、单 Token 动态激活 13B 的纯文本 MoE 架构,依然提供 1M 上下文窗口与 384K 最大输出。
回看 V4 技术报告,Flash 的长文本能力建立在其 43 层 Transformer 的特殊设计之上:前两层采用纯滑动窗口注意力,后续层则交替使用 CSA(压缩稀疏注意力)与 HCA(强压缩注意力)。
CSA 将连续 Token 压缩 4 倍,并通过索引器为每个 Query 精准挑选 Top-512 个相关 KV 条目;HCA 则直接将压缩率拉到 128 倍,以极低成本保留粗粒度的全局信息。两者均辅以窗口大小为 128 的滑动分支,将计算开销从“随长度暴涨”变为“大体可控”,使百万 Token 上下文在工程部署中真正具备了可行性。通俗来说,模型不再是每读一个新词就把全部历史翻一遍,而是先压缩、再筛选,只有必要时才回看全局。
MoE 结构上,它延续了 DeepSeekMoE 路线:每层包含 1 个共享专家与 256 个路由专家(单 Token 激活 6 个),前 3 层采用确定性 Hash 路由并引入多 Token 预测机制。模型在 32 万亿 Token 上完成了预训练,大部分参数由 Muon 优化器更新。在 V4 原始报告中,后训练流程是先分别培养数学、代码、Agent、指令遵循等领域的专项专家,再通过在线策略蒸馏融合为统一模型。虽然官方确认 0731 重做了一遍后训练,但我们无法直接断言它是否完整复用了 Preview 的全部专家培养与蒸馏路径。
如果把预训练比作读万卷书,后训练就是专业岗前培训。预训练赋予模型海量常识,而后训练则教会它如何操作工具、编写代码、搞定复杂任务。从 Agent 榜单的大幅提升来看,0731 显然在代码与工具调用场景下进行了极具针对性的专项强化。
目前,0731 的权重已完全开源。官方配置文件显示,其核心 Transformer 与 MoE 架构均未做改动,新增模块主要服务于推理解码加速。官方公布的 9 项成绩全数聚焦于代码、终端操作与工具调用,既没有刷通用知识榜,也没有提及多模态指标。原因非常明确:0731 是一个纯文本模型,官方把增强重点全放在了 Agent 能力上。
![]()
实测见实力
实测一:个人知识管理系统
第一题是一道从零开始的工程题,简化后的任务是这样的:
V1:从空目录开发一个可运行的个人知识管理系统:注册登录、笔记管理、标签分类与搜索、统计看板、Markdown 导出、SQLite 持久化、pytest 测试和 README,必须一条命令启动。 V2:在现有项目上继续迭代,新增批量 Markdown 导入、备份恢复、双向链接。技术栈限定 Python3.12 与 FastAPI,前端使用原生 HTML、CSS、JavaScript。
![]()
图片来源:codex 页面截图(V1)
模型两轮累计用时约 162 分钟,排除异常状态后时长会短一些。交付物确实能一条命令启动,前端原生实现无刷新切换,后端与数据库真实联动,浏览器端到端验证通过。批量导入支持 md 文件和压缩包,能识别重复内容、拦截危险路径;备份恢复包裹在事务里,失败可回滚;双向链接能跳转、能反查。
审核环节最认可的是工程底子:代码分层清楚,数据库查询统一防注入,用户输入统一防脚本,老数据升级有迁移逻辑,不同用户的数据互不可见。
两轮开发的时间分布也说明它保持了工程节奏:第一轮从需求分析到项目落地约 88 分钟,第二轮在已有系统上做增量约 74 分钟。它没有推倒重来,而是先读原有代码,再补数据迁移和前端入口,最后跑完整回归。 这种“先理解再动手”的顺序,和真实团队的迭代方式几乎一致。
![]()
![]()
图片来源:个人知识系统网页截图
把交付物当普通产品用一遍,体验是完整的:注册一个账号,写一篇笔记,打上标签,搜索关键词,查看统计看板,再导出一份 Markdown,整条链路都能走通;换一个账号登录,看不到前一个用户的数据。对于一道没有提供任何模板的题目,第一版就能达到这个完成度已经相当不错。
但验收环节也发现了几处与要求不符的地方。首先,最明显的是技术栈:题目明确要求 FastAPI,最终交付却是 Flask。产品理解没有问题,硬性约束却走了样。接着,细节方面,笔记没有真正渲染 Markdown,全量导出格式不友好,批量导入时标签位置错乱,恢复在部分场景不完整,双向链接存在时序缺陷。这些缺陷都不致命,却说明模型擅长搭主干,在“提示词没有反复强调的边界”上仍会漏。
![]()
图片来源:codex 页面截图
最后,执行过程还有一个插曲:启动服务时,模型把常驻进程当成普通命令同步运行,任务界面因此挂起 41 分钟。根因是 Agent 工具没有区分阻塞型命令与后台服务,模型也缺少超时判断,但或许框架与模型都要占一部分责任。
实测二:AI 产业五层研究报告
第二题从写代码切换到做研究,任务简化后是这样:
联网完成一份全球 AI 产业基本面研究报告:按 AI 芯片与算力、数据中心与云计算、基础模型、开发平台与 Agent、行业应用五层展开,每层分析市场规模、商业模式、核心公司、关键数据、竞争格局、增长驱动与风险;交付 PPT、PDF、Excel 数据表和来源清单,并区分事实、估算与判断。
这次全程约 36 分钟:14 分钟联网调研,3 分钟整理数据,9 分钟生成 17 页 PPT,7 分钟转 PDF 并逐页检查,其余时间用于计划和收尾,几乎没有返工。
![]()
![]()
图片来源:交付 PPT 部分截图
17 页 PPT 从封面、方法论、五层正文到价值分布、未来判断和风险页完整展开;来源以公司财报和权威研究机构为主,微软和亚马逊最新一季的数据都被准确抓取,新鲜度较高;Excel 自带自动检查页,每页底部标注数据性质,来源清单写明口径,避免各层收入被错误加总。模型还分得清收入、合同额、资本开支这些容易混淆的财务概念。
![]()
![]()
图片来源:交付 Excel 部分截图
这份报告对普通读者是否友好?每一页都有清晰的小节标题,数据下面标注来源和时间,图表能直接看懂。更重要的是,它把“公司财报里写死的数字”“研究机构给出的预测”和“模型自己的推断”分开标注,读者一眼就能判断哪句话有出处、哪句话需要谨慎。同时模型创建了 sources.md 文件,标注了所有数据来源链接,可以对数据进行快速溯源验证。对投资研究、行业分析这类场景,这种透明度比华丽的版面更有价值。
![]()
图片来源:sources.md 文件
数据链条规范、可追溯、格式符合要求。短板集中在排版:PPT 部分标题和长段落存在溢出或不对齐,最后一公里的视觉精修仍需要收尾。 这一题最有价值的不是它“搜到了多少”,而是它把来源、数据、图表和判断串成了一条可审计的链。 对研究类 Agent 来说,可追溯比漂亮更重要,而这恰恰是很多模型最容易崩掉的环节。
实测三:陌生仓库审查与修复
第三题是与第一题的互搏:模型没有第一题的任何对话记忆,任务简化后是这样:
在全新会话中接手一个陌生项目:先运行项目与全部测试,理解代码;重点审查登录与权限、用户数据隔离、密码处理、注入与脚本攻击、异常返回、并发风险、可维护性和测试覆盖;修复高优先级问题并补充测试,交付审查报告。
模型先跑基线测试,37 项全部通过,随后用 12 分钟完成代码走读,8 分钟完成安全审计。它没有报一堆规范层面的皮毛问题,而是点出了三个真正针对知识管理系统的风险:恶意压缩包防护、错误信息统一收敛、上传与恢复大小限制。它还主动用独立临时数据库跑端到端验证,避免污染原数据;发现测试框架的等待机制在单线程服务下会一直挂起后,没有改业务代码,而是换了更合适的等待方式。
修复后测试从 37 项增至 53 项,新增 16 项安全专项测试,12 项端到端场景全部通过,审查报告结构完整,临时验证实例也被清理干净。如果只看交付物,这一题几乎无可挑剔:理解准确、定位精准、修改克制、回归充分。
![]()
图片来源:审查报告文件
交付的审查报告包含确认问题、修复范围、测试结果和残余风险四部分,还附带了一份耗时记录,把每个阶段的起止时间列得清清楚楚。 这种自我复盘的意识,在自动生成的交付物里并不常见。
“接手陌生项目”对人类工程师来说从来不是轻松事:先跑起来,再读文档,再定位问题,最后小心翼翼地修改并保证不破坏原有功能。模型在这一题里基本复刻了这套流程,而且把最危险的步骤控制住了: 修改集中在后端安全边界,没有大范围重构,改完以后原有测试全部保留并继续通过,新增测试也全部通过。 这说明它的“胆大”和“心细”是并存的。
![]()
![]()
图片来源:codex 页面截图
但过程同样暴露短板。整个任务耗时约 86 分钟,其中相当一部分消耗在服务启动环节: 模型反复用同步命令运行常驻服务 ,一次等待 5 分钟,一次等待 12 分钟,直到测试人员介入才继续;它清理临时环境变量的方式也偏粗暴。这类问题有一半属于 Agent 外壳的设计缺陷,工具没有区分同步命令与后台服务,模型自然容易掉进“死等”的陷阱,而对模型本身而言, 缺少的是时间感知与主动脱困能力。
![]()
长板与短板
把三道题放在一起,长板很清楚:凡是需要模型自己建立状态、自己验证状态的任务,比如事务、校验、回归,完成度都明显更高。任务基本都能走到成品,交付前会主动校验状态,而且坚持用原生技术完成,不依赖外部框架掩盖难度。 可以说,它的长链推理和交付能力,明显强于它的“环境生存能力”。
短板也集中在同一类场景:凡是需要感知外部环境状态的任务,比如进程是否在运行、命令是否该后台执行,就会露出破绽。具体表现为硬性约束偶尔走样、收尾细节容易遗漏、在真实终端里缺少时间感知、遇到阻塞命令会死等。
把这两组特点放在一起,它在工程型任务里的画像很接近一位能独立完成大部分工作的主力工程师:需求来了能搭主体,测试写了能证明基本正确,安全边界也守得住。但在验收清单上仍然需要人类把关,因为约束是否被悄悄替换、排版是否溢出、进程是否卡住,模型自己并不总能发现。这也决定了它目前的最佳使用方式:适合放进有人盯着的自动化流程,而不是直接丢进无人值守的生产环境。
![]()
和同场选手比一比
![]()
图片来源:DeepSeek-V4-Flash-0731 更新公告
与 D eepseek-v4-flash-Preview 相比,0731 在 DeepSWE 上从 7.3 跳到 54.4,DSBench-Hard 从 25.8 跳到 59.6,DSBench-FullStack 从 37.0 跳到 68.7。 同样是 284B 和 13B 激活,重新执行后训练,Agent 成绩就出现数量级提升,说明这代模型的能力上限一定程度上由后训练配方决定。
与 DeepSeek-V4-Pro-Preview 相比,Flash-0731 在 NL2Repo 上以 54.2 对 38.5 领先,CyberGym 以 76.7 对 52.7 领先,DSBench-FullStack 以 68.7 对 41.8 领先。一个激活规模更小的模型在部分 Agent 场景里反超同门更大的模型, 说明在具体任务上,架构规模并不是唯一变量,后训练、推理预算和 Agent 框架同样会改变最终结果。
这件事的意义不止于一家公司内部的产品线竞争。过去大家默认“参数越大越强”,而 Flash-0731 证明,在 Agent 任务上, 后训练的质量可以改写规模带来的差距 。对开发者来说, 这意味着选择模型时不能只看总参数量,还要看具体任务上的实测和版本迭代。 对开源生态来说,也意味着一个激活负担更轻的模型,有可能成为更多人用得起、部署得起的 Agent 基座。
放到外部模型里,GLM-5.2 在 TerminalBench2.1 为 81.0、DeepSWE 为 46.2、Toolathlon-Verified 为 59.9、DSBench-Hard 为 54.5,Flash-0731 均保持领先;与 Opus-4.8 相比,Flash-0731 已经明显接近,但最难的长期 Coding Agent 任务仍有差距。
如果再往远处看,各家已经把路线分得很开: Kimi K3 以 2.8 万亿参数和原生图文多模态登顶开源旗舰,用接近闭源旗舰的能力和约三分之一的任务成本争夺开发者;GLM-5.2 把长程任务做成主线,强调一次任务中连续规划、执行与修复的自主闭环;Claude Opus 5 与 Fable 5 则守住数日级自治的标杆,靠多子智能体、自我校验和工业级长任务维持溢价。DeepSeek-V4-Flash-0731 选择的是另一条路:不拼多模态和总参数,用 13B 激活把代码、终端、工具调用这些文本 Agent 高频场景做到极致,同时把调用成本压到最低。
这些数字背后还有一层:Flash-0731 是在更小的激活规模下做到的,说明它把有限的推理预算用在了刀刃上。 对需要高频调用 Agent 的团队来说,这种“小马拉大车”的实现方式,本身就是一种值得关注的产品路线。
这些对比仍然需要加一层限制:官方表格中的不同模型使用各自的 Agent 框架与推理设置,DSBench-FullStack 和 DSBench-Hard 还是 DeepSeek 内部测试集,跨模型分数不能直接等同于日常使用体验。更可靠的说法是:deepseek-v4-flash-0731 的生态位是轻量激活的长上下文 Agent 基座,它以 284B 核心目标模型、13B 激活的规模,把代码、终端、工具调用和全栈开发这些高频 Agent 场景做成了重点能力。
![]()
结语
这轮测试给出的答案并不复杂:deepseek-v4-flash-0731 已经能完成真实、复杂、可验收的工作,三道题全部交出完整成品。同时,它也用“挂起 41 分钟”和“86 分钟里反复等待”提醒我们,Agent 的能力从来不只是模型单方面的事。
过去一年,大模型竞争的重心已经从“谁答得更对”转向“谁 更能闭环 ”。从零构建、联网调研、陌生仓库审查,都在问同一句话:模型能不能把一次长任务从头执行到尾,并且在出错时自己发现、自己纠正。
当 284B 参数的仓库配上 13B 激活的每次计算,百万级上下文不再意味着无底洞式的资源消耗,Agent 任务的入口已经被大幅打开。剩下的问题是:重新后训练带来的 Agent 能力提升能否在更多真实场景中稳定复现,以及当模型真正跑进无人值守的生产流程时,谁为那一次次“死等”兜底。这些问题的答案,可能比榜单上的任何一分都更重要。
参考资料:
[1] DeepSeek API Docs,deepseek-v4-flash 官方更新日志(0731 上线、重新后训练与 Agent 基准说明),https://api-docs.deepseek.com/zh-cn/updates/
[2] Hugging Face,DeepSeek-V4-Flash-0731 官方模型权重(开源权重、Benchmark、DSpark 与部署说明),https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
[3] Hugging Face,DeepSeek-V4-Flash-0731 配置文件(层数、隐藏维度、CSA/HCA 压缩率、MoE 与 DSpark 参数),https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/blob/main/config.json
[4] DeepSeek-AI,DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence(架构、预训练与原始后训练流程),https://arxiv.org/html/2606.19348v1
[5] DeepSeek API Docs,模型与价格(1M 上下文、384K 最大输出与接口能力),https://api-docs.deepseek.com/zh-cn/quick_start/pricing/
作者:Dean Qiu
![]()
![]()
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.