我可能是算错了,DeepSeek Flash 有可能会被 DeepSeek Pro 给斩杀掉。
因为Artificial Analysis的正式结果还没有出来,下面这些数字是我根据DeepSeek官方小助手发布的性能图表推算出来的。
![]()
V4 Pro 性价比估算
主要的依据来源于 DeepSeek 官方小助手发的性能图表。这个数据大概瞄一眼就知道提升有多大了,比较夸张的是 DeepSWE,从预览版的 12.8 提升到 62.7,将近五倍的提升。
![]()
添加图片注释,不超过 140 字(可选)
计算过程是这样的,先拿已经有 AA 分数的 DeepSeek V4 Flash 0731 当参照(截止8.12)
- V4 Pro Max:45.2683 分,$0.0474025/task
- V4 Flash 0731:51.7666 分,$0.0271349/task
它的10项评测均分是55.47,Pro 0813是60.80,也就是Pro高出约9.6%。因此,Pro 0813的智力指数可以估算为:
51.77×60.8055.47≈56.74
所以Pro 0813在AA里面的智力指数,我暂时估在56.74分左右。这样算的理由也比较简单,两个模型用的是同一张性能表、同一套项目和同一种计分尺度,拿它们的相对差距去调整Flash已经公开的AA分数,比拿模型参数量或者某一个单项成绩硬推更稳定一些。
成本这一部分,相对保守的办法,是把Preview到0813的提升理解为单位有效产出提高了1.635倍,再让成本按反比例下降:
0.0474×60.80/37.19≈0.0290美元
也就是说,主推结果大约是56.74分、0.0290美元一次任务。这个点已经可以进入帕累托前沿,但它还没有严格斩杀Flash,因为Flash的成本大约是0.0271美元,比0.0290美元稍微低一点,两个模型仍然各有一个维度占优。
不过两者的距离已经很小了。从0.0290美元降到0.0271美元,只需要再降低大约6.4%。如果AA以后实测出来,发现Pro 0813完成同一批任务时确实少用了更多推理Token,把成本压到了0.0271美元以下,那么它就会同时比分数51.77的Flash更聪明、也更便宜,到那个时候才可以说Flash被Pro严格斩杀。
V4 Pro的后训练提升巨大
不过撇开是否被斩杀还是怎么样,但可以肯定的是V4 的两个版本完成新一轮后训练以后,提升幅度非常大,按照 DeepSeek 官方发布的对比表,把 HLE 的不带工具与带工具两项先取平均,再计算十组 Agent 评测,Pro Preview 到 Pro-0813 平均增加约 24.0 个百分点,Flash Preview 到 Flash-0731 平均增加约 23.5 个百分点。
![]()
DeepSWE 的增速看起来最大,绝对增加也达到 49.9和47.1 个百分点,Cybergym、DSBench-Hard、DSBench-FullStack 的绝对增量同样很高,这几项共同指向代码执行、终端操作和长链路任务能力的变化。
看起来,后训练给所有模型带来的提升都是巨大的。
Pro-0813 与 Fable 5、GPT-5.6 Sol 的位置
同时可以肯定的是,Pro 0813 在跟这个最前沿模型相比之后,已经 100% 可以确认,它已经进入了 Agent 能力的第一梯队附近。
如果用这个图来看,现在 DeepSeek Pro、Fable 5、GPT-5.6 Sol 以及 Kimi K3 都是坐一张桌子的
![]()
可以说是比较稳定地超过了 Cloud 的 4.8 这个大版本,同时在部分情况下,已经接近了 Fable 5 这个模型。
开源模型世界
但是大家要知道,这个 DeepSeek V4 Pro 它是一个开源模型,这个模型的大小大家是很清楚的。
那么跟开源模型相比,主要是跟这次公布的 DeepSeek V4 Flash、Kimi K3 以及 GLM 5.2 相比,DeepSeek V4 Pro 的模型参数排第二,是 1.6T。最大的是 Kimi K3,是 2.8T。
但是有意思的是,DeepSeek V4 Pro 的 Agent 性能指数,和比它大的 2.8T 的 Kimi K3 在伯仲之间。可以说,DeepSeek 肯定是有自己一套独到的 Agent(也就是后训练)方法。因为即使是只有 284B(差不多小了 10 倍)的一个模型,它都能达到 83.7 的指标。
可以说,DeepSeek-V4-Pro-0813 是一个可能会斩杀很多模型的一个模型。
![]()
V4 Preview 发布时,Pro 已经具备很强的知识、数学和代码能力,Agent 评测却暴露出明显短板。经过新一轮后训练,Pro 与 Flash 在十组评测上的平均绝对提升都超过23个百分点,提升最大的部分集中在需要连续使用工具、读取环境反馈和反复验证结果的任务。
Pro-0813 目前最合适的位置,是最强模型最严厉的爸爸。它在 AutomationBench、Cybergym和部分 DSBench 项目里很强,HLE带工具和Terminal Bench也已经靠近Fable 5与GPT-5.6 Sol,DeepSWE和Toolathlon仍能看到差距,也还需要更多外部复测来验证稳定性。
如果任务量大、并发高、每次失败的成本可控,Flash-0731更划算。如果任务涉及大型仓库、困难调试、网络安全环境或者长时间工具调用,Pro-0813增加的成功率更可能覆盖价格差。两款模型这次提升的共同点,是参数规模没有成为主要变量,后训练把模型已有的代码与推理能力组织成了更稳定的执行过程。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.