网易首页 > 网易号 > 正文 申请入驻

DeepSeek V4 Pro凌晨突然更新:性能逼近Fable 5,价格只要零头,但还不能“闭眼用”

0
分享至


出品 | 网易智能

作者 | 小小

编辑 | 王凤枝

DeepSeek V4 Pro正式版终于来了?

8月12日,DeepSeek官方API定价页悄悄把V4 Pro的模型版本更新为DeepSeek-V4-Pro-0813。新版本继续沿用原来的模型ID和调用方式,已经接入DeepSeek API以及相关开发工具。


比起预览版,这次更新的重点并不只是"模型变强了"。

DeepSeek正在把V4 Pro的能力重点推向智能体、编程、工具调用和长流程任务。模型不仅要回答问题,还要进入代码仓库、调用工具、执行任务、修改代码,再根据结果继续往下走。

从DeepSeek自报数据和开发者测试来看,DeepSeek V4 Pro 0813在编码、智能体任务和工具使用方面的表现有明显提升,一些测试已经接近甚至超过部分海外前沿模型。

与此同时,它依然延续了DeepSeek最具辨识度的低成本路线。在部分智能体任务中,DeepSeek V4 Pro 0813与Claude、Fable等顶级模型的性能差距已缩小到约5%,但Claude、Fable的价格最高却是DeepSeek V4 Pro的45倍。



这背后对应着行业里的一个变化:模型之间比的,已经不只是每百万Token多少钱,而是完成一个复杂任务到底要花多少钱。

不过,真实体验也说明,这条路并没那么容易。

一些开发者发现,在长时间连续执行时,DeepSeek V4 Pro 0813仍会出现提前停止、反复思考以及部分任务完成质量不稳定的问题。


所以V4 Pro这次真正的看点,不在分数,而在它能不能把DeepSeek一贯的价格优势,延伸到智能体和长任务这些更吃稳定性的场景里。


0813版上线

最大变化是智能体能力

V4 Pro此前已经存在,但一直是预览阶段。8月12日上线的0813版本,意味着这款旗舰模型进入GA阶段。

DeepSeek官方文档确认,模型ID仍是deepseek-v4-pro,调用方式没变。OpenRouter也将DeepSeek V4 Pro 0813标记为正式发布版本,同一天上线。OpenCode Go随后宣布支持这一模型。

从产品能力看,DeepSeek V4 Pro 0813支持工具调用和结构化输出,同时提供OpenAI ChatCompletions、Anthropic Messages以及DeepSeek自己的Responses API。模型支持不同的推理强度,包括非思考、高推理强度和最大强度。

它还拥有100万Token上下文窗口和384K Token最大输出。对于大型代码库、长文档以及需要多轮执行的智能体任务,这意味着一次调用能塞进更多上下文,也能保留更长的执行过程。

DeepSeek V4 Pro 0813的底层架构也保持了较大规模。模型卡显示,它是一个混合专家模型,总参数约1.6万亿,每个Token激活约490亿参数。DeepSeek称,通过新的注意力机制,可以把百万Token场景下的单Token推理计算量降低到V3.2的27%,KV缓存则降低到10%。

不过,这些架构和模型卡数据主要来自DeepSeek自己披露,0813版最亮眼的一批智能体基准结果,截至资料发布时还没有经过独立评测机构完整复现。

在DeepSeek公布的数据里,DeepSeek V4 Pro 0813在Terminal-Bench 2.1上拿到87.9分,预览版为69.8分;DeepSWE从12.8分提高到62.7分,涨了约5倍;CyberGym从68.5分提高到83.3分;AutomationBench从42.1分提高到68.5分。DSBench-FullStack从35.6分提高到61.4分,DSBench-Hard从18.9分提高到50.6分。


放到其他前沿模型旁边看,差距已经比较小。但这不意味着DeepSeek V4 Pro已经全面超过前沿模型。

在无工具调用的Humanity's Last Exam上,DeepSeek报告的成绩为42.7分,跟Claude Opus 5比仍有明显差距。此外,DeepSeek V4 Pro 0813是纯文本模型,不支持视觉输入。

此前模型卡给出的DeepSeek V4-Pro-Max测试结果也显示,该模型在Terminal Bench 2.0、Humanity's Last Exam等项目上仍落后部分前沿系统,但在LiveCodeBench等编码项目上表现突出。

所以,比较稳妥的说法是,DeepSeek V4 Pro 0813在智能体和编程相关任务上的差距已经明显缩小,但离"所有能力全面领先"还有距离。

X用户@Xudong Han整理智能体测试后认为,DeepSeek V4 Pro 0813相较DeepSeek V4 Flash 0731基本是全面提升,尤其是TerminalBench 2.1、DeepSWE和AutomationBench等偏智能体和编程的项目。

他同时指出,Humanity's Last Exam、Toolathlon和DSBench-Hard等任务上,DeepSeek V4 Pro 0813跟最强的一档模型仍有差距。



价格几乎没动

这才是它最现实的优势

性能提升之外,DeepSeek V4 Pro 0813还有一个很直接的特点:价格没跟着性能一起涨。

目前API价格是每百万输入Token 3元钱,每百万输出Token 6元钱,缓存读取价格为每百万Token 0.025元。

相比之下,Artificial Analysis给出的Claude Opus 5价格为每百万输入5美元、输出25美元。GPT-5.6 Sol则是输入5美元、输出30美元。按标价算,DeepSeek V4 Pro 0813的成本明显低于这些模型。

OpenRouter的数据也提供了一个实际运行中的参考。该平台显示,DeepSeek V4 Pro 0813的提供商标价为输入0.435美元、输出0.87美元,P50延迟约1.52秒,吞吐量约52 Token/s,工具调用错误率平均1.60%,缓存命中率平均91.86%。

当然,OpenRouter的实际平均价格会受到缓存和折扣影响,所以不能简单理解成所有用户最终都会按这个价格付。

开发者@AdityaShipsHQ专门比较了DeepSeek V4 Pro 0813和DeepSeek V4 Flash 0731的成本和能力。他注意到,Pro的API价格大约是Flash的3倍,但在智能体、编程和长流程任务上表现更强。

他的判断是,主要做日常高频任务,Flash仍然有比较合理的性价比;缓存输入的价格差距较小,所以长时间运行的Agent任务,Pro的成本溢价会相对小一些。

这也解释了DeepSeek为什么同时保留Flash和Pro两条产品线。

Flash是2840亿参数的MoE模型,激活参数约130亿,价格只有每百万输入0.14美元、输出0.28美元。V4 Pro则承担更重的推理、长上下文编码和智能体任务。

从并发限制也能看出这种区别。资料显示,Flash支持2500个并发请求,Pro则限制在500个。Pro更多用算力处理复杂任务,Flash则适合高频、高吞吐量的工作。

所以,如果一个开发者只是大量调用模型完成简单任务,Flash可能已经够用。要长时间让模型处理代码、调用工具、进行多轮修改时,Pro才更有价值。


开发者@gmi_cloud对Pro 0813、Pro Preview和Flash 0731做了100个深度研究问题的测试。数据显示,Pro 0813在法律、学术和医学三个领域分别达到100%、83%和67%的正确率;Flash在学术和法律方面分别为75%和67%。


@gmi_cloud据此建议,研究和文档密集型任务可以考虑Flash,医疗、金融等高风险领域则更适合用Pro 0813,并增加人工验证。


真正上手后

表现没榜单那么整齐

基准测试很好看,但DeepSeek V4 Pro 0813的实际体验没那么简单。

小红书博主"清歌"做了实际测试。她用同一个"Pelican Cycling SVG Exquisite, Details Ultra"提示词测试自行车骑行鹈鹕图像相关任务,DeepSeek V4 Pro 0813思考了237秒、执行25个步骤,预览版则用了105秒、15个步骤。


她的主观感受是,0813版虽然思考时间和步骤更多,但最终效果反而没有明显优于旧版。

她随后又比较了正式版Flash和Pro制作3D中国地图的表现,发现两个模型都有比较明显的"反思"过程,会不断表示准备开始执行,然后进入下一轮思考。Pro的思维链次数相对少一些,同时在她的测试中,Pro体现出的世界知识更丰富,最终生成质量也更好,而Flash在该任务中直接生成失败。

这个测试有一个点值得注意:模型"想得更久",不一定意味着最终结果一定更好。

小红书博主"工具蛙Frog"看到测试表后认为,DeepSeek V4 Pro 0813这次的重点很明显放在智能体能力上。他特别关注Terminal Bench 2.1、DeepSWE、AutomationBench等指标,同时认为NL2Repo、Toolathlon、DSBench等项目上,Claude和Fable依然有优势。


他的关注点也比较实际:真正用编程智能体时,开发者更在意模型能不能进入代码仓库,能不能连续跑几十步,能不能调用工具,改完代码之后能不能把测试跑通,最后能不能把任务完整做完。

这也是V4 Pro这次升级最值得观察的地方。

开发者@CommandCodeAI对DeepSeek V4 Pro 0813、Kimi K3和Opus 5做了FlappyBench测试,用的是相同的"/design"命令,并从游戏玩法、UX/UI和成本几个方面评价。

测试中,DeepSeek V4 Pro 0813得到8分,单次成本约0.0005美元;Kimi K3为9.5分、0.0740美元;Opus 5为9分、0.2539美元。按这组结果,DeepSeek V4 Pro 0813的成本远低于另外两个模型,但最终输出质量仍然略逊一筹。


@CommandCodeAI随后又测了V4 Pro 0813、Kimi K3和GLM 5.2。V4 Pro同样得到8分,Kimi K3为9.5分,GLM 5.2为9分;对应成本分别为0.0005美元、0.0740美元和0.0480美元。按这组测试,DeepSeek V4 Pro 0813的成本分别约低148倍和96倍,但质量评分并没有达到同样的领先幅度。

@CommandCodeAI因此认为,DeepSeek V4 Pro 0813最突出的地方是成本,生成一个能跑的一次性游戏所需要的费用非常低。但从最终输出质量看,Kimi K3仍然排名更高,GLM 5.2也略高于DeepSeek。

这类测试不能代表模型的整体能力,但它提供了排行榜之外的另一个观察角度:在同一个实际任务里,最终交付质量和完成成本并不一定同步变化。

DeepSeek真正夸张的地方,不是"每次都做得最好",而是"做一次太便宜了"。对于允许反复尝试和自动重试的Agent工作流,这两者的经济意义完全不同。

如果任务需要反复尝试几十次,模型每次调用只花很少的钱,成本优势就会被放大;如果任务更看重一次生成的完成度,质量差距仍然要考虑。

长程任务里,还出现了一个现象:模型会不会"提前交卷"?

X平台用户@Text1G做了50轮测试,在reasoning_effort设置为max的情况下,模型跑到42轮就停了,没把全部测试机会用完。他因此提醒,不能只看DeepSeek V4 Pro 0813公布的benchmark,长周期任务能不能完整跑完同样重要。


小红书博主karminski也做了类似观察。他测试50轮长程智能体编程任务,3次测试里有2次在42到43轮左右停下,同样没有用完全部机会。他明确表示,这只是自己的单个案例,目前还不能据此推断其他任务的表现。


至于原因,目前资料没有给出确定结论。karminski提出的可能性包括强化学习阶段的奖励机制,以及长上下文中的注意力衰减,但这仍属于测试者的猜测,不能当成已经确认的模型缺陷。

这一点尤其值得后续观察,因为DeepSeek自己公布的测试数据恰恰显示,DeepSeek V4 Pro 0813最大的提升集中在长周期智能体任务。

如果模型在标准测试中能连续完成任务,但在真实环境里偶尔提前停止,那开发者实际用时仍然要增加外部的重试、检查和任务恢复机制。

真正的竞争,可能也在模型外面的Harness。

Harness可以简单理解为模型外面的"驾驶系统",负责任务规划、工具调用、记忆、验证、重试和权限控制。对智能体来说,同一个模型放在不同Harness里,最终表现可能完全不同。

这意味着V4 Pro真正的使用效果,可能还取决于模型本身之外的工具链。


Token很便宜

但Agent真正比的是"完成一个任务多少钱"

目前DeepSeek V4 Pro 0813仍按0.435美元输入、0.87美元输出的价格提供服务,但这个价格本身有两个变量。

一个变量是,DeepSeek的定价页面已经出现涨价提示。该公司计划在不久的将来大幅提高整体API价格,具体方案将通过正式通知公布。

所以,现在看到的低价未必是长期价格。

另一个更重要的变量是,对Agent来说,真实成本从来不只是Token单价。

如果一个模型单次调用只要很少的钱,却需要开发者不断检查、反复重试,甚至在关键节点重新接管,那表面上便宜的模型,最终并不一定意味着整体使用成本更低。

反过来,如果模型能稳定完成复杂任务,那即便价格有所上涨,开发者也可能愿意为这种效率买单。

对Agent应用来说,更值得比较的指标,是"完成一个任务的总成本":模型单价、Token消耗、调用轮数、失败率、重试次数、Harness效率以及人工接管成本,都会计入其中。

这也让DeepSeek V4 Pro 0813的商业意义变得更直接。在当前价格下,它给开发者提供了一个成本很低的前沿级智能体编程选择。但如果未来价格明显上涨,或者真实任务中的失败和重试次数较多,开发者就要重新算这笔账。

所以,V4 Pro接下来真正要证明的,已经不只是"模型有多强",而是它能不能成为一个值得长期放进真实工作流里的工具。

这也是为什么现在去判断V4 Pro是否"全面领先"还太早。

Benchmark能告诉我们模型在哪些能力上取得了进步,开发者测试能告诉我们模型放进真实环境后会发生什么。

两者结合,才能看见一个更完整的V4 Pro。

而从目前这些测试来看,它的优势和问题其实已经逐渐浮现:能力正在逼近前沿,价格依然非常低;但长流程执行、稳定性以及模型之外的Agent系统,还需要继续打磨。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
王思聪5年前配的100万电脑今天值多少钱?对比后惊了

王思聪5年前配的100万电脑今天值多少钱?对比后惊了

快科技
2026-08-13 06:49:04
“新型啃老”已来临?985毕业生家里蹲,家长:不工作也不结婚

“新型啃老”已来临?985毕业生家里蹲,家长:不工作也不结婚

白米饭怎么吃
2026-08-08 20:04:51
兰州大学原校长李发伸逝世!建榆中校区、进985、211,均在其任期内…

兰州大学原校长李发伸逝世!建榆中校区、进985、211,均在其任期内…

双一流高校
2026-08-14 01:45:28
中方向全世界通告,若台海开战,出兵参战一律等同侵略中国领土!

中方向全世界通告,若台海开战,出兵参战一律等同侵略中国领土!

史之韵
2026-08-12 20:38:17
56岁日本大叔健身做网红,什么时候努力都不晚!

56岁日本大叔健身做网红,什么时候努力都不晚!

下水道男孩
2026-08-14 01:20:05
土耳其外长罕见捅破窗户纸:乌再打下去,俄可能真要掀核武桌了!

土耳其外长罕见捅破窗户纸:乌再打下去,俄可能真要掀核武桌了!

南宗历史
2026-08-14 01:30:38
ESPN记者:湖人队新老板想要取得成功,就应该联系克里斯·保罗

ESPN记者:湖人队新老板想要取得成功,就应该联系克里斯·保罗

好火子
2026-08-13 23:46:48
条件不符别尬演检察官!全程苦瓜脸,老戏骨也带不动这“拖油瓶”

条件不符别尬演检察官!全程苦瓜脸,老戏骨也带不动这“拖油瓶”

娱说瑜悦
2026-08-13 14:52:16
亚冠资格赛重大争议!加时赛换两人被拒,韩俱乐部提交抗议

亚冠资格赛重大争议!加时赛换两人被拒,韩俱乐部提交抗议

老皢尾声体育解说
2026-08-13 08:04:28
0-7两连败狂丢12球!中国足球小将被打爆,前国脚摇头、董路无奈

0-7两连败狂丢12球!中国足球小将被打爆,前国脚摇头、董路无奈

粵語经典歌單
2026-08-03 08:15:21
调整!央视5直播WTT大满贯有变,国乒再战张本美和 王曼昱赛程出炉

调整!央视5直播WTT大满贯有变,国乒再战张本美和 王曼昱赛程出炉

南海浪花
2026-08-13 18:08:09
日媒罕见承认:中国不和高市政府打交道,原因全在东京

日媒罕见承认:中国不和高市政府打交道,原因全在东京

牛锅巴小钒
2026-08-14 02:42:16
2027年江苏将有五座地级市迎来自己的最大高铁站,利好上亿人出行

2027年江苏将有五座地级市迎来自己的最大高铁站,利好上亿人出行

匹夫来搞笑
2026-08-14 00:38:44
从MVP到终身禁赛,一场“降维打击”毁掉的不止是冠军

从MVP到终身禁赛,一场“降维打击”毁掉的不止是冠军

阿陆
2026-08-11 18:28:16
打掉涉黑涉恶犯罪团伙22个辽宁公安扫黑除恶首轮行动收网告捷

打掉涉黑涉恶犯罪团伙22个辽宁公安扫黑除恶首轮行动收网告捷

金台资讯
2026-08-12 20:38:20
与房东矛盾激化?茉莉奶白伦敦一门店被砸

与房东矛盾激化?茉莉奶白伦敦一门店被砸

观察者网
2026-08-13 15:11:04
博主裁判圈:中超本轮起部分场次试行现场播报,裁判将开麦播报最终决定

博主裁判圈:中超本轮起部分场次试行现场播报,裁判将开麦播报最终决定

懂球帝
2026-08-13 21:56:09
就在刚刚,上海男篮曝出锁定大外援,北京首钢旧将有望加盟,上赛季场均12+6!

就在刚刚,上海男篮曝出锁定大外援,北京首钢旧将有望加盟,上赛季场均12+6!

寒律
2026-08-14 00:01:22
费坚,已任江苏省政府副秘书长!嵊州市委书记裘建勇,拟任新职!

费坚,已任江苏省政府副秘书长!嵊州市委书记裘建勇,拟任新职!

兰妮搞笑分享
2026-08-14 02:38:55
要做女强人:那不是宣言,是我在日常中逐渐积累的可替代性

要做女强人:那不是宣言,是我在日常中逐渐积累的可替代性

疾跑的小蜗牛
2026-08-13 19:04:29
2026-08-14 06:23:00
星海情报局 incentive-icons
星海情报局
关注“中国制造”的星辰大海
1392文章数 2031关注度
往期回顾 全部

科技要闻

一切皆插件!DeepSeek Harness正式发布

头条要闻

冉莹颖被指称“输了换老公有保险”邹市明深夜回应

头条要闻

冉莹颖被指称“输了换老公有保险”邹市明深夜回应

体育要闻

负债十几亿的联赛,还在疯狂买球星

娱乐要闻

篡改红歌已立案,郭德纲大祸临头

财经要闻

可治疗癌症?神话破灭的片仔癀 陷入争议

汽车要闻

全新红旗H7到底新在哪儿?

态度原创

游戏
家居
艺术
时尚
教育

跨越星海的“仰齐与共”,我们又打了一场“仰齐浜”保卫战

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

顶级的大片

HYROX赛场上的美照怎么拍出来的?

教育要闻

8月30日前完成!山东综评价系统填写教程!

无障碍浏览 进入关怀版