网易首页 > 网易科技 > 网易科技 > 正文

DeepSeek V4 Pro凌晨突然更新:性价比炸裂,但仍需打磨

0
分享至

出品 | 网易科技

作者 | 小小

编辑 | 王凤枝

DeepSeek V4 Pro正式版终于来了?

8月12日,DeepSeek官方API定价页悄悄把V4 Pro的模型版本更新为DeepSeek-V4-Pro-0813。新版本继续沿用原来的模型ID和调用方式,已经接入DeepSeek API以及相关开发工具。

比起预览版,这次更新的重点并不只是"模型变强了"。

DeepSeek正在把V4 Pro的能力重点推向智能体、编程、工具调用和长流程任务。模型不仅要回答问题,还要进入代码仓库、调用工具、执行任务、修改代码,再根据结果继续往下走。

从DeepSeek自报数据和开发者测试来看,DeepSeek V4 Pro 0813在编码、智能体任务和工具使用方面的表现有明显提升,一些测试已经接近甚至超过部分海外前沿模型。

与此同时,它依然延续了DeepSeek最具辨识度的低成本路线。在部分智能体任务中,DeepSeek V4 Pro 0813与Claude、Fable等顶级模型的性能差距已缩小到约5%,但Claude、Fable的价格最高却是DeepSeek V4 Pro的45倍。

这背后对应着行业里的一个变化:模型之间比的,已经不只是每百万Token多少钱,而是完成一个复杂任务到底要花多少钱。

不过,真实体验也说明,这条路并没那么容易。

一些开发者发现,在长时间连续执行时,DeepSeek V4 Pro 0813仍会出现提前停止、反复思考以及部分任务完成质量不稳定的问题。

所以V4 Pro这次真正的看点,不在分数,而在它能不能把DeepSeek一贯的价格优势,延伸到智能体和长任务这些更吃稳定性的场景里。

01 0813版上线,最大变化是智能体能力

V4 Pro此前已经存在,但一直是预览阶段。8月12日上线的0813版本,意味着这款旗舰模型进入GA阶段。

DeepSeek官方文档确认,模型ID仍是deepseek-v4-pro,调用方式没变。OpenRouter也将DeepSeek V4 Pro 0813标记为正式发布版本,同一天上线。OpenCode Go随后宣布支持这一模型。

从产品能力看,DeepSeek V4 Pro 0813支持工具调用和结构化输出,同时提供OpenAI ChatCompletions、Anthropic Messages以及DeepSeek自己的Responses API。模型支持不同的推理强度,包括非思考、高推理强度和最大强度。

它还拥有100万Token上下文窗口和384K Token最大输出。对于大型代码库、长文档以及需要多轮执行的智能体任务,这意味着一次调用能塞进更多上下文,也能保留更长的执行过程。

DeepSeek V4 Pro 0813的底层架构也保持了较大规模。模型卡显示,它是一个混合专家模型,总参数约1.6万亿,每个Token激活约490亿参数。DeepSeek称,通过新的注意力机制,可以把百万Token场景下的单Token推理计算量降低到V3.2的27%,KV缓存则降低到10%。

不过,这些架构和模型卡数据主要来自DeepSeek自己披露,0813版最亮眼的一批智能体基准结果,截至资料发布时还没有经过独立评测机构完整复现。

在DeepSeek公布的数据里,DeepSeek V4 Pro 0813在Terminal-Bench 2.1上拿到87.9分,预览版为69.8分;DeepSWE从12.8分提高到62.7分,涨了约5倍;CyberGym从68.5分提高到83.3分;AutomationBench从42.1分提高到68.5分。DSBench-FullStack从35.6分提高到61.4分,DSBench-Hard从18.9分提高到50.6分。

放到其他前沿模型旁边看,差距已经比较小。但这不意味着DeepSeek V4 Pro已经全面超过前沿模型。

在无工具调用的Humanity's Last Exam上,DeepSeek报告的成绩为42.7分,跟Claude Opus 5比仍有明显差距。此外,DeepSeek V4 Pro 0813是纯文本模型,不支持视觉输入。

此前模型卡给出的DeepSeek V4-Pro-Max测试结果也显示,该模型在Terminal Bench 2.0、Humanity's Last Exam等项目上仍落后部分前沿系统,但在LiveCodeBench等编码项目上表现突出。

所以,比较稳妥的说法是,DeepSeek V4 Pro 0813在智能体和编程相关任务上的差距已经明显缩小,但离"所有能力全面领先"还有距离。

X用户@Xudong Han整理智能体测试后认为,DeepSeek V4 Pro 0813相较DeepSeek V4 Flash 0731基本是全面提升,尤其是TerminalBench 2.1、DeepSWE和AutomationBench等偏智能体和编程的项目。

他同时指出,Humanity's Last Exam、Toolathlon和DSBench-Hard等任务上,DeepSeek V4 Pro 0813跟最强的一档模型仍有差距。

02价格几乎没动,这才是它最现实的优势

性能提升之外,DeepSeek V4 Pro 0813还有一个很直接的特点:价格没跟着性能一起涨。

目前API价格是每百万输入Token 3元钱,每百万输出Token 6元钱,缓存读取价格为每百万Token 0.025元。

相比之下,Artificial Analysis给出的Claude Opus 5价格为每百万输入5美元、输出25美元。GPT-5.6 Sol则是输入5美元、输出30美元。按标价算,DeepSeek V4 Pro 0813的成本明显低于这些模型。

OpenRouter的数据也提供了一个实际运行中的参考。该平台显示,DeepSeek V4 Pro 0813的提供商标价为输入0.435美元、输出0.87美元,P50延迟约1.52秒,吞吐量约52 Token/s,工具调用错误率平均1.60%,缓存命中率平均91.86%。

当然,OpenRouter的实际平均价格会受到缓存和折扣影响,所以不能简单理解成所有用户最终都会按这个价格付。

开发者@AdityaShipsHQ专门比较了DeepSeek V4 Pro 0813和DeepSeek V4 Flash 0731的成本和能力。他注意到,Pro的API价格大约是Flash的3倍,但在智能体、编程和长流程任务上表现更强。

他的判断是,主要做日常高频任务,Flash仍然有比较合理的性价比;缓存输入的价格差距较小,所以长时间运行的Agent任务,Pro的成本溢价会相对小一些。

这也解释了DeepSeek为什么同时保留Flash和Pro两条产品线。

Flash是2840亿参数的MoE模型,激活参数约130亿,价格只有每百万输入0.14美元、输出0.28美元。V4 Pro则承担更重的推理、长上下文编码和智能体任务。

从并发限制也能看出这种区别。资料显示,Flash支持2500个并发请求,Pro则限制在500个。Pro更多用算力处理复杂任务,Flash则适合高频、高吞吐量的工作。

所以,如果一个开发者只是大量调用模型完成简单任务,Flash可能已经够用。要长时间让模型处理代码、调用工具、进行多轮修改时,Pro才更有价值。

开发者@gmi_cloud对Pro 0813、Pro Preview和Flash 0731做了100个深度研究问题的测试。数据显示,Pro 0813在法律、学术和医学三个领域分别达到100%、83%和67%的正确率;Flash在学术和法律方面分别为75%和67%。

@gmi_cloud据此建议,研究和文档密集型任务可以考虑Flash,医疗、金融等高风险领域则更适合用Pro 0813,并增加人工验证。

03真正上手后,表现没榜单那么整齐

基准测试很好看,但DeepSeek V4 Pro 0813的实际体验没那么简单。

小红书博主"清歌"做了实际测试。她用同一个"Pelican Cycling SVG Exquisite, Details Ultra"提示词测试自行车骑行鹈鹕图像相关任务,DeepSeek V4 Pro 0813思考了237秒、执行25个步骤,预览版则用了105秒、15个步骤。

她的主观感受是,0813版虽然思考时间和步骤更多,但最终效果反而没有明显优于旧版。

她随后又比较了正式版Flash和Pro制作3D中国地图的表现,发现两个模型都有比较明显的"反思"过程,会不断表示准备开始执行,然后进入下一轮思考。Pro的思维链次数相对少一些,同时在她的测试中,Pro体现出的世界知识更丰富,最终生成质量也更好,而Flash在该任务中直接生成失败。

这个测试有一个点值得注意:模型"想得更久",不一定意味着最终结果一定更好。

小红书博主"工具蛙Frog"看到测试表后认为,DeepSeek V4 Pro 0813这次的重点很明显放在智能体能力上。他特别关注Terminal Bench 2.1、DeepSWE、AutomationBench等指标,同时认为NL2Repo、Toolathlon、DSBench等项目上,Claude和Fable依然有优势。

他的关注点也比较实际:真正用编程智能体时,开发者更在意模型能不能进入代码仓库,能不能连续跑几十步,能不能调用工具,改完代码之后能不能把测试跑通,最后能不能把任务完整做完。

这也是V4 Pro这次升级最值得观察的地方。

开发者@CommandCodeAI对DeepSeek V4 Pro 0813、Kimi K3和Opus 5做了FlappyBench测试,用的是相同的"/design"命令,并从游戏玩法、UX/UI和成本几个方面评价。

测试中,DeepSeek V4 Pro 0813得到8分,单次成本约0.0005美元;Kimi K3为9.5分、0.0740美元;Opus 5为9分、0.2539美元。按这组结果,DeepSeek V4 Pro 0813的成本远低于另外两个模型,但最终输出质量仍然略逊一筹。

@CommandCodeAI随后又测了V4 Pro 0813、Kimi K3和GLM 5.2。V4 Pro同样得到8分,Kimi K3为9.5分,GLM 5.2为9分;对应成本分别为0.0005美元、0.0740美元和0.0480美元。按这组测试,DeepSeek V4 Pro 0813的成本分别约低148倍和96倍,但质量评分并没有达到同样的领先幅度。

@CommandCodeAI因此认为,DeepSeek V4 Pro 0813最突出的地方是成本,生成一个能跑的一次性游戏所需要的费用非常低。但从最终输出质量看,Kimi K3仍然排名更高,GLM 5.2也略高于DeepSeek。

这类测试不能代表模型的整体能力,但它提供了排行榜之外的另一个观察角度:在同一个实际任务里,最终交付质量和完成成本并不一定同步变化。

DeepSeek真正夸张的地方,不是"每次都做得最好",而是"做一次太便宜了"。对于允许反复尝试和自动重试的Agent工作流,这两者的经济意义完全不同。

如果任务需要反复尝试几十次,模型每次调用只花很少的钱,成本优势就会被放大;如果任务更看重一次生成的完成度,质量差距仍然要考虑。

长程任务里,还出现了一个现象:模型会不会"提前交卷"?

X平台用户@Text1G做了50轮测试,在reasoning_effort设置为max的情况下,模型跑到42轮就停了,没把全部测试机会用完。他因此提醒,不能只看DeepSeek V4 Pro 0813公布的benchmark,长周期任务能不能完整跑完同样重要。

小红书博主karminski也做了类似观察。他测试50轮长程智能体编程任务,3次测试里有2次在42到43轮左右停下,同样没有用完全部机会。他明确表示,这只是自己的单个案例,目前还不能据此推断其他任务的表现。

至于原因,目前资料没有给出确定结论。karminski提出的可能性包括强化学习阶段的奖励机制,以及长上下文中的注意力衰减,但这仍属于测试者的猜测,不能当成已经确认的模型缺陷。

这一点尤其值得后续观察,因为DeepSeek自己公布的测试数据恰恰显示,DeepSeek V4 Pro 0813最大的提升集中在长周期智能体任务。

如果模型在标准测试中能连续完成任务,但在真实环境里偶尔提前停止,那开发者实际用时仍然要增加外部的重试、检查和任务恢复机制。

真正的竞争,可能也在模型外面的Harness。

Harness可以简单理解为模型外面的"驾驶系统",负责任务规划、工具调用、记忆、验证、重试和权限控制。对智能体来说,同一个模型放在不同Harness里,最终表现可能完全不同。

这意味着V4 Pro真正的使用效果,可能还取决于模型本身之外的工具链。

04 Token很便宜,但Agent真正比的是"完成一个任务多少钱"

目前DeepSeek V4 Pro 0813仍按0.435美元输入、0.87美元输出的价格提供服务,但这个价格本身有两个变量。

一个变量是,DeepSeek的定价页面已经出现涨价提示。该公司计划在不久的将来大幅提高整体API价格,具体方案将通过正式通知公布。

所以,现在看到的低价未必是长期价格。

另一个更重要的变量是,对Agent来说,真实成本从来不只是Token单价。

如果一个模型单次调用只要很少的钱,却需要开发者不断检查、反复重试,甚至在关键节点重新接管,那表面上便宜的模型,最终并不一定意味着整体使用成本更低。

反过来,如果模型能稳定完成复杂任务,那即便价格有所上涨,开发者也可能愿意为这种效率买单。

对Agent应用来说,更值得比较的指标,是"完成一个任务的总成本":模型单价、Token消耗、调用轮数、失败率、重试次数、Harness效率以及人工接管成本,都会计入其中。

这也让DeepSeek V4 Pro 0813的商业意义变得更直接。在当前价格下,它给开发者提供了一个成本很低的前沿级智能体编程选择。但如果未来价格明显上涨,或者真实任务中的失败和重试次数较多,开发者就要重新算这笔账。

所以,V4 Pro接下来真正要证明的,已经不只是"模型有多强",而是它能不能成为一个值得长期放进真实工作流里的工具。

这也是为什么现在去判断V4 Pro是否"全面领先"还太早。

Benchmark能告诉我们模型在哪些能力上取得了进步,开发者测试能告诉我们模型放进真实环境后会发生什么。

两者结合,才能看见一个更完整的V4 Pro。

而从目前这些测试来看,它的优势和问题其实已经逐渐浮现:能力正在逼近前沿,价格依然非常低;但长流程执行、稳定性以及模型之外的Agent系统,还需要继续打磨。

相关推荐
热点推荐
90年代邵东黑道少年佘智江为何成了KK园缔造者,他表哥却成了大佬

90年代邵东黑道少年佘智江为何成了KK园缔造者,他表哥却成了大佬

睡前讲故事
2025-11-14 13:00:20
A股:突放量跳水超49点,原因浮出水面!做好准备,A股很可能这样走!

A股:突放量跳水超49点,原因浮出水面!做好准备,A股很可能这样走!

股侠指北针
2026-10-09 11:04:34
开拓者执行杨瀚森选项已成定局,不执行才会震惊联盟,此事无关国籍

开拓者执行杨瀚森选项已成定局,不执行才会震惊联盟,此事无关国籍

陈錈爱体育
2026-10-09 08:36:06
男子每天发朋友圈炫耀女儿美貌,老师察觉不对报警,警方推开门傻眼

男子每天发朋友圈炫耀女儿美貌,老师察觉不对报警,警方推开门傻眼

罪案洞察者
2025-07-18 17:04:05
张家齐母女:一条13.1克的金项链,锁在抽屉里9年!

张家齐母女:一条13.1克的金项链,锁在抽屉里9年!

宛沐
2026-10-09 09:00:36
日本不怕中国制裁,不怕经济下滑,不怕航班取消,不怕拉走熊猫,不怕旅游业萧条,日本根本就不是在赌,而是已经把最坏的结果都想了一遍

日本不怕中国制裁,不怕经济下滑,不怕航班取消,不怕拉走熊猫,不怕旅游业萧条,日本根本就不是在赌,而是已经把最坏的结果都想了一遍

回京历史梦
2026-10-08 06:20:08
35岁新郎婚礼当天就医后离世:喜宴变丧席,只隔了两个半小时

35岁新郎婚礼当天就医后离世:喜宴变丧席,只隔了两个半小时

程韧风
2026-10-09 10:15:00
《余红旧事》第19集郝洁这场自慰戏,有无必要?导演太会拍了

《余红旧事》第19集郝洁这场自慰戏,有无必要?导演太会拍了

露珠聊影视
2026-10-07 21:20:16
北京地铁事儿全网都炸翻天了!大学生的三天噩梦,比电视剧还憋屈

北京地铁事儿全网都炸翻天了!大学生的三天噩梦,比电视剧还憋屈

苗苗情感说
2026-10-09 10:49:42
今晚7点半决赛!中国女篮PK澳大利亚,陈楠手握利好,翻身机会来了

今晚7点半决赛!中国女篮PK澳大利亚,陈楠手握利好,翻身机会来了

萌兰聊个球
2026-10-09 08:51:58
追尾一定是后车全责?女司机高速35公里/小时龟速行驶被追尾,称天黑看不清开慢点安全;交警:女司机与后车司机同等责任

追尾一定是后车全责?女司机高速35公里/小时龟速行驶被追尾,称天黑看不清开慢点安全;交警:女司机与后车司机同等责任

扬子晚报
2026-10-09 10:21:52
WTT中国大满贯:王艺迪首局救3局点,国乒组合9-11惜败世界第1!

WTT中国大满贯:王艺迪首局救3局点,国乒组合9-11惜败世界第1!

刘姚尧的文字城堡
2026-10-09 11:18:40
河北富商相亲发现小23岁对象酷似亡妻,DNA检测后傻眼:怎么可能

河北富商相亲发现小23岁对象酷似亡妻,DNA检测后傻眼:怎么可能

罪案洞察者
2025-07-09 11:51:52
90%的家长都搞错了:频繁出行,正悄悄毁掉孩子专注力

90%的家长都搞错了:频繁出行,正悄悄毁掉孩子专注力

辣妈当小小
2026-10-08 18:10:35
腾格尔现状:住北京别墅,66岁彻底戒酒,把老来得子儿子宠成宝

腾格尔现状:住北京别墅,66岁彻底戒酒,把老来得子儿子宠成宝

财叔
2026-10-07 20:40:08
“乡下父母全是这样被骗的”,中职女孩穿廉价警服,过来人说实话

“乡下父母全是这样被骗的”,中职女孩穿廉价警服,过来人说实话

番外行
2026-10-09 09:40:45
张本美和找教练告状!松岛辉空输球发脾气+故意不理人 被批没教养

张本美和找教练告状!松岛辉空输球发脾气+故意不理人 被批没教养

风过乡
2026-10-09 07:30:42
王皓报警不到24小时,大半个饭圈被拉下水,王楚钦成众矢之的

王皓报警不到24小时,大半个饭圈被拉下水,王楚钦成众矢之的

观察鉴娱
2026-10-08 10:23:28
“这拿筷子姿势,太恶心了”,一段母女吃饭视频火了,又一个贫民窟的小公主

“这拿筷子姿势,太恶心了”,一段母女吃饭视频火了,又一个贫民窟的小公主

蝴蝶花雨话教育
2026-10-06 11:47:56
印尼总统普拉博沃,最新涉华表态

印尼总统普拉博沃,最新涉华表态

政知新媒体
2026-10-09 10:44:00
2026-10-09 13:20:49

科技要闻

字节"干扰模型训练"实习生融资近2亿元

头条要闻

男子看房发现有十几个人急交10万定金 回家感觉不对劲

头条要闻

男子看房发现有十几个人急交10万定金 回家感觉不对劲

体育要闻

30天30队·鹈鹕:胖虎又一年“如果”

娱乐要闻

蔡康永回应,装都不装了!

财经要闻

日薪120元,我给机器人当“老师”

汽车要闻

不想改车又不想撞衫 来看看小鹏P7+的黑武士版

态度原创

教育
时尚
本地
游戏
手机

教育要闻

到2027年,将培育20个标杆!北京城乡学校共同体建设方案发布

这件“棕色外套”越来越火!这样穿复古又好看

本地新闻

转型再出发 奋勇打头阵

《宝可梦集换式卡牌游戏》滑板盲袋10月17日发售!

手机要闻

一加x京东方第四代东方屏发布:全新X4发光材料、日常165Hz、游戏185Hz,一加16首发搭载

无障碍浏览 进入关怀版
×