网易首页 > 网易科技 > 网易科技 > 正文

DeepSeek V4 Pro凌晨突然更新:性价比炸裂,但仍需打磨

0
分享至

出品 | 网易科技

作者 | 小小

编辑 | 王凤枝

DeepSeek V4 Pro正式版终于来了?

8月12日,DeepSeek官方API定价页悄悄把V4 Pro的模型版本更新为DeepSeek-V4-Pro-0813。新版本继续沿用原来的模型ID和调用方式,已经接入DeepSeek API以及相关开发工具。

比起预览版,这次更新的重点并不只是"模型变强了"。

DeepSeek正在把V4 Pro的能力重点推向智能体编程、工具调用和长流程任务。模型不仅要回答问题,还要进入代码仓库、调用工具、执行任务、修改代码,再根据结果继续往下走。

从DeepSeek自报数据和开发者测试来看,DeepSeek V4 Pro 0813在编码、智能体任务和工具使用方面的表现有明显提升,一些测试已经接近甚至超过部分海外前沿模型。

与此同时,它依然延续了DeepSeek最具辨识度的低成本路线。在部分智能体任务中,DeepSeek V4 Pro 0813与Claude、Fable等顶级模型的性能差距已缩小到约5%,但Claude、Fable的价格最高却是DeepSeek V4 Pro的45倍。

这背后对应着行业里的一个变化:模型之间比的,已经不只是每百万Token多少钱,而是完成一个复杂任务到底要花多少钱。

不过,真实体验也说明,这条路并没那么容易。

一些开发者发现,在长时间连续执行时,DeepSeek V4 Pro 0813仍会出现提前停止、反复思考以及部分任务完成质量不稳定的问题。

所以V4 Pro这次真正的看点,不在分数,而在它能不能把DeepSeek一贯的价格优势,延伸到智能体和长任务这些更吃稳定性的场景里。

01 0813版上线,最大变化是智能体能力

V4 Pro此前已经存在,但一直是预览阶段。8月12日上线的0813版本,意味着这款旗舰模型进入GA阶段。

DeepSeek官方文档确认,模型ID仍是deepseek-v4-pro,调用方式没变。OpenRouter也将DeepSeek V4 Pro 0813标记为正式发布版本,同一天上线。OpenCode Go随后宣布支持这一模型。

从产品能力看,DeepSeek V4 Pro 0813支持工具调用和结构化输出,同时提供OpenAI ChatCompletions、Anthropic Messages以及DeepSeek自己的Responses API。模型支持不同的推理强度,包括非思考、高推理强度和最大强度。

它还拥有100万Token上下文窗口和384K Token最大输出。对于大型代码库、长文档以及需要多轮执行的智能体任务,这意味着一次调用能塞进更多上下文,也能保留更长的执行过程。

DeepSeek V4 Pro 0813的底层架构也保持了较大规模。模型卡显示,它是一个混合专家模型,总参数约1.6万亿,每个Token激活约490亿参数。DeepSeek称,通过新的注意力机制,可以把百万Token场景下的单Token推理计算量降低到V3.2的27%,KV缓存则降低到10%。

不过,这些架构和模型卡数据主要来自DeepSeek自己披露,0813版最亮眼的一批智能体基准结果,截至资料发布时还没有经过独立评测机构完整复现。

在DeepSeek公布的数据里,DeepSeek V4 Pro 0813在Terminal-Bench 2.1上拿到87.9分,预览版为69.8分;DeepSWE从12.8分提高到62.7分,涨了约5倍;CyberGym从68.5分提高到83.3分;AutomationBench从42.1分提高到68.5分。DSBench-FullStack从35.6分提高到61.4分,DSBench-Hard从18.9分提高到50.6分。

放到其他前沿模型旁边看,差距已经比较小。但这不意味着DeepSeek V4 Pro已经全面超过前沿模型。

在无工具调用的Humanity's Last Exam上,DeepSeek报告的成绩为42.7分,跟Claude Opus 5比仍有明显差距。此外,DeepSeek V4 Pro 0813是纯文本模型,不支持视觉输入。

此前模型卡给出的DeepSeek V4-Pro-Max测试结果也显示,该模型在Terminal Bench 2.0、Humanity's Last Exam等项目上仍落后部分前沿系统,但在LiveCodeBench等编码项目上表现突出。

所以,比较稳妥的说法是,DeepSeek V4 Pro 0813在智能体和编程相关任务上的差距已经明显缩小,但离"所有能力全面领先"还有距离。

X用户@Xudong Han整理智能体测试后认为,DeepSeek V4 Pro 0813相较DeepSeek V4 Flash 0731基本是全面提升,尤其是TerminalBench 2.1、DeepSWE和AutomationBench等偏智能体和编程的项目。

他同时指出,Humanity's Last Exam、Toolathlon和DSBench-Hard等任务上,DeepSeek V4 Pro 0813跟最强的一档模型仍有差距。

02价格几乎没动,这才是它最现实的优势

性能提升之外,DeepSeek V4 Pro 0813还有一个很直接的特点:价格没跟着性能一起涨。

目前API价格是每百万输入Token 3元钱,每百万输出Token 6元钱,缓存读取价格为每百万Token 0.025元。

相比之下,Artificial Analysis给出的Claude Opus 5价格为每百万输入5美元、输出25美元。GPT-5.6 Sol则是输入5美元、输出30美元。按标价算,DeepSeek V4 Pro 0813的成本明显低于这些模型。

OpenRouter的数据也提供了一个实际运行中的参考。该平台显示,DeepSeek V4 Pro 0813的提供商标价为输入0.435美元、输出0.87美元,P50延迟约1.52秒,吞吐量约52 Token/s,工具调用错误率平均1.60%,缓存命中率平均91.86%。

当然,OpenRouter的实际平均价格会受到缓存和折扣影响,所以不能简单理解成所有用户最终都会按这个价格付。

开发者@AdityaShipsHQ专门比较了DeepSeek V4 Pro 0813和DeepSeek V4 Flash 0731的成本和能力。他注意到,Pro的API价格大约是Flash的3倍,但在智能体、编程和长流程任务上表现更强。

他的判断是,主要做日常高频任务,Flash仍然有比较合理的性价比;缓存输入的价格差距较小,所以长时间运行的Agent任务,Pro的成本溢价会相对小一些。

这也解释了DeepSeek为什么同时保留Flash和Pro两条产品线。

Flash是2840亿参数的MoE模型,激活参数约130亿,价格只有每百万输入0.14美元、输出0.28美元。V4 Pro则承担更重的推理、长上下文编码和智能体任务。

从并发限制也能看出这种区别。资料显示,Flash支持2500个并发请求,Pro则限制在500个。Pro更多用算力处理复杂任务,Flash则适合高频、高吞吐量的工作。

所以,如果一个开发者只是大量调用模型完成简单任务,Flash可能已经够用。要长时间让模型处理代码、调用工具、进行多轮修改时,Pro才更有价值。

开发者@gmi_cloud对Pro 0813、Pro Preview和Flash 0731做了100个深度研究问题的测试。数据显示,Pro 0813在法律、学术和医学三个领域分别达到100%、83%和67%的正确率;Flash在学术和法律方面分别为75%和67%。

@gmi_cloud据此建议,研究和文档密集型任务可以考虑Flash,医疗、金融等高风险领域则更适合用Pro 0813,并增加人工验证。

03真正上手后,表现没榜单那么整齐

基准测试很好看,但DeepSeek V4 Pro 0813的实际体验没那么简单。

小红书博主"清歌"做了实际测试。她用同一个"Pelican Cycling SVG Exquisite, Details Ultra"提示词测试自行车骑行鹈鹕图像相关任务,DeepSeek V4 Pro 0813思考了237秒、执行25个步骤,预览版则用了105秒、15个步骤。

她的主观感受是,0813版虽然思考时间和步骤更多,但最终效果反而没有明显优于旧版。

她随后又比较了正式版Flash和Pro制作3D中国地图的表现,发现两个模型都有比较明显的"反思"过程,会不断表示准备开始执行,然后进入下一轮思考。Pro的思维链次数相对少一些,同时在她的测试中,Pro体现出的世界知识更丰富,最终生成质量也更好,而Flash在该任务中直接生成失败。

这个测试有一个点值得注意:模型"想得更久",不一定意味着最终结果一定更好。

小红书博主"工具蛙Frog"看到测试表后认为,DeepSeek V4 Pro 0813这次的重点很明显放在智能体能力上。他特别关注Terminal Bench 2.1、DeepSWE、AutomationBench等指标,同时认为NL2Repo、Toolathlon、DSBench等项目上,Claude和Fable依然有优势。

他的关注点也比较实际:真正用编程智能体时,开发者更在意模型能不能进入代码仓库,能不能连续跑几十步,能不能调用工具,改完代码之后能不能把测试跑通,最后能不能把任务完整做完。

这也是V4 Pro这次升级最值得观察的地方。

开发者@CommandCodeAI对DeepSeek V4 Pro 0813、Kimi K3和Opus 5做了FlappyBench测试,用的是相同的"/design"命令,并从游戏玩法、UX/UI和成本几个方面评价。

测试中,DeepSeek V4 Pro 0813得到8分,单次成本约0.0005美元;Kimi K3为9.5分、0.0740美元;Opus 5为9分、0.2539美元。按这组结果,DeepSeek V4 Pro 0813的成本远低于另外两个模型,但最终输出质量仍然略逊一筹。

@CommandCodeAI随后又测了V4 Pro 0813、Kimi K3和GLM 5.2。V4 Pro同样得到8分,Kimi K3为9.5分,GLM 5.2为9分;对应成本分别为0.0005美元、0.0740美元和0.0480美元。按这组测试,DeepSeek V4 Pro 0813的成本分别约低148倍和96倍,但质量评分并没有达到同样的领先幅度。

@CommandCodeAI因此认为,DeepSeek V4 Pro 0813最突出的地方是成本,生成一个能跑的一次性游戏所需要的费用非常低。但从最终输出质量看,Kimi K3仍然排名更高,GLM 5.2也略高于DeepSeek。

这类测试不能代表模型的整体能力,但它提供了排行榜之外的另一个观察角度:在同一个实际任务里,最终交付质量和完成成本并不一定同步变化。

DeepSeek真正夸张的地方,不是"每次都做得最好",而是"做一次太便宜了"。对于允许反复尝试和自动重试的Agent工作流,这两者的经济意义完全不同。

如果任务需要反复尝试几十次,模型每次调用只花很少的钱,成本优势就会被放大;如果任务更看重一次生成的完成度,质量差距仍然要考虑。

长程任务里,还出现了一个现象:模型会不会"提前交卷"?

X平台用户@Text1G做了50轮测试,在reasoning_effort设置为max的情况下,模型跑到42轮就停了,没把全部测试机会用完。他因此提醒,不能只看DeepSeek V4 Pro 0813公布的benchmark,长周期任务能不能完整跑完同样重要。

小红书博主karminski也做了类似观察。他测试50轮长程智能体编程任务,3次测试里有2次在42到43轮左右停下,同样没有用完全部机会。他明确表示,这只是自己的单个案例,目前还不能据此推断其他任务的表现。

至于原因,目前资料没有给出确定结论。karminski提出的可能性包括强化学习阶段的奖励机制,以及长上下文中的注意力衰减,但这仍属于测试者的猜测,不能当成已经确认的模型缺陷。

这一点尤其值得后续观察,因为DeepSeek自己公布的测试数据恰恰显示,DeepSeek V4 Pro 0813最大的提升集中在长周期智能体任务。

如果模型在标准测试中能连续完成任务,但在真实环境里偶尔提前停止,那开发者实际用时仍然要增加外部的重试、检查和任务恢复机制。

真正的竞争,可能也在模型外面的Harness。

Harness可以简单理解为模型外面的"驾驶系统",负责任务规划、工具调用、记忆、验证、重试和权限控制。对智能体来说,同一个模型放在不同Harness里,最终表现可能完全不同。

这意味着V4 Pro真正的使用效果,可能还取决于模型本身之外的工具链。

04 Token很便宜,但Agent真正比的是"完成一个任务多少钱"

目前DeepSeek V4 Pro 0813仍按0.435美元输入、0.87美元输出的价格提供服务,但这个价格本身有两个变量。

一个变量是,DeepSeek的定价页面已经出现涨价提示。该公司计划在不久的将来大幅提高整体API价格,具体方案将通过正式通知公布。

所以,现在看到的低价未必是长期价格。

另一个更重要的变量是,对Agent来说,真实成本从来不只是Token单价。

如果一个模型单次调用只要很少的钱,却需要开发者不断检查、反复重试,甚至在关键节点重新接管,那表面上便宜的模型,最终并不一定意味着整体使用成本更低。

反过来,如果模型能稳定完成复杂任务,那即便价格有所上涨,开发者也可能愿意为这种效率买单。

对Agent应用来说,更值得比较的指标,是"完成一个任务的总成本":模型单价、Token消耗、调用轮数、失败率、重试次数、Harness效率以及人工接管成本,都会计入其中。

这也让DeepSeek V4 Pro 0813的商业意义变得更直接。在当前价格下,它给开发者提供了一个成本很低的前沿级智能体编程选择。但如果未来价格明显上涨,或者真实任务中的失败和重试次数较多,开发者就要重新算这笔账。

所以,V4 Pro接下来真正要证明的,已经不只是"模型有多强",而是它能不能成为一个值得长期放进真实工作流里的工具。

这也是为什么现在去判断V4 Pro是否"全面领先"还太早。

Benchmark能告诉我们模型在哪些能力上取得了进步,开发者测试能告诉我们模型放进真实环境后会发生什么。

两者结合,才能看见一个更完整的V4 Pro。

而从目前这些测试来看,它的优势和问题其实已经逐渐浮现:能力正在逼近前沿,价格依然非常低;但长流程执行、稳定性以及模型之外的Agent系统,还需要继续打磨。

相关推荐
热点推荐
乌克兰发现情况不妙:俄军已恢复苏联时代产能,重磅炸弹随便用

乌克兰发现情况不妙:俄军已恢复苏联时代产能,重磅炸弹随便用

浯江孤舟
2026-08-13 09:49:22
中国公开赛离谱一幕:英格兰名将连续2杆打进红球!对手都没发现

中国公开赛离谱一幕:英格兰名将连续2杆打进红球!对手都没发现

小火箭爱体育
2026-08-12 15:20:29
《剑星2》女主手办来了 紧身衣圆润翘臀 细节逼真

《剑星2》女主手办来了 紧身衣圆润翘臀 细节逼真

游民星空
2026-08-13 11:07:34
她不顾反对嫁大12岁恩师,如今丈夫已是北影院长,她成了人生赢家

她不顾反对嫁大12岁恩师,如今丈夫已是北影院长,她成了人生赢家

LULU生活家
2026-06-29 20:45:21
69年谭震林被疏散到广西,当地一把手是他老部下,直接下了道命令

69年谭震林被疏散到广西,当地一把手是他老部下,直接下了道命令

兴趣知识
2026-07-28 13:56:38
阿萨德被判死刑,普京对他很够意思,谈判18个月愣是没把他交出去

阿萨德被判死刑,普京对他很够意思,谈判18个月愣是没把他交出去

古史青云啊
2026-08-13 10:18:44
划红线!联合国明确:敢武力介入台海就是侵略。

划红线!联合国明确:敢武力介入台海就是侵略。

阿芒娱乐说
2026-08-13 06:52:44
松岛辉空:我实力世界前5!搭档张本智和 很有希望击败中国夺冠

松岛辉空:我实力世界前5!搭档张本智和 很有希望击败中国夺冠

念洲
2026-08-12 14:23:01
沙特带头,中东六国奔赴北京,中国以和平姿态突破美军防线

沙特带头,中东六国奔赴北京,中国以和平姿态突破美军防线

旧铁皮往南开
2026-08-10 21:34:01
美财长天塌了,中国7800亿美债换成人民币结算,美这哑巴亏吃定了

美财长天塌了,中国7800亿美债换成人民币结算,美这哑巴亏吃定了

说故事的阿袭
2026-08-13 01:01:02
菲媒:网红雅典娜Liya已被撕票,设局者仍在境外逃亡

菲媒:网红雅典娜Liya已被撕票,设局者仍在境外逃亡

界面新闻
2026-08-11 09:21:55
8月13日大满贯,男单32强全部落位,4大种子翻车,国乒4人日本5人

8月13日大满贯,男单32强全部落位,4大种子翻车,国乒4人日本5人

南海浪花
2026-08-13 05:52:06
99年朱总理访美,被问中国给克林顿30万献金,总理:怎么才30万?

99年朱总理访美,被问中国给克林顿30万献金,总理:怎么才30万?

WarOH协虎
2024-12-01 22:10:02
古代大门上,那些密密麻麻的圆形疙瘩是做什么用的?

古代大门上,那些密密麻麻的圆形疙瘩是做什么用的?

长风文史
2026-08-12 21:20:50
饶颖:赵忠祥与我发生关系多年,他有特殊癖好,令我身心受到伤害

饶颖:赵忠祥与我发生关系多年,他有特殊癖好,令我身心受到伤害

阿废冷眼观察所
2026-08-04 06:11:41
84岁高明近况:儿子高亮去世一年,儿媳已成他和妻子的晚年依靠

84岁高明近况:儿子高亮去世一年,儿媳已成他和妻子的晚年依靠

妙知
2026-08-13 10:45:27
致命分手

致命分手

新京报
2026-08-13 08:47:26
国民党是一个很可怜的党,也是一个很无奈的党。

国民党是一个很可怜的党,也是一个很无奈的党。

星落山间
2026-08-13 08:42:35
颠覆认知!最长寿的运动不是走路跑步,99%的人都练错了!

颠覆认知!最长寿的运动不是走路跑步,99%的人都练错了!

坠入二次元的海洋
2026-08-12 01:08:38
皇马为何能1-0赢拉科?赛后穆里尼奥直接说出了原因,说得很实在

皇马为何能1-0赢拉科?赛后穆里尼奥直接说出了原因,说得很实在

舟望停云
2026-08-13 09:40:02
2026-08-13 11:43:00

科技要闻

DeepSeek V4 Pro更新:性价比炸裂 仍需打磨

头条要闻

男子称冲着1.5万国补买新车 提车后才知没有申领资格

头条要闻

男子称冲着1.5万国补买新车 提车后才知没有申领资格

体育要闻

负债十几亿的联赛,还在疯狂买球星

娱乐要闻

郭德纲魔改红歌被立案!

财经要闻

韩国可能迎来失去的三十年

汽车要闻

试了奇瑞捷豹路虎神行者8,才知道它的i-ATS有多强?

态度原创

艺术
亲子
教育
房产
时尚

艺术要闻

红色系 | 中国当代油画优秀作品 24幅

亲子要闻

他们给本国孩子输“毒血”、喂活菌、鼻灌高乳糖,活体解剖中国孩子……“科研”面具下,儿童只是材料

教育要闻

九牛问津靠谱吗?数据展现硬核实力

房产要闻

华润海棠湾·澐麗 | 高光封顶,南法新境启幕新篇

婚纱照销毁潮,体面得有点好笑

无障碍浏览 进入关怀版
×