DeepSeek V4-Pro正式版(版本号0813)悄然上线:DeepSWE从12.8涨到62.7,官方称软件工程智能体能力提升约4.9倍。8月12日晚,该模型出现在DeepSeek API文档中,没有发布会,也没有官宣推文。价格上,V4-Pro是走量高端档,明显高于V4-Flash:每1M token缓存命中输入0.025元、未命中输入3元、输出6元;而V4-Flash分别为0.02元、1元、2元。输出token与未命中输入均从2元/1元涨到6元/3元,正好三倍。官方在涨价预告中直言“计划近期整体上调DeepSeek API服务定价,预计涨幅较大”。 为了检验V4-Pro的涨价底气,我们花了一宿,用社区最新的一批复杂测试手法进行实测。结论先行:这次升级确实过硬,前端审美发生质变,Agent能力表现稳定;但也有一些暂时无解的bug,比如鹈鹕骑自行车翻车,甚至生成了两个挂在天上的弯月。 一个悄悄上线的新版本 V4-Pro并非新模型,而是“转正”。今年4月24日,DeepSeek发布V4系列,Pro版当时还是Preview状态。三个多月后,正式版以日期命名“0813”到来。参数上,它支持1M上下文长度,输出上限拉至384K Token,支持thinking和non-thinking双模式,默认开启思考模式;接口同时兼容OpenAI和Anthropic两套格式,可以直接更换base_url接入Claude Code等Agent框架。 官方叙事也换了关键词:不再强调“更会答题”,而是“更会把一件事干完”。有博主将官方数据翻译成人话:DeepSWE从12.8提到62.7,测的不是“会不会写一段代码”,而是“能不能像工程师一样持续干活”。 从九项Agent与代码基准看,全线大涨:Terminal Bench 2.1达到87.9,Cybergym达到83.3,NL2Repo涨至61.5,DeepSWE增长到62.7,分别比Preview版本提升15.8、30.6、23.0、49.9。不过,社区也存在质疑声,有开发者对比后认为0813仍略逊于Luna MX,也有人指出它约一半基准落后Kimi K3。官方尚未发布完整benchmark报告,所有声称都需要第三方验证。 考题换代:从鹈鹕到指环王 在动手前,有个背景必须说明:圈内测试手法正在换代。8月2日,入职Anthropic的Karpathy发长推称,该告别“鹈鹕骑自行车”
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.