DeepSeek V4-Flash正式版上线,Agent能力一夜之间变强了
![]()
你有没有发现,最近国产大模型更新速度快得有点离谱。前脚刚看完预览版,后脚正式版就来了。7月31日下午,DeepSeek通过API文档发布了一则更新日志,宣布DeepSeek-V4-Flash正式版API上线公测。这不是一次普通的版本号跳动,而是把Agent(智能体)能力实打实地拉高了一大截。
先说最直观的变化。官方给出的基准测试数据里,V4-Flash正式版在好几个Agent专项评测上远超之前的V4-Pro-Preview版本。比如Terminal Bench 2.1拿到了82.7分,Cybergym是76.7,DeepSWE是54.4,Toolathlon verified到了70.3,DSBench-FullStack也冲到了68.7。这些名字听起来很技术,翻译过来就是一句话:这个模型更会自己操作电脑、自己调工具、自己跑代码任务了。
为什么这件事重要?因为过去一年大家都在聊"大模型能不能干活",而不只是"能不能聊天"。所谓Agent能力,就是让模型像个小助理一样,接到一个模糊的任务,自己拆解步骤、调用软件、查资料、改bug,最后把结果交给你。V4-Flash这次明显是在往这个方向猛踩油门。
![]()
有意思的是,DeepSeek这次把正式版和预览版做了区分。官方说明,V4-Flash-0731这个正式版的模型结构、尺寸和之前的preview保持一致,区别是重新做了后训练。也就是说,底层没大改,但在"怎么更好地听话、怎么更稳地完成任务"这件具体的事上下了功夫。另外正式版原生支持Responses API格式,还针对性适配了Codex。对开发者来说,这意味着接入成本更低,写代码助手的体验会更顺。
那V4-Pro呢?官方在日志里留了句话:正式版V4-Flash上线公测,而V4-Pro正式版将"尽快"发布。等于说,更强的那个还在路上,今天先把这个更能打的Flash放出来给大家用。
从行业角度看,DeepSeek这波操作其实踩在了一个关键节点上。今年上半年开始,国内外模型厂商的竞争焦点已经从"谁参数多"悄悄转向了"谁的Agent真能替人办事"。OpenAI、谷歌、Anthropic都在推自己的智能体能力,国产这边DeepSeek、通义、智谱也都在卷。V4-Flash正式版把基准分数摆出来,本质上是在用公开评测说话:我能干的事,有分数佐证。
对普通用户来说,感知可能还没那么直接,毕竟API是开发者先用。但往下传导会很快:你用的那些AI写代码工具、AI自动填表工具、AI客服,底层模型一旦换上这种Agent能力更强的版本,最明显的变化就是"少废话、多办事"。以前要你手把手教三步才能完成的任务,以后可能一段话就搞定了。
当然也要泼点冷水。基准测试分数高,不代表真实场景里就一定完美。Agent跑长任务容易中途走偏、调用工具出错,这些问题在整个行业都还没彻底解决。DeepSeek自己也在日志里说,这次主要是后训练优化,结构没变,所以上限还得看后续V4-Pro正式版的表现。
总的来说,V4-Flash正式版上线是个信号:国产大模型在Agent这条赛道上,已经开始从"演示给用户看"走向"真的能交付"。接下来几个月,V4-Pro正式版、各家的新视频模型、新编程模型会陆续撞在一起,今年的AI圈,热闹才刚开场。
来源:DeepSeek API文档发布日志(2026年7月31日)、新浪财经、极客公园《极客早知道》(2026年8月1日)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.