7月31日下午,DeepSeek干了一件事。
没有发布会,没有直播,没有铺天盖地的宣传。
就在API文档里发了一篇更新日志。
DeepSeek-V4-Flash正式版API上线公测。
但就是这么一个“低调”的操作,让整个AI圈炸了锅。
因为这一次,AI不再只是“会聊天”了。
它开始像工程师一样干活了。
![]()
1.
先看硬指标。
DeepSeek这次直接甩出了9项基准测试成绩单。不是遮遮掩掩挑几个好看的,是9项全公开。
Terminal Bench 2.1——82.7分。
Cybergym(网络安全攻防模拟)——76.7分。
Toolathlon verified(工具调用综合测试)——70.3分。
NL2Repo(代码仓库生成)——54.2分。
最夸张的是DeepSWE——从预览版的7.3分直接飙到54.4分。
暴涨6倍多。
啥概念?之前Flash在这个编程测试里基本是“不及格”,现在直接冲到中上水平。
内部测试也不含糊:DSBench-FullStack(全栈开发)68.7分,DSBench-Hard(高难度编码)59.6分。
这些数字单独看可能没感觉。但你得知道——V4-Flash的总参数是2840亿,但激活参数只有130亿。
130亿什么水平?GLM-5.2是7400多亿参数,K3是2.8万亿。
130亿对7400亿,差了将近60倍。
用不到别人1/60的激活参数,打出了接近甚至超越的效果。
这就是DeepSeek最可怕的地方——不是在堆参数,是在优化效率。
2.
更让人细思极恐的,是这句话:
“DeepSeek-V4-Flash-0731的模型结构、尺寸和预览版保持一致,仅重新进行了后训练。”
底座没换,骨架没变,就是重新“教”了一遍。
结果Agent能力直接起飞。
这说明啥?说明在Agent这条赛道上,训练方法和数据质量的权重,正在超过模型规模。
以前大家拼的是“谁家房子大”——参数越多越牛。
现在DeepSeek告诉你:房子不用最大,装修得好照样住得舒服。
同样的骨架,不同的“教育”,效果天差地别。
这对整个行业的启示太大了——后训练,才是真正的护城河。
3.
这次更新还有一个隐藏大招——DeepSeek Harness首次亮相。
Harness团队今年3月才组建,负责人崔添翼是个90后,浙大计算机出身,6枚ACM亚洲区域赛金牌,曾在顶级量化机构Jane Street干了九年。
今年3月加入DeepSeek,5月开始招兵买马。
不到5个月,Harness就出来了。
这速度,只能说明一件事:DeepSeek在Agent这条路上,早就开始布局了。
梁文锋之前说过一段话:“AI现在不缺品位和直觉,它缺的是持续学习的能力。投资人看Agent,我们看怎么解决学习。”
Harness就是解决“学习”的那个工程落点。
4.
再说个对开发者特别重要的消息。
正式版V4-Flash原生支持Responses API格式,并针对性适配了Codex。
Responses API是OpenAI力推的新一代API格式,比传统的Chat Completions更适合Agent场景——工具调用更灵活、多轮交互更复杂、输出控制更精细。
Codex适配则瞄准了代码生成与软件开发。
翻译成大白话:你用OpenAI那套工具链开发的Agent应用,现在可以低成本迁移到DeepSeek上。
开发者不用重新学一套东西,改个模型名就能用。
这招太狠了——直接掏了OpenAI开发者生态的墙脚。
5.
价格呢?
V4-Flash百万tokens输入(缓存命中)平时只要0.02元,高峰时段0.04元。
百万tokens输出平时2元,高峰时段4元。
什么概念?OpenAI那边GPT-5.6 Luna刚降价80%,输入价从1美元砍到0.2美元。
0.2美元,约合人民币1.4元。
DeepSeek这边是0.02元。
差了70倍。
有网友让GPT整理了V4 Flash和其他模型的性价比对比——Flash依然无敌,比降价后的GPT-5.6 Luna还要便宜一半以上。
一边是性能追平甚至超越,一边是价格便宜几十倍。
这还怎么打?
6.
而且你得把这事放在更大的背景里看。
截至7月26日,中国AI模型全球市场份额已经达到63.5%,美国模型只剩35.5%。
DeepSeek凭借V4 Flash和V4 Pro两款模型,合计占了Top 10总量的16.4%,是平台内覆盖最广的模型提供商。
全球每10个用大模型的开发者里,就有超过6个在用中国模型。
这放在三年前,谁敢想?
更狠的是——美国企业也在转向中国AI模型。2026年4月,美国企业通过OpenRouter的Token使用量中,中国模型占了46%。
DeepSeek以17.6%的市占率领先,超过了Google和OpenAI。
美国人自己都在用DeepSeek。
7.
最后说几句掏心窝的话。
2023年大模型拼的是“通用能力”——谁能聊天、谁能写诗。
2024年拼的是“长上下文”——谁能一次处理更多信息。
2026年的关键词,毫无疑问是Agent。
Agent是啥?是模型自主规划、调用工具、执行复杂任务的能力。
以前你让AI“帮我修个Bug”,它给你一段代码建议——你还得自己动手。
现在你让AI“帮我修个Bug”,它自己打开终端、分析代码仓库、调用工具、跑测试、修完提交。
从“建议者”变成了“执行者”。
这才是这次更新的真正意义。
AI不再只是“会说话”了。
它开始“会干活”了。
你觉得程序员会被AI取代吗? 你用过大模型写代码吗?体验咋样?
评论区聊聊。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.