大家好,我是程序员鱼皮。
刚刚,DeepSeek 悄悄发布了 DeepSeek V4 Pro 模型的正式版,已经可以通过 API 接口调用了。
![]()
DeepSeek 官方群发布消息
新版本支持 1M 上下文、384K 最大输出,进一步增强了 Agent 能力,并且支持 Responses API,能够轻松接入到 Codex 中。
来看一看 DeepSeek 官方放出的跑分表:
![]()
DeepSeek V4 Pro 正式版跑分对比
最亮眼的是 Terminal Bench 2.1 这一项,它考察的是模型能不能在终端里独立把一整套编程任务干完。
DeepSeek V4 Pro 正式版拿了 87.9,而国外顶级模型 Claude Fable 5 是 88.0。
就差 0.1 !
![]()
相比之前放出的 DeepSeek V4 Preview 版,其他几项测试指标的涨幅也很夸张,DeepSWE 从 12.8 涨到 62.7,Cybergym 从 52.7 涨到 83.3,NL2Repo 从 38.5 涨到 61.5。这几个基准考的其实是同一件事,模型能不能带着工具进到真实环境里,把一个多步骤的活儿从头做到尾。
也有落后的地方,比如 HLE 这种纯知识考试,DeepSeek V4 Pro 拿了 42.7,Claude Opus 4.8 是 49.8,Claude Fable 5 是 53.3,差距还是挺明显的。不过 HLE 考的是百科知识和通识推理,跟日常写代码的关系不大,真正决定 AI 编程体验的还是上面那几项 Agent 和 Coding 的基准。
跑分归跑分,模型好不好用,还得拿真实项目来检验。
这次我准备了 7 个不同类型的项目,从简单的前端动画、再到复杂的全栈产品,全方面测评 DeepSeek V4 Pro 的编程能力。
![]()
7 个测评项目汇总图(由浅入深)
值得一提的是,为了这次测试,我特地往 DeepSeek 账户里充了 300 块。
![]()
大家可以猜猜看,这 300 块够不够花?
答案在结尾揭晓~
先给 DeepSeek V4 Pro 搭一套 Harness
这次测试我统一使用 Codex 这个主流的 AI 编程工具来跑所有任务。
把 DeepSeek V4 Pro 接进 Codex CLI 没什么难度,官方这次专门适配了 Responses API 和 Codex,改改配置文件就能跑。具体步骤我之前写过一篇 ,照着做就行。
![]()
真正麻烦的是另外两件事。
DeepSeek V4 Pro 是纯文本模型,看不了图。这意味着它没办法像 Kimi K3 或 Claude Opus 5 那样写完页面自己截图看一眼效果对不对,也没办法跟之前有视觉理解能力的模型放在完全公平的条件下横向对比。
另外,官方那些跑分数字本身就不是只靠裸模型跑出来的。公开基准里的 Code Agent 任务,用的是 DeepSeek Harness 极简模式,而且开的是 max 档位。
Harness 指的是把模型能力落到真实环境里的那层工程,负责调用工具、读写文件、管理上下文、处理报错,让模型能把一件事从头干到尾。
问题是,官方那套 Harness 到现在都还没放出来。
那我就自己给它搭一套呗~
这套 Harness 并不复杂,主要做 4 件事:
统一执行环境:所有任务走同一个启动脚本,推理档位保持一致,每个任务独立目录和端口,不会互相影响
Playwright 验证器:模型看不了图,就让脚本替它抓 console 报 错、网络请求和 DOM 断言,再存截图便于人工验证
Token 计费对账:把任务执行过程中的事件流保存为 JSON 文件,按官 方定价算钱,测试前后各查一次余额做交叉验证
90 分钟看门狗机制:超时就强行关掉任务,失败也不会重跑,保证数据 干净
准备工作做完,我在 Cursor 里把 8 次执行一次性并行丢了出去,全程不需要人工干预,跑完我再一个一个验收。
![]()
Cursor 并行调度 8 个子任务 项目实战测评
这次我准备了 7 个项目 来测 DeepSeek V4 Pro 的编程能力,从简单的前端动画,到复杂的全栈产品,由浅入深。
交互式动画讲解网站
3D 版动画知识讲解
竹知了仿真网页游戏
网页 PPT 生成工具(内置 AI 大模型)
在线抽奖系统
以撒的结合肉鸽游戏
全栈 AI 编程工具(复刻 Cursor)
下面挨个儿来看。
1、交互式动画讲解网站
第一个项目,让模型做一个用交互式动画讲解知识的网站,讲的知识点是「注意力残差」。
提示词里我要求它先用 Firecrawl 联网搜索技术细节,确保讲解内容准确,做完之后自己验证效果,不满意就自主调整,改到满意再交付。
![]()
先来看看首屏效果。
已经能看出问题了,不仅动画做得很简单,而且动画块中的文字已经溢出边框了……
![]()
再往下看 AI 对核心机制的讲解,中间那个示意图的线条连接明显不对,节点之间错位了。
![]()
再往下看交互演示的部分,文字溢出和连线错位的问题更加明显,而且动画过于敷衍,没什么交互性可言。
![]()
对比一下之前同样的提示词、其他模型做出来的效果。
Kimi K3 的版本用「100 个厨师接力加调料」的类比把问题讲清楚了,动画流畅、审美在线:
![]()
Kimi K3 开发的交互动画
Claude Opus 5 做得更全面,背景有漂浮的光点,还自己加了几道随堂测验题,检查用户学习知识的效果,更像是一个系统化的知识讲解网站。
![]()
Claude Opus 5 开发的交互动画
回看 DeepSeek V4 Pro 这个版本,文字溢出、连线错位、动画敷衍,前端效果明显拉胯了。
我的评价是「拉」。
2、3D 版动画知识讲解
还是同一个知识点,这次换成 3D 场景来呈现。
提示词里除了联网搜索,我还要求它用 Context7 查一下所用 3D 库的最新文档,别拿过时的 API 来写。
![]()
看下效果,整体网站的配色是科技风,背景有飞舞的粒子效果。布局很清晰,通过左下角的面板学习知识、控制动画步骤。
![]()
3D 动画能够正常旋转缩放,没有明显的错位问题,也没有任何的卡顿。工程上的分块注意力残差也用金色连线做了可视化。
![]()
不过跟之前的模型比,差距还是有的。
Kimi K3 的版本干净利落,重点全在 3D 动画演示上,3D 的效果更生动:
![]()
Kimi K3 的 3D 版本
再看看 Claude Opus 5 的版本,我刚打开网页就被惊艳到了,科技感爆棚,还能并排对比多种残差模式:
![]()
Claude Opus 5 的 3D 版本
相比之下,DeepSeek V4 Pro 的 3D 动画简单了不少,没有让我眼前一亮的感觉。我的评价是「NPC」。
3、竹知了仿真网页游戏
竹知了是中国传统的竹制玩具,一根竹签上串着一片薄竹片,用手搓动竹签让竹片高速旋转,竹片切割空气产生振动,发出类似夏天蝉鸣的「哇呜哇呜」声。
![]()
这道题同时考察了前端效果、物理引擎和实时声音合成,而且效果好不好只能靠耳朵听、凭自己的手感来玩,代码写得再漂亮也没用。
先看 DeepSeek V4 Pro 做的效果。界面中规中矩,象征性地画了几颗小竹子,但没什么氛围感。
![]()
游戏的操作方式很简单,用鼠标拖拽让竹知了旋转起来。页面上还支持开启体感模式,摇一摇手机或转动手腕就能驱动竹片旋转。
![]()
不过发出的声音竟然是《嗡嗡嗡》的,跟我想要的那种《哇哇哇》的蝉鸣声完全不搭,配不上 1000 万以内最好的玩具!
这道题我还额外用 DeepSeek V4 Flash 拿同样的提示词跑了一遍,结果还挺意外的。竹知了的结构变了,声音也更接近我想要的那种哇哇声。
![]()
怎么回事,感觉这版的前端效果居然比 Pro 版更好了???
不过综合来看,这两个版本都比较一般,没什么惊喜,我的评价是「NPC」。
4、网页 PPT 生成工具(内置 AI)
前面三个都是开胃小菜,接下来该测测它的全栈工程能力了。
用户在网页上粘贴一段长文案,后端调用大模型把文案拆解成多页 PPT 结构,前端渲染成可以全屏演示、键盘翻页的网页 PPT,还要支持切换配色主题和导出 HTML 文件,后端用流式输出,前端实时显示生成进度。
![]()
这道题相当于对 DeepSeek V4 Pro 的双重验证。项目代码是它写的,项目里内置的那个大模型接口填的也是它自己,一举两得,同时测试了它的编码能力和内容生成能力。
来看看效果,整体界面布局和风格还算中规中矩,左侧输入生成 PPT 的长文案,右侧预览 PPT 成品效果。
![]()
输入一段长文案,点击生成,左下角可以看到生成进度和 AI 大模型的实时输出。
![]()
但这个「实时输出」其实不是实时的…… 等了很长一段时间之后,好像是 AI 全部生成完了,才开始流式输出的。这算是一个明显的 Bug。
![]()
再看看最终生成的 PPT 效果吧,额,很难评……
![]()
文字内容基本都堆在左边,右侧那么多空白留着干嘛?
可以切换 PPT 的主题配色,也能导出为独立的 HTML 文件,这些功能是正常可用的。
![]()
对比一下之前的模型。
Kimi K3 做出来的版本比较简陋:
![]()
Kimi K3 的 PPT 工具
Claude Opus 5 做出来的更像一个成熟的工具产品,配色主题起了极光、象牙这种很形象的名字,还自己加了「填写额外生成要求」的功能:
![]()
Claude Opus 5 的 PPT 工具
相比之下,DeepSeek V4 Pro 做的前端效果就比较一般了,离可交付有距离。
不过它起码也是跑通了前端 + 后端一整套完整的 AI 生成业务流程了,我的评价是「人上人(低配版)」。
5、在线抽奖系统
接下来让 AI 开发一个人人可用的在线抽奖系统,使用场景是公司年会、社群活动、直播间抽奖等等。
管理员可以创建一场抽奖活动,配置好每档奖品的名额,生成参与链接和二维码;参与者打开链接填昵称报名;到点管理员点击开奖,大屏上滚动出中奖名单。
![]()
前面几道题拼的是审美和创意,这道题拼的是工程严谨度。
名额绝对不能超发,一等奖 1 名就只能出 1 个人,哪怕同一瞬间有海量请求涌进来也一样。
同一个参与者在同一场活动里最多只能中一次奖。
开奖操作必须幂等,管理员手抖连点五下开奖按钮,结果也只能产生一轮。
来看下效果。
光看到这个界面,我已经没什么期待了,这也太丑了叭!我以为高低得整个转盘呢。
![]()
试试功能,能够在管理后台正常新建活动、配置奖品名额。
![]()
参与者可以通过扫描二维码报名参与抽奖,这个流程还挺方便的。
![]()
管理员开奖后,参与者可以实时看到中奖结果:
![]()
我让其他 AI 帮忙验证了后端逻辑,1000 人抢 100 个名额,中奖总人数正好 100,没有超发,也没有重复中奖。后端的幂等和并发控制是做到位了的。
作为一个小工具使用,是足够的了。唯一的硬伤就是太丑了,太一板一眼了,让我感觉像是 2024 年的模型搞出来的前端。但后端逻辑没毛病,综合来看给到「人上人(低配版)」。
6、以撒的结合肉鸽游戏
接下来是一个更有挑战性的游戏项目。
以撒的结合是我小孩儿时代很爱玩的一款肉鸽游戏,玩家在随机生成的房间里探索,用射击消灭敌人,清完一个房间开门进下一个,每层有若干房间和一个 Boss 房。
![]()
我让 AI 复刻核心玩法,包括随机地牢生成、射击战斗、道具系统、属性系统,至少 3 种普通敌人和 1 个 Boss,图形素材全部用代码绘制。
![]()
这道题的图形素材全部靠代码一笔一笔画出来,画成什么样模型自己心里其实是没数的,所以这道题最能看出不同模型之间的水平差距。
来看看 DeepSeek V4 Pro 的版本。游戏名叫「地下室:泪之回廊」,好家伙,游戏名称都一股 AI 味儿。
![]()
进入游戏,开屏暴击。来看看这个人物形象,带着个面罩,我是小偷啊我是?不过小人的眼泪标志还是致敬了原版。
![]()
你别说,游戏是真的能正常玩耍的,而且体验竟然还不错。怪物也有点儿以撒的结合原版的味道,数值系统和宝箱机制都还原了。
![]()
还能打 Boss,难度适中:
![]()
不过游戏只有 1 层,打完 Boss 就结束了,非常单调,离成品还差得远。
对比一下之前其他模型做出来的效果。Kimi K3 那次做出来的界面看着简陋,但玩法链路是完全跑通的,能发子弹、能杀怪、能吃道具:
![]()
Kimi K3 开发的以撒游戏
再看看 Claude Opus 5 做出的游戏。我一打开游戏主页 DNA 就动了,小怪很多都是原版里有的,Boss 机制也跟原版神似:
![]()
Claude Opus 5 开发的以撒游戏
可以发现,DeepSeek V4 Pro 的效果比 Kimi K3 好不少,怪物的行为逻辑和战斗手感都上了一个台阶。但跟 Claude Opus 5 的差距不是一点半点。
我的评价是「人上人」。
7、全栈 AI 编程工具
最后一个项目,直接把难度拉满。
我让它克隆 VS Code 的开源代码,在这个基础上开发一个复刻 Cursor 核心体验的 Web AI 编程工具,要支持 Editor Window 代码编辑器和 Agents Window 对话工作台两种模式,两个窗口之间能自由切换,Agent 还得能自主读文件、改代码、执行终端命令。
![]()
这是 7 道题里唯一的长程任务,考察模型能不能在一个几十万行的代码库面前稳定运行、不跑偏。
来看看成品,虽然跟真实的 Cursor 差距甚大,但整体布局还是合理的。在 Editor Window 编辑器模式中,能够顺利打开和编辑文件,还有代码提示和高亮。
![]()
切换到 Agents Window,创建一个新的 AI 对话,让它帮我开发一个推箱子游戏。
![]()
可以看到 AI 能够执行命令、调用工具来查看文件,然后自己编写代码。等了一会儿,AI 完成了开发。
![]()
开发完成后,直接让 AI 把网站跑起来。
![]()
来看下我用 AI 做的 AI 编程工具开发出的推箱子游戏,效果还不错,能够正常玩耍:
![]()
有个细节值得说一下。虽然提示词要求 AI 在 VS Code 源码基础上开发,AI 也确实克隆了 40 多万行 VS Code 代码,但实际上 AI 转头用 monaco-editor 这个 npm 包另起炉灶写了个独立的 React 应用。
从工程角度来说这个选择是合理的,毕竟直接改造 VS Code 源码是要消耗大量成本的,但 AI 也没跟我打声招呼。
跟之前的模型对比一下。
先看看 Kimi K3 做的 Cursor,双窗口的核心能力也是跑通了的:
![]()
Kimi K3 开发的 AI 编程工具
Claude Opus 5 做的版本几乎完整保留了 VS Code 的精髓,代码高亮、代码小地图、管理面板都在,妥妥的降维打击!
![]()
Claude Opus 5 开发的 AI 编程工具
DeepSeek V4 Pro 的版本 Editor 和 Agent 双窗口都能用,交互体验也没有明显的问题。
开发这种复杂的长程任务没有翻车,我可以给到「顶级」评价。
我的感受
7 个项目全部跑完了,聊聊我的真实感受。
先说 AI 编程能力,DeepSeek V4 Pro 的前端能力可以说是远远低于我的预期。交互动画的文字溢出、PPT 的排版失衡、抽奖系统的刻板界面审美,跟 Claude Opus 5 和 Kimi K3 做出来的效果差距很明显。
但是后端能力还不错。PPT 生成工具跑通了完整的 AI 生成流程,抽奖系统的并发控制和幂等逻辑做得很到位,全栈 AI 编程工具的 Agent 模式也能正常工作。
而且关键是 7 个项目全部能跑起来,没有出现依赖装不上、服务启动报错这种需要人工救场的情况。
整体来看,DeepSeek V4 Pro 在 AI 编程能力上,跟国外顶尖模型的差距还是很明显的。后端逻辑可以放心交给它,但如果你对前端效果有要求,还是得上 Claude 这个级别的模型。
DeepSeek V4 Pro 还有一个对 AI 编程影响极大的短板,就是没有视觉理解能力。它写完页面之后没办法自己截图看一眼效果对不对,前端布局有没有错位、配色好不好看,这些它全都判断不了。我这次专门搭了一套 Playwright Harness 来替它做验证,但 Harness 只能抓报错和 DOM 断言,涉及到「好不好看」的判断还是得靠人工。
比如开发《以撒的结合》游戏时,地板的配色代码逻辑是对的,颜色确实画了,但是选了一个跟纯黑几乎分不出来的暗色,人眼看上去就是一片漆黑。模型自己完全发现不了这个问题。
![]()
然后揭晓本次测试花费的总金额。
你敢相信么,这么多项目跑下来,竟然只花了 5 块钱左右???
该说不说,DeepSeek 的性价比是真的高。
![]()
DeepSeek 消费面板
这么便宜主要是因为 DeepSeek 的缓存命中率实在太高了,平均达到 99%,绝大部分输入 Token 的计费几乎可以忽略不计。
而之前我用 跑了 7 个项目,花了 900 多块。DeepSeek V4 Pro 只花了 5 块钱,差了 180 倍!
不过 DeepSeek 官方说近期会整体上调 API 的价格,而且涨幅较大,所以珍惜现在这个价格吧,先多蹬 AI 一会儿。
![]()
另外简单对比一下 DeepSeek V4 Pro 和 V4 Flash。开发竹知了游戏时,Flash 跑了 15 分钟、花了 7 毛,Pro 跑了 11 分钟、花了 4 毛,两个版本的完成度和效果差别不大。
说实话,我现在没有明显感受到 DeepSeek V4 Pro 和 V4 Flash 之间的差距,在我的使用体感而言,它们算是同一档的模型,都可以独立完成全栈开发的任务。
但无论是前端效果还是交付成果的质量,都跟国外顶级的大模型有差距。
不过由于时间有限,这块的测试还不够充足,感兴趣的同学也可以自己试试。
我的建议是,在学习 AI 编程阶段,或者对于一些日常小工具、内部系统、快速验证想法这类不太在意前端精细度的任务,用 DeepSeek 完全没问题,节省成本。如果你要做面向用户的产品,可以先用 DeepSeek 跑一遍 Demo,调通提示词、明确功能和业务流程,再切换到 Claude 这个级别的模型去系统开发,这样既省钱又高效。
![]()
最后哔哔
看到这里,你觉得 DeepSeek V4 Pro 的表现怎么样?这波是梁子还是梁神?
![]()
至少 DeepSeek V4 Pro 是不及我的预期的,毕竟等了这么久,结果正式版在 AI 编程上的体验并没有给我惊喜。
不过 DeepSeek 应该还有大招没有发。
按照官方那个公式,Model + Harness = Agent,模型这一半算是交付了,他们自研的 Harness 框架应该也快了。
等 Harness 正式发布,DeepSeek V4 Pro 的 Agent 能力可能还会再上一个台阶,到时候可以再测一波。
OK 就分享到这里,本文会收录到我免费开源的 ,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。
![]()
鱼皮的 AI 编程教程
我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~
欢迎在评论区聊聊:你会把主力模型换成 DeepSeek 吗?你现在跑 AI 编程一个月大概花多少钱?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.