网易首页 > 网易号 > 正文 申请入驻

实测:DeepSeek追上Kimi了吗?

0
分享至



DeepSeek赢在速度,Kimi胜在完成度。

AIX财经(AIXcaijing)原创

作者 | 雷晶

编辑 | 金玙璠

盼望着,盼望着,DeepSeek-V4-Pro正式版终于来了。

这次发布,过程还有点曲折。8月12日晚,DeepSeek官方API定价页悄然发生变化,DeepSeek-V4-Pro对应版本已经更新为DeepSeek-V4-Pro-0813,新模型先在API端静默上线了。

8月13日下午,DeepSeek官网的发布通知以及开放平台公告被撤回,不过模型仍然显示在模型与价格页面中。到了13日晚间,DeepSeek重新发布公告,确认正式版已同步登陆APP、网页端和API。

正式版继续往长任务和Agent方向走。它延续了1M上下文、384K最大输出等规格,同时支持非思考和思考模式,思考模式默认开启。1M上下文可以一次塞进更大的代码库和文档,384K最大输出则给连续编程、复杂Agent任务留下了更大的执行空间。

除此之外,正式版还新增了low、high、max三档思考强度,并原生支持ResponsesAPI。对应到官方公布的基准成绩上,它的重点能力也比较明确,主要集中在Coding、Agent、工具调用和复杂任务执行。

DeepSeek这次也涨价了。从8月17日开始,DeepSeekAPI将采用峰谷定价:每天9:00-12:00、14:00-18:00为高峰时段,其余为空闲时段,空闲价格为高峰的一半。以DeepSeek-V4-Pro为例,空闲时段缓存未命中输入、输出价格将从目前的3元、6元涨至4.5元和13.5元,高峰时段则达到9元和27元。

配置摆在这里,价格也涨了,那实际能力到底如何呢?

要判断DeepSeek-V4-Pro处在什么水平,Kimi K3是一个很合适的参照物。Kimi K3是上个月发布的旗舰模型,在Coding和Agent相关榜单上表现突出,且两款模型瞄准的能力区间高度重合。我们具体来看一下基准成绩的对比。

DeepSeek-V4-Pro正式版 VS Kimi K3跑分对比图



从上图可以看出,两款模型没有出现谁把谁完全甩开的情况,而是各自守住了几块优势。Kimi K3更占优的项目,大多集中在长程软件工程和连续任务执行。DeepSeek-V4-Pro正式版则在自动化、安全以及部分高难任务上更占优势。

跑分只能说明一部分问题。真正放进具体任务里,两款模型谁更会干活?我们选了四类任务,用同一套提示词分别交给两款模型,看看谁的表现更好。

不过,需要说明的是,我们是在DeepSeek-V4-Pro正式版尚未上线App和网页端时开始测试的,使用方法是将它接入Codex使用;Kimi K3则直接在Kimi Work中调用。这意味着在编程、网页生成和文件操作等任务里,最终表现除了模型本身,也可能受到工具链和运行环境影响。另外,本次测试均为单次生成结果,模型输出存在一定随机性,结果仅供参考。

接下来,我们一起看看它们的实际表现。

01.内容创作:DeepSeek更会讲故事,Kimi更会做报告

我们先从最容易暴露模型“表达习惯”的内容创作开始。

我们设计了两道题:一道考故事续写,看模型能不能理解人物、延续叙事;另一道考行业报告,看它能不能从大量信息里抓住重点、组织观点。

我们先让两款模型为近期爆火的AI漫剧《被裁掉的女孩》续写第二季,从第一季女主角方桃子结束巴黎时装周、回到上南城的第二天开始,写一个1000字左右的故事。要求延续第一季的现实风格,不走一路开挂的爽文路线,而是继续讨论行业规则、舆论压力和自我价值等更现实的问题。

写故事对大模型来说不算难,难的是不暴露“AI味”。从结果来看,两款模型都没有完全逃过这个问题。还需要说明的是,即便做了简单的介绍,它们对具体的人物依旧不了解,给出的故事人物和原剧设定有出入。

先来看DeepSeek-V4-Pro正式版的成品,有“AI味”但至少故事线是顺的。



DeepSeek-V4-Pro正式版生成的故事

Kimi K3的问题更明显,它没有完全分清“背景资料”和“故事正文”。我们在提示词中简单回顾第一季,只是为了帮助模型理解人物和前情。结果Kimi K3在故事里写了几句类似“第一季里陪她熬过来的助理小满”的句子,正常的续集不会突然站在观众视角提醒这是第一季的人物和情节,很容易出戏,也让整篇故事的衔接不够流畅。



Kimi K3生成的故事

接着,我们把内容创作从文学拉回工作场景,让它们分别写一份2026年AI编程工具行业竞争格局分析报告。

DeepSeek-V4-Pro正式版给出的框架比较清楚。它按照行业演变、全球格局、中国市场等维度展开,也会结合公司案例和数据支撑判断。不过,整体内容偏少,对头部产品竞争关系、市场变化等问题点到了但没有进一步展开。

Kimi K3则明显更“能搜罗”。它不仅整理了市场规模、采用率、国内外市场份额、产品定价等信息,还通过大量表格把不同公司和产品放在一起比较,呈现上更直观。论证也比较有条理,结尾还附上了信息来源。

这一轮,它们各赢一题。DeepSeek-V4-Pro正式版更会把故事讲顺,Kimi K3则更会收集和整理信息。

02.编程:DeepSeek修改快,Kimi还原准

接下来,进入两款模型都很受关注的编程场景。

我们先从最常规的前端网页开始,让它们做一个“电影选片器”。网页需要内置至少24部经典电影,支持按类型和评分筛选,再通过“随机选一部”不断抽选。这道题本质上是前端综合题,主要考察模型能不能把数据、筛选逻辑、交互和视觉效果装进一个HTML文件。



Kimi K3生成的电影网页

两款模型交出来的结果相当接近。它们都选择了深色背景,把筛选条件放在页面上方,中央用电影卡片承载抽选结果,类型筛选、评分区间、“换一部”等核心功能也都正常实现。



DeepSeek-V4-Pro正式版生成的电影网页

DeepSeek-V4-Pro正式版的问题出在一个小细节。它在电影卡片中央加入了胶片图标,本意可能是为了增强氛围,但在部分加载情况下,图标会与文字发生重叠,影响观感。

这一题差距不大,于是我们把要求提高了一档,给它们两张艺术博物馆官网的截图,让它们据截图还原网页。这道题要求模型不仅要会写代码,还得先真正“看懂”页面。





艺术博物馆官网的截图

这一轮,差距明显拉开。DeepSeek-V4-Pro正式版的成品“不能说一模一样,只能说毫不相关”,它仅仅抓住了截图的色调,没有真正还原截图表达的内容。原图明明是艺术博物馆官网,它最终做出来的却是品牌官网。





DeepSeek-V4-Pro正式版还原的网页

Kimi K3的还原更准确。官网的整体结构、模块都保留下来,和原截图相当接近。比较明显的差别主要在图片素材,原截图的首页主视觉和部分页面使用了实景照片,Kimi K3没有原始素材,用几何图形进行了替代。





Kimi K3还原的网页

我们再把难度继续拉高,让它们做一款威尼斯运河快艇游戏。玩家要控制快艇,在倒计时结束前沿运河穿过桥洞,最终抵达码头。我们还要求加入晾衣绳、水面倒影等细节。

两款模型都交出了能玩的游戏,但侧重点不太一样。DeepSeek-V4-Pro正式版把要求的运河两侧建筑、桥洞和晾衣绳等大部分元素都还原了,整体完成度不错。不过,它漏掉了一个细节,水面没有呈现建筑的倒影。此外,晾衣绳上的衣服虽然存在,但悬挂状态比较生硬,多少有一点“贴”上去的感觉。

我们随后临时加了一道题,把原本相对规整的桥洞改成交错分布,增加游戏难度。DeepSeek大约5分钟完成修改,调整后的桥洞交错,且船不能直接穿墙而过,游戏逻辑基本成立。



DeepSeek-V4-Pro正式版生成的游戏

Kimi K3这一轮在视觉上更胜一筹。两侧建筑、晾晒的衣物处理得更自然,水面也能够看到房屋倒影,整个运河美感更强。尤其同样是“晾衣绳”,两边都做了,但Kimi K3会进一步处理衣物悬挂状态,更像真实场景。此外,它还加入了快艇行驶、穿过桥洞得分等音效,游戏的沉浸感也更强。

我们同样要求它把桥洞改成交错分布。修改后的游戏能正常运行,碰撞逻辑也没有明显问题,不过这一轮它花了大约10分钟,是DeepSeek-V4-Pro正式版的两倍。



Kimi K3生成的游戏

这一轮,两款模型在纯前端功能实现上的差距并不大,真正拉开差距的是复杂需求下的理解和执行方式。Kimi K3更擅长还原视觉要求,成品细节也更完整;DeepSeek-V4-Pro正式版虽然视觉表现稍逊,但二次修改速度更快,对明确指令的响应也更直接。

03.视觉审美:DeepSeek先卡壳,Kimi一次“出片”

接下来,我们再看看视觉审美。

我们让两款模型用Three.js还原水母湖,画面里要有大量金色水母随着光线迁徙,在碧绿海水中形成近似“金色星河”的效果;同时还要表现水面光束、丛林倒影、鱼群和不同远近层次的水母。这道题也在考验模型能不能理解一段偏文学化的视觉描述,再把“金色星河”“发光云团”这些抽象要求翻译成具体画面。

DeepSeek-V4-Pro正式版先卡了几次。它半小时后交出的首个成品,打开页面一片空白;第一次修改后又出现渲染错误;直到第二次调整,场景才正常显示,但页面上仍留有一行渲染错误提醒。



DeepSeek-V4-Pro正式版生成的水母湖

再具体看成品,它对视觉呈现的理解也偏了。我们想要的是金色水母密集分布,在水中形成像星河一样的发光云团。DeepSeek的成品却在海水里铺了大量金色光点,而真正的水母则被处理成灰色椭圆状物体。结果“星光”有了,“金色水母群”这个主角反而没有体现。

它的整体色调也偏暗,更像置身较深的水底,看不出水面和阳光穿透的层次感。不过,它倒是体现了水下植物丛,背景环境铺得比较全。

Kimi K3则花了大约40分钟,一次交出了可以正常运行的成品。它的理解更准确,画面里能看到密集的金色水母群,不同远近的水母形成明显层次,基本呈现出了要求的“金色星河”。



Kimi K3生成的水母湖

除了水母,画面中能看到鱼群、水面以及从上方洒下来的光束,整体风格也更偏写实,画面也更加精美。不过,我们要求水下能够看到植物,它的成品里基本没有呈现。

这一轮两者的差距依然比较明显。DeepSeek视觉表现稍弱,首轮运行的稳定性也还有提升空间;Kimi的理解和审美完成度更高。

04.物理仿真:Kimi跑通逻辑,DeepSeek卡在穿模

最后,我们把难度拉满,进入一个更容易露馅的场景:物理仿真。

我们让它们用Three.js制作一个“鞭炮箱子”的3D连锁爆炸演示。100个鞭炮落入箱中后,要完成点燃、爆炸、弹射和连锁引燃,同时处理碰撞、碎片和烟雾等效果。

这道题最重要的是物理逻辑和因果链能不能成立,鞭炮掉下来不能穿模、爆炸不能凭空发生,被冲击的鞭炮也要符合运动规律。

Kimi K3大约用了10分钟就交出了结果,整体完成度比较高。鞭炮从上方落入透明箱子后,会留在箱体内部,没有明显穿模。点击“开始燃放”后,一个已经点燃的鞭炮从外部落入箱中,再逐渐引燃周围的鞭炮,整个过程至少在视觉上有清楚的因果关系。燃放的反应也比较写实,能看到明显的烟雾和气团效果。



Kimi K3生成的“鞭炮箱子”

单个引爆模式也和正常燃放做了区分,可以直接选择箱内某个鞭炮点燃,再从这个位置向周围触发连锁反应。这样一来,正常燃放是外部点火,单个引爆是局部触发,两条逻辑都连贯,更像一套完整的仿真演示。

DeepSeek-V4-Pro正式版就要曲折得多,前后花了接近40分钟。首先出现了碰撞问题,鞭炮从上方落入箱子的过程中会直接穿过箱体,说明最基础的碰撞约束没有成立。到了点燃环节,箱内某个鞭炮突然冒出火星,开始连锁爆炸,缺少火源的过渡。它可能想展示爆炸后的气体形成的气团,但最终呈现像短暂白屏。而且整个爆炸过程明显卡顿,多次运行也没有明显改善。



DeepSeek-V4-Pro正式版生成的“鞭炮箱子”

单个引爆模式没有和正常燃放拉开明显差别,依旧是某个位置突然出现火星,随后进入同样的爆炸流程。按钮虽然有了,但对应的交互逻辑并没有真正做出区分。

这一轮,Kimi K3明显更稳,更能把物理规律落实到运行逻辑里;DeepSeek-V4-Pro正式版则在基础碰撞和因果链上掉了链子。

05.结语

几轮测下来,我们发现,DeepSeek-V4-Pro正式版在内容创作上叙事更顺;编程任务里,它的修改速度也更快。但在需要理解视觉信息的任务中,表现有待提升。截图还原、3D视觉和物理仿真任务中,Kimi K3对画面的理解更准确,成品完成度也更高。

所以,DeepSeek-V4-Pro正式版依然能打,只是没有做到全面领先。考虑到它依然保持了较低的价格,性价比仍然突出。在旗舰模型里,“够用且便宜”本身就是竞争力。

一直以来,DeepSeek最鲜明的标签,是用相对低的价格,提供足够强的模型能力。到了DeepSeek-V4-Pro正式版,这套逻辑发生了一些变化,API将采用峰谷定价,虽然给开发者留下了通过错峰调用控制成本的空间,但“绝对低价”已经不再像过去那么突出。

模型表现之外,DeepSeek背后的深度求索自己正在变“重”。

6月,深度求索启动大规模的公开招聘,提出希望各部门规模至少扩大一倍,岗位从算法研发扩展到产品、数据工程、运维等方向。与此同时,DeepSeek官网招聘页面开始频繁出现Agent Harness、Agent Infra以及通用Agent数据产品经理等岗位。

8月13日晚,DeepSeek Harness开发者预览版正式开放测试,并同步以MIT协议开源。这套系统解决的是模型“怎么干活”的问题,模型、工具、存储等能力都可以通过插件自由组合。相比直接做一个面向用户的Agent产品,DeepSeek选择先搭一套开放的Agent运行框架,把能力从模型层进一步延伸到Agent基础设施。

团队和产品都在扩张,背后也需要更多资金支撑。DeepSeek过去长期依靠幻方体系提供资金,并一度拒绝外部融资。今年策略明显改变,6月完成首次外部融资,规模超过500亿元,此后又继续推进新一轮融资。

所以,DeepSeek-V4-Pro正式版之后,还有两个更值得观察的问题。

第一,涨价之后,DeepSeek还能不能守住“高性价比”。模型规模扩大、Agent任务变长,都在增加算力消耗和成本压力。价格不再足够低之后,它需要靠更强的任务完成能力和更高的调用效率,证明自己依然“值”。

第二,DeepSeek能不能真正进入用户工作流。目前的Harness仍主要面向开发者。接下来更关键的是,DeepSeek会不会进一步推出面向普通用户或企业的Agent产品,把这些能力变成真正可用的工作流。只有走到这一步,DeepSeek才能获得更直接的真实任务反馈,也才能把模型能力进一步转化成产品优势。

*题图由AI生成。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
北京两男子心跳骤停,一个倒在医院门口,一个倒在120门口

北京两男子心跳骤停,一个倒在医院门口,一个倒在120门口

今日搞笑分享
2026-08-14 01:58:40
全网深挖张京私生活!夫妻同在外交界,从不秀恩爱才是顶级婚姻

全网深挖张京私生活!夫妻同在外交界,从不秀恩爱才是顶级婚姻

草莓解说体育
2026-08-14 05:07:09
中国男篮83-78乌拉圭!但真正让全网记住的,是对方主帅赛后这话

中国男篮83-78乌拉圭!但真正让全网记住的,是对方主帅赛后这话

生活新鲜市
2026-08-14 03:08:07
傅崐萁做出重磅决定,韩国瑜尴尬了,邱毅罕见向韩国瑜开火

傅崐萁做出重磅决定,韩国瑜尴尬了,邱毅罕见向韩国瑜开火

DS北风
2026-08-13 12:06:03
“车位泡沫”彻底破了?越来越多的地下停车位没人买了,原因有四

“车位泡沫”彻底破了?越来越多的地下停车位没人买了,原因有四

平说财经
2026-07-23 16:46:39
我表妹25岁就因艾滋病走了,奉劝大家:一定不要乱搞男女关系

我表妹25岁就因艾滋病走了,奉劝大家:一定不要乱搞男女关系

千秋文化
2026-08-04 20:35:28
低调到离谱!中国四大神秘组织,正在悄悄改写世界规则

低调到离谱!中国四大神秘组织,正在悄悄改写世界规则

大鱼简科
2026-07-18 21:57:32
心理学:一个家庭长期没饭局,不串门、不社交,就已经说明了两个现实,很准

心理学:一个家庭长期没饭局,不串门、不社交,就已经说明了两个现实,很准

心理观察局
2026-07-02 06:05:10
终于急了,朝导弹击中钢铁厂,乌方喊话:北约再不动,防线必崩

终于急了,朝导弹击中钢铁厂,乌方喊话:北约再不动,防线必崩

随梦而飞起
2026-08-13 18:43:36
不敢置信,火车站成了长沙衰退最严重的区域、被抛弃了的市区

不敢置信,火车站成了长沙衰退最严重的区域、被抛弃了的市区

吃货的分享
2026-08-14 00:45:26
深圳破获特大案!28人全部落网!细节披露:家族化、同乡化职业团伙,手段十分狡猾

深圳破获特大案!28人全部落网!细节披露:家族化、同乡化职业团伙,手段十分狡猾

南方都市报
2026-08-13 21:00:51
丢人丢到国外去了!高速服务区形式主义的“面子工程”该醒醒了

丢人丢到国外去了!高速服务区形式主义的“面子工程”该醒醒了

椰青美食分享
2026-08-14 00:25:42
胖东来走后周边商户生意一定变差,有博主为房东说话认为涨租没错

胖东来走后周边商户生意一定变差,有博主为房东说话认为涨租没错

映射生活的身影
2026-08-13 16:02:08
抗癌26年,李雪健的双耳,已经完全听不见了……

抗癌26年,李雪健的双耳,已经完全听不见了……

都市快报橙柿互动
2026-08-12 23:53:24
1分钟破1000万元,ALO在华正式开售,定价整体高于lululemon,有人吐槽“娇贵次抛衣”

1分钟破1000万元,ALO在华正式开售,定价整体高于lululemon,有人吐槽“娇贵次抛衣”

封面新闻
2026-08-13 18:59:03
苦等5年!上海这里,要拆了?

苦等5年!上海这里,要拆了?

新浪财经
2026-08-13 18:24:03
“他快饿死了,你还嫌他花的多!”男大学生一天花50被妈妈骂,网友一边倒!

“他快饿死了,你还嫌他花的多!”男大学生一天花50被妈妈骂,网友一边倒!

林林先生
2026-08-02 08:35:06
过于离谱!“七院院士”黄维被曝已发表4320篇论文,平均每天一篇左右,涉及多个领域,网友:学术界需要严查!

过于离谱!“七院院士”黄维被曝已发表4320篇论文,平均每天一篇左右,涉及多个领域,网友:学术界需要严查!

谭谈社会
2026-08-12 15:16:09
奔驰新车官宣:8月21日 ,正式上市

奔驰新车官宣:8月21日 ,正式上市

科技堡垒
2026-08-13 09:14:11
塞尔:若费兰转会费达到5500万欧,巴萨需向曼城支付1000万欧

塞尔:若费兰转会费达到5500万欧,巴萨需向曼城支付1000万欧

懂球帝
2026-08-14 03:45:12
2026-08-14 05:40:49
AIX财经 incentive-icons
AIX财经
AI新时代,财经新观察。
100文章数 23225关注度
往期回顾 全部

科技要闻

一切皆插件!DeepSeek Harness正式发布

头条要闻

冉莹颖被指称“输了换老公有保险”邹市明深夜回应

头条要闻

冉莹颖被指称“输了换老公有保险”邹市明深夜回应

体育要闻

负债十几亿的联赛,还在疯狂买球星

娱乐要闻

篡改红歌已立案,郭德纲大祸临头

财经要闻

可治疗癌症?神话破灭的片仔癀 陷入争议

汽车要闻

全新红旗H7到底新在哪儿?

态度原创

艺术
旅游
家居
健康
公开课

艺术要闻

顶级的大片

旅游要闻

春城昆明名字根源,不是滇池不是美景,源自两千年前滇西古老部族!

家居要闻

2026建博会(广州) 公装联探展交流活动

孩子高低肩,是不是脊柱侧弯了?!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版