网易首页 > 网易号 > 正文 申请入驻

三大国产模型编码对决:Kimi、GLM、DeepSeek谁最强?

0
分享至

JeecgBoot AI 专题研究 | Kimi K3、GLM-5.2、DeepSeek V4 Pro 编程实战体验与客观数据交叉验证



写在前面:从 Claude Code 封号开始的折腾

说实话,这篇文章不是纯粹看榜单写出来的,是我真金白银(以及大量加班时间)换出来的踩坑记录。

事情要从 Claude Code 封号潮说起。一夜之间主力工具没了,项目不等人,只能赶紧找替代方案。于是过去一个多月我几乎是「见一个试一个」:DeepSeek Pro4、MiniMax M3、GitHub Copilot、Cursor CLI、Codex 5.5,再到最近刚放出来的 Kimi K3,以及现在稳定当主力的 Kimi 2.7 高速版。

这篇文章只聊一个方向:编程。不是通用问答,不是写作文,不是做数学题,就是实打实的写代码、改代码、理解项目上下文。我的结论可能和榜单不完全一致,但都是键盘上敲出来的真实感受。

DeepSeek V4 Pro:速度快,但低级错误让人头大

DeepSeek 的性价比在国内模型里一直很能打,API 价格几乎是白菜价,所以第一时间就接进来试。



实际编程体验怎么说呢?速度确实可以,响应不拖沓。但问题是低级错误太多了:编译错误、类型不匹配、import 错、把旧 API 当新 API 用…… 经常是它写完一版,我还要花十分钟帮它 debug。最难受的是这些错误不是业务逻辑复杂导致的,而是只要认真看一眼就能避免的「基本功问题」。

客观数据上 DeepSeek V4 Pro 并不弱,参考评测里它在 SWE-bench Verified 上能跑到 80.6%,长上下文 MRCR 1M 也有 83.5 分,参数规模 1.6T,输出长度能到 384K。但落到我的日常开发里,它就是那个「便宜大碗但总要返工」的选手。

如果你预算紧张、任务相对标准化,DeepSeek 依然是好选择;但如果是复杂工程,需要它一次性把活儿干漂亮,我目前不太敢把核心模块交给它。

MiniMax M3:Java 方向稳,但慢到让人崩溃

从 DeepSeek 换到 MiniMax M3 之后,第一感觉是:终于没有那些低级编译错误了。尤其在 Java 后端开发上,M3 的代码结构、Spring Boot 相关写法、依赖注入的理解都算得上规矩,出错的概率明显低一档。



但新的问题接踵而至:太慢了。不是那种「稍微等一等」的慢,是写一段稍微复杂点的逻辑就要盯着光标转圈,长到我开始怀疑是不是网络断了。用久了之后工作效率反而下降,因为思路老是被打断。

参考榜单里 MiniMax M3 虽然没有被单独拿出来和 Kimi K3 / GLM-5.2 / DeepSeek V4 Pro 做同维度比较,但从我自己的使用节奏看,它属于「能力够但体验打折」的类型。如果你不在意等待、对代码稳定性要求高,M3 还能用;但对我来说,慢到受不了就只能再换。

Cursor CLI 与 Codex 5.5:工具层面的遗憾

中间也试过国外工具路线。Cursor CLI 整体交互做得不错,但有个很致命的点:不支持图片。有些场景下需要截图给 AI 看 UI 或报错,直接就没法用,只能放弃。



Codex 5.5 能写代码,但写完总是不满意。它的修改方式更像「哪里报错改哪里」,缺乏对项目全局上下文的理解,改出来的代码经常是东拼西凑,能跑但不优雅,后续维护成本不低。 Claude Code 之前最让我离不开的,恰恰是它能把整个仓库的上下文串起来做决策;Codex 在这方面差了一截。

Kimi K3:周五惊艳,周六掉链子

Kimi K3 出来的那个周五下午,我几乎是抱着「再试最后一次」的心态点开的。结果出乎意料地好:

  • 写代码思路清晰,能把需求拆成合理的模块;
  • 上下文理解明显强于 Codex,能跨文件找关联;
  • 速度比 M3 快很多,响应流畅。

当时的感觉是:终于有一个能接近 Claude Code 体验的国产模型了。

但周六晚上再测,同样的问题同样的复杂度,响应速度却明显慢了下来,慢到让我怀疑是不是用户量暴增、服务资源跟不上了。这个波动让我有点犹豫 —— 如果稳定性不能保证,关键时刻掉链子也是很要命的。

从公开数据来看,Kimi K3 确实是三款国产模型里综合最强的一个:总参数 2.8T,DeepSWE 67.5、FrontierSWE 81.2、SWE Marathon 42.0,代码智能体能力领先;多模态支持文本、视觉、视频;高难度推理 GPQA-Diamond 93.5。榜单和我的周五体验是吻合的,但周六晚上的速度波动也提醒我:能力再强,稳定性也是生产力的一部分。



现在稳定的主力:Kimi 2.7 高速版

折腾了一圈之后,我目前稳定下来的是 Kimi 2.7 模型的 kimi-for-coding-highspeed

它的优势非常直接:速度快,编码能力也没短板。不需要像等 M3 那样等半天,也不像 DeepSeek 那样时不时冒低级错误,更不像 K3 那样出现明显的速度波动。写 Java、改配置、处理中等复杂度的业务逻辑,它都能比较稳地接住。

当然,它可能不像 Kimi K3 那样在复杂智能体任务和长上下文输出上那么惊艳,但对于日常编程这种高频、重复、需要快速反馈的场景,「没什么弱的感觉」本身就是很高的评价。

榜单数据再验证:综合最强≠最适合你

参考评测对三款国产开放权重大模型做了更系统的横向对比,结论和我上面的体验基本能对应上:

  • 综合能力:第一名 Kimi K3,综合指数约 57
  • 代码智能体:第一名 Kimi K3,关键数据包括 SWE Marathon 42.0、Automation Bench 30.8
  • 长上下文输出:第一名 DeepSeek V4 Pro,最大输出 384K token
  • 推理速度:第一名 GLM-5.2,约 168 tokens/s
  • 多模态能力:第一名 Kimi K3,覆盖文本、视觉、视频
  • API 成本:第一名 DeepSeek V4 Pro,输出约 0.87 美元 / 百万 token

GLM-5.2 在榜单里走的是「小而快」路线,744B 参数规模,速度达到 168 tokens/s,综合能力约 51 分,性价比和响应速度都很突出。如果我没被速度折磨到受不了,可能会更早注意到它。

结论:谁的编码能力第一?

如果只看客观榜单,Kimi K3 是当前国产模型里代码和复杂智能体能力最强的,综合能力、代码智能体、高难度推理、多模态都是它领先。

但如果问我现在日常开发用谁?答案是 Kimi 2.7 高速版。因为它在速度和稳定性上最符合「干活」的节奏。

对于其他几款:

  • DeepSeek V4 Pro:适合预算敏感、能接受返工的场景,API 成本优势巨大;
  • MiniMax M3:Java 方向代码质量还可以,但速度是硬伤;
  • Cursor CLI / Codex 5.5:工具和模型层面还有明显短板,暂不适合作为主力。

所以「谁的编码能力第一」这个问题,其实有两个答案:榜单第一是 Kimi K3,我当前的生产力第一是 Kimi 2.7 高速版。 能力上限和稳定交付,有时候并不是一回事。

总结

Claude Code 封号之后,我被迫把国产模型和国外替代工具试了个遍。最深的体会是:不要只看发布会和 benchmark,真正拿到项目里跑几天,才能知道谁是你的「真生产力」。

Kimi K3 代表了国产模型在代码能力上的上限,DeepSeek V4 Pro 代表了成本效率,GLM-5.2 代表了速度与参数规模的平衡。而我个人的选择,是先把稳定性放在第一位 —— 这或许也是很多一线开发者最朴素的共识。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
特朗普宣布两年后对仿制药征收100%关税,后续还将升至200%

特朗普宣布两年后对仿制药征收100%关税,后续还将升至200%

上观新闻
2026-07-22 07:38:29
央视三胎宣传片惹争议,脱离现实强行把孕妇塑造成超人式幸福?

央视三胎宣传片惹争议,脱离现实强行把孕妇塑造成超人式幸福?

番外行
2026-05-24 09:14:38
检出一类致癌物!山姆、盒马、永辉,均下架!

检出一类致癌物!山姆、盒马、永辉,均下架!

中吴网
2026-07-21 16:56:28
未来3年,即将烂大街不值钱的10样东西,越早扔越省钱

未来3年,即将烂大街不值钱的10样东西,越早扔越省钱

坠入二次元的海洋
2026-07-20 15:18:50
正式确定!中国男篮锋线大将完成转会,加盟北控男篮

正式确定!中国男篮锋线大将完成转会,加盟北控男篮

体坛瞎白话
2026-07-22 07:38:08
父子反目?郭德纲悲痛发文,杨议曝光猛料,郭麒麟的处境早有预兆

父子反目?郭德纲悲痛发文,杨议曝光猛料,郭麒麟的处境早有预兆

晓肂爱八卦
2026-07-20 11:09:06
预计未来1-2小时,北京大部地区有雷阵雨,请注意防范

预计未来1-2小时,北京大部地区有雷阵雨,请注意防范

北青网-北京青年报
2026-07-22 07:42:05
惊人发现!100%女人被玩之后,不再纠缠,而是无声的进行8种蜕变

惊人发现!100%女人被玩之后,不再纠缠,而是无声的进行8种蜕变

有态度网友19Dsym
2026-07-05 15:40:10
谢贤第一任妻子甄珍落泪回应谢贤去世:一辈子在心中都会把重要位置留给他,盼他一路好走

谢贤第一任妻子甄珍落泪回应谢贤去世:一辈子在心中都会把重要位置留给他,盼他一路好走

大象新闻
2026-07-21 13:52:09
同为骑士队“状元”,欧文队史总得分9475分,那詹姆斯总分多少?

同为骑士队“状元”,欧文队史总得分9475分,那詹姆斯总分多少?

钱说体育
2026-07-22 09:07:53
趁你病要你命!北约参战,澳大利亚参战,阿联酋参战,伊朗遭围殴

趁你病要你命!北约参战,澳大利亚参战,阿联酋参战,伊朗遭围殴

小先生笔记
2026-07-18 08:55:41
殡仪馆烧尸工自述,女尸下身惊现异物,冷汗直流吓破了胆

殡仪馆烧尸工自述,女尸下身惊现异物,冷汗直流吓破了胆

麦子情感故事
2026-07-21 00:23:04
谢贤去世1天私生活被扒,王晶大爆猛料 原来他和迟重瑞是同类人

谢贤去世1天私生活被扒,王晶大爆猛料 原来他和迟重瑞是同类人

老吴教育课堂
2026-07-22 05:27:52
印尼全面停购柴油,转头紧急访华求和,王毅直言拒绝脱钩断链!

印尼全面停购柴油,转头紧急访华求和,王毅直言拒绝脱钩断链!

无月可归辛
2026-07-22 02:35:52
记者:萨默维尔转会新月费用6000万+500万欧,年薪1200万欧

记者:萨默维尔转会新月费用6000万+500万欧,年薪1200万欧

懂球帝
2026-07-22 00:41:08
相声界仅剩的10位老演员,个个高寿,看看有没有你认识的艺人

相声界仅剩的10位老演员,个个高寿,看看有没有你认识的艺人

草莓解说体育
2026-07-22 02:01:59
第23波打击,伊朗领导层投降了?土耳其提醒中国:抓紧跟三国结盟

第23波打击,伊朗领导层投降了?土耳其提醒中国:抓紧跟三国结盟

史潎的生活日记
2026-07-21 05:12:03
BBA价格崩了,国产电车也没赢麻

BBA价格崩了,国产电车也没赢麻

老凤说财经
2026-07-21 17:05:25
从“挤破头”到“招不满”,这所民办学校的崩塌,只用了七年

从“挤破头”到“招不满”,这所民办学校的崩塌,只用了七年

亚哥谈古论今
2026-07-21 22:31:40
中国要提防巴基斯坦,看看他们的小孩,随口就:“秦腔穷”!

中国要提防巴基斯坦,看看他们的小孩,随口就:“秦腔穷”!

经纬戎韬
2026-07-20 21:33:05
2026-07-22 09:28:49
呼呼历史论
呼呼历史论
分享有趣的历史
716文章数 17584关注度
往期回顾 全部

科技要闻

怕了?美财长扬言:严查中国AI

头条要闻

中国游客在印尼遭遇沉船:深夜在海里漂了四五个小时

头条要闻

中国游客在印尼遭遇沉船:深夜在海里漂了四五个小时

体育要闻

“不会进球”的前锋,在世界杯决赛进球了

娱乐要闻

谢贤被曝已火葬,狄波拉携儿女送别

财经要闻

长鑫战配股数“腰斩” 投行详解背后逻辑

汽车要闻

WAIC专访|易启未来余志勇:网易孵化按摩机器人 能识穴会“手法”

态度原创

本地
亲子
健康
公开课
军事航空

本地新闻

杭州诗意路名,自带氛围感

亲子要闻

邀请儿童走进实验室 南方医科大学儿童皮肤科普课堂开讲

我这么年轻,也会中风吗?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美伊再开打 战局出现新变化

无障碍浏览 进入关怀版