大家好,我是程序员鱼皮。
最近 AI 圈儿真是过年了,前脚 DeepSeek V4 Pro 正式版和 DeepSeek Harness 同时发布,后脚智谱就放出了全新的 GLM-5.3 模型。
![]()
听说 GLM-5.3 模型的基座跟 GLM-5.2 完全一样,还是 743B 参数,单纯通过后训练把性能提升了 50%。
测不完,根本测不完……
既然现在 GLM、DeepSeek、Kimi 几家国产模型打得这么凶,那干脆在同一个擂台上打一场呗?
我相信你们肯定也想看对吧~
![]()
刚好最近大火的 DeepSeek Harness(DSH)支持接入第三方模型,于是我决定把 DSH 当做一个统一的评测工具,把这三家的最新模型放在完全一致的工具链环境下测试,只有模型本身不同,尽量做到公平对比。
![]()
DeepSeek Harness 工具
点个收藏,我们开始。
模型接入 DeepSeek Harness
首先要把 GLM-5.3 和 Kimi K3 模型接入 DeepSeek Harness,这里我就以 GLM-5.3 为例。
如果你还没有安装和使用过 DeepSeek Harness,可以看看我之前的 ,从安装到上手只要几分钟。
视频教程:https://bilibili.com/video/BV1VkgK6NEZS
这里我只讲怎么在已有的 DeepSeek Harness 里接入第三方模型。
1)打开 DSH 的 Web 界面,点击左下角的「设置」按钮。
![]()
2)进入「模型」标签页,点击「添加提供方」。
![]()
3)选择模型提供方为 zai-coding-cn,然后到 智谱开放平台 获取你的 API Key 填进去就行。
![]()
4)展开自定义设置,点击「获取可用模型」。不过因为 GLM-5.3 太新了,默认不会被自动拉取到。
所以需要手动点击「添加模型」,填入 glm-5.3,然后保存。
![]()
搞定!现在就可以在对话框中选择并使用 GLM-5.3 模型了~
![]()
用同样的方法把 Kimi K3 也添加进来。DeepSeek V4 Pro 是 DSH 安装成功后默认接入的,不需要额外配置。
三个模型都就位了,下面开始正式比拼。
测试说明
为了公平对比,三个模型全部在 DeepSeek Harness 的标准模式下运行,统一使用各模型的默认推理档位,工具链完全一致,提示词完全相同。而且全程不做人工干预,给完提示词就让 AI 自己跑到底。
DSH 会自动扫描我本地安装的技能目录,比如我这里装了 Firecrawl 联网搜索技能、Context7 文档查询技能等,三个模型跑任务时都可以使用这些技能来搜索资料。
![]()
实战 1、致敬《牛来》的 3D 跑酷游戏
最近有一部国产动画电影叫《牛来》,因为建模极度粗糙、剧情抽象离谱,在社交媒体上反向爆火了。
上映第一天票房才 3420 元,结果因为猎奇打卡,短短十几天就冲到了 900 多万。
用半佛老师的话来说:
如果你花一个多小时去了解这个电影,你就浪费了人生的一个小时。
但如果你花了 30 块去看了《牛来》,那说明你真的有 30 块钱。
我决定让 3 个模型致敬这部电影,做一个《3D 网页跑酷游戏》。
提示词里我故意不做太多功能约束和技术限制,就是想看看模型自己能发挥到什么程度,能不能把电影里的元素还原出来。值得一提的是,我让 AI 用 Loop Engineering 的方式推进,做完一步就自己验证一步,出了问题自己修复。
![]()
OK,开跑!
GLM-5.3 成品效果
先来看 GLM-5.3 的效果。
进入主界面,可以看到一段故事描述。
有看过《牛来》的朋友吗?这个描述跟电影剧情还挺贴的,草原上的小牛犊牛来,跟随云雀坠入一场大梦,穿过迷雾、狼群与轰鸣的伐木场,唯有向前奔跑才能学会勇敢…… 还挺励志。
![]()
进入第一关「晨曦草原」,你别说,这个牛的建模真的挺抽象的,尤其是牛脸竟然还直勾勾地对着你……
旁边还有个云雀好友陪着牛牛向前奔跑,有点还原电影那个味儿了。
![]()
游戏操作支持左右移动、跳跃和滑铲,手感还挺流畅的,可玩性不错。
![]()
吃到一定数量的幸运草之后,可以释放大招,进入「豹拉疾冲」状态,全屏加速 + 无敌。
解释一下,豹拉是电影里牛来的好朋友,这个大招名字起得挺有意思的。
![]()
游戏有好几个关卡,而且每一关的主题和机制都不一样。比如「狼群夜袭」这关,你身后真的有狼在追你,还有一个贴合剧情的技能叫「妈妈的守护」,我直接一个泪目。
![]()
可惜,最终牛牛我倒在了第四关。
看看这个死亡结算画面,我真的没绷住,怎么还喷出一团血花了呢?
![]()
细节,真的细节……
DeepSeek V4 Pro 成品效果
再来看看 DeepSeek V4 Pro 的版本。
主界面还挺像那么回事,也还原了云雀和牛来的故事背景。
![]()
进入游戏。
额…… 怎么硕呢?
界面真的是干净得一鲏啊!
不过还原了云雀和好友豹拉,它们会陪着牛牛一起奔跑。
![]()
移动、跳跃和滑铲功能都是正常的,不过看到这个滑铲效果我真没绷住…… 好家伙,眼珠子都给我铲出来了?
![]()
仔细看的话,道路两侧的图标明显飘在了草坪上面。还有就是游戏节奏太慢了,刚开局跑了好久第一个障碍物才出现,也没什么技能和特殊的关卡机制,可玩性较差。
![]()
牛牛只有一条命,撞到石头之后直接进入死亡结算画面:
![]()
整体来看,中规中矩吧。
Kimi K3 成品效果
最后看看 Kimi K3 的版本。
主界面的配色平平无奇,跟其他模型一样,也把电影剧情概括了一下。
![]()
进入游戏,界面风格还可以,远处的大山绘制得不错。但是主角牛牛就平平无奇了,不够抽象,看起来就是一组普通的方块。
![]()
虽然牛牛有 3 条命,也可以吃金币,但是没有什么技能和特殊机制,整个游戏就是单纯跑跑跑。
我的豹子朋友呢?云雀呢?
还有这个下雨效果,直接来一个全屏网格?这就有点敷衍了吧……
![]()
而且最致命的问题是,整个游戏时不时会出现明显的卡顿,帧率不够稳定。
最后是平平无奇的结算画面,一般。
![]()
实战 1 对比
三个版本都跑完了,胜负应该已经很明显了。
GLM-5.3 的版本完成度最高,多关卡、多技能、剧情还原度强,可玩性远超其他两个。
DeepSeek V4 Pro 实现了基本玩法,但是节奏偏慢、细节粗糙。
Kimi K3 虽然场景画面还行,但游戏机制太单一,还有卡顿问题。
综合来看:
前端效果 GLM ≈ Kimi > DeepSeek
可玩性是 GLM > DeepSeek > Kimi
画面抽象程度是 GLM > DeepSeek > Kimi
整体游戏完成度上,GLM 5.3 遥遥领先。
实战 2、AI 绘图工具
上一个任务是前端游戏,第二个任务当然要换个方向,测试模型的全栈工程能力。
我让 3 个模型开发一个《AI 绘图工具》,用户输入自然语言描述需求,后端调用大模型生成 draw.io 格式的图表,前端嵌入 draw.io 开源编辑器,用户可以直接在线编辑和修改生成的图表。
这个任务同时考验对 draw.io 开源代码的理解、后端 AI 调用链路的设计、前端复杂组件的集成、以及整体产品设计的合理性。
为了方便测试,我直接在提示词里把 API Key 提供给了 AI,省去手动配置环境变量的步骤。
![]()
GLM-5.3 成品效果
先看看 GLM-5.3 的效果。
整个页面很有科技感,左侧是 AI 对话框,右侧是画布编辑器。
产品引导做得也很到位,告诉你可以用一句话画出专业图表,还给了几个示例类型。
![]()
我让 AI 帮我画出 DeepSeek Harness 的架构图。可以实时看到 AI 深度思考和生成 XML 代码的过程,右侧显示了一个炫酷的 Loading 动画。
![]()
生成完成后,右侧立刻渲染出了完整的架构图,分层很清晰,而且保留了 draw.io 原本的元素编辑能力,可以直接拖拽和修改。
![]()
更强的是,它支持连续对话修改。比如我说「帮我把 DeepSeek Harness Core 这里变成红色」,AI 就能精准定位到对应的元素并修改样式,右侧画布实时更新。
![]()
整体效果非常不错,图片导出功能也能正常使用。
而且你会发现 GLM-5.3 把 draw.io 的编辑能力深度融合进了自己设计的界面中,看起来就像一个完整的产品,而不是生硬地嵌入了一个第三方组件。
DeepSeek V4 Pro 成品效果
再来看看 DeepSeek V4 Pro 的表现。
打开界面,右侧画布竟然是一坨空白加一个大大的 Loading 图标?
而且左下角的提示文字还出现了溢出,这把 DeepSeek V4 Pro 的前端确实拉了。
![]()
AI 生成图表的功能是可以正常使用的,但是没有实时展示 AI 思考过程的能力,你只能等它全部生成完了,才能看到结果。
![]()
最关键的是,DeepSeek V4 Pro 很明显是直接把 draw.io 整个嵌入到了前端页面中,没有做任何深度集成。给人一种很生硬的感觉,跟 GLM 那种把 draw.io 能力自然融合到自己界面中的做法差距明显。
Kimi K3 成品效果
最后看 Kimi K3。
Kimi K3 这次生成的界面布局跟 GLM 类似,也把 draw.io 自然融合到了项目中,整体界面风格非常 nice。
不过 draw.io 的图标和菜单栏还是原封不动地保留了下来,融合度比 GLM 略逊一筹。
![]()
AI 生成图表的功能正常,同样支持连续对话修改。
![]()
但是,后端逻辑明显没做好提示词约束和工具校验,有时候 AI 生成的内容会翻车,直接把 XML 源码糊在界面上而不是渲染成图形。
![]()
整体来看,Kimi K3 的前端设计能力跟 GLM-5.3 相当,但后端稳定性差了一截。
实战 2 对比
这个任务 GLM-5.3 的综合表现最好,界面设计、AI 深度思考实时展示、连续对话修改、draw.io 深度融合,每一环都做到位了。
Kimi K3 的前端设计能力很强,但是后端偶尔会翻车。
DeepSeek V4 Pro 虽然也正常实现了核心功能,但是界面粗糙,集成方式生硬,表现最差。
我的感受
两个项目全部跑完了,聊聊我的真实感受。
显然,即使是在 DeepSeek Harness 这个 DeepSeek 的「角色专武」环境下,GLM-5.3 的表现依然很出色。
我选的这两个任务覆盖了纯前端 3D 游戏和全栈 AI 应用两个完全不同的方向,可以看出 GLM-5.3 在任务理解、代码生成质量、产品设计意识这几个维度上都明显领先。
然后聊聊大家非常关心的成本问题,猜猜我花了多少 money 呢?
由于 GLM-5.3 我使用的是编码套餐,不太好直接统计实际消耗金额,我只能拿积分来算了。
两个项目累计消耗了 1151 积分,由于我订的是 Pro 套餐(538 元/月),每周额度是 6 万积分,算下来这次的消耗只占了周额度不到 2%,折算成钱连 3 块都不到。
![]()
由于我的 Kimi K3 套餐过期了,新的抢不到,所以是直接用 API Key 接入的,总共消耗了 31.07 元;涨价之后的 DeepSeek V4 Pro 消耗了 13.99 元。
单从我的实际花销来看,GLM-5.3 按照套餐来算,性价比是最高的。一周 6 万积分随便你跑,根据我这次测试的这种任务来看,做几十个小项目不成问题。
而且 GLM-5.3 会在发布两周后开源权重。
在开源世界里,GLM-5.3 目前可以说是编程能力的天花板。
![]()
而且智谱在发布文章中提到,Hugging Face 之前遭遇安全攻击的时候,Anthropic 的 Mythos 模型只面向约 150 家大型机构提供服务,更多的中小企业和开源项目在最需要帮助的时候,反而用不上最强的防御工具。
当攻击能力在扩散,防御能力就不能只掌握在少数人手中。GLM-5.3 的开源给所有人提供了一把防御的盾牌,这件事本身的意义可能比跑分更重要。
最后哔哔
最后多说几句,这次横评让我对国产模型的编程能力更有信心了。GLM-5.3、Kimi K3、DeepSeek V4 Pro 这几家打得不可开交,对我们用户来说是好事儿,起码有了更多的选择。
OK 就分享到这里,本文会收录到我免费开源的 ,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。
![]()
鱼皮的 AI 编程教程
我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~
也欢迎在评论区聊聊:你现在主力用哪个国产编程模型?GLM、Kimi 还是 DeepSeek?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.