网易首页 > 网易号 > 正文 申请入驻

把 GLM-5.3 接入到 DeepSeek Harness,夯爆了!

0
分享至

大家好,我是程序员鱼皮。

最近 AI 圈儿真是过年了,前脚 DeepSeek V4 Pro 正式版和 DeepSeek Harness 同时发布,后脚智谱就放出了全新的 GLM-5.3 模型。


听说 GLM-5.3 模型的基座跟 GLM-5.2 完全一样,还是 743B 参数,单纯通过后训练把性能提升了 50%。

测不完,根本测不完……

既然现在 GLM、DeepSeek、Kimi 几家国产模型打得这么凶,那干脆在同一个擂台上打一场呗?

我相信你们肯定也想看对吧~


刚好最近大火的 DeepSeek Harness(DSH)支持接入第三方模型,于是我决定把 DSH 当做一个统一的评测工具,把这三家的最新模型放在完全一致的工具链环境下测试,只有模型本身不同,尽量做到公平对比。


DeepSeek Harness 工具

点个收藏,我们开始。

模型接入 DeepSeek Harness

首先要把 GLM-5.3 和 Kimi K3 模型接入 DeepSeek Harness,这里我就以 GLM-5.3 为例。

如果你还没有安装和使用过 DeepSeek Harness,可以看看我之前的 ,从安装到上手只要几分钟。

视频教程:https://bilibili.com/video/BV1VkgK6NEZS

这里我只讲怎么在已有的 DeepSeek Harness 里接入第三方模型。

1)打开 DSH 的 Web 界面,点击左下角的「设置」按钮。


2)进入「模型」标签页,点击「添加提供方」。


3)选择模型提供方为 zai-coding-cn,然后到 智谱开放平台 获取你的 API Key 填进去就行。


4)展开自定义设置,点击「获取可用模型」。不过因为 GLM-5.3 太新了,默认不会被自动拉取到。

所以需要手动点击「添加模型」,填入 glm-5.3,然后保存。


搞定!现在就可以在对话框中选择并使用 GLM-5.3 模型了~


用同样的方法把 Kimi K3 也添加进来。DeepSeek V4 Pro 是 DSH 安装成功后默认接入的,不需要额外配置。

三个模型都就位了,下面开始正式比拼。

测试说明

为了公平对比,三个模型全部在 DeepSeek Harness 的标准模式下运行,统一使用各模型的默认推理档位,工具链完全一致,提示词完全相同。而且全程不做人工干预,给完提示词就让 AI 自己跑到底。

DSH 会自动扫描我本地安装的技能目录,比如我这里装了 Firecrawl 联网搜索技能、Context7 文档查询技能等,三个模型跑任务时都可以使用这些技能来搜索资料。


实战 1、致敬《牛来》的 3D 跑酷游戏

最近有一部国产动画电影叫《牛来》,因为建模极度粗糙、剧情抽象离谱,在社交媒体上反向爆火了。

上映第一天票房才 3420 元,结果因为猎奇打卡,短短十几天就冲到了 900 多万。

用半佛老师的话来说:

  • 如果你花一个多小时去了解这个电影,你就浪费了人生的一个小时。

  • 但如果你花了 30 块去看了《牛来》,那说明你真的有 30 块钱。

我决定让 3 个模型致敬这部电影,做一个《3D 网页跑酷游戏》。

提示词里我故意不做太多功能约束和技术限制,就是想看看模型自己能发挥到什么程度,能不能把电影里的元素还原出来。值得一提的是,我让 AI 用 Loop Engineering 的方式推进,做完一步就自己验证一步,出了问题自己修复。


OK,开跑!

GLM-5.3 成品效果

先来看 GLM-5.3 的效果。

进入主界面,可以看到一段故事描述。

有看过《牛来》的朋友吗?这个描述跟电影剧情还挺贴的,草原上的小牛犊牛来,跟随云雀坠入一场大梦,穿过迷雾、狼群与轰鸣的伐木场,唯有向前奔跑才能学会勇敢…… 还挺励志。


进入第一关「晨曦草原」,你别说,这个牛的建模真的挺抽象的,尤其是牛脸竟然还直勾勾地对着你……

旁边还有个云雀好友陪着牛牛向前奔跑,有点还原电影那个味儿了。


游戏操作支持左右移动、跳跃和滑铲,手感还挺流畅的,可玩性不错。


吃到一定数量的幸运草之后,可以释放大招,进入「豹拉疾冲」状态,全屏加速 + 无敌。

解释一下,豹拉是电影里牛来的好朋友,这个大招名字起得挺有意思的。


游戏有好几个关卡,而且每一关的主题和机制都不一样。比如「狼群夜袭」这关,你身后真的有狼在追你,还有一个贴合剧情的技能叫「妈妈的守护」,我直接一个泪目。


可惜,最终牛牛我倒在了第四关。

看看这个死亡结算画面,我真的没绷住,怎么还喷出一团血花了呢?


细节,真的细节……

DeepSeek V4 Pro 成品效果

再来看看 DeepSeek V4 Pro 的版本。

主界面还挺像那么回事,也还原了云雀和牛来的故事背景。


进入游戏。

额…… 怎么硕呢?

界面真的是干净得一鲏啊!

不过还原了云雀和好友豹拉,它们会陪着牛牛一起奔跑。


移动、跳跃和滑铲功能都是正常的,不过看到这个滑铲效果我真没绷住…… 好家伙,眼珠子都给我铲出来了?


仔细看的话,道路两侧的图标明显飘在了草坪上面。还有就是游戏节奏太慢了,刚开局跑了好久第一个障碍物才出现,也没什么技能和特殊的关卡机制,可玩性较差。


牛牛只有一条命,撞到石头之后直接进入死亡结算画面:


整体来看,中规中矩吧。

Kimi K3 成品效果

最后看看 Kimi K3 的版本。

主界面的配色平平无奇,跟其他模型一样,也把电影剧情概括了一下。


进入游戏,界面风格还可以,远处的大山绘制得不错。但是主角牛牛就平平无奇了,不够抽象,看起来就是一组普通的方块。


虽然牛牛有 3 条命,也可以吃金币,但是没有什么技能和特殊机制,整个游戏就是单纯跑跑跑。

我的豹子朋友呢?云雀呢?

还有这个下雨效果,直接来一个全屏网格?这就有点敷衍了吧……


而且最致命的问题是,整个游戏时不时会出现明显的卡顿,帧率不够稳定。

最后是平平无奇的结算画面,一般。


实战 1 对比

三个版本都跑完了,胜负应该已经很明显了。

GLM-5.3 的版本完成度最高,多关卡、多技能、剧情还原度强,可玩性远超其他两个。

DeepSeek V4 Pro 实现了基本玩法,但是节奏偏慢、细节粗糙。

Kimi K3 虽然场景画面还行,但游戏机制太单一,还有卡顿问题。

综合来看:

  • 前端效果 GLM ≈ Kimi > DeepSeek

  • 可玩性是 GLM > DeepSeek > Kimi

  • 画面抽象程度是 GLM > DeepSeek > Kimi

整体游戏完成度上,GLM 5.3 遥遥领先。

实战 2、AI 绘图工具

上一个任务是前端游戏,第二个任务当然要换个方向,测试模型的全栈工程能力。

我让 3 个模型开发一个《AI 绘图工具》,用户输入自然语言描述需求,后端调用大模型生成 draw.io 格式的图表,前端嵌入 draw.io 开源编辑器,用户可以直接在线编辑和修改生成的图表。

这个任务同时考验对 draw.io 开源代码的理解、后端 AI 调用链路的设计、前端复杂组件的集成、以及整体产品设计的合理性。

为了方便测试,我直接在提示词里把 API Key 提供给了 AI,省去手动配置环境变量的步骤。


GLM-5.3 成品效果

先看看 GLM-5.3 的效果。

整个页面很有科技感,左侧是 AI 对话框,右侧是画布编辑器。

产品引导做得也很到位,告诉你可以用一句话画出专业图表,还给了几个示例类型。


我让 AI 帮我画出 DeepSeek Harness 的架构图。可以实时看到 AI 深度思考和生成 XML 代码的过程,右侧显示了一个炫酷的 Loading 动画。


生成完成后,右侧立刻渲染出了完整的架构图,分层很清晰,而且保留了 draw.io 原本的元素编辑能力,可以直接拖拽和修改。


更强的是,它支持连续对话修改。比如我说「帮我把 DeepSeek Harness Core 这里变成红色」,AI 就能精准定位到对应的元素并修改样式,右侧画布实时更新。


整体效果非常不错,图片导出功能也能正常使用。

而且你会发现 GLM-5.3 把 draw.io 的编辑能力深度融合进了自己设计的界面中,看起来就像一个完整的产品,而不是生硬地嵌入了一个第三方组件。

DeepSeek V4 Pro 成品效果

再来看看 DeepSeek V4 Pro 的表现。

打开界面,右侧画布竟然是一坨空白加一个大大的 Loading 图标?

而且左下角的提示文字还出现了溢出,这把 DeepSeek V4 Pro 的前端确实拉了。


AI 生成图表的功能是可以正常使用的,但是没有实时展示 AI 思考过程的能力,你只能等它全部生成完了,才能看到结果。


最关键的是,DeepSeek V4 Pro 很明显是直接把 draw.io 整个嵌入到了前端页面中,没有做任何深度集成。给人一种很生硬的感觉,跟 GLM 那种把 draw.io 能力自然融合到自己界面中的做法差距明显。

Kimi K3 成品效果

最后看 Kimi K3。

Kimi K3 这次生成的界面布局跟 GLM 类似,也把 draw.io 自然融合到了项目中,整体界面风格非常 nice。

不过 draw.io 的图标和菜单栏还是原封不动地保留了下来,融合度比 GLM 略逊一筹。


AI 生成图表的功能正常,同样支持连续对话修改。


但是,后端逻辑明显没做好提示词约束和工具校验,有时候 AI 生成的内容会翻车,直接把 XML 源码糊在界面上而不是渲染成图形。


整体来看,Kimi K3 的前端设计能力跟 GLM-5.3 相当,但后端稳定性差了一截。

实战 2 对比

这个任务 GLM-5.3 的综合表现最好,界面设计、AI 深度思考实时展示、连续对话修改、draw.io 深度融合,每一环都做到位了。

Kimi K3 的前端设计能力很强,但是后端偶尔会翻车。

DeepSeek V4 Pro 虽然也正常实现了核心功能,但是界面粗糙,集成方式生硬,表现最差。

我的感受

两个项目全部跑完了,聊聊我的真实感受。

显然,即使是在 DeepSeek Harness 这个 DeepSeek 的「角色专武」环境下,GLM-5.3 的表现依然很出色。

我选的这两个任务覆盖了纯前端 3D 游戏和全栈 AI 应用两个完全不同的方向,可以看出 GLM-5.3 在任务理解、代码生成质量、产品设计意识这几个维度上都明显领先。

然后聊聊大家非常关心的成本问题,猜猜我花了多少 money 呢?

由于 GLM-5.3 我使用的是编码套餐,不太好直接统计实际消耗金额,我只能拿积分来算了。

两个项目累计消耗了 1151 积分,由于我订的是 Pro 套餐(538 元/月),每周额度是 6 万积分,算下来这次的消耗只占了周额度不到 2%,折算成钱连 3 块都不到。


由于我的 Kimi K3 套餐过期了,新的抢不到,所以是直接用 API Key 接入的,总共消耗了 31.07 元;涨价之后的 DeepSeek V4 Pro 消耗了 13.99 元。

单从我的实际花销来看,GLM-5.3 按照套餐来算,性价比是最高的。一周 6 万积分随便你跑,根据我这次测试的这种任务来看,做几十个小项目不成问题。

而且 GLM-5.3 会在发布两周后开源权重。

在开源世界里,GLM-5.3 目前可以说是编程能力的天花板。


而且智谱在发布文章中提到,Hugging Face 之前遭遇安全攻击的时候,Anthropic 的 Mythos 模型只面向约 150 家大型机构提供服务,更多的中小企业和开源项目在最需要帮助的时候,反而用不上最强的防御工具。

当攻击能力在扩散,防御能力就不能只掌握在少数人手中。GLM-5.3 的开源给所有人提供了一把防御的盾牌,这件事本身的意义可能比跑分更重要。

最后哔哔

最后多说几句,这次横评让我对国产模型的编程能力更有信心了。GLM-5.3、Kimi K3、DeepSeek V4 Pro 这几家打得不可开交,对我们用户来说是好事儿,起码有了更多的选择。

OK 就分享到这里,本文会收录到我免费开源的 ,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。


鱼皮的 AI 编程教程

我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~

也欢迎在评论区聊聊:你现在主力用哪个国产编程模型?GLM、Kimi 还是 DeepSeek?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
富商给瘫痪女儿招婿,穷小子为20万答应,洞房夜掀开头纱他傻眼了

富商给瘫痪女儿招婿,穷小子为20万答应,洞房夜掀开头纱他傻眼了

温情邮局
2025-05-16 14:23:56
别大意!这 4 种蔬菜已被列入升糖黑名单!建议糖尿病患者少吃

别大意!这 4 种蔬菜已被列入升糖黑名单!建议糖尿病患者少吃

橘子约定
2026-08-20 11:29:52
穿武磊国家队球衣小球迷遭围攻?警方通报

穿武磊国家队球衣小球迷遭围攻?警方通报

界面新闻
2026-08-19 22:35:48
秀智新剧男主演颜值翻车遭群嘲:韩网批毫无男主相

秀智新剧男主演颜值翻车遭群嘲:韩网批毫无男主相

娱圈观察员
2026-08-20 18:36:17
凌晨4点,高速上沉睡的司机和115公里时速的“智驾”棺材盒

凌晨4点,高速上沉睡的司机和115公里时速的“智驾”棺材盒

阿芒娱乐说
2026-08-20 11:58:45
白月光的杀伤力有多大?网友:白月光就是没得到的人,得到了也就那样

白月光的杀伤力有多大?网友:白月光就是没得到的人,得到了也就那样

带你感受人间冷暖
2026-08-20 00:18:45
斩首!俄军导弹打出致命一击,外国雇佣兵被炸翻了天,日本人参战

斩首!俄军导弹打出致命一击,外国雇佣兵被炸翻了天,日本人参战

共工之锚
2026-08-20 00:07:37
低成本网红Cos《牛来》!胶带缠全身 网笑:预算比电影成本还高

低成本网红Cos《牛来》!胶带缠全身 网笑:预算比电影成本还高

ETtoday星光云
2026-08-20 12:19:08
乌克兰新防长是个狠角色

乌克兰新防长是个狠角色

名人苟或
2026-08-20 18:02:13
俄媒:中国“歼-50上舰”,将比歼-35上舰更可怕,将重塑航母战斗方式

俄媒:中国“歼-50上舰”,将比歼-35上舰更可怕,将重塑航母战斗方式

蓝星杂谈
2026-08-19 08:05:08
网友吐槽格力字体像“格尸”“格P”,批评令人误解、意味不好,建议修改,评论区已经吵翻天

网友吐槽格力字体像“格尸”“格P”,批评令人误解、意味不好,建议修改,评论区已经吵翻天

谭谈社会
2026-08-18 11:26:52
崩盘!湖人队内乱全面爆发,东契奇夺冠梦碎,詹姆斯全身而退

崩盘!湖人队内乱全面爆发,东契奇夺冠梦碎,詹姆斯全身而退

黄小仙的搞笑视频
2026-08-20 17:45:37
跌超15%,宇树科技只做了一天“浙股一哥”,海康威视重新夺回宝座

跌超15%,宇树科技只做了一天“浙股一哥”,海康威视重新夺回宝座

极目新闻
2026-08-20 14:50:41
丁玉梅在英国的两个未成年子女,会是许家印的孩子吗?

丁玉梅在英国的两个未成年子女,会是许家印的孩子吗?

李丹Fintalk
2026-08-20 15:58:24
新疆兵团为啥不能撤?看完2026真实数据,瞬间看懂国家布局

新疆兵团为啥不能撤?看完2026真实数据,瞬间看懂国家布局

心灵得以滋养
2026-08-01 02:28:35
阳朔网红“千里江山图”打卡点划定摄影师专用机位,当地镇政府:地块属企业承包经营,非公共景区;旅拍空闲时段游客可进入

阳朔网红“千里江山图”打卡点划定摄影师专用机位,当地镇政府:地块属企业承包经营,非公共景区;旅拍空闲时段游客可进入

大风新闻
2026-08-19 18:51:06
部分央国企目前面临的最大问题,已经不是如何发展了

部分央国企目前面临的最大问题,已经不是如何发展了

花小猫的美食日常
2026-08-20 03:02:49
男性有没有衰老,“下半身”会说实话,若一个没中,恭喜还强壮

男性有没有衰老,“下半身”会说实话,若一个没中,恭喜还强壮

展望云霄
2026-07-23 09:05:25
许家印的「金瓶梅」,写到最后一回了

许家印的「金瓶梅」,写到最后一回了

法律先生
2026-08-20 21:00:13
大爆冷!萨巴伦卡0-2输贝莱克无缘八强 捷克小将首胜世界第一

大爆冷!萨巴伦卡0-2输贝莱克无缘八强 捷克小将首胜世界第一

醉卧浮生
2026-08-20 12:15:16
2026-08-20 21:44:49
程序员鱼皮 incentive-icons
程序员鱼皮
一手科技资讯和编程干货
206文章数 152关注度
往期回顾 全部

科技要闻

快手Q2研发狂烧45亿:如何面对双面夹击

头条要闻

情侣礁石拍照坠落1死1伤 有摄影师称“浪越猛越好拍”

头条要闻

情侣礁石拍照坠落1死1伤 有摄影师称“浪越猛越好拍”

体育要闻

46岁小罗抵达意大利 将为拉文纳征战意丙

娱乐要闻

任重晒全家福官宣二胎喜讯

财经要闻

许家印被判处无期 恒大集团被罚88.2亿

汽车要闻

智能硬派越野方盒子 享界G9上市售42.98万起

态度原创

艺术
本地
手机
房产
公开课

艺术要闻

新地标!毛戈平总部大楼,关键结构施工中

本地新闻

先导片|攀登不止,让不同的故事在此连接

手机要闻

Omdia预测:折叠屏智能手机2028年出货量将达2025年的2倍

房产要闻

265亿资产甩出!三亚老牌地产巨头,正在集体退场!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版