大家好,我是程序员鱼皮。
前几天,海外 AI 平台 OpenRouter 和 OpenCode 上突然冒出了一个没有任何背景介绍的匿名模型 Ox-Alpha,俗称「牛来」模型。
没人知道它是谁做的,但开发者们试用之后纷纷上头了。上线首日直接冲到 OpenRouter 榜首,刷新了平台单日 Token 用量的历史纪录,甚至终结了 DeepSeek 在 OpenCode 连续 56 天霸榜的纪录!
![]()
ox 模型的 LLM Leaderboard 排名
谷歌还屁颠屁颠儿地跑出来蹭热度认领,说这是自家的模型,结果被全网笑惨了。。。
就在昨天,这个神秘模型终于正式揭晓身份。
它是智谱的 GLM-5.3-Flash,是国产模型!
![]()
GLM-5.3-Flash 是智谱的首个 原生多模态模型,采用全新架构,仅 320B 参数(激活仅 18B),能力就可以对标 Claude Opus 4.8,而且价格竟然只有 Opus 4.8 的 1/40 !
![]()
GLM-5.3-Flash 上线即开源,采用 MIT 协议,而且全部流量跑在 10 万张国产芯片上!
![]()
在 Artificial Analysis Intelligence Index 这个国际权威综合能力榜上,GLM-5.3-Flash 拿到了 57 分,跟 Claude Opus 4.8 持平,超过了 DeepSeek V4 Pro(53 分)和 DeepSeek V4 Flash(52 分)。在 Coding 方向的多项基准上也都逼近甚至超过了 Opus 4.8,但价格目前仅为 Opus 4.8 的 1/40,常规场景下也比涨价后的 DeepSeek V4 Flash 更便宜。
![]()
智谱 GLM-5.3-Flash 跑分图
一条新的 AI 模型斩杀线,正在形成。
![]()
以前大家默认 AI 具有前沿能力就意味着高昂的价格,GLM-5.3-Flash 把这个等式打破了。
![]()
GLM 终于开眼
对我来说,这次最兴奋的升级不是价格,而是原生多模态。
GLM-5.3 虽然编程能力很强,但它是个「瞎子模型」,写完代码之后没办法自己看一眼页面长什么样。同样的问题在测试 DeepSeek V4 Pro 的时候也遇到了,前端做出来的效果对不对、好不好看,模型自己完全判断不了。
AI 公司当然能意识到这个痛点,于是前阵子 DeepSeek V4 Flash 率先放出了多模态版本 DeepSeek-V4-Vision-Exp,这次智谱直接跟上,而且视觉能力是从预训练阶段就原生融入的,让 AI 天生就有一双慧眼。
![]()
也就是说,AI 写完一段前端代码之后,它自己就能截图看效果、发现布局错位或者配色不对、然后自己修复,不需要你人工介入一步步测试和验收了。这对 AI 编程的体验提升是巨大的。
官方提供了几个 Demo 案例,咱们一起来看看。
1、3D Blender 建模
GLM-5.3-Flash 在没有任何外部素材的情况下,自主运行了 16 个小时,用 Blender 从零搭建了一套约 400 平方米的专业主厨自宅和厨房。模型通过反复渲染、查看画面、定位问题、再迭代修正的方式,完成了整个场景构建。
2、设计稿到完整 APP
让 AI 基于参考页面的截图进行像素级复刻,模型会分析设计体系、页面关系、共享组件、导航结构和动效逻辑,然后逐页截图与参考图对比,持续修正差异,直到视觉还原度达标。
设计稿原型图:
![]()
设计稿原图
复刻出来的成品 APP,还原度很高:
3、主题视觉复刻
基于节日视觉设计,复刻红包封面的平面艺术风格和动态展示体验。
这个复刻效果,你觉得怎么样?
![]()
4、游戏复刻
让 AI 自主复刻经典的 Godot 游戏《喷射战士》。
好家伙,看看这个效果,我甚至以为是原作……
当然,官方 Demo 再好看也只是参考,到底好不好用还是得自己试了才知道。
下面我准备了 3 个项目来实测 GLM-5.3-Flash 的编程能力,从前端视觉复刻、全栈应用开发到多模态综合任务,由浅入深。
工具准备
这次实战我选用的 AI 编程工具是 ZCode,这是智谱 GLM 系列的官方 Harness 工具。
如果你平时就打算用 GLM 系列模型来 AI 编程,那 ZCode 是更好的选择,毕竟是角色专武嘛。它对自家模型 GLM-5.3-Flash 的多模态能力支持得最好,还内置了浏览器控制和电脑控制功能,模型可以直接操作浏览器、截图验证、自主调试。
![]()
打开 ZCode,会先让你登录授权,国内选择连接 BigModel 平台。
登录之后就进入了熟悉的 Agent 面板,跟 Codex 长得几乎一模一样,可以在对话框中直接切换使用最新的 GLM-5.3-Flash 模型。
![]()
另外,为了让 AI 运行时能够获取到最新的信息,还需要准备好联网搜索插件 Firecrawl、以及获取最新文档的插件 Context7。分别到各自的官网安装就好了,ZCode 会自动识别出本地已经安装的技能。
![]()
ZCode 自带浏览器控制和电脑控制功能,开启之后模型就能直接打开浏览器截图验收、操作桌面应用。需要先在设置里点击授权,允许辅助功能和屏幕录制权限。
![]()
准备工作搞定了,下面开始实战。
GLM-5.3-Flash 实战测评 实战 1、复刻 Apple Vision 产品页
第一个任务,我想测的是 GLM-5.3-Flash 的视觉理解能力,看看到底有多强?
最直观的方式就是让 AI 去复刻一个视觉效果很复杂的网页。我选了 Apple Vision Pro 的官方产品页,这个页面有大量的滚动触发动画、3D 产品展示、深色科技感背景和精致的文字排版节奏,是公认难度很高的前端设计。
![]()
提示词里我要求 AI 先用 Firecrawl 抓取目标页面的结构信息,然后充分利用视觉理解能力,先截图分析目标网站的布局和风格,开发过程中每完成一个模块就自己截图对比验证,不满意就优化,直到满意再交付。
我特地开启了完全访问模式,让 AI 可以自由安装依赖和启动服务,省去中间的确认环节:
![]()
AI 拿到任务之后,先加载 Firecrawl 技能联网抓取了 Apple Vision Pro 产品页的网页结构,然后加载浏览器自动化技能,对目标页做了 8 个不同滚动位置的截图分析,提取出页面的章节节奏、双导航结构、文字韵律等设计细节。
做完这些准备工作之后,AI 才正式开工写代码。
![]()
整个开发过程中,AI 会不断截图对比自己的成品和 Apple 目标页的效果,发现差异就调整。比如它会检查缩放舞台的文字与产品淡出时序是不是跟原版一致,章节标题的亮度对不对,媒体辉光效果够不够。
![]()
经过了 12 轮截图验证,AI 花了大约 19 分钟完成了整个任务,并且自动帮我启动了项目:
![]()
来看看成品效果。在没有使用任何 Apple 官方图片素材的情况下,整体布局的还原度相当高!
举个例子,对比一下导航栏的复刻效果,双层导航结构、胶囊按钮、产品子导航的排列方式都还原了:
![]()
整个页面的深色科技氛围和原版很相似,文字的排版节奏也是对味儿的:
![]()
虽然没有真实的产品摄影图片,但整体的视觉还原度已经很不错了。如果把正式的产品图片替换上去,基本可以直接当成一个完整的产品宣传页来使用。
以后如果你想做个产品宣传网站,直接把要复刻的网址或者 UI 截图发给 AI,它就能帮你搭出来个八九不离十的版本,然后再手动微调细节就行了。
实战 2、全栈 AI 绘图工具
第二个任务我换了方向,测试 GLM-5.3-Flash 的全栈工程能力。
我选了跟之前测评 GLM-5.3 时完全一样的案例,让 AI 开发一个 AI 智能绘图工具。
用户输入自然语言描述,后端调用大模型生成 draw.io 兼容的 XML 图表结构,前端嵌入 draw.io 开源编辑器实时渲染,还支持连续对话修改。
之所以用同一个案例,是为了跟之前在 DeepSeek Harness 里测试的 GLM-5.3、DeepSeek V4 Pro、Kimi K3 做横向对比,看看 GLM-5.3-Flash 在 ZCode 环境下表现如何。
而且 GLM-5.3-Flash 本身就支持 API 接入,正好可以作为这个应用内置的 AI 模型,一举两得。
![]()
提示词跟之前完全一样,只是把内置的 AI 模型从 DeepSeek V4 Pro 换成了 GLM-5.3-Flash。
![]()
AI 通过 Firecrawl 联网抓取了 draw.io 仓库结构和嵌入协议文档,发现了一个关键信息:draw.io 支持 AUTOSAVE 事件,编辑器会主动推送 XML,这样就能实现双向实时同步,不需要魔改源码。
![]()
大约 46 分钟后,AI 完成了任务,主要的时间都花在了自动化验证上。
![]()
来看看成品效果。
刚打开页面我就被吸引到了,这个 UI 设计很有科技感,而且 draw.io 的集成非常自然,不像是生硬嵌入的第三方组件,而是融合成了产品本身的一部分。
![]()
我让 AI 帮我画出 DeepSeek Harness 的架构图。左侧可以实时看到 AI 工作的过程,右侧显示了一个加载动画。
![]()
生成完成后,右侧立刻渲染出了完整的架构图,分层清晰,而且保留了 draw.io 原本的元素编辑能力,可以直接拖拽和修改。
![]()
更强的是,网站支持连续对话修改。比如我说「帮我把 Harness 服务层这块的背景改为红色」,AI 就能精准定位到对应的元素并修改样式,右侧画布也会实时更新。
![]()
不过偶尔也会出现 AI 生成的 XML 跟 draw.io 不兼容的情况,弹出解析错误的提示。之前我用 Kimi K3 跑同一个案例的时候也遇到过类似的问题,这估计是目前 AI 生成结构化代码时的通病了。
![]()
看了 GLM-5.3-Flash 生成的效果后,再跟之前在 DeepSeek Harness 里测试的其他模型对比一下。
之前 GLM-5.3 做的版本界面科技感最强,把 draw.io 深度融合到了自己设计的界面中,生成的架构图分层清晰,连续对话修改也很顺畅:
![]()
DeepSeek V4 Pro 的版本虽然功能跑通了,但整体界面粗糙,draw.io 是直接整个嵌入的,给人的感觉很生硬:
![]()
Kimi K3 的版本前端设计挺好看,draw.io 的融合度也不错,但后端偶尔翻车,会直接把 XML 源码糊在界面上而不是渲染成图形。
![]()
综合来看,GLM-5.3-Flash 这次的前端效果比 GLM-5.3 和 Kimi K3 略逊一筹,主要体现在界面精致度上。
后端能力比 GLM-5.3 弱了一些,偶尔会出现 XML 不兼容的情况,跟 Kimi K3 的水平差不多。但综合效果明显超过 DeepSeek V4 Pro,毕竟 draw.io 的集成方式和整体产品设计意识都好了不止一个档次。
实战 3、3D 联机对战游戏
最后一个任务我想测的是 GLM-5.3-Flash 的多模态综合理解能力和长程工程能力。
一方面看它能不能从图片中提取视觉信息并转化成实际的代码产出,另一方面看它能不能在复杂的大项目中稳定运行而不翻车。
最近《牛来》不是很火么?
![]()
于是我让 AI 开发一个 3D 双人联机实时拳击对战游戏《牛来格斗》,致敬拳皇和奥特曼格斗进化系列的经典对战体验。
关键在于,我会提供 6 张《牛来》动画电影的角色原片图片,让 AI 分析这些角色的造型、体态比例和色彩风格,然后把它们还原成游戏中的可选角色。
这个任务对多模态能力的要求非常高,AI 不仅要理解格斗游戏的玩法机制,还得从图片中提取视觉信息并转化成 3D 角色建模。
![]()
AI 拿到 6 张参考图之后,通过联网搜索获取了拳皇和街霸的核心机制,然后分析参考图确定了 4 个可选角色的方案:
![]()
整个 ZCode 的开发体验还是很丝滑的。AI 自己就能打开内嵌浏览器,操作页面然后截图验证效果,发现问题就自己修复,不需要我做任何干预。
![]()
苦苦等待了 2 个多小时,AI 终于完成了任务。总共经历了 4 轮完整的开发 - 验证循环,长程任务没有翻车。
我已经开始期待成品了……
![]()
打开游戏主页,《牛来》那股抽象的味儿扑面而来~
![]()
试试人机练习模式,先选择你的斗士。这 4 个角色的 3D 建模我觉得还不错,金黄色的牛麻麻、橙色的小牛来、斑点金钱豹、棕色的牛霸霸,跟我给的参考图还是挺像的吧?
![]()
开始对战!
角色的出招方式很丰富,轻拳、重拳、轻踢、重踢、防御、闪避一应俱全。
看我豹拉一脚把牛来踹了个跟头,打的牛来叫「妈妈」:
![]()
就你欺负我儿子牛来是吧?
牛麻麻亲自下场,先给你来一连串牛家拳,15 连击!
![]()
还可以释放必杀技,蛮牛冲撞!特效还可以,打击感十足~
![]()
每个角色的必杀技风格都不一样,小牛来的必杀是「飞天小牛弹」,会把对手轰出画面,动画效果很流畅:
![]()
再试一下局域网联机功能。虽然能够正常加入房间开局,但双方的画面并没有实时同步。说明 GLM-5.3-Flash 在处理复杂的实时网络同步逻辑上还有一些不足。这也算是意料之中的事,WebSocket 状态同步本来就是后端最难搞的场景之一。
![]()
但游戏单机对战的体验确实超出了我的预期。一个 AI 从 6 张图片出发,自己搜索格斗游戏的设计规范,自己分析角色造型转化成 3D 建模,最后做出一个有连招系统、必杀技特效、完整 UI 流程的格斗游戏,整个过程不需要人工干预。
视觉理解能力对 AI 编程的加持,在这个测评中体现得淋漓尽致。
我的感受
三个项目都跑完了,聊聊我的真实感受。
这次 GLM-5.3-Flash 最大的亮点毫无疑问是视觉理解能力。之前测试 DeepSeek V4 Pro 和 GLM-5.3 的时候,前端效果好不好看、布局有没有错位,模型完全判断不了,只能靠人工验收或者 Playwright 做一些基础的文字化断言。
现在 GLM-5.3-Flash 能自己截图验证了,整个开发体验完全不一样。复刻 Apple 产品页的时候 AI 做了 12 轮截图对比,开发格斗游戏的时候 AI 通过截图抓到了一个纯代码审查根本发现不了的视觉 Bug。这种「写完代码自己看一眼效果」的能力,对 AI 编程来说真的是质的提升。
除了模型能力之外,大家最关心的肯定还是性价比。我开通了 GLM Coding Plan 的 Pro 套餐,三个项目跑完之后看了一下使用统计,5 小时额度才花了 40% 左右,这周才花了 8% 的额度。
![]()
换算一下,GLM-5.3-Flash 相比 GLM-5.3 额度翻了 3 倍,而且非高峰时段(包括周末全天)积分消耗减半。按照 Pro 套餐的周额度和我实际消耗的比例来算,跑完这 3 个项目的成本才不到 10 块钱。而且我测的项目复杂度都不低,如果你只是日常写点小工具、做个页面的话,一周的额度根本用不完。
![]()
相比之下,DeepSeek 八月份全面提价之后,同样的任务量如果用 V4 Pro 来跑,估计要花几十块,V4 Flash 来跑也要花 20 多块,差距一目了然。
此外,智谱也学会 Codex 那一套了,GLM-5.3-Flash 发布当天直接重置了所有用户的使用限额。对用户来说这当然是好事,白票一波新模型的机会,说不定以后有事儿没事儿就能重置一波呢?
![]()
不过 GLM-5.3-Flash 的能力上限肯定是比不过 GLM-5.3 这个旗舰模型的。在 AI 绘图工具的横评里能明显看出,GLM-5.3 做出来的产品可用性和精细度还是更高一截。
GLM-5.3-Flash 的定位是 日常好用、高性价比的牛马模型,大部分任务它都能胜任,偶尔遇到需要极致效果的场景再切换到旗舰模型就好。
综上,我单方面不负任何责任地宣布,DeepSeek 的排名又下降了一位。
![]()
为了让更多新朋友能 0 成本上手体验 GLM-5.3-Flash,我帮大家申请到了一批 GLM Coding Plan 7 天体验卡(从未订阅过套餐的用户可领取): 接下来一周,每天限量发放 10,000 张。同时,智谱官方也已重置所有套餐用户账号内的体验卡数量,欢迎分享安利给你的更多朋友。
自取 : https://bigmodel.cn/activity/trial-card/PU9MTWG0PM
OK 就分享到这里,本文会收录到我免费开源的 ,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。
![]()
鱼皮的 AI 编程教程
我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~
也欢迎在评论区分享你自己使用 GLM-5.3-Flash 模型的体验。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.