你好,我是蔚公子,毕业ALL in AI,专注于 AI 提效/企业赋能/教育
点击关注我,
分享真正能落地的AI方案,让企业和个人把AI用好
这两天 AI 圈突然冒出来一头牛。
事情是这样的,8月20号,OpenRouter 上悄悄上线了一个匿名模型,叫 Ox-Alpha,没说是谁家的,也没公布任何身份,就这么免费开放给大家用。
中文社区看它名字里带个 Ox,刚好《牛来》电影那几天爆火,干脆就管它叫牛来了
![]()
结果这一测不要紧,它直接冲到了 OpenRouter 使用榜第一,调用量是 DeepSeek 的两倍还多。
一个连爹妈都不知道是谁的模型,冲到了榜首,那全网当然就开始猜了,这到底是哪家憋的大招
答案很快揭晓了,8 月 26 号晚上,智谱正式发布并开源了 GLM-5.3-Flash,亲口承认牛来就是它。
![]()
而且它还不是把前不久那个 GLM-5.3 做了个轻量版这么简单。
恰恰相反,官方明确说了,这是重新训练的基础模型,不是旗舰的蒸馏版。它是 GLM-5 系列第一个原生多模态模型,总参数 3200 亿,但每次推理只激活 180 亿,支持 100 万 Token 上下文,文本图片视频都能直接处理,而且权重是按 MIT 协议全开源的。
性能上它也没让人失望。在 Artificial Analysis 那个智能指数上拿了 57 分,跟 Claude Opus 4.8 打平,智谱自己的 Code Bench 上编程表现也到了跟 Opus 4.8 相当的水平。
![]()
不过这些还不是最离谱的。真正让人瞪眼的是价格。
按官方的说法,它的定价只有 GLM-5.3 的十分之一,发布期还有五折,折下来大概是二十分之一,差不多是 Claude Opus 4.8 的四十分之一。
![]()
那为什么能压这么低呢?
主要是这次架构重做了。它第一次把线性注意力和稀疏注意力混在一起用,官方给的数据是注意力计算量降了大约三倍,KV Cache 降了大约四点四倍。
还有个挺有分量的细节。牛来匿名测试那阵子烧掉的超过20万亿 Token,全部是跑在国产 AI 芯片集群上的。
所以纸面上这东西已经很好总结了,前沿模型的能力,Flash 模型的成本。
一、但我真正想测的,不是这些跑分
因为这次它最不一样的地方,是把视觉真正塞进了 Agent 的干活循环里。
以前的多模态,很多时候还停留在你给它一张图,它告诉你图里有什么。这次不一样了,它是先看懂一个现成的东西,从结果反推出背后的逻辑,然后自己重新做一个出来。
你品品这两件事的差别。前一件它只是个看图工具,后一件它已经能拿眼睛去干活了。
说白了,图片、视频、录屏这些原本只是给人看的东西,现在本身就能当成 AI 的需求文档了。
所以什么识图、看图做题、总结 PDF 这种基础项目我就不重复测了,我挑了四个野一点的活儿:
从孙宇晨的小作文,到王者荣耀录屏、黄仁勋演讲,反正都是以前你不太会想着直接给扔给AI,让它自己做完的东西。
废话不多说,直接开搞
![]()
二、一篇长文,做成一个能玩的专题网页
这两天孙宇晨那个瓜,想必大家也都吃过了。
那我干脆不聊瓜了,直接拿他那篇小作文当素材,让 AI 重新做一个网页出来,看看能不能做得比小作文本身还有意思。
当然,孙宇晨这篇长文文末标注了“纯属虚构”,下面所有剧情和金额都只按照原文叙事来处理,不代表现实事实。
提示词:
阅读我提供的孙宇晨长文,把它重新制作成一个高完成度、可交互的专题网页。你自己提炼人物关系、时间线、关键事件、名场面和 AI 相关节点,设计信息结构和视觉风格。不要简单把原文堆到网页上,要像真正的媒体深度专题。完成后自己打开网页逐屏检查视觉、交互和内容,有问题自行修改。不要虚构原文不存在的事实。
这个提示词我建议大家仔细看一眼,因为它是这一轮最有杀伤力的地方。
你会发现我压根没提人物关系图,没提答题,没提原文弹窗。些而这些,全是它自己想出来加的。
![]()
说实话,我一开始的预期就是它给我做个还算好看的长页面,把内容排一排就行了。
结果打开的一瞬间,跟我想的完全不是一回事。
它把整个内容拆成了七个板块,从人物到时间线到名场面,一路排到最后的留白,每一块的呈现方式还都不一样。
![]()
开头有一张人物关系图,能点。你点哪个人,跟他相关的线就亮起来,其余的淡下去,下面还会跟着切换出这个人在原文里的引句。这块我觉得有点小问题,节点位置偶尔会挤,但整体是能用的。
再往下是时间线,它把事件按发生顺序排开,每一条都能展开看原文出处。
![]()
中间还有个我完全没想到的板块,它做了一份账单。把文里提到的每一笔支出全列出来了,二十多笔,每笔标了名目、金额,还标了状态,已付的绿色,没付的红色,不退的黄色。上面还能按状态筛。
![]()
后面还有名场面、金句墙这些。
![]()
让我意外的是它还塞了一个答题环节。看完之后它出了几道选择题考你,问的都是文里的细节,比如当时那个放映厅到底坐了多少人。答完还给你打分。
这个是真没想到,因为我提示词里一个字都没提测验。
@=https://v.qq.com/x/page/m32965uzmy1.html@@
不过整个网页里最让我起鸡皮疙瘩的,是另外一块。
它做了一个叫机器的答案的板块,一开始那儿是空的,就一个按钮摆在那。我点下去,那段对话居然一行一行往外打,就跟正在聊天一样,我说一句,Claude 回一句,我再说一句,它再回一句
@=https://v.qq.com/x/page/a3296xge0h1.html@@
我是天天用 AI 的人,这里面每句话我都清楚是怎么回事。
可它用这种方式一行行打出来的那一刻,我是真的卧槽了一声。那一下我整个人就代入进去了。
![]()
整体设计我觉得挺高级的,暗黑风格跟这篇文章的调性也对得上。
你要说它完美,那肯定谈不上。最明显的问题是通篇还是文字为主,视觉表达上还有不少进步空间。
但说实话,这一下确实有点猛了。
三、一堆二创素材,让它自己对照着剪
第二个我把难度往上抬了一档。
因为这两天除了小作文本身,网友的创造力才是真的翻天了。各种梗图、各种二创、AI 漫剧、AI 短剧,一晚上全冒出来了。
![]()
那我干脆把这些二创素材找来一堆,图片视频一起扔给它,先让它自己判断每个素材到底对应原文的哪一段。
提示词:
同时阅读原文并分析我提供的所有图片和视频。先判断每个二创素材对应原文中的哪个情节,并找出具体依据;无法在原文找到依据的内容明确标记为二创发挥或无法确认。然后从这些素材中挑选最有代表性的内容,重新剪成一条 60 到 90 秒的名场面合集,你自己决定顺序、节奏、字幕和说明,并输出最终成片。
它确实是老老实实读完了,然后逐个做了拆解。
![]()
而且有两个动作是我没要求它做的。
一个是它在每张章节卡上都标了原文出处,精确到第几页。另一个更有意思,有张换脸图它专门把人脸裁出来跟原图做了比对,最后给的结论是这不是孙宇晨本人。
对于在原文里找不到依据的,它也照我说的老实标了二创发挥。
@=https://v.qq.com/x/page/w3296li8l8d.html@@
问题也有两个。
那张换脸图它只排除了不是本人,到底是谁它没看出来。
另外我上传的那些素材本身就有点糊,所以最后成片的清晰度也一般。剪辑本身我觉得只能算还可以,谈不上多好
四、一段实机录屏,让它重做一个游戏
这个是我最好奇的一个,因为它已经不只是看懂,是要从画面里反推出一整套规则。
我给的素材是一段王者荣耀的实机录屏,三十秒。
![]()
提示词:
只根据这段实机视频,先自行推断游戏的核心玩法、移动方式、战斗规则、地图机制、敌我单位、失败条件和胜利条件。然后不要照搬原作 IP、美术和角色,重新设计一个不同主题、但保留核心玩法的可玩游戏。要求真正能够操作和完成一局。完成后自己试玩、检查并修复问题。
结果它真给我做出来一个。
开局是五秒倒计时,进去之后地图上确实有塔要拆,路上有小兵一波一波往前推。它自己换了个主题,做成了深海生物打机械族,主角是一条会发光的鳐鱼。
![]()
攻击、位移、大招这些都有,玩起来是需要花点时间的,不是点两下就结束。
最让我意外的是野区。它居然真的在地图上放了野怪,而且我是真能去打的,打完还有加成。这个我提示词里没提,是它自己从录屏里看出来的。
![]()
最后我把对面最后一个建筑拆掉,赢了。
@=https://v.qq.com/x/page/t32963r8an6.html@@
说实话,那个味儿已经出来了。
我甚至觉得再往后发展一下,做一个更完整、更难一点的版本都有可能。
问题也很明显。建模还是比较简单,不够精美,玩法也相对单一,跟真正的游戏比还差得远。
但你别忘了,它手上从头到尾就只有一段三十秒的录屏
五、五分钟的演讲,让它自己剪成一分钟
最后这个,说实话是我最迫不及待想测的。
因为咱们做自媒体的都懂,剪辑真的是个心头病。拍摄其实简单,坐下来剪才是最熬人的那一步,你只要真自己剪过就知道有多累。
所以它既然说能剪视频,那我一定得试试。万一这个环节真能交出去,那就有点了不起了。
既然是 AI 领域,那就找个 AI 领域的大拿。我挑了一段五分钟左右的黄仁勋演讲,直接扔过去,让它自己当剪辑师。
![]()
提示词:
完整看完这段视频,把自己当成专业短视频剪辑师。不要机械做金句合集,而是自己判断最值得传播的核心观点,重新组织成一条约 60 秒、普通人愿意看完的中文短视频。你自行决定开头钩子、片段选择、顺序、删减和节奏,添加准确中文字幕。最终直接输出成片,并保留选用了哪些原始时间段。
它剪出来了,成片接近一分半。
![]()
这里面有个决定我觉得挺关键。原视频讲了六大块内容,它自己判断只留一条主线,把另外三个产品发布整块砍掉了。这是它自己做的取舍,我没给任何指示。
还有一点,原视频底下本来烧了一条机翻的中文字幕,里面有明显的错译。它自己发现了这个问题,直接用黑条把原字幕盖掉,整条重新翻了一遍。
成片我看了一下,感觉还不错。
@=https://v.qq.com/x/page/d3296wig5dv.html@@
要评价的话,我觉得中规中矩。节奏、钩子这些谈不上多惊艳,但它能从五分钟里自己判断该留什么、该扔什么,然后完整剪出来,这个已经挺厉害了。
六、蔚公子的洞察
四个跑完,我想说四点。
第一,模型是真的在变强,而且强的程度超出我的预期。
我说句实话,这四个题目扔出去之前,我心里的预期是能成两个就不错了,另外两个大概率会中途卡住,或者做出来一半跑不动。
结果一个都没卡。
四个全跑完了,而且每一个都是在一小时之内做出来的。
这个我是真没想到。要知道里面有反推游戏规则、有剪长视频,放在半年前,这些活儿别说一小时,你给它一天它都未必能交出个能看的东西。
第二,发力的不只是那几个明星产品。
我们平时聊国产模型,翻来覆去就是那几个名字。但这次智谱这一下,我觉得它是实打实站到了牌桌上的。
而且不只是它。这几家现在都不差,谁都有往上争的资格。这个局面比一家独大健康得多,因为谁也不敢停。
![]()
第三,国产Agent 确实在往前走,但今天还没到那一天。
我这次是在 Z Code 上跑的,整体的丝滑度是可以的,中间基本没怎么让我操心。
但我也得说句公道话,今天离真正好用还是有差距的。
我感觉可能再过一年左右,会是另一番光景,那时候差不多就是人人都在用 Agent 的状态了。但今天还不行,今天你还是得盯着,还是得自己收尾。
不过方向我是不怀疑的,而且国产这一块我觉得会走得不错。
第四,这场浪潮,是真的要来了。
你回头对比一下2025年1 月,DeepSeek 刚出来那一波。当时大家嘴里描绘的那个未来,什么 AI 自己看视频、自己写游戏、自己剪片子,听着都还挺远的。
今天再看这四个活儿,已经很接近当时想象的样子了。
![]()
当然还需要时间,但我相信最后一定会有一个不错的结果。
问题只在于,这里面谁能真正拿到结果。
那就得看谁先动手了
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.