网易首页 > 网易号 > 正文 申请入驻

GLM-5.3更强却未刷屏,股价反跌3.6%

0
分享至

8月14日,智谱发布新一代旗舰模型GLM-5.3。8月19日,API正式开放调用,定价与GLM-5.2持平。从测试结果看,GLM-5.3进步明显,在Artificial Analysis最新综合智能指数中拿到60分,进入全球前沿模型区间,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰处在同一档,并与Kimi K3并列开源模型第一。

但模型能力提升,并没有延续与前代的市场热度。4月GLM-5.1发布时,智谱收盘上涨11.5%;6月GLM-5.2发布,股价又涨了32.8%。但GLM-5.3模型发布当天,智谱股价下跌3.6%。模型发布后的行业讨论度,也远不如此前几次旗舰亮相。模型明明更强了,为什么没有再次成为市场焦点?


这种反差并不意味着GLM-5.3没有变强,而是说明在国产模型密集迭代、能力差距快速收窄的当下,模型跑分领先已经很难让市场兴奋。对智谱来说,更重要的问题是,更强的模型还能带来多大的差异化优势?这种优势又能不能继续转化成产品和收入?

后训练:把已有能力“练深”

GLM-5.3最值得关注的变化,是通过扩大后训练规模,取得了较为明显的成绩提升。简单理解,智谱没有重新训练一个更大的基座模型,而是让现有模型在更复杂、更接近真实工作的环境里反复训练,把已有能力继续“练深”。

大模型研究员曾小健告诉「AIX财经」,预训练更多是在增加模型“读过的东西”,后训练则是在增加模型“做过的事情”。模型不只是继续学习知识,还要进入真实环境做任务、拿到反馈,再根据结果调整自己的做法。

支撑起这轮后训练的,是此前打造的一套训练方式。IndexShare主要降低长上下文的计算成本;SAO让一条任务完成后就可以进入训练,不必等整批任务全部结束;slime框架则把模型执行任务和根据结果更新模型两个环节拆开运行,减少不同任务耗时差异带来的算力闲置。

曾小健举例,假设100个Agent任务里,有80个十分钟就能完成,有15个需要半小时,最后5个却要跑两个小时。传统训练方式会要求这一批任务全部结束后才能进入下一步,先完成的任务也只能干等着最慢的那5个,昂贵的GPU就会闲着。新的框架不再等所有任务一起“交卷”,这样可以减少等待时间,提高算力利用率。

训练效率提高之后,还得有足够多的“题”给模型练。GLM-5.3搭了一套自动生成训练环境的流程。Research Agent负责从真实工作中寻找任务,再由Judge Agent亲自跑一遍,确认任务确实能完成;系统还会检查模型有没有利用评分漏洞抄近路。可以理解为让AI自己出题、试做和验题,再把合格的题目送进训练。

编程能力:从“会做题”到“能干活”

这一套方法的效果首先体现在编程能力上。从基准测试成绩来看,GLM-5.3提升比较明显的项目,大多和长程软件工程、终端操作和自动化任务有关。比如,强调长程软件工程的DeepSWE v1.1,从前代的46.2分提高到66.9分。说明GLM-5.3更能把一项复杂任务从头干到尾。它能够理解一个陌生项目,自己定位问题、调用工具、修改代码,再根据测试结果继续修正。

智谱自己的Code Bench也在强调这一点。这套测试直接把模型放进本地开发环境,任务设置不同难度,在最高难度下,GLM-5.3用平均约7.5万输出Token取得34.5%的成绩,GLM-5.2则需要约9.6万Token,成绩只有23.4%。

曾小健认为,完成率提高、Token消耗反而下降,比单纯的跑分上涨更值得关注,这说明模型学会了更有效地探索,而不是靠堆更长的思考时间换成绩。

独立开发者李然的体验也印证了这种变化。他认为,GLM-5.3相比GLM-5.2进步明显,ZCode的Goal Mode是他感受最深的功能。给定一个目标后,模型会持续推进、检查和验证,直到任务完成,长任务的可靠性比上一代更高。

网络安全:提升超一倍,已发现2436个真实漏洞

另一块提升更加显眼,是网络安全。在考验漏洞利用推理的ExploitBench中,GLM-5.3从前代的24.4%提高到54.4%,提升超过一倍。安全任务要求模型不仅读懂代码,还要继续判断漏洞藏在哪里、怎样触发,对代码理解、工具调用和长程规划的要求更高。

这项能力也已经进入真实项目。智谱官方提到,从GLM-5.2开始,智谱就联合国内多家安全机构,用模型持续寻找真实项目中的漏洞。到GLM-5.3发布时,经过专家复核、筛选和去重,累计发现2436个漏洞,覆盖269个项目,其中1097个属于中高危问题,部分漏洞已经存在数十年。

综合来看,GLM-5.3相对前代的变化在于:编程能力更接近完整工程任务,长任务的稳定性有所提升,网络安全能力的进步幅度尤其明显。

横向对比:第一不少,但差距未拉开

但一款模型有没有竞争优势,还得放到同期对手中看。我们选择阿里、月之暗面和深度求索的最新旗舰模型作为参照,一方面因为这几款模型都在近期迎来更新,另一方面,Coding、Agent和长程任务也是它们共同投入的重点方向。

单从成绩来看,GLM-5.3的确拿到了不少第一,其中网络安全的优势最明显;Coding和长程Agent也已经进入第一梯队,但和Kimi K3、DeepSeek V4 Pro相比,没有形成明显差距。

再看各家手里的牌。DeepSeek V4 Pro仍有综合能力和价格优势;Kimi K3在长程软件工程上与GLM-5.3几乎贴身竞争,同时拥有原生多模态,能力覆盖更完整;Qwen3.8-Max虽然部分跑分不占优,但背靠阿里生态,在企业工作流和应用落地上更有基础。

所以,GLM-5.3确实更强了,但还没有形成让同期国产旗舰模型短期难以追赶的优势。

为什么没刷屏?升级方向“专业”且与用户期待错位

那么,为什么GLM-5.3的能力提升没有带来同等规模的传播?

一个直接原因,是它选择的升级方向相对“专业”。这轮更新主要升级的两个方向,一个是编程能力,主要服务开发者;另一个是网络安全能力,受众主要是安全研究人员和企业客户。能力都实用,但受众也相对集中。

这和GLM-5.3发布前的用户期待存在错位。此前智谱创始人唐杰在X上征集用户对新模型的期待,视觉、多模态能力是呼声较高的方向。原因并不难理解,现在越来越多的Agent任务已经不只是处理文字。做网页要看截图,改UI要理解设计稿,分析报告可能包含图表和PDF,甚至写代码时也经常需要根据页面效果继续调整。

李然提到,不少开发任务其实很难完全用语言描述清楚,尤其是页面设计和创意编码。有了视觉能力后,模型能直接“看结果”,就不用反复把需求翻译成文字。在他的实际使用中,GLM-5.3目前还缺少视觉能力,这在一定程度上限制了它在更广泛场景中的适用性。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
有钱人太多!成都断供10年的二环别墅,卖爆了!

有钱人太多!成都断供10年的二环别墅,卖爆了!

楼市灭霸
2026-08-22 13:37:12
试拍:大批歼-16降落巴基斯坦

试拍:大批歼-16降落巴基斯坦

烽火观天下
2026-08-22 12:09:12
未来乒坛的顶级男单宝座,会被以下五人持续统治!但关键弱点都可能成为下一个翻盘契机

未来乒坛的顶级男单宝座,会被以下五人持续统治!但关键弱点都可能成为下一个翻盘契机

林子说事
2026-08-22 08:47:18
香港著名演员新片惨败,上映多时票房只有2600元,5000万成本打水漂了

香港著名演员新片惨败,上映多时票房只有2600元,5000万成本打水漂了

影视高原说
2026-08-21 14:29:53
用竹子代替钢筋,浇灌的混凝土到底有没有用?真的能住人吗?

用竹子代替钢筋,浇灌的混凝土到底有没有用?真的能住人吗?

抽象派大师
2026-08-19 22:26:11
《欢迎来龙餐馆》外网炸锅!未在海外公映为何伊拉克网友集体不满?内地破12亿

《欢迎来龙餐馆》外网炸锅!未在海外公映为何伊拉克网友集体不满?内地破12亿

小椰的奶奶
2026-08-21 10:49:30
“欧洲不仅落后中国,现在连美国都要追不上了”

“欧洲不仅落后中国,现在连美国都要追不上了”

观察者网
2026-08-22 19:58:25
从"查无此人"到"火线驰援",赵睿只用一天!郭士强你慌不慌?

从"查无此人"到"火线驰援",赵睿只用一天!郭士强你慌不慌?

贵州小娟
2026-08-22 14:28:44
摊上千万英镑诉讼费,哈里梅根打算卖房填窟窿:梅根新剧本色出演,拍摄地在查尔斯隔壁...

摊上千万英镑诉讼费,哈里梅根打算卖房填窟窿:梅根新剧本色出演,拍摄地在查尔斯隔壁...

悦居英国
2026-08-22 20:40:07
曝奥萨尔与活塞谈崩!走杜伦老路五年2.5亿成空?活塞第2巨被小觑

曝奥萨尔与活塞谈崩!走杜伦老路五年2.5亿成空?活塞第2巨被小觑

林木体育解说
2026-08-22 20:05:02
“长得不好看,真考不上!”老师劝退视频火了,说得已经很委婉了

“长得不好看,真考不上!”老师劝退视频火了,说得已经很委婉了

泽泽先生
2026-08-20 15:35:06
“他的智商已经不是普通人了”,宝妈公开厌恶天才儿子:只想揍他

“他的智商已经不是普通人了”,宝妈公开厌恶天才儿子:只想揍他

泽泽先生
2026-08-06 11:01:17
五周年无庆典:塔利班"削藩"第一战,打碎了自己人的江山

五周年无庆典:塔利班"削藩"第一战,打碎了自己人的江山

民间胡扯老哥
2026-08-20 07:07:52
8月22日WTA战报,决赛对阵出炉,世界第十惨败,高芙太稳了

8月22日WTA战报,决赛对阵出炉,世界第十惨败,高芙太稳了

南海浪花
2026-08-22 11:41:43
谷歌突然“脱中”!2027年起所有Pixel彻底告别中国制造

谷歌突然“脱中”!2027年起所有Pixel彻底告别中国制造

叮当当科技
2026-08-22 04:27:29
魏祥鑫落选首轮名单,欧塞尔副总经理:他太疲劳了,状态不好

魏祥鑫落选首轮名单,欧塞尔副总经理:他太疲劳了,状态不好

懂球帝
2026-08-22 12:03:43
这一刀捅得真狠!C919刚完成海外首飞,美国就一招“锁”了我们脖子

这一刀捅得真狠!C919刚完成海外首飞,美国就一招“锁”了我们脖子

大卫聊科技
2026-08-22 13:02:11
许家印判无期,他在里面可以干啥

许家印判无期,他在里面可以干啥

风马驿
2026-08-21 07:00:05
当D+级轿车卖到24.99万,BBA的“护城河”还剩什么?

当D+级轿车卖到24.99万,BBA的“护城河”还剩什么?

EV世纪
2026-08-21 21:34:22
荣蓉现状:57岁住上海超大豪宅,俩女儿才貌双全,老公身份不简单

荣蓉现状:57岁住上海超大豪宅,俩女儿才貌双全,老公身份不简单

神颜贩卖机
2026-08-21 16:55:57
2026-08-22 21:43:00
字节漫游指南
字节漫游指南
有态度网友ytd
246文章数 109关注度
往期回顾 全部

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

头条要闻

"高铁零食占座"女孩母亲:没请到假 儿童不能单独购票

头条要闻

"高铁零食占座"女孩母亲:没请到假 儿童不能单独购票

体育要闻

枪手赚翻!4000万新援揭幕战8分钟策动2球

娱乐要闻

《空枪》预测票房缩水,手握王炸都没赢

科技要闻

苹果裁员200人:Vision Pro砍游戏团队

汽车要闻

最能代表东方神韵的新旗舰 体验面子里子都拉满的比亚迪大汉

态度原创

艺术
房产
亲子
家居
数码

艺术要闻

248米!白鹅潭核心区的第二高楼,效果图曝光!

房产要闻

两大热盘即将入市!三亚又一批安居房狠货要炸场了!

亲子要闻

号称适合婴幼儿的“宝宝水”火了,泡奶一年额外花销超两千元,专家:伪概念

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

雷神24.5英寸2K 360Hz银翼Pro显示器上市:1349元

无障碍浏览 进入关怀版