网易首页 > 网易号 > 正文 申请入驻

10万颗国产卡,两周跑通:GLM开始优化自己

0
分享至

两周时间,10万颗国产AI加速器,一个开始优化自己的模型。

智谱GLM首席科学家唐杰在X平台分享了一项关于GLM-5.3-Flash推理系统优化的研究。从这款模型首次运行在国产AI加速器上,到完成全部生产流量承载,只用了两周。系统端到端吞吐能力提升了3.2倍


让唐杰印象深刻的不是数字本身。完成大量优化工作的,除了基础设施工程师,还有一个由GLM-5.3驱动的Infra Agent。他这样描述这一变化:「一个帮助优化服务自身的模型。」

在他看来,这意味着AI开始参与优化承载自身运行的系统。距离真正意义上的递归自我改进(Recursive Self-Improvement,RSI)仍然很远,但一种早期形态已经出现。

从代码漏洞到构建AI系统

过去一年里,智谱团队观察到GLM的角色在发生变化。最初,团队探索GLM在代码理解和网络安全领域的能力,希望让模型帮助分析复杂代码中的漏洞。随着模型能力提升,GLM开始参与构建AI系统本身。

团队表示,他们曾观察到模型完成一些过去需要资深基础设施工程师团队花费数周才能完成的任务,而这些工作又会直接影响下一代模型训练和部署方式。

把一个大模型从新硬件上的首次运行,推进到能够稳定承载生产请求的推理服务,需要大量系统工程工作。GLM-5.3-Flash此次部署运行在超过10万颗国产AI加速器组成的集群上。智谱团队表示,这是一次此前缺少成熟经验参考的大规模部署。

团队需要解决的问题包括:

  • 国产芯片显存容量和互联带宽限制
  • 新模型架构适配
  • 100万token长上下文支持
  • 多模态请求处理

与此同时,国产AI加速器的软件生态仍处于发展阶段,部分Kernel支持不足,很多资料需要工程团队自行探索。

唐杰表示,在这些限制条件下,GLM-5.3驱动的Infra Agent参与了推理系统优化过程,帮助分析性能瓶颈、提出优化方案,并完成部分代码修改。整个优化过程不是简单增加计算资源,而是在算力、内存、通信和调度之间寻找新的平衡。

智谱团队采用了一系列优化方案。通过ReplaySSM用计算换取内存空间,通过节点内张量并行降低显存压力,通过INT8、FP8、BF16混合精度缓存提高容量利用率,同时引入Encode-Prefill-Decode(EPD)分离式架构,让不同推理阶段能够更加灵活地调度。

最终,GLM-5.3-Flash的端到端服务性能相比初始版本提升约3倍,硬件利用率和单token成本达到接近主流NVIDIA GPU平台的水平。

部署完成后,GLM-5.3-Flash还进入真实使用环境测试。智谱团队介绍,该模型曾以匿名模型名Ox-Alpha运行在OpenCode和OpenRouter平台,一周内成为两个平台使用量最高的模型之一,六天处理超过62万亿token

瓶颈不在写代码,在判断为什么变差

这次实验真正的变化,不只是让AI写代码,而是让AI能够理解复杂系统为什么出现性能变化。

唐杰提到,Infra Agent遇到困难时,很少是因为无法编写代码,而是无法判断「为什么结果变差」。当系统反馈「吞吐下降20%」时,它只能说明某个地方出现异常,却无法直接告诉Agent哪一层出了问题,当前假设是否错误,以及下一步应该验证什么。

对于资深工程师来说,这类判断依赖长期经验。工程师知道什么时候查看执行时间线,什么时候运行微基准测试,以及应该比较哪个模块的输出。

智谱团队希望把这种工程经验转化为AI可以调用的反馈机制,并将其称为「dense feedback」。这套机制的核心,是让Agent获得更加接近工程判断过程的信息:需要确认计算是否正确时,可以获得对应的正确性反馈;需要分析性能下降原因时,可以查看系统运行过程中的时间消耗;尝试新的优化方案时,可以通过实验判断该方案是否适用于当前场景。

智谱团队认为,真正有效的反馈需要满足几个条件——必须足够接近具体问题,能够快速获得,同时能够通过客观实验验证。否则,大量日志和指标反而可能让Agent难以判断下一步行动方向。

在dense feedback的帮助下,Infra Agent开始参与定位推理系统中的隐藏问题。

在KDA的上下文并行路径中,Agent发现了一个影响长上下文计算精度的问题。由于不同上下文分片之间需要不断合并状态矩阵,TF32计算产生的舍入误差会随着序列长度增加不断累积,最终导致计算结果偏差。Agent通过比较不同执行路径的结果,将问题定位到状态传播和合并过程中的精度处理。相关修复已经合并到Flash Linear Attention项目PR #1180。

另一个问题出现在KV Transfer与DeepEP调度之间。测试过程中,Agent发现KV Transfer没有与DeepEP Dispatch形成有效重叠,导致部分场景下传输开销超过30%。随后,Agent沿着Python与C++调用链继续分析,发现节点内路径没有及时释放Python GIL,使传输任务无法及时推进。完成修改后,KV Transfer带来的额外开销从超过30%降低到1%以下

此外,Agent还优化了一个Decode Kernel。它发现,由于Kernel切分方式的问题,同一组归一化计算被重复执行四次。通过重新组织计算结构,减少重复计算,该Kernel最终获得1.71倍性能提升。

这一优化思路来自Agent对SGLang、Flash Linear Attention和DeepGEMM等项目现有Kernel的学习。它将这些代码中的优化经验提炼成「optimization skeleton」,再结合当前系统反馈判断是否适用。

过去,类似优化经验主要依赖工程师个人积累。而在这一过程中,Agent开始能够从已有代码中学习优化方法,再通过实验验证这些方法是否适合新的硬件和模型环境。

模型优化系统,系统服务模型

唐杰表示,人类工程师仍然负责设定目标、搭建反馈环境,以及审核高风险修改。但工程师的角色正在变化,从直接解决每一个问题的人,逐渐转向设计反馈系统的人。

智谱团队认为,建立在真实基础设施任务上的可验证反馈环境,可能也是训练下一代模型的重要基础。每一次Agent完成工程任务,都可能成为下一代模型学习的数据。

目前,GLM-5.3-Flash的案例距离真正意义上的递归自我改进仍然存在距离。但唐杰认为,一个最小规模的循环已经出现。

模型优化系统,而系统服务模型。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1991年,他一年时间相继杀害41人,尸体全部埋在自家后院地窖

1991年,他一年时间相继杀害41人,尸体全部埋在自家后院地窖

法网恢恢
2026-08-30 22:09:03
印度耕地27亿亩,年产3.7亿吨粮食,我国耕地19.18亿亩,年产多少

印度耕地27亿亩,年产3.7亿吨粮食,我国耕地19.18亿亩,年产多少

抽象派大师
2026-09-17 14:15:46
“诺奖风向标”!中国科学院院士薛其坤获奖

“诺奖风向标”!中国科学院院士薛其坤获奖

化学人生
2026-09-18 22:05:10
地铁车厢,一女子将手插入男子裤内,殊不知,这是博流量的摆拍

地铁车厢,一女子将手插入男子裤内,殊不知,这是博流量的摆拍

四海神君
2026-09-06 15:30:09
《交锋》大结局:郑桂平,用笑掩饰真相,看似笑面虎实则是我方最强卧底!

《交锋》大结局:郑桂平,用笑掩饰真相,看似笑面虎实则是我方最强卧底!

肆季娱乐
2026-09-17 17:57:32
频繁走光副乳外露,为了出圈博眼球,连最基本的体面都不要了?

频繁走光副乳外露,为了出圈博眼球,连最基本的体面都不要了?

可乐谈情感
2026-09-18 08:44:39
美国有点慌了?中国AI仅用5%的GPU,达到了美国AI同等能力

美国有点慌了?中国AI仅用5%的GPU,达到了美国AI同等能力

互联网.乱侃秀
2026-09-17 13:47:17
湖北省和武汉市联合调查组通报长江倾倒淤泥事件

湖北省和武汉市联合调查组通报长江倾倒淤泥事件

新京报
2026-09-18 19:55:11
新西兰华人老板当街脱衣,跪地磕头“求放过”!“几十人的饭碗被砸了!”

新西兰华人老板当街脱衣,跪地磕头“求放过”!“几十人的饭碗被砸了!”

发现新西兰
2026-09-17 13:07:02
邮储前高管受贿案:二审突现留置期间《自绝书》与无罪供述,家属发三千封控告信

邮储前高管受贿案:二审突现留置期间《自绝书》与无罪供述,家属发三千封控告信

法治边角料
2026-09-18 18:05:26
12:2!美国正式加息,特朗普付出惨痛代价,中方拒签新广场协议

12:2!美国正式加息,特朗普付出惨痛代价,中方拒签新广场协议

说故事的阿袭
2026-09-18 10:27:33
中国运动员被困日本机场!干坐6小时又累又饿,日本做法太没品

中国运动员被困日本机场!干坐6小时又累又饿,日本做法太没品

吃青菜长高
2026-09-17 18:09:19
忍无可忍无需再忍!一场恶仗正在逼近中国,东大不必再继续退让了

忍无可忍无需再忍!一场恶仗正在逼近中国,东大不必再继续退让了

温一壶皎月
2026-09-16 15:18:37
女学霸发明“咯噔字体”,老师低分警告:别用个性挑战考试底线

女学霸发明“咯噔字体”,老师低分警告:别用个性挑战考试底线

蝴蝶花雨话教育
2026-05-07 00:05:04
iPhone18Pro今日开售!广州天环广场大排长龙!现场人山人海...

iPhone18Pro今日开售!广州天环广场大排长龙!现场人山人海...

广州笋嘢益街坊
2026-09-18 16:42:04
离队倒计时!克内克特,会被湖人放弃吗?

离队倒计时!克内克特,会被湖人放弃吗?

篮球实录
2026-09-19 02:19:32
河南固始一村民在菜地烧1平米杂草被罚500元?当地通报

河南固始一村民在菜地烧1平米杂草被罚500元?当地通报

界面新闻
2026-09-18 18:31:20
高盛预测2050年GDP:美国37万亿美元,印度22万亿,中国是多少呢

高盛预测2050年GDP:美国37万亿美元,印度22万亿,中国是多少呢

观史搜寻着
2026-09-04 19:27:25
《兰香如故》第15-16集预告:林锦岐对许兰香开始有点暧昧了,李医士出诊发现了异样

《兰香如故》第15-16集预告:林锦岐对许兰香开始有点暧昧了,李医士出诊发现了异样

两年的海
2026-09-16 08:36:05
狱友问我怎么进来的,我:贪10个亿。狱警上来就是一脚:装什么

狱友问我怎么进来的,我:贪10个亿。狱警上来就是一脚:装什么

悬案解密档案
2026-02-26 15:34:48
2026-09-19 03:11:00
报错免疫体
报错免疫体
一名在需求评审和数据异常中反复横跳的产品运营。
311文章数 67关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

艺术
本地
家居
数码
公开课

艺术要闻

好色也分段位?这位时尚摄影大师,直接杀进王者局!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

Realforce静电容键盘GX1 Plus皮卡丘版亮相TGS2026

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版