Z.ai 公布了一项内部实验:让 GLM-5.3 驱动的 Infra Agent 去设计、调试并优化 GLM-5.3-Flash 的生产推理基础设施。这套基础设施覆盖 100,000+ 中国芯片。
结果出现在不到两周内——吞吐量达到初始基线的 3 倍。硬件效率和单 token 成本,据称与主流 Nvidia GPU 相当。
![]()
模型改自己的跑道
这件事的特殊之处在于对象。Infra Agent 优化的不是别人的系统,而是运行它自己这一代模型推理的那套基础设施。Z.ai 团队把这种模式称为"递归自我改进"——模型改进运行自身的基础设施。
换句话说,被优化的对象和优化的工具,来自同一个模型家族。GLM-5.3 负责决策,GLM-5.3-Flash 是被服务的推理目标。
两周与10万颗芯片
两个数字值得单独看。一个是时间:不到两周。另一个是规模:100,000+ 中国芯片。在这套国产硬件组合上,团队给出的对标对象是主流 Nvidia GPU,比较维度是硬件效率和单 token 成本。
Z.ai 没有披露具体的芯片型号、Agent 的决策过程,也没有给出成本对比的原始数据。目前公开的只有结论本身。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.