智谱正式发布并开源原生多模态模型 GLM-5.3-Flash,参数量达到 320B。该模型在 AA 综合智能指数中取得 57 分,能力与 Claude Opus 4.8 持平。作为 GLM-5 系列首个原生多模态模型,其架构专为极低成本而设计,结合智谱最新的 30T Token 多模态预训练语料,能够以更少的计算资源实现更强的性能。
国产算力支撑大规模商用落地
![]()
此次发布的一个关键变化在于,商汤大装置为 GLM-5.3-Flash 提供了大规模国产算力支持。模型在发布前通过匿名测试处理了 62T Token 流量,全部由国产芯片支持。这一过程验证了国产算力在真实业务场景下的可靠性,也意味着前沿大模型的大规模商用不再必须依赖英伟达 GPU。
商汤大装置目前日均 Token 服务量已达 2.42 万亿,并计划年底突破 10 万亿。其背后是一套“Token 工厂”体系:一套模型、一座 Token 工厂、一套智能体管控系统。通过这套体系,商汤试图解决国产算力在性价比、适配性与能效比方面的长期痛点。
异构混推技术改变性价比逻辑
商汤大装置没有走单卡性能比拼的传统路线,而是采用异构混合推理技术,根据计算与带宽需求协同不同架构的国产芯片。实测数据显示,GLM-5.3-Flash 在国产芯片集群上的端到端服务性能较基线提升 3 倍,硬件效率和单 Token 成本已达到主流英伟达 GPU 相当水平。
更值得关注的是推理性价比。在相同硬件环境下,GLM-5.3-Flash 基于国产芯片集群的整体推理性价比达到 NVIDIA H 系列的 1.25 倍。这意味着国产算力不再只是“能用”,而是在特定场景下开始具备成本优势。
国产算力进入前沿模型供应链
GLM-5.3-Flash 的发布提供了一个可复用的样本:前沿模型训练完成后,推理环节可以完整跑在国产芯片集群上,并且性能与成本均达到商用标准。对于正在寻找英伟达替代方案的 AI 基础设施团队来说,这组数据比单纯的芯片参数更有参考价值。
从 62T Token 匿名测试到日均 2.42 万亿 Token 服务量,商汤大装置展示的是规模化供给能力,而非实验室环境下的单点突破。当国产算力能够支撑 320B 参数模型的大规模商用,AI 基础设施的供应链选择正在出现新的可能性。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.