8月27日,摩尔线程官宣基于MTT S5000智算卡及MUSA软件栈,完成成对智谱多模态模型GLM-5.3-Flash的Day-0适配。针对其线性注意力采用的KDA机制,研发团队基于MATE算子优化引擎完成定制算子调优,并与SGLang-MUSA缓存体系打通。此举将传统KV Cache转化为状态矩阵的增量更新,大幅缓解了长上下文推理的显存压力,实现该模型在国产算力平台的高效运行。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.