将Qwen3.5-397B这类混合专家(MoE)模型部署到专用硬件加速器上,并实现高效服务,是一项艰巨的系统工程挑战。将约400GB的权重载入高带宽内存(HBM),并最大化硬件利用率,需要遵循严谨的第一性原理工程方法论,而非依赖经验性的试错式修改。 关键在于,随着开放权重模型生态日趋复杂,工程团队再也无法投入数月时间,针对每个新模型家族进行孤立的调优。为了攻克这一规模化难题,性能团队开创了一种模块化、与具体模型无关的优化策略。团队不再将模型视为一个整体系统,而是将其分解为相互独立、自包含的构建模块(例如Batched RPA、Grouped GEMMs和SparseCore unpermutation),并配以硬件感知的成本模型。当新架构出现时,这些预优化模块几乎可以零工程摩擦地移植复用。这使得工程师能够远早于初期规划交付业界领先的服务性能,将工作重心从局部模型优化转向全局、平台级的可扩展性。 本技术报告详细阐述了如何将这一全局优化方法论系统性地应用于Ironwood(TPU v7x)平台上的Qwen 3.5 MoE模型。通过复用自研的JAX/Pallas内核库,并精准聚焦于Qwen 3.5的创新型组件——如Gated DeltaNet(GDN)线性注意力机制和注意力数据并行(Attention Data Parallelism)——团队在解码密集型(decode-heavy)和预填充密集型(prefill-heavy)工作负载上均取得了显著的性能提升。 文中所讨论的优化举措,使团队在2026年4月至6月期间,将解码密集型工作负载的推理性能提升了约3.1倍,预填充密集型工作负载(512并发层级)的推理性能提升了约4.7倍。此外,通过将这些模块化优化原生集成到vLLM和SGLang等开源服务框架中,团队已经化解了大型MoE服务场景中典型的性能瓶颈,使高性能推理不再受制于模型规模的复杂工程负担。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.