智猩猩AI整理
编辑:BugMaker
大模型参数规模不断增长,但真正部署到终端设备时,一个问题始终存在:
如何让这些模型离开数据中心,直接运行在手机、边缘设备甚至本地GPU上?
近年来,Mixture-of-Experts(MoE,混合专家模型)成为扩大模型规模的重要路线。相比传统稠密模型,MoE每次只激活部分专家,可以用更低计算成本承载更大的参数规模。
但当MoE模型进入边缘设备后,新的瓶颈出现了。
受限于内存容量和带宽,模型推理往往不是算力不足,而是参数搬运太慢。与此同时,推测解码(Speculative Decoding)虽然能够通过提前生成多个token提升速度,但直接应用到MoE模型时,会因为不同token激活不同专家,导致大量冗余专家激活,反而削弱加速效果。
针对这一问题,北京大学人工智能研究所与集成电路学院团队开源了S²-MoE(Efficient Self-Speculative Decoding for Mixture-of-Experts on Edge Devices)。
![]()
团队将自推测解码(Self-Speculative Decoding)与MoE专家路由机制结合,在不改变模型结构的情况下优化推理过程。
实验显示,S²-MoE在多种MoE模型和任务上,相比标准自回归生成最高实现5.3倍加速,平均达到约2倍提升,并且已经集成到开源推理框架llama.cpp中。
02
重新设计推测解码,让MoE模型
减少“冗余计算”
与传统方法不同,S²-MoE没有依赖额外的外部草稿模型,而是利用目标MoE模型自身构建自推测流程,并针对MoE特有的专家路由问题进行了优化。
第一,提出路由感知自适应扩展(Routing-aware Adaptive Speculative Expansion)。
传统方法通常根据token置信度决定是否继续生成候选token(candidate token)。
但在MoE模型里,高置信度并不代表低成本。
因为两个预测结果即使概率接近,也可能触发完全不同的专家组合。
因此,S²-MoE同时考虑候选token被接受的概率以及新增专家带来的验证成本。
系统优先选择“收益高、验证成本低”的候选token,减少无效验证。
第二,提出复用感知专家门控(Reuse-aware Expert Gating)。
MoE模型最大的特点是专家路由。
但推测解码过程中,不同token容易选择不同专家,导致参数访问分散。
S²-MoE通过分析多个候选token的专家选择情况,让部分token更加倾向已经激活的专家,提高专家复用率。
论文中的示例显示,通过这种方式,验证阶段的不必要专家激活可以减少。
![]()
第三,提出上下文对齐自推测解码(Context-aligned Self-speculative Decoding)。
传统自推测解码中,草稿模型和目标模型可能维护不同上下文。
随着生成过程增长,小误差会不断累积,导致预测越来越偏离。
S²-MoE让草稿模型和目标模型共享同一个键值缓存(KV Cache)。
这样草稿阶段不会因为上下文漂移产生长期误差,只需要验证当前预测结果。
论文实验显示,共享上下文后,在部分任务上接受率最高提升79%。
03
从边缘设备到RTX 4090,MoE推理
最高提速5.3倍
为了验证S²-MoE在不同模型上的泛化能力,团队覆盖了DeepSeek-V2-Lite-Chat、OLMoE-1B-7B、Qwen3-30B-A3B和GPT-OSS-120B等多种MoE模型,并分别在Jetson Orin和RTX 4090平台进行测试。
实验结果显示,S²-MoE在Jetson Orin平台上相比标准自回归生成实现1.3×到5.3×加速,在RTX 4090上也达到1.2×到2.9×提升。
相比其他推测解码方案,S²-MoE在不同模型和任务上表现更加稳定。
其中,在Jetson Orin 16GB环境下,部分任务取得更明显加速效果,说明MoE模型在资源受限设备上的部署空间正在进一步扩大。
![]()
除了速度提升,团队还验证了模型质量影响。
由于Reuse-aware Expert Gating会轻微调整专家选择,因此论文进一步测试任务准确率、长上下文能力以及输出分布变化。
结果显示,S²-MoE在提升推理速度的同时,模型质量仍能保持接近原模型水平。
例如,Qwen3模型平均任务准确率由原模型的59.76变化为60.75,DeepSeek模型平均任务准确率从58.68变化到60.74。同时输出分布变化保持较小。
![]()
04
从服务器到端侧,MoE推理
正在寻找新路径
过去的大模型优化更多关注训练效率和数据中心部署。
但随着AI应用不断向手机、机器人、智能终端迁移,如何降低推理成本成为新的竞争方向。
S²-MoE并不是通过简单压缩模型参数降低成本,而是重新优化推理过程中的专家选择和验证流程,让MoE模型减少无效访存和重复计算。
论文已经基于llama.cpp完成系统实现并公开代码,为后续端侧MoE部署提供了新的优化方向。
未来,随着更大规模MoE模型出现,如何进一步降低内存压力、提升本地推理速度,可能会成为大模型落地的重要方向。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.