Meta于周一发布了Muse Glimmer,一个300亿参数的开源权重模型,专为在本地硬件上运行agentic工作流而设计。该模型已在Hugging Face上开放下载,但更值得关注的是,Meta如何将更大的Muse Spark模型压缩到一个足以在本地运行智能体的规模。 Glimmer使用Spark进行训练,让模型学习更大模型处理复杂任务的方式。随后Glimmer被压缩,并添加了一个轻量级辅助模型来加速长任务的处理。这一路径展示了企业如何将高效的云端模型转化为可在本地部署的小型代理——Sam Altman最近对此不屑一顾,认为这构不成竞争威胁,而Meta却正在将其打造成一条完整的端到端管线。 在该架构中,本地代理负责处理设备上的日常任务,更大的云端模型则承担训练和更复杂的工作。不过,这也为开发者引入了一条额外的部署链路需要管理。 根据Meta的技术公告,Glimmer通过logit蒸馏在Muse Spark的输出上进行了预训练。随后进入长上下文训练阶段,更加强调智能体和更丰富的推理轨迹。后训练阶段结合了监督微调、强化学习和on-policy蒸馏,覆盖编码、推理和智能体任务。 蒸馏通常用于降低推理成本或让模型适配更小的设备,但Muse Glimmer展示了它可以连接集中训练的模型与运行在用户和数据附近的本地智能体。 DeepSeek最近也展示了类似动态——其较小的模型超越了自家的旗舰模型,这说明经过良好蒸馏的学生模型有时能在针对性任务上与更大的模型匹敌甚至超越。 举例来说,一家公司可以用更大的模型训练一个本地编码智能体,让它无需上传数据就能检查代码仓库并使用开发工具,大大降低了敏感代码外流的风险。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.