Meta最近的日子,冰火两重天。
一边,加州、科罗拉多、肯塔基、新泽西四个州的总检察长把索赔数字喊到了1.4万亿美元——几乎等于Meta 1.48万亿的总市值,指控它故意把Facebook和Instagram设计成让青少年上瘾的产品。另一边,Meta Superintelligence Labs在8月10日突然开源了Muse Glimmer:一个30B参数的Agent模型,直接挂上最宽松的Apache 2.0许可证。
这是Muse系列第一次开源。此前这条线一直闭源,只走API。
Muse Glimmer是个什么模型
先把公开资料能确认的规格摆上桌。
Muse Glimmer由Meta Superintelligence Labs训练——就是Scale AI创始人Alexandr Wang带队的那家实验室。官方定位很明确:不做聊天机器人,做常驻本地的Agent(always-on local agent)。
架构上,它是一个30B的稠密多模态模型:27.9B的文本解码器,配一个1.9B的ViT视觉编码器和GELU投影层。文本部分52层Transformer,用分组查询注意力(32个Q头对2个KV头),外加混合滑动窗口——每三层2048窗口的局部注意力,夹一层全序列注意力,局部层用RoPE、全局层用NoPE,借此把上下文撑到128k以上。
许可证是Apache 2.0:商用、修改、再分发,基本不设门槛。权重已在Hugging Face开放,GGUF和Unsloth变体同步放出。
落地速度也快得反常:发布当天,llama.cpp、Hugging Face Transformers、Ollama 0.32.7、LM Studio、SGLang全部day-0支持,MLX、vLLM随后几天跟进,AMD、Arm、Intel、NVIDIA都参与了设备端优化。Meta这次明显是有备而来。
30B怎么塞进24GB显卡
30B模型全精度要55GB以上的内存,RTX 5090都装不下。Meta用了两板斧。
第一板斧是量化。权重压到约4-bit,语言模型本体缩到20GB以内,省出来的显存留给KV cache、视觉编码器和投机解码的小模型,整体落在24GB或32GB的包络里。官方的说法是,压缩对Agent任务的性能几乎无损。
第二板斧是投机解码,这块值得拆开讲。传统解码是一个词一个词往外蹦,每一步都要把30B参数完整过一遍。Glimmer配了一个基于DFlash的轻量drafter,数据流是这样的:
![]()
小模型先"瞎猜"一大段,主模型一次前向就把整段验完——猜对的白赚,猜错的改掉。生成质量不变,速度直接翻倍起。实测数字:RTX 5090上解码从74.9 tok/s拉到233 tok/s,提速3.1倍;M5 Max的MacBook提速1.8倍到50 tok/s,M4 Max提速1.5倍。SGLang那边更狠,RTX 5090上NVFP4加DFlash,单用户236 tok/s,批量吞吐冲到1452 tok/s。
说白了,Meta用工程手段把一个60GB级的模型,压进了24GB级设备,还跑得足够快——本地Agent最怕的就是想五分钟憋一句话,这个问题算是正面解决了。
打工人的素质,是蒸馏出来的
能力从哪来?答案是自家闭源旗舰。
Glimmer的训练分三段:预训练阶段用Muse Spark的输出做logit蒸馏;中训阶段加长上下文、塞入更密集的Agent数据;后训练结合监督微调、on-policy蒸馏和强化学习。
所谓logit蒸馏,说人话就是:老师模型(Muse Spark)不只要告诉学生"答案是什么",连"每个候选词的信心分布"都手把手教过去。复杂推理链路和Agent交互数据,全部由这个庞然大物生成,再灌进30B的小身板。
这套流程砸出来的能力清单很Agent向:精确schema的工具调用、多步推理、工具调用失败后自己诊断报错并重试、读截图和图表的多模态输入、100多种语言,还兼容OpenClaw这类编排框架。
不过这里得泼点冷水。官方对比里,Glimmer在MCP Atlas上拿到75.5分,压过Gemma4-31B的54.2和Qwen3.6-27B的62.5;但在OSWorld-Verified、TerminalBench 2.1和SWE-Bench Verified上,反超的恰恰是Qwen3.6-27B。也就是说,这个"小钢炮"在工具调用链路上很强,真到电脑操作和终端写代码的硬碰硬,同尺寸的国产模型还站在它前面。
为什么偏偏现在开源
时间点选得很微妙,三条线拧在一起。
第一条线是开源生态的攻守易形。扎克伯格同日发了一封14页的长文《The Future is for Everyone》,给Meta的AI路线定调:超级智能应该交到每个人手里,反对把它集中在少数公司,并明确主张蒸馏训练、呼吁美国放宽对开源AI的限制。他直接点名DeepSeek、Qwen、Kimi是开源领域的领先者。去年春天Meta一度收回开源脚步,现在等于公开承认:这块地盘被中国模型占了,得抢回来。
![]()
第二条线是Muse系列的商业布局。Muse Spark上个月刚开始卖API,但在编码、推理、写作的公开榜单上仍落后于Anthropic和OpenAI的旗舰,Meta的策略是打价格——这跟DeepSeek、月之暗面、阿里用宽松许可证打市场的路数如出一辙。开源Glimmer,等于把旗舰蒸馏出的能力免费下放,给API业务引流。Alexandr Wang同天还预告,Muse Spark 1.2的开源权重版也在路上。
第三条线,就是开头那场1.4万亿美元的官司。四个州按"每个受影响青少年用户乘以法定罚款上限"的算法算出这个天价,Meta在法庭文件里反击称这是"博头条的数字",消费者保护执法史上从无先例。8月奥克兰开庭在即,此时高举"开源""隐私""个人超级智能"的大旗,叙事上的收益显而易见——合理推演是,Glimmer的发布节奏,很难说与这场舆论战完全无关。
还有个细节值得记下:据《纽约时报》,Meta内部还在搞一个代号Watermelon的更强模型,开不开源没说法。所以Glimmer的定位很清楚——开源的是旗舰的蒸馏产物,看家本事还攥在手里。
结语
把镜头拉远,Glimmer真正有意思的地方在于它验证了一条产品路线:云端旗舰负责把能力推到上限,本地小模型靠蒸馏承接,再用量化和投机解码塞进消费级硬件。文件、日历、代码、聊天记录这些高频又私密的活,迟早要留在设备上跑。
而这场发布会外的那层背景更直白:当扎克伯格需要点名三家中国实验室来证明开源的重要性时,开源大模型的重心在哪儿,已经不用多解释了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.