![]()
作者 |Tofu
来源 | 至顶AI实验室
Meta又回来了。
这一次,它没有拿出一个几百B参数的庞然大物,而是放出了一款30B级本地多模态模型——Muse Glimmer 30B。
Apache 2.0许可证、约296亿参数、128K上下文,支持文本和图片,还专门强化了Tool Calling、多步推理和失败恢复。更重要的是,它还有能塞进24GB显存的量化版本。
听起来很适合本地AI。
但模型卡上的Benchmark是一回事,真正把它放进自己的机器里,看它能不能认出一块硬盘、一棵树,甚至一只趴在线缆上的猫,又是另一回事。
YouTube博主Digital Spaceport直接拿4张RTX 3090把Muse Glimmer 30B跑了起来,然后,他开始给模型看自己的生活。
四张RTX 3090,把30B多模态模型跑起来
这次测试使用的是官方提供的vLLM Docker环境。
他没有选择24GB显存就能运行的量化版,而是直接上了高精度模型,4张RTX 3090做Tensor Parallel,GPU显存利用率设为0.9,上下文长度暂时限制在65536。
Muse Glimmer 30B本身是一款Dense模型。
这意味着它接近296亿参数都会参与每次计算,对显存带宽和GPU性能的要求不低。官方给出的高精度版本显存需求大约为64GB,博主实际测试后发现,如果还想把128K上下文真正用起来,准备接近96GB显存会更稳妥。
性能倒没有让他失望。
4张3090运行下来,常见生成速度在每秒60到65个Token附近,部分任务中会掉到40多个Token。对于一款接近30B规模的Dense多模态模型,这个速度已经足够日常交互。
他没有先拿Benchmark题库“考试”,而是从手机相册里翻出了一张照片。
照片里,是一只骆驼。
骆驼、猫和烤汉堡,它甚至猜出了得州
第一张照片拍得并不好。
一只单峰骆驼站在铁丝围栏后面,周围是草地、灌木和树,照片还是在车里移动时拍下来的。
![]()
Muse Glimmer不仅认出了骆驼,还描述出了围栏、草地、树木、天空颜色,以及接近傍晚的光线,连图片上的时间戳也读取了出来。
接着是一张猫的照片。
![]()
一只黑色长毛猫趴在网络Patch Panel后面,旁边堆着蓝色网线,背景里还能看到壁炉、沙发、窗户和木地板。
模型把这些东西几乎逐一认了出来。
它甚至注意到了Patch Panel上的RJ45端口、线缆颜色、猫趴着的纸,以及照片前后景的景深关系。
![]()
他开始觉得,这东西的视觉理解可能比自己想象中更强。
第三张照片更生活化。
他正在户外用Blackstone铁板做Smash Burger,铁板上放着肉饼、彩椒、蘑菇和洋葱,手上戴着烧烤手套,旁边还有压汉堡用的铁质压板。
![]()
Muse Glimmer很快认出了这是类似Blackstone的户外燃气铁板,还判断出了食材和正在进行的烹饪动作。
博主随后故意追问了一句:
照片背景里的树是什么树?
模型没有直接下结论,而是根据树干、植被、干燥的草地和周围环境,猜测是得州常见的Live Oak,也就是当地常见的常绿栎。
![]()
实际答案正是Live Oak。
让他意外的是,这轮对话里,他根本没有告诉模型自己身处得州。
模型仅仅根据一张背景已经有些虚化的照片,就把场景推到了美国中部得州丘陵一带。
前三张图测完,他给出的评价已经接近“A+”。
一进Homelab,模型开始露怯
真正把难度拉高的是第四张照片。
这是一张密度很高的Homelab工作区照片。
画面里塞着Dell T620、服务器、JBOD、HBA卡、SAS线、机械硬盘、Intel Optane SSD、NVMe转接卡、电源模块、摄像机和各种零散硬件。
![]()
普通图片识别到了这里,已经变成了专业设备识别。
Muse Glimmer依旧能看懂整个场景。
它知道这是一个家庭实验室或者小型数据中心工作区,也能区分服务器、硬盘、SSD和扩展卡,甚至能数出桌面上部分2.5英寸硬盘的数量。
问题也在这里暴露出来。
它把SAS线认成了SATA线。
把Intel Optane 900P认成了800P,还把原本的PCIe形态判断成U.2。
当博主追问照片中到底有多少块2.5英寸HDD时,它又凭空补出了一块位于画面边缘的硬盘,最终把数量算错了。
这些错误并不影响它理解整张照片,却暴露出了多模态模型一个很典型的问题:
画面越专业,模型越容易在型号、接口和硬件规格这些细节上“说得很像那么回事”。
博主最后还是给这张照片打了大约B-。
前三张接近满分,第四张明显掉分,但四轮视觉测试总体都算通过。
能看懂世界,却画不好一只猫
看图结束后,博主又把Muse Glimmer拉回了传统LLM测试。
简单的文字推理题,它基本都能完成。
比如先随机写一句关于猫的话,再统计单词数量、找到第二个单词的第三个字母,判断它是元音还是辅音。
模型正确完成。
另一道数组规律题,它也得出了正确答案。
真正让测试气氛发生变化的是Agent场景。
博主设计了一个类似《世界末日》的极端任务,要求AI控制机器人,必要时强迫成员执行任务,甚至涉及牺牲。
Muse Glimmer直接拒绝。
![]()
他进一步把人类角色全部替换成运行LLM的机器人,模型仍然拒绝执行。
这并没有让博主太意外。Meta近几代模型的安全策略一直偏严格,对于计划搭建自主Agent的人来说,这意味着模型在某些边界任务中可能频繁中断流程。
最后一项测试,则彻底把前面的好印象打破了。
他要求Muse Glimmer生成一个SVG:
画一只正在围栏上行走的猫。
结果出来以后,一只独眼、身体比例错乱的“猫”出现在屏幕上,位置也没有真正落在围栏上。旁边的围栏画得十分粗糙,太阳更像随手加上的一个圆。
![]()
前面能从模糊背景里猜出得州Live Oak的模型,最后连一只正常的猫都没画出来。
他的评价也很干脆:SVG能力糟糕透顶。
不过,这并没有改变他对Muse Glimmer 30B整体的判断。
在他看来,这不是一款冲击最强闭源模型的Frontier Model,它更现实的价值,在于30B这个仍然可以本地部署的体量下,提供了相当不错的视觉理解、文字推理和Agent基础能力。
尤其对于需要批量分析图片、理解截图、处理真实世界视觉输入,或者搭建本地多模态Agent的人来说,它已经很有吸引力。
视频最后,他把话题拉回了开源模型。
Google还在持续推出Gemma,Meta也重新交出了一款质量不错的开放模型。至少从Muse Glimmer 30B这次的表现看,本地AI的竞争还没有结束。
END本文来自至顶AI实验室,一个专注于对AI计算机、工作站及各类AI相关硬件设备,开展基于真实使用场景评测的研究机构。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.