网易首页 > 网易号 > 正文 申请入驻

多模态模型评测框架lmms-eval发布!全面覆盖,低成本,零污染

0
分享至

AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年,机器之心AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com

随着大模型研究的深入,如何将其推广到更多的模态上已经成为了学术界和产业界的热点。最近发布的闭源大模型如 GPT-4o、Claude 3.5 等都已经具备了超强的图像理解能力,LLaVA-NeXT、MiniCPM、InternVL 等开源领域模型也展现出了越来越接近闭源的性能。

在这个「亩产八万斤」,「10 天一个 SoTA」的时代,简单易用、标准透明、可复现的多模态评估框架变得越来越重要,而这并非易事。

为解决以上问题,来自南洋理工大学 LMMs-Lab 的研究人员联合开源了 LMMs-Eval,这是一个专为多模态大型模型设计的评估框架,为多模态模型(LMMs)的评测提供了一站式、高效的解决方案。

  • 代码仓库: https://github.com/EvolvingLMMs-Lab/lmms-eval
  • 官方主页: https://lmms-lab.github.io/
  • 论文地址: https://arxiv.org/abs/2407.12772
  • 榜单地址:https://huggingface.co/spaces/lmms-lab/LiveBench

自 2024 年 3 月发布以来, LMMs-Eval 框架已经收到了来自开源社区、公司和高校等多方的协作贡献。现已在 Github 上获得 1.1K Stars,超过 30+ contributors,总计包含 80 多个数据集和 10 多个模型,并且还在持续增加中。

标准化测评框架

为了提供一个标准化的测评平台,LMMs-Eval 包含了以下特性:

  1. 统一接口: LMMs-Eval 在文本测评框架 lm-evaluation-harness 的基础上进行了改进和扩展,通过定义模型、数据集和评估指标的统一接口,方便了使用者自行添加新的多模态模型和数据集。
  2. 一键式启动:LMMs-Eval 在 HuggingFace 上托管了 80 多个(且数量不断增加)数据集,这些数据集精心从原始来源转换而来,包括所有变体、版本和分割。用户无需进行任何准备,只需一条命令,多个数据集和模型将被自动下载并测试,等待几分钟时间即可获得结果。
  3. 透明可复现:LMMs-Eval 内置了统一的 logging 工具,模型回答的每一题以及正确与否都会被记录下来, 保证了可复现性和透明性。同时也方便比较不同模型的优势与缺陷。

LMMs-Eval 的愿景是未来的多模态模型不再需要自行编写数据处理、推理以及提交代码。在当今多模态测试集高度集中的环境下,这种做法既不现实,测得的分数也难以与其他模型直接对比。通过接入 LMMs-Eval,模型训练者可以将更多精力集中在模型本身的改进和优化上,而不是在评测和对齐结果上耗费时间。

评测的「不可能三角」

LMMs-Eval 的最终目标是找到一种 1. 覆盖广 2. 成本低 3. 零数据泄露 的方法来评估 LMMs。然而,即使有了 LMMs-Eval,作者团队发现想同时做到这三点困难重重,甚至是不可能的。

如下图所示,当他们将评估数据集扩展到 50 多个时,执行这些数据集的全面评估变得非常耗时。此外,这些基准在训练期间也容易受到污染的影响。为此, LMMs-Eval 提出了 LMMs-Eval-Lite 来兼顾广覆盖和低成本。他们也设计了 LiveBench 来做到低成本和零数据泄露。

LMMs-Eval-Lite: 广覆盖轻量级评估

在评测大模型时,往往庞大的参数量和测试任务会使得评测任务的时间和成本急剧上升,因此大家往往会选择使用较小的数据集或是使用特定的数据集进行评测。然而,有限的评测往往会使得对于模型能力的理解有所缺失,为了同时兼顾评测的多样性和评测的成本,LMMs-Eval 推出了 LMMs-Eval-Lite

LMMs-Eval-Lite 旨在构建一个简化的基准测试集,以在模型开发过程中提供有用且快速的信号,从而避免现在测试的臃肿问题。如果我们能够找到现有测试集的一个子集,在这上面的模型之间的绝对分数和相对排名与全集保持相似,那么我们可以认为修剪这些数据集是安全的。

为了找到数据集中的数据显著点,LMMs-Eval 首先使用 CLIP 和 BGE 模型将多模态评测数据集转换为向量嵌入的形式并使用 k-greedy 聚类的方法找到了数据显著点。在测试中,这些规模较小的数据集仍然展现出与全集相似的评测能力。

随后 LMMs-Eval 使用了相同的方法制作了涵盖更多数据集的 Lite 版本,这些数据集旨在帮助人们节省开发中的评测成本,以便快速判断模型性能

LiveBench: LMMs 动态测试

传统基准侧重于使用固定问题和答案的静态评估。随着多模态研究的进展,开源模型在分数比较往往优于商用模型,如 GPT-4V,但在实际用户体验中却有所不及。动态的、用户导向的 Chatbot Arenas 和 WildVision 在模型评估中越来越受欢迎,但是它们需要收集成千上万的用户偏好,评估成本极高。

LiveBench 的核心思想是在一个不断更新的数据集上评估模型的性能,以实现零污染且保持低成本。作者团队从网络上收集评估数据,并构建了一条 pipeline,自动从新闻和社区论坛等网站收集最新的全球信息。为了确保信息的及时性和真实性,作者团队从包括 CNN、BBC、日本朝日新闻和中国新华社等 60 多个新闻媒体,以及 Reddit 等论坛中选择来源。具体步骤如下:

  1. 捕捉主页截图并去除广告和非新闻元素。
  2. 使用当前最强大的多模态模型(如 GPT4-V、Claude-3-Opus 和 Gemini-1.5-Pro)设计问题和答案集。由另一模型审查和修订
  3. 问题,确保准确性和相关性。
  4. 人工审查最终的问答集,每月收集约 500 个问题,保留 100-300 个作为最终的 \livebench 问题集。
  5. 采用 LLaVA-Wilder 和 Vibe-Eval 的评分标准 -- 评分模型根据提供的标准答案评分,得分范围为 [1, 10]。默认评分模型为 GPT-4o,还包括 Claude-3-Opus 和 Gemini 1.5 Pro 作为备选。最终的报告结果将基于得分转换为 0 到 100 的准确率指标。

未来也可以在我们动态更新的榜单里查看多模态模型在每个月动态更新的最新评测数据,以及在榜单上的最新评测的结果。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
笑不活了!这老爸操作真绝啊,防止高二女儿早恋,直接暑假带闺女跑长沙、武汉旅游,把小姑娘晒成“黑人”

笑不活了!这老爸操作真绝啊,防止高二女儿早恋,直接暑假带闺女跑长沙、武汉旅游,把小姑娘晒成“黑人”

番外行
2026-08-21 09:33:46
特朗普:我要在深圳见金正恩!王毅:不作评论

特朗普:我要在深圳见金正恩!王毅:不作评论

呼呼历史论
2026-08-23 05:57:08
宁死不向中国低头!铃木退出中国市场,铃木修曾说:“我就是死,也不会向中国市场低头!”随后,以1块的价格,把铃木50%的股份卖给了长安

宁死不向中国低头!铃木退出中国市场,铃木修曾说:“我就是死,也不会向中国市场低头!”随后,以1块的价格,把铃木50%的股份卖给了长安

扶苏聊历史
2026-08-22 17:24:17
2000万+再陪一年!魏莹陪睡内幕炸裂,父亲亲口承认每月赴约

2000万+再陪一年!魏莹陪睡内幕炸裂,父亲亲口承认每月赴约

古事寻踪记
2026-08-24 14:30:56
唐师曾离世,他最大遗憾不是别的,而是那个在病重期间照顾的前妻

唐师曾离世,他最大遗憾不是别的,而是那个在病重期间照顾的前妻

社会日日鲜
2026-08-24 08:30:00
随着丁俊晖1-5惨败,小特5-0大胜,武汉公开赛首日中国4胜5负收官

随着丁俊晖1-5惨败,小特5-0大胜,武汉公开赛首日中国4胜5负收官

小火箭爱体育
2026-08-23 22:26:41
2016年,易建联花重金在洛杉矶买下的豪宅,如今出售值多少钱?

2016年,易建联花重金在洛杉矶买下的豪宅,如今出售值多少钱?

皮皮电影
2026-08-24 14:13:33
安徽一上市公司董事长涉嫌醉驾被取保候审!

安徽一上市公司董事长涉嫌醉驾被取保候审!

凤凰网安徽
2026-08-24 10:18:21
全网大乌龙!王菲陪看演唱会的普通人,真实身份吓到无数人!

全网大乌龙!王菲陪看演唱会的普通人,真实身份吓到无数人!

陈意小可爱
2026-08-24 07:43:52
妻子晋升后要离婚,我默然接下组织调任,再见她追悔莫及我却畅快

妻子晋升后要离婚,我默然接下组织调任,再见她追悔莫及我却畅快

红豆讲堂
2025-07-14 11:36:25
央视五套今日焦点赛事!CCTV5直播:中国女排面临重大考验,力争连胜

央视五套今日焦点赛事!CCTV5直播:中国女排面临重大考验,力争连胜

运动小看台
2026-08-24 06:51:37
铁路官方回应"先买大人票 再退掉只留儿童票"

铁路官方回应"先买大人票 再退掉只留儿童票"

看看新闻Knews
2026-08-24 12:14:23
利物浦头号水货!全场灾难级拉胯!球迷怒喷:队史最差引援

利物浦头号水货!全场灾难级拉胯!球迷怒喷:队史最差引援

澜归序
2026-08-24 08:37:11
莫言:一个人最好的活法——衣服少买,饭少吃,给生活做减法

莫言:一个人最好的活法——衣服少买,饭少吃,给生活做减法

杏花烟雨江南的碧园
2026-08-21 11:15:03
许家印判无期才3天,白珊珊私生活被扒,被曝悄悄嫁给了这个男人

许家印判无期才3天,白珊珊私生活被扒,被曝悄悄嫁给了这个男人

刘森森
2026-08-22 10:05:42
花的都是百姓财政收入,公职人员全部收入明细该向民众透明吗?

花的都是百姓财政收入,公职人员全部收入明细该向民众透明吗?

你在偷看谁
2026-08-10 21:22:11
仅剩最后1年!国防部亮底牌了,官方连发3大动作,解放军剑指台海

仅剩最后1年!国防部亮底牌了,官方连发3大动作,解放军剑指台海

老嫅尾声体育解说
2026-08-23 22:11:38
19年张扣扣被执行死刑当天,被害者家属语出惊人,当庭说出8个字

19年张扣扣被执行死刑当天,被害者家属语出惊人,当庭说出8个字

麓谷隐士
2026-07-13 10:05:15
第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

蜉蝣说
2026-07-17 09:47:08
哈兰德剪去标志性长发 维京人也留短发

哈兰德剪去标志性长发 维京人也留短发

甜份超标的我
2026-08-23 21:21:16
2026-08-24 15:15:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13831文章数 142724关注度
往期回顾 全部

科技要闻

“捂脸跑”机器人火出圈,它自己想出来的

头条要闻

牛弹琴:日理万机的特朗普久久不能入睡 凌晨1点发飙

头条要闻

牛弹琴:日理万机的特朗普久久不能入睡 凌晨1点发飙

体育要闻

42张照片 珍藏世界杯的热辣滚烫

娱乐要闻

张韶涵演唱会突发不适,本人发文道歉

财经要闻

泡泡玛特,最大的问题才刚显现

汽车要闻

智能超混 国民家轿 上汽大众ID. ERA 5S上市 限时8.99万元起

态度原创

数码
本地
旅游
公开课
军事航空

数码要闻

性能暴涨!小米玄戒O3架构揭晓:10核全大核CPU+16核G2Ultra GPU

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

旅游要闻

【观澜速递】张掖七彩丹霞旅游景区开闭园时间有调整

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美国与以色列发生“罕见冲突”

无障碍浏览 进入关怀版