网易首页 > 网易号 > 正文 申请入驻

「0污染」LLM理解基准来了!20000道题14个学科全覆盖,来自微软

0
分享至

新智元报道

编辑:LRST

【新智元导读】MMLU-CF是一个无污染的多任务语言理解基准测试,旨在更公平、准确地评估大语言模型的能力。通过去污染规则和闭源测试集防止数据泄露,确保评估结果可靠。该基准包含20,000道题目,涵盖14个学科,验证集公开透明,测试集闭源防泄露。

近年来,随着大语言模型(LLM)的不断进步,如何准确评估其能力已经成为研究的热点问题。

诸如大规模多任务语言理解基准MMLU(Massive Multitask Language Understanding),在评估大语言模型中起到重要作用。

然而,由于开放源代码和训练数据的多样性,现有基准测试难免存在数据污染问题,影响评估结果的可靠性。

为了提供更为准确、公平的评估,微软亚洲研究院推出了MMLU-CF,它是基于公开数据源,经过去污染设计的大语言模型理解基准,并已在Huggingface上开放。

MMLU-CF是一个「无污染」的、更具挑战性的多项选择题基准数据集。

论文链接:https://arxiv.org/pdf/2412.15194

代码链接:https://github.com/microsoft/MMLU-CF

数据连接:https://huggingface.co/datasets/microsoft/MMLU-CF

数据集包含20,000道题目,分为10,000道验证集题目和10,000道测试集题目,其中验证集开源,测试集闭源,涵盖健康、数学、物理、商业、化学、哲学、法律、工程等14个学科领域。

MMLU-CF为大语言模型的评估提供了一个更加公平和可靠的基准,不仅帮助研究者准确理解模型的能力,也为未来模型优化提供了宝贵的数据支持。

MMLU-CF的贡献

消除数据污染

传统基准测试可能存在数据污染,影响评估的公正性。MMLU-CF通过引入三条去污染规则并扩展数据源,确保测试结果更可靠。

防止恶意数据泄露

研究人员将数据集分为验证集和测试集,确保测试集保持闭源,避免数据泄漏引发的不公正结果。同时,验证集开源以促进透明度,便于独立验证。

对比结果

评估结果显示,OpenAI o1在MMLU-CF测试集上的5-shot得分为80.3%,显著低于其在MMLU上取得的92.3%得分,表明了MMLU-CF基准的严格性。

图1 主流大模型在MMLU-CF的测试集的5-shot得分表现

基准对比

MMLU与MMLU-Pro基准测试主要关注任务的广度、推理能力和难度,但未考虑数据污染问题。

对于MMLU-CF,研究人员在数据收集时应用了去污染规则,确保避免数据泄露,同时将测试集保持闭源,防止恶意泄露。

以下是几款主流模型在MMLU与MMLU-CF数据集上的表现与排名变化:

图2 主流大模型在MMLU-CF和MMLU上的表现与排名

新的基准MMLU-CF扰乱了已评估的语言模型(LM)在MMLU上的性能排名。

排名前三的语言模型:OpenAI o1、Deepseek-R1和Deepseek-V3 ,保持了领先地位,排名没有任何变化。

有趣的是,在显著的排名变化(>=3位)中,排名下降的往往比上升的更为显著。

平均而言,排名下降的语言模型下降了5.14位次,而排名上升的语言模型上升了3.78位次。

这种不对称性表明,性能大幅下降比上升更容易,这可能是由于预训练语料库中的数据污染造成的。

与规模较大的语言模型相比,规模较小的语言模型在新的MMLU-CF基准测试中似乎更具破坏性。

测试集与验证集的划分

在MMLU-CF中,研究人员将数据集划分为测试集和验证集,并通过计算「绝对分数差异」评估模型的泛化能力。统计结果显示,约60%的差异值小于0.5,96%的差异值低于1.0,表明测试集和验证集的评估结果高度一致。

图3 数据构建流程图

MMLU-CF的数据构建包括以下几个步骤:

1.题目收集:从广泛的开放互联网域收集问题,保证问题的多样性。

2.题目清洗:确保收集到的问题质量高,适合用于评估。

3.难度采样:确保问题的难度分布合理。

4.大模型检查:使用GPT-4o、Gemini、Claude模型对数据的准确性和安全性进行检查。

5.去污染处理:通过去污染处理,确保数据集的无污染性。

最终,MMLU-CF数据集分别包含了10,000道测试集域验证集题目,同时测试集保持闭源,验证集则公开以保证透明性。

去污染处理规则

为了避免无意中的污染并评估模型的推理和理解能力,研究人员采用了三条去污染规则:

规则1:改写问题,减少模型对已见数据的依赖。

规则2:打乱选项,避免模型通过记忆选项顺序做出正确答案。

规则3:随机替换选项,增加模型的推理难度。

图4 去污染示例

这些规则有效减少了恶意和无意的泄漏风险,确保了数据集的「无污染」性。

参考资料:

https://arxiv.org/pdf/2412.15194

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
汪嘉伟之子汪崎:心疼母亲邓星,再难不“啃”父亲,赢得继母好评

汪嘉伟之子汪崎:心疼母亲邓星,再难不“啃”父亲,赢得继母好评

细品名人
2026-03-26 07:10:29
哈萨克斯坦也没想到,跟着中国混来混去,结果自己也混成了个霸主

哈萨克斯坦也没想到,跟着中国混来混去,结果自己也混成了个霸主

花颜蕴韵
2026-03-26 03:37:13
伊朗获得强援,又一中东国家下场,还是美国亲自送上门的帮手

伊朗获得强援,又一中东国家下场,还是美国亲自送上门的帮手

快看张同学
2026-03-26 14:46:05
晚饭七分饱被推翻了?医生调查:过了56岁,吃饭尽量要做到这5点

晚饭七分饱被推翻了?医生调查:过了56岁,吃饭尽量要做到这5点

蜉蝣说
2026-02-03 15:00:19
太突然!董事长汤建,因心梗意外去世

太突然!董事长汤建,因心梗意外去世

每日经济新闻
2026-03-25 18:21:26
中年男人最大的悲哀是什么?网友:说到底就是自己能力差呗

中年男人最大的悲哀是什么?网友:说到底就是自己能力差呗

带你感受人间冷暖
2026-03-23 00:02:19
NBA积分榜又乱了!掘金4连胜,火箭加时2分惜败,快船稳居第8

NBA积分榜又乱了!掘金4连胜,火箭加时2分惜败,快船稳居第8

薇说体育
2026-03-26 16:03:59
樊振东空降迈阿密,新身份曝光!回归国乒成谜!吴敬平发文!

樊振东空降迈阿密,新身份曝光!回归国乒成谜!吴敬平发文!

好乒乓
2026-03-26 12:28:10
钱再多有什么用?58岁伊能静身价过亿,如今9岁女儿却成她的心病

钱再多有什么用?58岁伊能静身价过亿,如今9岁女儿却成她的心病

梨花黛娱
2026-03-25 15:00:06
女孩“全损课本”火了,自认为是清北的料子,老师:自我感动罢了

女孩“全损课本”火了,自认为是清北的料子,老师:自我感动罢了

复转这些年
2026-03-23 20:48:15
扎心!俄爱国军事博主摊牌:再征40万大军也白搭,战场早已变天!

扎心!俄爱国军事博主摊牌:再征40万大军也白搭,战场早已变天!

老马拉车莫少装
2026-03-25 07:41:30
浙江省政府领导班子有调整

浙江省政府领导班子有调整

极目新闻
2026-03-26 09:59:46
74年李先念找到李德生,沉默半晌后说:要你辞职,是毛主席的建议

74年李先念找到李德生,沉默半晌后说:要你辞职,是毛主席的建议

比利
2026-03-26 15:01:27
特朗普:赫格塞思对和解不感兴趣,只想打仗

特朗普:赫格塞思对和解不感兴趣,只想打仗

观察者网
2026-03-25 09:19:14
真是人走茶凉!看了三只羊传媒的现状,才明白什么叫兔死狗烹

真是人走茶凉!看了三只羊传媒的现状,才明白什么叫兔死狗烹

聚焦真实瞬间
2026-02-10 20:45:40
复旦大学王德峰:禅宗为何是人类最高智慧中的智慧?

复旦大学王德峰:禅宗为何是人类最高智慧中的智慧?

犀利辣椒
2026-03-25 06:43:28
湖人7分险胜!差点翻车原因揭晓,4人表现太拉胯,数据一目了然

湖人7分险胜!差点翻车原因揭晓,4人表现太拉胯,数据一目了然

余飩搞笑段子
2026-03-26 11:33:35
38.6万元起拍!南京一民国老四合院上架拍卖

38.6万元起拍!南京一民国老四合院上架拍卖

现代快报
2026-03-26 14:34:07
14岁初中生把干冰放冰箱,半夜爆炸致价值上万冰箱报废 家长:没责备他

14岁初中生把干冰放冰箱,半夜爆炸致价值上万冰箱报废 家长:没责备他

红星新闻
2026-03-24 23:25:19
以色列称伊朗40分钟内向以发射四轮导弹

以色列称伊朗40分钟内向以发射四轮导弹

财联社
2026-03-25 18:00:21
2026-03-26 17:24:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
14819文章数 66720关注度
往期回顾 全部

科技要闻

Meta高管狂分百亿期权,700名员工却下岗

头条要闻

国防部:日本侵略过所有周边国家 至今都没有真正反省

头条要闻

国防部:日本侵略过所有周边国家 至今都没有真正反省

体育要闻

申京努力了,然而杜兰特啊

娱乐要闻

张雪峰家人首发声 不设追思会丧事从简

财经要闻

长护险谁能享受?享受多少?解答来了

汽车要闻

一汽奥迪A6L e-tron开启预售 CLTC最大续航815km

态度原创

教育
时尚
旅游
本地
军事航空

教育要闻

2026湖北高职单招工作启动

皮衣+裙,高级到炸

旅游要闻

德阳绵竹:赏花、览文旅精品......沿山旅游“火”起来

本地新闻

救命,这只酱板鸭已经在我手机复仇了一万遍

军事要闻

担心特朗普突然停战 以总理下令48小时尽力摧毁伊设施

无障碍浏览 进入关怀版