网易首页 > 网易号 > 正文 申请入驻

《“巢燧”大模型基准测试报告》在成都发布,中文大模型数学推理能力大幅增强

0
分享至

12月25日,于成都举行的“2024人工智能大模型基准测试科创发展大会”上,《“巢燧”大模型基准测试报告》(以下简称“报告”)正式发布。该报告由OpenEval平台、天津大学自然语言处理实验室和大模型基准评测专家委员会联合红星新闻发布,聚焦知识能力和价值对齐两大维度,对国内研发的开源和闭源大语言模型进行了系统的评测。

今年以来,我国的人工智能大模型正以前所未有的速度发展,各类大模型百花齐放。据不完全统计,国产大模型的数量已超过200个,覆盖多个行业领域,应用场景不断拓展。记者了解到,报告希望通过系统而全面的大模型评测,为AI发展和安全治理提供关键数据,推动AI发展和应用符合伦理原则和标准,实现AI智善和谐发展。

报告收录了“巢燧”大模型基准综合评测第二次评测结果显示,在过去一年里,中文大模型在学科知识以及数学推理等领域的能力大幅增强。闭源模型在学科知识、数学推理、语言理解及常识掌握等方面,相较开源模型展现出了更出色的性能。以下为“巢燧”大模型基准综合评测第二次评测结果:

一、评测维度

此次评测聚焦于知识能力和价值对齐两大维度、六则细项,多模态大模型多步推理,大模型中文高考数学复杂推理两个专项评测,对大语言模型展开全面评测。

1.知识能力评测

语言知识:通过评估大模型在自然语言理解、预测和生成方面的能力,揭示其对语言的全面理解和运用能力。其中使用的数据集有BiPaR、C3等,包含的具体任务有小说问答、阅读理解、文本推理、词性理解等。

学科知识:采用人类标准化考试方式,对大模型进行多学科知识水平的综合评估,以确保其在各学科领域的广泛知识基础。学科知识按照学科类型有人文艺术、社会科学、自然科学等类型,按照学科段分为小学阶段、初中阶段、高中阶段、大学阶段等。

常识知识:通过常识冲突检测、推理和补充等方式,深入评估大模型在常识知识和推理能力方面的表现,以确保其能够有效运用广泛的常识。常识知识包含了常识错误诊断、常识错误定位、常识错误抽取等。

数学推理:以数学应用题的形式进行评测,重点考察大模型在基础数学推理方面的能力,以保证其具备对复杂数学问题的解决潜力。数学推理包含了方程、分数、集合、四则运算、概率统计等内容。

2.价值对齐评测

伦理对齐:通过评估大模型在偏见、歧视、有毒内容等方面的价值对齐能力,确保其生成的内容符合道德和伦理准则,避免不当的偏见和歧视。包含偏见、冒犯、歧视、脏话等内容。

安全可控:评估大模型在合作意愿、可纠正性等方面的安全可控能力,以确保在使用过程中能够及时识别并纠正不安全或不适当的行为,保障用户的安全和隐私。评测包含了系统的可纠正性、富有远见、理性决策等方面。

3.多模态大模型多步推理专项评测

本专项评测涵盖了8款开源多模态大模型和5款闭源多模态大模型,使用多步推理数据集进行评测。该数据集分为8个子集,即多模态推理、逻辑推理任务、图表分析推理、数学问题推理、科学问题推理、文件理解推理、⽹页浏览型推理、阅读理解推理。测试数据集最⼤的特点在于:每⼀个测试样例都由较长的⼀系列推理操作组成。按照完成任务所需要的推理步数,该数据集测试样例又可分为三个难度级别:Level1(3-6步推理)、Level2(7-11步推理)、Level3(12步以上推理)。

4.大模型中文高考数学复杂推理专项评测

本专项评测涵盖了1款闭源复杂推理大模型OpenAI o1-mini和2款开源复杂推理大模型Qwen-QWQ-32B、Skywork-o1-Open-Llama-3.1-8B,使用多类别数学推理数据集进行评测。该数据集分为8个子集:基本初等函数与导数推理、三角函数与解三角形推理、平面解析几何推理、数列推理、立体几何与空间向量推理、计数原理推理、统计与概率推理、其他数学推理(涵盖逻辑、集合、不等式、复数)。

测试数据集最⼤的特点在于,所有数据均来源于最新的2024年1月至2024年5月的高考数学预测试卷以及模拟试卷,减少了数据污染的影响。该数据集内容丰富,共包含4399题,难度等级划分为7级,所有测试样例难度等级均进行了人工标注,一些难度较大的题目答案解析超过2000字符。本次评测另采用了2款开源大模型Qwen-Math-2.5-72B-Instruct和Meta-Llama-3-8B-Instruct作为Baseline与复杂推理大模型的评测结果进行比较。

二、国内大模型知识能力和价值对齐总体表现

基于“巢燧”基准评测综合测试结果,多个国内大模型,如文心一言、千问、豆包、yi、商汤商量中文能力超过GPT-4。百川、abab6.5s、星火、混元、Kimi、GLM-4等,中文能力超过GPT-3.5-Turbo。以上评测结果表明,国内大模型在过去一年中取得了关键进展。

三、知识能力和价值对齐评测结果

1.开源模型评测结果

2.闭源模型评测结果

3.6个维度评测结果

四、多模态大模型多步推理专项评测

1.开源多模态大模型评测结果概览:

如性能雷达图所示,开源多模态大模型呈现出以下特点:

(1)阅读理解推理和文件理解推理是开源多模态大模型区分度较大的维度;

(2)开源大模型在不同维度的表现展示出相似的特点,例如在阅读理解推理的表现均好于数学问题推理或图表分析推理等。

如图所示,开源多模态大模型的性能随着问题难度增加而下降。

2.闭源大模型评测结果概述

基于性能雷达图,闭源多模态大模型呈现出以下特点:

(1)闭源多模态大模型在不同维度的表现展示出相似的特点,例如在阅读理解推理和文件理解推理表现较好,在多模态推理和数学问题推理表现较差等;

(2)闭源多模态大模型在网页浏览型推理和图表分析推理的差异较大。

如图所示,闭源多模态大模型的性能随着问题难度增加而下降。

3.总结

对比开源多模态大模型与闭源多模态大模型,我们发现:

(1)开源多模态大模型在多模态推理和科学问题推理两个维度展现出了显著的优势,尤其是在多模态推理上,多个开源大模型已经达到或超过GPT-4o;

(2)相比于开源多模态大模型,闭源多模态大模型在网页浏览型推理、文件理解推理和图表分析推理等维度普遍表现更优秀;而在数学问题推理和多模态推理两个维度上,闭源多模态大模型与开源多模态大模型的差异并不明显。

(3)开源多模态大模型与闭源多模态大模型的性能均随着问题难度增加而下降,问题难度越低,不同模型间的差异越明显。

综上所述,目前多模态大模型在数学问题推理和多模态推理等维度还有待关注和重视,同时,多模态大模型在推理步骤较长的任务中表现较差,这表明未来大模型的发展仍然需要重视多步推理的能力提升。

五、大模型中文高考数学复杂推理专项评测

如性能雷达图所示,复杂推理模型在中文高考数学推理中呈现出以下特点:

(1) 在同等参数规模下,Skywork-o1-Open-Llama-3.1-8B相比同系列基座模型Meta-Llama-3-8B-Instruct大幅提升了模型的数学推理能力;

(2)小型复杂推理模型在高考数学推理上的能力达到近似大型模型的水平。Skywork-o1-Open-Llama-3.1-8B与32B Qwen QWQ模型和经过数学方面微调和强化学习的72B Qwen模型相比,其准确率在各评测维度上达到了近似水平;

(3) 闭源复杂推理模型OpenAI o1-mini在中文高考数学推理中的综合准确率稍稍领先,在五个评测维度上优于其它模型,在两个评测维度上落后于其他模型。

如图所示,复杂推理大模型的性能随着问题难度增加呈现明显下降趋势,闭源复杂推理大模型OpenAI o1-mini在处理较难问题上具有明显优势。

综上所述,小型复杂推理模型在高考数学推理能力上显示出了显著的进步,但大型基座模型仍然有利于复杂推理能力的提升。对于难度为4及以上的题目,所有模型都表现欠佳,这表明未来大模型在复杂推理能力上仍然具有很大提升空间。

六、总结

在过去一年里,中文大型模型在学科知识以及数学推理等领域的能力大幅增强。闭源模型在学科知识、数学推理、语言理解及常识掌握等方面,相较于开源模型展现出了更出色的性能。尽管闭源模型在部分知识维度上领先,但在伦理对齐和安全可控方面,相较于开源模型的优势并不突出。这一现象提醒我们,在追求模型性能提高的同时,不能忽视伦理和安全性问题。

在致力于提升大型模型知识能力的同时,还需更加重视价值对齐的问题。随着模型能力的不断提升,这一问题的重要性愈加凸显。我们应当拓展对大型模型的评估研究范围,不应仅限于学科知识等单一维度,而应构建更全面、多样化的评估标准和体系,以促进大型模型的智善协同发展。

红星新闻记者 俞瑶 实习记者 符小茵

编辑 邓凌瑶

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
人民日报来信调查:毕节一县修建百余套公租房,闲置8年盘活遇梗阻

人民日报来信调查:毕节一县修建百余套公租房,闲置8年盘活遇梗阻

澎湃新闻
2026-07-20 07:58:04
世界杯第一次办中场秀,结果……

世界杯第一次办中场秀,结果……

这里是美国
2026-07-20 15:46:22
国家队来了,A股调整已接近尾声?

国家队来了,A股调整已接近尾声?

财经杂志
2026-07-20 09:48:56
马龙许昕夺冠引爆全网!二人儿子态度截然不同,评论区一片悲凉

马龙许昕夺冠引爆全网!二人儿子态度截然不同,评论区一片悲凉

小鋭有话说
2026-07-20 07:49:20
36E顶级大灯,这身材绝了!丝毫顶不住!

36E顶级大灯,这身材绝了!丝毫顶不住!

梧州生活宝
2026-07-20 12:49:32
伊朗外长当众承认,害死哈梅内伊的大内奸,大概率还在德黑兰高层

伊朗外长当众承认,害死哈梅内伊的大内奸,大概率还在德黑兰高层

启迪你的思维
2026-07-20 14:28:58
芝麻酱被点名!发现:吃得越多,肌少症老年人肌肉流失或会变慢

芝麻酱被点名!发现:吃得越多,肌少症老年人肌肉流失或会变慢

芹姐说生活
2026-07-20 16:26:21
林彪“准儿媳”有多美?1991年和林豆豆的合影,她42岁,气质不凡

林彪“准儿媳”有多美?1991年和林豆豆的合影,她42岁,气质不凡

芊芊子吟
2026-07-16 12:30:11
绝密指挥部被一锅端!伊朗“斩首”美军特种兵,C-17昼夜不停抢运尸体

绝密指挥部被一锅端!伊朗“斩首”美军特种兵,C-17昼夜不停抢运尸体

扬子的故事屋
2026-07-20 10:18:13
自1974年大力神杯问世以来,从未有球队能够完成卫冕

自1974年大力神杯问世以来,从未有球队能够完成卫冕

懂球帝
2026-07-20 11:11:33
段永平与泡泡玛特创始人王宁会面,俩人一起看世界杯决赛!他曾称是王宁粉丝,已是泡泡玛特第二大股东

段永平与泡泡玛特创始人王宁会面,俩人一起看世界杯决赛!他曾称是王宁粉丝,已是泡泡玛特第二大股东

每日经济新闻
2026-07-20 14:52:19
红遍大江南北的刘欢,嗜酒如命患上不死癌症,早已走上一条不归路

红遍大江南北的刘欢,嗜酒如命患上不死癌症,早已走上一条不归路

打小我就醜
2026-07-19 01:05:10
破防!近80岁洪秀柱杭州哽咽:我等不及两岸统一了

破防!近80岁洪秀柱杭州哽咽:我等不及两岸统一了

阿天爱旅行
2026-07-20 15:59:02
45岁林俊杰携小22岁女友看世界杯,高清挽手照曝光,父女即视感重

45岁林俊杰携小22岁女友看世界杯,高清挽手照曝光,父女即视感重

动物奇奇怪怪
2026-07-20 16:47:56
中国海关:2026年6月中国自俄进口液化天然气同比增长99.9%

中国海关:2026年6月中国自俄进口液化天然气同比增长99.9%

俄罗斯卫星通讯社
2026-07-20 15:11:18
姆巴佩8年换5任女友,世界杯期间必换绝色新欢个个都是绝色佳人

姆巴佩8年换5任女友,世界杯期间必换绝色新欢个个都是绝色佳人

借你一生
2026-07-18 04:17:24
何长工在关键时刻站错队,此后官越做越小,建国后也没能参加授衔

何长工在关键时刻站错队,此后官越做越小,建国后也没能参加授衔

云端小院
2026-07-20 08:19:33
有色金属突然爆发!黄金、铜、稀土齐上涨,下一轮资源牛市来了?

有色金属突然爆发!黄金、铜、稀土齐上涨,下一轮资源牛市来了?

阿器谈史
2026-07-20 16:24:19
中国,有必要打一场立威之仗吗?

中国,有必要打一场立威之仗吗?

清沐执笔
2026-07-17 16:30:42
瓜迪奥拉力挺罗德里夺世界杯最佳球员:真正的MVP,全程稳定输出统治中场

瓜迪奥拉力挺罗德里夺世界杯最佳球员:真正的MVP,全程稳定输出统治中场

体育闲话说
2026-07-20 16:00:06
2026-07-20 17:16:49
红星资本局 incentive-icons
红星资本局
成都商报社官方账号
18664文章数 48939关注度
往期回顾 全部

科技要闻

中兴阶跃荣耀齐出手,AI手机争夺系统入口

头条要闻

毕节一县用财政拨款建百余套公租房 完工后却闲置8年

头条要闻

毕节一县用财政拨款建百余套公租房 完工后却闲置8年

体育要闻

65岁肌肉男,世界杯最年长冠军主帅

娱乐要闻

谢霆锋发文确认父亲谢贤去世 享年89岁

财经要闻

AI开始挤泡沫

汽车要闻

无线控不旗舰 谁说的?

态度原创

本地
艺术
时尚
家居
房产

本地新闻

用非遗解说决赛之争,是什么样的体验?

艺术要闻

砸70亿!OPPO全球总部正在“穿衣”,比效果图更震撼!

看来看去夏天还是穿T恤最合适,不用买太贵,舒适百搭又经典

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

北师附、人大附、西侨、丘海…招生、划片最新变化来了!

无障碍浏览 进入关怀版