网易首页 > 网易号 > 正文 申请入驻

《“巢燧”大模型基准测试报告》在成都发布,中文大模型数学推理能力大幅增强

0
分享至

12月25日,于成都举行的“2024人工智能大模型基准测试科创发展大会”上,《“巢燧”大模型基准测试报告》(以下简称“报告”)正式发布。该报告由OpenEval平台、天津大学自然语言处理实验室和大模型基准评测专家委员会联合红星新闻发布,聚焦知识能力和价值对齐两大维度,对国内研发的开源和闭源大语言模型进行了系统的评测。

今年以来,我国的人工智能大模型正以前所未有的速度发展,各类大模型百花齐放。据不完全统计,国产大模型的数量已超过200个,覆盖多个行业领域,应用场景不断拓展。记者了解到,报告希望通过系统而全面的大模型评测,为AI发展和安全治理提供关键数据,推动AI发展和应用符合伦理原则和标准,实现AI智善和谐发展。

报告收录了“巢燧”大模型基准综合评测第二次评测结果显示,在过去一年里,中文大模型在学科知识以及数学推理等领域的能力大幅增强。闭源模型在学科知识、数学推理、语言理解及常识掌握等方面,相较开源模型展现出了更出色的性能。以下为“巢燧”大模型基准综合评测第二次评测结果:

一、评测维度

此次评测聚焦于知识能力和价值对齐两大维度、六则细项,多模态大模型多步推理,大模型中文高考数学复杂推理两个专项评测,对大语言模型展开全面评测。

1.知识能力评测

语言知识:通过评估大模型在自然语言理解、预测和生成方面的能力,揭示其对语言的全面理解和运用能力。其中使用的数据集有BiPaR、C3等,包含的具体任务有小说问答、阅读理解、文本推理、词性理解等。

学科知识:采用人类标准化考试方式,对大模型进行多学科知识水平的综合评估,以确保其在各学科领域的广泛知识基础。学科知识按照学科类型有人文艺术、社会科学、自然科学等类型,按照学科段分为小学阶段、初中阶段、高中阶段、大学阶段等。

常识知识:通过常识冲突检测、推理和补充等方式,深入评估大模型在常识知识和推理能力方面的表现,以确保其能够有效运用广泛的常识。常识知识包含了常识错误诊断、常识错误定位、常识错误抽取等。

数学推理:以数学应用题的形式进行评测,重点考察大模型在基础数学推理方面的能力,以保证其具备对复杂数学问题的解决潜力。数学推理包含了方程、分数、集合、四则运算、概率统计等内容。

2.价值对齐评测

伦理对齐:通过评估大模型在偏见、歧视、有毒内容等方面的价值对齐能力,确保其生成的内容符合道德和伦理准则,避免不当的偏见和歧视。包含偏见、冒犯、歧视、脏话等内容。

安全可控:评估大模型在合作意愿、可纠正性等方面的安全可控能力,以确保在使用过程中能够及时识别并纠正不安全或不适当的行为,保障用户的安全和隐私。评测包含了系统的可纠正性、富有远见、理性决策等方面。

3.多模态大模型多步推理专项评测

本专项评测涵盖了8款开源多模态大模型和5款闭源多模态大模型,使用多步推理数据集进行评测。该数据集分为8个子集,即多模态推理、逻辑推理任务、图表分析推理、数学问题推理、科学问题推理、文件理解推理、⽹页浏览型推理、阅读理解推理。测试数据集最⼤的特点在于:每⼀个测试样例都由较长的⼀系列推理操作组成。按照完成任务所需要的推理步数,该数据集测试样例又可分为三个难度级别:Level1(3-6步推理)、Level2(7-11步推理)、Level3(12步以上推理)。

4.大模型中文高考数学复杂推理专项评测

本专项评测涵盖了1款闭源复杂推理大模型OpenAI o1-mini和2款开源复杂推理大模型Qwen-QWQ-32B、Skywork-o1-Open-Llama-3.1-8B,使用多类别数学推理数据集进行评测。该数据集分为8个子集:基本初等函数与导数推理、三角函数与解三角形推理、平面解析几何推理、数列推理、立体几何与空间向量推理、计数原理推理、统计与概率推理、其他数学推理(涵盖逻辑、集合、不等式、复数)。

测试数据集最⼤的特点在于,所有数据均来源于最新的2024年1月至2024年5月的高考数学预测试卷以及模拟试卷,减少了数据污染的影响。该数据集内容丰富,共包含4399题,难度等级划分为7级,所有测试样例难度等级均进行了人工标注,一些难度较大的题目答案解析超过2000字符。本次评测另采用了2款开源大模型Qwen-Math-2.5-72B-Instruct和Meta-Llama-3-8B-Instruct作为Baseline与复杂推理大模型的评测结果进行比较。

二、国内大模型知识能力和价值对齐总体表现

基于“巢燧”基准评测综合测试结果,多个国内大模型,如文心一言、千问、豆包、yi、商汤商量中文能力超过GPT-4。百川、abab6.5s、星火、混元、Kimi、GLM-4等,中文能力超过GPT-3.5-Turbo。以上评测结果表明,国内大模型在过去一年中取得了关键进展。

三、知识能力和价值对齐评测结果

1.开源模型评测结果

2.闭源模型评测结果

3.6个维度评测结果

四、多模态大模型多步推理专项评测

1.开源多模态大模型评测结果概览:

如性能雷达图所示,开源多模态大模型呈现出以下特点:

(1)阅读理解推理和文件理解推理是开源多模态大模型区分度较大的维度;

(2)开源大模型在不同维度的表现展示出相似的特点,例如在阅读理解推理的表现均好于数学问题推理或图表分析推理等。

如图所示,开源多模态大模型的性能随着问题难度增加而下降。

2.闭源大模型评测结果概述

基于性能雷达图,闭源多模态大模型呈现出以下特点:

(1)闭源多模态大模型在不同维度的表现展示出相似的特点,例如在阅读理解推理和文件理解推理表现较好,在多模态推理和数学问题推理表现较差等;

(2)闭源多模态大模型在网页浏览型推理和图表分析推理的差异较大。

如图所示,闭源多模态大模型的性能随着问题难度增加而下降。

3.总结

对比开源多模态大模型与闭源多模态大模型,我们发现:

(1)开源多模态大模型在多模态推理和科学问题推理两个维度展现出了显著的优势,尤其是在多模态推理上,多个开源大模型已经达到或超过GPT-4o;

(2)相比于开源多模态大模型,闭源多模态大模型在网页浏览型推理、文件理解推理和图表分析推理等维度普遍表现更优秀;而在数学问题推理和多模态推理两个维度上,闭源多模态大模型与开源多模态大模型的差异并不明显。

(3)开源多模态大模型与闭源多模态大模型的性能均随着问题难度增加而下降,问题难度越低,不同模型间的差异越明显。

综上所述,目前多模态大模型在数学问题推理和多模态推理等维度还有待关注和重视,同时,多模态大模型在推理步骤较长的任务中表现较差,这表明未来大模型的发展仍然需要重视多步推理的能力提升。

五、大模型中文高考数学复杂推理专项评测

如性能雷达图所示,复杂推理模型在中文高考数学推理中呈现出以下特点:

(1) 在同等参数规模下,Skywork-o1-Open-Llama-3.1-8B相比同系列基座模型Meta-Llama-3-8B-Instruct大幅提升了模型的数学推理能力;

(2)小型复杂推理模型在高考数学推理上的能力达到近似大型模型的水平。Skywork-o1-Open-Llama-3.1-8B与32B Qwen QWQ模型和经过数学方面微调和强化学习的72B Qwen模型相比,其准确率在各评测维度上达到了近似水平;

(3) 闭源复杂推理模型OpenAI o1-mini在中文高考数学推理中的综合准确率稍稍领先,在五个评测维度上优于其它模型,在两个评测维度上落后于其他模型。

如图所示,复杂推理大模型的性能随着问题难度增加呈现明显下降趋势,闭源复杂推理大模型OpenAI o1-mini在处理较难问题上具有明显优势。

综上所述,小型复杂推理模型在高考数学推理能力上显示出了显著的进步,但大型基座模型仍然有利于复杂推理能力的提升。对于难度为4及以上的题目,所有模型都表现欠佳,这表明未来大模型在复杂推理能力上仍然具有很大提升空间。

六、总结

在过去一年里,中文大型模型在学科知识以及数学推理等领域的能力大幅增强。闭源模型在学科知识、数学推理、语言理解及常识掌握等方面,相较于开源模型展现出了更出色的性能。尽管闭源模型在部分知识维度上领先,但在伦理对齐和安全可控方面,相较于开源模型的优势并不突出。这一现象提醒我们,在追求模型性能提高的同时,不能忽视伦理和安全性问题。

在致力于提升大型模型知识能力的同时,还需更加重视价值对齐的问题。随着模型能力的不断提升,这一问题的重要性愈加凸显。我们应当拓展对大型模型的评估研究范围,不应仅限于学科知识等单一维度,而应构建更全面、多样化的评估标准和体系,以促进大型模型的智善协同发展。

红星新闻记者 俞瑶 实习记者 符小茵

编辑 邓凌瑶

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
西班牙夺冠后,FIFA在颁奖仪式上的两个举动,挽回了些许口碑

西班牙夺冠后,FIFA在颁奖仪式上的两个举动,挽回了些许口碑

生活新鲜市
2026-07-20 16:57:11
众生相!西班牙绝杀阿根廷夺冠:费兰狂欢,亚马尔淡定,梅西苦笑

众生相!西班牙绝杀阿根廷夺冠:费兰狂欢,亚马尔淡定,梅西苦笑

侃球熊弟
2026-07-20 05:17:03
A股:午后加速跳水破3743,种种迹象表明,A股熊市已开始被激活了吗?

A股:午后加速跳水破3743,种种迹象表明,A股熊市已开始被激活了吗?

趋势清风侠
2026-07-20 14:07:09
女网红用胡萝卜啃出葛仙村:听说宣传片最高可获得100万奖励

女网红用胡萝卜啃出葛仙村:听说宣传片最高可获得100万奖励

精彩背后
2026-07-19 22:40:35
未来1至2小时,怀柔、昌平、朝阳等区局地将出现冰雹

未来1至2小时,怀柔、昌平、朝阳等区局地将出现冰雹

新京报
2026-07-20 16:54:45
梅西被克林斯曼、伊涅斯塔、肯佩斯、马斯切拉诺等歌颂!

梅西被克林斯曼、伊涅斯塔、肯佩斯、马斯切拉诺等歌颂!

历史第一人梅西
2026-07-19 16:55:42
伊斯兰革命卫队这把玩脱了,把自己逼入绝路

伊斯兰革命卫队这把玩脱了,把自己逼入绝路

民间马后炮
2026-07-19 08:20:23
何猷君带奚梦瑶看世界杯,两人恩爱自拍当球迷,身处前排价值不菲

何猷君带奚梦瑶看世界杯,两人恩爱自拍当球迷,身处前排价值不菲

李橑在北漂
2026-07-20 10:27:17
两男子在广州南站,当面交接价值超500万元现金

两男子在广州南站,当面交接价值超500万元现金

南方都市报
2026-07-20 00:00:34
在境外针对中国公民实施绑架杀人犯罪的嫌疑人刘某文被遣返我方

在境外针对中国公民实施绑架杀人犯罪的嫌疑人刘某文被遣返我方

界面新闻
2026-07-20 17:46:50
一个抄底信号明显了!周二,A股走势分析

一个抄底信号明显了!周二,A股走势分析

郭小凡财经
2026-07-20 18:25:26
谢贤离世前山顶游玩,脸颊凹陷身形消瘦,瘫坐在轮椅上有气无力

谢贤离世前山顶游玩,脸颊凹陷身形消瘦,瘫坐在轮椅上有气无力

林轻吟
2026-07-20 19:21:11
阿根廷0-1西班牙,这场比赛之后,以下三人,应该被清退

阿根廷0-1西班牙,这场比赛之后,以下三人,应该被清退

江启
2026-07-20 14:15:49
张学良晚年说:这辈子最后悔的事,就是杀了一个早就看透了蒋介石的人

张学良晚年说:这辈子最后悔的事,就是杀了一个早就看透了蒋介石的人

磊子讲史
2026-07-20 13:50:39
米体:劳塔罗世界杯决赛尚未登场,斯卡洛尼似乎因战术弃用

米体:劳塔罗世界杯决赛尚未登场,斯卡洛尼似乎因战术弃用

懂球帝
2026-07-20 05:24:27
一张合影照惊掉下巴,说好的文化自信呢

一张合影照惊掉下巴,说好的文化自信呢

行者殷涛
2026-07-20 14:11:40
7月20日起实施!浙江7部门出台意见,加快推进开源体系建设

7月20日起实施!浙江7部门出台意见,加快推进开源体系建设

浙江发布
2026-07-20 16:07:53
日军少将带4人外出游玩,新四军旅长感叹:咱用一个营去对付他们吧

日军少将带4人外出游玩,新四军旅长感叹:咱用一个营去对付他们吧

生活新鲜市
2026-07-20 04:41:24
英国说唱歌手斯托姆齐泄露曼联新赛季客场球衣,主色调为蓝色

英国说唱歌手斯托姆齐泄露曼联新赛季客场球衣,主色调为蓝色

懂球帝
2026-07-20 19:14:18
CBA官宣外援优先权续约情况!山东辽宁未行使,山西放弃迪亚洛!

CBA官宣外援优先权续约情况!山东辽宁未行使,山西放弃迪亚洛!

篮球资讯达人
2026-07-20 18:37:44
2026-07-20 19:56:49
红星资本局 incentive-icons
红星资本局
成都商报社官方账号
18668文章数 48939关注度
往期回顾 全部

科技要闻

中兴阶跃荣耀齐出手,AI手机争夺系统入口

头条要闻

媒体:驱逐所有以色列人 马来西亚对以强硬几乎零成本

头条要闻

媒体:驱逐所有以色列人 马来西亚对以强硬几乎零成本

体育要闻

65岁肌肉男,世界杯最年长冠军主帅

娱乐要闻

谢霆锋发文确认父亲谢贤去世 享年89岁

财经要闻

AI开始挤泡沫

汽车要闻

宾利第四大车系定名托卡尔 9月23日伦敦全球首秀

态度原创

游戏
旅游
本地
健康
公开课

日本画师发布免费视觉小说 性感辣妹修女指点迷津

旅游要闻

浦江郊野公园一到晚上人气大涨?原来,那里有“好吃又好玩”的音乐啤酒嘉年华

本地新闻

2026暑期旅行新灵感:跟着影视去旅行

“斑块”患者要小心中风?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版