网易首页 > 网易号 > 正文 申请入驻

国产推理大模型决战2025考研数学,看看谁第一个上岸?

0
分享至

机器之心发布

机器之心编辑部

随着上个月 2025 研究生考试的结束,最新的考研数学真题成为大语言模型尤其是推理模型的「试炼场」,将考验它们的深度思考能力。

业内曾有着这样一种共识:大语言模型在文字水平上的表现令人印象深刻,但说到数学就不甚令人满意了。去年一度火出圈的「9.9 与 9.11」比大小的问题,包括 GPT-4o 在内的很多大模型都翻车了,直到深度推理模型出现后才从根本上改善了这一状况。

OpenAI 发布的 o1 模型在涉及复杂和专业的数理问题方面表现让人印象深刻,大模型在经过一定时间仔细思忖后,回答问题的能力和准确度大幅提升,这种被称为推理侧 Scaling Law 的现象已经成为继续推动大模型能力提升的关键力量。在黄仁勋最新 CES 2025 的演讲中,他也把测试时(即推理)Scaling 形容为大模型发展的三条曲线之一。

可以看到,继 o1 之后,国内大模型厂商也陆续推出了自己的深度推理模型,并在某些任务上有亮眼的表现。数了一下时间轴大概是这样的:

  • 2024 年 11 月 21 日,深度求索团队发布 DeepSeek-r1 模型;
  • 2024 年 11 月 28 日,阿里通义团队发布 QwQ 模型;
  • 2024 年 12 月 16 日,月之暗面团队发布 Kimi-k1 模型;
  • 2024 年 12 月 31 日,智谱 GLM 团队发布 GLM-Zero 模型;
  • 2025 年 1 月 6 日,昆仑万维发布 Skywork-o1 模型。

大家也许会好奇,这些深度推理模型的能力(尤其是数学推理能力)到底有多强,又是谁能拔得头筹呢?这时就需要一场公平的标准化考试了。

清华 SuperBench 大模型测评团队(以下简称测评团队)为了全面评估这些模型在数学推理方面的能力,结合 2025 年考研数学(一、二、三)的试题,专门对以上各家深度推理模型进行了严格的评测。同时,为了确保评测的全面性,参与评测的还包括各家的旗舰基础模型。

此次选择的 13 个模型具体如下:

从结果来看,所有模型中以平均分计,第一名是 OpenAI 的 GPT-o1模型,这也是没什么意外的。第二名则是来自智谱的 GLM-Zero-Preview,它以三门数学平均 138.70 的成绩仅次于 o1,成为国产大模型第一,且距第一名不到 3 分。第三名则是来自通义的 QwQ

测试方法

在本次评测过程中,测评团队发现并非所有模型均提供 API 支持,且部分提供 API 服务的模型在输出内容长度超出一定限制时,会出现内容截断的情况。为确保评测工作的公正性与准确性,测评团队决定统一采用各模型厂商的网页端进行测试操作。

在测试过程中,每道题目均在独立的对话窗口中进行,以此消除上下文信息对测试结果可能产生的干扰。

鉴于部分模型输出存在一定不稳定性,为降低由此引发的分数波动,测评团队设定当同一模型在三次测试中有两次及以上回答正确时,方将其记录为正确答案。

结果分析

接下来从测试总分、单张试卷分数、深度思考模型 vs 基础模型三个方面来详细分析此次测评的结果。

总分

对于总分数,测评团队对三张试卷的分数进行求和并计算平均值,按照分数高低进行排序。结果如下图所示:

从图中可以看到,GPT-o1 仍然处于领先的地位,是唯一一个达到 140 分以上的模型,相较于排名末位的 GPT-4,分数优势高达 70 分

位于第二梯队(130 分以上)的模型有 GLM-zero-preview 和 QwQ,分别斩获 138.7 分和 137.0 分。

DeepSeek-r1-lite、Kimi-k1、Tiangong-o1-preview、DeepSeek-v3 则处于第三梯队(120 分以上)。

可以看出,深度思考模型普遍能够达到 120 + 的水平。这也彰显了深度思考模型在解决数学问题方面的强大能力。

值得注意的是,曾于 2023 年位居榜首的基础模型GPT-4,在本次测试中仅获 70.7 分,位列末席。这一结果表明,在过去一年(2024 年)中,语言模型在数学推理领域的进步显著。

而另一方面,在缺乏深度思考能力辅助的情况下,仅凭逻辑推理能力,DeepSeek-v3 作为基础模型,已经能够跻身第三梯队,这说明基础模型和深度思考模型之间的能力并非界限分明。

单张试卷分析

为了更清晰地展现大模型在各张试卷答题能力方面的表现,测评团队对每张试卷的错题分布情况进行了深入分析。

在数学一的评测过程中,GPT-o1、GLM-zero-preview、QwQ、DeepSeek-r1-lite 四款模型的得分相同。通过进一步剖析错题情况,测评团队发现所有模型均在第 20 题(12 分,涉及曲面积分求解)以及第 21 题第二问(6 分,涉及特征向量求解)上出现了错误。

在数学二的评测中,各模型的分数分布较为分散。经统计分析发现,第 3 题、第 5 题、第 7 题成为所有模型犯错的集中区域。具体错题分布情况如下图所示:

针对数学三的评测结果显示,模型出错的重灾区主要集中在第 14 题、第 15 题、第 16 题、第 19 题。相关错题分布情况如下图所示:

综合上述各试卷错题的具体分析,我们可以清晰地看到,GPT-o1(阴影列所示)在总计 66 道题目中,仅答错 3.5 道题;并且 GPT-o1 答错的题目,其他模型亦普遍存在错误,这显示了GPT-o1 目前依然是深度推理模型的天花板

基础模型 vs 深度思考模型

最后,为了全面深入地探究各模型厂商在深度思考能力优化方面所取得的成果,测评团队对相应基础模型与深度思考模型进行了细致对比分析。

需要说明的是,此处对比并非意味着各深度思考模型是基于对应基础模型所做优化,其主要目的在于直观呈现各厂商在模型综合能力提升方面的进展与成效。

相关对比结果如下图所示:

注:OpenAI 的基础模型采用的是 GPT-4o。

通过对比分析,OpenAI 的深度思考模型 GPT-o1 相较于基础模型 GPT-4o,提升幅度最为显著,达到 57.3 分。紧随其后的是阿里的 Qwen 模型和智谱的 GLM 模型,提升幅度分别为 47.0 分和 34.3 分。

另外,深度求索和月之暗面的提升幅度相对较小,这主要是由于其基础模型本身分数较高。以深度求索为例,其基础模型 DeepSeek-v3 初始分数高达 120.3 分,在参评基础模型中位居榜首。

在本次测试中,测评团队选取表现最为优异的基础模型 DeepSeek-v3 作为参照基准,进而对各厂商深度思考模型的性能提升情况进行评估,相关数据呈现如下图所示:

可以看出,OpenAI、智谱、阿里在深度思考模型上的性能提升做了很大的优化,而 DeepSeek-v3 等其他模型在本项测试中的结果基本接近。

这些测试结果一一看下来,我们可以发现:虽然 OpenAI 的 o1 在深度推理方面仍然是最强的,但国产推理大模型正在逐渐缩小与它的差距,此次智谱 GLM-zero-preview 和阿里 QwQ 的成绩说明了这一点。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中方罕见公开西太对峙细节!日舰模拟攻击辽宁舰,结果彻底沉默?

中方罕见公开西太对峙细节!日舰模拟攻击辽宁舰,结果彻底沉默?

时光流转追梦人
2026-06-30 16:17:21
4日凌晨大满贯:女单8强诞生,陈幸同强势横扫,莎莎下轮对手确定

4日凌晨大满贯:女单8强诞生,陈幸同强势横扫,莎莎下轮对手确定

行舟问茶
2026-07-04 06:03:42
密春雷9亿债务危机4年了,董卿没离婚没落魄,却悄悄布局一盘大棋

密春雷9亿债务危机4年了,董卿没离婚没落魄,却悄悄布局一盘大棋

娱小余
2026-06-27 22:42:52
去省厅报到遇前妻,她羞辱我不懂规矩,我坐上厅长位:你再说一遍

去省厅报到遇前妻,她羞辱我不懂规矩,我坐上厅长位:你再说一遍

千秋文化
2026-07-02 19:53:21
0-3温网大冷门,世界第9遭世界第74掀翻,梅德韦杰夫止步32强

0-3温网大冷门,世界第9遭世界第74掀翻,梅德韦杰夫止步32强

俯身冲顶
2026-07-04 00:08:08
我国和不丹为何争议区越来越少了?看看这些抵边村就知道了

我国和不丹为何争议区越来越少了?看看这些抵边村就知道了

老谢谈史
2026-05-10 02:51:04
世界杯:阿根廷3-2佛得角进16强!梅西破门+罗梅罗造乌龙绝杀

世界杯:阿根廷3-2佛得角进16强!梅西破门+罗梅罗造乌龙绝杀

乒烧泳球
2026-07-04 08:54:17
鲍鹏山:如果中国真的足够强大!我们没必要脆弱到那么害怕批评!

鲍鹏山:如果中国真的足够强大!我们没必要脆弱到那么害怕批评!

用冷眼洞悉世界
2026-06-24 00:44:14
唐嫣案判了!罗晋近况曝光,难堪一幕发生,原来他和辛柏青同病相怜

唐嫣案判了!罗晋近况曝光,难堪一幕发生,原来他和辛柏青同病相怜

情感大头说说
2026-07-03 16:56:13
曼联追楚阿梅尼恐成泡影,皇马官宣不签恩佐!需避免重蹈德容覆辙

曼联追楚阿梅尼恐成泡影,皇马官宣不签恩佐!需避免重蹈德容覆辙

罗米的曼联博客
2026-07-04 07:11:14
A股正在憋着一场阴谋

A股正在憋着一场阴谋

睿知睿见
2026-07-04 07:36:07
不甩亲妹争议!钟丽缇长女晒比基尼辣照 「岸边脱泳裤」曲线傲人

不甩亲妹争议!钟丽缇长女晒比基尼辣照 「岸边脱泳裤」曲线傲人

ETtoday星光云
2026-07-03 14:02:04
因男友嫌弃猫腿太短,妹子不想要了,网友开开心心来收猫,结果骂骂咧咧的走了!

因男友嫌弃猫腿太短,妹子不想要了,网友开开心心来收猫,结果骂骂咧咧的走了!

拜见喵主子
2026-07-03 11:46:52
伊朗给全球上了一课:要想赢得特朗普的尊敬,必须要打疼他

伊朗给全球上了一课:要想赢得特朗普的尊敬,必须要打疼他

福建睿平
2026-07-04 06:58:41
老公去世时我查出怀孕,公婆劝我打掉,7年后孩子进门他们红了眼

老公去世时我查出怀孕,公婆劝我打掉,7年后孩子进门他们红了眼

千秋文化
2026-07-02 19:38:21
曼晚:B费在本届世界杯表现挣扎,战术适配存在问题

曼晚:B费在本届世界杯表现挣扎,战术适配存在问题

懂球帝
2026-07-03 19:43:10
举报整整10个月无人问津,蒋方舟论文造假为什么今天才炸

举报整整10个月无人问津,蒋方舟论文造假为什么今天才炸

林子说事
2026-07-04 00:29:51
韩红基金会回应质疑,避谈明细评论区沦陷,曾说一包泡面都能公示

韩红基金会回应质疑,避谈明细评论区沦陷,曾说一包泡面都能公示

萌神木木
2026-07-02 21:13:20
贝隆:如今科技发展,球员都能踢到很大岁数,但梅西还是令人惊叹

贝隆:如今科技发展,球员都能踢到很大岁数,但梅西还是令人惊叹

兰亭墨未干
2026-07-03 15:14:11
韩红再次回应传闻:善款理财,利益输送,高价工资,网友不买账!

韩红再次回应传闻:善款理财,利益输送,高价工资,网友不买账!

眼光很亮
2026-07-03 08:05:06
2026-07-04 09:08:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13427文章数 142686关注度
往期回顾 全部

教育要闻

英国又一名校裁员!人文学科首当其冲,500名员工受影响

头条要闻

牛弹琴:很罕见 普京突然穿上了军装

头条要闻

牛弹琴:很罕见 普京突然穿上了军装

体育要闻

C罗穿已故队友若塔球衣谢场 眼中含泪

娱乐要闻

海来阿木孕期出轨指控掀起全网热议

财经要闻

千亿茶市场无赢家:澜沧巨亏 八马停"蹄"

科技要闻

万亿富豪马斯克 舍不得特斯拉员工敞开用AI

汽车要闻

方程豹钛9内饰曝光 用上了长联屏设计/下半年上市

态度原创

旅游
艺术
健康
房产
公开课

旅游要闻

全部免费!郑州7月4日-7月5日周末活动推荐

艺术要闻

这位女子,在画坛默默无闻,作品清新质朴

听说少吃点能抗衰老?专家讲解!

房产要闻

总裁空缺17个月、现金缺口超1000亿:金融局“局外人”入局万科

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版