网易首页

注册免费邮箱

网易首页 > 网易号 > 正文申请入驻

国产推理大模型决战2025考研数学，看看谁第一个上岸？

2025-01-14 14:27:29　来源: 机器之心Pro

北京举报

0

分享至

机器之心发布

机器之心编辑部

随着上个月 2025 研究生考试的结束，最新的考研数学真题成为大语言模型尤其是推理模型的「试炼场」，将考验它们的深度思考能力。

业内曾有着这样一种共识：大语言模型在文字水平上的表现令人印象深刻，但说到数学就不甚令人满意了。去年一度火出圈的「9.9 与 9.11」比大小的问题，包括 GPT-4o 在内的很多大模型都翻车了，直到深度推理模型出现后才从根本上改善了这一状况。

OpenAI 发布的 o1 模型在涉及复杂和专业的数理问题方面表现让人印象深刻，大模型在经过一定时间仔细思忖后，回答问题的能力和准确度大幅提升，这种被称为推理侧 Scaling Law 的现象已经成为继续推动大模型能力提升的关键力量。在黄仁勋最新 CES 2025 的演讲中，他也把测试时（即推理）Scaling 形容为大模型发展的三条曲线之一。

可以看到，继 o1 之后，国内大模型厂商也陆续推出了自己的深度推理模型，并在某些任务上有亮眼的表现。数了一下时间轴大概是这样的：

2024 年 11 月 21 日，深度求索团队发布 DeepSeek-r1 模型；
2024 年 11 月 28 日，阿里通义团队发布 QwQ 模型；
2024 年 12 月 16 日，月之暗面团队发布 Kimi-k1 模型；
2024 年 12 月 31 日，智谱 GLM 团队发布 GLM-Zero 模型；
2025 年 1 月 6 日，昆仑万维发布 Skywork-o1 模型。

大家也许会好奇，这些深度推理模型的能力（尤其是数学推理能力）到底有多强，又是谁能拔得头筹呢？这时就需要一场公平的标准化考试了。

清华 SuperBench 大模型测评团队（以下简称测评团队）为了全面评估这些模型在数学推理方面的能力，结合 2025 年考研数学（一、二、三）的试题，专门对以上各家深度推理模型进行了严格的评测。同时，为了确保评测的全面性，参与评测的还包括各家的旗舰基础模型。

此次选择的 13 个模型具体如下：

从结果来看，所有模型中以平均分计，第一名是 OpenAI 的 GPT-o1模型，这也是没什么意外的。第二名则是来自智谱的 GLM-Zero-Preview，它以三门数学平均 138.70 的成绩仅次于 o1，成为国产大模型第一，且距第一名不到 3 分。第三名则是来自通义的 QwQ。

测试方法

在本次评测过程中，测评团队发现并非所有模型均提供 API 支持，且部分提供 API 服务的模型在输出内容长度超出一定限制时，会出现内容截断的情况。为确保评测工作的公正性与准确性，测评团队决定统一采用各模型厂商的网页端进行测试操作。

在测试过程中，每道题目均在独立的对话窗口中进行，以此消除上下文信息对测试结果可能产生的干扰。

鉴于部分模型输出存在一定不稳定性，为降低由此引发的分数波动，测评团队设定当同一模型在三次测试中有两次及以上回答正确时，方将其记录为正确答案。

结果分析

接下来从测试总分、单张试卷分数、深度思考模型 vs 基础模型三个方面来详细分析此次测评的结果。

总分

对于总分数，测评团队对三张试卷的分数进行求和并计算平均值，按照分数高低进行排序。结果如下图所示：

从图中可以看到，GPT-o1 仍然处于领先的地位，是唯一一个达到 140 分以上的模型，相较于排名末位的 GPT-4，分数优势高达 70 分。

位于第二梯队（130 分以上）的模型有 GLM-zero-preview 和 QwQ，分别斩获 138.7 分和 137.0 分。

DeepSeek-r1-lite、Kimi-k1、Tiangong-o1-preview、DeepSeek-v3 则处于第三梯队（120 分以上）。

可以看出，深度思考模型普遍能够达到 120 + 的水平。这也彰显了深度思考模型在解决数学问题方面的强大能力。

值得注意的是，曾于 2023 年位居榜首的基础模型GPT-4，在本次测试中仅获 70.7 分，位列末席。这一结果表明，在过去一年（2024 年）中，语言模型在数学推理领域的进步显著。

而另一方面，在缺乏深度思考能力辅助的情况下，仅凭逻辑推理能力，DeepSeek-v3 作为基础模型，已经能够跻身第三梯队，这说明基础模型和深度思考模型之间的能力并非界限分明。

单张试卷分析

为了更清晰地展现大模型在各张试卷答题能力方面的表现，测评团队对每张试卷的错题分布情况进行了深入分析。

在数学一的评测过程中，GPT-o1、GLM-zero-preview、QwQ、DeepSeek-r1-lite 四款模型的得分相同。通过进一步剖析错题情况，测评团队发现所有模型均在第 20 题（12 分，涉及曲面积分求解）以及第 21 题第二问（6 分，涉及特征向量求解）上出现了错误。

在数学二的评测中，各模型的分数分布较为分散。经统计分析发现，第 3 题、第 5 题、第 7 题成为所有模型犯错的集中区域。具体错题分布情况如下图所示：

针对数学三的评测结果显示，模型出错的重灾区主要集中在第 14 题、第 15 题、第 16 题、第 19 题。相关错题分布情况如下图所示：

综合上述各试卷错题的具体分析，我们可以清晰地看到，GPT-o1（阴影列所示）在总计 66 道题目中，仅答错 3.5 道题；并且 GPT-o1 答错的题目，其他模型亦普遍存在错误，这显示了GPT-o1 目前依然是深度推理模型的天花板。

基础模型 vs 深度思考模型

最后，为了全面深入地探究各模型厂商在深度思考能力优化方面所取得的成果，测评团队对相应基础模型与深度思考模型进行了细致对比分析。

需要说明的是，此处对比并非意味着各深度思考模型是基于对应基础模型所做优化，其主要目的在于直观呈现各厂商在模型综合能力提升方面的进展与成效。

相关对比结果如下图所示：

注：OpenAI 的基础模型采用的是 GPT-4o。

通过对比分析，OpenAI 的深度思考模型 GPT-o1 相较于基础模型 GPT-4o，提升幅度最为显著，达到 57.3 分。紧随其后的是阿里的 Qwen 模型和智谱的 GLM 模型，提升幅度分别为 47.0 分和 34.3 分。

另外，深度求索和月之暗面的提升幅度相对较小，这主要是由于其基础模型本身分数较高。以深度求索为例，其基础模型 DeepSeek-v3 初始分数高达 120.3 分，在参评基础模型中位居榜首。

在本次测试中，测评团队选取表现最为优异的基础模型 DeepSeek-v3 作为参照基准，进而对各厂商深度思考模型的性能提升情况进行评估，相关数据呈现如下图所示：

可以看出，OpenAI、智谱、阿里在深度思考模型上的性能提升做了很大的优化，而 DeepSeek-v3 等其他模型在本项测试中的结果基本接近。

这些测试结果一一看下来，我们可以发现：虽然 OpenAI 的 o1 在深度推理方面仍然是最强的，但国产推理大模型正在逐渐缩小与它的差距，此次智谱 GLM-zero-preview 和阿里 QwQ 的成绩说明了这一点。

特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐

热点推荐

同花顺回应突然崩了：已修复，具体原因排查中

第一财经 2026-07-03 11:32:13
639 跟贴 639
俄罗斯宣布：芬兰已成核打击目标！

看看新闻Knews 2026-07-03 13:09:37
23017 跟贴 23017

美媒：台富豪认为台海紧张局势正恶化资产涌向新加坡

澎湃新闻 2026-07-03 22:22:09
1158 跟贴 1158

开了一次就“头晕”？看到机器上的英文单词，他觉得自己被骂了

北青网-北京青年报 2026-06-28 14:48:24
1827 跟贴 1827
国乒男单无缘美国大满贯8强

北京日报 2026-07-03 11:55:13
9650 跟贴 9650

泰山景区回应修建滚筒式刀片刺绳隔离铁丝网：与正常游览路线不交叉不重叠

北京日报客户端 2026-07-02 08:55:17
20359 跟贴 20359

官方报价40元的配件被维修师傅收150元格力售后回应

上游新闻 2026-07-03 12:34:32
1449 跟贴 1449
失踪近一年后，美国一实验室员工被曝曾参与量子物理项目：让物质“同时存在于两个地方”

红星新闻 2026-07-03 14:00:10
93 跟贴 93

大量欧洲客户从中国网购空调空运一台运费2000元

封面新闻 2026-07-03 11:45:25
6718 跟贴 6718
日印又提“旗舰项目” 印度首条高铁终于要成了

澎湃新闻 2026-07-04 07:00:16
16 跟贴 16
乌克兰或用弹道导弹袭击莫斯科，“回合制”互袭首都愈演愈烈

澎湃新闻 2026-07-03 21:24:29
132 跟贴 132
双色球第2026075期开奖后，游戏规则如何运行？

齐鲁壹点 2026-07-03 15:12:44
184 跟贴 184
C罗穿21号球衣致敬已故队友若塔

看看新闻Knews 2026-07-03 09:38:09
3852 跟贴 3852
清华教授举报蒋方舟，人大的调查结果何时公开，拖延平息不了事态

谭浩俊 2026-07-04 08:29:04
0 跟贴 0
特斯拉Model Y L在美国上市

界面新闻 2026-07-03 11:01:08
657 跟贴 657
央行开展万亿买断式逆回购精准对冲7月资金到期压力

财联社 2026-07-03 21:09:06
63 跟贴 63
俄罗斯采取措施稳定国内燃料供应

财联社 2026-07-03 12:02:03
1001 跟贴 1001
网传“南宁邕江主航道开放水上运动”系曲解误读（2026·07·03）

今日辟谣 2026-07-03 18:49:10
26 跟贴 26
哈兰德食谱曝光：生吃牛心牛肝每天摄入6000卡路里！

看看新闻Knews 2026-07-03 11:16:04
167 跟贴 167
藏马熊幼崽走失误闯牧民家，奶凶又怯生，拍摄者：并未私自圈养或伤害

潇湘晨报 2026-07-03 12:04:24
66 跟贴 66
7月5日起中国内地航线燃油附加费将下调

新京报 2026-07-03 17:13:10
159 跟贴 159
教育部：不得以“夏令营”等名义变相组织考试

央视新闻客户端 2026-07-03 11:29:18
377 跟贴 377
北约高级指挥官：欧洲已基本填补美国削减军力留下的缺口

财联社 2026-07-04 08:00:02
1 跟贴 1
女子自家种的黄瓜上长了一片叶子

潇湘晨报 2026-07-03 22:20:59
20 跟贴 20
刚果（金）沉船事故致20人死亡、逾百人失踪

新华社 2026-07-04 08:15:36
0 跟贴 0

中方罕见公开西太对峙细节！日舰模拟攻击辽宁舰，结果彻底沉默？

中方罕见公开西太对峙细节！日舰模拟攻击辽宁舰，结果彻底沉默？

时光流转追梦人

2026-06-30 16:17:21

4日凌晨大满贯：女单8强诞生，陈幸同强势横扫，莎莎下轮对手确定

4日凌晨大满贯：女单8强诞生，陈幸同强势横扫，莎莎下轮对手确定

行舟问茶

2026-07-04 06:03:42

密春雷9亿债务危机4年了，董卿没离婚没落魄，却悄悄布局一盘大棋

密春雷9亿债务危机4年了，董卿没离婚没落魄，却悄悄布局一盘大棋

娱小余

2026-06-27 22:42:52

去省厅报到遇前妻，她羞辱我不懂规矩，我坐上厅长位：你再说一遍

去省厅报到遇前妻，她羞辱我不懂规矩，我坐上厅长位：你再说一遍

千秋文化

2026-07-02 19:53:21

0-3温网大冷门，世界第9遭世界第74掀翻，梅德韦杰夫止步32强

0-3温网大冷门，世界第9遭世界第74掀翻，梅德韦杰夫止步32强

俯身冲顶

2026-07-04 00:08:08

我国和不丹为何争议区越来越少了？看看这些抵边村就知道了

我国和不丹为何争议区越来越少了？看看这些抵边村就知道了

老谢谈史

2026-05-10 02:51:04

世界杯：阿根廷3-2佛得角进16强！梅西破门+罗梅罗造乌龙绝杀

世界杯：阿根廷3-2佛得角进16强！梅西破门+罗梅罗造乌龙绝杀

乒烧泳球

2026-07-04 08:54:17

鲍鹏山：如果中国真的足够强大！我们没必要脆弱到那么害怕批评！

鲍鹏山：如果中国真的足够强大！我们没必要脆弱到那么害怕批评！

用冷眼洞悉世界

2026-06-24 00:44:14

唐嫣案判了！罗晋近况曝光,难堪一幕发生,原来他和辛柏青同病相怜

唐嫣案判了！罗晋近况曝光,难堪一幕发生,原来他和辛柏青同病相怜

情感大头说说

2026-07-03 16:56:13

曼联追楚阿梅尼恐成泡影，皇马官宣不签恩佐！需避免重蹈德容覆辙

曼联追楚阿梅尼恐成泡影，皇马官宣不签恩佐！需避免重蹈德容覆辙

罗米的曼联博客

2026-07-04 07:11:14

A股正在憋着一场阴谋

睿知睿见

2026-07-04 07:36:07

不甩亲妹争议！钟丽缇长女晒比基尼辣照　「岸边脱泳裤」曲线傲人

不甩亲妹争议！钟丽缇长女晒比基尼辣照　「岸边脱泳裤」曲线傲人

ETtoday星光云

2026-07-03 14:02:04

因男友嫌弃猫腿太短，妹子不想要了，网友开开心心来收猫，结果骂骂咧咧的走了！

因男友嫌弃猫腿太短，妹子不想要了，网友开开心心来收猫，结果骂骂咧咧的走了！

拜见喵主子

2026-07-03 11:46:52

伊朗给全球上了一课：要想赢得特朗普的尊敬，必须要打疼他

伊朗给全球上了一课：要想赢得特朗普的尊敬，必须要打疼他

福建睿平

2026-07-04 06:58:41

老公去世时我查出怀孕，公婆劝我打掉，7年后孩子进门他们红了眼

老公去世时我查出怀孕，公婆劝我打掉，7年后孩子进门他们红了眼

千秋文化

2026-07-02 19:38:21

曼晚：B费在本届世界杯表现挣扎，战术适配存在问题

曼晚：B费在本届世界杯表现挣扎，战术适配存在问题

懂球帝

2026-07-03 19:43:10

举报整整10个月无人问津，蒋方舟论文造假为什么今天才炸

举报整整10个月无人问津，蒋方舟论文造假为什么今天才炸

林子说事

2026-07-04 00:29:51

韩红基金会回应质疑，避谈明细评论区沦陷，曾说一包泡面都能公示

韩红基金会回应质疑，避谈明细评论区沦陷，曾说一包泡面都能公示

萌神木木

2026-07-02 21:13:20

贝隆：如今科技发展，球员都能踢到很大岁数，但梅西还是令人惊叹

贝隆：如今科技发展，球员都能踢到很大岁数，但梅西还是令人惊叹

兰亭墨未干

2026-07-03 15:14:11

韩红再次回应传闻：善款理财，利益输送，高价工资，网友不买账！

韩红再次回应传闻：善款理财，利益输送，高价工资，网友不买账！

眼光很亮

2026-07-03 08:05:06

机器之心Pro

专业的人工智能媒体

13427文章数 142686关注度

往期回顾全部

教育要闻

英国又一名校裁员！人文学科首当其冲，500名员工受影响

头条要闻

牛弹琴：很罕见普京突然穿上了军装

头条要闻

牛弹琴：很罕见普京突然穿上了军装

体育要闻

C罗穿已故队友若塔球衣谢场眼中含泪

娱乐要闻

海来阿木孕期出轨指控掀起全网热议

财经要闻

千亿茶市场无赢家:澜沧巨亏八马停"蹄"

科技要闻

万亿富豪马斯克舍不得特斯拉员工敞开用AI

汽车要闻

方程豹钛9内饰曝光用上了长联屏设计/下半年上市

态度原创

+arrTaiduYuanC[i].tag+' | '+arrTaiduYuanC[i].title+'
\

旅游

艺术

健康

房产

公开课

旅游要闻

全部免费！郑州7月4日-7月5日周末活动推荐

艺术要闻

这位女子，在画坛默默无闻，作品清新质朴

听说少吃点能抗衰老？专家讲解！

房产要闻

总裁空缺17个月、现金缺口超1000亿：金融局“局外人”入局万科

公开课

李玫瑾：为什么性格比能力更重要？

© 1997-2026 网易公司版权所有 About NetEase | 公司简介 | 联系方法 | 招聘信息 | 客户服务 | 隐私政策 | 不良信息举报 Complaint Center | 廉正举报 | 侵权投诉

无障碍浏览进入关怀版