网易首页 > 网易号 > 正文 申请入驻

看好了,这才是7家大模型做高考数学题的真实分数。

0
分享至

这两天,很多媒体都在写用AI考高考题的内容。

我本来真的没打算卷这个选题,因为知道大家肯定都会写,都会卷,我也想休息休息,真的就不打算写了。

但是吧,用AI测语文考试还没啥,但是看了一些用AI做数学考试的文章,真的给我看的一脸地铁老头表情包,就,那个测试方法,也特么太扯淡了。

我觉得既然是考试,那就公平公正的去测试?

当然,你要是玩整活,那就另谈了。

结果最后得出一些不太靠谱的结论,我觉得还是蛮误导大家的。

客观、公平、公正,是我觉得最核心的标准。

所以我觉得,我想按照我的玩法,再严谨一点的测一下大模纯数学能力型高考,给大家看一下,真实客观的评分。

测试试卷为2025年数学全国一卷。

测试规则如下:

1. 不考解答题(因为给我标准答案我也看不懂,不知道咋给分。。)

2. 所有的题目截图全部使用LaTeX编辑器转成LaTeX文本格式,再扔给大模型进行回答。

LaTeX是学术界最广泛使用的数学公式排版语言,能最精确地表达数学符号,我们考的是模型的数学能力,不是考模型的多模态识图能力,比如DeepSeek根本就没多模态,用的是OCR提取文本,很可能识别错误,所以截图上传不公平,一律转化成LaTeX格式再进行统一测试。

3. 剔除掉单选题第6题,因为这是单选、多选、填空题中唯一有图表的,转成文字可能会有理解歧义,同时就一题,影响不大,直接剔除。

4. 单题计分方法也依照高考判分原则:单选题7道,每道5分,选项正确计分,错误不得分;多选题3道,每道6分,全对计6分,漏选按正确答案数量计分,如答案为ABCD,漏选其一扣1.5分,错选不得分;填空题3道,每道5分,填空正确计分,错误不得分。

5. 每道题都会使用大模型跑3遍,根据正确比例进行分配,最大程度减少幻觉。比如OpenAI o3模型,做单选题第7题,对2次,错1次,则实际得分为5*0.66=3.3分。

6. 只开推理、不使用Prompt引导、不开联网、不允许写代码在沙盒进行计算,比如o3,我直接把这几个功能关掉了。

以上,就是全部规则了。

接下来,请我们的模型考生入场。

测试模型为OpenAI o3、Gemini 2.5 pro、DeepSeek R1 、豆包( 1.5-thinking-pro) 、元宝(混元T1)、千问3(235B)、讯飞星火X1,均为推理模型。

在晚上凌晨2点开始测试,因为搞API写脚本反而可能更麻烦,所以直接搞了个表格,复制粘贴测了,以至于喊了我的几个好朋友@卡尔的AI沃兹、@Max、@猫先生 一起测,硬生生测到凌晨4点。

7道单选题、3道多选题、3道填空题,总分一共68分。

我们得出了,我认为,非常公平客观的,每个模型的考试结果。

没有收任何家钱,也没有任何利益关系,全部客观公正。

如下图:

看看每一题的具体选项。

第9题是个非常神奇的题目,是个多选题,只有Gemini 2.5 Pro每次都对了,其他的所有大模型,几乎全都有问题,D选项倒是全都答出来了,但是缺了B。

而那个DeepSeek第11道题错的那道题,其实并不是真做错了,明明做对了,但是非要作死的瞎答,比如11题多选题,DeepSeek R1错了一道题。

但是我给你看看,它其实是这么错的。

真的,太抽象了。。。

再看看,最终分数。

Gemini确实非常强,在整个逻辑上,没有一题是错的。

而豆包、混元、星火位列第二梯队,在第9题上漏了一个选项,并列屈居第二。

DeepSeek半对半错了一个多选题,丢了0.7分,排名第五。

而Qwen3和OpenAI o3因为两个都错了1次填空题,只能被迫垫底。。

通过我的测试,我相信,大家应该对于模型的数学能力,有一些了解了。

其实,根本拉不开差距,出错一般也都是小小的幻觉。

高考对于现在绝大多数的推理大模型来说,其实真的就是,没有特别大的难度,跟2023年的时候,真的是天壤之别。

很多测出来测的非常离谱的文章,其实最后答案错了,跟推理模型本身没有半毛钱关系,而是你把截图扔过去,各种符号啥的识别错误。

比如 则 \complement_{U} A,硬生生识别成了CuA。

所以,折腾到现在,这场公平、客观的AI数学高考终于落幕了。

在打完最后一个结果的时候,我松了一口气。

其实吧,我们不睡觉,熬夜折腾这么久,想得出的并不仅仅是一个简单的分数。

而是我们我们想知道,怎么才算是一场合格的AI考试。

规则公正,流程严谨,技术中立,少一点博眼球的夸张,多一点对真相的执着。

我始终相信,无论是对技术,还是对人生,严谨总能让我们更接近真实。

而真实,总能让我们更加自由。

睡觉。

起床以后,一定又是美好的一天。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。

>/ 作者:卡兹克

>/ 投稿或爆料,请联系邮箱:wzglyay@virxact.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中超第6轮跑动距离榜:周定洋13673米登顶,严鼎皓排第二

中超第6轮跑动距离榜:周定洋13673米登顶,严鼎皓排第二

懂球帝
2026-04-19 22:16:18
长治商场女子坠楼后续:知情人曝现场细节,商场次日营业惹争议

长治商场女子坠楼后续:知情人曝现场细节,商场次日营业惹争议

奇思妙想草叶君
2026-04-19 23:35:25
赔光2亿后,冉莹颖独自搬家30箱未给邹市明留体面

赔光2亿后,冉莹颖独自搬家30箱未给邹市明留体面

春之韵
2026-03-18 09:32:52
贺娇龙账号时隔3个月更新:官方已开通新账号,“90后”清华研究生成为新任“推荐官”

贺娇龙账号时隔3个月更新:官方已开通新账号,“90后”清华研究生成为新任“推荐官”

大象新闻
2026-04-19 23:43:05
男人的生理需求能有多难忍?网友:我对我老公只有动物本能

男人的生理需求能有多难忍?网友:我对我老公只有动物本能

番外行
2026-04-02 08:37:13
都想错了,巴基斯坦购买歼-35战机,根本不是为了对付印度!

都想错了,巴基斯坦购买歼-35战机,根本不是为了对付印度!

大黑爱旅游
2026-04-17 17:56:33
面相大变?那个砸神像、睡坟场“八字命硬”的网红,如今差别太大

面相大变?那个砸神像、睡坟场“八字命硬”的网红,如今差别太大

鲸探所长
2026-03-30 19:37:08
美国洛马怎么也没想到,没缴中国的990亿罚单,后果竟如此严重了

美国洛马怎么也没想到,没缴中国的990亿罚单,后果竟如此严重了

叹知
2026-04-19 21:19:26
001308,拟10派6元!又有超10家A股公司披露分红预案!

001308,拟10派6元!又有超10家A股公司披露分红预案!

证券时报e公司
2026-04-19 20:20:35
法国情侣在泰国海滩“啪啪啪”,被捕后遮脸!当地人怒了!

法国情侣在泰国海滩“啪啪啪”,被捕后遮脸!当地人怒了!

新欧洲
2026-04-18 17:15:30
网友喊话让何润东代言霸王茶姬,此前他已接到多个商务合作,最近30天抖音涨粉近200万,品牌客服回应

网友喊话让何润东代言霸王茶姬,此前他已接到多个商务合作,最近30天抖音涨粉近200万,品牌客服回应

极目新闻
2026-04-19 17:19:41
你们都是什么时候对男女之事开窍的?网友:果然还是拦不住有心人

你们都是什么时候对男女之事开窍的?网友:果然还是拦不住有心人

夜深爱杂谈
2026-02-21 21:37:02
同一套“民生投降论”,为何在乌克兰与伊朗身上轮番上演

同一套“民生投降论”,为何在乌克兰与伊朗身上轮番上演

律法刑道
2026-03-22 10:37:01
撕破脸!郑丽文公开炮轰卢秀燕,蓝营内斗彻底公开化!

撕破脸!郑丽文公开炮轰卢秀燕,蓝营内斗彻底公开化!

达文西看世界
2026-03-25 10:53:39
人穷能卑微到什么地步?网友说:一个男人两千块买了我三个晚上!

人穷能卑微到什么地步?网友说:一个男人两千块买了我三个晚上!

黯泉
2026-04-14 12:13:04
《火遮眼》评分满分,被誉为年度最佳动作片,谢苗将成好莱坞巨星

《火遮眼》评分满分,被誉为年度最佳动作片,谢苗将成好莱坞巨星

影视高原说
2026-04-17 17:46:35
西方正制造一个可怕的共识:对华战争,可无视道德底线和伦理原则

西方正制造一个可怕的共识:对华战争,可无视道德底线和伦理原则

小噎论事
2026-04-04 07:22:13
新加坡已经成功预测中美冲突,一旦爆发,美称中国不能攻打美本土

新加坡已经成功预测中美冲突,一旦爆发,美称中国不能攻打美本土

起喜电影
2026-04-16 01:05:59
那方面能力最强的星座TOP3,有你吗?

那方面能力最强的星座TOP3,有你吗?

同道大叔
2026-04-09 22:04:18
给人养了7年闲人,广汽终于要关闭洛杉矶的研发中心

给人养了7年闲人,广汽终于要关闭洛杉矶的研发中心

与车同乐
2025-12-04 10:05:02
2026-04-20 02:07:00
数字生命卡兹克 incentive-icons
数字生命卡兹克
反复横跳于不同的AI领域,努力分享一些很酷的AI干货
501文章数 626关注度
往期回顾 全部

教育要闻

五年级女孩着装风波:时尚认知与教育的碰撞

头条要闻

半年下沉22厘米 女子家中坐拥价值上亿别墅却没法住人

头条要闻

半年下沉22厘米 女子家中坐拥价值上亿别墅却没法住人

体育要闻

湖人1比0火箭:老詹比乌度卡像教练

娱乐要闻

何润东涨粉百万!内娱隔空掀桌第一人

财经要闻

华谊兄弟,8年亏光85亿

科技要闻

50分26秒破人类纪录!300台机器人狂飙半马

汽车要闻

29分钟大定破万 极氪8X为什么这么多人买?

态度原创

游戏
教育
健康
房产
军事航空

如何将ZH-1火力最大化?《战舰世界》15.3版本造船厂加点攻略

教育要闻

655家单位、1.29万个岗位,湖南用心帮大学生找工作

干细胞抗衰4大误区,90%的人都中招

房产要闻

官宣签约最强城更!海口楼市,突然杀入神秘房企!

军事要闻

伊朗逼退美扫雷艇:美方求给15分钟撤退

无障碍浏览 进入关怀版