网易首页 > 网易号 > 正文 申请入驻

10万token自然语言推理,让30B-A3B模型站上奥赛金牌线

0
分享至



奥赛级科学推理,一定要从更大的通用模型开始吗?

最近上海人工智能实验室一份技术报告给出了一个不同答案:不调用外部工具、不执行代码、不接入专用符号求解器,一个 30B-A3B 规模的推理模型,也可以通过统一后训练和推理时扩展,在 IMO、USAMO、IPhO 等高难数学与物理奥赛评测中达到强劲水平。

研究团队选择从已有 30B-A3B 推理主干出发,先用约 33.8 万条高质量轨迹进行反向困惑度课程监督微调,再通过 200 步两阶段强化学习提升解题能力与完整证明质量,最后在推理阶段采用多轮「生成 - 验证 - 修正」循环。模型不调用外部工具、不执行代码、不依赖专用符号求解器,却能够在困难奥赛题上持续开展 10 万词元以上的自然语言推理。

在比赛式评测中,模型经过推理阶段扩展后,在 IMO 2025 和 USAMO 2026 中均取得 35 分,达到对应金牌级水平;在 IPhO 2024/2025 等物理奥赛任务上也达到金牌水平。在 USAMO 2026 第三题(人类选手平均分仅 0.01 分,无人过 5 分)上更是取得满分。

更重要的是,这并非来自参数惊人的「巨无霸」模型,而是一个小而精的 30B-A3B 选手。

报告还显示,在 USAMO 2026 的推理扩展轨迹中,初始解答生成的中位长度约为 10.6 万 token,自我修正阶段中位长度约为 8.3 万 token。

这表明,奥赛级科学推理的关键不只是模型规模本身,而在于能否让模型把更长的推理预算稳定转化为证明搜索、自我验证和论证修复能力。



  • 论文链接:https://arxiv.org/abs/2605.13301
  • 开源链接:https://github.com/Simplified-Reasoning/SU-01

一般尺寸模型,也能做奥赛级证明?

奥林匹克竞赛题一直是检验模型长程推理能力的硬场景。这类题目和常规数学问答不同, 一个正确结论远远不够,模型还必须在很长的解题链路中持续管理假设、中间结论和边界情形,最终给出能够经受严格评分的完整证明或推导。隐藏的论证缺口、未覆盖的分类讨论、未经证明的关键引理,都可能让整题失分。

因此,在过去相当长一段时间里,人们很自然地把奥赛级推理和一个条件绑定在一起:更大的通用模型底座。这份报告想回答的正是这一问题:

奥赛级推理任务,是否必须依赖更大、更强的通用模型?

研究团队的选择相当克制:不引入外部工具,不执行代码,不依赖符号求解器。模型从构思、证明、检查到修正,全部在自然语言中完成。

这样一来,结果更直接地指向模型自身的能力:一个 30B-A3B 规模的模型,仅靠自然语言推理,能否承担奥赛级证明?

先教会模型严谨推理,再让它学会自我修正

团队提出的简洁统一方案可以概括为三个环节:监督微调塑造行为,强化学习提升解题能力,推理阶段扩展放大证明搜索。



图 1:方法框架,整体流程以 30B-A3B 推理主干为基础,通过监督微调、两阶段强化学习和推理阶段扩展,将模型塑造成能够进行证明搜索、自我验证和多轮修正的自然语言推理系统。

第一步是反向困惑度课程监督微调。研究团队从数学、科学、代码和指令跟随等来源构建长链路推理数据,并加入自验证、自修正样本,使模型学习如何组织证明、检查假设、定位漏洞并修复论证。训练过程中,样本按照初始模型困惑度从高到低排序:模型先接触与当前策略差异更大的证明轨迹,再逐步巩固更熟悉的样本。

换言之,SFT 阶段的目标并不是依靠海量数据直接堆高模型能力,而是更稳定地重塑模型的推理行为,使其形成严谨、可检查、可修正的长程推理模式。

第二步是两阶段强化学习。第一阶段使用可验证题目和可靠的结果奖励,高效提升模型的直接求解能力;第二阶段则进一步从「答案是否正确」转向「证明是否完整可靠」,引入证明质量奖励模型、自修正任务和经验回放机制。

其中,自修正任务让模型在看到自身不完整或存在漏洞的解答后,学习如何重新检查推理链条并生成更完整和严谨的修正版证明;经验回放机制则用于保留训练过程中少量但高价值的成功证明轨迹,避免这些在高难问题上偶然发现的有效解法被很快遗忘。

第三步在推理阶段扩展。面对奥赛难题,模型并不只生成一次答案,而是进入「生成候选解答 - 检查完整证明 - 定位问题 - 修正解答」的循环。这里扩展的不是外部工具链,而是模型自身的自然语言验证与修正计算。

10 万 token 级奥赛推理,不只是把答案写长



图 2:IMO-Bench 所含 ProofBench 结果。 SU-01 在直接生成时取得 57.6%,经推理阶段扩展提升至 70.2%,显著超越同尺寸模型,并 Gemini 3.1 Pro Thinking 等强闭源模型。

报告结果显示,SU-01 在证明级评测中已经展现出强长程推理能力。在 IMO-ProofBench 上,SU-01 直接生成取得 57.6%,已是同尺寸模型中的最强结果;经推理阶段扩展后,整体得分进一步提升至 70.2%,显著超越同尺寸模型,并接近 Gemini 3.1 Pro Thinking 的 72.6%。

这说明,一般尺寸模型不仅可以追求最终答案正确,也可以通过统一训练与推理组织提升完整证明质量。

报告还进一步指出,SU-01 的能力并不局限于竞赛题。在更接近科研问题形态的 FrontierScience-Research 评测中,SU-01 取得同尺寸模型中的最佳成绩,说明这套训练方案不仅适用于奥赛基准,也具备向研究型科学问题泛化的潜力。



图 2:USAMO 2026 推理阶段扩展流程中不同动作的生成长度分布。

推理阶段扩展进一步放大了模型的证明搜索和自我修正能力。通过「生成候选解答 - 检查完整证明 - 定位问题 - 修正解答」的多轮循环,模型能够把不完整或不稳定的尝试转化为严谨连贯的完整解答。

报告中的推理扩展分析显示,在 USAMO 2026 的推理扩展轨迹中,初始解答生成的中位长度约 10.6 万词元,修正阶段的中位长度约 8.3 万词元。

换言之,模型在 30B-A3B 规模下仍能持续开展 10 万词元量级的有效推理,并将长程计算用于证明构造、漏洞定位和论证修复。

数学与物理奥赛金牌水平推理

在奥林匹克官方竞赛题上,SU-01 在数学奥赛和物理奥赛任务上均展现出金牌水平推理能力。

数学奥赛方面,模型在单次直接生成时已经具备较强解题能力:IMO 2025 取得 21 分,在 P2 获得满分,在 P4、P5 上接近满分;USAMO 2026 取得 15 分,在 P1、P4 获得满分。经推理阶段扩展后,模型在 IMO 2025 和 USAMO 2026 均取得 35 分,达到对应金牌级水平。



表 1:数学奥林匹克竞赛评测结果。评测涵盖 IMO 2025 和 USAMO 2026 两项赛事;其中,IMO 2025 的金 / 银 / 铜牌线为 35/28/19 分,USAMO 2026 的金 / 银 / 铜牌线为 25/18/11 分。

尤其在最近的美国数学奥林匹克 USAMO 2026 上,SU-01 取得 35 分,远超该赛事 25 分的金牌线,并达到人类选手最高分水平。

根据 340 名人类选手的得分统计,USAMO 2026 平均分为 8.59 分,中位数仅为 6 分,Top 12 分数线为 26 分、Top 24 分数线为 23 分,整场最高分为 35 分;从分题统计看,P2、P3、P6 难度尤其突出,其中 P3 平均分仅 0.01 分、无人达到 5 分以上,而 SU-01 在该题取得满分成绩。



图 4 :USAMO 2026 人类选手得分统计与分题难度分布。该赛事共有 340 名选手参赛,平均分为 8.59 分,中位数为 6 分,Top 12 和 Top 24 分数线分别为 26 分和 23 分,最高分为 35 分。分题统计显示,P2、P3、P6 难度突出,其中 P3 平均分仅 0.01 分,且无人达到 5 分以上。(来源https://web.evanchen.cc/exams/posted-usamo-statistics.pdf)


这说明 SU-01 的 35 分并非主要来自常规题的得分,而是在高难证明题上取得关键突破,整体表现达到了顶尖人类选手水平。

一个特别突出的例子是 USAMO 2026 P3:模型没有沿用标准的综合几何路线,而是优雅地使用复数方法,将单位圆、等边三角形旋转、弦关系和切线条件统一到同一个代数框架中。这将一个奥赛选手通常会通过角追踪和辅助构造处理的几何配置,转化为一种结构化的解析表述。

IMO 2025 P2 则展示了另一种互补能力,模型将一个涉及两相交圆、垂心和切线判定的几何问题,化约为坐标与距离计算。

其他有趣的案例还包括 USAMO P4 中的进位状态动态规划,以及 USAMO P6 中结合欧拉函数、同余、Vieta jumping 和 Fibonacci 结构的数论证明。

物理奥赛方面,模型在 IPhO 2024/2025 直接生成已超过金牌线,推理阶段扩展后进一步提升。



表 2:物理奥林匹克竞赛评测结果。评测涵盖 IPhO 2024 和 IPhO 2025 两项赛事;其中,IPhO 2024 金牌线为 20.8 分,IPhO 2025 金牌线为 19.7 分。表中 x /y 分别表示模型在直接生成和推理阶段扩展设置下的得分。

更高效的科学推理系统路线

这项工作的价值不止于奥赛分数,而在于验证了一条更高效的科学推理系统路线:以已有推理模型为起点,通过严谨推理行为塑造、证明级奖励设计和推理时「生成 - 验证 - 修正」闭环,将有限规模模型的计算预算转化为可评分、可验证的证明能力。

面向未来,这一路线有望从数学与物理奥赛扩展到更广泛的科学问题求解,成为构建高效、可靠、可验证科学智能系统的通用方法。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
河南西平县发生五人灭门惨案?驻马店网信办:系谣言

河南西平县发生五人灭门惨案?驻马店网信办:系谣言

界面新闻
2026-08-03 21:47:20
3名辅警在非管辖区查醉驾“以罚代刑”致1死,还多次收钱对酒驾、无证驾驶等不予处罚!一审判了

3名辅警在非管辖区查醉驾“以罚代刑”致1死,还多次收钱对酒驾、无证驾驶等不予处罚!一审判了

红星新闻
2026-08-03 15:55:08
瑙鲁正式更改国名

瑙鲁正式更改国名

澎湃新闻
2026-08-03 23:29:11
央视提醒后才发现,手机相册可能比聊天记录还危险

央视提醒后才发现,手机相册可能比聊天记录还危险

小虎新车推荐员
2026-08-03 07:29:33
火焰山中,重大发现!

火焰山中,重大发现!

中国新闻周刊
2026-08-03 07:27:14
奖励1万!董路寻找泰国10岁黑人年龄造假证据 名记:他父亲是假的

奖励1万!董路寻找泰国10岁黑人年龄造假证据 名记:他父亲是假的

念洲
2026-08-03 07:41:12
U17国足开门红!压哨绝杀阿森纳,赵松源独造两球,周二将战毕巴

U17国足开门红!压哨绝杀阿森纳,赵松源独造两球,周二将战毕巴

奥拜尔
2026-08-03 21:38:52
银鹭与男子因兑奖发生纠纷后,转账1万元并附言“敲诈”,双方均称已报警,市监部门:正处理

银鹭与男子因兑奖发生纠纷后,转账1万元并附言“敲诈”,双方均称已报警,市监部门:正处理

极目新闻
2026-08-03 20:52:08
3000头猪饿死,亿万身家沦为负债3000万,谁来买单?

3000头猪饿死,亿万身家沦为负债3000万,谁来买单?

雾满拦江
2026-08-03 12:24:51
上海这起和稀泥事件,多么荒唐才能当做正面典型

上海这起和稀泥事件,多么荒唐才能当做正面典型

吴女士
2026-08-03 08:19:26
真的太瘦了!王思聪新女友的酒店照被扒,四肢纤细,身形如同轻薄的纸片

真的太瘦了!王思聪新女友的酒店照被扒,四肢纤细,身形如同轻薄的纸片

火山詩话
2026-08-03 07:07:29
第二个富士康?宣布全线搬迁、近10万工人丢掉饭碗,央媒早有预警

第二个富士康?宣布全线搬迁、近10万工人丢掉饭碗,央媒早有预警

云舟史策
2026-08-03 11:48:56
最新后续!威胁浙江捐日军罪证的少年找到了,已有一人被警方传唤

最新后续!威胁浙江捐日军罪证的少年找到了,已有一人被警方传唤

人工岛分布
2026-08-03 05:32:11
传统玩具“竹知了”相关短视频被华为大规模投诉下架!网友懵了:没提余承东名字 没骂华为也侵权?

传统玩具“竹知了”相关短视频被华为大规模投诉下架!网友懵了:没提余承东名字 没骂华为也侵权?

闪电新闻
2026-08-03 08:38:39
“竹知了”事件持续发酵,胡锡进劝余承东要大气,华为这方面要向农夫山泉学习

“竹知了”事件持续发酵,胡锡进劝余承东要大气,华为这方面要向农夫山泉学习

Mr王的饭后茶
2026-08-03 23:25:31
官媒也下场了!华为投诉“竹知了”玩具,越投诉越火,公关彻底翻车!

官媒也下场了!华为投诉“竹知了”玩具,越投诉越火,公关彻底翻车!

一个有灵魂的作者
2026-08-03 16:25:30
饶毅教授说得太好了:今天的中国,没有一个人有资格说回国是爱国

饶毅教授说得太好了:今天的中国,没有一个人有资格说回国是爱国

读鬼笔记
2026-08-03 13:50:50
深夜11股提前发中报,2股业绩大超预期,6股暴雷,别搞错方向

深夜11股提前发中报,2股业绩大超预期,6股暴雷,别搞错方向

风风顺
2026-08-04 03:00:03
扎哈罗娃称,发生在莫斯科的爆炸事件表明,乌克兰的袭击目标是意大利

扎哈罗娃称,发生在莫斯科的爆炸事件表明,乌克兰的袭击目标是意大利

山河路口
2026-08-03 20:01:10
出狱人员纷纷吐槽:如今坐牢,和几十年前大不一样!说出来不敢信

出狱人员纷纷吐槽:如今坐牢,和几十年前大不一样!说出来不敢信

云景侃记
2026-06-21 09:26:20
2026-08-04 05:03:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13664文章数 142710关注度
往期回顾 全部

科技要闻

“像魔法一样”的AI,只卖几分钱

头条要闻

特朗普:2029年1月前控制格陵兰岛

头条要闻

特朗普:2029年1月前控制格陵兰岛

体育要闻

马克龙介入FIFA危机 致电因凡蒂诺勿搞分裂

娱乐要闻

陈璇半蹲采访诺兰惹争议

财经要闻

美日联手,救得了日元吗?

汽车要闻

方程S系列将于成都车展发布内饰 9月上旬新车上市即交付

态度原创

艺术
教育
健康
时尚
公开课

艺术要闻

颠覆认知!这份中国最美榜单出炉,第一名竟不是九寨沟?看完第一个我就坐不住了!

教育要闻

关注:今年9月,南京一批学校停招、更名、合并!

干细胞和衰老有什么联系?

刘亦菲又美上了热搜!她的“减龄扎发”普通人也可以照着学

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版