网易首页 > 网易号 > 正文 申请入驻

AI科研范式革命:花200美元即可攻克一道数学世纪难题

0
分享至


OpenAI日前确认,其下一代模型Astra以约2000美元推理成本攻克了十道数学与理论计算机科学前沿难题,全部成果通过Lean形式化验证,代码开放在GitHub仓库中。这些难题涵盖高维球堆积、编码理论、群论、量子复杂性和极值组合学等多个领域,每道题学术积压均超十年。

需要说明的是,这十道题是从多次尝试中筛选出的成功案例。

据OpenAI披露,模型在早期探索阶段存在大量失败,GPT-5.2 Pro对Erdős问题的一次通过率仅1%-2%。Astra呈现的是“成功精选集”,而非无差别的全面碾压。

即便如此,Astra交出的成绩单仍然是一道分水岭:AI已从“解已知答案的题”跨越为“产出人类也未知的原创证明”。AI不再是科研的“助手”,而是科研的“参与者”。此次重塑基础科学发现范式的不是单一技术突破,是形式化验证、多智能体协同与成本崩塌三股力量的交汇。

从“解题”到“发现”

要理解Astra十题意味着什么,必须回溯AI数学能力的进化曲线。

2025年10月,OpenAI宣称GPT-5解决了十个Erdős问题,但随后被澄清——GPT-5所做的不是原创证明,而是文献搜索,在已有论文中找到了未被数据库收录的解答。AI擅长检索,不证明AI擅长创造。

转折发生在2026年1月。软件工程师Neel Somani使用GPT-5.2 Pro在短时间内生成了一份Erdős问题#397的原创证明,经Harmonic的Aristotle系统完成Lean形式化验证,菲尔兹奖得主陶哲轩亲自确认该证明为此前文献中不存在的新论证。随后问题#728和#729也在此后数日内相继被攻克。

今年5月20日,OpenAI内部通用推理模型推翻了平面单位距离问题的核心猜想,一个自1946年提出、近80年无人撼动的离散几何命题。AI找到了一族反例,核心思路借用了代数数论领域的Golod-Shafarevich定理,实现了多项式级别的改进。菲尔兹奖得主Tim Gowers称之为“AI数学的里程碑”。

从GPT-5的“查资料”到GPT-5.2的“原创三题”,再到5月模型“推翻80年猜想”,最后到Astra的“2000美元横扫十题”,八个多月的时间,AI完成了从“图书馆管理员”到“独立研究者”的跃迁。


AI数学能力进化时间线,从文献检索到独立发现,八个月完成角色跃迁

  • 多智能体协同:从“一人解题”到“团队作战”

Astra的核心不是参数规模更大,而是组织方式根本不同。据报道,Astra可以让多个智能体协同工作,拆分复杂任务、分配子目标、相互校验,并在数小时甚至数天内持续推进。十个开放问题不是由一个模型一口气推导出来的,而是由一个协调者将问题拆解为子命题,分配给不同专长的子智能体并行执行,再由验证智能体筛选、合并、检查逻辑一致性。

这一流程与人类数学研究团队的组织方式高度同构。Anthropic的Managed Agents、OpenAI的Agents SDK、微软Agent Framework 1.0、LangChain的supervisor-as-tool,四家主流厂商的共识是:让多个AI自由讨论不是最优方案,一个管理者分配任务、多个执行者交付结果才是。

  • 全球共振:不止OpenAI一家

Astra并非孤例。Google DeepMind的AlphaProof Nexus自主解决了9个Erdős开放问题,其中最早一题已困扰学界56年,单题成本最低仅7.5美元。北京大学AI4Math团队采用双智能体框架(Rethlas+Archon)推翻Anderson猜想,完成国内首次由AI自主解决数学开放问题并完成大规模形式化验证,生成了约19000行Lean代码。Math Inc的Gauss在5天内完成了8维(E8)情形的球堆积定理形式化,随后再用约一周完成24维(Leech格)情形,总计产出约20万行Lean代码(经优化后),原人类团队估计剩余工作量需6个月。

此外,Anthropic、字节跳动Seed-Prover、月之暗面Kimina-Prover、DeepSeek-Prover-V2等系统也在各自方向推进神经定理证明的自动化。形式化推理赛道已经形成全球性竞争格局。

如果说上述突破展示了AI“能做数学”的能力,那么下一个问题就是:我们如何信任AI产出的数学结果?这正是Lean形式化验证所要回答的。

信任锚点

如果没有Lean,以上所有突破都缺少一个关键环节——可验证性。

Lean是一种交互式定理证明器,由微软研究院开发,将数学证明写成可被计算机逐行检查的代码。不同于传统学术论文依赖同行评议的主观判断,Lean验证是二进制的,要么编译通过,要么报错。一旦一个证明在Lean中“编译”成功,它就不需要人类相信它,它本身就是正确的。Astra十项成果的GitHub仓库中“sorry”计数为零,意味着形式化证明中无任何步骤遗漏或未证。

大语言模型的“虚假推理”问题在科研场景中是一个不可忽视的风险:同行评议精力、复现预算、沿着错误方向继续深挖的研究周期,都可能被“看起来对”的AI生成论文无声吞噬。Lean提供了独立于AI的“终极裁判”系统,人类不需要逐行审阅AI产出的数千行推理,只需确认Lean编译器通过了即可。

产业界已率先为形式化验证买单。在芯片验证领域,25岁华人创业者洪乐潼创立的Axiom Math,据公司披露其AxiomProver系统在2025年12月Putnam数学竞赛中获得满分12/12的成绩,公司于2026年3月以超16亿美元估值完成2亿美元A轮融资。在密码学领域,形式化验证正在被用于后量子密码原语的安全性证明。在生物医药领域,形式化推理框架向“靶点-疾病”因果链推演的迁移也已进入早期探索阶段。


Lean形式化验证生态关键指标,Mathlib已积累超27万条已形式化定理

据Mines Paris PSL官方数据,Lean数学库Mathlib已积累约210万行代码、超27万条已形式化的定理。Meta的ATLAS项目消耗1830亿token,将26本数学教材翻译为Lean代码库。让机器自动检查“是不是对的”的能力,正在从增值功能变成基础设施。

形式化验证解决了“可信度”问题,但另一个更根本性的变化正在发生,科研的成本结构正在被重写。

成本崩塌:从百万美元到两百美元

2000美元这个数字,是Astra故事中最具冲击力的细节,但需要明确的是,这仅指推理算力的边际成本,不包括模型训练(数亿美元级)、基础设施投资以及人类研究者的选题与验证时间。

即便如此,边际成本的下降幅度仍然惊人。传统数学研究中,一个Erdős级别的开放问题可能需要一位顶尖数学家耗费数年甚至数十年,背后是终身教职的薪资、研究经费、博士生培养费用,折算成本在百万美元量级以上。Astra以2000美元攻克十题,平均每题200美元,约相当于一个初级软件工程师一周的工资

这是成本结构的崩塌。

成本下行趋势同样值得关注。2026年5月单位距离问题,推理成本约1000美元。2026年8月Astra十题合计2000美元,平均每题200美元。同期DeepMind AlphaProof Nexus单题成本最低仅7.5美元。同代模型的推理优化、专用硬件普及、多智能体架构对token利用效率的提升,都将在Astra发布后继续压缩这个数字。


AI数学难题推理成本下降趋势,从单题1000美元降至7.5美元

当解决一个前沿数学猜想的边际成本降到200美元以下,“只有天才数学家才能做前沿数学”这个隐含前提开始松动。

  • 密码学冲击波

成本下降最直接的连锁反应发生在密码学领域。7月28日,Anthropic披露Claude Mythos Preview在约60小时、10万美元成本内,发现了NIST后量子签名候选算法HAWK-256的格结构对称性缺陷,将密钥恢复的理论工作量从2的64次方降至2的38次方。次日,HAWK开发者宣布从NIST标准化进程中撤回该方案。

这不是量子计算机攻破RSA,这是纯粹由AI推理能力驱动的密码分析,不需要量子比特,不需要超低温冷却。当多智能体系统能以200美元一题的边际成本求解开放数学问题时,密码学家面临的不再是“AI能不能找到漏洞”,而是“低成本密码分析何时平民化”。

  • 科研预算结构重配

科研能耗正从实验密集型转向推理密集型。高校计算中心的采购清单将从“更多GPU”扩展为“更多能跑形式化推理管线的算力配额”。OpenAI于7月29日推出的“ChatGPT学术研究者计划”向十万名科学家免费提供前沿模型访问权限,承诺到2027年前投入2.5亿美元——表面上是公益,本质上是在下一代科研范式中抢占用户习惯。

成本的急剧下降正在将一个问题推向台前:当AI能够以极低成本产出数学成果时,数学家自身的存在价值又该如何定义?

科学家从“证明者”走向“提问者”

6月2日,国际数学联盟(IMU)正式背书《莱顿人工智能与数学宣言》。截至撰写时,该宣言已获超过3000人签署,陶哲轩称其为“必要框架”,多位菲尔兹奖得主也已签署。《自然》杂志于6月18日发表社论全面支持,呼吁其他学科效仿。

宣言指出AI对数学的五大威胁:不可靠结果、归属缺失、依赖不平等、过度炒作、自主性丧失。OpenAI在其Astra报告中回应了这些关切,承认AI有“贡献”,既不是把AI当成无生命的工具,也不是赋予AI作者身份,而是把人类放在“最终承担责任”的位置。

  • AI的边界与科学家的新定位

Astra解决的是“证明一个长期猜想是否成立”的证明型突破。而“提出一个全新交叉方向、需要直觉跳跃的猜想”的概念型突破,依然是人类最稀缺的能力。不过,单位距离问题的突破也展示了AI超出预期的跨域联想能力,它将代数数论的Golod-Shafarevich理论应用于离散几何,这种跨学科联系被数学家Arul Shankar评价为“具备原创、精妙的独立思想”。AI的跨域联想能力正在快速进步

随着Astra可以200美元一题解决开放难题,人类数学家的工作重心将从“产生证明”向上游迁移到“提出好问题”。莱顿宣言的务实建议是:人类研究者选择问题、设定标准、批判想法、验证结果;AI贡献广度、速度和并行探索能力。

陶哲轩在2026年初的演讲中判断:“AI将成为数学研究中值得信赖的合作者。”Tim Gowers在5月20日当晚最初误以为AI“证明”了单位距离猜想,写道:“如果AI能想出这样的证明,数学家的好日子可能很快就要结束了。”但次日他得知AI是“推翻”了猜想(而非证明),明确表示“如释重负”。这一细节折射出数学界对AI能力的复杂心态,既为其潜力震撼,又为其边界感到宽慰。

  • 验证机制的递归困境

如果Astra能以每天几十个问题的速度产生候选解,当前人类同行评议体系根本消化不了这个流量。Lean形式化验证提供了部分答案,但将自然语言证明翻译为Lean代码本身也需要成本。AI辅助的自动形式化正在缩小这个差距,但远未达到即插即用的水平。

于是出现一个绕不过去的困境:要规模化验证AI产生的数学结果,我们需要AI来自动化验证过程——但这又回到了“谁来验证验证AI的AI”的递归问题。当AI产出速度是人类验证速度的百倍以上时,最终裁决权可能退化为抽样检查权,而系统性犯错的风险窗口始终存在。

2000美元不是奥尔特曼在国会山抛出的营销数字,它是一道分水岭。在这条线的左边,科学发现是人类智力的专属领地,昂贵、缓慢、依赖天才的偶然出现。在这条线的右边,科学发现开始变成一种可以被工程化、被规模化、被定价的服务。

当一个数学猜想的边际解决成本降到200美元,它就不再是“科研”,它变成了“查询”,“做科研”这件事本身的成本结构也正在被重新定义。从历史经验看,重新定义成本结构往往意味着产业变革的开始。

基础科学的前沿发现,不再是一件只有人类才能做的事。但“什么值得发现”、“发现之后如何理解”、“谁来为发现负责”。这些问题,仍然只属于人类。(本文首发钛媒体APP,作者 | 硅谷Tech-news,编辑 | 焦燕)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
开票3分钟售罄!辽宁德比一票难求,加开3趟球迷专列

开票3分钟售罄!辽宁德比一票难求,加开3趟球迷专列

小金体坛大视野
2026-08-03 18:21:43
读《羊脂球》发现:跟任何人交往,只要你表现出讨好、迎合、没主见,对方就会得寸进尺,这样只会让你越来越廉价,正确的做法是做到这两条

读《羊脂球》发现:跟任何人交往,只要你表现出讨好、迎合、没主见,对方就会得寸进尺,这样只会让你越来越廉价,正确的做法是做到这两条

心理观察局
2026-08-02 06:54:12
时隔3年还是来CBA!单场17助攻破纪录,他才26岁

时隔3年还是来CBA!单场17助攻破纪录,他才26岁

德译洋洋
2026-08-03 11:50:04
郑丽文再获强援!我防长发表重磅涉台言论,外媒:大陆有4个动作

郑丽文再获强援!我防长发表重磅涉台言论,外媒:大陆有4个动作

琴音缭绕回
2026-08-03 12:47:13
减内脏脂肪:只需死磕3件事,坚持3个动作,让小腹变平坦

减内脏脂肪:只需死磕3件事,坚持3个动作,让小腹变平坦

增肌减脂
2026-08-03 17:25:15
半两财经|全球头部存储ETF完成调仓,长鑫科技跻身前八大重仓

半两财经|全球头部存储ETF完成调仓,长鑫科技跻身前八大重仓

北青网-北京青年报
2026-08-03 14:38:03
非洲人不爱吃米面,主食主要吃这3种,难怪没啥人种田也饿不着

非洲人不爱吃米面,主食主要吃这3种,难怪没啥人种田也饿不着

史之铭
2026-08-03 16:45:57
台湾退役中将帅化民表示:不少人都说中国军事力量已居世界顶尖水平,但在他看来,真正需要思考的不是先打谁,而是大陆为何始终隐忍不出手

台湾退役中将帅化民表示:不少人都说中国军事力量已居世界顶尖水平,但在他看来,真正需要思考的不是先打谁,而是大陆为何始终隐忍不出手

人生录
2026-07-27 00:05:06
阿里巴巴突然大涨

阿里巴巴突然大涨

中国基金报
2026-08-03 17:58:34
再不处理后果很严重?港媒发声:中国高铁已被“粪便淹没”!

再不处理后果很严重?港媒发声:中国高铁已被“粪便淹没”!

泠泠说史
2026-08-04 00:09:03
震惊!“你只要给我转钱就行了”,索钱遭拒被拉黑,女儿网暴亲生父亲

震惊!“你只要给我转钱就行了”,索钱遭拒被拉黑,女儿网暴亲生父亲

火山詩话
2026-08-02 10:13:33
法庭上杀人犯当场质问法官:“我明明杀了四个女人,你们为什么说我杀了3个?”

法庭上杀人犯当场质问法官:“我明明杀了四个女人,你们为什么说我杀了3个?”

落纸生花创意手工
2026-07-19 12:06:31
如果你身边有炒股赚到大钱的人,离他远远的,越远越好

如果你身边有炒股赚到大钱的人,离他远远的,越远越好

流苏晚晴
2026-07-31 21:13:55
印尼陷入困境,坦言无力运营雅万高铁,45 亿对华债务求放宽期限

印尼陷入困境,坦言无力运营雅万高铁,45 亿对华债务求放宽期限

福建睿平
2026-08-03 07:22:33
房产中介良心透露:二手房如果房龄超过这个年限,建议就别买了

房产中介良心透露:二手房如果房龄超过这个年限,建议就别买了

巢客HOME
2026-08-01 05:35:03
以音乐节恐袭幸存者煎熬3年,在遇难女友墓前自尽,另有人自焚离世

以音乐节恐袭幸存者煎熬3年,在遇难女友墓前自尽,另有人自焚离世

译言
2026-08-03 08:06:34
青岛市黄岛区一公司仓库起火,当地通报:目前正开展灭火工作,无人员被困和伤亡

青岛市黄岛区一公司仓库起火,当地通报:目前正开展灭火工作,无人员被困和伤亡

都市快报橙柿互动
2026-08-02 19:58:33
1990年,作家三毛到新疆和76岁的王洛宾同居,王洛宾说:“可以同居,不可以发生关系!

1990年,作家三毛到新疆和76岁的王洛宾同居,王洛宾说:“可以同居,不可以发生关系!

犀利辣椒
2026-05-20 06:23:07
掐住竹知了的脖子,它就发不出声音,这是最“讽刺”的!

掐住竹知了的脖子,它就发不出声音,这是最“讽刺”的!

走读新生
2026-08-03 15:46:57
中方接到消息,立陶宛重启对台谈判,不到4天,新总理就遭审查了

中方接到消息,立陶宛重启对台谈判,不到4天,新总理就遭审查了

面包夹知识
2026-08-03 18:33:33
2026-08-04 04:15:00
钛媒体APP incentive-icons
钛媒体APP
独立财经科技媒体
137541文章数 862497关注度
往期回顾 全部

科技要闻

“像魔法一样”的AI,只卖几分钱

头条要闻

特朗普:2029年1月前控制格陵兰岛

头条要闻

特朗普:2029年1月前控制格陵兰岛

体育要闻

马克龙介入FIFA危机 致电因凡蒂诺勿搞分裂

娱乐要闻

陈璇半蹲采访诺兰惹争议

财经要闻

美日联手,救得了日元吗?

汽车要闻

方程S系列将于成都车展发布内饰 9月上旬新车上市即交付

态度原创

房产
本地
亲子
艺术
数码

房产要闻

120亿注册资本,新巨头出现!崖州湾,真的要爆发了!

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

亲子要闻

月嫂回乡给父亲祝寿,宝妈发愁没人看娃,月嫂邀我带孩子一同赴宴

艺术要闻

颠覆认知!这份中国最美榜单出炉,第一名竟不是九寨沟?看完第一个我就坐不住了!

数码要闻

网友反馈其苹果M5 Max MacBook Pro高负载运行过热导致按键变形

无障碍浏览 进入关怀版