这个剧情写进小说都嫌离谱。主角金山木本科读地质,后来转道念完医学博士,如今在协和神经外科当住院医师兼博士后。
![]()
7月27日,他把手稿挂上preprints.org;三天后,美国康奈尔大学的Alex Townsend按照过去一整年的习惯又向GPT-5.6发问,模型直接指了指这份预印本。
Townsend愣了几个小时,把稿子转给华盛顿大学的Anne Greenbaum和法国人Crouzeix本尊。三位专家一致认了。
![]()
回头看这个不等式的前世今生,才知道它为什么让人较真。2004年Crouzeix在期刊上写下那行简洁的猜想,把里面那个普适常数猜成了2。
这个数字漂亮得像句诗,可整个矩阵分析圈子却在它面前连续绊了二十二年跤。Crouzeix自己2007年拼尽力气推到11.08,2017年跟Palencia合力压到1+√2约等于2.414。
再往后八年,美国数学研究所在圣何塞专门为它办过一周的封闭研讨,全球顶尖脑袋汇成一屋子,进展依然贴地爬行。要看懂为什么大家死磕这个"2",得往下走一层。
![]()
这个不等式撑着的不是纯学术光环,而是GMRES迭代法、Krylov子空间方法、矩阵函数逼近这一整套工程算法的稳定性证明。抽象归抽象,底下托的是量子计算模拟、深度学习训练框架、油藏建模、医学影像重建这些真金白银的应用。
常数从2.414往下压到2,理论上等于给整套计算工程学收一次紧的螺丝。数学家们不是在争一份诗意,是在争一份效率。
金山木的做法,与其叫"用AI证题",不如叫组建了一支临时数字研究院。
![]()
他把OpenAI攻克Cycle Double Cover猜想时那份提示词拿来改造,写了几条硬约束:切断外网,禁止模型翻墙参考;开出多条并行推演路径,别让它们过早收敛到同一个漂亮但可能错的思路上;每一条候选证明都得挨一轮反例队伍的围剿;不给出完整可验证的证明,不许收工。
写好按下回车,他去干别的事情了。十六个钟头里模型自己完成了几万次假设、推翻、重建。
真正让Townsend他们震惊的,不是模型能跑这么久,而是它给出的那步棋。人类过去的思路一直在啃硬估计,试图用更精细的不等式一层层压逼近。
![]()
模型没走这条路,它换了个入口——通过一种精心设计的采样策略,把问题降维成一个出乎意料简单的"正性条件"。这就像面对一扇撞了二十多年的铁门,别人一直在找更粗的钉锤,它绕到门缝里找准了个受力点,轻轻一撬。
两人大大方方交代,他们探索思路时同样借助了GPT-5.6。二十二年的悬案,九天里冒出两份彼此独立的证明,数学史上找不到先例。
![]()
而两份工作的辅助工具指向同一款模型,这个信号很难被当成巧合抹掉。我看到这条新闻的第一反应,是学术权威的层级结构正在被击穿。
传统数学界要认可一份突破性结果,标配流程是名校博士、名导师背书、顶刊评审。
金山木这些标签一样没有,他把手稿挂在preprints.org,把提示词、每一版迭代稿、Lean 4形式化脚本、公理审计报告一股脑塞进GitHub,连和模型对话的完整记录都做了脱敏公开。
![]()
这套操作在传统期刊眼里是野路子,可它扛住了Crouzeix本人的逐行审查。真正被这次事件晃动的是学术信任机制本身。
以前判断一份手稿值不值得看,靠的是隐形的机构-师承-职称三重信任网。现在这一层可以被完整替代——代码开源、对话透明、形式化验证工具在线可跑,任何人愿意花几个小时都能自行复现和挑刺。
这种"辐射式透明"某种程度上比不透明的peer review更抗质疑,也更快。这次事件之所以在9天里就走完了"发布-复核-独立复现"的完整闭环,靠的就是这一层。
![]()
把这次事件放进过去三个月AI介入基础科研的时间线里看,分量会更清楚。5月,OpenAI内部模型给出了埃尔德什单位距离猜想的一个反例。
7月,一款名为Astra的推理模型宣称一口气推进了十道未解数学问题。8月,协和这一位。
三个月里三次AI直接进入前沿数学的核心地带,曲线陡到肉眼可见,还没有见顶迹象。这不是量变叠加,是范式在换挡。
![]()
我这里必须泼一盆冷水:AI并没有"独立完成"任何事。金山木在这套流程里不是甩手掌柜。
他得看得懂预印本、判得出思路真假、认得出关键漏洞,还得敢把自己的名字签在稿子第一栏挂上公网,扛住Crouzeix本人的显微镜检验。他的GitHub仓库开出来供全球审计,这种技术自信不是随便哪个提示词工程师都拿得出来。
模型给的是加速器,握方向盘的从头到尾还是这位中国医生。美方数学社群这一周的反应也值得单说一句。
![]()
8月15日Townsend和Greenbaum联合署名的那份SIAM News稿子,语气克制得近乎冷静,通篇在讨论新范式怎么搭建、学界怎么消化即将涌来的成果洪流。
这跟过去几年英美学术圈面对中国AI进展时那种下意识的防御性叙事,已经出现清晰分野。数学圈是最讲究结果说话的地方,谁把悬案拿下,谁就自动获得发言权。
换个角度看这件事更有意思。一位美国常青藤教授花了一整年时间反复向ChatGPT敲问同一个猜想,拿到的答案要么胡编要么烂尾。
![]()
同一款模型、同一段窗口期,一个北京住院医靠提示词工程的巧劲把它撬开了。这里面差的不是算力,是问问题的姿势。
顺带说一句,台湾地区中央研究院数学所过去几年在Blaschke乘积、数值域理论方面也砸了不少人力,包括在AIM 2017那场研讨会上有过声音,但没能拱到最后这一步。
![]()
这不完全是能力差距,更像是路径依赖——传统数学社群里"跟AI合作"这件事还带着不小的心理防线,担心污染学术纯度。反倒是金山木这种没有师门包袱的野路子选手,冲得又稳又狠。
我个人对这场变化的判断是:未来五年学科分野会被工具彻底重画。过去评价一个研究者水平,天花板由所在领域的深度决定;从这次开始,天花板由"设计问题、驱动AI、验证结果"这三件套的综合水平决定。
医学、工程、地质、经济这些应用学科的从业者,只要愿意投入学习成本,完全可能在原本纯理论的战场做出决定性贡献。学科壁垒正在被工具普及性一寸一寸抹平。
![]()
留给高校和科研管理体制的作业,现在也变得棘手。招人怎么招?晋升怎么评?
经费怎么切?过去衡量一位数学家看他每年顶刊几篇,今后得看他驱动AI的能力、开源仓库的透明度、跨学科解决问题的实绩。
![]()
数学圈这场炸响,炸掉的不只是Crouzeix猜想二十二年的僵局,更是"顶尖研究者必须来自名校名门"的旧秩序。一位没有数学正规学历的中国住院医,靠一款硅谷模型和一份自己反复调教的提示词,九天里让全球最挑剔的一群数学家点头认账。
他把过程完整开源给全人类审计,这本身就是新一代科研伦理的样本。二十二年顽疾就此画上句号,而这声炸响,不过是新时代序幕拉开时敲的一记鼓点。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.