“试着真正挑战一下黎曼猜想。”这是 Anthropic 一名员工给 Claude 出的一道几乎不可能完成的数学挑战。
1859 年提出的黎曼猜想,被认为是现代数学最重要的未解决问题之一,至今无人证明或推翻,甚至悬赏 100 万美元寻找解决方案。
这一次,Claude 虽然没有攻克这一百年难题,却在尝试过程中意外取得了一项数学突破:将与黎曼猜想相关的一个长期下限,从此前数学界已知的 41.6% 提升至 67.2%。
Anthropic 表示,一个尚未公开发布的研究版本 Claude,通过调用多个 AI 子代理、运行数千次数值验证,并结合过去几十年数学家的研究成果,完成了一篇经过数学家审核、且可形式化验证的论文。
更值得关注的是,这项成果并非人类为 AI 设计好的任务,而是在 AI 自主探索过程中“意外发现”的。
Claude 花费 3100 万个输出 token,在两轮 Claude Code 会话中不断尝试、失败、修正,最终找到了一条突破路径。
这再次引发一个问题:AI 正在从辅助数学家解决问题,走向参与发现新的数学知识。
但作为人类普通一员,如果真的 AI 就这么简单的解决了黎曼猜想,那么我们是不是更多应该担心和忧虑,而不是欣喜呢?
![]()
以下为 Anthropic 对此的公告全文——
《进一步了解 Claude 的数学能力》
最近,Anthropic 一名员工给 Claude 出了一道不合理的挑战。
这是数学领域最著名的未解决问题之一,真正尝试解决黎曼猜想(Riemann hypothesis)。
Claude 确实进行了认真尝试。
但如果你了解这个问题的难度,你可能会预料到结果——它并没有成功。
黎曼猜想最早提出于 1859 年,至今仍未被证明或推翻,并且设有 100 万美元奖金。
然而,在尝试过程中,Claude 意外地在一个相关问题上取得了进展。
一个尚未公开发布的 Claude 研究版本,改进了关于黎曼 ζ 函数零点比例的长期下限估计。
借助过去几十年来数学家的大量研究成果,它将这一已知下限从 41.6% 提升到了 67.2%。
Anthropic 的两位数学家研究并验证了 Claude 的论文,并为相关领域专家撰写了一份非正式说明,简洁阐述 Claude 的证明过程。
Claude 同时还生成了一份可以形式化验证的证明。
我们感谢该领域两位专家 Brian Conrey 和 Dan Goldston,他们在收到论文后很短时间内慷慨地进行了审阅。
我们并不认为 Claude 使用的技术能够最终证明黎曼猜想。
但它的工作再次展示了 AI 模型数学能力快速发展的趋势。
在本文中,我们将讨论 Claude 是如何处理这一问题,以及它发现了什么。
黎曼 ζ 函数
黎曼 ζ 函数描述了素数的分布规律。
函数取值为零的位置,每一个都揭示了素数序列中更加精细的结构。
黎曼猜想认为,决定素数分布的这些零点,都存在于某一条特定的垂直线上。
这一猜想已经成为数学领域最重要的猜想之一。
许多数学结果都假设黎曼猜想成立,以便利用素数分布中存在的某种随机性。
目前,没有人能够证明或否定黎曼猜想。
但数学家已经围绕黎曼 ζ 函数及其零点,在多个相关方向取得进展。
其中之一,就是计算至少有多少比例的零点位于这条直线上。
随着时间推移,数学家逐步提高了这一已知比例,目前最高达到 41.6%。
另一个研究方向,是研究这条直线上零点的分布。
特别是在 1973 年,数学家 Montgomery 引入了一系列新技术。
不过,这些技术当时假设黎曼猜想成立。
近年来,多位数学家——Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh——发表了一系列研究成果,使 Montgomery 的方法无需依赖这一假设即可使用。
这意味着,这些技术可以用于进一步提高位于该直线上的零点比例下限。
Claude 的成果大量借鉴了这一研究方向,同时也参考了 Bombieri 在 2000 年发表的一篇论文。
Claude 的发现
Claude 发现,将Baluyot、Goldston、Suriajaya 和Turnage-Butterbaugh 的研究成果,与 Bombieri 的工作结合,可以突破此前 41.6% 的最佳下限结果,将其提高到 67.2%。
对 Claude 发现的简短技术解释如下:Claude 构造了一个适当的函数空间,其中二次型由 Weil 方法诱导,并利用来自直线内零点和直线外零点的正定与负定子空间。
随后,Claude 根据一阶和二阶矩信息,建立了关于二次型秩的不等式。
其中,通过素数对偶结构计算二阶矩,或者通过控制 Hilbert 变换实现这一计算,在解析数论领域并不令人意外。
真正关键的一步,是 Claude 敢于处理整个函数空间,同时考虑正定和负定结构,并允许二次型保持非对角形式。
某种意义上,正是这一步,让 Claude 能够基于此前的重要数学成果得到新的结论。完整技术解释可见论文。
Claude 关于自己如何得到这一结果的解释,则收录在另一份文件中。
Claude 的研究方法
一个尚未发布的 Claude 研究版本,在两次 Claude Code 会话中发现了这一新的下限结果。
整个过程共使用了 3100 万个输出 token。
Anthropic 员工 Jarred Sumner(同时也是一名非数学家)最初提示 Claude:“真正尝试一下这个猜想。”
之后,数学探索方向完全交由模型自行决定。
最开始,Claude 生成并尝试了 650 个想法,但全部失败。
Jarred 随后鼓励 Claude 再尝试一次。这一次,Claude 花费一天半时间,协调约 60 个 Claude 子代理展开更深入探索。
这些子代理:
- 执行了 2400 条 shell 命令;
- 编写了数百个 Python 脚本;
- 对数千个已知 ζ 函数零点进行了数值验证;
- 相互检查彼此的工作。
整个过程中,Jarred 的主要输入只是不断鼓励 Claude 继续尝试,例如“继续”、“相信自己”等。
这些鼓励似乎帮助 Claude 克服了最初的怀疑,让它相信自己可能取得有意义的进展。
在发现新结果后,Claude 又进一步验证自己的工作。
它让多个子代理审查证明过程,搜索反例,从 arXiv 下载 54 篇论文,确认该发现此前没有被提出,然后从零开始独立重新证明这一结果。
Claude 还主动提出将研究成果整理成论文,并建议由人类数论专家进行验证。
Anthropic 自己的两位数学家 Levent Alpöge 和 Ralph Furman 对 Claude 的工作进行了审查,以理解这一新结果以及它与此前研究成果之间的关系。
与此同时,Claude 与另一名 Anthropic 员工 Eric Easley 合作,将这一结果转化为 Lean 形式化证明。该证明通过了标准验证工具 comparator 的验证。
AI 模型在数学领域的进展
这一成果显示,像 Claude 这样的 AI 模型,正在以新的、甚至令人意外的方式扩大数学思想的影响范围。
尽管 Claude 没有解决黎曼猜想本身,但这一成果却作为最初挑战任务的意外副产品出现,甚至 Claude 自己也对这一发现感到惊讶。
它最初对此持怀疑态度,可能是因为训练数据中包含大量关于数学开放问题难度以及 AI 模型局限性的知识。
但经过一些鼓励性的提示后,它最终取得了上述成果。也许 Claude 和许多人一样,都低估了 AI 进步的速度。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.