如果一家 AI 公司说,自己的模型尝试研究黎曼猜想,第一反应是什么?
“AI 把这道百年难题解开了?”
答案恰恰相反。Anthropic 在官方动态里写得很清楚:一款尚未发布的研究版 Claude 没有解决黎曼猜想。
但它推进了一个相关的数学问题。
截至 8 月 12 日扫描时,这条动态已经获得约 938 万浏览、1.76 万次点赞、3139 次转发和 4127 次收藏。一个“没有解出”的结果,为何能引起如此大的关注?
![]()
黎曼猜想不是普通数学题
黎曼猜想研究的是黎曼 zeta 函数零点的分布,与素数如何分布密切相关。它不仅是一道著名开放问题,也是克雷数学研究所“千禧年大奖难题”之一。
正因为名气太大,任何涉及它的 AI 消息都很容易被包装成“机器攻克人类百年难题”。但从 Anthropic 当前公开的说法看,这种标题并不成立。
Claude 没有给出完整证明。Anthropic 声称模型改进了与该猜想有关的一个下界,这是局部进展,而不是终局答案。具体成果还需要专业数学家审阅和独立验证。
“没解出来”并不等于没有价值
公众容易把数学研究想象成考试:答案只有对或错,模型要么解开,要么失败。
真实研究往往不是这样。一个开放问题可能需要先提出新引理、改进某个界限、排除错误路线,或者找到连接两个领域的新方法。终极证明之前,大量价值都存在于这些中间步骤。
如果 AI 能稳定推进局部结果,它就可能成为一种新的研究伙伴:快速阅读文献、尝试不同证明路径、检查推导、寻找反例,再把最有希望的方向交给数学家判断。
这和“一键生成答案”完全不同。它更像一位精力异常充沛、但必须由专家监督的研究助理。
真正的门槛不是推导速度,而是验证
开放数学问题最危险的地方,是一段证明可以看起来非常像真的。
语言模型擅长生成形式连贯的推理,也可能在某一步悄悄使用不存在的定理、忽略适用条件或循环论证。非专业读者很难发现这些错误,即便专家验证长证明也需要大量时间。
因此,AI 数学能力越强,验证机制越重要。至少需要回答三个问题:
第一,模型用了哪些已知结果,来源能否追踪?
第二,关键步骤能否被形式化证明工具或多名专家复核?
第三,成果来自模型独立发现,还是人类研究人员多轮提示、筛选和修正后的共同产物?
在这些信息没有充分公开之前,“Claude 推进了相关问题”可以报道,“Claude 攻克黎曼猜想”则属于越界。
为什么这条消息仍然重要
它提醒人们,前沿模型正在从标准化试题走向没有标准答案的研究任务。
过去我们用 benchmark 判断 AI 会不会做题;未来更难的问题是,它能不能帮助人类发现原本不知道的东西。两者之间的差距,不只是模型规模,还有长期探索、工具调用、文献核验与专家协作。
如果这类局部进展经过独立验证,AI 对科研的影响可能不会以“某天突然解决一切”的方式出现,而是先悄悄改变研究工作的分工:机器负责大规模搜索和尝试,人类负责提出问题、判断价值和承担结论责任。
938万浏览真正说明了什么
高浏览量当然不等于科研成果已经成立。它更像是公众期待的一次集中投射:大家都在等待 AI 跨过“会回答已知问题”与“能创造新知识”之间的那条线。
Claude 这次没有越过黎曼猜想的终点线。但它是否在起跑方式上带来了变化,值得专业领域继续验证。
对这条新闻最准确的总结,也许正是那句看似不够刺激的话:
它没有解出百年难题,但可能让我们看到,未来的百年难题会怎样被研究
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.