![]()
有一个数字,最近被反复拿出来说——AI解了埃尔德什问题库里的多少道题。几十道!上百道!数字越大,标题越炸。但陶哲轩实在看不下去了,他泼了盆冷水,冰凉彻骨的那种:题目难度天差地别,解题数根本不能比。
埃尔德什问题库这个名称,在数学家听来会自动分成三个箱子。第一个箱子装着真正的怪物,是让几代数学家前赴后继的硬核难题。第二个箱子装的是中等难度的问题。第三个箱子最大,装的是大量长期没人细查的“长尾题”。这些题不是难,是冷门,是没人顾得上。它们可能只是某个细小分支里的一个小障碍,需要细心和耐心就能解决。AI做的大量工作,集中在第三个箱子里。
陶哲轩点破的这件事,其实触及了一个很深的痛点:人类对AI的所有误解,几乎都源于用错了评价标尺。我们用“解题数量”来比,就是在用AI最长的长板,去拼人类最短的短板。人类数学家穷尽一生能解几道题?几十道算高产了。而AI没有寿命限制,不会累,不会饿,可以二十四小时翻找第三箱。一个勤奋的翻箱倒柜者,和一个精心设计攻顶路线的登山家,有可比性吗?我们却在用同一个“解题数”来比较他们,然后得出一个吓死人的标题——AI超越人类数学家了。
这不叫评估,这叫作弊。就像拿一个体力无限的搬运工和一个建筑师比,谁搬的砖多。搬运工赢了,但房子是建筑师盖的。
陶哲轩泼这盆水,是想让我们换一个更诚实的坐标系。评价AI应该问:它解决了什么级别的难题?它有没有提出新概念?它有没有重构理论的框架?这些才是衡量数学贡献的真正标尺。没有这个坐标系,所有的比较都是胡扯。
当然,陶哲轩没有否认AI在第三箱里的价值。那些冷门的长尾题被清理干净,本身就是对知识网络的重要修补。过去人类顾不上,现在有了助手,挺好的。他只是提醒我们,别把清理门前的土堆和攀登珠峰混为一谈。
AI能摘低垂的果实,这已经很了不起。但数学的天空里,真正的星星还在高处。够到它们,需要的东西比计算力更多。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.