![]()
公司情报专家《财经涂鸦》获悉,9月10日,在2026 Inclusion·外滩大会主论坛上,普林斯顿大学人工智能创新中心主任王梦迪教授提出一个问题:AI距离自主发现新科学还有多远?
她的判断是,今天的大模型已经掌握了大量人类知识,但在真正的科学发现上仍然存在明显局限:大模型更擅长找到“最可能”的答案,而真正的新发现,往往藏在概率分布的长尾里。
近期,王梦迪团队与普林斯顿大学社会学教授谢宇合作,用ChatGPT、Claude等大模型进行“模拟人生”实验。例如,让模型模拟一个1930年出生的英国人,自主生成自己此后的人生轨迹。
公开资料显示,王梦迪14岁考入清华大学、24岁进入普林斯顿、29岁成为普林斯顿最年轻的终身教授,而今,她又带领普林斯顿大学人工智能创新中心。
以下为王梦迪演讲精编:
大家好!
今天我要讲的话题比较学术,AI和能够自主探索/自主Discovery还差多远?。
先给大家出一道题,现在的大模型与人类知识的交集,是正好覆盖、已覆盖离中心比较近的部分还是已经超出?答案是,需要分类。
先讲一个具体的最近的工作,是普林斯顿大学社会学教授谢宇老师想研究的问题。在这个工作里,我们如果用大模型去模拟人生。
设定一个1930年出生的英国人,让它自己把自己后面的人生,比如什么时候上学、在哪儿上学、学什么专业等等都给写下来,自己把自己模拟一遍。我们选择了一个恰好有非常多现实数据的历史上的时间段、地理上的区域。
一个社会学家关心的问题是“第一次结婚多大岁数“?大模型模拟出来的基本都是24岁左右,非常符合父母的期待。但实际上,社会学上真正的概率分布是长尾多的曲线。
最终我们发现,基本在每一个设计的实验环节,都会发生一个问题——大模型会在比较通用的选项上高估最常见最通用的情况,但对于相对少见的情况会大大低估。
换言之,当大模型进行预训练的时间可能学到了很多关于人的信息,但是在这一类的模拟或者对人类社会的理解上,大模型是Mode Seeking的。
Mode是什么?在概率论里,当我有一个随机分布,Mode讲的概率分布最大似然的那一点,也就是大模型会学到一个分布力最大似然那一部分的知识,但对于长尾的知识可能会低估、可能会忽略。
那么从大模型ChatGPT Moment以来,大模型到底没有发现新的科学?
我之前有个更长的报告,其中把每年、每个公司(美国大模型公司,包括欧洲大模型公司)的宣传稿都扒下来,2022年、2023年、2024年、2025年,每一年Google都会出现一个颠覆科学的AI Co-Scientist,很多其他的模型公司也都在出。
但是,如果你真的去看这些基础学科,生物、化学、物理,尤其是实验学科,其实大模型目前为止还没有发现。
这是为什么呢?当我们真的在基础学科的前沿想去做新发现时,相当于要在宇宙里找一个新的“星星”,这个星星肯定是之前没有观测过的,是我训练数据里没有的。
但如果从知识学习和知识拟合的角度来讲,大模型学到的是一个概率分布的Mode,它会忽略长尾,但人类真正的创新是发生在长尾上的。这时候,大模型可能还没有真正推到前沿,并且就更没有办法把长尾更往前推,找到那个概率分布以外的新的星星。
我有个同事去年写了一篇文章,讲的是AI不光没有加速科学、没有加速发现,AI反而把科学变慢了。他的论据是,因为科学尤其是物理这样的学科,本质上要有足够的观测数据,来证明一个hypothesis,这时候我对有效的信号有非常高的要求。
但是,当有大模型以来,每年论文的数量指数级地产生,但里面真正有效的信息和信号并没有变,因为人类对宇宙的观测、对世界的观测并没有真的增加。换言之,有越来越多的文章,但是新的信息并没有增加。
在信息论里有一个概念叫“信噪比”。当“信噪比”很低的时候,不管是科学家、是工程师,是想真正用来发现的一些机构,可能反而更难在这些海量的信息里面找到有用的(信息)。
数学和Coding领域模型的进步如此之强,是因为在这两个领域里面,大模型的强化学习可以得到非常精准的反馈,也就是它存在一个Verification,是验证器。在Coding这个验证器本身就是计算机程序的compiler(编译器),并且取决于每个程序有很多不同的Unit test,来保证模型写出来的程序完成了我的任务。
数学领域有一个“形式化证明”的验证器,可以把数学描述成一种非常特殊的编程语言。通过Lean就可以把两三句话的数学定理翻译成几千页的编程语言,虽然它变长了,但这样的数学证明是可验证、可编译的。
当我有一个明确的验证器的时候,大模型就可以左右互搏,它就可以不断提高数学和编程的能力。但如果是这样的一种训练方法,我们其实并没有办法把它拓展到物理世界,拓展到真正的对科学、对宇宙的发现上面。
为什么科学发现或者现实世界的发现中,还没有看到大模型发力呢?一个原因是,科学的瓶颈其实不在我们想一些ideas。Ideas are cheap.You want to show me the code or show me the experiment。在科学领域,大量的实验是不可重复、不可验证,也没有办法追溯的。
有一个很著名的调查在Nature的子刊上发表,这个调研显示了70%的科学实验是没法重现的,甚至其中50%的实验结果连做实验的科学家本人也重现不了。原因在于,要去探索一个全新的物质、全新的过程,这里面涉及到非常复杂的人的判断、实验器材,甚至是很大的实验组,甚至是多个实验组跨空间的合作,这里面每一步都有不确定性。当这些不确定性叠加起来之后,整个的发现过程就变成了一个“摇骰子”的过程。
在编程和数学领域,每一个计算、每一步推导都可以重现,都可以有Checkpoint,都可以回溯,大家知道哪儿成、哪儿是对的、哪儿是错的,但是在更前沿的对物理世界的探索中,没有这样的验证。这也是为什么当我们没有验证器的时候,大模型只能在已知的数据里面不断地去过拟合,但没办法走到长尾,并且走到新的发现。
本质上,我们要做的是验证,是希望让验证Verification and Validation变得越来越快,这也是我在普林斯顿大学和很多同事们花了很多时间在做的一件事。
我们最近的一个工作,想做的事情是找到新的量子材料,其中需要把两片单元子厚度的石墨烯叠加在一起。可以看到,当两片碳原子的石墨烯叠在一起的时候,如果我们去改变它的一些角度,这时候这两层的石墨烯会产生非常新的两层晶体结构,这种晶体结构它就可以让大家了解新的物理性质,找到新的物理材料,并且是现在通往超导体最前沿的技术。
但是这样的实验往往需要非常有才华的物理博士生很多人花几个月的时间手动来做,我们在这里做了一件事情,做了一套全自动的实验平台,并且做好了它背后的科学大脑,它从前面的设计、参数、Hypothesis、预测到实际操作中怎么样去制备单原子的石墨烯。怎么去做Quality Control,怎么样去观察显微镜,最终再回到第一层怎么样把整个科学过程变成loop Engineering。
这是第一步,在这一步里我们已经把这一套完整本来需要很多个月完成的一套试验设备变成了API,这样任何一个合作者都可以调用API来复现实验结果,并且这一套API里面有很多不管是软件、AI还是硬件的KIT我们都开源出来了,这样其他的科研机构也可以复用,并且也可以基于这套基础设施搭建新的探索性实验。
另外一件我们想做到的事情是,有没有可能有一个通用的跨学科科学实验室的智能操作系统?
这个系统我们起名叫LabOS,科研实验室的Operating System,在这套系统里我们想解决的问题是任何一个烦琐、需要人工去验证的实验一定会涉及人的操作,人对整个物理环境的感知决策,我们做了这套系统里面大模型有多模态能力的大模型,它可以通过智能眼镜跟每一个科学家进行直接的交互,这样实验员看到每一个细节都变成AI可以看到的细节,实验员做的每一个操作也都可以在AI的指导下。
用这套系统之后我们做了一些验证,可以让第一年的本科实习生就达到有十几年经验,经过长期科学训练的科学家可以达到精确的科学流程和科研水平。并且同样的这一套系统它一方面可以在数字世界自己写代码、自己训练专属模型、自己迭代,同时它还可以在物理世界和多个人并且和多个不同的型号机器人同时进行交互。
因为在任何一个复杂的环境里,最终一定会涉及不同型号的本体,并且最关键的就是这里面的研究人员和工程师,这样一套系统就可以跨学科去数字化并且智能化,在物理世界进行复杂的流程。
最终,回到我们原来概率分布的问题,怎么才能把一个Mode Seeking大模型它的概率分布变得越来越宽,最终找到新的发现?
我们需要的是闭环的系统,这个系统它可以连接各种各样的开源、闭源,并且是私域的模型。
并且这样的系统它应该可以同时连接物理实验室、Clean Rooms、化学实验室、生物实验室乃至于半导体车间等,当数字世界能够把物理世界里发生所有的研究、探索、纠结全部闭环时,这时候AI才可能真正发生效用,这时候每一个学科的实验室才会变成可验证的环境,才可能让现在大模型训练的方式扩展到新的发现。
最后,我想讲AI的训练方法、AI模型学习方法,学到的是“似然性”,但当我们说到发现Discovery,我们要找到概率之外的可能性,怎么去弥合从“似然性”到“可能性”之间非常大的Gap,这里需要基础设施级别的探索和投入。
谢谢大家。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.