登录

普林斯顿大学教授王梦迪:大模型在数学和编程上的成功目前还无法延伸至科学发现


速读:但这种训练方法难以推广到物理世界,也难以用于真正发现科学和宇宙规律。 普林斯顿大学教授王梦迪:大模型在数学和编程上的成功目前还无法延伸至科学发现。 AI在编程、数学领域的突破,不断刷新人类对于大模型能力边界的认知。
作者:张静 来源:澎湃新闻 发布时间:2026/9/10 16:15:1

普林斯顿大学教授王梦迪:大模型在数学和编程上的成功目前还无法延伸至科学发现

AI在编程、数学领域的突破,不断刷新人类对于大模型能力边界的认知。

当前的大模型,究竟是恰好覆盖了人类现有的全部通用知识,还是覆盖了通用知识中较为核心的部分,抑或是已经超出了人类现有知识,能够催生训练数据中从未出现过的新发现?AI离自主探索和发现还有多远?

9月10日,普林斯顿大学人工智能创新中心主任王梦迪在2026外滩大会开幕式发表演讲时,向台下的听众抛出了这个问题。听众的反映呈现两极分化,一半认为模型的知识面还不及人类,一半认为已经超越人类。

而王梦迪给出的答案是:得分类。

虽然AI已经能 “自己写自己的系统”,Anthropic今年5月对外表示该公司超过80%合并进生产环境的代码由Claude自行编写;在数学领域,AI从竞赛选手升级为研究助手,正在触碰人类几十年没解开的题,然而,王梦迪说,当前的大模型训练方法,在数学和编码上的成功,并无法延伸到科学领域。

“大模型会学到一个分布里最大似然的知识,但是可能会忽略长尾现象和知识。”王梦迪解释说,大模型的训练方法使得它常常高估通用情况,低估少见情况,在理解人类世界时,大模型更像是在寻找概率分布中最常见的模式。她表示,即使经过了预训练、强化学习,无论是在模拟社会、模拟人生,还是在数学等更严谨的问题中,大模型仍会向概率分布的中心聚集。

但在生物、化学、物理尤其是实验学科领域,人类真正的创新恰恰发生在长尾。在基础学科前沿寻找新发现,就像在宇宙中寻找一颗从未被观测、训练数据中也没有的新星。大模型学到的往往只是概率分布中的最大似然知识,容易忽略长尾。因此,王梦迪表示,大模型可能还没有真正抵达前沿,更难继续将长尾向前推进,找到概率分布之外的新星。

大模型为何在数学和编程领域进步如此之快?王梦迪指出,在这两个领域,强化学习能得到精准反馈,也就是存在明确的“验证器”。在编程中,验证器就是计算机编译器,再加上针对每个程序,都有大量测试来保证模型写出的程序完成了任务。在数学中,则有形式化证明验证器Lean,它能把数学写成一种特殊的编程语言。通过Lean,两三句话的数学定理可以被翻译成几千页的编程语言。虽然篇幅变长了,但这样的数学证明可验证、可编译。编程和数学的每一次计算、每一步推导都可以重现、检查、回溯,能清楚知道哪里对、哪里错。

但这种训练方法难以推广到物理世界,也难以用于真正发现科学和宇宙规律。在没有验证器的情况下,大模型只能在已知数据中不断过拟合,走不到长尾和新发现。

《自然》子刊上曾发表过一项调查,显示约70%的科学实验无法重现,甚至有50%的实验结果连做实验的科学家本人也无法复现。根本原因在于,探索全新的物质或过程往往涉及个人判断、实验器材等复杂因素,甚至需要多个实验组跨空间协作,每一步都充满不确定性。当这些不确定性叠加起来,发现的过程就变成了“掷骰子”。

“AI可能不光没有加速科学发现,反而把科学变慢了。”王梦迪解释,科学尤其是物理这样的学科,本质上必须要有足够的观测数据来证明假设,这对有效信号提出了极高要求。但自大模型出现以来,每年论文数量呈指数级增长,然而其中真正有效的信息和信号并未增加,因为人类对宇宙和世界的观测并没有实质性增加。换句话说,文章越来越多,新信息却没有增加。信息论中有一个信噪比概念,当信噪比较低时,无论是科学家、工程师,还是真正希望做出发现的机构,反而更难在海量信息中找到有用的内容。

如何才能让大模型找到新的发现?王梦迪认为需要一套闭环系统,这套系统既能连接各种开源、闭源和私域模型,也能连接物理实验室、化学实验室、生物实验室,甚至半导体车间。“当数字世界能够把物理世界里发生的所有研究、探索、纠结全部闭环,AI才可能真正发生效用。这时每一个学科实验室才会变成可验证的环境,才有可能让大模型扩展到新的发现。”

“AI模型的学习方法学到的是似然性,但当我们谈论 ‘发现’时,要找的是概率分布之外的可能性。如何弥合从似然性到可能性之间的巨大鸿沟,需要基础设施级别的探索和投入。”王梦迪表示。

主题:大模型|数学|发现|编程|验证器