AI为什么还没发现新科学?王梦迪:大模型困在概率,而创新在长尾 ai为什么不能研究新的东西 ai为什么能创新新的材料
创始人
2026-09-10 13:21:16

文|懂财帝 外滩大会现场报道

14岁考入清华,24岁进入普林斯顿,29岁成为普林斯顿最年轻终身教授,如今执掌普林斯顿大学人工智能创新中心。

当王梦迪站在外滩大会讲台前提出那个问题时,全场陷入了思考:AI距离能够自主探索、自主Discovery(发现),到底还有多远?

她给出的答案,不是技术路线的微调,而是对当前大模型本质局限的一次深刻剖析。



一道关于知识的选择题

王梦迪用一个形象的比喻开场。假设黑色的概率分布代表人类所有的知识,现在的大模型学到了哪一步?她给出了三个选项:第一种,Same space,大模型正好覆盖人类所有通用知识;第二种,Smaller space,大模型只覆盖了离中心较近的那部分;第三种,Larger space,大模型已经超出人类现有知识,推动了训练数据之外的发现。

现场投票结果两极分化:要么认为AI还没学到人类知识,要么认为AI已经拓宽了人类知识,几乎没人选第一种。但王梦迪指出,真实的答案需要分类讨论,而她最近的跨学科研究揭示了令人意外的真相。

大模型是"众数追寻者"

她分享了一个与普林斯顿社会学教授谢宇合作的统计社会学实验。研究人员让ChatGPT、Claude等大模型模拟人生:假设你是1930年出生的英国人,请模拟自己后面的人生——什么时候上学、在哪儿上学、学什么专业。

当问及"模拟人生第一次结婚多大岁数"时,大模型给出的答案高度集中在24岁左右,非常符合"父母的期待"。然而,真实社会学的概率分布是一条长尾曲线,24岁只是其中一个点,现实中存在着大量偏离这个中心的情况。

实验结论令人深思:在几乎所有设计的问题中,大模型都会高估最常见、最通用的选项,而大大低估相对少见的长尾情况。换言之,大模型在预训练、中期训练和强化学习之后,依然是Mode Seeking(众数追寻)的。在概率论中,Mode是概率分布中最大似然的那一点。大模型学到了分布中最可能的那部分知识,却对长尾效应视而不见。

为什么大模型至今没有发现新科学?

既然大模型如此强大,为什么从ChatGPT Moment以来,在排除了编程和数学之后,大模型并没有在生物、化学、物理等基础学科中发现新的科学规律?王梦迪一针见血地指出:因为人类真正的创新,恰恰发生在长尾上。

当我们想在基础学科前沿做新发现时,相当于要在宇宙里找一颗之前没有观测过的"星星"。这颗星星肯定不在训练数据里。但大模型学到的是概率分布的Mode,它会忽略长尾,自然也就无法把知识前沿再往前推。

她甚至提到一位同事的文章:AI不仅没有加速科学发现,反而让科学变慢了。原因在于,科学发现需要足够的观测数据来证明一个假设,对有效信号有极高要求。但大模型时代,每年论文数量指数级增长,人类对宇宙的观测并没有真的增加。信息论中的"信噪比"急剧下降,科学家反而更难在海量信息中找到真正有用的信号。

验证器的缺失:数学/编程 vs 科学发现

为什么大模型在数学和编程领域进步神速,却在科学发现上举步维艰?王梦迪揭示了关键差异:验证器(Verification)。

在数学和编程领域,大模型可以得到非常精准的反馈。编程有编译器(Compiler)和单元测试,数学有"形式化证明"验证器(如Lean),可以把数学定理翻译成可编译的编程语言。有了明确的验证器,大模型就可以左右互搏,不断提高能力。

但在物理世界和真正的科学探索中,这样的验证器几乎不存在。科学的瓶颈往往不在于想出一些Idea,而在于"Show me the experiment"。大量科学实验是不可重复、不可验证的。Nature子刊曾发表著名调查:70%的科学实验无法重现,其中50%连做实验的科学家本人也重现不了。实验涉及复杂的判断、器材、多实验组合作,每一步都有不确定性,叠加起来就像"摇骰子"。没有验证器,大模型只能在已知数据里过拟合,无法走向长尾和新发现。

维度

数学与编程

基础科学发现

验证器

编译器、形式化证明(Lean)

缺乏通用验证器

反馈机制

精准、即时

滞后、模糊

可重复性

高(代码可复现)

低(Nature:70%不可重现)

AI能力

强(左右互搏)

弱(过拟合已知数据)

探索方向

概率分布中心(Mode)

需要长尾与未知

破局之路:从自动化实验到LabOS

面对这一困局,王梦迪和她在普林斯顿的同事们正在从基础设施层面寻求突破。他们做了一件开创性的工作:搭建全自动实验平台来寻找新的量子材料。

以两层石墨烯叠加为例,改变角度就能产生新的晶体结构和物理性质,这是通往超导体的前沿技术。但这样的实验通常需要非常有才华的物理博士生花几个月手动完成。他们做了一套全自动实验平台,配备了背后的"科学大脑",从设计、参数预测到制备、质量控制、显微镜观察,形成了完整的闭环。这套系统把原本需要数月的实验变成了API,并开源了软硬件工具包,让其他科研机构也能复用。

更进一步,他们正在开发通用的跨学科科学实验室智能操作系统——LabOS。这套系统利用大模型的多模态能力,通过智能眼镜与科学家直接交互,让实验员看到的细节变成AI能看到的细节,操作在AI指导下进行。验证结果显示,第一年的本科实习生使用这套系统后,能达到有十几年经验的科学家那样的精确科研水平。LabOS还能在数字世界自主写代码、训练模型,在物理世界与多型号机器人交互,跨学科地数字化和智能化复杂流程。

从"似然性"到"可能性"

回到最初的概率分布问题:怎么才能把Mode Seeking的大模型概率分布变得越来越宽,最终找到新的发现?王梦迪认为,我们需要的是闭环系统。这个系统连接各种开源、闭源和私域模型,同时连接物理实验室、洁净室、化学实验室、生物实验室乃至半导体车间。当数字世界能把物理世界所有的研究、探索、纠结全部闭环时,AI才可能真正发生效用,每个学科的实验室才会变成可验证的环境,大模型训练方式才能扩展到新发现。

AI的训练方法学到的是"似然性"(Likelihood),但当我们说到发现(Discovery),我们要找的是概率之外的"可能性"(Possibility)。弥合从似然性到可能性之间的巨大鸿沟,需要的不是更多算力或数据,而是基础设施级别的探索和投入——让验证变得更快,让实验变得可重复,让长尾不再被忽略。

这或许就是AI自主探索的下一站:不是让模型在文本里"想"出答案,而是让它在真实世界的闭环中"试"出答案。

相关内容

热门资讯

AI为什么还没发现新科学?王梦... 文|懂财帝 外滩大会现场报道14岁考入清华,24岁进入普林斯顿,29岁成为普林斯顿最年轻终身教授,如...
揭秘*ST高科控制权之争:前董... 本文来源:时代周报 作者:周松清 韩迅谁也没想到因为一块地会引发*ST高科(600730.SH)控制...
越地道越过瘾,地方菜正在被全国... 在抖音,“地方菜”正在刮起一阵越来越大的“风”。一口酸辣鲜香的贵州酸汤鱼,一盘锅气冲天的江西小炒,或...
摩尔线程、沐曦股份解禁,如何砸... 9月7日,"国产GPU第一股"摩尔线程(688795.SH)开盘约4分钟即触及20%跌停,收报415...
城地香江:解除数据中心项目总承... 新京报贝壳财经讯 9月9日,城地香江公告称,公司全资子公司香江系统工程有限公司与北京德昂互通互联网有...