登录

MIT、谷歌发布重磅报告:AI让科研假设变得“廉价”,实验环节成新瓶颈


速读:从结果来看,AI给科研带来的变化呈现出明显的两面性。 一位生命科学家完全可能一边用通用模型查阅文献、编写数据处理脚本、完成统计检验,一边调用AlphaFold预测目标蛋白质结构,再借助专用模型进行分子动力学模拟。 研究人员最终还是要把它合成出来,放进真实的生物环境中测试。
2026年09月23日 18:35

过去几年,AI for Science 最大的进展,莫过于机器开始进入科学发现的核心环节。AI 开始阅读海量论文、寻找人类遗漏的规律、提出新的研究假设,设计蛋白质、药物和材料,甚至参与解决一些过去需要科学家长期攻关的问题。

近日,Google、Google DeepMind 与 MIT FutureTech 联合研究团队发布  40  页报告《AI 在科学研究中的应用:初步观察》(AI in Science: Early Insights),试图系统评估 AI 进入真实科研场景后,正在给科学研究带来哪些变化。

(来源:MIT) (来源:MIT) 研究团队使用了三组规模相当少见的数据:约 1,500 万次匿名 Gemini 交互记录、覆盖不同学科的 2,690 个专用科学 AI 模型,以及对美国和英国 637 名活跃科学家的调查,范围横跨物理、计算机、生命科学、医学和社会科学。

从结果来看,AI 给科研带来的变化呈现出明显的两面性。

接近四分之三的受访研究人员表示,AI 确实为自己节省了时间,平均每周接近 7 小时。但与此同时,超过四成的科学家发现,科研瓶颈正在向工作流下游移动;41% 的受访者表示,手中积压的待验证假设比过去更多。AI 可以越来越快地产生候选答案,但实验、验证和现实数据采集并不会同步提速。当前端不断加速,越来越多的假设也开始堆积在这些难以扩容的环节。

换句话说, 尽管在 AI 的帮助下,科学家产生了越来越多新的想法和假设,但验证这些假设的能力,却没有跟上。

AI 先加速的,是科研中的“数字世界”

从报告的数据来看,AI 在科研中的渗透程度已经相当高。 在 637 名受访科学家中,约 46.6% 的人每天都会使用某种形式的 AI,另有约 30.6% 每周使用。

在这其中,从事科研的人群明显比一般职业更积极地使用大模型。报告发现,六类研究密集型职业贡献的 Gemini 使用量,是其就业人口占比所对应水平的约 1.8 倍。如果只看生命科学、物理科学和社会科学等核心科研岗位,这一比例进一步升至约 2.7 倍。

此外,研究团队还分析了约 1,500 万次匿名 Gemini 交互,并从中识别出约 36 万次可能直接与真实科研任务有关的对话。

(来源:Google) (来源:Google) 而且,AI 进入科学的方式早已超越了“让 Chatbot 润色论文”的初级阶段。

在 Gemini 的科研交互中,占比最高的任务是定量数据分析与建模,约占 42%;之后是科研成果沟通和写作。研究人员还会用它处理研究代码、统计分析、文献综述、实验流程乃至项目管理。

与此同时,另一套更加专精的科学 AI 体系也在迅速壮大。报告整理的 2,690 个科学模型,覆盖了开放学术数据库 OpenAlex 全部 26 个科学大类以及 83% 的细分学科。从预测蛋白质结构的 AlphaFold,到基因组分析、材料发现、医学影像诊断以及天气预测模型,它们在各自的领域内承担着高精度的预测、分类、模拟与生成任务。

有意思的是,通用大模型与专用模型并没有出现彼此替代的局面。从粗粒度的任务标签来看,两类工具似乎都在做“数据分析”,但一旦将科研流程进一步拆开,二者的功能重叠便迅速减少。一位生命科学家完全可能一边用通用模型查阅文献、编写数据处理脚本、完成统计检验,一边调用 AlphaFold 预测目标蛋白质结构,再借助专用模型进行分子动力学模拟。

它们目前更像是一种互补的分工。 大语言模型逐渐成为串联科研流程的通用操作界面,各类专业模型则深入不同学科内部,承担更垂直、更专业的计算与预测任务。

这种“组合拳”带来了相当可观的时间红利。 约四分之三的受访研究者表示,AI 为自己节省了时间,平均每周约 6.9 小时。

但这些被省下来的时间并没有变成休息时间。其中近三成被重新投入扩大科研产出,约两成用于实验执行和数据采集,还有约两成被用于尝试难度更高的前沿课题。过去三年中,超过八成的受访者认为个人或实验室的科研产出有所提高,接近九成预计未来三年产出还将继续增长。

(来源:Google) (来源:Google) 而且,这份效率背后还藏着更大的问题。

AI 最擅长压缩的,一般是高度数字化的工作,例如检索论文、调试代码、运行计算、筛选候选分子、预测数万个蛋白质结构…… 尽管这些环节都可以随着模型能力提升和算力扩张而迅速提速,但现实中的科学研究,并不是一条所有环节都能同步扩容的数字化流水线。

在许多学科中,研究人员原本每周就要花费近 8 个小时从事物理实验和现实数据采集,耗时甚至超过数据分析本身。当上游的数据处理、模型预测和假说生成被 AI 大幅提速后,下游的物理世界却不会因此获得同等的加速度。模型可以在几分钟内生成成百上千个候选答案,但实验设备、样本、试剂和研究人员仍然只能按照现实世界的速度逐一验证。

于是,科研的堵点不可避免地转移到了实验环节。

实验环节正成为新的瓶颈

在被问及当前最制约科研进展的环节时, 据受访科学家回答,排在第一位的是物理实验与数据采集,占比达到 24%;在物理科学与工程领域,这一比例进一步升至 30%。

在此基础上,约 43.5% 的研究者表示,过去两年自己的核心阻力已经明显向科研流程下游转移,超过四成的人发现,手中积压的“待测试假设”比三年前更多。

(来源:Google) (来源:Google) 如果把科研看作是一条彼此依赖的生产链条,最终产出并不取决于其中最快的环节,而是受制于最难扩容的一环。

假设过去一个课题组每月能够提出 10 个有研究价值的候选方案,实验室能够验证其中 8 个,那么寻找更好的想法仍然十分重要。但如果 AI 将前者突然提高到每月 100 个,而实验室的验证能力只能从 8 个提高到 10 个,最终科研产出并不会随之增长十倍,反而会留下 90 个等待筛选和验证的候选方案。

这也是 AI for Science 正在面对的结构性矛盾。 当前端越来越接近数字世界的速度,下游那些无法被算力线性加速的实体环节,便会逐渐成为整个系统新的限速器。

甚至那些看似可以完全在数字世界中完成的工作,也伴随着一笔巨大的隐性成本。

在声称 AI 为自己节省了时间的受访学者中,近九成都需要拿出一部分时间专门核查模型输出,近半数甚至需要耗费超过四分之一的时间进行调试、排错和事实查证。 研究人员将这种额外消耗形象地称为“验证税”。

到了生命科学等高度依赖实验的领域,这笔“税”还会进一步放大。数学命题可以借助形式化工具在计算机中检查证明是否成立,但模型预测出的一种全新蛋白质究竟有没有活性,却不能只靠另一个模型给出答案。研究人员最终还是要把它合成出来,放进真实的生物环境中测试。模型可以不断生成候选答案,却无法跳过现实世界给出的最终判决。

这种失衡甚至开始反过来影响科学家选择问题的方式。

报告显示,虽然超过六成的科学家认为 AI 帮助自己拓宽了研究视野、进入更有雄心的议题,但与此同时,近半数受访者也表示,AI 正促使自己更多选择那些数据积累充分、评价标准清晰、相对容易验证的渐进式课题;真正因为使用 AI 而更愿意尝试高风险未知领域的人,则不到三成。

这与科学研究中的“路灯效应”颇为相似。 当一个领域拥有充足的训练数据、成熟的评测体系和较低的验证成本,AI 会让这些本就明亮的区域更加明亮,吸引更多研究资源涌入。相反,那些缺乏数据、实验周期漫长、验证代价高昂的科学盲区,依然很难被照亮。

科研界需要新的实验基础设施

这种“上游生成过快、下游消化不及”的现象,并不只发生在实验科学。

在数学领域,陶哲轩早前就曾谈到,AI 正在推动数学从过去的“证明稀缺”走向“证明过剩”,随之而来的则可能是“证明消化不良”。 AI 生成证明的速度越来越快,但理解证明、同行评议,以及将新结果整理进成熟数学体系的速度却无法同比例提升。如果前后的速率差距过大,即便大量证明是正确的,也可能因为来不及被理解和吸收而不断积压。

这与报告中观察到的“待测试假设积压”,本质上是同一种结构。

区别在于,数学与计算机科学仍然可以在纯数字世界中完成相当一部分验证闭环。一道形式化命题至少遵循明确的公理和规则,可以交由 Lean 等系统进行程序化验证;算法和部分物理模拟,同样能够在软件环境中完成测试。

报告也特别指出,不同学科受到的约束并不相同,相比能够进行纯计算验证的数学和计算机科学, 真正受到物理实验限制的,更多还是那些需要“动手”的湿科学,尤其是在生物、化学与医学领域。

因为模型预测出一个可能有效的分子,仅仅是第一步。它必须被真正合成出来,进入细胞和动物模型接受测试;如果是候选药物,后面还有临床试验、伦理审查与监管审批。目前实验自动化仍主要集中在相对标准化的化学流程,一旦涉及复杂的生物体实验,技术难度便会迅速上升。机器人操作真实材料还会带来纯软件环境不存在的安全问题,而搭建和维护高通量自动化实验室本身,也需要不菲的成本。

正因如此,前段时间 Anthropic 建立湿实验室的举动,也有了更具体的语境。

9 月中旬,路透社披露 Anthropic 已经在旧金山湾区建立自己的生物湿实验室,尝试让 Claude 从论文、数据库和计算环境进一步进入真实实验。公司此前已经尝试将模型接入液体处理设备、机械臂和实验读取仪器,希望缩短模型提出方案之后,再由人工执行实验的链条。 它争夺的已经不只是更强的科研推理能力,还有整个科研闭环中越来越稀缺的另一半,即实验能力和真实数据。

美国学术界也在同步建设类似的基础设施。今年 7 月,美国国家科学基金会向西北大学提供 2,000 万美元,建设 DREAM Cloud Lab。研究人员可以远程提出希望蛋白质实现的功能,由 AI 负责设计,自动化系统完成合成和测试,再将实验数据送回模型继续迭代。该项目计划在四年内合成和表征超过 30 万种蛋白质,产生最多 3,000 万个实验数据点,并成为更大规模可编程云实验室网络的一部分。

主题:科研|数据|报告|假设|研究团队