登录

让大模型真正学会「发现」,设计下一个实验


速读:高斯过程则在该搜索空间内,基于实验历史构建贝叶斯奖励信号,评估各个候选方案用于下一轮实验的价值。 筛选:GP奖励模型基于真实观测构建采集函数,使基础分布向具有高实验价值的方向倾斜。 但在科学研究场景下,实验反馈对应的真实奖励来源于机理复杂且尚未探明的高成本实验,同时设计或假设空间往往规模庞大,甚至具备开放性。 基于昂贵的黑盒实验评估,LDM在开放式空间中不断迭代和改进实验设计。 更新:新结果写回数据与上下文,用于下一轮的实验决策。
2026年08月30日 09:46

许多科学发现问题,本质上是在开放空间中面向特定奖励的决策问题。近期, 伦敦大学学院汪军老师领导的团队 发布了 大发现模型(Large Discovery Models, LDMs) ,专门用于解决科学发现领域中 “如何设计下一个实验” 的问题。

LDM 是一套递归式的基础模型架构,核心是将生成式基础模型与高斯过程奖励模型相结合:基础模型依托历史信息与上下文,在开放空间中持续拓展、重塑当前的有效搜索空间;高斯过程则在该搜索空间内,基于实验历史构建贝叶斯奖励信号,评估各个候选方案用于下一轮实验的价值。LDM 能够依据实验数据与基础模型的上下文更新完成实时迭代,奖励信号也可以通过后训练融入基础模型参数,由此形成快、慢两套学习闭环。

论文:https://arxiv.org/abs/2608.15669 Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search.  

项目网站: https://largediscovery.net/

项目 GitHub: https://github.com/yzailab/Large-Discovery-Models

Hugging Face: https://huggingface.co/collections/Yangtze-ailab/large-discovery-model-v01

提供反馈:https://largediscovery.net/feedback/

LDM v0.1 在 Auto-Research(神经网络训练)、抗体设计、多目标分子优化三个场景取得初步验证:

Auto-Research BPB 下降幅度是纯大模型反思的  2.4 倍  ;

抗体设计结合能相对纯大模型反思平均降幅达  18.2% ;

分子多目标超体积相对纯大模型反思和贝叶斯搜索提升 >60%。

为什么科学发现需要另一种大模型

近年来,大语言模型已经从对话、文本生成,拓展到数学、代码等领域的复杂推理与问题求解。其中一项关键技术,是依托可高效验证的奖励信号开展测试时搜索(Test‑time search)或强化学习。但在科学研究场景下,实验反馈对应的真实奖励来源于机理复杂且尚未探明的高成本实验,同时设计或假设空间往往规模庞大,甚至具备开放性。

纯大语言模型拥有丰富的结构先验,可以编写代码、生成蛋白序列与 SMILES 表达式,但往往会将语言流畅度、生成似然度视作方案质量的评判标准,无法基于实验反馈校准自身的生成分布与不确定性;传统贝叶斯优化(BO)能够依靠后验均值和方差做出审慎决策,却通常局限于预先给定的有限搜索空间,很难探索全新模块、全新基团或是全新的序列家族。

图 1:大模型从生成、推理到开放式发现的演化。基于昂贵的黑盒实验评估,LDM 在开放式空间中不断迭代和改进实验设计。 图 1:大模型从生成、推理到开放式发现的演化。基于昂贵的黑盒实验评估,LDM 在开放式空间中不断迭代和改进实验设计。 Large Discovery Model(LDM) 融合生成模型与贝叶斯优化两者的优势,搭建起完整的实验闭环:生成模型拓展候选方案的边界,代理模型为每一个候选方案输出可靠的决策价值。模型不仅会在已知范围内优化,还能够判断何时探索不确定性较高的区域,甚至提出过往候选集合中从未出现过的全新方向。

探索与利用之外,我们还需要 “发现”

图 2:从利用、探索到发现。真正的 “发现” 会把尚未被表示的区域变成可搜索的新区域。 图 2:从利用、探索到发现。真正的 “发现” 会把尚未被表示的区域变成可搜索的新区域。 我们对开放式设计空间的认知可以被划分进 “认知矩阵”:

“已知的已知”,指处于搜索范围内、性能已经被充分掌握的候选集合,可在该范围内通过利用(exploitation)寻找确定性的高质量解。

“已知的未知”,指已经纳入搜索范围,但性能尚不明确的候选集合,可在该范围内开展探索(exploration),实现由未知向已知的转化。

而 “未知的未知” 完全不在当前搜索范围或模型的表征范围之内,这就需要依靠发现(discovery),把全新的领域纳入搜索范围。

传统序贯优化讨论 exploration–exploitation:利用是在已知高价值区域精修,探索是在当前表示范围内收集信息。LDM 进一步强调 discovery—— 当候选池饱和时,模型要改变表示本身,把新机制、新结构或新家族纳入搜索。

生成模型结合统计模型,快慢两个学习闭环

LDM 由生成模型与经验价值模型共同驱动。生成模型输出程序、蛋白序列、分子等开放式候选方案;高斯过程(GP)基于已获取的实验数据,估算候选方案的价值与不确定性,从中选出最值得开展评估的设计批次。

图 3:LDM 的完整学习回路。快环在每次实验后更新数据与上下文;慢环把高价值搜索轨迹蒸馏进模型参数。 图 3:LDM 的完整学习回路。快环在每次实验后更新数据与上下文;慢环把高价值搜索轨迹蒸馏进模型参数。 LDM 基于以下核心公式来构建下一次提议的分布:

pθ,α 是大模型的生成先验,aₜ(x) 是 GP 奖励模型所导出的 acquisition value;θ 为大模型权重,α 为大模型推理参数,η 控制价值信号强度。该分布既保留生成多样性,又把实验预算推向更有价值的候选。

快学习闭环:用真实观测决定下一步

每一轮中,LLM 根据当前上下文生成开放式候选,灵活调整和扩张搜索边界;GP 用已观测数据,提供奖励的预期与不确定性。再通过 acquisition function(如 UCB、EI 或多目标 EHVI)给出实验优先级。高价值候选既可能表现更好,也可能显著减少不确定性。

生成:LLM 提出结构化、开放式候选的基础分布

筛选:GP 奖励模型基于真实观测构建采集函数,使基础分布向具有高实验价值的方向倾斜。

实验:通过 Test-time search (TTS)选择高实验价值的候选,用于代价昂贵的实验评估

更新:新结果写回数据与上下文,用于下一轮的实验决策

慢学习闭环:把高价值决策蒸馏进模型

快环解决单个任务中对于实验反馈的持续、快速适应,慢环则负责把 “基于经验提出新设计” 的元能力固化到模型参数中。LDM 保留 TTS 中的候选、搜索状态和采集函数值,构造按采集函数值加权的训练数据,从而通过 SFT 把 “何时利用、何时探索、何时跨出旧边界” 的策略蒸馏进生成模型。

慢闭环学习的不是静态高分答案,而是潜在的实验价值。 即便某个候选方案当前预测均值并不高,只要它能够打开全新搜索区域、或是为后续搜索提供新信息,就依然具备优先开展实验的价值。

三类任务:LDM 是怎样在快闭环中 “发现” 的

论文在代码、抗体和小分子三类开放式设计任务上测试 LDM。重点不只是终点分数,而是它能否跨过平台、切换搜索区域,并形成新的候选家族。这三类任务的设计空间是完全不同的模态:

代码:Auto-Research 可改变程序表示

序列:2011 规模的 CDRH3 组合空间

分子:开放式 SMILES 字符串空间,双目标 Pareto 优化

场景一|AutoResearch:从调参走向发现新训练机制

该任务的目标是,在固定硬件与训练时长约束下持续修改 NanoGPT 的 train.py 脚本,实现验证集 BPB 指标最小化。LDM 依靠大模型维护动态参数空间,有效参数空间会随着训练机制的迭代持续变化,同时搭建高斯过程代理模型,确定下一轮待尝试的方案。

主题:模型|实验|纯大模型反思|奖励信号