登录

实验


分类

评估

基于昂贵的黑盒实验评估,LDM在开放式空间中不断迭代和改进实验设计。
文章

实验:通过Test-timesearch(TTS)选择高实验价值的候选,用于代价昂贵的实验评估
文章

设计

反馈

但在科学研究场景下,实验反馈对应的真实奖励来源于机理复杂且尚未探明的高成本实验,同时设计或假设空间往往规模庞大,甚至具备开放性。
文章

快环解决单个任务中对于实验反馈的持续、快速适应,慢环则负责把“基于经验提出新设计”的元能力固化到模型参数中。
文章

纯大语言模型拥有丰富的结构先验,可以编写代码、生成蛋白序列与SMILES表达式,但往往会将语言流畅度、生成似然度视作方案质量的评判标准,无法基于实验反馈校准自身的生成分布与不确定性;
文章

决策

更新:新结果写回数据与上下文,用于下一轮的实验决策
文章

价值

即便某个候选方案当前预测均值并不高,只要它能够打开全新搜索区域、或是为后续搜索提供新信息,就依然具备优先开展实验的价值。
文章

慢闭环学习的不是静态高分答案,而是潜在的实验价值。
文章

筛选:GP奖励模型基于真实观测构建采集函数,使基础分布向具有高实验价值的方向倾斜。
文章

高斯过程则在该搜索空间内,基于实验历史构建贝叶斯奖励信号,评估各个候选方案用于下一轮实验的价值。
文章