Auto-Research「终极大考」:新基准撕下大模型科研伪装
该论文团队由来自10所高校的28位研究者构成,核心作者包含加州大学伯克利分校吕博涵、韩鑫阳,普渡大学张家儒,华盛顿大学李星汉,以及清华大学杨玉成、黄思乔、徐启鑫、张华清、张轶程。团队成员覆盖多领域背景,在大语言模型、强化学习、MLsys、计算机视觉、优化理论等领域的成果受到学界业界广泛认可。
当一个 AI Agent 在机器学习实验中得到更高分,提升究竟来自哪里?
它可能提出了新的优化器或训练目标,也可能只是调整了学习率、扩大了模型、修改了数据处理,甚至找到了评测流程中的漏洞。只观察最终指标,往往无法区分方法创新与工程优化。
这也是现有 Auto-Research 评测面对的核心归因问题。代码生成与实验执行已经成为前沿模型的常见能力,但「能完成研究流程」并不等于「能发现更好的方法」。如果不控制数据、容量、训练预算和评测协议,任何分数提升都很难被可靠归因到算法本身。
来自伯克利、普林斯顿、清华等多家机构的研究者提出 MLS-Bench ,试图在可执行环境中单独测量这项能力。它包含 12 个机器学习领域的 140 个真实研究任务,每个任务都设置多个泛化条件,并在统一代码库中复现至少三种强人类方法,其中包括领域公认的 SOTA。
论文对初版五个前沿模型的分析发现,即使获得这些强方法的实现,模型仍然更擅长优化和组合已有组件,而不是完成真正的方法发现。
MLS-Bench 论文首页:
论文:https://arxiv.org/abs/2605.08678
项目主页:https://mls-bench.com/
GitHub:https://github.com/Imbernoulli/MLS-Bench
现有评测为什么难以测量方法发现
过去一年,自动研究系统取得了不少进展。一类系统把代码生成、自动验证和进化搜索连接起来,在 circle packing、kernel 优化或固定训练任务中持续提高指标;另一类系统尝试让 Agent 阅读论文、提出想法、编写实现并生成研究报告。
两类路线分别证明了大模型可以进行大规模搜索,也可以执行越来越完整的研究流程。但它们仍留下一个共同问题:结果变好时,我们不知道模型究竟发现了什么。
具体来看,MLE-Bench 一类任务继承了数据挖掘竞赛的形式:模型获得训练集与测试接口,通过数据清洗、特征工程和既有算法组合提高单个数据集上的预测表现。这适合评估机器学习工程,但单点结果无法说明候选方法能否迁移。另一类端到端研究评测让 Agent 生成方案和论文,再由语言模型从新颖性、完整性与可行性等维度评分,却不直接比较候选方法的实际性能。
还有一些任务更接近方法搜索,但聚焦范围较窄。例如激活函数发现可以在少数固定数据和模型上验证大量表达式;nanoGPT speedrun 可以持续吸收新优化器、注意力实现与训练技巧。它们能够推动具体系统,却没有为跨领域方法发现提供统一测量。
在拥有廉价验证器的任务中,系统可以生成大量候选,通过单一分数选择最优实现。这种设置适合测量搜索效率,却不要求候选方法跨数据、模型或规模成立。端到端研究任务覆盖范围更广,但允许模型修改的环节也更多。只要数据处理、训练资源、模型容量或评分逻辑没有锁定,局部工程收益就可能被误认为方法进步。
机器学习方法的价值通常来自可迁移性。残差连接、Attention、归一化或 Adam 并不是只在某个固定实例上有效;它们解决了更一般的问题,并在条件发生变化时继续带来收益。因此,一套面向方法发现的评测至少需要回答两个问题:
提升能否被归因到目标研究组件,而不是其他工程变量?
同一个改进能否跨越多个数据、环境、模型或规模?
从这个角度看,工程优化与科学方法发现的区别不在于是否写代码,而在于优化对象。工程任务允许围绕一个最终指标使用多种技巧;方法发现则要求改进一个明确研究组件,并验证它在多个下游条件与更大规模中仍然成立。
MLS-Bench 的任务设计围绕这两个问题展开。
从真实研究问题构造 140 个可执行任务
MLS-Bench 覆盖语言模型预训练、语言模型后训练、视觉生成、强化学习、机器人、机器学习系统、AI for Science、优化与理论、因果推断、时间序列和可信学习等 12 个方向,共包含 140 个任务。
任务跨度包括 KV 缓存压缩、主动学习、时空交通预测、黑洞图像逆问题、抗体与抗原结合、机器人世界模型、训练量化以及优化与理论问题。完整评测运行一次候选方案约需 700 个 H100 小时;30 题的 MLS-Bench-Lite 将单次评测降至约 90 个 H100 小时。这个成本本身也反映了真实方法验证与廉价代码评分之间的差异。
这些任务并不要求模型总结论文或复现既有实验。每个任务都从真实代码库和具体研究问题出发,要求 Agent 修改一个明确的研究组件。例如,候选提交可能是一种新的训练目标、优化器、注意力变体、采样策略或路由机制。模型必须提交可运行实现,并通过统一评测得到结果。