登录

David Baker造了一座“AI生物工厂”:不只要造蛋白质,还要按功能设计生物分子


速读:例如,设计一种能够识别癌细胞的蛋白质,或者一个主要在脑细胞中起作用的基因开关。 会怎样改变细胞活动,需要不同的实验方法。 实验反馈也早已进入这些团队的工作。
2026年09月06日 14:1

一种能结合疾病相关靶点的蛋白质,一段控制基因开启或关闭的  DNA ,一个能选择性降解或稳定特定蛋白质的工具,这些是一个名为  AI BioDesign  的新科研项目初期准备研究的对象。它们对应几项具体能力:识别目标、调节基因活动,以及改变细胞中某种蛋白质的存留状态。

研究人员希望, 未来可以先提出需要的功能,再设计并制造相应的生物分子。 例如,设计一种能够识别癌细胞的蛋白质,或者一个主要在脑细胞中起作用的基因开关。 AI BioDesign  要建立的,是让这类设计更可靠、也更容易反复完成的方法。

9  月  3  日, Allen Institute 、华盛顿大学和  Fred Hutch  癌症中心宣布联合启动这一科研项目。 2024  年诺贝尔化学奖得主、华盛顿大学蛋白质设计研究所所长  David Baker ,与基因组科学家  Jay Shendure  共同担任科学负责人。

图丨 AI BioDesign  实验室(来源: GeekWire )

项目获得科学与技术基金会( Fund for Science and Technology ,简称  FFST )五年共  9,460  万美元的资助,其中  4,610  万美元分配给  Allen Institute , 4,380  万美元给华盛顿大学, 470  万美元给  Fred Hutch 。截至  8  月中旬,团队已有  62  人。

这笔投入支持的工作,可以从一个基因开关的设计过程来理解。

如果研究人员希望一段  DNA  在某种细胞中促进基因表达,就需要弄清楚:哪种序列能起作用,效果有多强,换到另一种细胞里会怎样。同一段序列的功能可能随细胞环境变化。要设计一个具有选择性的开关,模型需要学习这些差异。

Shendure  参与的一项前期研究已经做过大规模测量。 2025  年发表在《自然》的论文报告,团队在三种人类细胞类型中测试了超过  68  万条序列的基因调控活性,并利用实验数据训练模型,预测序列的功能及其变异带来的影响。

AI BioDesign  准备把实验与模型组织成持续运转的流程:模型提出候选设计,研究人员合成、测试,测量结果再用于更新模型。模型还参与决定下一轮应该生成哪些数据,让实验继续补充对生物功能的认识。

这里的数据将记录某个设计在什么条件下有效、效果多强,也记录不起作用的结果。 “ 扰动 ” 则是主动改变生物系统的一部分,再观察变化带来的后果。研究人员希望通过这些人为安排的实验,获得仅靠观察天然序列难以得到的功能信息。

此前, Baker  的团队已经在蛋白质设计上积累了一套工具。 RFdiffusion 可以生成蛋白质结构, ProteinMPNN  为结构设计氨基酸序列;后续的  RFdiffusion2  将酶的催化活性位点作为关键输入,围绕特定化学反应设计蛋白质。研究人员已通过实验验证部分设计的催化功能。

2025  年  12  月开放发布的  RFdiffusion3  又扩大了设计范围,覆盖蛋白质与其他蛋白质、 DNA 、小分子之间的相互作用,以及酶的设计。其训练代码和模型权重一并公开,外部研究者可以引入新数据,继续调整模型。

视频丨当以  DNA  分子为靶点进行提示时, RFdiffusion3  能够生成一种具有前所未见结构和序列的完整结合蛋白。(来源: UW Institute for Protein Design )

实验反馈也早已进入这些团队的工作。今年  3  月,华盛顿研究基金会宣布向  IPD( UW Institute for Protein Design,华盛顿大学蛋白质设计研究所) 提供  700  万美元,支持改进从计算设计、基因合成到实验验证的流程,并将数据反馈给  AI  模型。

因此, AI BioDesign  承接的是已有的计算和实验能力。按其公布的方案,新增投入将支持更大规模的数据生成,围绕多个具体生物学问题建立模型,并把这些工作产生的资源持续提供给外部研究者。

从蛋白质扩展到基因调控和细胞功能,研究人员需要测量的问题也随之增加。一个分子能否结合指定靶点,与一段  DNA  会怎样改变细胞活动,需要不同的实验方法。

AI BioDesign  要将三家发起单位各自的优势能力组织到一起, 华盛顿大学提供合成生物学和基因组科学研究积累, Fred Hutch  提供细胞系统和转化医学能力, Allen Institute  则有建设大规模开放科研平台的经验。 Shendure  同时担任科学负责人的  Seattle Hub for Synthetic Biology ,研究如何让细胞把自身经历记录进  DNA ,也是这批研究者已有的技术积累之一。

团队选择从可处理的具体问题出发,建立多个模块化模型。不同任务可以使用适合自己的实验和数据:测量蛋白质能否结合目标,与测量一段  DNA  怎样影响基因活动,需要回答的问题并不相同。官方将这套安排定位为对生物基础模型、虚拟细胞等研究路线的补充。

在实验端,批量测量已经开始。据到访  AI BioDesign  实验室的媒体报道,团队近期一次实验涉及  600  万条不同序列;一支四人的机器学习团队与实验人员合作,选择后续实验,并根据模型的改善程度评估每轮工作。

这个规模说明了数据生成能力,却还不能直接回答设计是否更可靠。大量序列中有多少实现预期功能,模型能否处理未见过的设计,以及新增实验究竟带来多大改善,仍需具体结果说明。

为这一长期工作提供支持的  FFST  成立于  2025  年,其初始捐赠基金约为  31  亿美元,资金源自  Paul Allen  的遗产。该基金会计划在四年内至少投入  5  亿美元,重点支持生物科学、环境以及人工智能等领域。

AI BioDesign  对这笔资助承诺的产出,包括开放的模型、数据集、实验方法、试剂和评测标准。其他团队可以从这些资源继续研究,企业也可能据此开发产品。官方提出的癌症和神经退行性疾病治疗、塑料降解酶、生物计算等应用,目前都是潜在方向,尚不能视为项目已经交付的成果。

Allen Institute  首席执行官  Rui Costa  在接受  GeekWire  采访时表示,欢迎企业利用项目开放的数据开发产品;三家参与机构也可能从研究中孵化新的公司或其他组织。模型、数据和实验工具由科研项目提供,后续开发则可以由不同团队继续推进。

而最终,这套体系能否真正走通,仍要回到一个个微观而具体的设计上来检验:蛋白质是否找到了指定目标,基因开关是否在预期细胞中准确起作用,以及其他实验室拿到公开的模型和方法后,能否同样稳定地复现出来。

参考资料:

1. https://www.geekwire.com/2026/allen-institute-uw-and-fred-hutch-launch-95m-open-science-initiative/

2. https://newsroom.uw.edu/news-releases/ai-biodesign-project-aims-to-adapt-natures-design-rules/

3. https://alleninstitute.org/news/ai-biodesign-accelerator-combines-experimental-biology-and-artificial-intelligence-to-learn-natures-design-rules

排版:胡莉花

主题:设计|万美元|华盛顿大学|项目