Arc研究所造出能“举一反三”的虚拟细胞模型,破解跨细胞预测难题
如果给细胞加一种药物,或者敲低其中一个基因,接下来会发生什么?
这是生物学和药物研发中一个非常基础的问题。研究人员通常需要真正培养细胞、施加干预,再通过测序等手段观察细胞发生了哪些变化。但细胞类型、药物、基因和疾病状态之间能够形成的组合极其庞大,不可能全部通过实验逐一验证。
更麻烦的是,同一种药在不同细胞里的效果可能不同。对某种癌细胞有效的药物,换到另一种癌细胞上可能完全没反应,甚至产生相反的效果。
因此,近年来虚拟细胞(Virtual Cell)成为一个重要研究方向:研究人员希望通过大量生物数据训练模型,让 AI 学习细胞运行和变化的规律,在真正动手做实验之前,先预测一次药物或基因操作可能让细胞发生什么变化?
然而,现有模型的痛点恰恰是 跨细胞环境泛化能力差。 很多模型在某个细胞系上训练得不错,一旦换到另一个细胞类型或新的实验条件,预测效果就会大幅下降,不少深度学习模型甚至无法稳定胜过简单的线性统计基线;同时细胞群体天然存在异质性,即使同一类型的细胞内部反应也有差异,叠加不同实验带来的技术噪声,会进一步掩盖扰动带来的真实信号。
近日,Arc Institute 团队在 Cell 发表论文“Predicting cellular responses to perturbation across diverse contexts with State”, 正式介绍了虚拟细胞模型 STATE。 它更关注一个动态问题: 已知一个细胞当前的状态,以及即将对它施加的干预,能不能预测干预之后细胞会变成什么状态?
同时, 团队还开发了 Cell‑Eval 标准化评测套件, 专门用来评判这类 AI 模型好不好用。
STATE 由 Arc Institute 团队主导开发,研究人员来自机器学习、单细胞组学和功能基因组学等不同方向,斯坦福、UC Berkeley、UCSF 等机构参与合作。Arc Institute 成立于 2021 年,近年来重点推进“虚拟细胞”计划,一边通过 CRISPR、单细胞测序等实验平台大规模产生细胞扰动数据,一边开发 AI 模型,希望形成实验数据与模型预测相互迭代的研究体系。
STATE 主要由两个部分组成: State Embedding(SE)模型和 State Transition(ST)模型。
Cell )
SE 用来让 AI“看懂”一个细胞现在是什么状态。 单个细胞里有成千上万个基因,每个基因都有自己的表达量,原始数据非常复杂。SE 的任务,就是把这些复杂的信息整理成一种 AI 更容易理解的表示。为了训练这个部分,研究团队使用了大约 1.67 亿个人类单细胞数据, 来源包括 Arc scBaseCount、CZ CELLxGENE、Tahoe-100M 等多个大型单细胞数据库。
ST 负责解决更核心的问题——预测细胞的状态变化。 ST 接收两类关键输入:这一组细胞现在的状态,以及要施加的干预。这是一个基于 Transformer 的模型, 特别之处在于其能够对一组细胞进行分析,而不是一个一个细胞单独预测。 它学习的是扰动如何让整群细胞的状态发生集体变化,同时还能捕捉群体内部的残留异质性。为了训练这部分能力,研究团队又使用了超过 1 亿个接受过不同干预的单细胞数据。
图 | 基于 Transformer 的模型,用于预测细胞集合的扰动效应(来源: Cell ) 为了测试 STATE 的能力,研究人员选择了三大类真实生物数据集,包括 大量小分子药物处理的癌细胞数据;细胞因子刺激的免疫细胞数据;Perturb‑seq 技术产生的 CRISPR 基因敲除数据集。 这三类实验对应着不同的问题:给细胞一款药会怎样?加入一个信号分子会怎样?把一个基因关闭之后又会怎样?
结果显示,STATE 对扰动效应的预测整体优于多个基线方法。 在大型数据集上,它区分不同扰动效应的能力提升超过 30%,在预测差异表达基因方面也取得了明显提升。
其中更关键的一项测试,正是 STATE 最初想解决的跨细胞环境泛化问题: 同样的药物,在不同细胞中如何表现? 研究团队测试了抗癌药曲美替尼,模型从未见过该药物处理 C32 黑色素瘤细胞,但依然较为准确预测出药物会改变哪些基因,表现显著优于简单取平均值的传统基线。
此外,STATE 还表现出一定的“举一反三”能力。如果某款药物已经在很多种细胞上做过实验,面对全新细胞,只要拿到该细胞未处理的正常单细胞数据,STATE 就可以基于过往学到的规律,推测这款新药作用于该细胞的潜在转录组变化。基于模拟得到的转录组,STATE 还可以进一步推演下游表型:例如预测药物处理之后细胞的存活能力、细胞周期状态等。
同时,该模型支持计算机内的虚拟生物实验:模拟多种药物联用,预判药物之间协同或者拮抗效果;利用药物扰动的数据,去模拟基因敲低带来的细胞响应;反向推演:想要达到某一种目标细胞状态,什么样的药物或者基因干预最有可能实现。
这意味着很多候选方案可以先在计算机中大规模筛选,再挑选少数高价值假设进入湿实验验证,有望大幅降低实验成本。
除了 STATE 本身,研究团队还推出了 Cell‑Eval 标准化评测套件, 模拟生物学家分析测序数据的真实流程,从三个核心维度综合打分。
整体基因表达效果: 能不能区分不同药物、不同基因扰动带来的不一样的细胞变化; 差异表达基因: 找出真正被干预改变的基因,校验基因上调、下调的方向是否预测准确; 扰动效应强弱: 判断这项干预对细胞整体影响有多大,统计一共会改变多少基因。
目前,这套评测框架已经被用于国际 Virtual Cell Challenge(虚拟细胞挑战赛)的官方评估,并逐步成为该领域通用的基准测试工具之一。