Cell重磅:把血液、基因和蛋白数据交给AI,它开始学会判断衰老
如果把一个人的血液指标、DNA 甲基化数据、基因表达和血浆蛋白数据直接交给大模型,它能不能判断这个人有多大、未来死亡风险如何?如果把一个基因的实验数据给它,它又能不能判断这个基因究竟会促进还是延缓衰老?
过去几年,大模型越来越多地进入生命科学研究,但它们最擅长的事情,仍然是处理已经被写成人类语言的知识:读论文、查资料、总结文献,再根据已有信息提出假设。模型能够回答衰老有哪些标志,并不代表它看到几万个基因表达值、数百个 DNA 甲基化位点或者一组血液生化指标时,也能理解这些数据意味着什么。
9 月 17 日,Insilico Medicine、Liquid AI、巴克衰老研究所、哈佛医学院和布莱根妇女医院等机构的研究人员在 Cell 发表论文,推出了一套面向衰老研究的大模型体系, 包括用于测试模型能力的 LongevityBench、专门针对衰老数据训练的 Longevity-LLMs,以及把大模型与各种衰老分析工具连接起来的科研智能体 Longevity Claw。
研究团队希望通过这套体系,测试大语言模型处理衰老相关生物数据的能力,并探索 AI 在衰老研究中的应用方式。
直接把真实生物数据交给模型
研究团队首先开发了 LongevityBench,用于系统评估大语言模型在衰老生物学任务中的表现。
过去,大模型在生命科学领域的测试,很多集中在知识问答,例如询问某个基因的功能、某种疾病涉及哪些通路。这类任务更接近检验模型是否读过相关资料。
而 LongevityBench 采用了不同方式:研究人员直接将真实世界的生物数据输入模型,让模型根据这些数据完成预测。 该 benchmark 包含 17 类任务、25,457 个测试提示词,覆盖临床指标、DNA 甲基化、转录组、蛋白质组和遗传学五个方向的数据。
其中,临床任务主要考察模型是否能够根据基础健康指标推断年龄或健康风险。例如,模型需要根据血液检测指标、身体测量数据等信息,比较不同样本的年龄差异,或者预测未来 10 年死亡风险。
在 DNA 甲基化任务中,模型需要处理表观遗传数据。DNA 甲基化是目前研究最广泛的衰老指标之一,随着年龄增长,人体大量 CpG 位点的甲基化水平会发生规律性变化。研究人员将这些位点信息输入模型,让模型判断样本年龄。
在转录组任务中,模型需要分析不同年龄阶段基因表达模式的变化;在蛋白质组任务中,则需要根据血液中大量蛋白质水平的变化预测年龄;遗传学任务则要求模型结合基因扰动实验和已有数据库信息,判断某些基因变化与衰老之间的关系。
这些数据来自多个公开资源,包括美国国家健康与营养调查(NHANES)、基因表达数据库(GEO)、GTEx 项目、Olink 蛋白质组研究,以及 OpenGenes、CellAge、SynergyAge 等衰老相关数据库。
为了保证测试结果可靠,研究团队对数据划分进行了专门设计,避免模型直接接触测试答案。例如,部分数据按照研究项目、个体或蛋白家族进行拆分,让模型面对未见过的数据完成预测。此外,研究人员还通过改变问题表达方式、调整数据排列顺序等方法,测试模型是否只是依赖固定模板回答,而不是根据输入数据进行判断。
在完成 benchmark 后,研究团队测试了多款通用大语言模型,包括来自 OpenAI、Google、Anthropic、xAI、DeepSeek、Moonshot AI 等公司的模型。
结果显示,不同通用模型在不同任务上的表现差异明显。有些模型在临床指标预测中表现较好,但在 DNA 甲基化或蛋白质组任务中表现下降,没有一个通用模型能够覆盖所有类型的衰老数据。
尤其是在直接从多组学数据预测年龄时,通用大模型的表现并不稳定。基于这一结果,研究团队进一步尝试:如果不继续扩大模型规模,而是针对衰老数据进行专门训练,能不能获得更好的效果?
最大只有 9B,综合排名却超过 Gemini 和 Claude
因此,他们基于 Liquid AI 的 LFM2,以及阿里巴巴 Qwen3、Qwen3.5 等开放模型架构,训练出 5 款 Longevity-LLM,参数量从 0.6B 到 9B。训练语料超过 72 万条提示词,集中覆盖 DNA 甲基化、转录组、蛋白质组、血液检测、遗传扰动以及衰老相关知识等任务。