告别“数据孤岛”,全球首个海洋硬骨鱼组学平台建成
陈松林(中)指导团队成员开展实验。
■本报记者 廖洋 通讯员 曹馨月 宋俊谕
2024年冬天的一个凌晨,窗外夜色沉沉,实验室里寂静无声,只有电脑屏幕透出微光。屏幕上突然弹出一行报错信息,原本持续运行的程序戛然而止。
这样的场景,在数据库建设过程中反复上演。一次次排查问题,一次次调整程序代码,再一次次重新运行,是中国工程院院士、中国水产科学研究院黄海水产研究所(以下简称黄海水产所)研究员陈松林团队3年攻坚路上的常态。
近日,陈松林团队成功构建全球首个海洋硬骨鱼类综合功能与进化基因组数据库MFDB,首次系统整合了来自85种海洋硬骨鱼的89个染色体水平基因组数据,并创新集成了多种特色分析模块和生物信息学工具,为全球海水鱼种业自主创新奠定了重要的数据基础。相关研究成果发表于《核酸研究》。
截至9月15日,MFDB上线23天,累计访问量达5200余次,访问者遍布全球多个国家和地区。
绕不开的“数据困境”
作为国内海水鱼领域的领军科学家,多年来,陈松林带领团队围绕海水鱼生物技术和遗传育种持续开展研究,从建立鱼类种质冷冻库、破译我国首个鱼类基因组到基因组育种技术应用,不断探索如何利用现代生物技术提升海水鱼育种效率。
在长期科研实践中,陈松林发现,看似简单的“找数据”,往往要耗费大量时间和精力。
随着基因组测序和多组学技术快速发展,大量研究数据不断积累。海洋鱼类的多组学数据分散在NCBI、Ensembl等国际公共数据库中,这些数据库大多面向不同物种,数据格式、来源和注释标准也存在差异。科研人员往往需要在多个平台之间反复检索、比对,再根据研究需求进行筛选和整理,整个过程繁琐且耗时。
这种数据分散、资源难以有效整合的现象,被称为“数据孤岛”,长期制约着海洋鱼类功能基因组学、进化生物学研究以及相关分子育种技术的发展。如何更加高效地获取和利用这些数据,成为亟待解决的问题。
更现实的压力,来自外部环境。国内许多基因组和多组学研究的数据长期存储于国外的公共数据库。一些国外数据库一度限制国内学者访问,科研人员的学术研究与交流受到了极大阻碍。
“对于国内学者而言,这是一种资源的损失。”陈松林对《中国科学报》表示,“如果中国拥有自主可控的平台,就可以将这些数据存储在自己的网站上,提升科研人员获取和利用数据的效率,减少对国外数据库的依赖。”
掌握数据,就是掌握科研主动权。多年来,陈松林持续关注相关数据资源的整合,并推动这一设想落地。
2023年底,黄海水产所博士后高成斌加入陈松林团队,承担起MFDB建设工作。高成斌的专业是水产养殖,从硕士阶段起便自学生物信息学,并逐渐将其运用于鱼类研究。
做加法容易,做减法难
项目刚开始,数据收集工作就给高成斌上了一课。
“最大的挑战是如何从不同公共数据库中批量获取鱼类的海量数据。”高成斌说。不同数据库的检索方式、数据结构各不相同,单靠人工逐一下载,工作量十分庞大。为提高效率,他用Python编写脚本,从各公共平台自动检索和下载所需数据。
然而,程序真正“跑”起来,问题接踵而至。
“一些大型数据库设置了相应的保护机制,程序运行几个小时后便报错中止。”高成斌说。而初代程序一旦中止,此前工作便前功尽弃。为此,高成斌不得不修改、迭代程序。经过一次又一次的失败和再挑战,他反复调试,数据收集逐步完成。
最初,研究团队采用“广撒网”的方式,从公共数据库中收集了256种鱼类的数据,涵盖众多淡水鱼、海水鱼。但随着分析的深入,他们意识到,现有数据过于庞杂,不利于围绕同一方向开展后续分析与研究。
基于团队长期以来在海水鱼遗传育种领域的研究,陈松林决定“做精、做专”,进一步聚焦于海洋硬骨鱼类。团队结合物种生活史和盐度适应特征,对候选物种进行筛选,确定以85种海水硬骨鱼为首批收录对象。
“建数据库最难的不是做加法,而是做减法。”高成斌说,“确定好研究对象后,下一步就是从海量数据中筛选出有效信息。”
公开数据库中的数据来源复杂,数据格式和注释标准并不统一,团队需要在大量数据中比对和整理,确认数据来源及其可靠性,确保不同来源的数据能够在同一标准下进行分析。
以转录组数据为例,同一种鱼可能包含来自肌肉、血液、皮肤等不同器官的大量样本;同时,不同发育阶段,以及高温、低温或细菌、病毒感染等处理,也会产生不同样本数据。团队需要逐一确认每个数据对应的组织来源和实验处理条件,并剔除非常规条件下的样本,只保留反映鱼类基础状态的数据。
从“数据书架”到“工具箱”
“如果数据库只是一个‘书架’,数据摆在那里,研究人员仍需要下载后在本地环境里进行分析,还是不够便利。”高成斌说。
于是,研究团队将工作从数据整理延伸到分析应用。2024年下半年,他们开展了泛基因组、基因表达和功能注释等多维度生物信息学分析,挖掘基因背后的生物学信息。
考虑到分析任务计算量较大,为提高平台使用效率,团队将完成的分析结果提前部署到平台中,用户可以直接调用,大幅缩短等待时间。
“同时,这也降低了使用门槛。即使是刚接触相关研究的科研人员或缺乏专业服务器的小型科研团队,也能直接利用平台进行检索和调用个性化分析结果。”团队成员、黄海水产所研究员徐文腾说。
其中,泛基因组分析尤为复杂,由于数据量巨大,服务器难以一次完成全部分析。于是,团队采用分段分析的方式,将任务按照生物分类层级逐步完成后再整合结果。从方案摸索到最终完成,分析工作持续了6个月。
来自85种海洋硬骨鱼的89个染色体水平基因组及3017套高质量转录组数据被纳入数据体系,覆盖33个目;团队还对231万多个基因统一进行了功能注释,总数据量达到2.6TB,大幅提升了数据的可用性与可比性。在此基础上,科研人员可以开展基因功能、表达调控和物种演化等多层面的研究。
不同于传统数据库仅提供数据检索与下载,MFDB还内置了多个特色分析模块,包括泛基因集与核心基因集、组织特异性基因共表达网络等,并设计了基因组、共线性等六大核心板块,搭载了JBrowse2、Muscle等常用生物信息学工具,让用户可以轻松调用数据,并直接利用平台开展相关研究,真正实现“一站式”数据分析。
让数据多跑路,让科研人员少跑腿,这正是MFDB的设计初衷。MFDB的建成不仅为海洋鱼类基因功能解析、适应性进化研究等提供了系统化的数据资源,也为生长、抗病、抗逆等重要经济性状基因挖掘和分子育种提供了基础支撑。
“随着基因组技术和人工智能的快速发展,育种模式正在迎来新的变革。”陈松林表示。在他看来,MFDB并不只是一个“存数据”的平台,更是一个面向未来海洋鱼类研究和育种的数据基础设施。而85种海洋鱼类,只是团队迈出的第一步。
相关论文信息:
https://doi.org/10.1093/nar/gkag844