登录

告别数据孤岛!陈松林院士团队建成全球首个海洋硬骨鱼组学平台


速读:告别数据孤岛! 项目刚开始,数据收集工作就给高成斌上了一课。 这种数据分散、资源难以有效整合的现象,被称为“数据孤岛”,长期制约着海洋鱼类功能基因组学、进化生物学研究以及相关分子育种技术的发展。 随着基因组测序和多组学技术快速发展,大量研究数据不断积累,海洋鱼类的多组学数据分散在NCBI、Ensembl等国际公共数据库中,这些数据库大多面向大量不同物种,数据格式、来源和注释标准也存在差异。 公开数据库中的数据来源复杂,不同数据格式和注释标准并不统一,团队需要从大量数据中比对和整理,确认数据来源及可靠性,确保不同来源的数据能够在同一标准下进行分析。
作者:廖洋,曹馨月,宋俊谕 来源:中国科学报 发布时间:2026/9/16 11:28:5

告别数据孤岛!陈松林院士团队建成全球首个海洋硬骨鱼组学平台

2024年冬天的一个凌晨,窗外夜色沉沉,实验室里寂静无声,只有电脑屏幕透出微光。屏幕上突然弹出一行报错信息,原本持续运行的爬虫程序戛然而止。

这样的场景,在数据库建设过程中反复上演。一次次排查问题,一次次调整程序代码,再一次次重新运行,不过是陈松林团队三年攻坚路上一个普通的工作缩影。

近日,中国工程院院士、中国水产科学研究院黄海水产研究所研究员陈松林团队在国际学术期刊《核酸研究》发布研究成果。他们成功构建全球首个海洋硬骨鱼类综合功能与进化基因组数据库MFDB,首次系统整合了89种海洋硬骨鱼类多组学数据,还创新性地集成了多种特色分析模块和生物信息学工具,为全球海水鱼种业自主创新提供了重要的数据基础。

截至9月15日,数据库已上线23天,累计访问量已达5200余次,访问者遍布全球多个国家和地区。

陈松林(中)在指导团队成员开展实验

绕不开的“数据困境”

作为国内海水鱼领域的领军科学家,多年来,陈松林带领团队围绕海水鱼生物技术和遗传育种持续开展研究,从建立鱼类种质冷冻库、破译我国首个鱼类基因组到基因组育种技术应用,不断探索利用现代生物技术提升海水鱼育种效率。

在长期科研实践中,陈松林发现,看似简单的“找数据”,往往要耗费大量时间和精力。

随着基因组测序和多组学技术快速发展,大量研究数据不断积累,海洋鱼类的多组学数据分散在NCBI、Ensembl等国际公共数据库中,这些数据库大多面向大量不同物种,数据格式、来源和注释标准也存在差异。科研人员往往需要在多个平台之间反复检索、比对,再根据研究需求进行筛选和整理,整个过程繁琐且耗时。

这种数据分散、资源难以有效整合的现象,被称为“数据孤岛”,长期制约着海洋鱼类功能基因组学、进化生物学研究以及相关分子育种技术的发展。如何更加高效地获取和利用这些数据,成为亟待解决的问题。

而更现实的压力,则来自外部环境。国内许多基因组和多组学研究的数据,长期存储于国外的公共数据库。然而,NCBI等国外网站却一度限制国内学者访问,科研人员的学术研究与交流受到了极大阻碍。

“对于国内学者而言,这实际上是一种资源的损失。”陈松林对《中国科学报》表示,“如果中国拥有自己自主可控的平台,就可以直接将这些数据存储在我们自己的网站上,提升科研人员获取和利用数据的效率,减少对国外数据库的依赖。”

掌握数据,就是掌握科研主动权。多年来,他持续关注相关数据资源的整合,并推动这一设想落地。

2023年底,论文第一作者、黄海水产研究所博士后高成斌加入陈松林团队,承担起MFDB数据库建设工作。水产养殖专业的他,从硕士阶段起便自学生物信息学,并逐渐将这项能力运用到鱼类研究中。

陈松林展示团队繁育出的红瓜子斑

做加法容易,做减法难

项目刚开始,数据收集工作就给高成斌上了一课。

“最大的挑战,是如何从不同公共数据库中批量获取鱼类的海量数据。”高成斌介绍。不同数据库的检索方式、数据结构各不相同,如果单靠人工逐一下载,工作量将十分庞大。为提高效率,他用Python编写网络爬虫,自动检索和下载各公共平台的所需数据。

然而,程序真正运行起来,问题接踵而至。

“一些大型数据库设置了反爬机制,程序运行几个小时后便报错中止。”高成斌说起当时的苦恼,仍皱起眉头。而初代程序一旦中止,此前工作便前功尽弃。为此,高成斌不断修改、迭代程序,使其在爬取过程中能同步写入数据。即使程序再次中断,已获取的数据也能保存下来,后续可在已有基础上继续运行。

这听起来容易,做起来可一点都不简单。经过一次又一次的失败和再挑战,他反复调试,终于攻克“反爬”,数据收集也逐步完成。

最初,团队采用“广撒网”的方式,从公共数据库中收集了256种鱼类的数据,涵盖众多淡水鱼、海水鱼。但随着进一步分析,团队意识到,现有数据过于庞杂,不利于围绕同一方向开展后续分析与研究。

如此,怎么抉择呢?

结合团队长期以来在海水鱼遗传育种领域的研究基础,陈松林决定“做精、做专”,进一步聚焦于海洋硬骨鱼类。大家结合物种生活史和盐度适应特征,对候选物种进行筛选,确定了85种海水硬骨鱼作为首批收录对象。

“建数据库最难的不是做加法,而是做减法。”高成斌介绍,“确定好研究对象后,下一步就是从海量数据中筛选出有效信息。”

公开数据库中的数据来源复杂,不同数据格式和注释标准并不统一,团队需要从大量数据中比对和整理,确认数据来源及可靠性,确保不同来源的数据能够在同一标准下进行分析。

以转录组数据为例,同一种鱼可能包含来自肌肉、血液、皮肤等不同器官的大量样本;同时,不同发育阶段,以及高温、低温或细菌、病毒感染等处理,也会产生不同样本数据。团队需要逐一确认每份数据对应的组织来源和实验处理条件,并剔除非常规条件下的样本,只保留能够反映鱼类基础状态的数据。

“以大菱鲆为例,公开数据库中既有其正常状态下的转录组数据,也有经过弧菌感染实验后的数据。团队只选取前者,以避免攻毒处理对基因基础表达造成干扰。”高成斌解释道。

主题:数据|陈松林|科研人员