登录

打破模态壁垒,11 B通用底座,上智院开放多模态科学基础模型「神珍」


速读:基于这一前瞻判断,上智院团队给出了一条科学智能新思路:将科学模态的数据以原生、无损方式接入基础模型,在统一表征空间中完成跨模态对齐、理解与推理,确保输入输出始终处于原生的科学数据空间。
2026年07月19日 20:15

人工智能(AI)模型在科学发现中的角色,正经历着一场从「工程缝合者」向「智能推演者」的深刻蜕变。

过去几年,AI for Science 领域涌现出众多性能优异的专用模型,蛋白质结构预测、分子生成、材料设计等单一任务频现进展。然而,在科研场景中,实质性的突破往往诞生于跨模态的交界地带。

以疾病研究为例,面对基因序列、蛋白质构象与药理活性数据交织而成的复杂因果网络,研究者需要的不是预测精准的蛋白质模型,而是一个能同时「阅读」序列语言、「理解」空间构象、「推演」动态交互的统一框架。

最近,由上海科学智能研究院(下称「上智院」)发布并开放的科学多模态基础模型 ——「神珍」,有力回应了这一需求。

作为一款总参数量为 110 亿的统一基座模型,「神珍」并非简单地将多个专用模型打包,而是从底层模态对齐入手,在一个统一架构内同时支撑科学理解与多类结果生成,现已覆盖 DNA、RNA、蛋白质、小分子、地球系统与医学影像六类科学数据。

科学智能新思路

2020 年,AlphaFold2 成功从氨基酸序列直接预测蛋白质的三维结构,证明了 AI 模型在单一科学任务上的潜力。以之为代表的专用模型路线,针对特定科学领域定制网络架构与损失函数,在大量标注数据上充分挖掘特征,从而在既定任务上精度卓越、物理合理性强。

但这种专精化也带来了固有局限:模型的表征空间被严格锚定在单一模态和特定物理尺度内,泛化能力严重不足,既难以跨领域迁移知识,也无法与其他科学模态建立语义关联。由此形成的数据与任务孤岛,从根本上制约了跨域融合与通用推理。

2022 年以来,大语言模型(LLM)以通用推理和涌现能力席卷 AI 领域,也为科学智能提供了另一条可能路径 —— 将 LLM 直接作为基础框架,把各类科学数据统一转化为文本 token。例如,把分子、蛋白质翻译成一串字母(SMILES 表达式),再以文本形式喂给大模型,NatureLM、Intern-S1-pro 走的就是这条路线。

然而,科学数据本质上是结构化数据,当它们被强行压扁为文本 token 时,就像是只给一份乐高零件清单却不给成品图,结构性信息会出现系统化损失。模型在已受损的科学 token 上进行模式识别与逻辑推演,其推理精度与科学发现能力就被框定了上限。

这一局限,恰恰揭示了一个更深层的命题:对科学智能而言,数据以何种形式进入模型,决定了模型能以何种方式理解世界。

复旦大学特聘教授、上智院院长漆远在 2026 世界人工智能大会(WAIC 2026)科学智能开放论坛上指出,一个好的模型某种角度是一种压缩。AI 要从「预测下一个 token」走向「发现未知规律」,靠的是从高维空间中压缩出简洁的机理 —— 而想发现底层规律,前提就是在第一步别把关键的细节信息丢掉。让 AI 从背诵科学走向发现科学,第一步就是让它直接看懂科学现象。

基于这一前瞻判断,上智院团队给出了一条科学智能新思路:将科学模态的数据以原生、无损方式接入基础模型,在统一表征空间中完成跨模态对齐、理解与推理,确保输入输出始终处于原生的科学数据空间。

借鉴多模态大模型处理图像的方式 —— 将图像压缩编码为视觉 token,团队为每个学科配置专属的 tokenizer,将高维原始数据中的有效信息高效压缩为「科学 token」,统一到同一个表达空间,再对齐进大语言模型进行推理。这样一来,AI 看到的并非转译后的「文字说明」,而是科学对象本身近乎「原图」的样貌,高维结构与原生信号得以保留。

整个架构以「共享智能内核+专业接口模块」实现分工 —— 共享空间承载跨领域知识、推理与对话,不同对象则保留适合自身结构特性的编码与解码路径。

这一方案恰好呼应了 中国工程院院士、 之江实验室主任、阿里云创始人王坚的洞见,他在论坛上点明:要让科学数据成为科学智能的「原住民」,将各学科数据 token 化、纳入同一表征空间,让科学重新成为一个整体。

从文本 token 到科学 token,表面上是技术路径的差异,实则是对「AI 如何理解科学」这一根本问题的不同回答。

如 中国工程院外籍院士、 香港科技大学首席副校长郭毅可在论坛巅峰对话中所言,语言是人类对世界观察的一次压缩。只有当 AI 能够创造「语言」,以其方式压缩世界,它才算真的开始理解科学。

主题:模型|数据