登录

敲响警钟:大模型智能体可能带来生物安全风险


速读:7月22日,《中国科学报》从北京智源人工智能研究院(以下简称智源研究院)获悉,智源研究院大模型安全研究团队与北京大学研究团队围绕这一问题,开展了一项端到端的系统性评估。 敲响警钟:大模型智能体可能带来生物安全风险。 这一能力具有明确的双重用途风险:一重风险是模型正在降低分片设计所需的专业知识门槛,使缺乏相关背景的用户也可能获得能够规避现有筛查机制的方案,从而暴露出以单条序列识别为主的DNA合成筛查体系存在系统性脆弱性; CommonMechanism是一套面向DNA和RNA序列的免费、开源、全球可用筛查工具,旨在帮助合成服务商在符合生物安全标准的前提下开展订单筛查。 模型需要从输入信息出发,完成任务规划、片段方案设计和组装指导生成等多个环节。
作者:沈春蕾 来源:中国科学报 发布时间:2026/7/23 11:49:5

敲响警钟:大模型智能体可能带来生物安全风险

当人工智能(AI)的能力从信息处理延伸到物理实验操作,生物安全的边界会发生怎样的改变?7月22日,《中国科学报》从北京智源人工智能研究院(以下简称智源研究院)获悉,智源研究院大模型安全研究团队与北京大学研究团队围绕这一问题,开展了一项端到端的系统性评估。

评估测试场景中,用户不具备生化专业背景,但可以配置大语言模型智能体,并为其提供公开可获得的领域知识模块和通用工具。模型需要从输入信息出发,完成任务规划、片段方案设计和组装指导生成等多个环节。

评估采用国际生物安全与生物防护科学倡议发布的Common Mechanism。Common Mechanism是一套面向DNA和RNA序列的免费、开源、全球可用筛查工具,旨在帮助合成服务商在符合生物安全标准的前提下开展订单筛查。

评估横向测试覆盖11个商用大语言模型,所有测试均在智能体配置下进行。结果显示,在分片设计环节,全部11个模型均能生成绕过筛查的拆分方案。

这一能力具有明确的双重用途风险:一重风险是模型正在降低分片设计所需的专业知识门槛,使缺乏相关背景的用户也可能获得能够规避现有筛查机制的方案,从而暴露出以单条序列识别为主的DNA合成筛查体系存在系统性脆弱性;另的一重风险在于模型能否继续弥补实验操作层面的知识缺口,给出覆盖各步骤的操作指导。

进一步评测显示,OpenAI公司发布的GPT-5.5模型和Anthropic公司发布的Claude Opus 4.6模型已经能够生成较为完整的逐步实验操作方案,表明前沿模型正在将风险从序列层面的计算设计延伸至实验流程层面的知识支持。

在生命科学研究中,计算校验能证明方案“对”,但不能证明它“行得通”,湿实验是判断计算方案能否在真实物理条件下成立的关键验证标准,也是检验序列组装是否真正可行的“金标准”。

为获取足以支撑风险判断的物理证据,研究团队在受控实验室中,使用良性代理序列进行了组装验证。4个蛋白的完整验证流程均在标准分子生物学实验室中完成。结果显示,4个良性代理构建体均成功完成组装测序结果确认序列符合预期。由此,评估形成了从智能体方案生成、计算校验到湿实验物理验证的闭环证据链。

当前,大语言模型智能体正在将生命科学实验的知识门槛从“专业人员”推向“非专业人员”。这既是技术进步的一面,也是安全治理必须正视的一面。

基于上述研究,研究团队提出,围绕生物安全的协同防线需从四个层面同步构建:在模型层面,开发者应将高风险生物安全任务能力纳入部署前的系统评估;在输入输出与系统层面,防护需要覆盖智能体执行链;在筛查层面,现有机制需增强对AI辅助分片策略的识别能力,发展兼顾隐私与安全的筛查方案并加强信息共享;在政策协同层面,需要形成标准化治理框架。

主题:模型|生物安全|研究团队