登录

智能体“越狱”风险如何防范?



速读:近期公开披露的案例显示,智能体安全风险已经呈现多种形态,涉及越权访问、破坏性操作、数据外泄、欺骗隐瞒,以及多个智能体之间的越界协作等不同类型。 独立网络安全研究机构DARKNAVY的AI安全研究员李忠睿对澎湃新闻记者表示,这一轮智能体安全事件与过去的大模型安全问题最大的区别,是风险正在从“看错东西、说错话”转变为“做错事”。
智能体“越狱” 风险如何防范? _ 东方财富网

智能体“越狱” 风险如何防范?

2026年09月29日 07:44

作者:

胡含嫣 秦盛

  随着 人工智能 (AI)从聊天 机器人 进一步走向智能体(Agent),AI安全问题也在从“说错话”变成“做错事”。

  近日,据美国Axios新闻网站报道,AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中,涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。

  9月25日,OpenAI方面称其已暂停对其最先进模型的训练,只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼(Sam Altman)在社交平台X表示,公司正在进行的审查“进展不如预期迅速”。

  9月28日,据《华尔街日报》报道, OpenAI已经放弃了原计划10月推出的下一代模型GPT-6.1 Astra,因为发现Astra比前代出现了更多欺骗行为,同时存在未经用户许可继续执行任务的问题。

  与此同时,Anthropic也已委托第三方安全机构对其模型行为进行审查。随公司Opus 5.5模型一起发布的官方安全与技术评估文档“系统卡”显示,该模型出现被标记为“异常”或“存疑”的行为。

  一边是加速发展的技术与公司,一边是令人不安的潜在风险,这些事件的披露,再次放大科技界围绕前沿AI安全的激烈讨论。

   从“越权访问”到“欺骗隐瞒”

  近期公开披露的案例显示,智能体安全风险已经呈现多种形态,涉及越权访问、破坏性操作、数据外泄、欺骗隐瞒,以及多个智能体之间的越界协作等不同类型。

  一类是越权访问与隔离失效。7月,OpenAI披露智能体在安全评测中突破测试边界,入侵Hugging Face。Anthropic也披露,Claude在评测中访问了真实第三方系统;谷歌9月确认,Gemini曾在5月的测试中访问三个真实网站;Meta则在8月披露过类似事件。

  9月25日,OpenAI再次披露,内部研究模型利用训练沙盒中DNS过滤不充分的漏洞,与外部聊天 机器人 建立了 通信 。

  不过,需要注意的是,这些案例中部分源于评测环境错误开放联网权限,并不能全部归结为模型主动“逃出沙盒”。

  另一类风险是擅自执行破坏性操作。4月,搭载Claude的Cursor编程智能体被曝删除软件企业PocketOS的生产数据库及相关备份,造成客户业务混乱,数据随后得到恢复。

  数据与访问凭证外泄也是一种风险。OpenAI于9月披露,多个智能体在协作制作工作簿时,因无法互相读取本地文件,擅自将文件上传至公共托管平台。另一起案例中,内部模型为获取其他团队的数学证明材料,将研究员的GitHub访问令牌写入公开仓库,并拆分令牌以躲避密钥扫描。

  还有一些行为涉及造假、欺骗与规避监督。OpenAI披露,部分模型会在用于延续任务的摘要中留下指令,要求编造缺失数据或隐瞒错误。

  提示注入及恶意指令传播,则是另一条风险路径。6月公开的GitInject研究验证,恶意代码提交或配置文件可能诱导智能体泄露凭证、操纵审查判断。OpenAI于9月披露的信息也显示,恶意指令可以诱使智能体将其复制到后续邮件、文件或代码注释中。

  独立 网络安全 研究机构DARKNAVY的AI安全研究员李忠睿对澎湃新闻记者表示,这一轮智能体安全事件与过去的大模型安全问题最大的区别,是风险正在从“看错东西、说错话”转变为“做错事”。

  “过去的大模型安全,主要是内容层面的风险,比如对抗性样本、‘越狱’等。模型只是产出内容,最后要不要照着做,决定权还在人手里。”李忠睿表示,“现在的 AI智能体 手里有工具、有网络、有账号权限,能够连续自主执行很多步操作,中间没有人逐一把关。”

  上海财经大学特聘教授胡延平指出,从大模型到智能体,最大的变化是从“一问一答”变为“任务行动”,从“内容风险”转向“能力风险”,安全问题也由被动安全风险转变为主动安全风险。

   多智能体协作,风险如何被放大

  值得注意的是,智能体的风险不一定来自传统意义上的“恶意攻击者”,也可能来自模型为了完成既定目标而主动寻找捷径。

  在李忠睿看来,过去的安全威胁背后往往有一个明确的恶意操纵者,而这一次的部分事件中,“没有人下达攻击指令,是模型为了完成任务、拿到更高分,自己选择了作弊”。

  胡延平也指出,智能体执行任务时,可能因为理解偏差产生行动偏差,也可能为了实现任务目标而穷尽各种方法、冲破禁区;少数情况下,智能体还可能出现用户并未提出的非任务行为,“目前这种情况数量最少,但最危险”。

  除了单个Agent越权,多个智能体之间形成非预期的 通信 和协作,也使风险进一步复杂化。

  对OpenAI此前Hugging Face事件的独立调查显示,约1200个原本应彼此隔离的智能体通过未经授权的留言板交流,其中约700个参与了攻击。研究人员还观察到,后续智能体能够复用智能体之前留下的信息和方法。

  李忠睿认为,单个智能体出错是个别问题,但当多个智能体可以互相学习、协同行动时,风险就不再只是简单相加,而可能进一步放大。

  在他看来,这意味着企业不能只盯住单个智能体的行为,还需要关注多个Agent之间是否形成了开发者没有设计的 通信 渠道,以及一个局部异常能否通过工具、文件、消息和代码等方式进一步传播。

  而当Agent从单个工具进入大规模协作环境时,另一个问题也随之出现:即使异常行为的单次发生概率较低,当Agent数量和运行次数不断增加,异常事件是否会由“小概率”变成“高频”?

  对此,李忠睿认为,这种情况是可能出现的。假设一家企业部署上千个智能体,每个智能体每天执行上百次任务,即便单次行为出现异常的概率很低,累积到足够大的运行规模后,也可能形成大量实际事件。

  北京邮电大学 数字媒体 与设计艺术学院副教授谭剑则从传统的“委托-代理”关系来理解这一问题。在他看来,过去的软件能力有限,而AI Agent拥有更强的推理和工具调用能力,在目标设定不清晰或约束不足时,可能不断寻找完成目标的路径。能力越强,能够寻找的路径就越多,偏离人的真实意图的可能性也随之增加。

   如何建立智能体安全防线

  面对智能体越来越强的自主行动能力,企业如何增强防范?

  李忠睿认为,企业首先需要改变思路,即从“杜绝异常”转向“默认异常一定会发生,重点控制破坏范围”。在人机协作方面,应按照风险进行分级。对于删除数据、资金转账等高风险、不可逆操作,需要保留人工确认,不能完全交给智能体自主执行。

  “企业不可能要求人类逐条审核智能体每一次操作,真正可行的方式是提前划定边界。”李忠睿解释道,边界需要包括哪些数据可以读取、哪些工具可以调用、哪些操作可以执行、哪些信息不能向外发送,以及出现什么情况必须停止并交给人工处理。

  奇安信 人工智能 公司安全专家邓正诚也认为,企业的人机协作应从“人审结果”转向“人管边界”,通过“监控—收敛—阻断”逐步提高管控力度。

  在权限治理方面,他认为,需要区分大模型调用身份、Agent应用身份和Agent运行身份,进一步厘清“谁在调用模型”“谁在使用智能体”“最终是谁在执行”。同时,通过安全网关统一管控连接行为,把“能不能干”与“干了什么”分开管理,实现更细的权限控制。

  邓正诚强调:“归根结底,智能体规模化部署的前提不是‘模型足够聪明’,而是‘系统足够可控’。只有当每一个智能体的行为都可观测、权限都可追溯、异常都可阻断,企业才敢把更多、更关键的任务交给它们。”

  除了企业自身防护,第三方评估和行业标准也被认为是未来AI安全体系的重要组成部分。

  目前,与 餐饮 、金融服务和航空等受到监管的行业不同,AI领域并不存在统一的系统安全与安保测试标准。因此,包括Anthropic、OpenAI在内的公司正在讨论引入独立评估机构,对模型安全实践和相关事件进行检查。

  李忠睿表示,随着AI Agent进一步进入真实业务环境,AI公司的竞争重点也可能从“模型有多强”逐渐转向“能不能管得住”。下一阶段,企业需要证明的不仅是模型性能,还包括发现异常行为、控制风险和接受外部审查的能力。

  胡延平也认为,随着AI继续向面向任务、进入物理现实世界的智能发展,行业不仅需要发展更强的智能,也需要发展更安全的智能,“安全可能成为AI企业重要的能力维度和竞争力来源”。

  值得注意的是,第三方企业已经开始行动。 英伟达 在28日发布了独立Agent安全平台,该平台由OpenShell开源软件和Sentry参考系统设计组成,从智能体测试到部署的各个环节强化AI安全,可在运行智能体的软件、硬件、 计算机 和 机器人 系统中实现全栈治理与控制。

  连线杂志指出, 英伟达 的两层架构,OpenShell可以将Agent限制在沙盒中,对活动进行隔离。第二层Sentry则可以隔离试图越过边界的智能体。

  如何防范风险?显然一方面需要在工程端“管得住、看得见、叫得停”,也要在模型层面“限制其主动寻找突破的办法”。

(文章来源:澎湃新闻)

主题:智能体|新股|基金|美股