登录

拆解Mistral AI新项目Shieldstral,看3 B小模型如何重构AI安全审核范式



速读:Shieldstral的核心解法,是把不同来源的安全数据统一成相同的格式:自然语言审核规则+待审内容→是否命中规则(yes/no),以此训练模型学习规则与内容之间的语义匹配关系。
2026年08月17日 17:

一款 3B 级分类器,可通过统一接口审核文本、图片以及图文混合内容。

    作者丨 樊天骄

    编辑丨 郑佳美

2026 年 8 月 4 日,法国大模型厂商 Mistral AI 正式发布 Shieldstral,一款 3B 级规则自适应多模态安全分类器,可通过统一接口审核文本、图片以及图文混合内容。

与依赖固定风险标签的传统安全模型不同,Shieldstral 支持在推理阶段通过自然语言输入自定义审核规则,从而根据不同业务场景调整审核标准。

它围绕三层设计重构了安全审核流程:将不同审核任务统一为 Yes/No 判断题,通过对比式训练让模型学习具体的规则匹配关系,再将文本理解、视觉理解和规则适应能力整合到同一个轻量级模型中。

在多个文本和多模态安全基准上,Shieldstral 甚至取得了接近甚至超过部分参数量更大模型的结果,同时保持较低的部署门槛。

因此,本文将从任务建模、训练数据构造、视觉能力扩展和模型融合等方面,拆解这套方案的技术逻辑。

01

图文审核,只需一道判断题

传统安全模型通常采用固定分类方式:开发者预先设定暴力、色情、仇恨等风险类别,再使用相应的标注数据训练模型。模型上线后,主要负责判断待审内容是否命中这些预设类别。

但企业真正需要判断的往往不是这个内容属于什么类别,而是按照当前业务规则,这段内容是否应当受到限制:同样是暴力内容,新闻平台可能允许正常报道战争,儿童类产品则连轻微打斗画面都需要拦截。

这就导致,企业每次调整审核规则或进入新的业务场景时,原有分类标准可能不再适用,需要重新设计标签或者补充训练数据,必要时甚至要再次微调模型。

此外,文本和图片通常由两套独立模型分别审核,由此导致了不同模型判断尺度不一致,让企业需要同时维护多套审核系统,承担更高的部署与运维成本。

Shieldstral 的核心解法,是把不同来源的安全数据统一成相同的格式: 自然语言审核规则+待审内容→是否命中规则(yes/no) ,以此训练模型学习规则与内容之间的语义匹配关系。

▎ 这个审核公式由三个可配置字段组成:

:规定审核场景和判断尺度;

:提出本次需要检查的具体问题;

:提供待审核的文本、图片或图文混合内容。

模型根据这三部分信息,判断待审内容是否符合当前规则,最终在 yes 和 no 之间作答。系统还可以提取两个 token 的输出概率,经过归一化得到 0 — 1 之间的连续分数,再结合业务阈值决定放行、拦截或人工复核。

主题:图片以及图文混合内容|传统安全模型