Mistral推出Shieldstral:3 B小模型单卡16 GB跑起多模态审核,号称拿下开源SOTA
速读:操作者可以自己写一道"是或否"的问题,再附上评估场景和严格程度说明,模型随后只从单个输出词元里吐出一个经过校准的安全分数。
"),提供待审内容——可以是提示词、回答、两者组合,也可以是附带可选文本的图像。
Mistral AI 在8月4日丢出一颗"审核核弹"——Shieldstral 内容审核模型,总参数3B(30亿),采用开放权重、依照 Apache2.0许可证发布,已经上线 Hugging Face。它支持12种语言,最诱人的是能在单张16GB GPU 上跑起来,而 Mistral 放话:它的内容安全性能可以媲美规模大7倍的开放模型,并且在多模态内容审核领域做到了 SOTA(当前 最先 进水平)。

多数防护模型有个通病:把伤害类别体系直接焊死在权重里,产品一换使用场景,开发者往往得重新训练。Shieldstral 换了个思路——把审核政策写进输入里。操作者可以自己写一道"是或否"的问题,再附上评估场景和严格程度说明,模型随后只从单个输出词元里吐出一个经过校准的安全分数。

具体机制上,它把每一项审核任务都拆成二元问答,输入由三个带标签字段组成:
模型地址:https://huggingface.co/mistralai/Shieldstral-1.0-3B 主题: