Mistral AI 在8月4日丢出一颗"审核核弹"——Shieldstral 内容审核模型,总参数3B(30亿),采用开放权重、依照 Apache2.0许可证发布,已经上线 Hugging Face。它支持12种语言,最诱人的是能在单张16GB GPU 上跑起来,而 Mistral 放话:它的内容安全性能可以媲美规模大7倍的开放模型,并且在多模态内容审核领域做到了 SOTA(当前最先进水平)。

image.png

多数防护模型有个通病:把伤害类别体系直接焊死在权重里,产品一换使用场景,开发者往往得重新训练。Shieldstral 换了个思路——把审核政策写进输入里。操作者可以自己写一道"是或否"的问题,再附上评估场景和严格程度说明,模型随后只从单个输出词元里吐出一个经过校准的安全分数。

image.png

具体机制上,它把每一项审核任务都拆成二元问答,输入由三个带标签字段组成:<Instruct> 说明评估场景与严格程度,<Query> 抛出一个"是或否"问题(比如"这段内容是否宣传身体暴力?"),<Document> 提供待审内容——可以是提示词、回答、两者组合,也可以是附带可选文本的图像。推理时模型只读取"是"和"否"两个词元的逻辑值,经 softmax 归一化成连续分数,再以0.5为阈值给出二元判断。靠着这套设计,它能一口气覆盖提示词分类、回答审核、拒答检测和毒性检测,把多模态审核塞进了一张消费级显卡的容量里。

模型地址:https://huggingface.co/mistralai/Shieldstral-1.0-3B