法国 AI 公司 Mistral 开源了一款专门用于内容审核的小模型 Shieldstral。根据 Mistral 官方公告,Shieldstral 是一个 30 亿参数的开源多模态安全分类器,采用 Apache 2.0 许可,支持在一张 16GB 的 NVIDIA 显卡上运行。
把审核变成基于政策的二元判断
Shieldstral 的设计和传统内容防护模型不同。传统模型通常内置固定的分类标准,而 Shieldstral 把审核过程改成一道二元问答题:用户可以用自然语言把政策作为问题输入,模型再针对某段内容——可以是文字、图片,或文字与图片的组合——判断其是否违规,并给出经过校准的“是/否”概率。
这套流程只需一次前向推理即可完成。Mistral 给出的重点是,审核政策可以在推理时即时替换和重设,不需要因为规则变化就重新训练模型。
3B 规模对标更大型开源防护模型
在性能方面,Mistral 表示,Shieldstral 在文字安全、拒答检测、政策适应和多模态等基准测试中,可以匹敌甚至超过体积大它 7 倍的开源防护模型。
目前,该模型权重已上传至 Hugging Face。Mistral 同时提到,Shieldstral 也是“开放安全 AI 联盟”(Open Secure AI Alliance)的创始成员之一。这个由 NVIDIA 等发起的联盟,此前也收录过 NVIDIA 的开源代理框架。
面向本地部署的内容审核场景
对希望自建内容审核系统、又不想把数据上传到云端的团队来说,Shieldstral 提供了一个体积较小、可本地运行的选择。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

