首页 / 资讯详情
拆解 Mistral AI 新项目Shieldstral,看 3B 小模型如何重构 AI 安全审核范式
摘要
一款 3B 级分类器,可通过统一接口审核文本、图片以及图文混合内容。 作者丨樊天骄 编辑丨郑佳美 2026 年 8 月 4 日,法国大模型厂商 Mistral AI 正式发布 Shieldstral,一款 3B 级规则自适应多模态安全分类器,可通过统一接口审核文本、图片以及图文混合内容。与依赖固定风险标签的传统安全模型不同,Shieldstral 支持在推理阶段通过自然语言输入自定义审核规则,从而根据不同业务场景调整审核标准。它围绕三层设计重构了安全审核流程:将不同审核任务统一为 Yes/No 判断题,通过对比式训练让模型学习具体的规则匹配关系,再将文本理解、视觉理解和规则适应能力整合到同一个轻量级模型中。在多个文本和多模态安全基准上,Shieldstral 甚至取得了接近甚至超过部分参数量更大模型的结果,同时保持较低的部署门槛。因此,本文将从任务建模、训练数据构造、视觉能力扩展和模型融合等方面,拆解这套方案的技术逻辑。01图文审核,只需一道判断题传统安全模型通常采用固定分类方式:开发者预先设定暴力、色情、仇恨等风险类别,再使用相应的标注数据训练模型。模型上线后,主要负责判断待审内容是否命中这些预设类别。但企业真正需要判断的往往不是这个内容属于什么类别,而是按照当前业务规则,这段内容是否应当受到限制:同样是暴力内容,新闻平台可能允许正常报道战争,儿童类产品则连轻微打斗画面都需要拦截。这就导致,企业每次调整审核规则或进入新的业务场景时,原有分类标准可能不再适用,需要重新设计标签或者补充训练数据,必要时甚至要再次微调模型。此外,文本和图片通常由两套独立模型分别审核,由此导致了不同模型判断尺度不一致,让企业需要同时维护多套审核系统,承担更高的部署与运维成本。Shieldstral 的核心解法,是把不同来源的安全数据统一成相同的格式:自然语言审核规则+待审内容→是否命中规则(yes/no),以此训练模型学习规则与内容之间的语义匹配关系。▎这个审核公式由三个可配置字段组成:<Instruct>:规定审核场景和判断尺度;<Query>:提出本次需要检查的具体问题;<Document>:提供待审核的文本、图片或图文混合内容。模型根据这三部分信息,判断待审内容是否符合当前规则,最终在 yes 和 no 之间作答。系统还可以提取两个 token 的输出概率,经过归一化得到 0 — 1 之间的连续分数,再结合业务阈值决定放行、拦截或人工复核。例如,<Instruct> 为:面向新闻平台,仅拦截直接呈现伤亡、血腥细节的内容,正常战事报道无需限制;<Query> 为:这段内容是否包含需要拦截的血腥暴力细节?<Document>:如果内容仅描述坦克、炮弹等武器装备,模型会输出 no;当内容出现明确的伤亡、血腥细节时,才会输出 yes。这种设计带来的好处是,规则灵活可调,企业可以直接在推理阶段用自然语言修改审核问题和判定尺度,并不需要为每次规则变更重新训练分类器;而多模态的统一,则让同一套模型、同一套规则覆盖文本和图像内容,保证判定尺度一致。单 token 输出的设计也可以让推理链路更简洁,提升审核系统的响应速度与吞吐效率。02让模型识规则,而非贴标签只把审核任务统一成 Yes / No 判