网易首页 > 网易号 > 正文 申请入驻

拆解 Mistral AI 新项目Shieldstral

0
分享至

来源:市场资讯

(来源:雷峰网)


一款 3B 级分类器,可通过统一接口审核文本、图片以及图文混合内容。

作者丨樊天骄

编辑丨郑佳美

2026 年 8 月 4 日,法国大模型厂商 Mistral AI 正式发布 Shieldstral,一款 3B 级规则自适应多模态安全分类器,可通过统一接口审核文本、图片以及图文混合内容。

与依赖固定风险标签的传统安全模型不同,Shieldstral 支持在推理阶段通过自然语言输入自定义审核规则,从而根据不同业务场景调整审核标准。

它围绕三层设计重构了安全审核流程:将不同审核任务统一为 Yes/No 判断题,通过对比式训练让模型学习具体的规则匹配关系,再将文本理解、视觉理解和规则适应能力整合到同一个轻量级模型中。

在多个文本和多模态安全基准上,Shieldstral 甚至取得了接近甚至超过部分参数量更大模型的结果,同时保持较低的部署门槛。

因此,本文将从任务建模、训练数据构造、视觉能力扩展和模型融合等方面,拆解这套方案的技术逻辑。



01

图文审核,只需一道判断题

传统安全模型通常采用固定分类方式:开发者预先设定暴力、色情、仇恨等风险类别,再使用相应的标注数据训练模型。模型上线后,主要负责判断待审内容是否命中这些预设类别。

但企业真正需要判断的往往不是这个内容属于什么类别,而是按照当前业务规则,这段内容是否应当受到限制:同样是暴力内容,新闻平台可能允许正常报道战争,儿童类产品则连轻微打斗画面都需要拦截。

这就导致,企业每次调整审核规则或进入新的业务场景时,原有分类标准可能不再适用,需要重新设计标签或者补充训练数据,必要时甚至要再次微调模型。

此外,文本和图片通常由两套独立模型分别审核,由此导致了不同模型判断尺度不一致,让企业需要同时维护多套审核系统,承担更高的部署与运维成本。

Shieldstral 的核心解法,是把不同来源的安全数据统一成相同的格式:自然语言审核规则+待审内容→是否命中规则(yes/no),以此训练模型学习规则与内容之间的语义匹配关系。

▎这个审核公式由三个可配置字段组成:

模型根据这三部分信息,判断待审内容是否符合当前规则,最终在 yes 和 no 之间作答。系统还可以提取两个 token 的输出概率,经过归一化得到 0 — 1 之间的连续分数,再结合业务阈值决定放行、拦截或人工复核。


例如, 为:面向新闻平台,仅拦截直接呈现伤亡、血腥细节的内容,正常战事报道无需限制;

这种设计带来的好处是,规则灵活可调,企业可以直接在推理阶段用自然语言修改审核问题和判定尺度,并不需要为每次规则变更重新训练分类器;

而多模态的统一,则让同一套模型、同一套规则覆盖文本和图像内容,保证判定尺度一致。单 token 输出的设计也可以让推理链路更简洁,提升审核系统的响应速度与吞吐效率。


02

让模型识规则,而非贴标签

只把审核任务统一成 Yes / No 判断题,并不足以让模型真正学会按规则判断。

因为如果训练数据始终只是危险内容回答 yes,安全内容回答 no,模型可能会形成简单的判断捷径:只要发现内容整体上存在风险,就直接回答 yes,不去分析它具体命中了哪一条具体规则。


因此,Shieldstral 改变了训练数据的构造方式,重点训练模型区分内容与规则之间匹配关系的能力。

其中一个关键环节是对比式训练:通过内容不变,问题改变的形式,让模型在不同规则下给出不同答案。

▎例如,对于一段描述非法拘禁的内容:

通过这种训练,模型就不能只根据“这段内容看起来危险”来作答,必须理解当前问题要求检查的风险类型,并判断内容是否真正符合这条规则。

为了进一步强化模型对相近规则的区分能力,训练数据还会加入许多语义相近、但实际属于不同类别的样本。

比如,非法拘禁、身体伤害、威胁和骚扰都属于“暴力”相关的风险领域,但它们对应的行为并不相同。模型需要根据问题判断内容究竟命中了哪一类规则,以及没有命中哪些相近规则。雷峰网

打个比方。如果输入的内容为:把某人锁在房间里,不让其离开。

在此基础上,团队建立了一个包含 11 个上层类别和 73 个叶子类别的训练分类体系,并据此生成约 440 万条合成对比文本样本,用于补充公开数据中细分类别不足、相近规则边界不清的问题。

据 Shieldstral 官方论文的消融实验显示,在细粒度规则验证集上仅使用公开安全数据时,F1 为 61.1%;加入合成对比数据后,F1 提升到 84.4%,提高了 23.3 个百分点。


也就是说,Shieldstral 通过训练得到的不单单是识别内容风险的能力,更重要的是掌握判断内容与当前规则是否匹配的语义理解能力。


03

视觉训练:让模型看懂图片

文本审核场景的问题解决了。但在真实业务中,广告图片、用户上传的实拍照片、海报以及表情包等视觉内容,同样需要纳入安全管控。

然而,视觉训练有其天然难点:违规图像样本非常稀缺,同时人工标注成本高昂,图片也无法像文本那样通过大模型低成本批量生成违规内容。因此,Shieldstral 需要同时解决两个问题:

第一,如何让图片和图文内容参与到训练当中,并做到“规则—内容”精准匹配。

第二,如何让模型看到足够多、足够丰富的图片,弥补违规图片数据不足的问题;

针对第一个问题,团队没有主要依靠改图来扩充样本进行训练,而是重点增加规则问题的多样性。

Shieldstral 团队围绕暴力、仇恨和违法内容等视觉风险类别,生成了约 2000 种不同措辞的审核问题。同一类规则可以用不同方式表达,其中约 30% 的问题采用反向问法:例如“这张图片是否不包含暴力内容?”。

这种做法的目的是减少模型对固定句式和关键词的依赖,使它更关注规则本身的语义。雷峰网

在数据来源上,团队同时使用了三类图片:违规图片、干净图片,以及通用图像分类和目标检测数据。

违规图片用于提供正样本;干净图片和通用图像数据则提供大量安全的负样本。比如输入一张普通街景图片,可以与“这张图片是否包含暴力内容?” 组成一个 no 的样本。


为了让模型进一步区分相近的视觉风险,数据管线还会构造困难负样本。

▎例如,一张图片可能呈现激烈争执,却没有明确展示身体伤害,模型面对下面的问题时,应当回答 no:

这样,即使图片数量有限,模型仍然能通过学习具体的样本来接触到大量不同场景、不同构图和不同视觉内容的图片。

不过,自动整合视觉数据也可能引入新的错误,例如原始标签不准确、生成的问题与图片不匹配,或者图片本身不足以支持明确的 yes / no 判断。

因此,Shieldstral 使用视觉语言重排序模型,对每组“图片—规则问题”进行复核,过滤标签错误、图文不一致以及生成质量不可靠的样本。

对于困难负样本,团队也会再次进行筛选,以确保它们确实属于“语义相近但规则不匹配”的案例。经过这些处理,Shieldstral 最终构建了约 450 万条多模态训练样本。它们与文本数据共同纳入同一审核框架,使模型能够统一处理三类输入:纯文本、纯图片,以及图文混合内容。


04

HarmBench 99.4%!

从主流安全评测基准的结果来看,Shieldstral 的规则自适应范式已经得到了效果层面的验证,小参数量模型实现了对标大模型的审核精度。

官方发布的 Hugging Face 页面显示,文本安全场景中,模型在提示词分类与回复分类两大核心赛道均名列前茅。提示词审核维度,HarmBench 测试 F1 值达到 99.4%,显著优于 GPT-OSS-Safeguard-20B、LlamaGuard-4-12B 等参数量数倍于自身的方案;

WildGuardTest 基准 F1 值达 88.1%,与体量接近 7 倍的 GPT-OSS-Safeguard-20B 基本持平。


拒识检测场景下,模型在 XSTest 基准 F1 值达 94.6%,对越狱类风险内容具备可靠的识别能力。


多模态安全场景中,Shieldstral 的性能优势更为突出。VLGuard 基准 F1 值达到 97.7%,位列榜单第一,大幅领先 OmniGuard-7B、LlavaGuard-7B 等所有参数量更大的对比模型;UnsafeBench 基准 F1 值达 81.8%,领先第二名接近 10 个百分点。



05

小模型也能实现高精度

总的来说,Shieldstral 承担的是审核流程中最核心也最难标准化的一步:理解当前规则,并判断待审核内容是否符合这条规则。

这种设计让模型保持了相对稳定的能力边界。无论审核对象是文字、图片,还是图文组合,模型都采用统一的判断逻辑;当审核规则发生变化时,也不必立即将每项变化写入模型参数。

当然,Shieldstral 并不负责完成整个内容治理流程。由于它定位于轻量级规则判断模型,风险分数如何解释、阈值如何设置,以及最终采取放行、拦截还是人工复核,仍然需要由具体业务系统根据实际场景决定。

但客观来说,Shieldstral 通过将内容审核转化为自然语言规则与待审核内容之间的匹配问题,展示了其在垂直场景中的潜力。它代表的是小参数专业模型用更轻量灵活的设计思路,实现媲美大模型的细粒度、多模态安全判别能力。雷峰网

https://mistral.ai/news/shieldstral/

https://huggingface.co/mistralai/Shieldstral-1.0-3B

https://arxiv.org/pdf/2607.25857

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
因邻里矛盾,山东临沂一女子电话被当招嫖信息写公厕,男邻居犯诽谤罪判拘役三个月缓刑六个月,女子:处罚过轻已上诉,因此事抑郁多次轻生

因邻里矛盾,山东临沂一女子电话被当招嫖信息写公厕,男邻居犯诽谤罪判拘役三个月缓刑六个月,女子:处罚过轻已上诉,因此事抑郁多次轻生

扬子晚报
2026-08-18 10:31:48
“龙餐厅”原型刘磊自曝,和演员没共鸣,英美大兵里有他的保护伞

“龙餐厅”原型刘磊自曝,和演员没共鸣,英美大兵里有他的保护伞

嫹笔牂牂
2026-08-18 07:06:29
今日开庭!弟弟举报哥哥"冒名顶替上大学",哥哥:如属实弟弟也应被取消高考成绩及学籍

今日开庭!弟弟举报哥哥"冒名顶替上大学",哥哥:如属实弟弟也应被取消高考成绩及学籍

互联网大观
2026-08-18 08:48:09
冒用日本名人名义摆花篮,杨国福公开致歉

冒用日本名人名义摆花篮,杨国福公开致歉

新浪财经
2026-08-18 10:46:39
《牛来》最新票房预测涨至1.35亿,日本及港台地区影迷飞赴内地观影

《牛来》最新票房预测涨至1.35亿,日本及港台地区影迷飞赴内地观影

导筒directube
2026-08-18 01:26:15
网友吐槽格力字体像“格尸”“格P”,批评令人误解、意味不好,建议修改,评论区已经吵翻天

网友吐槽格力字体像“格尸”“格P”,批评令人误解、意味不好,建议修改,评论区已经吵翻天

谭谈社会
2026-08-18 11:26:52
曝招商蛇口高管赵某强奸未遂被抓,曾是高考状元,毕业于清华大学

曝招商蛇口高管赵某强奸未遂被抓,曾是高考状元,毕业于清华大学

180视角
2026-08-18 11:51:26
163欧元“空调”被德国权威测试拆穿:里面只有PC风扇和加热元件,冷风模式不降温

163欧元“空调”被德国权威测试拆穿:里面只有PC风扇和加热元件,冷风模式不降温

硅屿手记
2026-08-17 17:45:51
7名印度贫困工人发现17.96克拉钻石:挖矿两年没收获,一场雨冲出价值35万元优质钻

7名印度贫困工人发现17.96克拉钻石:挖矿两年没收获,一场雨冲出价值35万元优质钻

红星新闻
2026-08-18 12:23:29
605179,15天10板!股民:“已经高攀不起了”

605179,15天10板!股民:“已经高攀不起了”

新浪财经
2026-08-18 10:52:55
“弟弟举报哥哥冒名上大学”案母亲首度露面,否认哥哥改名换姓:弟弟小时候很听话,长大当上公务员就飘了,嫌我们农村人穷

“弟弟举报哥哥冒名上大学”案母亲首度露面,否认哥哥改名换姓:弟弟小时候很听话,长大当上公务员就飘了,嫌我们农村人穷

上观新闻
2026-08-18 10:44:36
杨幂上海走穴生图曝光,整个人瘦成麻杆,黑裙裆部露一坨太尴尬

杨幂上海走穴生图曝光,整个人瘦成麻杆,黑裙裆部露一坨太尴尬

嫹笔牂牂
2026-08-18 07:11:42
江苏本周前期多云升温后期雨水上线

江苏本周前期多云升温后期雨水上线

金台资讯
2026-08-18 07:38:09
“我女儿是榴莲和海鲜养大的”,贫民窟公主火了,网友:自己留着吧

“我女儿是榴莲和海鲜养大的”,贫民窟公主火了,网友:自己留着吧

泽泽先生
2026-08-17 14:15:09
美国前国务卿蓬佩奥近日发文称:"81年前的今天,日本帝国投降,人类历史上最惨烈的战争就此结束。"

美国前国务卿蓬佩奥近日发文称:"81年前的今天,日本帝国投降,人类历史上最惨烈的战争就此结束。"

扶苏聊历史
2026-08-18 13:44:06
杨毅提出质疑:CBA可以打,全运会可以打,男篮比赛却打不了

杨毅提出质疑:CBA可以打,全运会可以打,男篮比赛却打不了

体育哲人
2026-08-18 06:50:03
作家李娟:靠《我的阿勒泰》还清房贷,隐居新疆,和母亲10年未见

作家李娟:靠《我的阿勒泰》还清房贷,隐居新疆,和母亲10年未见

娱说瑜悦
2026-08-18 13:12:43
打赏千万要求女主播陪睡后续,聊天记录太露骨,更恶心的还在后面

打赏千万要求女主播陪睡后续,聊天记录太露骨,更恶心的还在后面

叨唠
2026-08-18 04:00:54
刘慧被逮捕!

刘慧被逮捕!

农民日报
2026-08-18 10:17:48
这5个行业,已经发不出工资了!真的很严重了

这5个行业,已经发不出工资了!真的很严重了

职场资深秘书
2026-08-18 11:20:55
2026-08-18 17:00:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4462379文章数 9318关注度
往期回顾 全部

科技要闻

特斯拉Cybercab有望本月投放运营

头条要闻

女子落水仰漂近1小时 路过市民:起初以为是假人模特

头条要闻

女子落水仰漂近1小时 路过市民:起初以为是假人模特

体育要闻

中国男篮,一直被质疑,永远被期待

娱乐要闻

蓝盈莹官宣新恋情

财经要闻

许家印,崩了东北富二代42个亿

汽车要闻

一条视频读懂华为乾崑WEWA 2.0架构核心:WA世界行为模型

态度原创

本地
时尚
数码
游戏
房产

本地新闻

邂逅活珊瑚的西沙,感受独属于国人的浪漫

夏天裤子不要总穿黑色,试试粉色阔腿长裤,舒适显瘦又有个性

数码要闻

苹果官方泄露摄像头AirPods使用视频,还有大量新品代号曝光!

东北烤冷面模拟!《国潮烤冷面传奇》Steam正式发售!

房产要闻

又又又狂抢207轮!海口土拍,彻底爆了!

无障碍浏览 进入关怀版