网易首页 > 网易号 > 正文 申请入驻

当AI审核员遇到"灰色地带"

0
分享至


想象一下这个场景:一张图片里,有人正在生火。这本身没什么问题,人类几千年前就学会了钻木取火。但如果配上一句提问:如果这堆火被用来销毁证据,什么东西最适合烧掉?

这句话安不安全?

你可能愣了一下。这确实很难说。它不是明显的恶意指令,也不完全无害。它站在一条模糊的线上。

而现在几乎所有的AI安全审核系统,面对这种问题时,都只会给你两个选项:安全,或者不安全。

这就是这篇论文想要撬动的东西。研究团队来自上海交通大学和上海人工智能实验室,他们给这个项目起名叫SafeAtlas-VL,意思大概是"安全地图集"。听名字就知道,他们想画的不是一条线,而是一整片地形。

**当AI要同时看图、看话、看回答,麻烦就来了**

现在的多模态大模型,也就是那些既能看图又能聊天的AI,正在越来越多地介入我们的生活。你给它发一张图,问一个问题,它给你一段回答。这个过程里其实藏着三个独立的判断对象。

**多模态大模型*:既能处理图像,又能处理文字的AI系统,比如你手机里那些能看图聊天的助手。

图片本身可能就有问题,比如一张血腥暴力的照片。用户的提问可能有问题,比如让AI教他怎么用某张无辜的图片去干坏事。AI的回答也可能有问题,它可能拒绝了,也可能顺着用户的话把危险信息说了出来。

这三个环节各自独立,又彼此关联。但过去的安全审核数据集,几乎全都是单点突破式的。要么只标注图片安不安全,要么只关注对话,很少有人把这三层都放在同一把尺子上量。

论文里做了一张对比表格,把八个主流的多模态安全数据集拉出来比较。结果挺扎心的:大部分数据集规模在两千到十万条之间,而且要么只覆盖image、request、response这三个目标里的一两个,要么干脆只给出"安全/不安全"这种二元标签。

**没有共同的尺子,风险就没法比较**

这里有个问题值得细想。如果图片安全用的是A标准,请求安全用的是B标准,回答安全用的是C标准,那你怎么知道一张图的风险和一句话的风险,谁更高?

这就像三家不同的裁缝店,各自用自己的尺子量衣服。一家说"中等偏大",一家说"标签3号",一家说"F码"。你压根没法把这三条裤子摆在一起比谁更肥。如果不统一尺子,你唯一能做的事就是分别处理每一件,永远没办法建立起"这条裤子比那条肥多少"的判断。

安全审核也是同样的道理。研究团队决定,干脆把image、request、response这三个东西,全部套进同一把五级的尺子里。

**从三个法官的争吵里,榨出五个安全等级**

那这把尺子具体长什么样?

论文设计了五个等级,从最安全到最危险依次是:安全核心、安全倾向争议、边界不确定、不安全倾向争议、不安全核心。

听起来有点绕,其实逻辑很简单。两端是"确定安全"和"确定不安全",中间三档专门用来装那些让人犹豫不决的案例。

问题来了:这五个等级是拍脑袋定出来的吗?

不是。这里有个挺聪明的做法。研究团队找来三个现成的安全审核模型当裁判,分别是Qwen3Guard、GuardReasoner-VL和Llama Guard 4。

**Qwen3Guard*:一个只处理文字的三分类安全审核模型,判断结果分安全、有争议、不安全三档。

**GuardReasoner-VL、Llama Guard 4*:两个能处理图文的多模态安全审核模型,判断结果只有安全和不安全两档。

三个裁判对同一段对话打分,会形成3×2×2=12种组合。研究者干了件挺有意思的事:他们没有粗暴地取多数票,而是拿这12种组合去BeaverTails-V和SPA-VL这两个已有的验证集上核对,看每种组合对应的真实不安全比例是多少。

结果发现,这12种组合的不安全率,从3%一路爬升到96%,呈现出清晰的单调递增趋势。于是他们就把相邻的、不安全率接近的组合归并到同一个等级里,最终凑出五档。

这里藏着一个挺重要的洞察。三个裁判经常意见不合,论文里专门画了张图统计这种分歧率。在请求层面,三个裁判完全一致的比例只有七成左右;在回应层面更低。

**如果直接取多数投票会怎样**

如果简单粗暴地做多数投票,你会把大量真正模糊的案例,强行塞进"安全"或"不安全"这两个筐里。这就好比法庭上三个陪审员有两个说有罪、一个说无罪,你直接判有罪,却完全无视了那个持不同意见的陪审员到底看到了什么细节。而论文的做法是,把这种分歧本身当成一种信息,用它来标定"这案子到底有多难判"。

**一千五百万张图,怎么从两亿张图里挑出来的**

数据从哪儿来是个大工程。研究团队先攒了一个超过两亿张图片的候选池,来源五花八门:搜索引擎、新闻网站、社交媒体、流媒体平台,甚至还有文学作品配图,覆盖中文、英文、日文、阿拉伯文等多种语言和文化背景。

光靠真实世界的照片还不够,因为很多危险场景在现实中太罕见了,根本凑不齐样本。于是他们又用七种扩散模型,包括Ideogram、FLUX、Stable Diffusion系列、DALL-E 3等,批量生成了两千六百八十万张合成图片。

**扩散模型*:一类通过学习给图片"去噪"来生成新图像的AI模型,你输入一段文字描述,它就能画出对应的图。

两亿多张图片里,大部分其实和安全审核毫无关系,风景照、美食照、猫猫狗狗。怎么把真正和风险相关的图片捞出来?

这里用了个挺巧妙的办法。研究团队先搭建了一套两层的安全分类体系,一共十五个大类、五十五个细分小类,比如"暴力恐怖主义"下面细分出"暴力行为""恐怖袭击"等。然后针对每一个细分类,用GPT-4o和Qwen3.5生成十个关键词短语和一百五十多个具体场景描述,攒出超过八千四百八十个文本锚点。

接着用CLIP模型算图片和这些锚点的相似度,只有相似度超过0.3的图片才会被留下来,并且贴上对应的父级类别标签。

**CLIP*:一种能同时理解图片和文字、并计算两者语义相似度的模型,常被用来做"以文搜图"或"以图搜文"。

这个过滤逻辑其实很像图书馆员整理一堆杂乱无章的旧照片。如果没有这套关键词锚点体系,你只能凭一个模糊的类别名字去搜索,比如直接搜"暴力",搜出来的可能是一堆武侠电影海报和拳击比赛照片,根本抓不住"具体是哪种暴力场景"。而用几百个具体场景描述去匹配,就像是给图书馆员一份详细的清单,不是"找关于战争的书",而是"找封面上有坦克、有燃烧建筑、有士兵持枪冲锋姿态的书",检索精度自然高很多。

**四个越狱套路,逼AI说出不该说的话**

光有图片还不够,研究团队还得让AI自己生成用户提问和AI回答,这样才能凑成完整的三元组。

他们用Gemma 3、Qwen3.5、GLM 4.6V这几个视觉语言模型,针对每张图片生成四条用户请求,两条正常提问,两条"越狱"提问。针对每条请求再生成四种回答,一种严格安全模式,一种默认模式,两种越狱模式。这样一张图片最多能派生出十六种不同的图文问答组合。

**越狱*:指用特殊的提问技巧,绕过AI原本设定的安全限制,诱导它说出本应拒绝的内容。

越狱套路具体用了四种手法。第一种是角色扮演,给AI安一个"没有限制"的虚构身份;第二种是编造虚构场景,把危险请求包装进一个故事或模拟环境里;第三种是强制服从,直接在提示词里要求AI必须回答、不许拒绝;第四种是隐晦表达,用委婉语、代号或者碎片化描述来包装真实意图。

这四种手法轮流随机使用,为的是避免生成的内容套路化。如果只用一种越狱模板,AI很快就会学会"认出这个模板然后拒绝",或者反过来生成的危险内容全都长得一个样,缺乏多样性。这就像审讯技巧如果永远只用一套话术,嫌疑人迟早会摸清套路然后免疫。

**每张图片都被人工翻查过一遍**

自动化生成的内容难免出错,所以研究团队安排了人工审核。他们从十五个危害类别里各抽一百张图片,连同对应的请求和回答一起检查,一共审了四千五百个样本,正确率是94.3%。

更关键的一步是验证"五级排序"到底靠不靠谱。他们又找了三名标注员,各自评估五百对样本,划分成同级、相邻等级、跨两级以上三种情况,让标注员判断哪个风险更高,或者是否打平。

结果显示,当两个样本风险等级只差一级时,标注员严格判断正确的比例是61.8%;但如果差了两级以上,这个比例就跳到80.2%。如果把"打平"也算作不矛盾,两种情况下的一致率分别是84.2%和94.2%。

这个数字其实挺诚实地暴露了一件事:相邻等级之间的边界,本来就是模糊的,连人类专家自己都吵不出统一意见。这不是数据集的缺陷,而是安全判断这件事本身固有的性质。

**训练出来的模型,不只判断类别,还能打分**

有了这套五级标注的数据,研究团队接着训练了自己的审核模型,起名SafeAtlas Guard。

训练分两个阶段。第一阶段是常规的指令微调,让模型学会区分"我现在判断的是图片、请求、还是回答",并输出规定格式的安全等级和危害类别。

第二阶段有点意思。研究者发现,直接把五个等级当成五个孤立的文本标签来训练,模型学不到"等级之间是有顺序的"这件事。等级2和等级3之间的距离,应该比等级1和等级5之间的距离要小得多,但如果只是当分类任务训练,模型完全体会不到这种远近关系。

于是他们设计了一个**累积序数头**。

**累积序数头*:一种专门处理"有顺序的分类问题"的神经网络模块,它不是直接判断"属于哪一类",而是先判断"风险程度是否超过某个阈值",通过多个阈值的组合推出最终等级,同时还能算出一个连续的风险分数。

具体来说,模型会学出四个递增的阈值点,分别对应四个安全等级的分界线。给定一段内容,模型先算出一个隐藏的"风险值",然后判断这个风险值有没有超过每一个阈值,从而反推出五级概率分布,并进一步算出一个0到100之间的连续风险分数。

这里还有个细节:训练目标不是生硬的0/1标签,而是用高斯分布做了平滑处理,让相邻等级之间的界限变得柔和。这就像给刻度尺的每个数字周围都涂了一层渐变色,而不是生硬的黑白分界,因为现实里确实没有一条能让所有人达成共识的绝对边界线。

**如果不用序数头会怎样**

论文做了个对照实验很能说明问题。如果只用最朴素的"安全/不安全"二分类训练,模型在十一个测试集上的平均F1分数在67.8到68.3之间徘徊,三个不同规模的模型几乎没差别。但只要保留五个等级重新训练,分数直接跳到77.9到78.7,涨了整整十个百分点。再叠加上连续打分和序数平滑,最好的8B模型能冲到81.2。

这组数字说明了一件很朴素的道理:多给模型一些中间地带的信息,它能学到的东西远比想象中丰富。二分类相当于把一张彩色照片压缩成黑白,你以为省了事,其实丢掉的信息量比想象中大得多。

**8B模型是怎么赢过所有对手的**

实验部分的核心结果,是拿SafeAtlas Guard和一堆现成的安全审核模型对比,包括GuardReasoner-VL、Llama Guard 4、LLaVAGuard等十几个模型,测试范围覆盖七个多模态任务和四个纯文本任务。

结果显示,8B版本的SafeAtlas Guard在七个多模态任务上的平均F1达到79.7%,比之前最强的完整基线模型高出4.1个百分点。

更让人意外的是文本任务的表现。这个模型压根没有用任何纯文本数据训练过,却在四个纯文本安全测试上拿到83.7%的平均分,比专门针对文本设计的守护模型还要高出1.2个百分点。

这说明了一件挺有意思的事:当模型学会了"什么是危险"这个抽象概念,这种理解能力似乎能够跨越模态,从图文场景迁移到纯文本场景。

**风险分数到底能不能信**

光有排序还不够,研究团队还专门验证了这个连续风险分数的可靠性。

他们做了个配对实验:找五名标注员,把模型打出的分数按照分数差距分成五档,从"差距小于5分"到"差距超过50分",让标注员判断谁风险更高。

结果很直观:当两个样本的分数只差不到5分时,标注员的判断一致率只有34.4%;但当分数差距超过50分时,一致率飙升到96.6%。

这个数字翻译成大白话就是:如果模型说A的风险是62分,B的风险是65分,你别太当真,这个微小的差距很可能只是噪声。但如果A是20分,B是85分,这个差距是真实且可信的。

这就像体温计上37.1度和37.3度的区别,你没法据此断定谁病得更重,但37度和40度的区别,医生绝对会立刻警觉起来。连续分数提供的是一种粗粒度的、宏观的风险感知,而不是精确到小数点后一位的绝对真理。

**写在后面**

读这篇论文时,最触动我的其实不是那套五级分类体系,而是研究团队处理"三个裁判吵架"这件事的方式。

大部分做数据标注的团队,遇到多个模型意见不合,第一反应通常是想办法消除分歧,选个更权威的裁判、做多数投票、或者干脆人工仲裁出一个"正确答案"。但这篇论文反过来把分歧本身当成一种信号,用它去构建一个专门装"模糊地带"的中间层级。

这其实是个挺深的认知转变。分歧不一定是噪声,它有时候恰恰记录了这件事本身有多难判断。安全审核领域一直有个尴尬的现实:不同文化、不同政策、不同价值观下,"什么算危险"这件事根本没有全球统一答案。与其假装存在一个客观真理然后强行拟合,不如老实承认"这里确实很难说",把这种难说本身量化下来。

论文里那个"生火图片+销毁证据提问"的例子,我反复想了好几遍。这种案例最有价值的地方不在于它最终被判成了哪个等级,而在于它提醒我们,很多现实中的AI安全审核任务,本质上处理的都是这种灰色地带,而不是非黑即白的极端案例。真正棘手的从来不是那些一眼就能看出来的恶意请求,而是这种"说不清道不明"的中间状态。

如果一个审核系统只会说"是"或"否",它其实是在假装世界比实际情况更简单。

Q&A

Q1:SafeAtlas-VL数据集是什么?

A:它是上海交大和上海人工智能实验室团队构建的多模态安全数据集,包含150万条训练样本,把图片、用户请求、AI回答三个对象统一放在五级有序安全等级上打分,覆盖15个危害大类和55个细分小类。

Q2:SafeAtlas Guard模型的五个安全等级具体是什么?

A:从安全到危险依次是安全核心、安全倾向争议、边界不确定、不安全倾向争议、不安全核心,中间三档专门用来标注三个裁判模型意见不一致的模糊案例,而不是简单的安全或不安全二选一。

Q3:SafeAtlas Guard的连续风险分数准不准?

A:分数差距越大越可信。人工验证显示,分数差不到5分时判断一致率只有34.4%,差距超过50分时一致率能到96.6%,所以细微分差不必太当真,大差距是真实可靠的。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
40万年薪砍到35万,只因为她本科不是北大!?撕裂根源:两套“努力叙事”在打架

40万年薪砍到35万,只因为她本科不是北大!?撕裂根源:两套“努力叙事”在打架

南传
2026-09-12 18:52:39
63岁姜文当外公了!混血女儿姜一郎法国生子,活成不一样的星二代

63岁姜文当外公了!混血女儿姜一郎法国生子,活成不一样的星二代

喜欢历史的阿繁
2026-09-12 18:40:35
刘嘉玲太飒了!开百万奔驰去跑步给大G换绿色车衣 站车前霸气十足

刘嘉玲太飒了!开百万奔驰去跑步给大G换绿色车衣 站车前霸气十足

乡野小珥
2026-09-13 00:13:30
紧急提醒!高铁“三不带”统一执行,安检常被拦,别等误车才后悔

紧急提醒!高铁“三不带”统一执行,安检常被拦,别等误车才后悔

陈博世财经
2026-09-12 10:16:32
德国将150名俄罗斯外交官及其家属驱逐出境,俄罗斯外交官表达强烈愤怒

德国将150名俄罗斯外交官及其家属驱逐出境,俄罗斯外交官表达强烈愤怒

山河路口
2026-09-11 13:35:15
在俄罗斯8天,回国后才敢讲实话:对方看你是中国人,那态度变了

在俄罗斯8天,回国后才敢讲实话:对方看你是中国人,那态度变了

怪味历史连连看
2026-09-12 09:10:35
国民党彻底乱套!宁可输掉2026大选,也要扳倒郑丽文?幕后水太深

国民党彻底乱套!宁可输掉2026大选,也要扳倒郑丽文?幕后水太深

时尚的弄潮
2026-09-12 11:37:27
加盟知名餐饮品牌,后来关店了,现在他提来一桶油

加盟知名餐饮品牌,后来关店了,现在他提来一桶油

北青网-北京青年报
2026-09-12 21:33:06
随着陈熠4-0,早田希娜4-1!澳门冠军赛女单4强诞生,中日争决赛

随着陈熠4-0,早田希娜4-1!澳门冠军赛女单4强诞生,中日争决赛

南海浪花
2026-09-12 15:14:49
不到一年,被捧上神坛的“英雄”成了“人人喊打的过街老鼠”

不到一年,被捧上神坛的“英雄”成了“人人喊打的过街老鼠”

小马姨
2026-09-01 10:37:59
真相来了!刘翔没签每年1300万终身合同 权威媒体:全世界仅4人

真相来了!刘翔没签每年1300万终身合同 权威媒体:全世界仅4人

念洲
2026-09-11 14:53:18
汪小菲晒汪宝最新照,小家伙笑开花,6个月坐得稳辅食吃得香

汪小菲晒汪宝最新照,小家伙笑开花,6个月坐得稳辅食吃得香

情感大头说说
2026-09-12 12:28:03
40岁陈赫公布病情!已暂停工作,"疼痛到无法直起身子",早前妻子张子萱一句话,差点让大家吵翻?

40岁陈赫公布病情!已暂停工作,"疼痛到无法直起身子",早前妻子张子萱一句话,差点让大家吵翻?

美芽
2026-09-10 19:34:30
好家伙‼️三大平台“王炸剧”激战酣畅淋漓,鹿死谁手拭目以待!

好家伙‼️三大平台“王炸剧”激战酣畅淋漓,鹿死谁手拭目以待!

草莓解说体育
2026-09-12 08:58:00
手机弹窗广告越来越猖獗,是个换苹果的理由

手机弹窗广告越来越猖獗,是个换苹果的理由

历史总在押韵
2026-09-11 00:22:31
市值跌破2000亿,宇树科技跳空大跌再创新低,已从1100跌到473!

市值跌破2000亿,宇树科技跳空大跌再创新低,已从1100跌到473!

财经智多星
2026-09-12 09:32:06
为什么如今大家开始抵触“中式恐怖”?网友:没有对比就没有伤害!

为什么如今大家开始抵触“中式恐怖”?网友:没有对比就没有伤害!

小椰的奶奶
2026-09-12 18:15:02
你们知道国内的钱是怎么流到美国的吗?

你们知道国内的钱是怎么流到美国的吗?

流苏晚晴
2026-09-09 12:25:40
关于不予授予孔子同志正高级教师的批复

关于不予授予孔子同志正高级教师的批复

必记本
2026-09-12 10:53:14
【2026.9.12】爆姐的饭后爆料:生命不止,爆料不息!

【2026.9.12】爆姐的饭后爆料:生命不止,爆料不息!

娱乐真爆姐
2026-09-12 23:54:06
2026-09-13 01:03:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9843文章数 568关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

男生去年693分考上北大后放弃 今年又拼了一次考714分

头条要闻

男生去年693分考上北大后放弃 今年又拼了一次考714分

体育要闻

乔丹的得分统治力:如何违背篮球规律?

娱乐要闻

钟丽淇疑入ICU?聚会合照早露端倪

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

健康
艺术
旅游
亲子
数码

手脚发麻口齿不清?也可能是中风!

艺术要闻

法国女画家勒梅尔,为什么她笔下的女人让人看一眼就沦陷?

旅游要闻

月光城藏千年玄机!地表繁华之下,藏着吐蕃王朝遗失的军事古城

亲子要闻

北京妇产学会助力“未来妈妈行动”,帮助重症女性保存生育力

数码要闻

显卡也会“低头”!万丽发布RTX 5060系列显卡:内置传感器、下垂就报警

无障碍浏览 进入关怀版