![]()
你有没有想过一个问题:如果你让AI画一个厨师,但让这个厨师去公园里散步而不是在厨房里工作,AI画出来的人还会穿着厨师服吗?
这个问题听起来有点无聊,但背后藏着一个挺重要的事情。我们都知道AI画图会有刻板印象,比如画"医生"总是画出白大褂,画"机械师"总是画出男性。但过去几乎所有研究这个问题的人,都是在一个固定场景里测试的,就是干脆不给场景,直接说"画一个医生"。这就好比你想知道一个人到底是不是真的喜欢穿西装,你只在他上班的时候观察他,从来没看过他周末去海边是什么样子。
这篇来自慕尼黑工业大学、特伦托大学等机构的研究,做了一件挺较真的事:他们把92种职业分别放进"完全无场景"、"合理场景"(比如厨师在厨房)、"完全不合理场景"(比如厨师在公园)三种设定里,然后观察AI到底会不会因为换了场景,就把职业相关的刻板印象也一起换掉。
答案有点让人意外。
**场景变了,但人脸上的偏见没有变**
先说说这个研究到底是怎么做的。研究团队做了一套叫ContextBench的测试题库,覆盖92种职业,1656条精心设计的提示词,然后用四个当前最先进的文生图模型(FLUX.1、Stable Diffusion XL、Stable Diffusion 3.5、Qwen-Image)跑出了66240张图片。
文生图模型:指能根据文字描述自动生成图片的AI系统,你输入"一只在海边奔跑的金毛",它就能画出这样一张图。
这个规模在同类研究里算是相当扎实的了。研究者没有满足于"AI会不会有偏见"这种粗糙的问题,而是把问题拆解得更精细:偏见到底是"职业本身自带的",还是"场景强化出来的"?如果把职业挪到一个完全不搭调的场景里,这个偏见会不会被冲淡?
为了搞清楚这件事,他们设计了三种条件。第一种叫"无场景",就是最简单的"一张厨师的照片"。第二种叫"场景相关",比如"一张厨师在厨房里做菜的照片",场景和职业是匹配的。第三种叫"场景不相关",比如"一张厨师在公园里散步的照片",场景和职业完全不搭。
这三种条件的设计逻辑,其实很像做一个"控制变量"的实验。你想知道到底是职业标签本身导致了刻板印象,还是配套场景在推波助澜,那就把场景单独拿出来变化,职业保持不变,看看图片里到底哪些东西跟着变了,哪些没变。
如果不这样设计会怎样?
如果只在"无场景"条件下测试,你顶多能知道"AI对厨师这个词有刻板印象",但你永远不知道这个刻板印象有多顽固,一旦语境变了它是不是立刻消失。这就好比你只在办公室里见过一个同事,你以为他见了任何人都是那副严肃脸,结果你在他家庭聚会上看到他跳舞唱歌,才发现原来"严肃"只是他工作场景下的表现,不是他这个人的本质。研究者要搞清楚的正是这个:AI画出来的厨师服,到底是"厨师"这个概念本身自带的标签,还是被"厨房"这个场景硬拽出来的?
**属性提取:让AI自己给AI"挑刺"**
光生成图片还不够,研究团队还得有一套办法,从这66240张图片里,系统性地把"这个人是男是女、穿什么衣服、拿什么工具、什么表情、镜头是什么角度"这些信息全都抠出来。
这个工作交给了GPT-5-mini来完成。研究者设计了一套包含30个维度的属性表格,分成四大类:场景外观(比如色调、天气、氛围)、镜头(比如景深、构图、视角)、物品(比如工具道具)、人物(比如年龄、性别呈现、服装、配饰、表情、姿势)。
属性提取:指用AI模型自动分析图片内容,把图片里能看到的特征(比如"穿白大褂""表情严肃""站姿")转化成结构化文字标签的过程,这样才能大批量统计和对比。
其中大部分维度用的是"闭集"标签,也就是预先划定好的固定选项,比如年龄范围只能选"儿童、青少年、青年、中年、老年"这几种。但有三个维度是"开放式"的,包括工具道具、服装款式、活动内容,因为这些东西太丰富多样了,没法提前穷举,只能让AI自由描述,事后再做归类整理。
这套流程听起来简单,但研究者非常在意它靠不靠谱。他们专门做了一次验证:构造了220条"标准答案已知"的提示词(比如直接说"一张男性调酒师的照片"),生成图片后检查AI提取的属性是不是和提示词里写的一致。结果四个模型的准确率都在86%到92%之间,平均F1分数接近95分,说明这套自动化分析工具确实靠谱。
不仅如此,他们还找了三名人工标注员,独立标注了1200张图片,跟自动化流程的结果对比,两者之间的一致性达到了Cohen's κ = 0.822,属于相当高的水平。这一步挺关键的,因为如果自动化提取本身就不靠谱,那后面所有基于这套数据得出的结论都站不住脚。
**核心发现:换了场景,偏见不但没消失,反而更集中了**
现在来到最关键的部分。研究者用了两个指标来衡量"偏见到底有多顽固"。
第一个叫偏见强度(Bias Intensity,简称BI)。这个指标衡量的是,在某个属性维度上(比如性别),生成的图片是不是高度集中在某一个标签上。如果100张厨师照片里99张都是男性,那这个维度的BI就接近1,说明高度集中,也就是偏见很强。如果50张是男性50张是女性,BI就接近0,说明很均匀,没什么偏见。
偏见强度:用信息熵计算出的一个0到1之间的数值,数值越接近1,说明生成结果越集中在某一个标签上(比如全是男性),数值越接近0,说明结果越分散多样。
研究者原本的假设是,如果AI真的理解"职业+场景"这种组合概念,那把厨师放进一个不相关的场景里(比如公园),厨师服这种职业标志应该会被"稀释"掉,因为公园里没道理穿厨师服。按这个逻辑,BI应该下降。
结果恰恰相反。
从"无场景"到"场景不相关",跨角色汇总后的平均BI从0.452升到了0.499,涨了0.047。这个数字看着不大,但背后的意思很扎心:不是每个职业自己的刻板印象变强了,而是不同职业被硬生生拽向了同一个"默认模板",导致整个数据集层面看起来更集中了。
这就好比一群性格各异的人,被塞进同一套统一制服里,你远远看去会觉得"这群人怎么看起来都差不多",但仔细看每个人,他们各自的个性并没有变得更极端,只是被抹平成了相似的样子。
如果按"每个职业单独算,再取平均"这种方式来看,BI其实是略微下降的,从0.724降到0.694。这两个数字看起来矛盾,其实说明了一件很微妙的事:场景不相关并没有让厨师这个职业本身的画像变得更死板,但它让整个基准测试里所有职业的画像,被压向了某种共同的默认状态。用大白话讲,就是场景乱了之后,AI没有"忘记"厨师该有的样子,反而让所有职业看起来都更趋同了。
这个效应在不同属性类别上的表现很不均匀。场景类属性(比如色调、天气、氛围)受影响最大,BI从0.430涨到0.524,涨了0.093,这说明背景环境确实会随着场景描述而调整。物品类属性涨了0.058,人物类属性只涨了0.042,说明人物身上的标签本来就已经很固定了,场景变化对它的冲击相对有限。镜头类属性整体几乎没变(只降了0.003),但这个"几乎不变"背后其实藏着两股相反的力量:构图的集中度上升了0.120,但景深的多样性上升了0.154,两者正好抵消,让整体数字看起来风平浪静。
**具体到某个职业,偏见到底有多顽固**
光看抽象的BI数值可能还不够直观,研究者还专门统计了具体的"职业-标签"对应关系,用一个叫上下文一致性分数(Context Consistency Score,简称CCS)的指标来衡量。
上下文一致性分数:综合考虑某个标签在所有场景条件下出现的频率,以及这个频率在不同场景之间波动有多大,波动越小、出现频率越高,这个分数就越高,说明这个标签越顽固。
具体数字挺说明问题的。"舞者"在四个模型里被画成女性的比例是98%到100%,不管你把舞者放在无场景、相关场景还是不相关场景里,这个比例几乎纹丝不动,波动只有1个百分点。"木匠"被画成男性的比例是97%到100%。"空乘"被画成女性的比例是99%到100%,波动只有2.9个百分点。"机械师"被画成男性的比例在94%到100%之间。
不只是性别标签顽固,工具类的关联也很稳。"焊工"戴手套的比例在29%到32%之间,四个模型全部通过了"跨场景一致性"检验。"面包师"系围裙的比例在31%到33%之间,同样在所有模型里都稳定存在。相比之下,"收银员"和"屏幕"这个物品的关联就弱得多,CCS只有1.3分,研究者推测这可能跟这个物品本身在画面里不够显眼有关。
服装方面也有类似的模式。"医生"穿白大褂的比例在31%到50%之间,虽然这个比例本身不算特别高(毕竟医生也可以穿别的衣服),但这个关联在四个模型里有两个通过了跨场景稳定性检验,说明即便有其他服装选项,这个标志性符号依然会顽强地出现。
这里有个挺值得琢磨的对比:表情和配饰这类维度,CCS普遍很低,说明它们本来就不算是职业的核心标志,AI画的时候也确实没有固定套路。这恰恰反过来证明了这套评测框架是有辨别力的,它不是给什么标签都打高分,而是真的能区分出哪些属性是顽固的刻板印象,哪些只是随机变化的细节。
**换个说法问AI,结果会不会不一样**
有人可能会想,会不会这些顽固的关联只是因为提示词写法比较单一,如果换一种说法问AI,结果会不会完全不同?
研究者也想到了这一点,专门做了一轮"提示词改写"的测试。对于每一条基础提示词,他们额外生成了两条语义完全相同但措辞不同的版本,对于涉及场景的提示词,还额外替换了场景和活动的具体内容(比如把"公园"换成"客厅")。然后检验同一个职业标签在这些不同措辞下,出现频率是否保持一致。
结果显示,跨越所有这些改写版本,93.3%的"职业-标签"组合依然保持稳定,物品类属性的稳定性最高,达到95.0%,人物类属性紧随其后,达到92.1%。唯独镜头类属性对措辞变化比较敏感,稳定性只有64.9%,这跟前面提到的"构图和景深互相拉扯"的现象是吻合的。
这个结果其实挺重要的,因为它排除了一种可能性:这些顽固关联并不是因为提示词碰巧写得不好,而是AI模型内部真的存在一套相对固定的"职业画像模板",不管你怎么换着法子问,它调出来的还是同一套东西。这就像你问一个只会做红烧肉的厨子做十种不同的菜,不管你怎么描述这十道菜的名字,他端上来的味道总是带着同一种酱油和糖的底色。
**这件事到底意味着什么**
研究者在论文里提出了一个挺有分量的观点,叫"组合泛化"的角度。
组合泛化:指AI系统应该能够灵活组合不同的概念(比如"职业"加上"场景"),生成真正符合新组合逻辑的内容,而不是简单套用某个概念自带的固定模板。
如果一个AI真的具备组合泛化能力,那当你把厨师放进公园这个新组合场景里,它应该能意识到"公园里的厨师"跟"厨房里的厨师"应该有明显不同的视觉呈现,至少厨师服这种强场景关联的元素应该会被削弱。但实验结果显示,AI并没有真正做到这一点,它更像是把"场景"这个变量单独渲染出来,而"职业该长什么样"这件事,几乎是焊死在模型内部的一套固定认知里,不太会因为外部场景的变化而调整。
这意味着现在这些文生图模型,可能并没有像我们期待的那样"理解"职业和场景之间的关系,而更像是在做一种拼贴:场景是场景,人物模板是人物模板,两者各自独立,谁也不太会真正影响谁。
这个发现之所以重要,是因为它揭示了一种"隐形的偏见"。如果你只测试"无场景"条件,你可能会觉得AI对厨师的刻板印象还算合理(毕竟厨师确实经常穿厨师服)。但当你把厨师放进一个完全不合理的场景里,这个刻板印象依然纹丝不动,这时候你才能真正看清楚,这不是"合理的职业特征",而是一种被焊死在模型深处、不受语境影响的固化联想。
写在后面
读到这篇论文的时候,最让我意外的其实不是"AI有偏见"这件事本身,这在这个领域已经算是老生常谈了。真正让我停下来想了一会儿的,是"场景不相关反而让整体更集中"这个发现。
我原本以为,如果把职业硬塞进一个不搭调的场景,最坏的结果无非是画面显得违和,或者AI干脆放弃职业标签、全力配合场景。但研究显示的是第三种情况:AI既没有完全放弃职业标签,也没有让画面显得特别违和,而是把不同职业都拉向了某种共同的默认样式。这种"既不坚持也不放弃,而是趋同"的行为模式,其实比单纯的刻板印象更难被察觉,也更难被简单地"修复"。
另一个让我反复琢磨的细节是镜头类属性的那个"假象"。整体上看,镜头这个维度的偏见强度几乎没变化,如果只看这一个总数,你会得出"场景变化对镜头没影响"的结论。但拆开来看,构图和景深其实在往完全相反的方向变化,只是刚好互相抵消,让总数看起来风平浪静。这提醒我一件挺基本但常常被忽略的事:任何一个被汇总过的平均数,都有可能藏着完全相反的两股力量在打架,光看总数是看不出这些暗流的。
这套研究方法本身也让我想到一件事:很多我们习以为常的"偏见测试",其实测的都是最简单的那个版本,就像只在办公室里观察一个人。如果真想搞清楚一种倾向到底有多根深蒂固,可能真的需要像这篇论文一样,故意把它挪到一个完全不相干的场景里,看它会不会现出原形。
Q&A
Q1:ContextBias研究发现了什么核心结论?
A:研究发现把职业角色放进语义不相关的场景(比如厨师在公园)并不会削弱职业相关的刻板印象,反而让不同职业的视觉表现更趋于统一的默认模板,跨角色的属性集中度反而上升了。
Q2:为什么把厨师放进公园里,AI画出来的还是厨师服?
A:因为AI模型里"职业该长什么样"这套认知相对固定,不太会因为场景变化而调整,场景和人物模板更像是各自独立渲染,而不是真正理解两者组合后应该产生的新逻辑。
Q3:这项研究测试了哪些文生图模型?
A:研究评测了FLUX.1、Stable Diffusion XL、Stable Diffusion 3.5和Qwen-Image四个模型,覆盖92种职业、1656条提示词,共生成了66240张图片进行分析。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.