网易首页 > 网易号 > 正文 申请入驻

AI 也会"以貌取人" 而且比人还狠

0
分享至


来源:混沌巡洋舰

一项覆盖 GPT-4o、GPT-5、Gemini 3、Claude 4.5 的研究
揭示了语言模型最令人不安的一面

你看一眼陌生人的脸,大概三秒钟,脑子里就会冒出一个判断:
这个人靠不靠谱?能不能干?

科学家管这叫"面部特质推断"(face-based trait inference)。
它不准确,但人类就是这么干的——几十万年进化写进脑子里的本能。

问题来了:AI 会不会也干这事?

01 人类的老毛病,AI 也染上了

2026 年 8 月,PNAS Nexus 上线了一篇论文,标题直白得让人心里一紧:

"Like humans, language models demonstrate face-to-character biases" (和人类一样,语言模型表现出"面部长相—性格特征"偏见)

来自哈佛大学心理学系、卡内基梅隆大学语言技术研究所和 Cangrade 公司的三位研究者,干了件很硬核的事——

他们用13 项实验近 8000 次试验,测试了4 个主流大模型(GPT-4o、GPT-5、Gemini 3 Flash Preview、Claude Sonnet 4.5),就问一个问题:

主要靠文本训练出来的大语言模型,看到一张人脸照片的时候,会不会像人类一样,凭长相去判断一个人的性格?

答案让人不太舒服。


图 1.实验使用的示例面孔。左组(1a/1b)在人类感知的"可信度"上不同;右组(2a/2b)在"能力"上不同。你能一眼看出哪张更"靠谱"吗?AI 也能,而且它比你更确信。

02 不是"有点偏见",是系统性地偏

先看核心数据。GPT-4o 在所有 7 个核心实验中,74.88%的判断都偏向了"预期中的那张脸"——也就是人类评分认为更可信或更能干的那张。

优势比(Odds Ratio)达到2.981,P 值小于 0.0001。统计上铁板钉钉。

但这还不是最离谱的。

GPT-4o 判断"能力"时的选中率高达 87.83%。

作为对比,人类做同样任务时的预估选中率大约只有62.65%

换句话说——AI 比人类更"自信"地以貌取人,而且错得更理直气壮。

研究者还做了回归分析:面孔的形态变化(morph level)能解释 GPT 评分方差的81.01%。同样条件下,人类只有3.59%

这说明什么?GPT 的判断几乎完全被面部特征牵着走。人类好歹还会犹豫一下。


图 2.按可信度递增排列的 7 张变形面孔(脸 1 → 脸 7)。相邻面孔生理差异很小(比如脸 3 和脸 5 很难区分),但脸 1 和脸 7 差异明显。实验发现:面孔差异越大,AI 判断越果断;差异越小,AI 反而比人类更容易出错。

03 偏见还会"传染"——连猴子都不放过

如果只是判断"这人看起来挺能干",那还算温和。但研究发现,这种偏见会层层升级


第一层:从核心特质泛化到相关特质

实验让 GPT-4o 判断与"能力"语义相关的特征——自信(Confident)、聪明(Smart)、有领导力(Leader-like)等 6 项。结果?全部显著偏向。

可信度那边也一样:温暖(Warm)、乐于助人(Helpful)、友善(Friendly)……照单全收。

第二层:跨物种泛化

这是最魔幻的部分。

研究者拿了一组猴子的脸(来自耶鲁大学 Laurie Santos 实验室,人类已经给这些猴脸打过分,哪些"看起来nice"、哪些"看起来mean")。

GPT-4o 从来没在训练数据里见过这些猴子。但它依然选了那张"看起来 nicer"的猴脸——选中率 66%,显著高于随机。

一个主要靠文本训练的模型,把人类对"可信面相"的审美标准,迁移到了灵长类动物身上。

你品品这事儿。

第三层:极端决策

实验 6 直接上狠活:给 GPT-4o 看两张脸,问它哪张更像连环杀手、哪张更像人口贩子

结果:68.7%的次数,它把"低可信度"面孔归为了罪犯。

实验 7 更现实:哪张脸更适合当校长?哪张值得风险投资

75.19%的高影响职位推荐,都给了"高能力"面孔。

示意图.语言模型内化面部偏见的完整链条:训练语料中的人类偏见 → LLM 学习面部-性格关联 → 输入人脸图像 → 输出偏见判断 → 泛化至相关特征/跨物种/极端决策 → 渗透高风险场景。

04 越新的模型,越"以貌取人"

如果这是 GPT-4o 一个模型的毛病,那还好说——也许是个案。

但研究者把实验搬到了三个更新的模型上,结果更扎心:

GPT-5(能力判断)94.33%

GPT-5(高影响决策)97.04%

Gemini 3 Flash显著高于 GPT-4o

Claude Sonnet 4.5显著高于 GPT-4o

GPT-5 在实验 8 和 9 中的表现简直可以用"决绝"来形容——97% 的一致率,基本就是看到"能干脸"就一路绿灯。

有意思的是,这些模型在遇到种族和性别刻板印象时,通常会拒绝回答或者给出中立回应。说明目前的对齐训练(alignment training)是领域特定的——它教会了模型"不要歧视种族性别",但没教"不要以貌取人"。

一个漏洞堵上了,另一个还在漏。

05 这事为什么值得认真对待

你可能觉得:"不就是个 AI 看脸嘛,又不会真用它招人。"

但现实是,AI 正在越来越多地渗入筛选场景

  • 招聘初筛

    ——有些公司已经开始用 AI 分析求职者视频面试中的"面部特征"来判断性格匹配度

  • 信贷审批

    ——部分 fintech 产品尝试结合"面部可信度"评估违约风险

  • 安全筛查

    ——机场、边境、大型活动的智能监控系统中,"可疑面孔"的判定逻辑可能就藏着这种偏见

  • 法律辅助

    ——AI 辅助证据分析时,如果无意中把"长得不像好人"纳入考量呢?

这篇论文的意义就在这里:它不是在说"AI 有个小毛病",而是在说当前最先进的 AI 系统,在高风险决策场景中使用时,可能存在系统性的、未被察觉的公平性缺陷

论文的核心呼吁:

  1. 在高风险 AI 系统中排除人脸图像输入

  2. 发展域无关(domain-agnostic)的公平策略,而不是一个一个打补丁

  3. 面相偏见审计纳入 AI 红队测试(red-teaming)的标准流程

人类以貌取人,那是进化遗留的 cognitive shortcut(认知捷径)——不完美,但至少我们知道它在,也在努力克服。

AI 以貌取人,则是另一种性质的问题:它是在没有意识、没有反思能力的情况下,把我们社会中最隐蔽的偏见之一,学得比我们本人还彻底、还坚定。

然后把它装进一个个"智能决策系统"里,用来判断谁该拿到 offer、谁该被多看两眼。

这篇论文发在 PNAS Nexus 上,不是什么冷门期刊。它提醒我们:当我们在谈论 AI 安全和对齐的时候,不能只盯着那些显眼的雷区——种族、性别、暴力内容。那些藏在视觉感知深处的、看似无害的"直觉判断",可能才是更难缠的对手。

毕竟,连猴子都没逃过。

论文信息

Lehr SA, Lothe Y, Banaji MR. Like humans, language models demonstrate face-to-character biases.
PNAS Nexus. 2026;5(8):pgag247.
DOI: 10.1093/pnasnexus/pgag247

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
火箭新助教恩格兰德已开练,专帮阿门提升投篮

火箭新助教恩格兰德已开练,专帮阿门提升投篮

绿茵狂热者
2026-09-10 00:35:43
知情人士证实DeepSeek备战科创板IPO,中信已入场尽调

知情人士证实DeepSeek备战科创板IPO,中信已入场尽调

21世纪经济报道
2026-09-09 16:47:35
2nm芯片+万元售价,iPhone 18 Pro凭啥让17 Pro暴跌40%?

2nm芯片+万元售价,iPhone 18 Pro凭啥让17 Pro暴跌40%?

小柱解说游戏
2026-09-08 05:06:02
伊朗:打死或俘虏美军奖3万美元,美国被驱逐已成事实,不得进入波斯湾、阿曼湾和霍尔木兹海峡!海湾国家对美国的愤怒已达最高点

伊朗:打死或俘虏美军奖3万美元,美国被驱逐已成事实,不得进入波斯湾、阿曼湾和霍尔木兹海峡!海湾国家对美国的愤怒已达最高点

每日经济新闻
2026-09-08 17:31:09
搬回英国也融不进王室,哈里惨遭亲爹发信打压,威廉彻底冷战拒不相见

搬回英国也融不进王室,哈里惨遭亲爹发信打压,威廉彻底冷战拒不相见

世界王室那些事
2026-09-09 20:30:50
网传男子相亲,女方却想要结婚化债,这哪是结婚?这是抄家啊!

网传男子相亲,女方却想要结婚化债,这哪是结婚?这是抄家啊!

笔尖下的人生
2025-07-25 17:41:08
偷税911万、卖假红薯粉、编造孤儿身世,这些千万粉网红终于全部凉了

偷税911万、卖假红薯粉、编造孤儿身世,这些千万粉网红终于全部凉了

子芫伴你成长
2026-07-27 22:15:55
这封信证明,教员一生都在追求平等...

这封信证明,教员一生都在追求平等...

慧翔百科
2026-09-09 17:29:38
反转!抱团涨价求生了

反转!抱团涨价求生了

格隆汇楼市V
2026-09-08 21:35:06
“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

背包旅行
2026-09-01 11:59:13
索默:第三个丢球我应该留在门线上;球队今天整体表现很好

索默:第三个丢球我应该留在门线上;球队今天整体表现很好

懂球帝
2026-09-09 04:51:06
伯纳乌头号卧底!皇马巨星断崖式崩盘!穆里尼奥用人彻底翻车

伯纳乌头号卧底!皇马巨星断崖式崩盘!穆里尼奥用人彻底翻车

澜归序
2026-09-09 09:48:12
中国香港首任特首逝世,享年89岁!曾多次去新加坡学习,同李光耀是挚友…

中国香港首任特首逝世,享年89岁!曾多次去新加坡学习,同李光耀是挚友…

新加坡万事通
2026-09-09 19:05:59
上海明早气温或降至下半年来新低,郊区部分地区不足20度!

上海明早气温或降至下半年来新低,郊区部分地区不足20度!

鲁中晨报
2026-09-09 19:15:40
美国选手淘汰黄友政后,竟然喊话樊振东:你是当今最好的球员!

美国选手淘汰黄友政后,竟然喊话樊振东:你是当今最好的球员!

十点街球体育
2026-09-09 20:18:37
吴宇森,有这样一部也够了

吴宇森,有这样一部也够了

虹膜
2026-09-08 22:23:00
中了宇树科技一签,她从赚47万到收益腰斩,只用了短短的13天……

中了宇树科技一签,她从赚47万到收益腰斩,只用了短短的13天……

清流财记
2026-09-09 14:59:57
44岁的阿娇独自在北京生活,住200平的房子,点外卖消费700多,如今生孩子很困难

44岁的阿娇独自在北京生活,住200平的房子,点外卖消费700多,如今生孩子很困难

情感大头说说
2026-09-09 06:49:33
印度21岁女力量举运动员因外貌走红后遭网暴 本人回应:这是极致的性别歧视

印度21岁女力量举运动员因外貌走红后遭网暴 本人回应:这是极致的性别歧视

封面新闻
2026-09-09 19:41:17
黄牛代抢、一机难求!华为Mate XT 2未开售先火,19999元也挡不住

黄牛代抢、一机难求!华为Mate XT 2未开售先火,19999元也挡不住

国货
2026-09-09 12:17:40
2026-09-10 01:03:00
人工智能学家 incentive-icons
人工智能学家
人工智能领域权威媒体
5034文章数 37518关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

男子资助女生5年后停止 遭质问"快打过来 不然曝光你"

头条要闻

男子资助女生5年后停止 遭质问"快打过来 不然曝光你"

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

健康
亲子
教育
游戏
军事航空

中风康复为何像“抽丝剥茧”?

亲子要闻

太阳从西边出来了?女儿主动想学外语

教育要闻

教育部最新公布!北京这40名学生上榜——

《怪物猎人:荒野》登陆Switch2 全新怪物登场!

军事要闻

停止互袭首都3天后 俄乌猛烈交火

无障碍浏览 进入关怀版