网易首页 > 网易号 > 正文 申请入驻

AI 也会"以貌取人" 而且比人还狠

0
分享至


来源:混沌巡洋舰

一项覆盖 GPT-4o、GPT-5、Gemini 3、Claude 4.5 的研究
揭示了语言模型最令人不安的一面

你看一眼陌生人的脸,大概三秒钟,脑子里就会冒出一个判断:
这个人靠不靠谱?能不能干?

科学家管这叫"面部特质推断"(face-based trait inference)。
它不准确,但人类就是这么干的——几十万年进化写进脑子里的本能。

问题来了:AI 会不会也干这事?

01 人类的老毛病,AI 也染上了

2026 年 8 月,PNAS Nexus 上线了一篇论文,标题直白得让人心里一紧:

"Like humans, language models demonstrate face-to-character biases" (和人类一样,语言模型表现出"面部长相—性格特征"偏见)

来自哈佛大学心理学系、卡内基梅隆大学语言技术研究所和 Cangrade 公司的三位研究者,干了件很硬核的事——

他们用13 项实验近 8000 次试验,测试了4 个主流大模型(GPT-4o、GPT-5、Gemini 3 Flash Preview、Claude Sonnet 4.5),就问一个问题:

主要靠文本训练出来的大语言模型,看到一张人脸照片的时候,会不会像人类一样,凭长相去判断一个人的性格?

答案让人不太舒服。


图 1.实验使用的示例面孔。左组(1a/1b)在人类感知的"可信度"上不同;右组(2a/2b)在"能力"上不同。你能一眼看出哪张更"靠谱"吗?AI 也能,而且它比你更确信。

02 不是"有点偏见",是系统性地偏

先看核心数据。GPT-4o 在所有 7 个核心实验中,74.88%的判断都偏向了"预期中的那张脸"——也就是人类评分认为更可信或更能干的那张。

优势比(Odds Ratio)达到2.981,P 值小于 0.0001。统计上铁板钉钉。

但这还不是最离谱的。

GPT-4o 判断"能力"时的选中率高达 87.83%。

作为对比,人类做同样任务时的预估选中率大约只有62.65%

换句话说——AI 比人类更"自信"地以貌取人,而且错得更理直气壮。

研究者还做了回归分析:面孔的形态变化(morph level)能解释 GPT 评分方差的81.01%。同样条件下,人类只有3.59%

这说明什么?GPT 的判断几乎完全被面部特征牵着走。人类好歹还会犹豫一下。


图 2.按可信度递增排列的 7 张变形面孔(脸 1 → 脸 7)。相邻面孔生理差异很小(比如脸 3 和脸 5 很难区分),但脸 1 和脸 7 差异明显。实验发现:面孔差异越大,AI 判断越果断;差异越小,AI 反而比人类更容易出错。

03 偏见还会"传染"——连猴子都不放过

如果只是判断"这人看起来挺能干",那还算温和。但研究发现,这种偏见会层层升级


第一层:从核心特质泛化到相关特质

实验让 GPT-4o 判断与"能力"语义相关的特征——自信(Confident)、聪明(Smart)、有领导力(Leader-like)等 6 项。结果?全部显著偏向。

可信度那边也一样:温暖(Warm)、乐于助人(Helpful)、友善(Friendly)……照单全收。

第二层:跨物种泛化

这是最魔幻的部分。

研究者拿了一组猴子的脸(来自耶鲁大学 Laurie Santos 实验室,人类已经给这些猴脸打过分,哪些"看起来nice"、哪些"看起来mean")。

GPT-4o 从来没在训练数据里见过这些猴子。但它依然选了那张"看起来 nicer"的猴脸——选中率 66%,显著高于随机。

一个主要靠文本训练的模型,把人类对"可信面相"的审美标准,迁移到了灵长类动物身上。

你品品这事儿。

第三层:极端决策

实验 6 直接上狠活:给 GPT-4o 看两张脸,问它哪张更像连环杀手、哪张更像人口贩子

结果:68.7%的次数,它把"低可信度"面孔归为了罪犯。

实验 7 更现实:哪张脸更适合当校长?哪张值得风险投资

75.19%的高影响职位推荐,都给了"高能力"面孔。

示意图.语言模型内化面部偏见的完整链条:训练语料中的人类偏见 → LLM 学习面部-性格关联 → 输入人脸图像 → 输出偏见判断 → 泛化至相关特征/跨物种/极端决策 → 渗透高风险场景。

04 越新的模型,越"以貌取人"

如果这是 GPT-4o 一个模型的毛病,那还好说——也许是个案。

但研究者把实验搬到了三个更新的模型上,结果更扎心:

GPT-5(能力判断)94.33%

GPT-5(高影响决策)97.04%

Gemini 3 Flash显著高于 GPT-4o

Claude Sonnet 4.5显著高于 GPT-4o

GPT-5 在实验 8 和 9 中的表现简直可以用"决绝"来形容——97% 的一致率,基本就是看到"能干脸"就一路绿灯。

有意思的是,这些模型在遇到种族和性别刻板印象时,通常会拒绝回答或者给出中立回应。说明目前的对齐训练(alignment training)是领域特定的——它教会了模型"不要歧视种族性别",但没教"不要以貌取人"。

一个漏洞堵上了,另一个还在漏。

05 这事为什么值得认真对待

你可能觉得:"不就是个 AI 看脸嘛,又不会真用它招人。"

但现实是,AI 正在越来越多地渗入筛选场景

  • 招聘初筛

    ——有些公司已经开始用 AI 分析求职者视频面试中的"面部特征"来判断性格匹配度

  • 信贷审批

    ——部分 fintech 产品尝试结合"面部可信度"评估违约风险

  • 安全筛查

    ——机场、边境、大型活动的智能监控系统中,"可疑面孔"的判定逻辑可能就藏着这种偏见

  • 法律辅助

    ——AI 辅助证据分析时,如果无意中把"长得不像好人"纳入考量呢?

这篇论文的意义就在这里:它不是在说"AI 有个小毛病",而是在说当前最先进的 AI 系统,在高风险决策场景中使用时,可能存在系统性的、未被察觉的公平性缺陷

论文的核心呼吁:

  1. 在高风险 AI 系统中排除人脸图像输入

  2. 发展域无关(domain-agnostic)的公平策略,而不是一个一个打补丁

  3. 面相偏见审计纳入 AI 红队测试(red-teaming)的标准流程

人类以貌取人,那是进化遗留的 cognitive shortcut(认知捷径)——不完美,但至少我们知道它在,也在努力克服。

AI 以貌取人,则是另一种性质的问题:它是在没有意识、没有反思能力的情况下,把我们社会中最隐蔽的偏见之一,学得比我们本人还彻底、还坚定。

然后把它装进一个个"智能决策系统"里,用来判断谁该拿到 offer、谁该被多看两眼。

这篇论文发在 PNAS Nexus 上,不是什么冷门期刊。它提醒我们:当我们在谈论 AI 安全和对齐的时候,不能只盯着那些显眼的雷区——种族、性别、暴力内容。那些藏在视觉感知深处的、看似无害的"直觉判断",可能才是更难缠的对手。

毕竟,连猴子都没逃过。

论文信息

Lehr SA, Lothe Y, Banaji MR. Like humans, language models demonstrate face-to-character biases.
PNAS Nexus. 2026;5(8):pgag247.
DOI: 10.1093/pnasnexus/pgag247

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
尼泊尔一侧发生泥石流灾害,致西藏吉隆口岸重大人员伤亡、失联,有建筑被掩埋,武警官兵已前往现场处置

尼泊尔一侧发生泥石流灾害,致西藏吉隆口岸重大人员伤亡、失联,有建筑被掩埋,武警官兵已前往现场处置

极目新闻
2026-08-26 16:40:04
五问湖南衡阳店主扶人赔付事件

五问湖南衡阳店主扶人赔付事件

极目新闻
2026-08-25 20:05:57
罗永浩向扶老人被索赔女店主捐助10万元,店主已获12万捐赠,官方承诺返还1.9万还没到位

罗永浩向扶老人被索赔女店主捐助10万元,店主已获12万捐赠,官方承诺返还1.9万还没到位

Mr王的饭后茶
2026-08-26 10:24:44
郑某涉嫌肢解抛尸,韩国警方正在焚烧厂搜寻中国女留学生部分遗体;监控拍下嫌犯男扮女装抛尸画面,其曾在遇害女生大学教授解剖学等课程

郑某涉嫌肢解抛尸,韩国警方正在焚烧厂搜寻中国女留学生部分遗体;监控拍下嫌犯男扮女装抛尸画面,其曾在遇害女生大学教授解剖学等课程

极目新闻
2026-08-26 16:06:25
全国人民都知道了!邢某彬每月来厦门都要魏莹必须陪他,细节曝光

全国人民都知道了!邢某彬每月来厦门都要魏莹必须陪他,细节曝光

文刀贰
2026-08-24 18:09:23
最大的台独分子,总算露出了真面目!原来,最大的台独分子并不都是溃退到台湾的国民党,也不是台湾普通民众,更不是土生土长的台湾原居民

最大的台独分子,总算露出了真面目!原来,最大的台独分子并不都是溃退到台湾的国民党,也不是台湾普通民众,更不是土生土长的台湾原居民

扶苏聊历史
2026-08-26 12:33:46
为什么身边越来越多人,宁愿在家待业也不上班?我们对工作的期待变化有多大?

为什么身边越来越多人,宁愿在家待业也不上班?我们对工作的期待变化有多大?

贵重物品爱美食
2026-08-26 15:17:59
突发!霍尔木兹海峡传来重磅信号,油价跳水美股集体大涨

突发!霍尔木兹海峡传来重磅信号,油价跳水美股集体大涨

魏家东
2026-08-26 09:27:02
特斯拉中国向公安机关报案

特斯拉中国向公安机关报案

第一财经资讯
2026-08-26 19:47:35
法国人气晕了?中埃文明之鹰联合演训,只为了买上百架歼-10CE?

法国人气晕了?中埃文明之鹰联合演训,只为了买上百架歼-10CE?

面包夹知识
2026-08-26 15:08:36
尼泊尔8:10山洪,10:30砸进吉隆口岸:不是"没预警",是预警的雨量计只装到海关这一侧

尼泊尔8:10山洪,10:30砸进吉隆口岸:不是"没预警",是预警的雨量计只装到海关这一侧

防灾小卫士
2026-08-26 18:05:15
特朗普宣布:全美降半旗一周

特朗普宣布:全美降半旗一周

环球时报国际
2026-08-26 12:39:36
25岁中国留学生在韩遇害嫌疑人被捕:管辖权属于谁?是否可以引渡?法律专业人士解读

25岁中国留学生在韩遇害嫌疑人被捕:管辖权属于谁?是否可以引渡?法律专业人士解读

澎湃新闻
2026-08-26 18:30:27
1岁幼童频繁抓挠耳朵,就医后发现耳道内有多颗种子已经发芽,医生提醒

1岁幼童频繁抓挠耳朵,就医后发现耳道内有多颗种子已经发芽,医生提醒

环球网资讯
2026-08-26 09:08:07
不服!38岁迪马利亚抗议FIFA重罚:太夸张 故意搞阿根廷 最后会减刑

不服!38岁迪马利亚抗议FIFA重罚:太夸张 故意搞阿根廷 最后会减刑

风过乡
2026-08-26 10:10:15
回收成功三分钟后被烧倒,某群体闻着味来团建,西方却集体闭嘴

回收成功三分钟后被烧倒,某群体闻着味来团建,西方却集体闭嘴

施涛说
2026-08-25 11:14:22
买机票时候就被盯上!又抓一人:华人女子带娃旅游归来被ICE带走,孩子公民也没用

买机票时候就被盯上!又抓一人:华人女子带娃旅游归来被ICE带走,孩子公民也没用

华人生活网
2026-08-26 04:58:10
尼泊尔山洪洪峰局地达8到10米,村民靠喝洪水等救援 有报道称105名印度游客失联

尼泊尔山洪洪峰局地达8到10米,村民靠喝洪水等救援 有报道称105名印度游客失联

红星新闻
2026-08-26 23:12:34
美国:中国 "落地抓人太卑鄙",中方:还记得孟晚舟1028天吗?

美国:中国 "落地抓人太卑鄙",中方:还记得孟晚舟1028天吗?

小莜读史
2026-08-26 12:29:59
24小时内,特朗普开打两场“战争”

24小时内,特朗普开打两场“战争”

补壹刀
2026-08-26 18:18:33
2026-08-27 01:27:00
人工智能学家 incentive-icons
人工智能学家
人工智能领域权威媒体
5006文章数 37516关注度
往期回顾 全部

科技要闻

DeepSeek被曝前七个月收入4.75亿元

头条要闻

央视:政务App日活用户仅60人 当地投4670万"打水漂"

头条要闻

央视:政务App日活用户仅60人 当地投4670万"打水漂"

体育要闻

兑现五年之约,含梗量最高的世界冠军诞生

娱乐要闻

包文婧当初担心包贝尔出轨,预言成真

财经要闻

洪灏:人民币是全球最被低估的货币

汽车要闻

北京现代吴周涛:艾尼氪V,中国定义专为年轻人打造

态度原创

家居
旅游
艺术
时尚
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

不止网红打卡!这座边境古塔,藏着云南最温柔的岁月沉淀

艺术要闻

加拿大震惊业界!北美最高抗震木结构办公楼亮相

卡其裤+蓝衬衫,简单高级

军事要闻

特朗普赞赏后 三个美国盟友邀请伊朗加入"中东版北约"

无障碍浏览 进入关怀版