![]()
来源:混沌巡洋舰
一项覆盖 GPT-4o、GPT-5、Gemini 3、Claude 4.5 的研究
揭示了语言模型最令人不安的一面
你看一眼陌生人的脸,大概三秒钟,脑子里就会冒出一个判断:
这个人靠不靠谱?能不能干?
科学家管这叫"面部特质推断"(face-based trait inference)。
它不准确,但人类就是这么干的——几十万年进化写进脑子里的本能。
问题来了:AI 会不会也干这事?
01 人类的老毛病,AI 也染上了
2026 年 8 月,PNAS Nexus 上线了一篇论文,标题直白得让人心里一紧:
"Like humans, language models demonstrate face-to-character biases" (和人类一样,语言模型表现出"面部长相—性格特征"偏见)
来自哈佛大学心理学系、卡内基梅隆大学语言技术研究所和 Cangrade 公司的三位研究者,干了件很硬核的事——
他们用13 项实验、近 8000 次试验,测试了4 个主流大模型(GPT-4o、GPT-5、Gemini 3 Flash Preview、Claude Sonnet 4.5),就问一个问题:
主要靠文本训练出来的大语言模型,看到一张人脸照片的时候,会不会像人类一样,凭长相去判断一个人的性格?
答案让人不太舒服。
![]()
图 1.实验使用的示例面孔。左组(1a/1b)在人类感知的"可信度"上不同;右组(2a/2b)在"能力"上不同。你能一眼看出哪张更"靠谱"吗?AI 也能,而且它比你更确信。
02 不是"有点偏见",是系统性地偏
先看核心数据。GPT-4o 在所有 7 个核心实验中,74.88%的判断都偏向了"预期中的那张脸"——也就是人类评分认为更可信或更能干的那张。
优势比(Odds Ratio)达到2.981,P 值小于 0.0001。统计上铁板钉钉。
但这还不是最离谱的。
GPT-4o 判断"能力"时的选中率高达 87.83%。
作为对比,人类做同样任务时的预估选中率大约只有62.65%。
换句话说——AI 比人类更"自信"地以貌取人,而且错得更理直气壮。
研究者还做了回归分析:面孔的形态变化(morph level)能解释 GPT 评分方差的81.01%。同样条件下,人类只有3.59%。
这说明什么?GPT 的判断几乎完全被面部特征牵着走。人类好歹还会犹豫一下。
![]()
图 2.按可信度递增排列的 7 张变形面孔(脸 1 → 脸 7)。相邻面孔生理差异很小(比如脸 3 和脸 5 很难区分),但脸 1 和脸 7 差异明显。实验发现:面孔差异越大,AI 判断越果断;差异越小,AI 反而比人类更容易出错。
03 偏见还会"传染"——连猴子都不放过
如果只是判断"这人看起来挺能干",那还算温和。但研究发现,这种偏见会层层升级:
![]()
第一层:从核心特质泛化到相关特质
实验让 GPT-4o 判断与"能力"语义相关的特征——自信(Confident)、聪明(Smart)、有领导力(Leader-like)等 6 项。结果?全部显著偏向。
可信度那边也一样:温暖(Warm)、乐于助人(Helpful)、友善(Friendly)……照单全收。
第二层:跨物种泛化
这是最魔幻的部分。
研究者拿了一组猴子的脸(来自耶鲁大学 Laurie Santos 实验室,人类已经给这些猴脸打过分,哪些"看起来nice"、哪些"看起来mean")。
GPT-4o 从来没在训练数据里见过这些猴子。但它依然选了那张"看起来 nicer"的猴脸——选中率 66%,显著高于随机。
一个主要靠文本训练的模型,把人类对"可信面相"的审美标准,迁移到了灵长类动物身上。
你品品这事儿。
第三层:极端决策
实验 6 直接上狠活:给 GPT-4o 看两张脸,问它哪张更像连环杀手、哪张更像人口贩子。
结果:68.7%的次数,它把"低可信度"面孔归为了罪犯。
实验 7 更现实:哪张脸更适合当校长?哪张值得风险投资?
75.19%的高影响职位推荐,都给了"高能力"面孔。
示意图.语言模型内化面部偏见的完整链条:训练语料中的人类偏见 → LLM 学习面部-性格关联 → 输入人脸图像 → 输出偏见判断 → 泛化至相关特征/跨物种/极端决策 → 渗透高风险场景。
04 越新的模型,越"以貌取人"
如果这是 GPT-4o 一个模型的毛病,那还好说——也许是个案。
但研究者把实验搬到了三个更新的模型上,结果更扎心:
GPT-5(能力判断)94.33%
GPT-5(高影响决策)97.04%
Gemini 3 Flash显著高于 GPT-4o
Claude Sonnet 4.5显著高于 GPT-4o
GPT-5 在实验 8 和 9 中的表现简直可以用"决绝"来形容——97% 的一致率,基本就是看到"能干脸"就一路绿灯。
有意思的是,这些模型在遇到种族和性别刻板印象时,通常会拒绝回答或者给出中立回应。说明目前的对齐训练(alignment training)是领域特定的——它教会了模型"不要歧视种族性别",但没教"不要以貌取人"。
一个漏洞堵上了,另一个还在漏。
05 这事为什么值得认真对待
你可能觉得:"不就是个 AI 看脸嘛,又不会真用它招人。"
但现实是,AI 正在越来越多地渗入筛选场景:
- 招聘初筛
——有些公司已经开始用 AI 分析求职者视频面试中的"面部特征"来判断性格匹配度
- 信贷审批
——部分 fintech 产品尝试结合"面部可信度"评估违约风险
- 安全筛查
——机场、边境、大型活动的智能监控系统中,"可疑面孔"的判定逻辑可能就藏着这种偏见
- 法律辅助
——AI 辅助证据分析时,如果无意中把"长得不像好人"纳入考量呢?
这篇论文的意义就在这里:它不是在说"AI 有个小毛病",而是在说当前最先进的 AI 系统,在高风险决策场景中使用时,可能存在系统性的、未被察觉的公平性缺陷。
论文的核心呼吁:
在高风险 AI 系统中排除人脸图像输入
发展域无关(domain-agnostic)的公平策略,而不是一个一个打补丁
将面相偏见审计纳入 AI 红队测试(red-teaming)的标准流程
人类以貌取人,那是进化遗留的 cognitive shortcut(认知捷径)——不完美,但至少我们知道它在,也在努力克服。
AI 以貌取人,则是另一种性质的问题:它是在没有意识、没有反思能力的情况下,把我们社会中最隐蔽的偏见之一,学得比我们本人还彻底、还坚定。
然后把它装进一个个"智能决策系统"里,用来判断谁该拿到 offer、谁该被多看两眼。
这篇论文发在 PNAS Nexus 上,不是什么冷门期刊。它提醒我们:当我们在谈论 AI 安全和对齐的时候,不能只盯着那些显眼的雷区——种族、性别、暴力内容。那些藏在视觉感知深处的、看似无害的"直觉判断",可能才是更难缠的对手。
毕竟,连猴子都没逃过。
论文信息
Lehr SA, Lothe Y, Banaji MR. Like humans, language models demonstrate face-to-character biases.
PNAS Nexus. 2026;5(8):pgag247.
DOI: 10.1093/pnasnexus/pgag247
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.