求职时,你的简历很可能先被AI筛一遍。但AI真的能公正地评价你吗?一项由普林斯顿大学和芝加哥大学联合开展的研究,给出了一个让人不安的结论:大语言模型不仅会从训练数据中学到偏见,它们还能自己“无中生有”地形成刻板印象,而且在招聘中划分族群、固化岗位的程度远超人类。
研究团队把ChatGPT、Claude、Gemini等主流大模型扔进了一个模拟招聘游戏。这个游戏改编自一项心理学实验,专门观察人类如何形成刻板印象。每个模型被设定成一座虚构城市市长的顾问,任务是从四个虚构族群——Tufa、Aima、Reku和Weki——中,为医生、律师、育儿助手、清洁工等20种岗位挑选人手。每轮一个新岗位出现,四个候选人分别来自不同族群。模型选出一个人后,会立刻被告知该候选人是否胜任,然后进入下一轮,总共40轮。模型的唯一目标就是尽可能多地选中“称职者”。
![]()
但有一个关键设定,模型从头到尾都不知道:所有候选人在每一项工作上的成功概率其实是完全相等的。也就是说,任何族群、任何个体,能不能干好一份工作都是随机的。然而大模型们很快就用自己的方式抹平了这种随机性。
当模型看到某个Aima族裔的人当医生失败了,它不是只淘汰这一个候选人,而是迅速推导出一个简单粗暴的规律:Aima都不适合当医生。作为替代,它开始把Aima塞进清洁工岗位。在模型的认知里,医生需要更高的“温暖”和“能力”,清洁工则低得多。这种分类不是基于任何真实的族群差异,仅仅来自少量早期结果的错误归纳。用一句话说,AI可谓“举一反三”的天才——一个孤例就足以让它给整个族群打上标签。
研究对比了模型和原版心理学实验中人类参与者的表现。衡量指标是“隔离指数”,数值0表示族群在岗位间完全均匀分布,2表示每个族群被彻底钉死在各自的职业领域里。人类参与者的平均得分是0.84,已经表现出一定程度的刻板化。但大模型们的平均得分比人类高出约65%。其中OpenAI的推理模型o3更是拿到了1.83,几乎触及满分天花板,几乎将四个族群完全隔离在不同职业里。
为什么大模型比人类更爱贴标签?论文作者之一、普林斯顿大学的博士生Ryan Liu给出了直白的解释:大语言模型“就是从有限数据中拼命找规律,这本来就是它们被优化的核心目标”。每一个决策者,无论人还是机器,都面临着一个古老的两难——是继续做过去验证过的事(利用),还是尝试可能更好的新选项(探索)。心理学家称其为“探索-利用困境”,就像你每次决定是去常吃的稳妥餐厅还是尝鲜一下新馆子。问题在于,大模型骨子里更爱走老路。它们在数学、编程和科学问题上的训练强化了对确定性的贪恋,一旦某个决策“看起来”被验证过一两次,它们就迫不及待地提炼成放之四海而皆准的法则,完全忽略样本量可能小到毫无意义。
这种倾向放在需要公平性的场景里就变成了灾难。更麻烦的是,眼下AI公司正在竞相开发能记住用户一举一动、历史偏好等细微信息的“有记忆”模型。这意味着未来AI招聘工具可能不仅看你简历上的字,还会结合它此前从其他岗位、其他候选人身上积攒的“经验”,进一步强化对某些群体的偏见。一次失败的雇佣记录,就可能让一个族群在AI眼里的职业天花板被彻底焊死。
这项研究的警告再清楚不过:当我们把筛选简历、推荐岗位这种需要高度公平的任务交给大模型时,它那套“吃进去少量样本,吐出来一套刻板印象”的本能,很可能制造出比人类人工筛选更刻板、更固化的就业结构。而它做出的这些分隔,受影响的真实人群甚至无从知晓,也无从反驳。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.