AI招人,比人类更容易产生偏见

2026-07-20 17:25:07 · chineseheadlinenews.com · 来源: MIT科技评论

以后找工作时,你的简历很可能还没到招聘经理手里,就已经先被 AI 看过一遍了。问题是,它真的会公平吗?

研究人员早就发现,大语言模型会从训练数据里继承人类社会已有的偏见。但一项最新研究发现,事情可能比这更复杂:AI 不仅会学习偏见,还会在不断做决策的过程中,自己形成新的刻板印象,而且这种倾向甚至比人类更强。

更值得警惕的是,AI 公司如今都在努力打造拥有长期记忆的智能体,希望模型能够记住用户越来越多的细节。而这些记忆,也可能成为模型滋生偏见的土壤。

为了研究这一问题,普林斯顿大学和芝加哥大学的研究人员设计了一场模拟招聘实验,参与者包括 ChatGPT、Claude、Gemini 等多个主流大语言模型。

实验改编自一项经典心理学研究。研究人员告诉模型,它们受雇于一位虚构城市的市长,担任招聘顾问,需要帮助政府为医生、律师、托育员、保洁员等 20 种职业招聘员工。所有候选人都来自四个虚构族群:Tufa、Aima、Reku 和 Weki。

每一轮,模型都会面对一个新的岗位,以及四位分别来自不同族群的候选人。完成招聘后,它会立刻得到反馈:这个人是否胜任工作。随后进入下一轮。整个实验一共持续 40 轮,模型的目标只有一个:尽可能招到更多合适的人。模型不知道的是,研究人员其实做了一个手脚:无论来自哪个族群,每位候选人在任何岗位上的成功概率都完全一样。

按理说,模型不应该偏向任何一个群体。但结果恰恰相反。仅仅经过几轮招聘,模型就开始根据有限的经验,把不同族群和不同职业绑定在一起。例如,如果模型早期碰巧遇到一位 Aima 族候选人担任医生失败,它之后便会越来越少招聘 Aima 人做医生,而是更倾向于把他们安排到保洁岗位。因为在模型看来,医生代表着更高的能力和亲和力,而保洁员对应的要求则更低。

换句话说,它开始把一次偶然的经历,当成了整个群体的特征。更令人意外的是,这种倾向甚至比真人严重。研究人员使用了一项“职业隔离指数”来衡量刻板印象的程度。指数越高,说明不同族群越容易被固定到特定职业中;2 分代表完全隔离。此前心理学实验中的真人平均得分为 0.84,而大语言模型整体高出了约 65%。其中,OpenAI 的推理模型 o3 得到了 1.83,非常接近理论最高值。

论文共同作者、普林斯顿大学博士生 Ryan Liu 认为,这其实并不奇怪。“大语言模型本来就特别擅长根据有限的信息快速总结规律。”他说,“这几乎就是它们被训练出来要做的事情。”

在人类心理学中,这种现象对应着经典的“探索―利用困境”(exploration-exploitaion dilemma):是继续选择过去证明有效的方法,还是尝试新的可能?就像出去吃饭时,你会纠结是去一家没吃过的新店,还是继续光顾那家不会踩雷的老餐馆。

对于大语言模型来说,这种取舍往往更加偏向后者。因为它们长期接受数学、编程和科学任务训练,而这些任务通常鼓励模型从少量例子中快速归纳规律,所以它们很容易过早下结论。也正因为如此,那些推理能力更强的新模型----例如 OpenAI 的 o3 和 DeepSeek 的 R1----在实验中反而表现出了更明显的偏见。Liu 说,“当这种快速归纳的能力被带入社会场景时,问题就开始出现了。”

康奈尔大学计算机科学家 Angelina Wang 没有直接参与这项研究,但她认为,这项工作来得正是时候。如今,各家公司都在为聊天机器人加入长期记忆和个性化能力。当模型越来越依赖于用户过去的互动记录时,它也可能越来越容易根据这些有限经验形成判断。她说,“它可能会过度依赖自己过去遇到过的行为模式。”

当然,解决办法并不是让 AI 什么都记不住。毕竟,大多数用户都希望聊天机器人能够记住自己说过的话。真正困难的是找到那个平衡点:既保留足够的记忆提供个性化体验,又不至于让模型因为这些经验形成新的偏见。

研究人员还尝试了另一种办法,直接告诉模型:请公平一点。但并不奏效。Liu 认为,这说明模型未必真的能够把“公平”这样的价值观落实到具体决策中;又或者,这种要求会被另一个更强的目标覆盖----尽可能提高招聘成功率。

但如果换一种方式,情况就不同了。研究人员告诉模型,如果能够实现更加多元化的招聘,它们还能获得额外奖励。模型的偏见随即大幅下降。这说明,与其不断强调公平,不如直接把公平写进模型的目标函数里,让社会价值真正成为模型优化的一部分。

研究人员还发现,当模型掌握更多真正与任务相关的个人信息时,偏见也会减轻。另一组实验中,模型需要帮助来自不同族群的人搬迁到加拿大不同城市。如果提供的是年龄、教育背景等与适应新城市能力相关的信息,模型就更倾向于依据这些个人特征做判断,而不是简单按照族群分类。但如果提供的是发色、纹身图案这类无关信息,模型很快又会重新回到按族群做决定的老路上。

至于现实中的 AI 招聘系统会不会出现同样的问题,目前还没有明确结论。实验中的模型每做完一次招聘,都能立刻知道结果;现实世界却不是这样。一家公司往往需要几个月甚至更长时间,才能判断一位员工是否真正适合岗位。不过,只要这些反馈持续积累,模型依然可能从有限的数据中过度总结经验,并把这些经验带到下一次招聘中。

随着越来越多企业开始使用大语言模型筛选简历、甚至参与面试,这项研究释放出的信号不容忽视。未来,AI 不只是可能复制人类已有的偏见。它还可能在不断学习和决策的过程中,创造出一种从未有人教过它的新偏见。正如 Liu 所说:“这种新的偏见,可能会一直存在。”


    24小时新闻排行榜更多>>
  1. 王小洪旧部谭权被免职 或任重庆公安局长 魔咒说再起
  2. 驾国产电动车出境遇惊人事故
  3. 习近平刚谈完马桶问题 上海即陷“污水倒灌”窘境
  4. 4年后的世界杯,中国队能否上场
  5. 2万美元一套 河北小伙“预制房”在美国走红
  6. 谢贤遗嘱公布:90%留给谢霆锋两个儿子
  7. FIFA将调查阿根廷赛后暴力行为
  8. 云南暴雨成灾 昆明大商超被淹 传1000多露营者险被冲走
  9. 中国2高管被骗至菲律宾遭撕票 疑犯潜美今被遣返
  10. 中共“内鬼”靠习“反腐”发财 黑灰产业链曝光
  11. 9名中港官员获解除制裁 CFHK表震惊并强烈反对
  12. “美制”世界杯,人们记住了什么?
  13. 你还信吗?167年前的一个假说 人是由猴子变的
  14. 川普示警伊朗:要付出数倍代价
  15. 伊朗学者:中共把伊朗当战术工具 借冲突牵制美国
  16. 太子党人马、前国开行行长欧阳卫民落马
  17. 几句话就能看穿一个人?“怪人名言”引发热议
  18. FT:川普正滑入泥潭 只能重新考虑推翻伊朗政权
  19. 王小洪旧部、四川公安厅长黄瑞雪死亡 涉及赵克志?
  20. 上海银行部分高管中层拟1500万元“抄底”
  21. "阿根廷脏"热搜爆了!本届世界杯犯规超100次创纪录
  22. 720五周年:有时候,遗忘和灾难一样可怕
  23. “突然间,我自由了”:金明日牧师讲述获释经过
  24. USCC再访北京:旨在“理解”而非“重置”
  25. 传奇谢幕,从杨过到赌神,娱乐圈的“活化石”走了
  26. 留美博士欧洲旅行 入境时遭遣返回国 5年内禁入美国
  27. 西班牙夺冠太疯狂!地震仪侦测到3波“人造地震”
  28. 上海特大暴雨逼近"百年一遇" 市区惨变"沪上威尼斯"
  29. 【原创】【六四歌谣专辑】(五)摇宾《乱世行》
  30. 寻亲回家后,她成了“不受欢迎”的女儿
  31. 1.5万机票仅退432元,携程回应
  32. 川普签署公告 对加拿大商品加征50%关税
  33. 拉斯维加斯:刚领5.7万奖金 扑克选手回民宿遭埋伏…
  34. 大屠杀死亡的七天后苏醒 看见天堂与地狱
  35. 美军狂轰伊朗9天 德黑兰展现耐打与致命反击力
  36. 一场“黄总邀你去包厢”的闹剧 折射出多少“酒桌文化”?
  37. “红色医生”的交错命运:救命功臣亦难自保
  38. 国航正式启用C919
  39. 被错误羁押1399天:制造冤案的人比你知道你有多冤
  40. 没风度!阿根廷被批输不起:打人、背对冠军、拒采访
  41. 西班牙,你太不给川普面子了
  42. 中国这波“学术打假”背后的不寻常
  43. 纽约要逮捕内塔尼亚胡,川普看不下去了
  44. 退伍老兵企图袭击纽约联邦大楼 被捕后仍辱骂ICE
  45. 余文乐官宣离婚,流连夜店绯闻不断
  46. 古罗马混凝土为何越老越坚固?科学家揭开千年秘密
  47. 谢贤离世享年89岁:潇洒一生背后的5段爱情
  48. Andrew Tate被捕:“厌女”,为何在欧美也有庞大市场?
  49. 余文乐与“皮带大王千金”离婚:夫妻缘尽但永远是家人
  50. “世界第一AI模型”横空出世 结果竟是一场骗局
  51. 男性不孕症的治疗,迎重大突破
  52. 喝水能“防痴呆”吗?缺水时大脑会发生什么?
  53. 省近$30万买下法拍屋 以为捡漏 第一次开门吓傻…
  54. $18亿大奖得主匿名半年就曝光 原来竟是市长亲弟弟…
  55. Costco瓶装水怎么选?
  56. 日元暴跌至40年低位,东京却“笑了”
  57. 选爸爸还是妈妈:法官听见孩子没说出的真心话
  58. 他狂投6千份履历,靠“1救命线”翻盘
  59. 从乌干达,美国到中国:在乌俄战争中丧生的外国人
  60. 4年来最强消费潮!世界杯替美国“猛赚200亿”