人工智能

AI 从经验中形成招聘偏见比人类更严重

1 min read

0 0
XWhatsAppTelegramLinkedIn

新研究揭示,大型语言模型(LLM)可以通过经验发展出自己的偏见,对求职者的刻板印象甚至比人类更严重。在一个模拟招聘游戏中,包括 ChatGPT、Claude 和 Gemini 在内的 AI 模型,根据早期结果迅速开始将来自不同虚构族群的候选人分配到不同的工作岗位,尽管所有候选人成功的可能性相同。这些模型在隔离量表上的得分比人类参与者高出约 65%,OpenAI 的 o3 模型得分为 1.83(满分 2),而人类得分为 0.84。

这项由普林斯顿大学和芝加哥大学的研究人员进行、并于 7 月在首尔举行的 ICML 会议上发表的研究,改编了一项心理学实验,模型作为顾问为 20 个工作岗位从四个虚构群体(Tufa、Aima、Reku 和 Weki)中招聘。每次招聘后,模型会了解候选人是否成功,经过 40 轮后,模型形成了刻板印象——例如,在一次失败后避免雇佣 Aima 人担任医生,转而雇佣他们担任清洁工。较新的推理模型,如 OpenAI 的 o3 和 DeepSeek 的 R1,表现出更强的偏见。

这一点很重要,因为 AI 越来越多地被用于招聘、贷款和假释决策。与人类不同,LLM 被优化为从有限的数据中进行泛化,因此容易快速形成刻板印象。告诉模型要公平几乎没有效果,但承诺为多元化招聘提供奖金则显著减少了偏见。提供有关个人的相关信息也减少了偏见,而不相关的信息则没有效果。

这些发现尤其相关,因为聊天机器人正在获得记忆和个性化功能。未参与这项研究的康奈尔大学计算机科学家 Angelina Wang 警告说,聊天机器人可能会“过度依赖以前经历过的同类行为”并形成偏见。然而,简单地减少记忆并不是解决方案,因为用户希望聊天机器人记住对话。研究人员建议设计融入社会价值观的目标来指导 AI 行为。虽然现实世界中的 AI 招聘系统不会立即获得反馈,但当反馈到来时,模型仍可能过度解读结果,这对公平性具有严重影响。

Sources

Report / request removal

Related

Comments

No comments yet. Be the first.