AIは人間よりも経験から採用バイアスを形成する
新たな研究により、大規模言語モデル(LLM)は経験を通じて独自のバイアスを発達させ、人間よりも応募者をステレオタイプ化することが明らかになった。模擬採用ゲームでは、ChatGPT、Claude、GeminiなどのAIモデルは、すべての候補者が成功する可能性が同等であるにもかかわらず、初期の結果に基づいて、異なる架空の民族グループの候補者を異なる職種に迅速に分離し始めた。モデルは分離尺度で人間の参加者よりも約65%高いスコアを示し、OpenAIのo3モデルは最大2点中1.83点を記録したのに対し、人間は0.84点だった。
プリンストン大学とシカゴ大学の研究者が実施し、7月にソウルで開催されたICMLで発表されたこの研究は、心理学実験を応用したもので、モデルがコンサルタントとして、Tufa、Aima、Reku、Wekiという4つの架空のグループから20の職種に採用を行うという設定だった。各採用後、モデルは候補者が成功したかどうかを学習し、40ラウンドを経てモデルはステレオタイプを形成した。例えば、Aimaを医師として採用することを避け、代わりに用務員として採用するようになった。OpenAIのo3やDeepSeekのR1のような新しい推論モデルは、さらに強いバイアスを示した。
これは、AIが採用、融資、仮釈放の判断にますます使用されているため重要である。人間とは異なり、LLMは限られたデータから一般化するように最適化されており、ステレオタイプを迅速に形成しやすい。モデルに公平であるように指示しても効果はほとんどなかったが、多様な採用に対してボーナスを約束するとバイアスが大幅に減少した。個人に関する関連情報を提供することもバイアスを減少させたが、無関係な情報は効果がなかった。
この発見は、チャットボットが記憶とパーソナライズ機能を獲得するにつれて特に重要である。この研究に関与していないコーネル大学のコンピューター科学者、Angelina Wang氏は、チャットボットが「これまでに経験したのと同じ種類の行動に過度に依存する」可能性があり、バイアスを形成する可能性があると警告している。しかし、単に記憶を減らすことは解決策ではなく、ユーザーはチャットボットに会話を記憶してほしいと考えている。研究者は、AIの行動を導くために社会的価値を組み込んだ目標を設計することを提案している。現実世界のAI採用システムは即座のフィードバックを得るわけではないが、フィードバックが届いた場合、モデルは結果を過剰に解釈する可能性があり、公平性に深刻な影響を及ぼす。
Comments
No comments yet. Be the first.