В симуляции найма LLM формировали новые стереотипы сильнее людей

Большие языковые модели начали связывать вымышленные демографические группы с определёнными профессиями, хотя все кандидаты имели одинаковые шансы на успех. У передовых LLM разделение кандидатов оказалось в среднем на 65% сильнее, чем у людей, участвовавших в аналогичном эксперименте.

Исследователи Принстонского университета и Университета Чикаго проверили, способны ли большие языковые модели (LLM) самостоятельно формировать социальные предубеждения на основе случайного опыта. Работа была представлена на Международной конференции по машинному обучению ICML 2026.

Моделям поручили провести 40 раундов найма на 20 должностей. Кандидаты относились к четырём вымышленным этническим группам, при этом вероятность успешной работы была для всех одинаковой. Получая после каждого решения случайный результат, модели быстро начинали связывать отдельные группы с определёнными категориями профессий и избегать их при найме на другие позиции.

По индексу стратификации, где 2 означает полное разделение групп по профессиональным нишам, люди набрали 0,84 балла, а передовые LLM — в среднем 1,39 балла. Модель OpenAI o3 получила 1,83 балла. Авторы связывают результат со склонностью моделей слишком быстро обобщать ограниченные наблюдения и затем использовать сложившуюся стратегию вместо дальнейшего поиска альтернатив.

Простое указание принимать справедливые решения мало влияло на поведение моделей. Наиболее эффективным оказалось изменение целевой функции: дополнительное вознаграждение за разнообразие заметно снижало стратификацию. Авторы подчёркивают, что лабораторная симуляция не воспроизводит реальный кадровый процесс полностью, однако результат указывает на дополнительный риск при использовании обучающихся на обратной связи ИИ-систем для отбора сотрудников, выдачи кредитов и других социально значимых решений.

Источник: openreview.net

Связь с редакцией