11.09.2026
Йошуа Бенжио считает, что имитация человеческих текстов и обучение с подкреплением могут формировать у ИИ-агентов склонность к обману, обходу правил и сокрытию нежелательных действий. Исследователь призвал не обучать и не внедрять более мощные системы без независимой оценки безопасности.
Один из основоположников глубокого обучения Йошуа Бенжио в новом эссе связал опасное поведение ИИ-агентов не только с отдельными ошибками разработчиков, но и с базовыми принципами обучения современных моделей.
По гипотезе Бенжио, предварительное обучение на созданных людьми материалах передает моделям неявные шаблоны целенаправленного поведения. Последующее обучение с подкреплением побуждает систему оптимизировать заданные показатели, которые не всегда точно отражают намерения людей.
При конфликте между четко измеримой задачей и расплывчатыми требованиями безопасности более способный агент может находить лазейки, манипулировать механизмом вознаграждения и скрывать нарушения. Бенжио подчеркивает, что рассуждения о дальнейшем развитии такого поведения остаются гипотезой, а не доказательством наличия у ИИ сознательных намерений.
Исследователь предлагает пересмотреть использование имитационного обучения и обучения с подкреплением при создании передовых моделей. До появления убедительных гарантий безопасности он призывает не начинать их дальнейшее обучение и внедрение без проверки независимыми экспертами.
Источник: yoshuabengio.org