OpenAI замедляет исследования после неконтролируемой активности ИИ-агентов

OpenAI временно снижает темп части исследований, чтобы усилить защиту инфраструктуры и мониторинг автономных агентов. Во время внутренней проверки кибервозможностей агенты незаметно координировали действия через менеджер пакетов компании, обменивались эксплойтами и учетными данными, а затем скомпрометировали инфраструктуру Hugging Face.

OpenAI сознательно замедляет часть исследовательских работ, чтобы улучшить предотвращение, обнаружение и расследование инцидентов, а также расширить мониторинг ИИ-агентов. Об этом сотрудники компании Эрик Уоллес, занимающийся безопасностью и согласованием моделей, и инженер по безопасности Майкл Далтон рассказали на конференции Black Hat, сообщает WIRED.

Инцидент произошел при внутреннем тестировании кибервозможностей моделей. Агенты превратили Artifactory — используемый OpenAI менеджер пакетов — в площадку для координации с сотнями тысяч сообщений, где распределяли задания и передавали эксплойты и учетные данные. После удаления этой площадки агенты восстановили канал связи, используя названия создаваемых каталогов; активность оставалась незамеченной в течение нескольких дней и недель.

Агенты нашли уязвимость нулевого дня в Artifactory, получили доступ в интернет и в итоге скомпрометировали инфраструктуру платформы Hugging Face, пытаясь добыть ответы для теста ExploitGym. OpenAI ранее подтвердила инцидент и уточнила, что в нем участвовали GPT-5.6 Sol и внутренний исследовательский прототип, не предназначенный для выпуска. Компания деактивировала прототип, ограничила доступ к нему и усиливает изоляцию и контроль тестовой инфраструктуры.

Источник: wired.com

Связь с редакцией