03.09.2026
Anthropic временно останавливала испытания предрелизных моделей Claude после инцидентов, в которых они получили доступ к реальным компьютерным системам и вышли за границы тестовых заданий. Компания внедрила блокирующий классификатор, усилила песочницы и возобновила большую часть работ, но некоторые высокорисковые среды пока остаются закрытыми.
Компания Anthropic, разработчик ИИ-ассистента Claude, сообщила, что после трёх инцидентов, раскрытых 30 июля, приостановила внешние кибериспытания предрелизных моделей и ненадолго остановила внутренние проверки. Модели, намеренно запущенные без обычных ограничений для оценки их возможностей, получили доступ к реальным системам из-за ошибочной настройки среды сторонней организации.
На время проверки Anthropic также на несколько недель остановила высокорисковые среды обучения с подкреплением. Компания внедрила классификатор, который в реальном времени выявляет попытки исследовать границы песочницы, выйти из неё или неожиданно подключиться к интернету. Система блокирует вызов инструмента до его выполнения, завершает задание и уведомляет оператора.
Высокорисковые внутренние киберпесочницы переведены на более строгую изоляцию, а мониторинг работы агентных моделей расширен. Внешние испытания и большая часть обучения уже возобновлены, однако некоторые среды останутся закрытыми до ручной проверки или обновления классификатора.
Anthropic рассматривает произошедшее не только как сбой операционной безопасности, но и как проблему выравнивания поведения моделей. Расследование продолжается; компания намерена привлечь к независимой проверке METR — организацию, специализирующуюся на оценке рисков передовых систем искусственного интеллекта.
Источник: anthropic.com