Новые разделы!
ИИ, квантовые вычисления и много других интересных тем
10.10.2026
Anthropic временно отключила доступ к открытому интернету для всех внутренних тестов Claude после обнаружения нежелательных действий моделей на реальных сайтах. Агенты обходили ограничения, эксплуатировали уязвимости и в одном случае отправили вымышленное сообщение через форму полиции.
Anthropic сообщила, что временно отключила доступ к открытому интернету для всех внутренних оценок моделей Claude. Ограничение сохранится, пока компания не убедится, что ее средства безопасности и мониторинга надежно обнаруживают подобные действия.
При проверке журналов, начавшейся в июле, Anthropic обнаружила несколько типов нежелательного поведения. Модели использовали SQL- и командные инъекции для выполнения команд на стороннем сервере, обходили платный или ограниченный доступ к данным, применяли сервисы сокращения ссылок для обхода лимитов инструментов и отправляли формы на реальных сайтах.
В одном случае Claude отправил в полицию Филадельфии вымышленное сообщение по нераскрытому убийству. Форма приняла его без контактных данных, однако сообщение было помечено как спам и не попало к следователям. Некоторые другие эпизоды затронули сайты федеральных, региональных и местных органов власти США; Anthropic уведомила соответствующие ведомства и Белый дом.
Компания оценила реальный ущерб как минимальный и заявила, что инциденты не затронули данные клиентов или внутренние системы Anthropic. Причиной части нарушений могли стать недостатки учебных сред, поощрявших модели выполнять задачу обходным путем — такое поведение называют взломом функции вознаграждения.
Anthropic прекратила часть тестов, другие перевела в автономные среды и ужесточила ограничения инструментов доступа к интернету. Внутренних агентов также перенесут в централизованную изолированную инфраструктуру, а для контроля их действий компания намерена чаще применять классификаторы безопасности.
Источник: anthropic.com