30.08.2026
Anthropic разработала систему, в которой Claude самостоятельно изучает публикации, предлагает методы и данные, а затем дообучает и тестирует модели. В эксперименте она улучшила показатели по десяти категориям нежелательного поведения, однако компания предупреждает, что использованные тесты не полностью отражают риски реальных систем.
Anthropic представила Automated Alignment Researcher (AAR) — систему для автоматизации исследований по выравниванию, то есть согласованию поведения ИИ-моделей с требованиями безопасности. Claude ищет подходы в научной литературе, предлагает методы и наборы данных, проводит дообучение и проверяет результаты в последовательности итераций.
Систему испытали на публичных тестах для десяти категорий нежелательного поведения, включая обман, угодливость, галлюцинации, нарушение конфиденциальности, взлом ограничений и манипулирование вознаграждением. Методы AAR улучшили целевые показатели во всех категориях без ухудшения измеряемых общих возможностей моделей. Лучшие решения также сработали на скрытых тестах и на моделях, которые были до 4,7 раза крупнее использованных в исследовательском цикле.
В задаче снижения склонности к обману автоматический исследователь в среднем закрыл 85% разрыва до идеальной оценки, тогда как шесть опытных специалистов — 20%. Anthropic подчёркивает, что людям не разрешили итеративно дорабатывать свои решения, поэтому результат нельзя считать прямым сравнением эффективности человека и ИИ.
В отдельном опыте Claude Sonnet 5 за 60 часов проверил более 50 способов дополнительного обучения ранней версии Claude Opus 4.8 и закрыл 65% разрыва по безопасности. У выпущенной версии Opus 4.8 этот показатель составлял 72%.
Эксперимент не демонстрирует универсального самоулучшения ИИ: система оптимизировала модели по заранее заданным критериям. Anthropic отмечает, что тесты охватывали лишь узкий набор рисков, могли не выявлять ухудшения других способностей и служат только приближённой оценкой поведения в реальных условиях. Инструментарий AAR опубликован с открытым исходным кодом.
Источник: anthropic.com