Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

Исследователи Google предложили защитить самооптимизирующихся ИИ-агентов от переобучения

Метод RRSI ограничивает процесс автоматической доработки программной обвязки ИИ-агента, чтобы тот не запоминал задания из обучающего набора. На незнакомых тестах прирост достиг 4,7 пункта, а расход токенов оказался примерно на 30% ниже, чем у варианта без регуляризации.

Исследователи Google Cloud AI Research и нескольких американских университетов представили RRSI — метод регуляризованного рекурсивного улучшения программной обвязки ИИ-агентов. Под обвязкой авторы понимают окружающие языковую модель инструкции, инструменты, память, управление контекстом и логику выполнения задач.

При обычной автоматической оптимизации агент многократно изменяет свою обвязку на основе результатов одних и тех же заданий. Это повышает показатели на знакомом наборе, но может привести к запоминанию его особенностей и ухудшить перенос изменений на новые задачи.

RRSI постепенно сокращает допустимое число правок в одном цикле, учитывает историю предыдущих экспериментов и проверяет предложения на наличие логики, привязанной к конкретным тестам. Дополнительные правила отбрасывают изменения, чей эффект укладывается в статистический шум, неоправданно увеличивает расход токенов или перестал приносить пользу.

Метод проверили на восьми тестах для программирования, офисных ИИ-агентов и инженерного проектирования. На пяти наборах, не использовавшихся при оптимизации, улучшение достигло 4,7 пункта; по сравнению с нерегуляризованным вариантом агент расходовал примерно на 30% меньше токенов. Исследование ограничено агентами с неизменными весами базовой модели и не рассматривает самообучение самой нейросети. Исходный код RRSI опубликован под лицензией Apache 2.0.

Источник: arxiv.org

Связь с редакцией