30.08.2026
Исследователи Google Research и Virginia Tech представили WikiSkill — систему, которая накапливает сведения об удачных и неудачных действиях ИИ-агента и превращает их в обновляемые рабочие инструкции. На пяти наборах тестов метод превзошёл другие подходы к автоматическому развитию навыков, а небольшие модели с WikiSkill в отдельных сравнениях обошли более крупные модели без таких модулей.
Исследователи Google Research и Virginia Tech представили WikiSkill — систему накопления и повторного использования опыта ИИ-агентов. Она не изменяет параметры языковой модели, а сохраняет обнаруженные закономерности во внешней базе знаний и на их основе формирует «навыки» — переиспользуемые модули с инструкциями, сценариями и другими ресурсами.

Рабочее пространство WikiSkill разделено на три слоя: неизменяемые журналы выполнения задач, постоянно пополняемую wiki-базу с описаниями ошибок и успешных стратегий, а также активные навыки агента. После очередной серии заданий отдельные компоненты системы анализируют результаты и предлагают изменения инструкций. Обновление сохраняется только после проверки на валидационном наборе, однако сведения о неудачной попытке остаются в базе, чтобы система не повторяла её в дальнейшем.
Авторы испытали подход на пяти наборах задач, включавших математические рассуждения, поиск в интернете, работу с электронными таблицами, ответы по длинным документам и взаимодействие с виртуальной средой. В экспериментах участвовали модели семейств Qwen, Gemma и Gemini. Средний результат Gemini 3.5 Flash вырос с 49,5 до 68,1 пункта, а Qwen-3.6-27B — с 39,4 до 63,3 пункта.
Модель Qwen-3.5-9B с WikiSkill набрала в среднем 47,4 пункта и опередила более крупную Qwen-3.6-27B без навыков, получившую 39,4 пункта. Исследователи также обнаружили, что навыки можно переносить между моделями и семействами моделей; в некоторых тестах перенесённые инструкции работали лучше самостоятельно созданных. Работа опубликована 27 августа 2026 года в виде препринта.
Источник: arxiv.org