ИИ-агенты справились с экспериментами, но не смогли провести полноценное исследование

Исследователи проверили ИИ-агентов на открытых научных задачах из двух неопубликованных работ для конференции NeurIPS 2026. Агенты самостоятельно выполнили инженерную часть, однако подготовленные ими статьи не содержали существенного научного вклада и были отклонены экспертами.

Международная группа исследователей под руководством специалистов Принстонского университета проверила способность ИИ-агентов самостоятельно вести открытые исследования, для которых нет заранее известного правильного ответа. Авторы назвали метод shadow evaluation: агент получает главный вопрос из качественной, но ещё не опубликованной научной работы, а результат оценивают её авторы.

В эксперименте использовались задачи из двух материалов, поданных на конференцию по машинному обучению NeurIPS 2026. Агентам дали по шесть дней и вычислительные ресурсы стоимостью в несколько тысяч долларов. Они смогли изучить литературу, написать код, провести эксперименты и оформить результаты без помощи людей, но обе подготовленные статьи были однозначно отклонены экспертами.

Исследователи выделили пять повторяющихся проблем: неверную оценку требований к публикации, недостаток творческого подхода при исправлении дизайна исследования, неспособность отказаться от тупикового направления, неэффективное использование ресурсов и отклонение от инструкций. Авторы подчёркивают, что выводы основаны только на двух задачах и не доказывают принципиальную невозможность автоматизации исследований, однако ставят под сомнение прогнозы о скором рекурсивном самосовершенствовании ИИ.

Источник: arxiv.org

Связь с редакцией