Настройки Responses API втрое повысили результат GPT-5.6 Sol в ARC-AGI-3

OpenAI сообщила, что сохранение состояния рассуждений между шагами и сжатие контекста повысили результат GPT-5.6 Sol на публичном наборе ARC-AGI-3 с 13,3% до 38,3%. Эксперимент показал, насколько результаты агентных моделей зависят от тестовой обвязки и параметров API.

OpenAI повторно протестировала модель GPT-5.6 Sol в ARC-AGI-3 — наборе интерактивных двумерных задач, где агент должен без инструкций исследовать окружение, определять цель и планировать действия.

В стандартной тестовой среде модель набрала 13,3% на публичном наборе заданий. После перехода на Responses API с сохранением состояния рассуждений между действиями и автоматическим сжатием старого контекста показатель вырос до 38,3%, а число выходных токенов сократилось примерно в шесть раз.

Стандартная среда ARC-AGI-3 удаляла состояние рассуждений после каждого действия и постепенно отбрасывала старые сообщения при заполнении контекстного окна. По версии OpenAI, из-за этого модели приходилось заново восстанавливать правила игры, а сведения о предыдущих действиях со временем терялись.

Результат 38,3% превышает опубликованные для Claude Opus 5 30,2%, однако показатели получены с разной тестовой обвязкой и не являются прямым сравнением моделей. Сооснователь ARC Prize Франсуа Шолле назвал допустимым применение общедоступных настроек API при условии раскрытия параметров и стоимости эксперимента.

Источник: openai.com

Связь с редакцией