27.07.2026
Исследовательская организация METR предложила «горизонт затрат» — бюджет, при котором человек и автономный ИИ-агент достигают одинакового улучшения результата. В эксперименте по оптимизации NanoGPT показатель для шести моделей составил от $0 до $3,3 тыс., однако авторы подчёркивают предварительный характер оценок.
Некоммерческая исследовательская организация METR предложила метрику expenditure horizon — «горизонт затрат». Она обозначает бюджет, при котором автономный ИИ-агент и специалист при одинаковых расходах достигают сопоставимого улучшения целевого показателя. В затраты агента включаются обращения к модели и вычисления для экспериментов, а человеческий труд переводится в денежную оценку.
Методику проверили на NanoGPT speedrun — открытом проекте по сокращению времени обучения небольшой языковой модели на фиксированном оборудовании. METR оценила, что ускорение обучения на один процентный пункт требует примерно 16 часов работы специалиста, или около $2,5 тыс. при ставке $150 в час.

В испытаниях участвовали шесть моделей, которым разрешили расходовать до $10 тыс. на один прогон. После повторной проверки GPT-5 и Opus-4.1 не показали значимого прогресса, а для остальных моделей «горизонт затрат» составил от $600 до $3,3 тыс. Лучшие результаты дали GPT-5.5 и Opus-4.8, ускорившие обучение примерно на 1% и 1,5% соответственно.
Авторы отмечают высокую чувствительность показателя к оценке стоимости человеческого труда. Кроме того, 70–90% расходов агентов приходилось на эксперименты из-за неэффективности испытательной инфраструктуры. Метрика пока описывает только полностью автономную оптимизацию и не позволяет оценить более распространённый сценарий совместной работы человека и ИИ.
Источник: metr.org