Artificial Analysis запустила Optima для тестирования ИИ-моделей на собственных данных

Платформа позволяет создавать специализированные бенчмарки на основе рабочих данных и сценариев пользователя. Модели сравниваются по качеству результатов, стоимости и времени выполнения одной задачи.

Сервис независимого тестирования ИИ-моделей Artificial Analysis представил платформу Optima для создания пользовательских бенчмарков. Она предназначена для выбора моделей под конкретные рабочие процессы, которые плохо отражаются в универсальных тестах.

В Optima можно загрузить готовый набор данных, импортировать трассировки ИИ-агентов из Arize, Braintrust или Langfuse, предоставить контекст из среды разработки либо описать задачу и добавить примеры входных и выходных данных. Система помогает сформировать тестовые задания и критерии оценки.

Ответы моделей оцениваются по заданным рубрикам или методом попарного сравнения. Вместе с качеством платформа учитывает стоимость и время выполнения задачи — эти показатели могут быть информативнее цены отдельных токенов при тестировании агентных приложений и многоэтапных процессов.

Источник: artificialanalysis.ai

Связь с редакцией