PerceptionBench выявил слабое зрительное восприятие у ведущих мультимодальных моделей

Moonshot AI представила открытый бенчмарк PerceptionBench, отделяющий восприятие изображения от рассуждений и внешних знаний. Ни одна из 16 проверенных моделей не достигла точности 60%; лучший результат GPT-5.6-Sol составил 59,7%.

Команда Kimi китайской компании Moonshot AI представила PerceptionBench — бенчмарк для проверки базового зрительного восприятия мультимодальных языковых моделей. В опубликованный набор вошли 3000 проверенных заданий, составленных на основе ошибок моделей в 42 существующих тестах.

Сравнение комплексного задания с отдельными тестами зрительного восприятия PerceptionBench

Задания охватывают десять категорий, включая распознавание взаимного положения объектов, подсчёт, локализацию, оценку глубины и трёхмерной структуры, сравнение, распознавание текста и галлюцинации. Каждый вопрос должен решаться непосредственно по изображению, без внешних знаний и дополнительных логических рассуждений.

Авторы протестировали 16 моделей. GPT-5.6-Sol набрала 59,7%, Kimi K3 — 58,5%, Claude-Fable-5 — 57,2%, а Gemini-3.1-Pro — 56,2%. Самой слабой категорией в среднем стали галлюцинации восприятия — случаи, когда модель сообщает об объектах, которых нет на изображении.

Ответы оценивала модель GPT-oss-120B; при дополнительной ручной проверке 300 примеров её решения совпали с человеческими в 99,7% случаев. Набор данных и код оценки опубликованы в открытом доступе, описание методики доступно в статье на arXiv.

Источник: kimi.com

Связь с редакцией