Проект ЦИТадель

Обзоры • курсы • практикумы

Не «что нажать», а «как устроено»
Век живи — век учись

Saturn: ИИ-модели ошиблись в 57% ответов на вопросы о личных финансах

Финтех-компания Saturn протестировала 18 популярных ИИ-систем на вопросах о налогах, пенсиях, долгах и сбережениях. По методике компании, ошибки содержали 57% ответов, а для сложных вопросов средний показатель достиг 88%; у отдельных моделей — 99%.

Британская финтех-компания Saturn, разрабатывающая ИИ-инструменты для финансовых консультантов, проверила 18 популярных моделей и сервисов, включая ChatGPT, Claude, Gemini и Copilot. В тест вошел 121 вопрос о личных финансах: пенсиях, налогах, долгах, ипотеке и сбережениях. Каждый вопрос задавали пять раз, чтобы оценить стабильность ответов.

По данным Saturn, ошибки содержали 57% ответов. На сложных вопросах средняя доля ошибок выросла до 88%, а отдельные модели отвечали неверно в 99% случаев. Среди выявленных проблем — неправильные вычисления, пропущенные предупреждения о рисках, игнорирование предстоящих изменений налоговых правил и ссылки на несуществующие нормы.

Лучший общий результат показала Claude Opus 5 в режиме рассуждений, однако и она, согласно исследованию, ошибалась в 39% ответов. Показатель 99% относится не ко всем финансовым задачам и ИИ-системам, а к отдельным моделям в наиболее сложной группе вопросов.

Источник: saturnos.com

Связь с редакцией