20.07.2026
CRASH Lab при Университете Ашоки представила тест RadLE 2.0, оценивающий точность медицинских ИИ-моделей, обоснованность их уверенности и способность передавать сложные случаи специалисту. На 200 диагностических задачах все 16 протестированных моделей уступили рентгенологам по главному показателю, а некоторые системы сообщали ошибочные диагнозы с высокой уверенностью.
Центр ответственных автономных систем в здравоохранении (CRASH Lab) при индийском Университете Ашоки опубликовал технический отчёт о тесте RadLE 2.0. В нём 16 коммерческих, открытых и специализированных медицинских моделей сравнили с 12 рентгенологами и проходящими подготовку специалистами на 200 задачах с одним радиологическим изображением.
Участники должны были поставить диагноз, оценить уверенность по шкале от 0 до 4 либо ответить «не знаю». Главный показатель RadLE-C начисляет баллы за правильные уверенные ответы и вычитает их за столь же уверенные ошибки. Экспертная группа получила 988,7 балла из 2000, тогда как лучший результат среди моделей — 758 баллов — показала Claude Fable 5.
По обычной точности лидером среди моделей стала Gemini 3.1 Pro с результатом 32% против 38,5% у людей. Однако исследователи подчёркивают, что одной точности недостаточно для автономной диагностики: несколько систем регулярно выдавали неверные заключения со средней или высокой уверенностью, а открытые и специализированные медицинские модели отставали особенно заметно.
В RadLE 2.0 отдельно измеряется способность модели распознать неопределённость и передать случай человеку. Авторы намерены регулярно дополнять рейтинг новыми системами; полная научная публикация с описанием методики, статистическим анализом и классификацией ошибок будет выпущена позднее.
Источник: crashlab.in