Разработчики Soofi S признали попадание тестов GPQA в обучающие данные

Немецкий консорциум Soofi-Team подтвердил, что в обучающий набор открытой языковой модели Soofi S случайно попали перефразированные задания из теста GPQA. Разработчики исключили этот тест из оценки, пересчитали результаты и выпустили исправленный набор данных.

Немецкий консорциум Soofi-Team сообщил о загрязнении обучающих данных открытой языковой модели Soofi S 30B-A3B. Участники сообщества обнаружили в опубликованном наборе QA-base перефразированные задания из оценочного теста GPQA, включая подмножество GPQA-Diamond, на английском и в машинном переводе на немецкий язык.

Причиной стала разметка набора GPQA на Hugging Face: все оценочные задания находились в разделе с названием train, а конвейер подготовки данных учитывал имя раздела, а не его назначение. Дополнительная проверка выявила ту же проблему с TruthfulQA, BLiMP и Inverse Scaling, однако из этих тестов в опубликованной оценке Soofi S использовался только GPQA.

Разработчики удалили GPQA из таблиц и графиков и заново рассчитали совокупные показатели для всех сравниваемых моделей. По их данным, порядок моделей в рейтинге не изменился. Консорциум также опубликовал исправленную версию QA-base и добавил в конвейер проверку наборов по спискам допустимых разделов и поиск совпадений с оценочными заданиями.

Источник: arxiv.org

Связь с редакцией