Имитация авторского стиля снижает точность детекторов ИИ-текста

Эксперимент Epoch AI показал, что детекторы Pangram, GPTZero и Originality.ai значительно чаще пропускают сгенерированные тексты, если языковая модель имитирует стиль конкретного автора. Особенно ненадёжными оказались результаты для научных материалов: доля пропусков достигала 29% в среднем по отдельным детекторам и 48% в одном из сценариев.

Исследовательская организация Epoch AI проверила детекторы ИИ-текста Pangram, GPTZero и Originality.ai. На текстах, созданных по обычным коротким запросам, доля ложноотрицательных результатов не превышала 0,7%.

Затем моделям Claude Opus 4.8, GPT-5.5 и Gemini 3.1 Pro предоставляли по пять фрагментов произведений конкретного автора и просили написать новый текст в том же стиле. Среди 297 полученных материалов Pangram пропустил 10%, GPTZero — 11%, а Originality.ai — 18%.

Научные тексты оказались наиболее сложными для распознавания: детекторы не выявили от 24% до 29% таких материалов. В худшем отдельном сценарии Pangram пропустил 48% научных текстов, созданных Gemini с имитацией авторского стиля.

Для проверки ложных срабатываний исследователи также использовали 495 человеческих текстов 99 авторов, опубликованных до появления ChatGPT. Pangram и GPTZero не допустили ошибок на этой выборке, а Originality.ai ошибочно классифицировал как машинные 19 фрагментов, или 3,8%. Авторы отмечают, что эксперимент охватывал только один способ обхода детекторов, тексты длиной около 500 слов и версии сервисов, доступные в июне 2026 года.

Источник: epoch.ai

Связь с редакцией