DOI: 10.15514/ISPRAS-2026-38(1)-16
А.Е. Гущин, ORCID: 0000-0002-4055-7394 <alexander.gushchin@graphics.cs.msu.ru>
А.В. Анциферова, ORCID: 0000-0002-1272-5135 <Aantsiferova@graphics.cs.msu.ru>
Д.С. Ватолин, ORCID: 0000-0002-8893-9340 <dm.vatolin@ispras.ru>
Институт перспективных исследований проблем
искусственного интеллекта и интеллектуальных систем МГУ имени М.В. Ломоносова,
Россия, 119192, г. Москва, Ломоносовский проспект, 27, кор. 1.
Институт системного программирования им. В.П. Иванникова РАН,
Россия, 109004, г. Москва, ул. А. Солженицына, д. 25.
Московский государственный университет имени М.В. Ломоносова,
Россия, 119991, Москва, Ленинские горы, д. 1.
Аннотация. Оценка качества изображения с эталоном (FR-IQA) имеет важное значение для сжатия, восстановления и генеративного моделирования изображений, однако существующие нейронные метрики по-прежнему работают медленно и очень уязвимы для враждебных возмущений. Мы представляем Anchored Adversarial Training (AnAT) – теоретически обоснованную стратегию защиты, которая использует чистые «якорные» образцы и ранжирование для явного ограничения точечной ошибки прогнозирования при атаках. AnAT может быть легко интегрирован в существующие архитектуры FR-IQA для повышения их надежности без значительного ухудшения производительности на чистых данных. Обширные эксперименты на пяти общедоступных тестовых наборах FR-IQA демонстрируют, что AnAT значительно улучшает устойчивость к невиданным атакам типа «белый ящик», повышая SROCC с 0,30–0,57 до 0,60–0,84 на KADID-10k, при этом сохраняя или превосходя точность незащищенных базовых моделей. Насколько нам известно, это первая техника состязательного обучения, разработанная для моделей FR-IQA.
Ключевые слова: состязательное дообучение; оценка качества изображений; машинное обучение.
Для цитирования: Гущин А.Е., Анциферова А.В., Ватолин Д.С. AnAT: состязательное дообучение с использованием якорей для метрик оценки качества изображений. Труды ИСП РАН, том 38, вып. 1, 2026 г., стр. 241–254. DOI: 10.15514/ISPRAS-2026-38(1)-16.
Благодарности: Работа выполнялась с использованием суперкомпьютера «МГУ-270» МГУ имени М.В. Ломоносова.
Оценка качества изображений (Image Quality Assessment, IQA) – фундаментальная задача компьютерного зрения с применениями в восстановлении изображений, сжатии и генеративном моделировании. Полно-референсная (Full-Reference, FR) IQA оценивает воспринимаемое качество, сравнивая искажённое изображение с его безупречным эталоном. Классические подходы, такие как оценка пикового отношения сигнал-шум (Peak Signal-to-Noise Ratio, PSNR) и индекс структурного сходства (Structural Similarity Index, SSIM), быстры, но упускают многие сложные детали человеческого восприятия, что поддерживает интерес к методам на основе глубокого обучения.
Тем не менее даже сильные нейросетевые модели IQA сталкиваются с двумя насущными проблемами: (i) невысокой скоростью вывода, ограничивающей применение в реальном времени, и (ii) высокой уязвимостью к состязательным возмущениям, подрывающей надёжность в критически важных сценариях.
Состязательные атаки вносят малозаметные возмущения, которые вводят в заблуждение нейросетевые модели IQA. Несмотря на внедрение относительно новых методов защиты для FR-IQA, системы оценки устойчивости показывают, что многие метрики остаются уязвимыми [1], что делает их непригодными для таких областей, как медицинская визуализация, автономное вождение и аутентификация контента, где оценки должны оставаться надёжными как при состязательных, так и при обычных возмущениях. Кроме того, эти уязвимости позволяют манипулировать результатами поиска изображений, поскольку поисковые системы (например, Bing) опираются на метрики IQA для ранжирования [2]. Подобные атаки также могут искажать результаты публичных оценок [3, 4], эксплуатируя слабости моделей IQA и искусственно повышая кажущееся качество алгоритмов. Например, использование уязвимой метрики IQA в качестве функции потерь в задачах восстановления изображений может ухудшать реальное качество [5] или вызывать визуальные артефакты [6]. Эти риски подчёркивают насущную необходимость подходов FR-IQA, сочетающих точность и устойчивость к атакам.
В этой работе мы предлагаем Anchored Adversarial Training (AnAT) – теоретически обоснованный метод защиты для моделей FR-IQA. AnAT дообучает базовую модель IQA так, чтобы сохранялся порядок предсказаний под атакой относительно чистых «якорных» образцов. Наш теоретический анализ связывает целевую функцию якорной оптимизации с верхней оценкой максимальной точечной ошибки предсказания.
Обширные эксперименты на стандартных бенчмарках IQA показывают, что AnAT повышает устойчивость к разнообразным, ранее не встречавшимся атакам белого ящика, при сохранении сильной точности на чистых данных. Основные результаты авторы сводятся к следующему:
Оценка качества изображений важна для множества приложений, включая сжатие, суперразрешение и другие методы обработки. FR-IQA оценивает качество, связанное с восприятием, сравнивая искажённое изображение с его безупречным эталоном. Хотя оценка PSNR вычисляется быстро, ее корреляция со зрительной системой человека (HVS) невысока. Метрики SSIM [7], MS-SSIM [8], FSIM [9], SR-SIM [10] и VIF [11] учитывают структуру, фазу, салиентность или видимость для лучшего соответствия восприятию при низких затратах. Эти методы опираются на эвристики и аналитические признаки, обеспечивая вычислительную эффективность.
Глубокое обучение далее улучшило качество предсказаний с помощью моделей LPIPS [12] и DISTS [13]. Трансформерные подходы продолжают эту линию: SwinIQA [14], IQT [15], AHIQ [16] и современная SOTA-модель TOPIQ [17], использующая многомасштабную схему сверху-вниз с механизмом Cross-Self Attention [41]. Ряд современных работ исследуют многомасштабное внимание и межмасштабный обмен: одни полагаются на тяжёлые трансформерные конвейеры, другие – на более лёгкие архитектуры; применяются как передачи сверху-вниз, так и снизу-вверх, а также их комбинации. Помимо многомасштабного внимания, изучаются методы обучения ранжированию качества: система RankIQA [18] обучает сиамскую сеть для NR-IQA. Насколько нам известно, сочетание ранжирования с состязательным обучением именно для модели FR-IQA остаётся малоизученным направлением.
В FR-IQA атака добавляет малозаметное возмущение, вводя метрику в заблуждение. Различают атаки белого ящика (известны градиенты и параметры) и чёрного ящика (доступны только выходные оценки) [18]. Специальные для моделей IQA сценарии атак предложены в [20-24].
Подходы к защите делятся на сертифицируемые и эмпирические. Первые обеспечивают формальные гарантии, но чаще всего слишком медленны для работы в реальном времени. Эмпирические стратегии практичнее и обычно опираются на состязательное обучение или «очистку» входа. Для NR-IQA изучались, в частности, входные «очистки» (E-LPIPS [24]), состязательное дообучение (метрика R-LPIPS [25]; метод AT [26]) и модификации архитектур (Grad.Norm [27]). В отличие от предыдущих вариантов АТ, мы рассматриваем якорную ранговую формулировку состязательного обучения, направленную на ужесточение верхней оценки точечной ошибки предсказания и повышение устойчивости при атаках.
Мы предлагаем стратегию состязательного дообучения AnAT, которая задействует состязательные примеры, не вводя прямого штрафа по меткам качества. Подход опирается на предположение, что состязательные возмущения либо незаметны, либо едва заметны, что является наиболее распространённым сценарием в реальных атаках. Ключевая идея – использовать наличие чистых примеров (изображений с надёжно предсказанным качеством) как «якорей» для обучения.
Постановка задачи.
Системы обработки изображений всё чаще работают в недоверенной среде, где малозаметные возмущения способны манипулировать оценками качества.
Мы формализуем атакующего, добавляющего ограниченный по норме шум () () к искажённому изображению из пары ().
Если большие значения соответствуют лучшему качеству, атакующий стремится максимизировать ; если меньшие значения означают более высокое качество, противник стремится его уменьшить. Тот же подход может решать и противоположную задачу, как показано в [28]. Эта постановка не ограничивает общность результатов, поскольку принципы применимы симметрично.
Формально состязательная атака определяется как
Для данной модели , обучающего набора D с парами изображений и ассоциированной меткой качества y, а также функции потерь , базовое состязательное обучение формулируется как задача min–max [26]:
Внутренняя максимизация генерирует сильные состязательные примеры , а внешняя минимизация подстраивает параметры модели для повышения устойчивости.
В задачах классификации истинная метка не меняется под воздействием атаки. В оценке качества, однако, сами значения могут слегка изменяться вместе с содержанием, поэтому прямое применение приводит к сдвигу меток. Ранее это обходили, вводя штраф по меткам или их рескейлинг1 [26], что порождает две практические проблемы:
Чтобы использовать надёжные «якоря» (чистые изображения без атаки), определим якорную ранговую функцию потерь:
где – покомпонентная ранговая матрица с элементами , N – размер мини-батча2, |S| – число якорей.
Интуитивно функция штрафует любые отклонения в предсказанном порядке относительно истинного, выделяя сравнения с чистыми образцами. Использование надёжных якорей из подмножества S позволяет эффективнее контролировать предсказания на состязательных примерах. В указанной формулировке получаем следующий результат:
Обозначения.
Пусть – истинные оценки MOS, а – предсказания модели на текущем мини-батче.
Пусть – множество индексов якорей, то есть чистых образцов в мини-батче. Остальные образцы атакованы.
Допущения.
Существуют константы такие, что:
Тогда .
Обозначим также
Теорема 1 (Граница точечной ошибки через якорную ранговую потерю).
Если , то .
Доказательство:
так что . Случай , симметричен; далее предполагаем .
Теорема 1 требует лишь (i) верхней границы на расстояние между якорями – чего тривиально добиться, отсортировав мини-батч и выбрав равномерно разнесённые примеры; и (ii) допуска по точности якорей (), который автоматически выполняется для хорошо обученной модели на чистых изображениях. Не требуются ни статистики конкретного набора данных, ни рескейлинг MOS, ни сертифицированные гарантии, так что условия выполняются для любого практического FR-IQA набора данных.
Рассмотрим набор данных с оценками MOS в интервале [0,100], почти совершенную модель IQA () и размер мини-батча N=16. Пусть при формировании каждого батча расстояние между соседними якорями не превышает , а минимальный шаг по MOS равен ; тогда . Если якорная ранговая потеря равна , то по условию Теоремы 1 получаем .
На рис. 1 (a) показана динамика якорной ранговой функции потерь на первых 1,000 шагах оптимизации (мини-батчах). Показаны две кривые: значение потери по мини-батчам (синяя) и её экспоненциальное скользящее среднее с окном в 20 итераций (оранжевая). К итерации сглаженная кривая опускается ниже и остаётся там до конца обучения, наблюдается лишь небольшое «дребезжание» по мини-батчам (относительная амплитуда менее ). Это соответствует целевому уровню , используемому в Теореме 1, так что теоретическая граница на точечную ошибку предсказания гарантируется уже менее чем через две эпохи. График подтверждает, что функция потерь при якорном состязательном дообучении сходится быстро и стабильно, достигая требуемо низких уровней потери без длительной подстройки гиперпараметров.
На рис. 1 (b) сравниваются теоретическая граница из Теоремы 1 и наблюдаемая максимальная точечная ошибка в ходе дообучения AnAT на наборе данных KADID-10k. Эмпирическая кривая нигде не превышает теоретическую границу и убывает с тем же экспоненциальным темпом, что даёт наглядное подтверждение корректности полученной оценки.

Рис. 1. (a) Сходимость якорной функции потерь за 1000 итераций. (b): сравнение границ, предоставленных теоремой 1, с эмпирическими значениями максимальных точечных ошибок.
Во время состязательного дообучения каждый мини-батч формируется из узкой полосы по оценкам MOS, что ограничивает как размах меток R, так и межъякорное расстояние .
В пределах этой полосы случайное подмножество изображений оставляется чистым (якоря), тогда как оставшиеся подвергаются атаке. Мы считаем, что модель уже достаточно хорошо предсказывает качество для чистых изображений, поэтому ошибка для якорных элементов остаётся пренебрежимо малой. Поскольку R и ограничены шириной полосы, граница из Теоремы 1 упрощается до выражения, где доминирует ; следовательно, более узкие полосы ужесточают гарантию и ускоряют сходимость.
Итоговая функция потерь имеет вид .
Такой составной штраф одновременно обеспечивает устойчивое относительное ранжирование изображений даже под состязательными возмущениями и продолжает ограничивать абсолютную ошибку предсказания.
Для сравнения нашего подхода с текущими решениями мы представляем ряд экспериментальных результатов. Мы провели оценки как внутри наборов данных, так и между ними, а также выполнили подробное сравнение устойчивости к атакам. Эксперименты выполнены на нескольких публичных наборах: LIVE [29], CSIQ [30], TID2013 [31],
KADID-10k [32], PIPAL [33] и наборе данных с двухальтернативным вынужденным выбором (2AFC): BAPPS [12]. При наличии мы использовали официальные разбиения на train/val/test и усредняли результат по 10 запускам со случайными разбиениями в пропорции 6\2\2. Разбиения формировались по эталонным изображениям, чтобы исключить пересечение контента.
Мы оцениваем качество с помощью двух широко используемых корреляционных показателей для наборов с MOS: линейного коэффициента корреляции Пирсона (PLCC) и рангового коэффициента Спирмена (SROCC). Оба показателя лежат в диапазоне [-1,1], положительное значение означает прямую взаимосвязь. Больший SROCC указывает на более точное ранжирование, тогда как больший PLCC – на более точное приближение абсолютных значений. Дополнительно применяется метод выборки с замещением ( повторных выборок) для проверки статистической значимости различий по SROCC.
Мы сравниваем эффективность предложенного состязательного дообучения для различных FR-IQA-моделей. Для состязательного дообучения и тестирования использовались обучающая и тестовая части набора KADID-10k; в качестве метода атаки – Projected Gradient Descent с 10 итерациями (PGD-10) [34], бюджет атаки . Различные варианты состязательного обучения сравниваются по SROCC и по интегральному показателю робастности IR-Score [26] на чистых и атакованных данных.
Показатель IR-Score оценивает способность модели выдерживать возмущения разной силы, как рекомендовано в [25]. Состязательные примеры генерировались при величинах возмущения . Оценки нормировались min–max-масштабированием и сопоставлялись в едином пространстве с помощью модели нейронного оптимального транспорта, чтобы учесть различия распределений. IR-Score вычисляется как
.
Здесь – пары эталон/искажённое изображение, – возмущение с бюджетом , сгенерированное против модели ; где – вариант после состязательного дообучения, N – число изображений. Большие значения соответствуют большему среднему снижению падения качества под атакой по сравнению с базовой моделью.
Мы сравниваем четыре варианта трёх полно-референсных FR-IQA моделей (LPIPS, TOPIQ и AHIQ) под распространёнными атаками белого ящика с нормой . Рассматриваемые варианты:
Во всех вариантах AT и AnAT в обучении использовалась PGD-атака на 10 итераций (PGD-10) с бюджетом .
На этапе тестирования мы оцениваем четыре невиданных атаки: FGSM [36], C&W [37], AutoAttack (AA) [38] и перцептивную атаку FACPA [39]. Устойчивость измеряется по SROCC и IR-Score на наборе данных KADID-10k.
Табл. 1 показывает, что AnAT достигает результатов уровня SOTA по робастности и превосходит другие подходы на 0.02–0.06 пункта SROCC, с сопоставимыми преимуществами по IR-Score. AnAT также даёт наилучший SROCC на неиспорченной тестовой выборке по сравнению с другими методами защиты. Без каких-либо защит TOPIQ демонстрирует более высокую устойчивость, чем LPIPS и AHIQ, опережая их по IR-Score на 0.02–0.03. Хотя AnAT требует больше времени на фазе состязательного дообучения, он обеспечивает наилучшие суммарные результаты.
Таблица 1. Устойчивость состязательно обученных моделей IQA на KADID-10k. SROCC оценивается при ε = 8/255; для IR-Score используется ε ∈ {2, 4, 8, 10}/255. Полужирным шрифтом выделены лучшие результаты для каждой модели. Все состязательные варианты обучались только с PGD-10.

Мы оценили четыре варианта трёх полно-референсных FR-IQA моделей (LPIPS, TOPIQ и AHIQ) на наборе данных BAPPS (двухальтернативный вынужденный выбор, 2AFC). Во всех вариантах AT и AnAT использовалась PGD-атака на 10 итераций (PGD-10) с бюджетом . На этапе тестирования модели подвергались семи невиданным ранее атакам: FGSM, C&W, AutoAttack (AA), FACPA, перцептивная атака Zhang et al., SquareAttack и Parsimonious; всего 5 атак белого ящика и 2 – чёрного ящика. Для всех тестовых атак использовался одинаковый бюджет . Мы сообщаем точность (accuracy) на чистой и атакованной версиях тестовой части BAPPS.
Табл. 2 показывает, что AnAT достигает уровня SOTA по робастности и превосходит другие подходы на 0.02–0.10 пункта точности. AnAT также обеспечивает наилучшую точность на неатакованной тестовой выборке по сравнению с другими методами защиты. Даже без защит AHIQ модель демонстрирует большую устойчивость, чем LPIPS и TOPIQ, опережая их по метрике ‘accuracy’ на 0.03–0.06.
Таблица 2. Точность на тестовом наборе BAPPS (2AFC) для различных техник состязательного обучения, применённых к моделям LPIPS, TOPIQ и AHIQ. Лучшие результаты для каждой модели выделены полужирным шрифтом. Во время обучения использовался PGD-10 (ε = 8/255).

В табл. 3 сравнивается предложенная техника AnAT с методами состязательной «очистки» (purification). Эти подходы не модифицируют саму модель IQA, а выполняют предварительную обработку входных изображений. Мы сопоставляем AnAT в связке с нашей FR-IQA моделью с базовыми приёмами предобработки (Random Flip, Random Rotate), а также со специализированной защитой DiffPure [40]. Результаты показывают, что AnAT превосходит все методы «очистки», за исключением случая SquareAttack, где DiffPure достигает наилучшего результата. Вероятная причина – наибольшее отличие возмущений SquareAttack от профиля PGD-10, использованного в процессе состязательного дообучения, что ведёт к большему «сдвигу домена» между обучением и тестированием.
Таблица 3. Точность (%) на тестовом наборе BAPPS 2AFC для AnAT-LPIPS по сравнению с базовыми методами состязательной очистки. Лучшие результаты выделены полужирным. AnAT-LPIPS обучался с PGD-10 (ε = 8/255).

В работе предложен метод Anchored Adversarial Training (AnAT) для полно-референсной оценки качества изображений, который объединяет якорное ранжирование с состязательным дообучением и даёт теоретически обоснованную границу на точечную ошибку предсказания под атаками. Показано, что якорная ранговая функция потерь контролирует перевороты порядка относительно «чистых» образцов и тем самым ограничивает максимальное отклонение предсказаний; эмпирически наблюдаемая динамика ошибки согласуется с полученной границей.
Экспериментальная оценка на пяти общедоступных FR-IQA бенчмарках и под невиданными ранее атаками белого (и, для 2AFC-набора, чёрного) ящика демонстрирует, что AnAT стабильно повышает робастность моделей без деградации на чистых данных. В частности, на KADID-10k AnAT увеличивает SROCC под атаками по сравнению с базовыми моделями и альтернативными вариантами AT, улучшая также интегральный показатель устойчивости IR-Score; на BAPPS достигается прирост accuracy по сравнению с другими методами. При этом подход интегрируется в существующие архитектуры (LPIPS, TOPIQ и компактная CNN-модель) и сохраняет или улучшает их качество на неизменённых выборках.
Практически значимо, что AnAT не требует согласования шкал MOS между наборами данных и обходится без прямого штрафа по меткам качества для атакованных примеров, что упрощает перенос между наборами данных и снижает риск «переноса» уязвимостей через используемую метрику. Вместе с тем авторы отмечают, что цена за прирост устойчивости – дополнительное время на фазе состязательного дообучения.
Ограничения и направления развития включают: расширение анализа за пределы выбранных бюджетов и типов атак; распространение методики на NR-IQA и видео-качество; автоматизацию выбора/планирования «полос» MOS и стратегии отбора якорей; изучение компромисса между числом якорей, сходимостью и итоговой границей ошибки; а также исследование сочетания AnAT с сертифицируемыми защитами.
Александр Евгеньевич ГУЩИН получил степень магистра по прикладной математике и информатике в Московском государственном университете имени М. В. Ломоносова в 2024 году. В настоящее время является студентом аспирантуры в лаборатории компьютерной графики и мультимедиа. В область его научных интересов входят методы оценивания качества видео и изображений, а также исследование устойчивости нейросетевых моделей и методов их защиты.
Анастасия Всеволодовна АНЦИФЕРОВА – аспирантка ВМК МГУ. Окончила магистратуру ВМК МГУ по специальности анализ больших данных в 2018 году. В настоящее время она является аспиранткой и участником видеогруппы лаборатории графики и мультимедиа МГУ. Сфера ее научных интересов включает анализ и оптимизацию видеокодеков, оценку субъективного качества стереоскопического видео. Анастасия является одним из организаторов проекта международного сравнения видеокодеков, ежегодно проводимого в МГУ и проекта измерения качества 3D-видео VQMT3D.
Дмитрий Сергеевич ВАТОЛИН закончил ВМК МГУ в 1996, защитил диссертацию в 2000, кандидат физико-математических наук, заведующий лабораторией компьютерной графики ВМК МГУ. Специализируется на исследованиях в области алгоритмов сжатия видео, современных методах измерения качества и обработке цифрового видео. Читает курсы по компьютерной графике и методам сжатия и обработки видео с 1997 года. Создатель популярных сайтов, посвященных алгоритмам обработки и сжатия видео.