2026 г.

Сбор данных для обучения и тестирования моделей сверхразрешения, работающих в реальном времени

DOI: 10.15514/ISPRAS-2026-38(1)-15

1 Е.Н. Богатырев, ORCID: 0000-0002-6173-3561 <evgeney.bogatyrev@graphics.cs.msu.ru>

1,2 И.А. Молодецких, ORCID: 0000-0002-8294-0770 <ivan.molodetskikh@graphics.cs.msu.ru>

1,2,3 Х.Н. Абуд, ORCID: 0009-0009-7131-5839 <khaled.abud@graphics.cs.msu.ru>

1,2,3,4 Д.С. Ватолин, ORCID: 0000-0002-8893-9340 <dm.vatolin@ispras.ru>

1 Московский государственный университет имени М.В. Ломоносова,
Россия, 119991, Москва, Ленинские горы, д. 1.

2 Центр искусственного интеллекта МГУ,

Россия, 119991, г. Москва, Ленинские горы, ГСП-1

3 Институт перспективных исследований проблем
искусственного интеллекта и интеллектуальных систем МГУ имени М.В. Ломоносова,

Россия, 119192, г. Москва, Ломоносовский проспект, 27, корп. 1.

4 Институт системного программирования им. В.П. Иванникова РАН,
Россия, 109004, г. Москва, ул. А. Солженицына, д. 25.

Аннотация. Современные модели сверхразрешения (SR) реального времени плохо справляются с особенностями сжатого видео. Часто используемые наборы данных не отражают в полной мере характеристики стримингового контента, что снижает релевантность существующих бенчмарков. Авторами предложен новый набор данных StreamSR, собранный из видеороликов с платформы YouTube и охватывающий широкий спектр жанров и разрешений видео, характерных для реальных сценариев. Протестировано 11 современных моделей сверхразрешения, работающих в реальном времени, оценена их эффективность для задач стримингового вещания. В работе демонстрируется, что дообучение других моделей на представленном наборе данных приводит к значительному повышению качества, которое хорошо обобщается на стандартные бенчмарки. Предлагается EfRLFN – эффективная модель сверхразрешения, в которую интегрированы Efficient Channel Attention и гиперболический тангенс в качестве функции активации, что является новым решением в контексте сверхразрешения в реальном времени. Архитектура оптимизирована для максимизации эффективности, также разработана составная функция потерь, улучшающая сходимость обучения. EfRLFN объединяет преимущества существующих архитектур, одновременно улучшая как визуальное качество, так и производительность.

Ключевые слова: сверхразрешение; видео; набор данных; кодирование видео; оценка качества видео.

Для цитирования: Богатырев Е.Н., Молодецких И.А., Абуд Х.Н., Ватолин Д.С. Сбор данных для обучения и тестирования моделей сверхразрешения, работающих в реальном времени. Труды ИСП РАН, том 38, вып. 1, 2026 г., стр. 221–240. DOI: 10.15514/ISPRAS-2026-38(1)-15.

Благодарности: Работа выполнена при финансовой поддержке Министерства экономического развития Российской Федерации (соглашение № 139-15-2025-012 от 20.06.2025). Работа выполнялась с использованием суперкомпьютера «МГУ-270» МГУ имени М.В. Ломоносова.

1. Введение

В последние годы наблюдается необходимость в высококачественном стримминге видео, обусловленная широким распространением таких платформ, как YouTube, Twitch и Netflix [1]. Из-за ограничений пропускной способности сети потоковые сервисы часто сжимают видеоконтент, что может приводить к появлению визуальных искажений, таких как блочность, размытие и потеря мелких деталей. Несмотря на то, что существуют технологии, позволяющие повышать разрешение видео в реальном времени, такие методы часто не справляются с уникальными искажениями, создающимися после сильного сжатия видео [2].

Проведённый анализ показывает, что существует ограниченное число методологий SR (Super-Resolution, сверхразрешение), способных эффективно увеличивать разрешение сжатых видео [3]. Кроме того, отмечается заметный дефицит моделей сверхразрешения, способных работать в реальном времени. Соревнования NTIRE [4, 5] сыграли ключевую роль в продвижении разработки моделей SR реального времени, способствуя значительному прогрессу в этой области. Однако следует отметить, что многие из этих моделей SR обучались только на наборах данных, таких как DIV2K [6] или Vimeo90K [7], которые не покрывают сценарии работы со сжатым видео.

Недавно был представлен и популяризирован метод Video Super-Resolution от NVIDIA (NVIDIA VSR) [8] – это основанный на машинном обучении метод SR, интегрированный в драйвер GPU. Однако, несмотря на свою эффективность, NVIDIA VSR часто не восстанавливает мелкие текстуры и вносит чрезмерное сглаживание, что ограничивает его практическую пользу, как проиллюстрировано на рис. 1. Аналогично, другие современные методы SR реального времени, такие как SPAN [9] и RLFN [10], показывают высокие результаты на стандартных наборах данных, но не оптимизированы для сложностей, появляющихся при сжатии видео [2].

Рис. 1. Примеры искажений, создаваемых NVIDIA VSR, в сравнении с бикубической интерполяцией (bicubic). Первая и вторая пара изображений показывают разницу в цвете. Третья пара показывает, как NVIDIA VSR сильно сглаживает текстуры.

Рис. 1. Примеры искажений, создаваемых NVIDIA VSR, в сравнении с бикубической интерполяцией (bicubic). Первая и вторая пара изображений показывают разницу в цвете. Третья пара показывает, как NVIDIA VSR сильно сглаживает текстуры.

Для решения указанных проблем в данной работе представлен набор данных StreamSR, содержащий 5,200 видеороликов с видеохостинга YouTube (в сумме более 10 млн отдельных кадров), охватывающих различные жанры и соотношения сторон. Этот набор данных является надежным бенчмарком для оценки методов SR в условиях потоковой передачи. Кроме того, разработана модель Efficient Residual Lightweight Feature Network (EfRLFN). Данная модель адаптирована для применений в реальном времени и демонстрирует значительное улучшение как объективных, так и субъективных метрик качества видео.

Основные вклады работы заключаются в следующем.

  • StreamSR набор данных для сверхразрешения потокового видео. Собран и проанализирован многомасштабный набор данных, полученный из YouTube. Набор включает 5,200 пользовательских видеороликов разнообразной тематики и типов контента. Также проведен сравнительный анализ с существующими наборами данных.
  • Системное тестирование моделей сверхразрешения реального времени. Оценены 11 методов сверхразрешения реального времени с использованием представленного набора данных. При этом их производительность анализировалась как с дообучением на тренировочном наборе, так и без него. Были использованы 7 различных объективных метрик качества видео и проведено масштабное исследование пользовательских предпочтений с участием более 3,800 человек.
  • Метод сверхразрешения реального времени. Исходя из результатов тестирования моделей SR, были предложены модификации существующих архитектур. Архитектура SPAN была улучшена изменением функции активации, что показало прирост качества по многим объективным и субъективным метрикам. На основе популярной архитектуры RLFN проведена тщательная оптимизация, включающая новую конструкцию блоков, механизм Efficient Channel Attention и усовершенствованную процедуру обучения. Проведённые оценки показывают, что разработанная архитектура EfRLFN показывает лучшие результаты в задаче сверхразрешения реального времени, превосходя другие методы по соотношению качество-сложность, что подтверждается расширенными экспериментами.

2. Обзор литературы

2.1 Методы сверхразрешения

Современные модели SR реального времени достигают различного соотношения между качеством реконструкции и вычислительной эффективностью за счёт инновационных архитектурных решений.

Среди моделей, способных работать в реальном времени, метод Bicubic++ [11] сочетает быстрое обратимое извлечение признаков с глобальным структурированным прореживанием сверточных слоев, достигая скорости обработки, сравнимой с традиционной бикубической интерполяцией. Метод AsConvSR [12] вводит динамические свертки, которые адаптируют свои ядра на основе характеристик входных данных. Данная модель оптимизирована для мобильных устройств. Для увеличения разрешения до высоких значений метод RT4KSR [13] использует перестановку пикселей и структурную репараметризацию блоков NAFNet для эффективного повышения разрешения с 720p/1080p до 4K. Архитектура метода SPAN [9] характеризуется механизмом внимания с симметричными активациями для усиления важных признаков и подавления избыточных. Это уменьшает вычислительные затраты на 40% по сравнению с традиционными модулями внимания. Аналогично, метод RLFN [10] реализует упрощенную трехслойную сверточную структуру, достигая повышения разрешения с 1080p до 4K менее, чем за 15 мс, при сохранении сильной агрегации признаков. Метод TMP [14] улучшает повышение разрешения видео за счёт минимизации вычислительной избыточности в оценке движения.

В дополнение к легковесным методам реального времени, трансформерные модели, такие как SwinIR [15] и HiT-SR [16], достигают превосходного качества за счёт механизмов самовнимания и иерархической многомасштабной обработки. Существуют и другие подходы к задаче SR, такие как COMISR [3] и CAVSR [17], которые специализируются на увеличении разрешения сжатого видео. Метод Real-ESRGAN [18] является популярным генеративным методом, который использует моделирование деградации высокого порядка для симуляции реальных искажений. Хотя эти методы демонстрируют превосходные результаты по сравнению с моделями SR реального времени, они являются вычислительно затратными, что делает их непригодными для приложений реального времени.

Несмотря на то, что все эти модели продемонстрировали различную степень успеха в улучшении качества изображений, проблемы со сверхразрешением сжатого видеоконтента остаются актуальными. Данная работа строится на этих фундаментальных исследованиях с целью создания наиболее подходящей модели SR для использования в реальном времени.

2.2 Наборы данных и соревнования в задаче SR реального времени

Наборы данных играют ключевую роль в обучении и оценке моделей SR. DIV2K [6] и Vimeo90K [7] широко используются для тестирования, так как содержат эталонные изображения высокого разрешения. Однако этим наборам данных не хватает примеров с артефактами сжатия, характерными для потокового контента. Аналогично, набор данных YouTube UGC [19] содержит разнообразные видео, но не фокусируется на сценариях, релевантных для SR в реальном времени. Для оценки качества SR также широко используются наборы данных Set14 [20], BSD100 [21] и Urban100 [22], содержащие естественные и структурированные изображения с фиксированным масштабом. Для задач видео-SR набор данных REDS [23] предоставляет динамические сцены с размытием движения и артефактами сжатия, что делает его подходящим для обучения и тестирования сложных архитектур SR.

Соревнование NTIRE 2023 Real-Time SR Challenge [4] было сфокусировано на разработке методов сверхразрешения, способных работать в реальном времени при сохранении высокого качества изображения. Перед участниками стояла задача разработки архитектуры, балансирующей вычислительную эффективность и производительность. Среди лидирующих решений присутствовали модели, использующие продвинутые методы прореживания и стратегии квантования для уменьшения размера модели без потери качества выходных данных. Также применялись методы дистилляции знаний для переноса представлений из больших моделей в меньшие и более эффективные сети, что обеспечивало обработку в реальном времени для таких приложений, как потоковое вещание и видеоконференции.

Продолжая фокус предыдущего года, Соревнование NTIRE 2024 Efficient SR Challenge [5] акцентировало внимание на эффективных моделях SR, способных обеспечивать высококачественные результаты при минимизации потребления ресурсов. Участники исследовали различные стратегии, включая использование трансформерных архитектур, которые адаптивно распределяют вычислительные ресурсы на основе характеристик входных данных. Кроме того, наблюдался повышенный интерес к методам, использующим обучение под несколько задач, где модели обучались не только для сверхразрешения, но и для таких задач, как шумоподавление и удаление блочности, повышая общую эффективность обработки сжатого видеоконтента. Несколько подходов интегрировали механизмы внимания для фокусировки на критически важных областях изображения, улучшая как скорость, так и качество процесса увеличения разрешения.

На основе описанных выше соревнований было разработано много качественных методов SR реального времени. Однако тренировочные наборы данных в этих соревнованиях не содержат сжатых видео, из-за чего обученные на них модели SR не приспособлены к работе с потоковым контентом.

3. Набор данных и оценка SR реального времени

В данном разделе описывается методология, использованная для сбора видео в наборе данных StreamSR и их последующей категоризации.

3.1 Сбор данных

Получение видео. Для генерации поисковых запросов для сбора видео использовалась большая языковая модель (GPT-4o) [24]. Исходя из 20 различных категорий YouTube (например, путешествия, образование, игры), GPT-4o генерировала 100 разнообразных поисковых запросов для каждой категории. Затем загружались топ-100 видео для каждого запроса. Список некоторых тем и примеры сгенерированных запросов приведены в табл. 1.

Фильтрация. Из всех видео рассматривались только видео с лицензией Creative Commons (CC BY 4.0) с доступными разрешениями 360p, 720p и 1440p. Для обеспечения точного выравнивания кадров требовалось постоянное значение частоты кадров, которое проверялось автоматически. Разрешения были выбраны для поддержки двух треков бенчмарка SR: 2× (720p→1440p) и 4× (360p→1440p). Для каждого разрешения выбирался поток с наивысшим битрейтом для обеспечения оптимального качества эталонного высококачественного потока. Из каждого видео извлекались первые 30 секунд (2,000 кадров). Видео с длинными статичными заставками отфильтровывались путем сравнения 1-ого, 100-ого и 150-ого кадра видео. Видео отбраковывались, если среднее значение метрики PSNR (peak signal-to-noise ratio, пиковое отношение сигнала к шуму) между этими кадрами превышал 40 дБ. В результате был получен набор из 5,200 видео, который был назван набором данных StreamSR.

Категоризация. Для построения разнообразного и репрезентативного тестового набора видео были кластеризованы с использованием признаков SI, TI [19], битрейта, MDTVSFA [25] и текстовых эмбеддингов поисковых запросов, посчитанных с помощью SigLIP [26]. Эмбеддинги SigLIP проецировались в 3-мерное пространство с помощью метода главных компонент для снижения размерности. Все признаки были нормализованы до нулевого среднего и единичной дисперсии. Кластеризация выполнялась алгоритмом K-средних (K-Means) с использованием евклидовой метрики расстояния. Количество кластеров K=20 было выбрано эмпирически на основе анализа метода локтя (elbow method), который показал, что это значение обеспечивает хороший компромисс между внутрикластерной схожестью и разнообразием набора данных. Из каждого из 20 полученных кластеров для формирования фиксированного тестового набора выбиралось одно видео, наиболее близкое к центроиду. Остальные видео случайным образом разделялись на обучающий и валидационный наборы в соотношении 10:1, сохраняя пропорции кластеров для предотвращения смещения распределения.

Табл. 1. Запросы для скачивания видео, сгенерированные с помощью LLM. В каждой ячейке представлено название категории и соответствующие ей запросы.

СпортЖивотныеАктивность
"highlights of football"
"sports slow motion"
"extreme sports action"
"basketball dunks"
"soccer goals"
"wildlife documentary"
"cute animal videos"
"slow motion animals"
"pets playing"
"nature interactions"
"people dancing"
"cooking tutorials"
"fitness workouts"
"street performers"
"DIY projects"
ИскусствоСъемка вблизиИстория
"time-lapse painting"
"sculpting techniques"
"DIY crafts"
"artistic creations"
"watercolor tutorial"
"macro insects"
"close-up flowers"
"macro techniques"
"tiny world"
"everyday objects"
"historical footage"
"old documentaries"
"historical events"
"classic film clips"
"moon landing"
АнимацияНаукаПрирода
"animation films"
"animated scenes"
"cartoon clips"
"stop motion"
"3D animation"
"science experiments"
"physics demos"
"chemical reactions"
"biology explained"
"science phenomena"
"nature landscapes"
"time-lapse nature"
"ocean waves"
"forest scenery"
"mountain views"

В табл. 2 проводится сравнение набора данных StreamSR с существующими наборами пользовательского контента. В отличие от наборов данных для классификации (YouTube-8M, Kinetics) или сегментации (YouTube-VOS), набор StreamSR разработан для задачи SR, предоставляя выровненные видео с разрешением от 360p до 1440p и с треками увеличения 2× и 4×. Благодаря более длинным клипам (25-30с), видео с различными разрешениями и естественными артефактами сжатия, а также более широкому диапазону качества, он лучше представляет реальные сценарии потоковой передачи по сравнению с предыдущими наборами данных SR (REDS, Vimeo-90K).

Рис. 2 показывает распределение признаков видео в собранном наборе данных и в других. Из графиков видно, что видео в собранном наборе данных покрывают широкий спектр значений по каждому из признаков, однако содержатся в отдельном кластере стриминговых видео.

Табл. 2. Сравнение наборов данных пользовательского видео. Диапазон качества показывает 5-й и 95-й процентили метрики MDTVSFA [25]. Длительность показывает типичную длительность видеоклипа.

Набор данныхГодРазрешенияДиапазон качестваПрименениеДлительность
YouTube-8M2016240p–1080p0.45–0.58Классификация5 мин
Kinetics-40020171080p0.48–0.59Распознавание действий12 сек
Kinetics-70020191080p0.47–0.58Распознавание действий12 сек
YouTube-VOS2018360p–1080p0.46–0.57Сегментация объектов25 сек
YouTube-BB20171080p0.50–0.60Отслеживание объектов12 сек
YT-Temporal 180M2020144p–1080p0.42–0.56Языковое предобучение7 сек
DIV2K20172K0.55–0.65Сверхразрешение изображений
REDS2019360p–720p0.50–0.60Сверхразрешение видео5 сек
Vimeo-90K2019448p0.48–0.58Сверхразрешение видео1 сек
UDM102019540p–4K0.45–0.58Сверхразрешение изображений
RealSR20194K0.43-0.59Сверхразрешение изображений
VideoLQ2021270p–1080p0.43–0.54Сверхразрешение видео10 сек
StreamSR 2025360p–1440p0.41–0.61Сверхразрешение30 сек

Рис. 2. Распределение пространственной и временной сложности [19] и MDTVSFA [25] для видео из разных наборов данных. Рис. 2. Распределение пространственной и временной сложности [19] и MDTVSFA [25] для видео из разных наборов данных.

Рис. 2. Распределение пространственной и временной сложности [19] и MDTVSFA [25] для видео из разных наборов данных.

3.2 Дообучение моделей SR

Для дообучения и тестирования был выбран широкий список моделей SR на основе результатов соревнований NTIRE за последние годы, включающий как классические подходы, такие как бикубическая интерполяция, Bicubic++ [11] и ESPCN [27], так и современные методы, такие как SMFANet [28], RLFN [10] и SPAN [9]. В сравнение также была включена проприетарная модель NVIDIA VSR. В табл. 3 собрана информация о тестируемых моделях.

Для обеспечения справедливого сравнения каждой модели все тестируемые модели предварительно обучались на тренировочной части StreamSR, а результаты оценивались как для дообученных, так и для стандартных моделей. Если для модели не существовало предварительно обученных весов для конкретного коэффициента увеличения (2× или 4×), она обучалась с нуля, и использовалась только обученная версия. Каждая модель была обучена в течение 500 эпох, используя процесс обучения, описанный в оригинальной статье. Все модели оценивались на видео разрешения 720p с увеличением разрешения в 2× до 1440p. Для измерений FPS каждая модель запускалась на видеокарте NVIDIA GeForce RTX 2080, и время выполнения рассчитывалось на одном и том же тестовом фрагменте из 100 кадров, усредненное по 3 последовательным запускам.

Табл. 3. Характеристики использованных моделей сверхразрешения реального времени.

МетодПараметры (М)FLOPs б)УвеличениеТип архитектуры
ESPCN [27]0.042.432×,3×,4×Sub-pixel CNN
XLSR [29]0.031.814×CNN
RLFN [10]0.401362×,4×CNN+Attention
AsConvSR [12]2.3592×Assembled Convolution
Bicubic++ [11]0.050.833×CNN
NVIDIA VSR [8]--2×,3×,4×CNN+Attention
RT4KSR [13]0.051722×CNN+Attention
SAFMN [30]0.23524×CNN с модуляцией признаков
SMFANet [28]0.20114×CNN с модуляцией признаков
SPAN [9]0.43282×,4×Беспараметровое внимание
3.3 Оценивание качества методов

Для оценивания различных аспектов производительности алгоритмов SR был выбран разнообразный набор объективных метрик. PSNR и SSIM [31] служат фундаментальными мерами точности на уровне пикселей и структурного сходства. LPIPS [32], с другой стороны, выходит за рамки традиционных метрик и использует глубокие признаки для лучшего соответствия человеческому восприятию. Помимо метрик с эталоном (Full-Reference, FR), в сравнение также были включены метрики, не требующие эталона (No-Reference, NR). Они оценивают качество изображений после сверхразрешения без сравнения с реальными примерами высокого разрешения. В частности, были использованы две NR метрики: MUSIQ [33] – мощная трансформерная модель, превосходно справляющаяся с оценкой реального контента, и CLIP-IQA [34] – популярная модель на основе CLIP.

3.4 Субъективное сравнение

Для более точной оценки лучших моделей SR было проведено субъективное сравнение. Поскольку пользовательские исследования часто могут быть дорогостоящими, на предварительном этапе были исключены модели, показавшие низкое качество на основе объективных метрик. Для оценки и ранжирования качества различных моделей SR с субъективной точки зрения было проведено попарное краудсорсинговое сравнение с использованием сервиса Subjectify.us [36]. Сравнение включало 11 моделей SR (+ эталонное видео) и в общей сложности 660 пар видео.

Оценка была организована в виде двух отдельных треков: один сфокусирован на увеличении 2×, другой – на увеличении 4×. При попарном сравнении видео точность разметки выше, так как участники видят оба сравниваемых видео. Однако, учитывая ограниченное количество участников с разрешением экрана выше Full HD, было принято решение представлять каждое тестовое видео в виде центрального кадрирования в разрешении Full HD, причем видео показывались последовательно.

В ходе эксперимента участникам показывались пары видео, сгенерированные двумя случайно выбранными моделями SR. Им предлагалось выбрать видео с меньшим количеством визуальных искажений, а также была предоставлена возможность указать, что видео «неразличимы». Каждая пара видео оценивалась в общей сложности 30 участниками, при этом каждый участник оценивал 10 пар видео. Количество оценок на пару было определено на основе расчета статистической мощности, что обеспечивает достаточную точность для ранжирования моделей с использованием модели Брэдли-Терри [37] при ожидаемом уровне согласия между участниками.

Для обеспечения достоверности результатов среди 10 пар были включены два контрольных вопроса с предопределенными правильными ответами. Ответы участников, которые не ответили правильно на один или более контрольных вопросов, исключались из дальнейшего анализа. В субъективной оценке приняли участие 3 822 уникальных участника. Итоговые субъективные баллы были получены на основе 37 184 ответов с применением модели Брэдли-Терри [37]. Для количественной оценки надежности полученных субъективных данных был рассчитан коэффициент межэкспертной согласованности Флейса [38], который составил 0.65, что указывает на существенное согласие между участниками и подтверждает надежность собранных оценок.

На рис. 3 визуализирован интерфейс сервиса Subjectify.us, использованного для субъективного сравнения.

Рис. 3. Интерфейс платформы Subjectify.us.

Рис. 3. Интерфейс платформы Subjectify.us.

Перед началом сравнения каждому участнику показывалась следующая инструкция:

«Вам будут показаны пары видео, демонстрируемые одно за другим. Для каждой пары выберите видео с лучшим визуальным качеством (более четкое, с меньшим количеством искажений, таких как размытие или пикселизация). Если видео выглядят одинаково, выберите «Неразличимы». Будьте внимательныв тесте присутствуют контрольные вопросы. Неправильные ответы на контрольные вопросы приведут к отклонению ваших результатов».

На рис. 4 представлен анализ корреляции между объективными метриками качества видео и субъективными оценками людей. Результаты экспериментов демонстрируют, что четыре метрики – CLIP-IQA, ERQA, LPIPS и MUSIQ – показывают значимые корреляции с субъективными оценками качества.

Данные результаты согласуются с предыдущими исследованиями в трех ключевых аспектах. Во-первых, метрики, использующие глубокие признаки (LPIPS, MUSIQ), показывают лучшую согласованность с человеческим восприятием по сравнению с традиционными подходами. Во-вторых, ERQA показывает хорошие результаты в задаче оценки качества восстановления видео. В-третьих, слабая корреляция PSNR с человеческим восприятием, что согласуется с другими работами [2,35].

Табл. 3. Сравнение качества SPAN (Sigmoid – 0.5) и SPAN (tanh).

Set14BSD100Urban100DIV2K
МодельSSIM/LPIPSSSIM/LPIPSSSIM/LPIPSSSIM/LPIPS
SPAN (Sigmoid – 0.5)0.836 / 0.1420.837 / 0.2390.847 / 0.1180.890 / 0.175
SPAN (tanh)0.837 / 0.1400.841 / 0.2280.853 / 0.1150.891 / 0.167

Рис. 4. Корреляция Пирсона между объективными метриками качества и субъективными оценками.

Рис. 4. Корреляция Пирсона между объективными метриками качества и субъективными оценками.

4. Разработка моделей SR реального времени

4.1 Улучшение архитектуры SPAN

Основное изменение заключается в использовании гиперболического тангенса (tanh) в качестве функции активации. Данная модификация мотивирована исследованиями [9], демонстрирующими, что нечётные симметричные функции активации, такие как Sigmoid(x)-0.5 или гиперболический тангенс, сохраняют как величину, так и знак признаков. В отличие от функции активации ReLU, которая отбрасывает отрицательные активации, tanh обеспечивает более богатый поток градиентов и предотвращает потерю информации в картах внимания, что приводит к уточнению признаков. Эмпирические исследования демонстрируют, что активация на основе tanh может улучшить распространение градиента в глубоких сетях [39] и повысить производительность в задачах плотного предсказания [40, 41]. Проведенные эксперименты демонстрируют, что замена смещенной сигмоиды (Sigmoid(x)-0.5) на активацию гиперболическим тангенсом в архитектуре SPAN приводит к улучшениям по сравнению с оригинальной архитектурой. В табл. 3 проводится сравнение обоих вариантов на стандартных бенчмарках.

4.2 Архитектура сети EfRLFN

Предлагаемая модель Efficient Residual Local Feature Network (EfRLFN) улучшает архитектуру RLFN [10] за счёт целевых модификаций, направленных на повышение эффективности и качества реконструкции. На рис. 5 представлена общая архитектура модели. Архитектура состоит из блока извлечения признаков, основного модуля обработки признаков и блока реконструкции. В силу простоты и параметрической эффективности, блоки извлечения и реконструкции признаков были перенесены из оригинальной модели. Ключевые инновации предложенной модели сосредоточены в конструкции блока ERLFB и процедуре обучения.

Рис. 5. Архитектура предложенной модели EfRLFN. Основная часть состоит из 6 блоков ERLFB.

Рис. 5. Архитектура предложенной модели EfRLFN. Основная часть состоит из 6 блоков ERLFB.

Блоки эффективных остаточных локальных признаков (ERLFB) заменяют оригинальные блоки RLFB в RLFN. По аналоги с архитектурой SPAN основное изменение заключается в использовании гиперболического тангенса (tanh) вместо ReLU в модулях уточнения.

Еще одной важной модификацией является механизм внимания, используемый для глобальной агрегации информации. В разработанной модели был использован механизм Efficient Channel Attention (ECA) вместо Enhanced Spatial Attention (ESA), используемый в RLFN. В то время как ESA использует многослойные сверточные группы для пространственного внимания, ECA использует облегченный механизм канального внимания на основе глобального усреднения (Global Average Pooling) и свертки 1×1. Данное изменение значительно сокращает вычислительные затраты при сохранении конкурентоспособной производительности, что подтверждается проведенными исследованиями.

Кроме того, архитектура ERLFB оптимизирована за счёт удаления избыточных соединений и упрощения этапа сглаживания признаков до одной свертки 3×3. Данная оптимизация уменьшает вычислительную фрагментацию, улучшая скорость вывода без ухудшения качества реконструкции.

4.3. Функция потерь

Контрастная функция потерь, используемая в методе RLFN, эффективно выравнивает промежуточные признаки с помощью пар позитивных и негативных образцов. Однако она создает две практические проблемы: чувствительность к выбору слоев экстрактора признаков (для задач, ориентированных на PSNR, требуются поверхностные слои [10]), и увеличение вычислительных затрат из-за попарного сравнения признаков. В EfRLFN вводится составная функция потерь, разработанная для устранения ограничений контрастной потери RLFN с акцентом на структурную точность и сохранение границ. Функция потерь состоит из трех ключевых компонентов:

L=λCharbLCharbРеконструкция+λVGGLVGGВосприятие+λSobelLSobelРезкостьграниц

Функция потерь Charbonnier обеспечивает точность на уровне пикселей, одновременно обеспечивая устойчивость к выбросам и устраняя ограничение потерь L1/L2, используемых на ранних этапах обучения RLFN. Она гарантирует стабильные градиенты даже для больших невязок, что делает её особенно подходящей для задач сверхразрешения.

LCharb=IHR-ISR2+ϵ2,ϵ>0

где IHR обозначает эталонное изображение высокого разрешения, а ISR обозначает выход модуля SR.

Перцептивная функция потерь на основе VGG использует глубокие признаки из предварительно обученной сети VGG-19 [42]. Данная функция потерь направляет модель к генерации реалистичных результатов.

LVGG=ϕVGG(IHR)-ϕVGG(ISR)1,

где ϕVGG() обозначает активации ReLU из слоя conv5_4 сети VGG-19.

Функция потерь Собеля оптимизирует резкость границ путем штрафования расхождений в картах градиентов между изображениями после сверхразрешения и исходными изображениями.

LSobel=S(IHR)-S(ISR)22,

где S() применяет оператор Собеля для извлечения горизонтальных и вертикальных границ.

Данная функция потерь устраняет критический пробел в подходе RLFN, который полагается на неявное сохранение границ посредством контрастного обучения на поверхностных признаках. Путем прямого воздействия на качество границ, предложенная функция потерь обеспечивает более четкое восстановление для высокочастотных деталей. Пользовательские исследования подтверждают, что такие результаты соответствуют предпочтениям зрителей, достигая более высоких субъективных оценок [2,32].

При обучении EfRLFN были установлены коэффициенты λCharb=1, λVGG=10-3 и λSobel=10-1 для нормализации, адаптированные из работы [2].

5. Эксперименты

5.1 Оценивание на тестовой части StreamSR

В табл. 4 (слева) показано, что предложенная модель EfRLFN демонстрирует наилучшее качество на тестовой части StreamSR среди моделей реального времени. Увеличение качества хорошо обобщается для различных объективных метрик и дополнительно подтверждается пользовательским исследованием (рис. 6). Результаты также указывают на то, что модели SPAN, RLFN и ESPCN значительно улучшаются после дообучения на нашем наборе данных: наблюдается заметный положительный разрыв как в объективных, так и в субъективных оценках. После дообучения некоторые из этих моделей превосходят проприетарную модель NVIDIA VSR по пользовательским предпочтениям. Для сравнения также включены некоторые стандартные модели SR, не работающие в реальном времени.

Рис. 6 и 7 предоставляют визуальное сравнение между различными моделями, дополнительно демонстрируя эффективность EfRLFN в сверхразрешении реального времени. Визуальные сравнения ясно показывают преимущества EfRLFN: модель производит более четкие изображения с более точными деталями, в то время как конкурирующие модели часто не могут воспроизвести четкие границы и тонкие текстуры, что приводит к заметным артефактам или размытию в сложных областях.

На рис. 8 демонстрируются результаты попарного субъективного сравнения с другими моделями SR: очевидно, что пользователи в значительной степени предпочитают результаты EfRLFN другим методам. В частности, EfRLFN предпочтительнее NVIDIA VSR в 77.4% случаев. Единственные конкурентоспособные альтернативы (SPAN-tuned и RLFN-tuned) также обучены на тренировочном наборе StreamSR.

Рис. 6. Сравнение EfRLFN с несколькими 4× моделями реального времени.

Рис. 6. Сравнение EfRLFN с несколькими 4× моделями реального времени.

Рис. 7. Сравнение между несколькими 2× моделями реального времени.

Рис. 7. Сравнение между несколькими 2× моделями реального времени.

Рис. 8. Предпочтение EfRLFN по сравнению с другими методами сверхразрешения реального времени на основе попарных субъективных оценок.

Рис. 8. Предпочтение EfRLFN по сравнению с другими методами сверхразрешения реального времени на основе попарных субъективных оценок.

5.2 Валидация на других наборах данных

Была проведена валидация EfRLFN и других методов SR реального времени на пяти широко признанных наборах данных: Set14 [20], BSD100 [21], Urban100 [22], REDS [23] и валидационном наборе DIV2K [6]. Усредненные результаты метрик представлены в табл. 4 (справа). EfRLFN стабильно превосходит все конкурирующие подходы во всех оцененных сценариях, достигая наилучшего качества как для увеличения разрешения 2×, так и 4×.

Проведенные эксперименты показывают, что обучение на предложенном наборе данных приносит пользу не только EfRLFN, но и улучшает производительность других конкурирующих моделей, что подтверждается количественными результатами в табл. 4 и 5 и рис. 10. Это особенно заметно в случаях с SPAN и RLFN.

Анализ функций потерь. На рис. 9 иллюстрируется влияние различных функций потерь на производительность EfRLFN по метрике SSIM в процессе обучения на треке 4× предложенного набора данных. Комбинированная функция потерь (синяя линия) достигает наивысшего значения SSIM, равного 0.865. Это демонстрирует взаимодополняющие преимущества каждой функции потерь. Исключение любого компонента приводит к заметному снижению, особенно удаление потери Charbonnier или VGG, что значительно ухудшает сходимость SSIM. Более простые функции потерь, такие как L1, L2 и LPIPS, показывают худшие результаты на протяжении всего обучения. Примечательно, что предложенный подход превосходит RLFN как по качеству, так и по эффективности обучения.

В отличие от RLFN, который использует двухэтапную процедуру обучения с потерями L1 и контрастной потерей, наша сеть обучается в один этап, достигая превосходного визуального качества при сокращении времени обучения на 16%.

Анализ архитектуры: В табл. 6 представлено исследование функций активации и механизмов внимания в EfRLFN. Комбинация активации гиперболическим тангенсом и механизма внимания ECA демонстрирует наилучшее общее качество, достигая наивысшего SSIM и LPIPS и самой быстрой скорости работы с минимальным количеством параметров. Замена tanh на смещенную сигмоиду заметно ухудшает SSIM и LPIPS для обоих вариантов внимания. Аналогично, использование более тяжелого блока внимания ESA приводит к снижению скорости работы и в лучшем случае к маргинальному улучшению LPIPS. Эти результаты указывают на то, что активация tanh в паре с облегченным модулем ECA обеспечивает оптимальный баланс между качеством и эффективностью для сверхразрешения в реальном времени.

Рис. 9. Влияние функций потерь на обучение EfRLFN на треке 4× предложенного набора данных. “Contrastive Loss” – оригинальная функция потерь модели RLFN.

Рис. 9. Влияние функций потерь на обучение EfRLFN на треке 4× предложенного набора данных. “Contrastive Loss” – оригинальная функция потерь модели RLFN.

Табл. 4. Сравнение методов сверхразрешения реального времени с 95% доверительными интервалами на треке увеличения 2×. Наилучшие результаты выделены полужирным, вторые лучшие –подчеркиванием. «T» обозначает дообучение на StreamSR. «Subj.» обозначает субъективные

StreamSRДругие бенчмарки
МодельSubj.PSNRLPIPSCLIP-IQABSD100Urban100DIV2KFPS
SSIM/LPIPS
AsConvSRТ1.93±0.1135.25±0.150.214±0.0080.48±0.020.832/0.2700.824/0.2080.883/0.206213±8
RT4KSR2.40±0.1236.45±0.160.213±0.0090.49±0.020.805/0.2960.769/0.2440.860/0.221102±5
RT4KSRТ2.43±0.1137.55±0.140.070±0.0030.53±0.020.812/0.2540.766/0.2230.864/0.186102±5
bicubic2.44±0.1430.32±0.210.076±0.0050.44±0.030.752/0.3860.711/0.3240.820/0.2921829±50
ESPCN2.48±0.1230.71±0.180.078±0.0040.45±0.020.774/0.5340.505/0.4370.514/0.515201±7
ESPCNТ2.49±0.1135.76±0.150.072±0.0030.51±0.020.814/0.2360.840/0.1500.862/0.180201±7
Bicubic++Т2.44±0.1336.79±0.150.087±0.0040.52±0.020.768/0.3600.725/0.2980.832/0.2701629±45
NVIDIA VSR2.57±0.1437.40±0.130.082±0.0030.56±0.020.788/0.2430.786/0.1520.858/0.18052±3
XLSRТ2.56±0.1237.25±0.140.230±0.0100.47±0.020.817/0.2440.828/0.1580.864/0.183429±15
SMFANetТ2.37±0.1437.14±0.150.158±0.0070.51±0.020.803/0.2390.798/0.1530.865/0.177327±12
SAFMNТ2.26±0.1537.09±0.150.122±0.0060.53±0.020.813/0.2360.808/0.1500.871/0.175273±10
RLFN2.17±0.1537.03±0.150.086±0.0040.54±0.020.805/0.2380.803/0.1470.876/0.175225±8
RLFNТ2.69±0.1337.63±0.120.072±0.0030.58±0.020.834/0.2390.845/0.1530.881/0.178225±8
SPAN2.55±0.1237.45±0.130.066±0.0030.57±0.020.836/0.2220.841/0.1390.887/0.16860±3
SPANТ3.13±0.1537.73±0.120.063±0.0030.61±0.020.837/0.2390.847/0.1180.890/0.17560±3
EfRLFNТ3.33±0.1437.85±0.110.059±0.0030.65±0.020.847/0.1900.856/0.1160.892/0.145271±10
Модели SR, не предназначенные для работы в реальном времени
Real-ESRGAN3.87±0.1337.65±0.120.048±0.0070.66±0.020.857/0.1720.867/0.1120.901/0.1379±1
BasicVSR++4.87±0.1338.05±0.130.037±0.0070.70±0.020.860/0.1580.868/0.1100.907/0.13115±1
COMISR4.32±0.1438.15±0.120.033±0.0060.67±0.030.894/0.1610.871/0.1080.913/0.1257±1

Табл. 5. Сравнение методов сверхразрешения реального времени с 95% доверительными интервалами на треке увеличения 4×. Наилучшие результаты выделены полужирным, вторые лучшие –подчеркиванием. «T» обозначает дообучение на StreamSR. «Subj.» обозначает субъективные оценки по Брэдли-Терри.

StreamSRДругие бенчмарки
МодельSubj.PSNRLPIPSCLIP-IQABSD100Urban100DIV2KFPS
SSIM/LPIPS
AsConvSRТ1.32±0.1432.6±0.150.382±0.0080.38±0.020.433/0.5860.500/0.5120.701/0.471213±8
RT4KSR1.40±0.1432.65±0.160.382±0.0090.36±0.02---102±5
RT4KSRТ1.45±0.1432.65±0.140.382±0.0030.39±0.020.409/0.5750.489/0.5210.696/0.489102±5
bicubic1.49±0.1332.8±0.210.240±0.0050.40±0.0240.423/0.5890.493/0.5890.562/0.4841829±50
ESPCN1.52±0.1132.04±0.180.276±0.0040.41±0.020.434/0.6710.432/0.5970.539/0.572201±7
ESPCNТ1.96±0.1532.08±0.150.215±0.0030.44±0.020.442/0.6620.452/0.5850.551/0.557201±7
Bicubic++Т1.86±0.1333.12±0.150.265±0.0040.39±0.02---1629±45
NVIDIA VSR2.31±0.1233.55±0.130.207±0.0030.47±0.02---52±3
XLSRТ2.17±0.1233.44±0.120.263±0.0100.43±0.020.659/0.4500.672/0.3410.759/0.339429±15
SMFANetT2.02±0.1433.06±0.140.183±0.0070.43±0.020.612/0.4820.608/0.4500.722/0.380327±12
SAFMNТ1.95±0.1533.38±0.150.199±0.0060.42±0.020.632/0.4680.632/0.4340.736/0.372273±10
RLFN2.24±0.1634.42±0.150.247±0.0040.42±0.020.603/0.4920.597/0.4600.721/0.386225±8
RLFNТ4.32±0.1333.82±0.120.182±0.0030.51±0.020.674/0.4450.688/0.3360.774/0.334225±8
SPAN1.87±0.1532.47±0.120.377±0.0030.46±0.020.632/0.4810.639/0.3690.739/0.34160±3
SPANТ3.14±0.1233.51±0.120.206±0.0030.49±0.020.649/0.4830.650/0.4060.750/0.37560±3
EfRLFNТ4.52±0.1334.55±0.110.173±0.0030.58±0.020.682/0.4290.699/0.3270.778/0.331271±10

Табл. 6. Исследование функций активации и модулей внимания для EfRLFN. Наилучшие результаты выделены полужирным. S(x) обозначает сигмоиду.

КомпонентыМетрики
АктивацияВниманиеSSIM LPIPS FPS Параметры
tanhECA0.8650.1733140.37M
tanhESA0.8630.1712340.4M
S(x)-0.5ECA0.8560.1793050.37M
S(x)-0.5ESA0.8520.1812370.4M
ReLUECA0.8470.1843030.37M
ReLUESA0.8490.1822350.4M

Рис. 10. Соотношение между пользовательской оценкой предпочтения и скоростью работы для различных моделей сверхразрешения. Все модели увеличивают разрешение в 2× раза. Синей линией обозначен Парето-оптимальный фронт. Модели, достигающие производительности реального времени, выделены зелёным цветом, тогда как более медленные модели – красным. Знаком “×” отмечены модели, дообученные на наборе данных StreamSR.

Рис. 10. Соотношение между пользовательской оценкой предпочтения и скоростью работы для различных моделей сверхразрешения. Все модели увеличивают разрешение в 2× раза. Синей линией обозначен Парето-оптимальный фронт. Модели, достигающие производительности реального времени, выделены зелёным цветом, тогда как более медленные модели – красным. Знаком “×” отмечены модели, дообученные на наборе данных StreamSR.

6. Заключение

Проведённое исследование продвигает область SR реального времени за счёт введения комплексного многомасштабного набора данных из 5,200 сжатых видео, специально разработанного для потоковых приложений. На этом наборе данных проведено систематическое тестирование 11 моделей SR, каждая из которых была предобучена на тренировочной части. Данные субъективных оценок качества работы моделей SR могут служить ценным материалом для обучения методов оценки качества видео.

Кроме того, разработана эффективная модель EfRLFN, содержащая новые архитектурные решения. Предложена стратегией обучения на основе составной функции потерь, демонстрирующая лучшую сходимость. Расширенная оценка демонстрирует превосходное качество EfRLFN и практическое повышение эффективности по сравнению с существующими методами.

Данная работа предоставляет основу для развития исследований в области сверхразрешения реального времени. Опубликованные ресурсы, включая данные субъективных оценок, открывают возможности для будущих работ как в области сверхразрешения, так и в области субъективной оценки качества.

Код и веса разработанных моделей, а также видео из собранного набора данных опубликованы [43].

Список литературы

  1. Grand View Research. Video Streaming Market Size & Share Industry Report, 2030. Available at: https://www.grandviewresearch.com/industry-analysis/video-streaming-market, 2025, accessed 08.11.2025.
  2. Bogatyrev E., Molodetskikh I., Vatolin D.S. SR+Codec: a Benchmark of Super-Resolution for Video Compression Bitrate Reduction. 35th British Machine Vision Conference 2024, BMVC 2024, Glasgow, UK, November 25-28, 2024. BMVA, 2024. ↩1 ↩2 ↩3 ↩4 ↩5
  3. Li Y. et al. Comisr: Compression-informed video super-resolution. Proceedings of the IEEE/CVF International Conference on Computer Vision, 2021, pp. 2543-2552. ↩1 ↩2
  4. Conde M.V. et al. Efficient Deep Models for Real-Time 4K Image Super-Resolution. NTIRE 2023 Benchmark and Report. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2023, pp. 1495-1521. ↩1 ↩2
  5. Ren B. et al. The ninth NTIRE 2024 efficient super-resolution challenge report. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 6595-6631. ↩1 ↩2
  6. Agustsson E., Timofte R. NTIRE 2017 Challenge on Single Image Super-Resolution: Dataset and Study. The IEEE Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2017. ↩1 ↩2 ↩3
  7. Xue T. et al. Video enhancement with task-oriented flow. International Journal of Computer Vision. Springer, 2019, vol. 127, issue 8, pp. 1106-1125. ↩1 ↩2
  8. Choi B. Pixel Perfect: RTX Video Super Resolution Now Available for GeForce RTX 40 and 30 Series GPUs. Available at: https://blogs.nvidia.com/blog/rtx-video-super-resolution/, 2023, accessed 08.11.2025. ↩1 ↩2
  9. Wan C. et al. Swift parameter-free attention network for efficient super-resolution. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 6246-6256. ↩1 ↩2 ↩3 ↩4 ↩5
  10. Kong F. et al. Residual local feature network for efficient super-resolution. Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, 2022, pp. 766-776. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6
  11. Bilecen B.B., Ayazoglu M. Bicubic++: Slim, slimmer, slimmest-designing an industry-grade super-resolution network. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 1623-1632. ↩1 ↩2 ↩3
  12. Guo J. et al. Asconvsr: Fast and lightweight super-resolution network with assembled convolutions. Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, 2023, pp. 1582-1592. ↩1 ↩2
  13. Zamfir E., Conde M.V., Timofte R. Towards real-time 4k image super-resolution. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 1522-1532. ↩1 ↩2
  14. Zhang Z. et al. Tmp: Temporal motion propagation for online video super-resolution. IEEE Transactions on Image Processing. IEEE, 2024.
  15. Liang J. et al. Swinir: Image restoration using swin transformer. Proceedings of the IEEE/CVF international conference on computer vision, 2021, pp. 1833-1844.
  16. Zhang X., Zhang Y., Yu F. HiT-SR: Hierarchical transformer for efficient image super-resolution. European Conference on Computer Vision. Springer, 2025, pp. 483-500.
  17. Wang Y. et al. Compression-aware video super-resolution. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 2012-2021.
  18. Wang X. et al. Real-esrgan: Training real-world blind super-resolution with pure synthetic data. Proceedings of the IEEE/CVF international conference on computer vision, 2021, pp. 1905-1914.
  19. Wang Y., Inguva S., Adsumilli B. YouTube UGC dataset for video compression research. 2019 IEEE 21st International Workshop on Multimedia Signal Processing (MMSP). IEEE, 2019, pp. 1-5. ↩1 ↩2 ↩3
  20. Zeyde R., Elad M., Protter M. On single image scale-up using sparse-representations. Curves and Surfaces: 7th International Conference, Avignon, France, June 24-30, 2010, Revised Selected Papers 7. Springer, 2012, pp. 711-730. ↩1 ↩2
  21. Silva A. BSD100 dataset. Available at: https://www.kaggle.com/datasets/asilva1691/bsd100, 2001, accessed 08.11.2025. ↩1 ↩2
  22. Huang J.-B., Singh A., Ahuja N. Single image super-resolution from transformed self-exemplars. Proceedings of the IEEE conference on computer vision and pattern recognition, 2015, pp. 5197-5206. ↩1 ↩2
  23. Nah S. et al. Ntire 2019 challenge on video deblurring and super-resolution: Dataset and study. Proceedings of the IEEE/CVF conference on computer vision and pattern recognition workshops, 2019, pp. 1-10. ↩1 ↩2
  24. Achiam J. et al. Gpt-4 technical report. arXiv preprint. Available at: https://arxiv.org/abs/2303.08774, accessed 08.11.2025.
  25. Li D., Jiang T., Jiang M. Unified quality assessment of in-the-wild videos with mixed datasets training. International Journal of Computer Vision. Springer, 2021, vol. 129, issue 4, pp. 1238-1257. ↩1 ↩2 ↩3
  26. Zhai X. et al. Sigmoid loss for language image pre-training. Proceedings of the IEEE/CVF International Conference on Computer Vision, 2023, pp. 11975-11986.
  27. Talab M.A., Awang S., Najim S.A.M. Super-low resolution face recognition using integrated efficient sub-pixel convolutional neural network (ESPCN) and convolutional neural network (CNN). 2019 IEEE international conference on automatic control and intelligent systems (I2CACIS). IEEE, 2019, pp. 331-335. ↩1 ↩2
  28. Zheng M. et al. SMFANet: A Lightweight Self-Modulation Feature Aggregation Network for Efficient Image Super-Resolution. ECCV. 2024. ↩1 ↩2
  29. Ayazoglu M. Extremely lightweight quantization robust real-time single-image super resolution for mobile devices. Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, 2021, pp. 2472–2479.
  30. Sun L. et al. Spatially-Adaptive Feature Modulation for Efficient Image Super-Resolution. ICCV. 2023.
  31. Wang Z. et al. Image quality assessment: from error visibility to structural similarity. IEEE transactions on image processing. IEEE, 2004, vol. 13, issue 4, pp. 600-612.
  32. Zhang R. et al. The unreasonable effectiveness of deep features as a perceptual metric. Proceedings of the IEEE conference on computer vision and pattern recognition, 2018, pp. 586-595. ↩1 ↩2
  33. Ke J. et al. Musiq: Multi-scale image quality transformer. Proceedings of the IEEE/CVF international conference on computer vision, 2021, pp. 5148–5157.
  34. Wang J., Chan K.C., Loy C.C. Exploring clip for assessing the look and feel of images. Proceedings of the AAAI conference on artificial intelligence. 2023, vol. 37, pp. 2555-2563.
  35. Huynh-Thu Q., Ghanbari M. Scope of validity of PSNR in image/video quality assessment. Electronics letters. IET, 2008, vol. 44, no. 13, pp. 800–801.
  36. Subjectify.us: Crowd-sourced subjective quality evaluation platform, 2025. Available at: https://subjectify.us/, accessed 08.11.2025.
  37. Bradley R.A., Terry M.E. Rank analysis of incomplete block designs: I. The method of paired comparisons. Biometrika. JSTOR, 1952, vol. 39, issue 3/4, pp. 324-345. ↩1 ↩2
  38. Fleiss, J. L. Measuring nominal scale agreement among many raters. Psychological bulletin 76.5, 1971, p. 378.
  39. Clevert D.-A., Unterthiner T., Hochreiter S. Fast and accurate deep network learning by exponential linear units (elus). arXiv preprint, 2015. Available at: https://arxiv.org/abs/1511.07289v5, accessed 08.11.2025. vol. 4, issue 5. p. 11.
  40. Isola P. et al. Image-to-image translation with conditional adversarial networks. Proceedings of the IEEE conference on computer vision and pattern recognition, 2017, pp. 1125-1134.
  41. Wang X. et al. Esrgan: Enhanced super-resolution generative adversarial networks. Proceedings of the European conference on computer vision (ECCV) workshops, 2018, pp. 1-16.
  42. Simonyan K., Zisserman A. Very deep convolutional networks for large-scale image recognition. arXiv preprint, 2014. Available at: https://arxiv.org/abs/1409.1556, accessed 08.11.2025.
  43. EfRLFN real-time Super-Resolution. Available at: https://github.com/EvgeneyBogatyrev/EfRLFN, accessed 08.11.2025.

Информация об авторах

Евгений Николаевич БОГАТЫРЕВ получил степень бакалавра по прикладной математике и информатике в Московском государственном университете имени М. В. Ломоносова в 2023 году. В настоящее время является студентом магистратуры в лаборатории компьютерной графики и мультимедиа МГУ. В область его научных интересов входят суперразрешение, оценка качества видео, методы сжатия видео и мультимодальное видео-языковое моделирование.

Иван Андреевич МОЛОДЕЦКИХ окончил аспирантуру по специальности математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей в Московском государственном университете имени М. В. Ломоносова в 2024 году. В настоящее время работает над диссертацией и является научным сотрудником в центре искусственного интеллекта МГУ, лаборатории компьютерной графики и мультимедиа. В область его научных интересов входят суперразрешение, семантическое матирование видео и машинное обучение. Иван курировал разработку бенчмарка методов суперразрешения для улучшения качества видео и был одним из организаторов соревнований по оценке качества суперразрешения видео на ECCV-AIM 2024 и ICCV-AIM 2025.

Халед Набиль АБУД получил степень бакалавра компьютерных наук в Московском государственном университете имени М. В. Ломоносова в 2024 году. В настоящее время продолжает обучение в магистратуре МГУ в Лаборатории компьютерной графики и мультимедиа. Его научные интересы включают обработку изображений, оценку качества изображений и видео, состязательное машинное обучение и глубокое обучение. Халед также является одним из ключевых участников проекта «Доверенный ИИ» ИСП РАН, занимаясь анализом устойчивости методов оценки качества изображений и нейросетевых кодеков сжатия изображений к состязательным атакам.

Дмитрий Сергеевич ВАТОЛИН закончил ВМК МГУ в 1996, защитил диссертацию в 2000, кандидат физико-математических наук, заведующий лабораторией компьютерной графики ВМК МГУ. Специализируется на исследованиях в области алгоритмов сжатия видео, современных методах измерения качества и обработке цифрового видео. Читает курсы по компьютерной графике и методам сжатия и обработки видео с 1997 года. Создатель популярных сайтов, посвященных алгоритмам обработки и сжатия видео.

Связь с редакцией