DOI: 10.15514/ISPRAS-2026-38(1)-15
1 Е.Н. Богатырев, ORCID: 0000-0002-6173-3561 <evgeney.bogatyrev@graphics.cs.msu.ru>
1,2 И.А. Молодецких, ORCID: 0000-0002-8294-0770 <ivan.molodetskikh@graphics.cs.msu.ru>
1,2,3 Х.Н. Абуд, ORCID: 0009-0009-7131-5839 <khaled.abud@graphics.cs.msu.ru>
1,2,3,4 Д.С. Ватолин, ORCID: 0000-0002-8893-9340 <dm.vatolin@ispras.ru>
1 Московский государственный университет имени М.В. Ломоносова,
Россия, 119991, Москва, Ленинские горы, д. 1.
2 Центр искусственного интеллекта МГУ,
Россия, 119991, г. Москва, Ленинские горы, ГСП-1
3 Институт перспективных исследований проблем
искусственного интеллекта и интеллектуальных систем МГУ имени М.В. Ломоносова,
Россия, 119192, г. Москва, Ломоносовский проспект, 27, корп. 1.
4 Институт системного программирования им. В.П. Иванникова РАН,
Россия, 109004, г. Москва, ул. А. Солженицына, д. 25.
Аннотация. Современные модели сверхразрешения (SR) реального времени плохо справляются с особенностями сжатого видео. Часто используемые наборы данных не отражают в полной мере характеристики стримингового контента, что снижает релевантность существующих бенчмарков. Авторами предложен новый набор данных StreamSR, собранный из видеороликов с платформы YouTube и охватывающий широкий спектр жанров и разрешений видео, характерных для реальных сценариев. Протестировано 11 современных моделей сверхразрешения, работающих в реальном времени, оценена их эффективность для задач стримингового вещания. В работе демонстрируется, что дообучение других моделей на представленном наборе данных приводит к значительному повышению качества, которое хорошо обобщается на стандартные бенчмарки. Предлагается EfRLFN – эффективная модель сверхразрешения, в которую интегрированы Efficient Channel Attention и гиперболический тангенс в качестве функции активации, что является новым решением в контексте сверхразрешения в реальном времени. Архитектура оптимизирована для максимизации эффективности, также разработана составная функция потерь, улучшающая сходимость обучения. EfRLFN объединяет преимущества существующих архитектур, одновременно улучшая как визуальное качество, так и производительность.
Ключевые слова: сверхразрешение; видео; набор данных; кодирование видео; оценка качества видео.
Для цитирования: Богатырев Е.Н., Молодецких И.А., Абуд Х.Н., Ватолин Д.С. Сбор данных для обучения и тестирования моделей сверхразрешения, работающих в реальном времени. Труды ИСП РАН, том 38, вып. 1, 2026 г., стр. 221–240. DOI: 10.15514/ISPRAS-2026-38(1)-15.
Благодарности: Работа выполнена при финансовой поддержке Министерства экономического развития Российской Федерации (соглашение № 139-15-2025-012 от 20.06.2025). Работа выполнялась с использованием суперкомпьютера «МГУ-270» МГУ имени М.В. Ломоносова.
В последние годы наблюдается необходимость в высококачественном стримминге видео, обусловленная широким распространением таких платформ, как YouTube, Twitch и Netflix [1]. Из-за ограничений пропускной способности сети потоковые сервисы часто сжимают видеоконтент, что может приводить к появлению визуальных искажений, таких как блочность, размытие и потеря мелких деталей. Несмотря на то, что существуют технологии, позволяющие повышать разрешение видео в реальном времени, такие методы часто не справляются с уникальными искажениями, создающимися после сильного сжатия видео [2].
Проведённый анализ показывает, что существует ограниченное число методологий SR (Super-Resolution, сверхразрешение), способных эффективно увеличивать разрешение сжатых видео [3]. Кроме того, отмечается заметный дефицит моделей сверхразрешения, способных работать в реальном времени. Соревнования NTIRE [4, 5] сыграли ключевую роль в продвижении разработки моделей SR реального времени, способствуя значительному прогрессу в этой области. Однако следует отметить, что многие из этих моделей SR обучались только на наборах данных, таких как DIV2K [6] или Vimeo90K [7], которые не покрывают сценарии работы со сжатым видео.
Недавно был представлен и популяризирован метод Video Super-Resolution от NVIDIA (NVIDIA VSR) [8] – это основанный на машинном обучении метод SR, интегрированный в драйвер GPU. Однако, несмотря на свою эффективность, NVIDIA VSR часто не восстанавливает мелкие текстуры и вносит чрезмерное сглаживание, что ограничивает его практическую пользу, как проиллюстрировано на рис. 1. Аналогично, другие современные методы SR реального времени, такие как SPAN [9] и RLFN [10], показывают высокие результаты на стандартных наборах данных, но не оптимизированы для сложностей, появляющихся при сжатии видео [2].

Рис. 1. Примеры искажений, создаваемых NVIDIA VSR, в сравнении с бикубической интерполяцией (bicubic). Первая и вторая пара изображений показывают разницу в цвете. Третья пара показывает, как NVIDIA VSR сильно сглаживает текстуры.
Для решения указанных проблем в данной работе представлен набор данных StreamSR, содержащий 5,200 видеороликов с видеохостинга YouTube (в сумме более 10 млн отдельных кадров), охватывающих различные жанры и соотношения сторон. Этот набор данных является надежным бенчмарком для оценки методов SR в условиях потоковой передачи. Кроме того, разработана модель Efficient Residual Lightweight Feature Network (EfRLFN). Данная модель адаптирована для применений в реальном времени и демонстрирует значительное улучшение как объективных, так и субъективных метрик качества видео.
Основные вклады работы заключаются в следующем.
Современные модели SR реального времени достигают различного соотношения между качеством реконструкции и вычислительной эффективностью за счёт инновационных архитектурных решений.
Среди моделей, способных работать в реальном времени, метод Bicubic++ [11] сочетает быстрое обратимое извлечение признаков с глобальным структурированным прореживанием сверточных слоев, достигая скорости обработки, сравнимой с традиционной бикубической интерполяцией. Метод AsConvSR [12] вводит динамические свертки, которые адаптируют свои ядра на основе характеристик входных данных. Данная модель оптимизирована для мобильных устройств. Для увеличения разрешения до высоких значений метод RT4KSR [13] использует перестановку пикселей и структурную репараметризацию блоков NAFNet для эффективного повышения разрешения с 720p/1080p до 4K. Архитектура метода SPAN [9] характеризуется механизмом внимания с симметричными активациями для усиления важных признаков и подавления избыточных. Это уменьшает вычислительные затраты на 40% по сравнению с традиционными модулями внимания. Аналогично, метод RLFN [10] реализует упрощенную трехслойную сверточную структуру, достигая повышения разрешения с 1080p до 4K менее, чем за 15 мс, при сохранении сильной агрегации признаков. Метод TMP [14] улучшает повышение разрешения видео за счёт минимизации вычислительной избыточности в оценке движения.
В дополнение к легковесным методам реального времени, трансформерные модели, такие как SwinIR [15] и HiT-SR [16], достигают превосходного качества за счёт механизмов самовнимания и иерархической многомасштабной обработки. Существуют и другие подходы к задаче SR, такие как COMISR [3] и CAVSR [17], которые специализируются на увеличении разрешения сжатого видео. Метод Real-ESRGAN [18] является популярным генеративным методом, который использует моделирование деградации высокого порядка для симуляции реальных искажений. Хотя эти методы демонстрируют превосходные результаты по сравнению с моделями SR реального времени, они являются вычислительно затратными, что делает их непригодными для приложений реального времени.
Несмотря на то, что все эти модели продемонстрировали различную степень успеха в улучшении качества изображений, проблемы со сверхразрешением сжатого видеоконтента остаются актуальными. Данная работа строится на этих фундаментальных исследованиях с целью создания наиболее подходящей модели SR для использования в реальном времени.
Наборы данных играют ключевую роль в обучении и оценке моделей SR. DIV2K [6] и Vimeo90K [7] широко используются для тестирования, так как содержат эталонные изображения высокого разрешения. Однако этим наборам данных не хватает примеров с артефактами сжатия, характерными для потокового контента. Аналогично, набор данных YouTube UGC [19] содержит разнообразные видео, но не фокусируется на сценариях, релевантных для SR в реальном времени. Для оценки качества SR также широко используются наборы данных Set14 [20], BSD100 [21] и Urban100 [22], содержащие естественные и структурированные изображения с фиксированным масштабом. Для задач видео-SR набор данных REDS [23] предоставляет динамические сцены с размытием движения и артефактами сжатия, что делает его подходящим для обучения и тестирования сложных архитектур SR.
Соревнование NTIRE 2023 Real-Time SR Challenge [4] было сфокусировано на разработке методов сверхразрешения, способных работать в реальном времени при сохранении высокого качества изображения. Перед участниками стояла задача разработки архитектуры, балансирующей вычислительную эффективность и производительность. Среди лидирующих решений присутствовали модели, использующие продвинутые методы прореживания и стратегии квантования для уменьшения размера модели без потери качества выходных данных. Также применялись методы дистилляции знаний для переноса представлений из больших моделей в меньшие и более эффективные сети, что обеспечивало обработку в реальном времени для таких приложений, как потоковое вещание и видеоконференции.
Продолжая фокус предыдущего года, Соревнование NTIRE 2024 Efficient SR Challenge [5] акцентировало внимание на эффективных моделях SR, способных обеспечивать высококачественные результаты при минимизации потребления ресурсов. Участники исследовали различные стратегии, включая использование трансформерных архитектур, которые адаптивно распределяют вычислительные ресурсы на основе характеристик входных данных. Кроме того, наблюдался повышенный интерес к методам, использующим обучение под несколько задач, где модели обучались не только для сверхразрешения, но и для таких задач, как шумоподавление и удаление блочности, повышая общую эффективность обработки сжатого видеоконтента. Несколько подходов интегрировали механизмы внимания для фокусировки на критически важных областях изображения, улучшая как скорость, так и качество процесса увеличения разрешения.
На основе описанных выше соревнований было разработано много качественных методов SR реального времени. Однако тренировочные наборы данных в этих соревнованиях не содержат сжатых видео, из-за чего обученные на них модели SR не приспособлены к работе с потоковым контентом.
В данном разделе описывается методология, использованная для сбора видео в наборе данных StreamSR и их последующей категоризации.
Получение видео. Для генерации поисковых запросов для сбора видео использовалась большая языковая модель (GPT-4o) [24]. Исходя из 20 различных категорий YouTube (например, путешествия, образование, игры), GPT-4o генерировала 100 разнообразных поисковых запросов для каждой категории. Затем загружались топ-100 видео для каждого запроса. Список некоторых тем и примеры сгенерированных запросов приведены в табл. 1.
Фильтрация. Из всех видео рассматривались только видео с лицензией Creative Commons (CC BY 4.0) с доступными разрешениями 360p, 720p и 1440p. Для обеспечения точного выравнивания кадров требовалось постоянное значение частоты кадров, которое проверялось автоматически. Разрешения были выбраны для поддержки двух треков бенчмарка SR: 2 (720p→1440p) и 4 (360p→1440p). Для каждого разрешения выбирался поток с наивысшим битрейтом для обеспечения оптимального качества эталонного высококачественного потока. Из каждого видео извлекались первые 30 секунд (2,000 кадров). Видео с длинными статичными заставками отфильтровывались путем сравнения -ого, -ого и -ого кадра видео. Видео отбраковывались, если среднее значение метрики PSNR (peak signal-to-noise ratio, пиковое отношение сигнала к шуму) между этими кадрами превышал 40 дБ. В результате был получен набор из 5,200 видео, который был назван набором данных StreamSR.
Категоризация. Для построения разнообразного и репрезентативного тестового набора видео были кластеризованы с использованием признаков SI, TI [19], битрейта, MDTVSFA [25] и текстовых эмбеддингов поисковых запросов, посчитанных с помощью SigLIP [26]. Эмбеддинги SigLIP проецировались в 3-мерное пространство с помощью метода главных компонент для снижения размерности. Все признаки были нормализованы до нулевого среднего и единичной дисперсии. Кластеризация выполнялась алгоритмом K-средних (K-Means) с использованием евклидовой метрики расстояния. Количество кластеров K=20 было выбрано эмпирически на основе анализа метода локтя (elbow method), который показал, что это значение обеспечивает хороший компромисс между внутрикластерной схожестью и разнообразием набора данных. Из каждого из 20 полученных кластеров для формирования фиксированного тестового набора выбиралось одно видео, наиболее близкое к центроиду. Остальные видео случайным образом разделялись на обучающий и валидационный наборы в соотношении 10:1, сохраняя пропорции кластеров для предотвращения смещения распределения.
Табл. 1. Запросы для скачивания видео, сгенерированные с помощью LLM. В каждой ячейке представлено название категории и соответствующие ей запросы.
| Спорт | Животные | Активность |
|---|---|---|
| "highlights of football" "sports slow motion" "extreme sports action" "basketball dunks" "soccer goals" | "wildlife documentary" "cute animal videos" "slow motion animals" "pets playing" "nature interactions" | "people dancing" "cooking tutorials" "fitness workouts" "street performers" "DIY projects" |
| Искусство | Съемка вблизи | История |
| "time-lapse painting" "sculpting techniques" "DIY crafts" "artistic creations" "watercolor tutorial" | "macro insects" "close-up flowers" "macro techniques" "tiny world" "everyday objects" | "historical footage" "old documentaries" "historical events" "classic film clips" "moon landing" |
| Анимация | Наука | Природа |
| "animation films" "animated scenes" "cartoon clips" "stop motion" "3D animation" | "science experiments" "physics demos" "chemical reactions" "biology explained" "science phenomena" | "nature landscapes" "time-lapse nature" "ocean waves" "forest scenery" "mountain views" |
В табл. 2 проводится сравнение набора данных StreamSR с существующими наборами пользовательского контента. В отличие от наборов данных для классификации (YouTube-8M, Kinetics) или сегментации (YouTube-VOS), набор StreamSR разработан для задачи SR, предоставляя выровненные видео с разрешением от 360p до 1440p и с треками увеличения 2× и 4×. Благодаря более длинным клипам (25-30с), видео с различными разрешениями и естественными артефактами сжатия, а также более широкому диапазону качества, он лучше представляет реальные сценарии потоковой передачи по сравнению с предыдущими наборами данных SR (REDS, Vimeo-90K).
Рис. 2 показывает распределение признаков видео в собранном наборе данных и в других. Из графиков видно, что видео в собранном наборе данных покрывают широкий спектр значений по каждому из признаков, однако содержатся в отдельном кластере стриминговых видео.
Табл. 2. Сравнение наборов данных пользовательского видео. Диапазон качества показывает 5-й и 95-й процентили метрики MDTVSFA [25]. Длительность показывает типичную длительность видеоклипа.
| Набор данных | Год | Разрешения | Диапазон качества | Применение | Длительность |
|---|---|---|---|---|---|
| YouTube-8M | 2016 | 240p–1080p | 0.45–0.58 | Классификация | 5 мин |
| Kinetics-400 | 2017 | 1080p | 0.48–0.59 | Распознавание действий | 12 сек |
| Kinetics-700 | 2019 | 1080p | 0.47–0.58 | Распознавание действий | 12 сек |
| YouTube-VOS | 2018 | 360p–1080p | 0.46–0.57 | Сегментация объектов | 25 сек |
| YouTube-BB | 2017 | 1080p | 0.50–0.60 | Отслеживание объектов | 12 сек |
| YT-Temporal 180M | 2020 | 144p–1080p | 0.42–0.56 | Языковое предобучение | 7 сек |
| DIV2K | 2017 | 2K | 0.55–0.65 | Сверхразрешение изображений | |
| REDS | 2019 | 360p–720p | 0.50–0.60 | Сверхразрешение видео | 5 сек |
| Vimeo-90K | 2019 | 448p | 0.48–0.58 | Сверхразрешение видео | 1 сек |
| UDM10 | 2019 | 540p–4K | 0.45–0.58 | Сверхразрешение изображений | |
| RealSR | 2019 | 4K | 0.43-0.59 | Сверхразрешение изображений | |
| VideoLQ | 2021 | 270p–1080p | 0.43–0.54 | Сверхразрешение видео | 10 сек |
| StreamSR | 2025 | 360p–1440p | 0.41–0.61 | Сверхразрешение | 30 сек |
![Рис. 2. Распределение пространственной и временной сложности [19] и MDTVSFA [25] для видео из разных наборов данных.](images/figure-03.png)
Рис. 2. Распределение пространственной и временной сложности [19] и MDTVSFA [25] для видео из разных наборов данных.
Для дообучения и тестирования был выбран широкий список моделей SR на основе результатов соревнований NTIRE за последние годы, включающий как классические подходы, такие как бикубическая интерполяция, Bicubic++ [11] и ESPCN [27], так и современные методы, такие как SMFANet [28], RLFN [10] и SPAN [9]. В сравнение также была включена проприетарная модель NVIDIA VSR. В табл. 3 собрана информация о тестируемых моделях.
Для обеспечения справедливого сравнения каждой модели все тестируемые модели предварительно обучались на тренировочной части StreamSR, а результаты оценивались как для дообученных, так и для стандартных моделей. Если для модели не существовало предварительно обученных весов для конкретного коэффициента увеличения (2 или 4), она обучалась с нуля, и использовалась только обученная версия. Каждая модель была обучена в течение 500 эпох, используя процесс обучения, описанный в оригинальной статье. Все модели оценивались на видео разрешения 720p с увеличением разрешения в 2 до 1440p. Для измерений FPS каждая модель запускалась на видеокарте NVIDIA GeForce RTX 2080, и время выполнения рассчитывалось на одном и том же тестовом фрагменте из 100 кадров, усредненное по 3 последовательным запускам.
Табл. 3. Характеристики использованных моделей сверхразрешения реального времени.
| Метод | Параметры (М) | FLOPs (Гб) | Увеличение | Тип архитектуры |
|---|---|---|---|---|
| ESPCN [27] | 0.04 | 2.43 | 2,3,4 | Sub-pixel CNN |
| XLSR [29] | 0.03 | 1.81 | 4 | CNN |
| RLFN [10] | 0.40 | 136 | 2,4 | CNN+Attention |
| AsConvSR [12] | 2.35 | 9 | 2 | Assembled Convolution |
| Bicubic++ [11] | 0.05 | 0.83 | 3 | CNN |
| NVIDIA VSR [8] | - | - | 2,3,4 | CNN+Attention |
| RT4KSR [13] | 0.05 | 172 | 2 | CNN+Attention |
| SAFMN [30] | 0.23 | 52 | 4 | CNN с модуляцией признаков |
| SMFANet [28] | 0.20 | 11 | 4 | CNN с модуляцией признаков |
| SPAN [9] | 0.43 | 28 | 2,4 | Беспараметровое внимание |
Для оценивания различных аспектов производительности алгоритмов SR был выбран разнообразный набор объективных метрик. PSNR и SSIM [31] служат фундаментальными мерами точности на уровне пикселей и структурного сходства. LPIPS [32], с другой стороны, выходит за рамки традиционных метрик и использует глубокие признаки для лучшего соответствия человеческому восприятию. Помимо метрик с эталоном (Full-Reference, FR), в сравнение также были включены метрики, не требующие эталона (No-Reference, NR). Они оценивают качество изображений после сверхразрешения без сравнения с реальными примерами высокого разрешения. В частности, были использованы две NR метрики: MUSIQ [33] – мощная трансформерная модель, превосходно справляющаяся с оценкой реального контента, и CLIP-IQA [34] – популярная модель на основе CLIP.
Для более точной оценки лучших моделей SR было проведено субъективное сравнение. Поскольку пользовательские исследования часто могут быть дорогостоящими, на предварительном этапе были исключены модели, показавшие низкое качество на основе объективных метрик. Для оценки и ранжирования качества различных моделей SR с субъективной точки зрения было проведено попарное краудсорсинговое сравнение с использованием сервиса Subjectify.us [36]. Сравнение включало 11 моделей SR (+ эталонное видео) и в общей сложности 660 пар видео.
Оценка была организована в виде двух отдельных треков: один сфокусирован на увеличении 2, другой – на увеличении 4. При попарном сравнении видео точность разметки выше, так как участники видят оба сравниваемых видео. Однако, учитывая ограниченное количество участников с разрешением экрана выше Full HD, было принято решение представлять каждое тестовое видео в виде центрального кадрирования в разрешении Full HD, причем видео показывались последовательно.
В ходе эксперимента участникам показывались пары видео, сгенерированные двумя случайно выбранными моделями SR. Им предлагалось выбрать видео с меньшим количеством визуальных искажений, а также была предоставлена возможность указать, что видео «неразличимы». Каждая пара видео оценивалась в общей сложности 30 участниками, при этом каждый участник оценивал 10 пар видео. Количество оценок на пару было определено на основе расчета статистической мощности, что обеспечивает достаточную точность для ранжирования моделей с использованием модели Брэдли-Терри [37] при ожидаемом уровне согласия между участниками.
Для обеспечения достоверности результатов среди 10 пар были включены два контрольных вопроса с предопределенными правильными ответами. Ответы участников, которые не ответили правильно на один или более контрольных вопросов, исключались из дальнейшего анализа. В субъективной оценке приняли участие 3 822 уникальных участника. Итоговые субъективные баллы были получены на основе 37 184 ответов с применением модели Брэдли-Терри [37]. Для количественной оценки надежности полученных субъективных данных был рассчитан коэффициент межэкспертной согласованности Флейса [38], который составил 0.65, что указывает на существенное согласие между участниками и подтверждает надежность собранных оценок.
На рис. 3 визуализирован интерфейс сервиса Subjectify.us, использованного для субъективного сравнения.

Рис. 3. Интерфейс платформы Subjectify.us.
Перед началом сравнения каждому участнику показывалась следующая инструкция:
«Вам будут показаны пары видео, демонстрируемые одно за другим. Для каждой пары выберите видео с лучшим визуальным качеством (более четкое, с меньшим количеством искажений, таких как размытие или пикселизация). Если видео выглядят одинаково, выберите «Неразличимы». Будьте внимательны – в тесте присутствуют контрольные вопросы. Неправильные ответы на контрольные вопросы приведут к отклонению ваших результатов».
На рис. 4 представлен анализ корреляции между объективными метриками качества видео и субъективными оценками людей. Результаты экспериментов демонстрируют, что четыре метрики – CLIP-IQA, ERQA, LPIPS и MUSIQ – показывают значимые корреляции с субъективными оценками качества.
Данные результаты согласуются с предыдущими исследованиями в трех ключевых аспектах. Во-первых, метрики, использующие глубокие признаки (LPIPS, MUSIQ), показывают лучшую согласованность с человеческим восприятием по сравнению с традиционными подходами. Во-вторых, ERQA показывает хорошие результаты в задаче оценки качества восстановления видео. В-третьих, слабая корреляция PSNR с человеческим восприятием, что согласуется с другими работами [2,35].
Табл. 3. Сравнение качества SPAN (Sigmoid – 0.5) и SPAN (tanh).
| Set14 | BSD100 | Urban100 | DIV2K | |
|---|---|---|---|---|
| Модель | SSIM/LPIPS | SSIM/LPIPS | SSIM/LPIPS | SSIM/LPIPS |
| SPAN (Sigmoid – 0.5) | 0.836 / 0.142 | 0.837 / 0.239 | 0.847 / 0.118 | 0.890 / 0.175 |
| SPAN () | 0.837 / 0.140 | 0.841 / 0.228 | 0.853 / 0.115 | 0.891 / 0.167 |

Рис. 4. Корреляция Пирсона между объективными метриками качества и субъективными оценками.
Основное изменение заключается в использовании гиперболического тангенса (tanh) в качестве функции активации. Данная модификация мотивирована исследованиями [9], демонстрирующими, что нечётные симметричные функции активации, такие как или гиперболический тангенс, сохраняют как величину, так и знак признаков. В отличие от функции активации ReLU, которая отбрасывает отрицательные активации, tanh обеспечивает более богатый поток градиентов и предотвращает потерю информации в картах внимания, что приводит к уточнению признаков. Эмпирические исследования демонстрируют, что активация на основе tanh может улучшить распространение градиента в глубоких сетях [39] и повысить производительность в задачах плотного предсказания [40, 41]. Проведенные эксперименты демонстрируют, что замена смещенной сигмоиды () на активацию гиперболическим тангенсом в архитектуре SPAN приводит к улучшениям по сравнению с оригинальной архитектурой. В табл. 3 проводится сравнение обоих вариантов на стандартных бенчмарках.
Предлагаемая модель Efficient Residual Local Feature Network (EfRLFN) улучшает архитектуру RLFN [10] за счёт целевых модификаций, направленных на повышение эффективности и качества реконструкции. На рис. 5 представлена общая архитектура модели. Архитектура состоит из блока извлечения признаков, основного модуля обработки признаков и блока реконструкции. В силу простоты и параметрической эффективности, блоки извлечения и реконструкции признаков были перенесены из оригинальной модели. Ключевые инновации предложенной модели сосредоточены в конструкции блока ERLFB и процедуре обучения.

Рис. 5. Архитектура предложенной модели EfRLFN. Основная часть состоит из 6 блоков ERLFB.
Блоки эффективных остаточных локальных признаков (ERLFB) заменяют оригинальные блоки RLFB в RLFN. По аналоги с архитектурой SPAN основное изменение заключается в использовании гиперболического тангенса (tanh) вместо ReLU в модулях уточнения.
Еще одной важной модификацией является механизм внимания, используемый для глобальной агрегации информации. В разработанной модели был использован механизм Efficient Channel Attention (ECA) вместо Enhanced Spatial Attention (ESA), используемый в RLFN. В то время как ESA использует многослойные сверточные группы для пространственного внимания, ECA использует облегченный механизм канального внимания на основе глобального усреднения (Global Average Pooling) и свертки . Данное изменение значительно сокращает вычислительные затраты при сохранении конкурентоспособной производительности, что подтверждается проведенными исследованиями.
Кроме того, архитектура ERLFB оптимизирована за счёт удаления избыточных соединений и упрощения этапа сглаживания признаков до одной свертки . Данная оптимизация уменьшает вычислительную фрагментацию, улучшая скорость вывода без ухудшения качества реконструкции.
Контрастная функция потерь, используемая в методе RLFN, эффективно выравнивает промежуточные признаки с помощью пар позитивных и негативных образцов. Однако она создает две практические проблемы: чувствительность к выбору слоев экстрактора признаков (для задач, ориентированных на PSNR, требуются поверхностные слои [10]), и увеличение вычислительных затрат из-за попарного сравнения признаков. В EfRLFN вводится составная функция потерь, разработанная для устранения ограничений контрастной потери RLFN с акцентом на структурную точность и сохранение границ. Функция потерь состоит из трех ключевых компонентов:
Функция потерь Charbonnier обеспечивает точность на уровне пикселей, одновременно обеспечивая устойчивость к выбросам и устраняя ограничение потерь L1/L2, используемых на ранних этапах обучения RLFN. Она гарантирует стабильные градиенты даже для больших невязок, что делает её особенно подходящей для задач сверхразрешения.
где обозначает эталонное изображение высокого разрешения, а обозначает выход модуля SR.
Перцептивная функция потерь на основе VGG использует глубокие признаки из предварительно обученной сети VGG-19 [42]. Данная функция потерь направляет модель к генерации реалистичных результатов.
где обозначает активации ReLU из слоя conv5_4 сети VGG-19.
Функция потерь Собеля оптимизирует резкость границ путем штрафования расхождений в картах градиентов между изображениями после сверхразрешения и исходными изображениями.
где применяет оператор Собеля для извлечения горизонтальных и вертикальных границ.
Данная функция потерь устраняет критический пробел в подходе RLFN, который полагается на неявное сохранение границ посредством контрастного обучения на поверхностных признаках. Путем прямого воздействия на качество границ, предложенная функция потерь обеспечивает более четкое восстановление для высокочастотных деталей. Пользовательские исследования подтверждают, что такие результаты соответствуют предпочтениям зрителей, достигая более высоких субъективных оценок [2,32].
При обучении EfRLFN были установлены коэффициенты , и для нормализации, адаптированные из работы [2].
В табл. 4 (слева) показано, что предложенная модель EfRLFN демонстрирует наилучшее качество на тестовой части StreamSR среди моделей реального времени. Увеличение качества хорошо обобщается для различных объективных метрик и дополнительно подтверждается пользовательским исследованием (рис. 6). Результаты также указывают на то, что модели SPAN, RLFN и ESPCN значительно улучшаются после дообучения на нашем наборе данных: наблюдается заметный положительный разрыв как в объективных, так и в субъективных оценках. После дообучения некоторые из этих моделей превосходят проприетарную модель NVIDIA VSR по пользовательским предпочтениям. Для сравнения также включены некоторые стандартные модели SR, не работающие в реальном времени.
Рис. 6 и 7 предоставляют визуальное сравнение между различными моделями, дополнительно демонстрируя эффективность EfRLFN в сверхразрешении реального времени. Визуальные сравнения ясно показывают преимущества EfRLFN: модель производит более четкие изображения с более точными деталями, в то время как конкурирующие модели часто не могут воспроизвести четкие границы и тонкие текстуры, что приводит к заметным артефактам или размытию в сложных областях.
На рис. 8 демонстрируются результаты попарного субъективного сравнения с другими моделями SR: очевидно, что пользователи в значительной степени предпочитают результаты EfRLFN другим методам. В частности, EfRLFN предпочтительнее NVIDIA VSR в 77.4% случаев. Единственные конкурентоспособные альтернативы (SPAN-tuned и RLFN-tuned) также обучены на тренировочном наборе StreamSR.

Рис. 6. Сравнение EfRLFN с несколькими 4 моделями реального времени.
![]() |
|---|
Рис. 7. Сравнение между несколькими 2 моделями реального времени.

Рис. 8. Предпочтение EfRLFN по сравнению с другими методами сверхразрешения реального времени на основе попарных субъективных оценок.
Была проведена валидация EfRLFN и других методов SR реального времени на пяти широко признанных наборах данных: Set14 [20], BSD100 [21], Urban100 [22], REDS [23] и валидационном наборе DIV2K [6]. Усредненные результаты метрик представлены в табл. 4 (справа). EfRLFN стабильно превосходит все конкурирующие подходы во всех оцененных сценариях, достигая наилучшего качества как для увеличения разрешения 2, так и 4.
Проведенные эксперименты показывают, что обучение на предложенном наборе данных приносит пользу не только EfRLFN, но и улучшает производительность других конкурирующих моделей, что подтверждается количественными результатами в табл. 4 и 5 и рис. 10. Это особенно заметно в случаях с SPAN и RLFN.
Анализ функций потерь. На рис. 9 иллюстрируется влияние различных функций потерь на производительность EfRLFN по метрике SSIM в процессе обучения на треке 4× предложенного набора данных. Комбинированная функция потерь (синяя линия) достигает наивысшего значения SSIM, равного 0.865. Это демонстрирует взаимодополняющие преимущества каждой функции потерь. Исключение любого компонента приводит к заметному снижению, особенно удаление потери Charbonnier или VGG, что значительно ухудшает сходимость SSIM. Более простые функции потерь, такие как , и LPIPS, показывают худшие результаты на протяжении всего обучения. Примечательно, что предложенный подход превосходит RLFN как по качеству, так и по эффективности обучения.
В отличие от RLFN, который использует двухэтапную процедуру обучения с потерями и контрастной потерей, наша сеть обучается в один этап, достигая превосходного визуального качества при сокращении времени обучения на 16%.
Анализ архитектуры: В табл. 6 представлено исследование функций активации и механизмов внимания в EfRLFN. Комбинация активации гиперболическим тангенсом и механизма внимания ECA демонстрирует наилучшее общее качество, достигая наивысшего SSIM и LPIPS и самой быстрой скорости работы с минимальным количеством параметров. Замена на смещенную сигмоиду заметно ухудшает SSIM и LPIPS для обоих вариантов внимания. Аналогично, использование более тяжелого блока внимания ESA приводит к снижению скорости работы и в лучшем случае к маргинальному улучшению LPIPS. Эти результаты указывают на то, что активация в паре с облегченным модулем ECA обеспечивает оптимальный баланс между качеством и эффективностью для сверхразрешения в реальном времени.

Рис. 9. Влияние функций потерь на обучение EfRLFN на треке предложенного набора данных. “Contrastive Loss” – оригинальная функция потерь модели RLFN.
Табл. 4. Сравнение методов сверхразрешения реального времени с 95% доверительными интервалами на треке увеличения 2. Наилучшие результаты выделены полужирным, вторые лучшие –подчеркиванием. «T» обозначает дообучение на StreamSR. «Subj.» обозначает субъективные
| StreamSR | Другие бенчмарки | |||||||
|---|---|---|---|---|---|---|---|---|
| Модель | Subj. | PSNR | LPIPS | CLIP-IQA | BSD100 | Urban100 | DIV2K | FPS |
| SSIM/LPIPS | ||||||||
| AsConvSRТ | 1.93±0.11 | 35.25±0.15 | 0.214±0.008 | 0.48±0.02 | 0.832/0.270 | 0.824/0.208 | 0.883/0.206 | 213±8 |
| RT4KSR | 2.40±0.12 | 36.45±0.16 | 0.213±0.009 | 0.49±0.02 | 0.805/0.296 | 0.769/0.244 | 0.860/0.221 | 102±5 |
| RT4KSRТ | 2.43±0.11 | 37.55±0.14 | 0.070±0.003 | 0.53±0.02 | 0.812/0.254 | 0.766/0.223 | 0.864/0.186 | 102±5 |
| bicubic | 2.44±0.14 | 30.32±0.21 | 0.076±0.005 | 0.44±0.03 | 0.752/0.386 | 0.711/0.324 | 0.820/0.292 | 1829±50 |
| ESPCN | 2.48±0.12 | 30.71±0.18 | 0.078±0.004 | 0.45±0.02 | 0.774/0.534 | 0.505/0.437 | 0.514/0.515 | 201±7 |
| ESPCNТ | 2.49±0.11 | 35.76±0.15 | 0.072±0.003 | 0.51±0.02 | 0.814/0.236 | 0.840/0.150 | 0.862/0.180 | 201±7 |
| Bicubic++Т | 2.44±0.13 | 36.79±0.15 | 0.087±0.004 | 0.52±0.02 | 0.768/0.360 | 0.725/0.298 | 0.832/0.270 | 1629±45 |
| NVIDIA VSR | 2.57±0.14 | 37.40±0.13 | 0.082±0.003 | 0.56±0.02 | 0.788/0.243 | 0.786/0.152 | 0.858/0.180 | 52±3 |
| XLSRТ | 2.56±0.12 | 37.25±0.14 | 0.230±0.010 | 0.47±0.02 | 0.817/0.244 | 0.828/0.158 | 0.864/0.183 | 429±15 |
| SMFANetТ | 2.37±0.14 | 37.14±0.15 | 0.158±0.007 | 0.51±0.02 | 0.803/0.239 | 0.798/0.153 | 0.865/0.177 | 327±12 |
| SAFMNТ | 2.26±0.15 | 37.09±0.15 | 0.122±0.006 | 0.53±0.02 | 0.813/0.236 | 0.808/0.150 | 0.871/0.175 | 273±10 |
| RLFN | 2.17±0.15 | 37.03±0.15 | 0.086±0.004 | 0.54±0.02 | 0.805/0.238 | 0.803/0.147 | 0.876/0.175 | 225±8 |
| RLFNТ | 2.69±0.13 | 37.63±0.12 | 0.072±0.003 | 0.58±0.02 | 0.834/0.239 | 0.845/0.153 | 0.881/0.178 | 225±8 |
| SPAN | 2.55±0.12 | 37.45±0.13 | 0.066±0.003 | 0.57±0.02 | 0.836/0.222 | 0.841/0.139 | 0.887/0.168 | 60±3 |
| SPANТ | 3.13±0.15 | 37.73±0.12 | 0.063±0.003 | 0.61±0.02 | 0.837/0.239 | 0.847/0.118 | 0.890/0.175 | 60±3 |
| EfRLFNТ | 3.33±0.14 | 37.85±0.11 | 0.059±0.003 | 0.65±0.02 | 0.847/0.190 | 0.856/0.116 | 0.892/0.145 | 271±10 |
| Модели SR, не предназначенные для работы в реальном времени | ||||||||
| Real-ESRGAN | 3.87±0.13 | 37.65±0.12 | 0.048±0.007 | 0.66±0.02 | 0.857/0.172 | 0.867/0.112 | 0.901/0.137 | 9±1 |
| BasicVSR++ | 4.87±0.13 | 38.05±0.13 | 0.037±0.007 | 0.70±0.02 | 0.860/0.158 | 0.868/0.110 | 0.907/0.131 | 15±1 |
| COMISR | 4.32±0.14 | 38.15±0.12 | 0.033±0.006 | 0.67±0.03 | 0.894/0.161 | 0.871/0.108 | 0.913/0.125 | 7±1 |
Табл. 5. Сравнение методов сверхразрешения реального времени с 95% доверительными интервалами на треке увеличения 4. Наилучшие результаты выделены полужирным, вторые лучшие –подчеркиванием. «T» обозначает дообучение на StreamSR. «Subj.» обозначает субъективные оценки по Брэдли-Терри.
| StreamSR | Другие бенчмарки | |||||||
|---|---|---|---|---|---|---|---|---|
| Модель | Subj. | PSNR | LPIPS | CLIP-IQA | BSD100 | Urban100 | DIV2K | FPS |
| SSIM/LPIPS | ||||||||
| AsConvSRТ | 1.32±0.14 | 32.6±0.15 | 0.382±0.008 | 0.38±0.02 | 0.433/0.586 | 0.500/0.512 | 0.701/0.471 | 213±8 |
| RT4KSR | 1.40±0.14 | 32.65±0.16 | 0.382±0.009 | 0.36±0.02 | - | - | - | 102±5 |
| RT4KSRТ | 1.45±0.14 | 32.65±0.14 | 0.382±0.003 | 0.39±0.02 | 0.409/0.575 | 0.489/0.521 | 0.696/0.489 | 102±5 |
| bicubic | 1.49±0.13 | 32.8±0.21 | 0.240±0.005 | 0.40±0.024 | 0.423/0.589 | 0.493/0.589 | 0.562/0.484 | 1829±50 |
| ESPCN | 1.52±0.11 | 32.04±0.18 | 0.276±0.004 | 0.41±0.02 | 0.434/0.671 | 0.432/0.597 | 0.539/0.572 | 201±7 |
| ESPCNТ | 1.96±0.15 | 32.08±0.15 | 0.215±0.003 | 0.44±0.02 | 0.442/0.662 | 0.452/0.585 | 0.551/0.557 | 201±7 |
| Bicubic++Т | 1.86±0.13 | 33.12±0.15 | 0.265±0.004 | 0.39±0.02 | - | - | - | 1629±45 |
| NVIDIA VSR | 2.31±0.12 | 33.55±0.13 | 0.207±0.003 | 0.47±0.02 | - | - | - | 52±3 |
| XLSRТ | 2.17±0.12 | 33.44±0.12 | 0.263±0.010 | 0.43±0.02 | 0.659/0.450 | 0.672/0.341 | 0.759/0.339 | 429±15 |
| SMFANet | 2.02±0.14 | 33.06±0.14 | 0.183±0.007 | 0.43±0.02 | 0.612/0.482 | 0.608/0.450 | 0.722/0.380 | 327±12 |
| SAFMNТ | 1.95±0.15 | 33.38±0.15 | 0.199±0.006 | 0.42±0.02 | 0.632/0.468 | 0.632/0.434 | 0.736/0.372 | 273±10 |
| RLFN | 2.24±0.16 | 34.42±0.15 | 0.247±0.004 | 0.42±0.02 | 0.603/0.492 | 0.597/0.460 | 0.721/0.386 | 225±8 |
| RLFNТ | 4.32±0.13 | 33.82±0.12 | 0.182±0.003 | 0.51±0.02 | 0.674/0.445 | 0.688/0.336 | 0.774/0.334 | 225±8 |
| SPAN | 1.87±0.15 | 32.47±0.12 | 0.377±0.003 | 0.46±0.02 | 0.632/0.481 | 0.639/0.369 | 0.739/0.341 | 60±3 |
| SPANТ | 3.14±0.12 | 33.51±0.12 | 0.206±0.003 | 0.49±0.02 | 0.649/0.483 | 0.650/0.406 | 0.750/0.375 | 60±3 |
| EfRLFNТ | 4.52±0.13 | 34.55±0.11 | 0.173±0.003 | 0.58±0.02 | 0.682/0.429 | 0.699/0.327 | 0.778/0.331 | 271±10 |
Табл. 6. Исследование функций активации и модулей внимания для EfRLFN. Наилучшие результаты выделены полужирным. S(x) обозначает сигмоиду.
| Компоненты | Метрики | ||||
|---|---|---|---|---|---|
| Активация | Внимание | SSIM | LPIPS | FPS | Параметры |
| ECA | 0.865 | 0.173 | 314 | 0.37M | |
| ESA | 0.863 | 0.171 | 234 | 0.4M | |
| ECA | 0.856 | 0.179 | 305 | 0.37M | |
| ESA | 0.852 | 0.181 | 237 | 0.4M | |
| ECA | 0.847 | 0.184 | 303 | 0.37M | |
| ESA | 0.849 | 0.182 | 235 | 0.4M | |

Рис. 10. Соотношение между пользовательской оценкой предпочтения и скоростью работы для различных моделей сверхразрешения. Все модели увеличивают разрешение в 2× раза. Синей линией обозначен Парето-оптимальный фронт. Модели, достигающие производительности реального времени, выделены зелёным цветом, тогда как более медленные модели – красным. Знаком “×” отмечены модели, дообученные на наборе данных StreamSR.
Проведённое исследование продвигает область SR реального времени за счёт введения комплексного многомасштабного набора данных из 5,200 сжатых видео, специально разработанного для потоковых приложений. На этом наборе данных проведено систематическое тестирование 11 моделей SR, каждая из которых была предобучена на тренировочной части. Данные субъективных оценок качества работы моделей SR могут служить ценным материалом для обучения методов оценки качества видео.
Кроме того, разработана эффективная модель EfRLFN, содержащая новые архитектурные решения. Предложена стратегией обучения на основе составной функции потерь, демонстрирующая лучшую сходимость. Расширенная оценка демонстрирует превосходное качество EfRLFN и практическое повышение эффективности по сравнению с существующими методами.
Данная работа предоставляет основу для развития исследований в области сверхразрешения реального времени. Опубликованные ресурсы, включая данные субъективных оценок, открывают возможности для будущих работ как в области сверхразрешения, так и в области субъективной оценки качества.
Код и веса разработанных моделей, а также видео из собранного набора данных опубликованы [43].
Евгений Николаевич БОГАТЫРЕВ получил степень бакалавра по прикладной математике и информатике в Московском государственном университете имени М. В. Ломоносова в 2023 году. В настоящее время является студентом магистратуры в лаборатории компьютерной графики и мультимедиа МГУ. В область его научных интересов входят суперразрешение, оценка качества видео, методы сжатия видео и мультимодальное видео-языковое моделирование.
Иван Андреевич МОЛОДЕЦКИХ окончил аспирантуру по специальности математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей в Московском государственном университете имени М. В. Ломоносова в 2024 году. В настоящее время работает над диссертацией и является научным сотрудником в центре искусственного интеллекта МГУ, лаборатории компьютерной графики и мультимедиа. В область его научных интересов входят суперразрешение, семантическое матирование видео и машинное обучение. Иван курировал разработку бенчмарка методов суперразрешения для улучшения качества видео и был одним из организаторов соревнований по оценке качества суперразрешения видео на ECCV-AIM 2024 и ICCV-AIM 2025.
Халед Набиль АБУД получил степень бакалавра компьютерных наук в Московском государственном университете имени М. В. Ломоносова в 2024 году. В настоящее время продолжает обучение в магистратуре МГУ в Лаборатории компьютерной графики и мультимедиа. Его научные интересы включают обработку изображений, оценку качества изображений и видео, состязательное машинное обучение и глубокое обучение. Халед также является одним из ключевых участников проекта «Доверенный ИИ» ИСП РАН, занимаясь анализом устойчивости методов оценки качества изображений и нейросетевых кодеков сжатия изображений к состязательным атакам.
Дмитрий Сергеевич ВАТОЛИН закончил ВМК МГУ в 1996, защитил диссертацию в 2000, кандидат физико-математических наук, заведующий лабораторией компьютерной графики ВМК МГУ. Специализируется на исследованиях в области алгоритмов сжатия видео, современных методах измерения качества и обработке цифрового видео. Читает курсы по компьютерной графике и методам сжатия и обработки видео с 1997 года. Создатель популярных сайтов, посвященных алгоритмам обработки и сжатия видео.