DOI: 10.15514/ISPRAS-2026-38(3)-49
1 А.В. Полевой, ORCID: 0009-0000-2216-0468 <polevoianton@bk.ru>
1,2 Н.В. Лукашевич, ORCID: 0000-0002-1883-4121 <louk_nat@mail.ru>
1 Московский государственный университет им. М.В. Ломоносова, факультет ВМК,
Россия, 119234, г. Москва, Ленинские горы, 1, стр. 4.
2 Научно-исследовательский вычислительный центр МГУ им. М.В. Ломоносова,
Россия, 119234, г. Москва, Ленинские горы, 1, стр. 4.
Аннотация. Несмотря на успехи моделей автоматического распознавания речи на различных наборах данных и языках, применение моделей в повседневной жизни не позволяет использовать их в различных сценариях, например, звонки с нестабильным сетевым соединением или телефонные каналы с помехами. В данной работе был разработан и представлен специализированный тестовый набор русскоязычной речи, ключевой особенностью которого является репрезентативный набор данных с контролируемыми деградациями сигнала, вызванными нестабильным интернет-соединением. На предложенном наборе была проведена апробация и сравнительный анализ современных подходов к распознаванию речи. Для количественной оценки степени искажений использовался автоматизированный метод, основанный на анализе совокупности акустических характеристик сигнала и нейросетевых метрик. Полученные результаты позволяют выявить методы, наиболее устойчивые к акустическим деградациям.
Ключевые слова: автоматическое распознавание речи; автоматическое прогнозирование WER; аудио тестовый набор речевых записей; аудиозаписи с нестабильным интернет-соединением.
Для цитирования: Полевой А.В., Лукашевич Н.В. Исследование влияния сетевых деградаций на модели распознавания речи. Труды ИСП РАН, том 38, вып. 3, часть 4, 2026 г., стр. 101–118. DOI: 10.15514/ISPRAS-2026-38(3)-49.
Развитие систем автоматического распознавания речи позволяет использовать модели для различных сценариев использования: автоматическая работа колл-центров [1], голосовое управление на предприятиях [2], в домах и автомобилях [3], протоколирование конференций и совещаний [4] и другие. Тем не менее, несмотря на стабильные результаты для сигналов известного качества (ручные микрофоны, запись в помещениях со стабильным интернет-соединением), модели показывают нестабильные результаты в присутствие акустических деградаций [5-6].
Под акустической деградацией будем понимать искажение исходного речевого сигнала, без изменения первоначального текста. Традиционно, выделяют несколько типов акустических искажений [7]:
При этом деградации на практике могут носить как временный, так и постоянный характер действия. Кроме того, несмотря на обилие наборов данных для систем распознавания речи, отсутствуют контролируемые тестовые наборы, построение которых позволит выбирать модели опираясь на конкретные требования.
Наша работа направлена на систематическое исследование проблем, связанных с распознаванием речевых сигналов с акустическими деградациями, вызванными нестабильным интернет-соединением:
В этом разделе начнем с описания различных подходов для автоматического распознавания речи и трудностях в распознавании, которые данные подходы имеют. Существующие исследования направлены на исследование адаптации существующих архитектур моделей распознавания речи под выбранный домен.
Наиболее популярной архитектурой для распознавания является Conformer [8]. Данная архитектура предоставляет возможность гибкого обучения и настройки под конкретную задачу. К основным плюсам данной архитектуры стоит отнести небольшое количество параметров (compute-optimal), трансформерная модель, адаптированная под работу с речевыми сигналами, а также скорость вычислений и возможность применения архитектуры Conformer к так называемой вариации Streaming Cache Aware, когда модель работает со звуковым потоком напрямую, поддерживая при этом внутреннее состояние. Существуют многочисленные улучшения и оптимизации Conformer. В частности:
Существует также и подходы для получения единой (Foundational) универсальной модели, например модели семейства Whisper (OpenAI [13]). Авторы обучают модель сразу нескольким задачам, такие как: определение конкретного языка анализируемого фрагмента, выделение временных меток, а также возможности перевода на английский язык (если декодеру подается метка «translate»). При этом они используют, в отличие от архитектуры Conformer частично или даже неполно размеченные данные (weakly-supervised), взятые из субтитров. Поэтому зачастую модель страдает различного рода галлюцинациями на тишину или какие-то незначительные шорохи, например, «Спасибо» [14] для русского языка.
В настоящее время наиболее активно развиваются подходы, целиком использующие большие языковые модели (Large Language Models, LLM), так называемые речевые большие языковые модели, SpeechLLM. Основная идея данной группы методов заключается в адаптации выходного пространства аудио энкодера для текстовой модели. Идея в том, чтобы адаптировать выход аудио-энкодера к входному пространству текстовой LLM, позволяя модели «понимать» речь как ещё один модуль. Примеры таких систем:
Авторы таких моделей на основе LLM обещают унифицировать обработку текста и звука, однако их практическое применение и стабильность результатов активно исследуется.
В реальных условиях речь часто искажается фоновым шумом и реверберацией. Естественные шумы (фоновые звуки улицы, офиса, толпы) и искусственные шумы (синтетический шум, наложенный на сигнал) снижают разборчивость. Реверберация – многократное отражение звука в помещении – также искажает спектр речи: для разных помещений (размер, длинный коридор) качество распознавания речи может изменяться в широких пределах. Например, в корпусе CHiME-5 записаны диалоги в 20 реальных домах с бытовыми шумами (кухня, кондиционер и так далее) и разной акустикой [18]. Аналогично в VOiCES данные записаны в двух мебелированных комнатах с фоновыми шумами и реверберацией [19].
Помимо акустических деградаций, вызванных шумами и комнатой, встречаются и порчи сигналов от передачи аудио потока. Данные в реальном времени характеризуются высокой чувствительностью к задержкам. Ярким примером являются голосовые коммуникации: в телефонном разговоре задержка в одну-две секунды между высказыванием и ответом делает взаимодействие крайне неудобным. Аналогичные эффекты наблюдаются при трансляции новостей с зарубежных площадок, когда сигнал приходит с заметной задержкой [20]. В отличие от передачи файлов, повторная отправка потерянных пакетов нежелательна, так как это увеличивает задержку и нарушает последовательность информации. Кроме того, вариативность скорости поступления пакетов (джиттер) может вызвать непредсказуемое поведение системы. Таким образом, потеря пакетов приводит к пропаданию фрагментов аудио, а джиттер – к вариативности времени прихода пакетов, что может приводить к ошибкам моделей распознавания речи.
Существуют разнообразные общедоступные наборы данных с зашумлённой или искажённой речью [18-19, 21-23]. Рассмотрим их основные характеристики в табл. 1.
Табл. 1. Обзор существующих речевых наборов данных с деградациями.
| Название набора | Описание | Языки |
|---|---|---|
| CHiME-5 [18] | Реальные разговоры, 20 домов, бытовой шум, запись на несколько микрофонов | 71 |
| VOiCES [19] | Корпус, созданный из чистой речи (LibriSpeech) с воспроизведением в помещениях с шумом и реверберацией; запись 12 микрофонами. | en |
| REVERB Challenge Dataset [21] | Корпус импульсных характеристик помещений. Включает как смоделированные (с искусственными АЧХ помещений), так и реальные записи речи в реверберационных помещениях. Предусмотрены записи с 1, 2 и 8 микрофонами. | en |
| DNS Challenge Dataset [22] | Набор для задач шумоподавления: содержит чистую речь, шумы, реверберацию и смесь голосов. | fr,ge,it,ru,sp,en |
| NISQA corpus [23] | Симулированные деградации речи: шумы, кодеки, потери пакетов, джиттер и др. | en |
Несмотря на опубликованные наборы данных с деградациями, лишь небольшое число наборов содержит примеры контролируемых деградаций, вызванных нестабильным интернет-соединением, и позволяет исследовать влияние определенной степени деградаций на качество распознавания речи. Очень трудно понять, является ли какой-либо набор данных достаточно сложным для распознавания из-за качества аудио данных, а не из-за других причин (некачественная разметка и прочее).
Ключевым приёмом адаптации под акустические деградации является аугментация данных при обучении моделей. Одним из самых известных методов является SpecAugment [24]: к спектрограмме применяют искажение «Time Warp», затем маскируют произвольные блоки частот и времени (то есть намеренно удаляют части спектра). Это имитирует реальную потерю каналов или пропуск сегментов. Также активно используют добавление синтетических и естественных шумов с реверберацией – накладывают реальные фоны (уличный, бытовой, офисный шум) и искусственно сгенерированные импульсные отклики помещений. Например, вводят задержки согласно моделям помещений или свертки с реальными импульсными откликами (Room Impulse Responses), чтобы тренировать сети на «ревербированном» сигнале. Кроме того, применяют перестановку времени (speed perturbation) и другие техники (см. обзор [24]).
Для эмуляции потери пакетов в обучении искусственно «зануляют» фрагменты аудио. Авторы работы [25] показали, что при добавлении имитации единичных потерь до 10% в обучающую выборку ASR-модель почти не теряет в точности. Однако при 15–20% потерь ошибки резко растут: лучшие стратегии аугментации дают качество распознавания на 7–10% выше, чем на чистых данных.
В ряде работ описывается апробация моделей распознавания речи для аудио с применением сетевых деградаций. В частности, авторы работы [26] предлагают методику аугментации речи сетевыми деградациями (потеря пакетов, джиттер) на основе известного набора данных зашумленной речи NOIZEUS. В результате генерируются около 192.5 часов речи, что позволяет изучать влияние искажений на распознавание речи в приложениях телефонии. Однако в работе не рассматривается сценарий кратковременной потери пакетов, которая характерна для реальных сетей и приводит к выпадению целых слов или словосочетаний. Такой сценарий особенно сложен для моделей, использующих контекстную информацию. Кроме того, созданный набор данных не опубликован.
Проблема восстановления потерянных пакетов (Packet Loss Concealment, PLC) остается актуальной, о чем свидетельствуют как специализированные исследования, например, работа [27], так и инициативы индустрии, такие как специализированный конкурс от Microsoft [28], направленный на исследование методов восстановления потерянных сетевых пакетов.
Другие подходы ориентированы на восстановление пропавших данных. Например, авторы [29] предлагают многослойную рекуррентную нейронную сеть, которая восстанавливает отсутствующие сегменты речи. Их модель способна восстанавливать до 1 секунды пропуска с высокой субъективной оценкой качества.
В архитектурном плане применяются также гибридные системы. Авторы работы [30] построили нейросеть, которая, будучи подключённой к модели распознавания речи с фиксированными весами, заполняет потерянные спектральные фреймы так, чтобы минимизировать ошибку. Кроме того, исследуются и трансформеры: например, модель Whisper (OpenAI) на 680 K часов многоязычных данных показала удивительную устойчивость к фоновым звукам [31]. Авторы этой работы демонстрируют, что модель Whisper лучше сохраняет качество распознавания при сильных шумовых зашумлениях, чем другие архитектуры распознавания речи.
В отличие от классических акустических шумов (таких как реверберация, фоновая речь или уличный шум), деградации, возникающие из-за некачественного интернет-соединения, имеют природу сетевого происхождения. Они связаны не с физическим искажением звука, а с потерей, задержкой или фрагментацией цифровых пакетов в потоке данных. Такие дефекты проявляются нерегулярно и могут создавать эффекты «пропадания» частей речи, искажений тембра, обрыва слов или временной рассинхронизации между аудио и видео.
Особенность сетевых деградаций заключается в непредсказуемости и дискретности потерь: в отличие от аддитивных шумов, они нарушают структуру временной последовательности сигнала, что делает задачу реконструкции и последующего распознавания особенно сложной для ASR-систем. Потеря пакетов приводит к тому, что модель сталкивается с обрывами спектрограмм, изменением амплитудных соотношений и нарушением контекстных зависимостей, что снижает точность распознавания даже при неизменных условиях фонового шума.
В рамках данного исследования был подготовлен специальный набор данных, моделирующий влияние неустойчивого соединения на распознавание речи (рис. 1). Для симуляции использовались два режима порчи: потеря пакетов на протяжении всего аудио файла (полный режим – full) и выборочная деградация для n последовательно идущих слов в тексте (частичный режим – partly). Таким образом, такая комбинация позволяет создать контролируемый характер порчи в наборах данных, что позволяет сравнивать модели распознавания речи и понимать границы их применимости в практических сценариях.

Рис. 1. Предлагаемый тестовый набор для эмуляции нестабильного интернет-соединения: схема генерации деградаций.
В условиях непредсказуемых деградаций важно оперативно оценивать качество поступающего звукового потока, иметь возможность до запуска модели распознавания речи, понимать примерный уровень её качества. Такой подход позволяет не только экономить вычислительные ресурсы, но и своевременно диагностировать причины деградации, сигнализируя о проблеме в аудиопотоке.
Метрика Word Error Rate (WER) является стандартным показателем качества систем автоматического распознавания речи (ASR). Она измеряет расстояние между эталонном текстом и гипотезой, выданной моделью ASR, вычисляя минимальное количество операций на уровне слов – замен (S), вставок (I) и удалений (D), – необходимых для преобразования гипотезы в эталонный текст: (где – общее количество слов в эталонном тексте).
Для решения этой задачи мы используем метод предсказания метрики WER на основе анализа акустического сигнала без использования транскрипции [32, 33]. Предлагаемый нами подход основан на совокупности низкоуровневых и спектральных признаков, а также методов оценки качества при помощи автоматических метрик (рис. 2).
Формирование признаков для прогноза WER включает в себя оценки уверенности ASR-модели (метрики уверенности, извлечённые из логарифмических вероятностей на уровне токенов, такие как энтропия, коэффициент Gini и другие) и признаки качества речи (WADA-SNR [34], SpeechBrain SI-SNR Estimator [35], NISQA [23]), что позволяет учитывать влияние различных типов аудио деградаций. Объединённый вектор признаков подаётся на вход модели регрессии, в качестве которой используется алгоритм CatBoost [36].

Рис. 2. Общая схема работы предсказания WER.
В данном разделе рассмотрим основные эксперименты по обучению и валидации моделей. Для экспериментов были выбраны 2 русскоязычных набора: LibriSpeech (ru) [37] и Fleurs (ru) [38]. Наборы содержат чистую речь, без акустических деградаций, поэтому подходят для контролируемой потери пакетов. Набор данных LibriSpeech (ru) основан на аудиокнигах, находящихся в открытом доступе в LibriVox. Набор данных Fleurs (ru) это речевая версия набора для машинного перевода FLoRes [39].
Для экспериментов были выбраны следующие модели: Whisper-small, Whisper-large-v3-turbo, FastConformer и Qwen-3-Omni (табл. 2). В табл. 3 представлены результаты качества распознавания речи на наборе LibriSpeech (ru). Метрики качества посчитаны как для предобученной версий модели, без изменения весов, так и после обучения c помощью LoRA-адаптеров [40]. Эмпирически было выбрано значения ранга для LoRA-адатера, равное 256, что соответствует обучению 21.6% весов модели у версии whisper-turbo-v3 (использовались веса матриц Q, K, V и набор полносвязных слоев оригинальной архитектуры Whisper).
Табл. 2. Используемые модели распознавания речи.
| Модель | Количество параметров | Тип декодера |
|---|---|---|
| Whisper-small [13] | 242M | Transformer |
| Whisper-turbo-v3 [13] | 809M | Transformer |
| FastConformer [12] | 120M | Гибрид (RNNT+CTC) |
| Qwen3-Omni [17] | 30B | MoE Transformer |
Тренировочная выборка была сформирована из обучающих выборок соответствующих наборов данных. Для этих выборок была применения процедура деградации, описанная в разделе 3 по потере пакетов (полный режим). Степень деградации p варьировалась от 0% до 90% c шагом 10%. Аналогичным образом применялась деградация для test выборок соответствующих наборов. У модели FastConformer обучались все веса (full-sft). Обучение всех моделей запускалось на 1 видеокарте Nvidia H100 80Gb. Среднеквадратичное отклонение у всех моделей < 0.2 по значениям WER, кроме случаев с Qwen3-Omni.
Табл. 3. Результаты распознавания с потерями на полной записи на наборе LibriSpeech (ru).
| Модель / Потеря пакетов | 0% | 10% | 20% | 30% | 40% | 50% | 60% | |
|---|---|---|---|---|---|---|---|---|
| Whisper-small | Pretrain | 0.2296 | 0.26 | 0.3038 | 0.3752 | 0.479 | 0.6545 | 1.384 |
| LoRA-sft | 0.1640 | 0.1766 | 0.1925 | 0.2132 | 0.2516 | 0.3136 | 0.4299 | |
| Whisper-turbo-v3 | Pretrain | 0.2037 | 0.2184 | 0.2350 | 0.2751 | 0.3291 | 0.4074 | 0.5309 |
| LoRA-sft | 0.1032 | 0.1099 | 0.1151 | 0.1322 | 0.1544 | 0.1937 | 0.2775 | |
| Fast Conformer | Pretrain | 0.4538 | 0.4552 | 0.4707 | 0.5159 | 0.6086 | 0.7495 | 0.8788 |
| Full-sft | 0.1229 | 0.1231 | 0.1274 | 0.1384 | 0.1577 | 0.1993 | 0.2749 | |
| Qwen3-Omni | Pretrain | 0.1109 ± 0.1251 | 0.1361 ± 0.1349 | 0.1722 ± 0.1470 | 0.2485 ± 0.1859 | 0.3785 ± 0.2240 | 0.8162 ± 9.2656 | 4.2209 ± 32.7964 |
| Прогноз WER | 0.079 | 0.103 | 0.122 | 0.158 | 0.226 | 0.342 | 0.547 | |
По результатам анализа данных из табл. 2 можно сделать следующие выводы:
В табл. 4 представлены результаты качества распознавания речи на наборе данных Fleurs (ru). Настройка гиперпараметров и модели обучения совпадают c описанной выше схемой. По результатам экспериментов можно сделать следующие выводы:
Табл. 4. Результаты распознавания с потерями на полной записи на наборе Fleurs (ru).
| Модель / Потеря пакетов | 0% | 10% | 20% | 30% | 40% | 50% | 60% | |
|---|---|---|---|---|---|---|---|---|
| Whisper-small | Pretrain | 0.1593 | 0.1731 | 0.1957 | 0.2228 | 0.3016 | 0.5112 | 0.9449 |
| LoRA-sft | 0.1502 | 0.1695 | 0.1835 | 0.2065 | 0.2527 | 0.3208 | 0.4450 | |
| Whisper-turbo-v3 | Pretrain | 0.2021 | 0.2230 | 0.2488 | 0.2952 | 0.3580 | 0.4590 | 0.6229 |
| LoRA-sft | 0.1266 | 0.1338 | 0.1426 | 0.1498 | 0.1756 | 0.2221 | 0.3120 | |
| Fast Conformer | Pretrain | 0.3655 | 0.3744 | 0.3868 | 0.4206 | 0.4896 | 0.6153 | 0.7733 |
| Full-sft | 0.1516 | 0.1543 | 0.1585 | 0.1689 | 0.1839 | 0.2155 | 0.2763 | |
| Qwen3-Omni | Pretrain | 0.0392 ± 0.0625 | 0.0429 ± 0.0648 | 0.0516 ± 0.0731 | 0.0671 ± 0.0834 | 0.1227 ± 0.1264 | 0.3688 ± 2.5370 | 2.0846 ± 14.5095 |
| Прогноз WER | 0.054 | 0.059 | 0.077 | 0.115 | 0.188 | 0.317 | 0.527 | |
Табл. 5. Примеры галлюцинаций Qwen3-Omni на полной записи на наборе данных LibriSpeech (ru) 60% потери пакетов.
| Гипотеза модели | Правильная запись | Комментарий |
|---|---|---|
| Вот в этой чаше, в этой чаше, в этой чаше, в этой чаше, в этой чаше, в этой чаше, в этой чаше, в этой чаше … (повторяется более 100 раз) | отбойное течение течение создаваемое волнами которые разбиваются о берег или иногда об риф или что-то подобное | WER=256.0 из-за повторений словосочетания в гипотезе |
| Минск является административным центром Минской области. | не оскверняйте это место нанося или выцарапывая граффити на объекты вокруг | WER=1.0 гипотеза связная, но ни одно слово не совпадает |
| Для вас, пушкин, поэты, касается вас от них, времена, нувшему птице, в часы досуга золотых, чтоб в тайны подлинные рукой веры я впал. | для вас души моей царицы красавицы для вас одних времен минувших небылицы в часы досугов золотых под шепот старины болтливой рукою верной я писал | WER=0.75 есть единичные попадания по словам, но в общем контексте распознавание неверное |
В табл. 6 и табл. 7 приведены результаты экспериментов на контролируемой частичной потере слов (см. раздел 3, режим partly). В этом режиме случайным образом выбираются n идущих подряд слов, и к ним применяется потеря пакетов степенью деградации p. Было эмпирически установлено, что на порче ограниченной последовательности слов имеет смысл рассматривать 2 сценария, как наиболее различимые на слух и по метрике WER: 40% и 60%.
Табл. 6. Результаты распознавания для потери на ограниченной последовательности слов (частичный режим) на наборе данных LibriSpeech (ru).
| Модель / Потеря пакетов | 40% 1 слово | 40% 2 слова | 40% 3 слова | 60% 1 слово | 60% 2 слова | 60% 3 слова | |
|---|---|---|---|---|---|---|---|
| Whisper-turbo-v3 | Pretrain | 0.2379 | 0.2500 | 0.2037 | 0.2341 | 0.2624 | 0.2956 |
| LoRA-sft | 0.1940 | 0.2097 | 0.1521 | 0.1949 | 0.2242 | 0.2614 | |
| Fast Conformer | Pretrain | 0.4631 | 0.4711 | 0.4538 | 0.4640 | 0.4854 | 0.5103 |
| Full-sft | 0.1304 | 0.1356 | 0.1229 | 0.1354 | 0.1523 | 0.1674 | |
| Qwen3-Omni | Pretrain | 0.1241 ± 0.1321 | 0.1468 ± 0.1473 | 0.1682 ± 0.1605 | 0.1487 ± 0.1433 | 0.2063 ± 0.1664 | 0.2671 ± 0.1930 |
| Прогноз WER | 0.097 | 0.111 | 0.123 | 0.111 | 0.144 | 0.177 | |
Табл. 7. Результаты распознавания на ограниченной последовательности слов (частичный режим) на наборе данных Fleurs (ru).
| Модель / Потеря пакетов | 40% 1 слово | 40% 2 слова | 40% 3 слова | 60% 1 слово | 60% 2 слова | 60% 3 слова | |
|---|---|---|---|---|---|---|---|
| Whisper-turbo-v3 | Pretrain | 0.2215 | 0.2299 | 0.2021 | 0.2165 | 0.2366 | 0.2641 |
| LoRA-sft | 0.1838 | 0.1938 | 0.1674 | 0.1842 | 0.2023 | 0.2247 | |
| Fast Conformer | Pretrain | 0.3727 | 0.3779 | 0.3655 | 0.3747 | 0.3928 | 0.4088 |
| Full-sft | 0.1559 | 0.1596 | 0.1516 | 0.1589 | 0.1689 | 0.1752 | |
| Qwen3-Omni | Pretrain | 0.0433 ± 0.0673 | 0.0458 ± 0.0693 | 0.0526 ± 0.0796 | 0.0500 ± 0.0723 | 0.0642 ± 0.0851 | 0.0909 ± 0.1025 |
| Прогноз WER | 0.059 | 0.063 | 0.072 | 0.061 | 0.086 | 0.109 | |
По результатам сравнения моделей в частичном режиме можно сделать следующие выводы:
Табл. 8. Примеры распознаваний Qwen3-Omni на ограниченной последовательности слов (частичный режим) на наборе данных Fleurs (ru).
| Whisper-turbo-v3 | Fast Conformer | Qwen3-Omni |
|---|---|---|
| коммутации в клетках зародышевой линии могут передаваться далее детям в то время коммутации гдето еще могут привести к гибели клеток или раку | коммутации в клетках зародышевой линии могут передаваться далее детям в то время коммутации гдето еще могут привести к гибели клеток или раку | только мутации в клетках зародышевой линии могут передаваться далее детям в то время как мутации гдето еще могут привести к гибели клеток или раку |
| людям с этих времен были известны основные химические элементы такие как золото серебро и медь поскольку их все можно встретить в природе в чистом виде и относительно легко добывать с помощью примитивных орудий | людям с этих времен были известны основные химические элементы такие как золото серебро и медь поскольку их все можно встретить в природе в чистом виде и относительно легко добывать с помощью примитивных орудий | людям с древних времен были известны основные химические элементы такие как золото серебро и медь поскольку их все можно встретить в природе в чистом виде и относительно легко добывать с помощью примитивных орудий |
| хьюн ушел в остатку и в кабинете министров его заменит член парламента… | Хьюн ушел в остатку и в кабинете министров его заменит член парламента … | Хьюн ушел в отставку, и в кабинете министров его заменит член парламента… |
Рассмотрим результаты экспериментов по автоматическому предсказанию WER (Раздел 4) на наборах LibriSpeech (ru) и Fleurs (ru). В первом (полном) режиме рассмотрим полную потерю пакетов на всем аудио файле. Во втором режиме деградация применяется случайно на n (1, 2, 3) последовательных слов в предложении – частичный режим. В табл. 9 представлены результаты по качеству автоматического предсказания метрики WER для трёх моделей на наборе Fleurs (ru).
Табл. 9. Качество прогнозирования WER на наборах данных Fleurs и LibriSpeech (ru).
| Модель | Размер | Fleurs | Librispeech | ||||
|---|---|---|---|---|---|---|---|
| RMSE | Pearson | Spearman | RMSE | Pearson | Spearman | ||
| Whisper-turbo-large-v3 | 809M | 0.0768 | 0.9827 | 0.9145 | 0.0633 | 0.9891 | 0.9424 |
| Whisper-small | 244M | 0.1077 | 0.9527 | 0.9399 | 0.0752 | 0.9817 | 0.9545 |
| Fast Conformer | 120M | 0.0866 | 0.9682 | 0.8942 | 0.0758 | 0.9828 | 0.9340 |
Результаты экспериментов проиллюстрированы на рис. 3, 4 и 5. Можно сделать несколько выводов:

Рис. 3. Распределение предсказания WER на наборе данных LibriSpeech (ru) – full режим.

Рис. 4. Распределение предсказания WER на наборе данных Fleurs (ru) – full режим.

Рис. 5. Распределение предсказания WER на наборах данных Fleurs (ru) и LibriSpeech (ru) –
частичный режим.
Несмотря на потерю стабильности при потерях> 50% для значений WER до 0.4 это все равно хороший инструмент по прогнозированию на практике;
Графики показывают, что при одинаковой доле потерь деградация большего числа слов оказывает более сильное влияние на прогноз WER. Так, на рис. 5 медианное значение WER при 40% потерь на трех словах выше, чем при 40% потерь на одном слове. Дисперсия с ростом деградации растет, как и на полном режиме full;
Однако прогнозирование WER не имеет потокового режима распознавания, поэтому совокупно показывает низкие значения на режиме потери на ограниченной последовательности слов (partly) по сравнению с потерей слов на всей записи (full).
В рамках проведенного исследования исследовалась задача по оценке современных систем автоматического распознавания речи (ASR) к акустическим искажениям, характерным для нестабильного интернет-соединения:
Был разработан и опубликован специализированный тестовый набор данных русскоязычной речи, ключевой особенностью которого является репрезентативный набор данных с контролируемыми и воспроизводимыми типами деградации аудио сигнала;
На предложенном тестовом наборе была проведена сравнительная апробация современных подходов к распознаванию речи. Модель Qwen3-Omni стабильно лучше справляется с частичным режимом деградации, при этом сильно падает в качестве по сравнению с другими моделями при полном режиме. Это связано с хорошим контекстом Qwen3-Omni на стадии декодирования для генеративного предсказания следующих токенов по сравнению с другими моделями;
Обученная версия модели FastConformer продемонстрировала наилучшую устойчивость для всех режимов тестового набора, например, для частичного режима: значение метрики WER находится в диапазоне от 0.1354 до 0.1674 (при потере пакетов 60%) на наборе данных LibriSpeech, и в диапазоне от 0.1589 до 0.1752 (при потере пакетов 60%) на наборе данных Fleurs;
Для количественной оценки степени искажений был апробирован метод прогнозирования WER без использования сравнения с эталонным распознаванием речи, основанный на анализе совокупности акустических характеристик сигнала и автоматических нейросетевых метрик.
Антон Вячеславович ПОЛЕВОЙ – аспирант Московского государственного университета им. М.В. Ломоносова на факультете вычислительной математики и кибернетики. Сфера научных интересов: цифровая обработка сигналов, машинное обучение для задач обработки звука, распознавания речи.
Наталья Валентиновна ЛУКАШЕВИЧ – доктор технических наук, сотрудник научно-исследовательского вычислительного центра Московского государственного университета им. М.В. Ломоносова. Сфера научных интересов: автоматическая обработка языка, искусственный интеллект.