2026 г.

Комплексное применение компьютерного зрения и распознавания речи для повышения качества обработки видеозаписей производственных работ

DOI: 10.15514/ISPRAS-2026-38(1)-14

1 И.Ю. Смолин, ORCID: 0000-0002-7272-1232 <ilya.smolin@ocrv.ru>

1,2 А.А. Любченко, ORCID: 0000-0002-2768-484X <aleksandr.lyubchenko@ocrv.ru>

1 М.В. Исаков, ORCID: 0000-0002-8677-8862 <maksim.isakov@ocrv.ru>

1 Д.А. Вождаева, ORCID: 0009-0001-2894-5810 <darya.vozhdaeva@ocrv.ru>

1 ООО «ОЦРВ», филиал Сириус, холдинг «РЖД-Технологии», ФТ «Сириус»,
Россия, 354340, г. Сочи, ул. Международная, 2/1.

2 Омский государственный технический университет (ОмГТУ),
Россия, 644050, г. Омск, пр. Мира, 11.

Аннотация. Сегодня технологии искусственного интеллекта находят свое применение в области научной организации труда и, в частности, применительно к технологическим процессам в сфере железнодорожного транспорта. Основной точкой получения эффекта в таком случае является использование технологий для автоматизации рутинного труда человека, направленного на просмотр и анализ видеозаписей производственных операций. Для достижения данного эффекта был разработан метод на основе технологий компьютерного зрения и обработки структурированной информации, которые легли в основу функционирующего сегодня программного обеспечения. Промышленная эксплуатация сервиса выявила необходимость в развитии его возможностей и повышении качества работы. Коллективом авторов был разработан усовершенствованный подход для анализа видеозаписей производственных процессов путем совместного использования технологий компьютерного зрения и распознавания речи. Предложенное решение включает детекцию и трекинг сотрудников, распознавание специализированных инструментов и действий работников, а также обработку речевых комментариев оператора съемки. Интеграция данных из различных информационных каналов позволяет повысить точность определения временных интервалов технологических операций, компенсируя ограничения при одноканальной обработке существующего решения. Проведенные лабораторные эксперименты показали, что применение современных архитектур нейронных сетей и предложенных алгоритмов постобработки обеспечивает 40-процентный прирост качества анализа видеозаписей производственных работ.

Ключевые слова: компьютерное зрение; распознавание речи; детекция объектов; трекинг; железнодорожная отрасль; видеоаналитика.

Для цитирования: Смолин И.Ю., Любченко А.А., Исаков М.В., Вождаева Д.А. Комплексное применение компьютерного зрения и распознавания речи для повышения качества обработки видеозаписей производственных работ. Труды ИСП РАН, том 38, вып. 1, 2026 г., стр. 201–220. DOI: 10.15514/ISPRAS-2026-38(1)-14.

1. Введение

В рамках развития научной организации труда в железнодорожной отрасли, где совершенствование механизмов нормирования является одной из ключевых задач [1], применяются различные методы изучения рабочего времени. В последние годы, для решения этого вопроса, все чаще используются современные информационные технологии видеоанализа на базе искусственного интеллекта [2].

Видеосъемка рабочего времени, дополненная алгоритмами компьютерного зрения, представляет собой перспективный метод исследования производственных процессов, позволяя не только фиксировать временные затраты, но и детально анализировать технологические операции, действия сотрудников и идентифицировать применяемые инструменты [3]. В отличие от классических методов нормирования труда, видеосъемка разделяет процесс замера показателей и их анализ, обеспечивая объективность измерений и возможность многократной проверки в соответствии с принципами научной организации труда. Такой подход обеспечивает комплексный анализ производственных процессов с высокой степенью детализации.

Развитие технологий видеоаналитики демонстрирует растущий интерес к автоматизации мониторинга трудовых процессов. Существуют разработки [4], которые используют несколько камер для мониторинга ручных операций и выявления аномальных событий. Также разработана система [5], фиксирующая события, связанные с поведением и действиями сотрудников. В работе [6] предлагается метод распознавания последовательности действий рабочих на стройплощадках на основе данных с камер видеонаблюдения. Промышленное внедрение подобных систем демонстрируется в работе [7], решение осуществляет контроль безопасности на производстве и анализ поведения персонала.

Определение интервалов технологических операций тесно связано с задачей Temporal Action Localization (TAL) [8], которая заключается в определении временных границ выполнения действий на видео. Однако, прямое применение этой технологии в железнодорожной отрасли ограничено несколькими факторами. Во-первых, методы TAL часто ориентированы на распознавание типовых, достаточно простых действий [9], тогда как, например, путевые работы включают множество нюансов и вариаций выполнения операций. Во-вторых, не учитывается необходимость одновременного анализа нескольких аспектов: действий сотрудников, применяемого инструмента, пространственного положения и производственного контекста.

Предыдущие исследования [10] решали задачу оценки временных интервалов технологических операций исключительно на основе детекции применяемых инструментов, где алгоритм оперирует ограниченным объемом информации. Такой поход был назван одноканальным. Впоследствии были выявлены некоторые его ограничения и недостатки: проблемы с обнаружением инструментов из-за различных перекрытий, невозможность определения неоперативного времени (когда инструмент в руках, без явной работы с ним), а также отсутствие индивидуального распределения времени операций в случае одновременной работы нескольких человек.

Для повышения точности и надежности анализа временных операций предлагается использовать альтернативный вариант, объединяющий разные модальности данных: визуальную информацию (детекция сотрудников и их действий, определение рабочих инструментов), аудиоданные (распознавание голосовых команд оператора съемки). И такой подход было предложено назвать многоканальным. Идея интеграции мультимодальных данных позволит создать более точную и адаптивную технологию для нормирования труда, учитывающую реальные условия путевых работ.

Автоматизация процесса визуальных наблюдений с использованием технологий компьютерного зрения и распознавания речи позволит минимизировать влияние человеческого фактора, повысить точность измерений и усовершенствовать методы научной организации труда в железнодорожной сфере.

2. Предлагаемое решение

В работе представлена реализация собственного решения для анализа затрат рабочего времени по видеосъемкам с применением методов глубокого обучения в области компьютерного зрения и распознавания речи. Предлагаемый алгоритм, с учетом специфики железнодорожной отрасли, обеспечивает обработку видео и аудиоинформации с высокой точностью. Отличительной особенностью технологии является применение многоканальной архитектуры, обеспечивающей более стабильную работу по сравнению с одноканальным вариантом.

При реализации предложенного алгоритма были выделены следующие основные прикладные задачи:

  1. детекция и трекинг сотрудников;
  2. распознавание отраслевых инструментов;
  3. привязка инструментов к сотруднику;
  4. распознавание действий;
  5. распознавание речевых комментариев;
  6. постобработка результатов.

Для точного анализа трудовых процессов и распределения норм времени необходимо детектировать и идентифицировать каждого сотрудника. Также нужно уделить особое внимание стабильности работы алгоритмов в условиях изменения ракурсов съемки, возможных перекрытий и наличия схожей спецодежды, которая затрудняет идентификацию.

При выполнении путевых работ требуется надежно детектировать 35 специализированных инструментов в следующих возможных условиях: плохое освещение, атмосферные осадки, тряска камеры и частичные окклюзии. Главное требование – точное установление факта использования инструмента.

В моменты, когда человек заслоняет собой инструмент, необходимо распознавать действия сотрудника, тем самым делать вывод о работе с конкретным инструментом по особым движениям, характерным для того или иного инструмента.

Если с помощью детектирования инструмента и выполняемых действий невозможно определить временные рамки операций, то дополнительно необходимо обрабатывать речевые комментарии оператора съемки, сопровождающие начало и конец операций.

На финальной стадии формирования оценок временных интервалов, требуется предусмотреть алгоритм постобработки, который обработает результаты на основе заданной логики для компенсации погрешностей по отдельным блокам.

Разрабатываемое решение представляет собой многоканальную систему анализа видео, алгоритм работы которой может быть визуально представлен на рис. 1.

На первом этапе видеофайл предварительно предобрабатывается, разбивается на отдельные кадры с необходимым масштабированием (а). Эти кадры затем параллельно поступают в два независимых модуля детектирования инструментов (б) и детектирования сотрудников (в). Данные модули отвечают за обнаружение и локализацию объектов в кадре. Далее предсказания этих блоков (bbox_tool, class_tool, bbox_person, idx_person, pose) агрегируются и передаются в модуль привязки инструмента к сотруднику (г). Этот этап позволяет определить, держит ли сотрудник конкретный инструмент в руках или он лишь находится в зоне видимости, например, лежит на земле. Это важно для понимания контекста действий человека.

Параллельно результаты работы блока (в) передаются в модуль распознавания действий (д), который анализирует активность сотрудников, например, определяет, бездействует ли человек, работает с инструментом или выполняет другие действия. Ответом модуля является ограничивающий прямоугольник сотрудника и его индекс с предыдущего модуля, а также и распознанное действие (bbox_person, idx_person, action).

Помимо обработки визуальных данных, система также включает модуль распознавания голоса (е), который работает напрямую с аудиодорожкой видеофайла, минуя этапы обработки изображений и выдает временные интервалы работы с инструментом (class_tool, start_time, end_time).

На финальном этапе все полученные данные — результаты распознавания голоса (е), распознавания действий (д) и привязки инструментов к сотрудникам (г) — поступают в модуль постпроцессинга (ж). Здесь информация интегрируется, анализируется и преобразуется в финальный результат: временные интервалы с указанием операций, выполняемых каждым сотрудником.

Рис. 1. Схема основных функциональных блоков архитектуры.

Рис. 1. Схема основных функциональных блоков архитектуры.

2.1 Детектирование сотрудников

Для решения задачи определения сотрудников в кадре был выбран подход на основе детекции объектов с ключевыми точками, а также добавление трекинга людей [11].

В качестве детекционной модели используется предобученная модель семейства Yolo – YoloV7-pose [12], которая не только возвращает координаты ограничивающего прямоугольника, но и определяет координаты ключевых точек. Такие точки характеризуют различные значимые части объекта, являющиеся ориентирами для анализа его структуры и позиции. Положения ключевых точек обычно представляются в виде набора 2D-координат [x, y] или 3D-координат [x, y, уверенность]. В стандартной модели YoloV7-pose имеется 17 ключевых точек, каждая из которых представляет собой отдельную часть человеческого тела. В нашей задаче используются только 11 точек (плечи, кисти, бедра, колени, глаза и нос).

Полученные данные о ключевых точках используются в дальнейшем на этапе привязки инструмента к человеку (рис. 1, г). Кроме того, точки глаз и носа применяются для определения ориентации человека относительно камеры. Если координаты глаз и носа имеют высокую уверенность детекции, это указывает на то, что точки видны и человек стоит лицом к камере. Если уверенность низкая, делаем вывод, что человек стоит спиной к камере и возможно заслоняет собой инструмент, с которым в данный момент работает.

Задача трекинга объектов в компьютерном зрении, особенно в контексте отслеживания движения людей, остается одной из наиболее сложных и актуальных проблем. Это связано с такими вызовами, как окклюзии, пересечения объектов, выходы из кадра и последующие возвращения, которые приводят к ошибкам в идентификации. Традиционные методы трекинга часто оказываются недостаточно устойчивыми в таких сценариях, что ограничивает их применение в реальных условиях.

В данной работе рассматриваются новые подходы к решению задачи трекинга, направленные на улучшение реидентификации объектов и повышение устойчивости алгоритмов в сложных условиях. Основным решением данных проблем является использование комбинаций современных архитектур, таких как xMEM [13] и SAM [14].

В рамках исследования были протестированы следующие подходы трекинга:

  • Tracking by Face Recognition. Подход предполагает использование распознавания лиц как основы для построения эмбеддингов, которые можно использовать в алгоритме реидентификации для сравнения. Качество такого подхода на тестовых данных оказалось низким из-за недостаточной устойчивости признаков, что в свою очередь обусловлено наличием в кадре средств индивидуальной защиты, таких как очки и кепки.
  • Tracking by Detection. Комбинация YoloV7-Pose в качестве детектора и алгоритма ByteTrack [15]. Результат – недостаточная эффективность при резких изменениях позы и входе/выходе из кадра на более чем 3 секунды.
  • Tracking by Segmentation. Совместное использование xMEM, YoloV7-Pose и SAM. Является перспективным вариантом, но требует доработки для повышения устойчивости работы при частых окклюзиях и выходах объектов трекинга из кадра.
  • Tracking by Segmentation представляет собой новый алгоритм, сочетающий xMEM для реидентификации (bboxes ID), YoloV7-Pose для детекции ключевых точек и ограничивающих прямоугольников (keypoints, bboxes) и SAM для сегментации с получением контуров объектов (masks). Взаимосвязь основных функциональных блоков адаптированного под рассматриваемую задачу алгоритма представлена на рис. 2.

Рис. 2. Предложенный алгоритм трекинга сотрудников.

Рис. 2. Предложенный алгоритм трекинга сотрудников.

Более детально предлагаемый алгоритм трекинга может быть представлен следующей последовательностью логических операций:

Вход: Список кадров входной видеозаписи video_frames
Выход: Ограничивающие прямоугольники с идентификаторами bboxes_id
Начало алгоритма трекинга
Инициализация моделей:
  Инициализировать xMEM
  Инициализировать YOLOv7-Pose
  Инициализировать SAM
    for каждый кадр f из video_frames do
Шаг 1: Детекция объектов с использованием YOLOv7-Pose
  (bboxes, keypoints) ← YOLOv7_Pose.detect(f)
Шаг 2: Сегментация объектов с использованием SAM
  masks ← SAM.segment(f)
Шаг 3: Реидентификация объектов с использованием xMEM
      for каждый bbox_i из bboxes do
        bboxes_id ← xMEM.reidentify(bbox_i, f)
        bboxes_id ← bboxes_id  {object_id, bbox_i, keypoints, masks_i}
      end for
Шаг 4: Обработка окклюзий и выхода объектов за пределы кадра
      for каждый объект obj из bboxes_id do
        if obj.is_occluded() или obj.is_out_of_frame() then
          obj.status "occluded"
          continue
        end if
        obj.update_position(object_id, keypoints, masks)
      end for
Шаг 5: Сохранение результатов трекинга
  Сохранить bboxes_id для дальнейшего анализа
    end for
Конец алгоритма трекинга

Для всесторонней и комплексной проверки качественных характеристик, все исследуемые подходы были протестированы по трем метрикам HOTA [16], MOTA [17] и IDF1 [18], которые являются стандартом в современных бенчмарках для алгоритмов трекинга [19]. Каждая из данных метрик фокусируется на определенных аспектах производительности алгоритмов трекинга в динамических сценах:

  • Higher Order Tracking Accuracy (HOTA) — оценка общего баланса между точностью и полнотой трекинга, учитывает как ошибки в позициях объектов, так и в их идентификации;
  • Multiple Object Tracking Accuracy (MOTA) — метрика, оценивающая точность трекинга, принимая во внимание количество ошибок в трекинге, такие как пропуски, ложные срабатывания и неправильное сопоставление идентификаторов;
  • Identification F1 Score (IDF1) — метрика, оценивающая качество идентификации объектов, которая вычисляется как гармоническое среднее между точностью полнотой в отношении правильных идентификаций объектов в процессе трекинга.

Тестовый набор состоял из 20 видеозаписей, содержащий как съемки реального производственного процесса (рис. 3, a) общей длительностью 1 час, так и записи, подготовленные в лабораторных условиях (рис. 3, b) длительностью 30 минут. Видеоматериалы различаются по уровню сложности трекинга и включают следующие сценарии:

  • сложность 1 – сотрудники в кадре без сильных окклюзий и без выхода за пределы кадра;
  • сложность 2 – трекинг сотрудников при частичном и полном перекрытии объектов друг другом или элементами окружения;
  • сложность 3 – трекинг с реидентификацией вследствие выхода сотрудников за кадр на различные интервалы по времени (менее 5 с, 5-10 с, 10-30 с и более 30 с).

Таким образом, выбранный набор тестовых видеозаписей позволял оценить устойчивость алгоритмов трекинга к визуальным сложностям в производственных условиях. Результаты работы на тестовом наборе данных, представлены в табл. 1.

Подход Tracking by Segmentation показал высокие результаты на тестовых данных и в результате был выбран в качестве основного алгоритма трекинга людей.

Иллюстрация к статье

a)

Иллюстрация к статье

b)

Рис. 3. Примеры кадров из видеозаписей реального производственного процесса (a)
и в лабораторных условиях (b).

Табл. 1. Метрики работы различных подходов трекинга на тестовом наборе данных.

ПодходыHOTA (%)↑MOTA (%)↑IDF1 (%)↑
Tracking by Face Recognition40,945,230,4
Tracking by Detection64,567,475,6
Tracking by Segmentation80,289,194,2
2.2 Детектирование инструментов

Для решения задачи детектирования инструментов используется модель также семейства Yolo – YoloV8, которая имеет приемлемое качество работы, быструю скорость инференса, а также легко интегрируется в большинство решений.

Для обучения модели использовались изображения из видеозаписей производственного процесса. Набор данных содержит 60 тыс. изображений с различными углами обзора, расстоянием до объекта, освещением и погодными условиями. Распределение на обучающую, валидационную и тестовую выборки было задано как: 70/20/10. Исходные данные включают 35 классов инструментов, что обеспечивает широкий охват большей части путевых работ, около 95%. Среди классов представлены такие специализированные инструменты, как ключ торцовый, кран портальный, станок рельсошлифовальный и другие. Их внешний вид, массогабаритные характеристики осложняют задачу детектирования в сравнении с повседневными предметами. Для наглядной демонстрации внешнего вида детектируемых объектов, отдельным документом [20] представлен список всех учитываемых в алгоритме инструментов. Материал подготовлен на основе изображений, доступных в сети Интернет.

Чтобы улучшить обобщающую способность нейросети и обеспечить работу в сложных условиях, к стандартным аугментациям Yolo были добавлены погодные аугментации (снег, дождь, туман). Примеры изменения изображений показаны на рис. 4.

Рис. 4. Пример погодных аугментаций.

Рис. 4. Пример погодных аугментаций.

Кроме того, часть данных была изменена с помощью генеративных сетей – CosXL [21] и InstructPix2Pix [22]. В качестве примера были применены такие запросы как: «измени время года на осень», «добавь закат» или «смени время суток на вечернее» и т.д. Пример преобразования изображений с запросом «время года осень» представлен на рис. 5. Еще одним экспериментом по изменению данных было применение переноса стиля с одного изображения на другое [23]. Данная технология улучшает взаимодействие моделей детекции объектов с низкоуровневыми признаками, такими как текстуры, цвета и небольшими изменениями форм.

Результаты экспериментов представлены в табл. 2.

2.3 Привязка инструмента к сотруднику

Результаты работы описанных выше блоков после преобразования в табличный формат передаются в сервис, отвечающий за привязку найденных инструментов к сотрудникам. Это необходимо для того, чтобы, проанализировав каждый кадр видео, определить, находится ли инструмент в руках сотрудника или нет.

Сервис детекции человека агрегирует координаты ограничивающего прямоугольника, его ключевые точки и уникальный индекс человека из модуля трекинга. Сервис детекции инструментов отдает координаты найденного инструмента и его класс. Поскольку на одном кадре может быть несколько инструментов и несколько человек, в таблицу заносятся все возможные комбинации «инструмент-человек». Детектирование инструмента в руках человека осуществляется на основе всех признаков, полученных от других сервисов, а также дополнительными признаками расстояний между ключевыми точками человека и координатами центра инструментов (рис. 6). Для предсказания используется CatBoost [24] – модель в виде ансамбля решающих деревьев, обученная методом градиентного бустинга. Алгоритм вычисляет вероятность того, что конкретный инструмент находится в руках сотрудника.

Рис. 5. Генеративная аугментации «время года осень».

Рис. 5. Генеративная аугментации «время года осень».

Табл. 2. Метрика детекции на тестовом наборе данных.

ЭкспериментыmAP50↑ (среднее)
YoloV8, стандартные данные0,682
+ погодные аугментации0,701
+ генеративные аугментации0,725

Рис. 6. Визуализация принципа работы алгоритма привязки инструмента к рукам человека.

Рис. 6. Визуализация принципа работы алгоритма привязки инструмента к рукам человека.

На отложенной тестовой выборке среднее значение целевой метрики (F1-мера) по всем инструментам составило 0,89.

2.4 Распознавание действий

Необходимость точно определять инструменты в блоке (в) на рис. 1. в условиях сильных окклюзий и съёмки со спины, является одной из нерешенных проблем при одноканальном подходе. Для этого в общую архитектуру решения был включен канал распознавание действий, блок (д) на рис. 1.

Задача распознавания действий (англ. Action Recognition) в компьютерном зрении представляет собой процесс автоматической идентификации и классификации действий, совершаемых людьми или объектами на основе анализа видеопоследовательностей или наборов изображений. Данная проблема находит широкое применение в различных прикладных областях, что стимулирует разработку многочисленных методик и алгоритмов для ее решения [25].

В рамках решаемой задачи ключевая функция данного канала – это определение действий, имеющих характерные движения рук, ног и положения тела при работе с различными инструментами. Было выделено 4 класса действий: вращательное, ударное, закручивающее, толкательно-поступательное, а также отдельно класс «без действия». Поясняющая визуализация сформированных классов приведена на рис. 7.

Рис. 7. Классы распознаваемых действий: вращательное (1), ударное (2), закручивающее (3), толкательно-поступательное (4), без действия (5).

Рис. 7. Классы распознаваемых действий: вращательное (1), ударное (2), закручивающее (3), толкательно-поступательное (4), без действия (5).

Основные подходы к решению данной задачи можно разделить на несколько категорий, каждая из которых имеет свои особенности, преимущества и недостатки. В ходе проведённых исследований были рассмотрены три подхода. Во-первых, это использование двухпоточной архитектуры I3D [26], которая с помощью RGB-потока и Optic Flow потока, позволяет модели анализировать как пространственные, так и временные особенности. Второй подход PoseC3D [27], который использует 3D-позы человека в качестве основной информации для получения результата распознавания. Последний апробированный вариант – это MViTv2 [28], трансформерная модель с самым большим количеством параметров.

Результаты тестирования и расчёта основных метрик качества для сравниваемых подходов показаны в табл. 3. Наиболее привлекательно по метрикам на отложенном тесте показала себя модель MViTv2, которая и была выбрана для канала распознавания действий. Более высокое качество работы данной модели обусловлено использованием механизма временного внимания.

Табл. 3. Метрики на тестовом наборе данных исследуемых подходов.

ПодходAccuracy Top1↑Accuracy Top3↑Macro F1↑
I3D0,360,770,30
PoseC3D0,630,860,54
MViTv20,740,900,70
2.5 Распознавание речевых комментариев

В качестве дополнительного источника информации для определения временных границ операций было предложено использовать речевые комментарии оператора съёмки, содержащие указания на начало и завершение работы определенным инструментом.

Для однозначного определения операций использовался согласованный речевой регламент, содержащий шаблонизированные фразы вида:

работу <инструментом> <начал/закончил>,

а также их вариации с использованием синонимов и перестановки слов.

Для задачи распознавания такого ограниченного набора фраз оптимальным выбором стала компактная модель QuartzNet [29] (19 млн. параметров), предобученная на наборе данных Golos [30] объемом 1227 часов. Она позволяет подключить внешнюю n-gram языковую модель для перевзвешивания гипотез акустической модели, а также легко вычислять временные метки для слов, что необходимо в решаемой задаче.

При дообучении использовались:

  • синтетические данные, сгенерированные моделью Text-to-Speech фразы из радиопереговоров на транспорте (30 часов) для адаптации к специфике задачи;
  • часть набора данных Golos (60 часов) для сохранения возможности модели распознавать реальную человеческую речь.

А также дополнительные аугментации:

  • silence – добавление тишины в начале записи;
  • white noise – добавление белого шума к сигналу;
  • noise – добавление железнодорожного шума и шума ветра из внешних аудиофайлов;
  • RIR – свертка с Room Impulse Response для имитации отражений звука.

Для тестирования использовались аудиодорожки из 23 видеозаписей (40 минут). В табл. 4 приведены значения Word Error Rate (WER) на тестовых аудиозаписях. Во всех экспериментах использовались аугментации Silence, WhiteNoise и Noise. Достигнуто хорошее качество при записи речи на небольшом расстоянии от микрофона.

Табл. 4. WER на тестовом наборе данных. Farfield и nearfield – подмножества тестовых записей, в которых говорящий находится на расстоянии и вблизи микрофона соответственно.

ЭкспериментWER↓WER↓ farfieldWER↓ nearfield
QuartzNet Golos0,340,690,16
Дообучение только на синтетических данных с «замороженным» энкодером0,680,930,56
+ данные Golos farfield0,240,480,12
+ разморозка энкодера0,190,390,08
+ аугментация RIR0,170,360,07

На рис. 8 представлен полный алгоритм обработки аудиозаписи для извлечения временных границ операций. После описанного выше этапа распознавания речи (а) с вычислением временных отсечек слов осуществляется сегментация распознанного текста на фразы на основе анализа пауз в речи (б). Критерием разбиения выступает значительное превышение длительности межфразовых пауз над внутрифразовыми. На следующем этапе (в) из текста каждой фразы извлекаются названия инструментов и слова-индикаторы начала или завершения операции («начал», «закончил» и тому подобные). В завершении (г) осуществляется сопоставление фраз с совпадающими инструментами и метками начала и конца операции с пересчетом временных меток.

Рис. 8. Алгоритм извлечения временных границ операций из речевых комментариев.

Рис. 8. Алгоритм извлечения временных границ операций из речевых комментариев.

Финальным результатом работы пайплайна является список операций с идентификаторами инструментов, временем начала и конца операции.

Пример визуализации результата на тестовом аудиофайле представлен на рис. 9.

Рис. 9. Визуализация работы пайплайна извлечения временных границ операций: (а) тестовый аудиофайл, (б) речевые комментарии с выделенными границами.

Рис. 9. Визуализация работы пайплайна извлечения временных границ операций:
(а) тестовый аудиофайл, (б) речевые комментарии с выделенными границами.

2.6. Постобработка результатов

Финальным и особенно важным этапом обработки видеозаписей является блок постпроцессинга (ж) на рис. 1, отвечающий за агрегацию и согласование предсказаний, поступающих от всех предыдущих блоков: детекции инструмента в руках сотрудника, распознавания его действий, а также анализа речевых комментариев. Цель этого этапа – формирование точных, непротиворечивых и интерпретируемых временных интервалов операций с привязкой к конкретным сотрудникам.

Последовательность шагов алгоритма финальной постобработки предсказаний представлена на рис. 10.

Покадровые результаты блока привязки инструмента к сотруднику и распознавания действий (action, tool_id, frame_num) конвертируются во временные интервалы (start_time, end_time), далее происходит корректировка по следующему алгоритму. Если между двумя операциями одного класса и одного сотрудника фиксируется пауза менее 10 секунд, они объединяются в один более протяженный интервал. Также, короткие по длительности интервалы (менее 2 секунд) удаляются как вероятные ложные срабатывания. Далее используется логика согласования – например, начало операции фиксируется при одновременном наличии сигнала из речевого канала («начал работу»), визуального подтверждения действия (характерное движение для конкретного инструмента) и наличия инструмента в руках. На основе последней обработки выдаются итоговые интервалы операций (operation, start_time, end_time), которые благодаря системе трекинга индивидуальны для каждого сотрудника.

Пример временных интервалов с разбивкой по информационным каналам, а также сравнение с ручной разметкой (GT – ground true) показан на рис. 11.

Рис. 10. Алгоритм постобработки предсказаний.

Рис. 10. Алгоритм постобработки предсказаний.

Рис. 11. Визуализация временные интервалов операций при многоканальном подходе.

Рис. 11. Визуализация временные интервалов операций при многоканальном подходе.

Как видно на изображении, в течение большей части рабочего процесса сотрудник находился спиной к камере, поэтому инструменты удавалось детектировать лишь в отдельных коротких промежутках. Однако, благодаря дополнительным данным – распознаванию действий и голосовых комментариев – технология позволила относительно точно определить временные границы выполняемых операций.

2.7. Программная реализация

Разработанное решение реализовано в виде программного комплекса на основе микросервисной архитектуры. Все функциональные блоки развертываются в изолированных Docker контейнерах и оркестрируются с помощью Docker Compose, что обеспечивает воспроизводимость вычислительного окружения, гарантирует переносимость решения между различными платформами и существенно упрощает процессы сопровождения и масштабирования приложения. Все сервисы реализованы на языке программирования Python.

Взаимодействие между сервисами осуществляется через REST API по протоколу HTTP с использованием формата данных JSON.

Обучение и инференс моделей выполнялись с использованием графического ускорителя 1 × NVIDIA Tesla V100 с объёмом видеопамяти 32GB. В качестве основных библиотек глубокого обучения применялись PyTorch и Ultralytics. Для распознавания действий сотрудников использовался фреймворк MMAction2. Предобработка видеопотоков и изображений осуществлялась на основе библиотеки OpenCV. Постобработка предсказаний моделей выполнялась с помощью библиотеки анализа данных Pandas.

Для хранения и управления данными системы использовалась объектно-реляционная база данных PostgreSQL.

2.8. Тестирование решения

В лабораторных условиях были смоделированы производственные работы с использованием реальных путевых инструментов и спецодежды, применяемой в хозяйстве. Для проверки предложенного подхода и количественной оценки его качества работы было отснято и размечено 27 тестовых видео, длительностью 2-4 минуты каждое. Сценарии видеозаписей предусматривали различные осложняющие работу моделей случаи: перекрытия инструментов, выход сотрудника за кадр, периоды активных действий с инструментом и периоды простоя, а также голосовое сопровождение выполняемых операций.

Эксперименты были организованы таким образом, чтобы постепенно добавлялась информация для оценки временных интервалов операций, начиная только с детекции инструментов (одноканальный подход) с расчетом метрики качества F1-меры. Результаты вычислительных экспериментов для тестирования решения представлены в табл. 5, на основании которой можно сделать вывод о положительной динамике роста целевой метрики с 0,59 до 0,83 благодаря дополнительной информации, извлекаемой модулями предложенной многоканальной архитектуры.

Табл. 5. Результаты тестирования решения при добавлении информации.

ЭкспериментF1-мера↑
1 каналДетекция инструментов0,59
N каналовДетекция инструментов + Распознавание действий0,66
Детекция инструментов + Распознавание действий + Распознавание речи0,71
Детекция инструментов + Распознавание действий + Постпроцессинг0,80
Детекция инструментов + Распознавание действий + Распознавание речи + Постпроцессинг0,83

3. Обсуждение результатов

Проведенные экспериментальные исследования подтверждают гипотезу о преимуществе многоканального подхода в сравнении с первоначальной одноканальной реализацией алгоритма видеоанализа производственных процессов путевого комплекса. Как показали результаты тестирования в табл. 5, интеграция двух модальностей – визуальной (детекция инструментов, трекинг персонала, распознавание действий) и аудиальной (распознавание речевых комментариев) – обеспечивает значительный прирост качества, F1-мера возросла с 0,59 до 0,83, что соответствует 40 процентному улучшению точности определения временных интервалов операций. Особенно важно, что предложенная архитектура демонстрирует устойчивость в условиях, типичных для рассматриваемого железнодорожного хозяйства: частичные окклюзии, нестабильное освещение, схожая спецодежда сотрудников, тряска камеры при съемке с рук.

Следует отметить, что ключевым фактором повышения качества стала не просто параллельная обработка данных из разных источников, а их логическая согласованность на этапе постобработки. Модуль постпроцессинга, реализующий правила, близкие к экспертной оценке, позволил эффективно фильтровать ложные срабатывания и корректировать временные границы операций. Кроме того, использование речевых комментариев оператора съёмки в качестве надёжного внешнего источника информации о начале и завершении операций оказалось особенно эффективным в ситуациях, когда визуальный канал оказывался недостаточным, например, при съемке со спины.

Однако следует признать, что предложенное решение сохраняет определённые ограничения, особенно в части распознавания речи. Как показала оценка частоты ошибок на уровне слов (WER) в табл. 4, качество распознавания заметно снижается при увеличении расстояния между видеокамерой и целевой сценой с производственным персоналом (WER farfield = 0,36). Это может ограничивать применимость решения в реальных полевых условиях, где расстояние между фиксируемой сценой и видеокамерой с микрофоном может значительно варьироваться ввиду необходимости сохранения безопасных условий труда специалистов и следования регламенту выполняемого производственного процесса.

Для устранения данного ограничения альтернативным решением может стать применение end-to-end моделей распознавания речи с встроенной устойчивостью к рассматриваемым условиям. Это могут быть модели, основанные на архитектуре Transformer, дообученные на аудиоданных, характерных реальным условиям функционирования железной дороги, например, шумы от движущегося подвижного состава и наличие звуков и речи громкоговорящей связи на фоне. При этом стоит отметить, что предложенная многоканальная архитектура с текущим набором используемых моделей в любом случае будет обладать повышенной устойчивостью в сравнении с одноканальным вариантом за счёт компенсации возможных ошибок на основе информации из других каналов.

4. Заключение

Данная работа посвящена совместному применению технологий компьютерного зрения и распознавания речи для видеоанализа производственных процессов в железнодорожной отрасли, что является особо актуальным в задачах нормирования труда. Основной фокус направлен на разработку многоканального подхода видеоанализа, который учитывает сложность и вариативность реальных производственных условий – перекрытие рабочих инструментов, наличие нескольких сотрудников в кадре, их выход и возвращение в кадр спустя время, а также учет неоперативного времени. В основу подхода положена интеграция нескольких ключевых компонент: детектирование объектов (инструментов и людей), трекинг, распознавание действий, а также распознавание речевых комментариев. Использование мультиканального подхода позволило компенсировать недостатки и ограничения одноканального решения, разработанного ранее, и достичь более точного определения временных интервалов производственных операций.

Ключевыми блоками подхода стали:

  • детекция людей и инструментов моделями YoloV7-Pose и YoloV8;
  • высокоточный трекинг на базе комбинации xMEM и SAM;
  • распознавание действий сотрудников моделью MViTv2;
  • распознавание речевых комментариев оператора с помощью QuartzNet;
  • модуль постобработки результатов.

Для проверки результативности предложенного решения как набора технологий, объединенных многоканальной архитектурой, было проведено тестирование на подготовленных в лабораторных условиях видеозаписях работ путевого хозяйства. Результаты экспериментов показали прирост качества на 40%.

Таким образом, результаты проведенного исследования подтверждают потенциал совместного использования технологий компьютерного зрения и обработки речи для видеоанализа производственных операций на примере путевого комплекса.

Благодаря заложенной в архитектуру модульности данный подход может быть адаптирован под аналогичные задачи в других отраслях со схожими производственными процессами. Это может быть достигнуто за счет обязательного дообучения и настройки отдельных модулей, в частности, блока детекции инструментов, распознавания характерных действий и обработки речи. Данные манипуляции могут быть трудозатратны, но необходимы для учёта специфики в альтернативной предметной области и устойчивой работы. Тогда как модуль трекинга, учитывающая главным образом визуальный образ человека, может быть переиспользован как есть или с незначительной донастройкой.

Возможными направлениям дальнейшей работы может стать тестирование разработанного решения на видеозаписях работ по действующему техпроцессу хозяйства пути, дообучение моделей, при необходимости, а также апробация подхода в процессах других подразделений и служб железнодорожной отрасли.

Список литературы

  1. Никитин В.Н. Научная организация труда в парадигме устойчивого развития транспортного комплекса. Транспортное дело России, №5, 2024 г., стр. 60-65. / Nikitin V.N. Scientific organization of labor in the paradigm of sustainable development of the transport complex. Transport business of Russia, no. 5, 2024, pp. 60-65.
  2. Коптева Ж.Ю., Томакова И.А, Садиков Р.А. Современные информационные технологии изучения затрат рабочего времени как важный инструмент для эффективного управления бизнес-процессами. Известия Юго-Западного государственного университета. Серия: Экономика. Социология. Менеджмент, том 14, № 4, 2024 г., стр. 202–217. DOI: 10.21869/2223-1552-2024-14-4-202-217. / Kopteva Zh.Yu., Tomakova I.A., Sadikov R.A. Modern information technologies for studying the cost of working time as an important tool for effective management of business processes. Proceedings of the Southwest State University. Series: Economics. Sociology. Management, vol. 14, no. 4, 2024, pp. 202-217. (in Russian) DOI: 10.21869/2223-1552-2024-14-4-202-217.
  3. Никитин В.Н. Новая научная организация труда как базис системы нормирования труда в ОАО «РЖД». Повышение производительности труда на транспорте – источник развития и конкурентоспособности национальной экономики: Труды V Всероссийской научно-практической конференции (г. Москва, 26 мая 2021 г.). Москва: Гуманитарный институт федерального государственного бюджетного образовательного учреждения высшего образования "Российский университет транспорта (МИИТ)", 2021 г., стр. 28–37.
  4. Клемышев И.М., Колчин С.М., Лебедев С.С., Старков С.О. Автономная многоракурсная нейросетевая система компьютерного зрения для автоматизации контроля ручных операций. Успехи кибернетики, том 5, №3, 2024 г., стр. 24–33. DOI: 10.51790/2712-9942-2024-5-3-03. / Klemyshev I.M., Kolchin S.M., Lebedev S.S., Starkov S.O. Autonomous Multi-Camera Neural Network Computer Vision System for Manual Operation Monitoring. Russian Journal of Cybernetics, vol. 5, no. 3, 2024, pp. 24–33 (in Russian) DOI: 10.51790/2712-9942-2024-5-3-03.
  5. Хацкелевич А.Н. Применение технологий искусственного интеллекта как один из факторов конкурентоспособности бизнеса в четвертой промышленной революции. Вестник ПНИПУ. Социально-экономические науки, №1, 2024 г., стр. 184–199. DOI: 10.15593/2224-9354/2024.1.14. / Khatskelevich A.N., Rudakov S.A., Egorov G.A. Artificial intelligence technologies as one of the factors of business competitiveness in the fourth industrial revolution. PNRPU Sociology and Economics Bulletin, no. 1, 2024, pp. 184–199 (in Russian) DOI: 10.15593/2224-9354/2024.1.14.
  6. Luo X., Li H., Yang X., Yu Y., Cao D. Capturing and understanding workers’ activities in far-field surveillance videos with deep action recognition and Bayesian nonparametric learning. Computer-Aided Civil and Infrastructure Engineering, vol. 34, no. 4, 2019, pp. 333-351. DOI: 10.1111/mice.12419.
  7. Варанкин Д.В., Гудошник Е.Э., Мельников С.С. Автоматическая система контроля соблюдения правил охраны труда и производственной безопасности. Бюллетень науки и практики, том 9, №7, 2023, стр. 317-321. DOI: 10.33619/2414-2948/92/44. / Varankin D.V., Gudoshnik E.A., Melnikov S.S. Automatic Health and Safety and Production Safety Monitoring System. Bulletin of Science and Practice, vol. 9, no. 7, 2023, pp. 317-321 (in Russian). DOI: 10.33619/2414-2948/92/44.
  8. Shou Z., Wang D., Chang S.-F. Temporal Action Localization in Untrimmed Videos via Multi-stage CNNs. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition (CVPR’2016), 2016, pp. 1049–1058. DOI: 10.1109/CVPR.2016.119.
  9. Liu X., Wang Q., Hu Y., Tang X., Zhang S., Bai S., Bai X. End-to-End Temporal Action Detection With Transformer. IEEE Transactions on Image Processing, vol. 31, 2022, pp. 5427–5441. DOI: 10.1109/TIP.2022.3195321.
  10. Штехин С.Е., Карачёв Д.К., Иванова Ю.А. Разработка алгоритма распознавания движений человека методами компьютерного зрения в задаче нормирования рабочего времени. Труды ИСП РАН, том 32, вып. 1, 2020 г., стр. 121-136. DOI: 10.15514/ISPRAS-2020-32(1)-7. / Shtekhin S.E., Karachev D.K., Ivanova Yu.A. Computer vision system for working time estimation by human activities detection in video frames. Trudy ISP RAN/Proc. ISP RAS, vol. 32, issue 1, 2020, pp.121-136 (in Russian) DOI: 10.15514/ISPRAS-2020-32(1)-7.
  11. Kadam P., Fang G., Zou J.J. Object Tracking Using Computer Vision: A Review. Computers, 13(6), 2024, 136. DOI: 10.3390/computers13060136.
  12. Wang C.-Y., Bochkovskiy A., Liao H.-Y.M. YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition (CVPR’2023), 2023, pp. 7464-7475. DOI: 10.1109/CVPR52729.2023.00721.
  13. Cheng H.K., Schwing A.G. XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model. In Proceedings of the European Conference on Computer Vision (ECCV’2022), 2022, pp. 640–658. DOI: 10.1007/978-3-031-19815-1_37.
  14. Kirillov A., Mintun E., Ravi N., Mao H., Rolland C., Gustafson L., Xiao T., Whitehead S., Berg A.C., Lo W.-Y., Dollár P., Girshick R. Segment Anything. In Proceedings of IEEE International Conference on Computer Vision (ICCV’2023), 2023, pp. 4015-4026. DOI: 10.1109/ICCV51070.2023.00371.
  15. Zhang Y., Sun P., Jiang Y., Yu D., Weng F., Yuan Z., Luo P., Liu W., Wang X. ByteTrack: Multi-Object Tracking by Associating Every Detection Box. In Proceedings of the European Conference on Computer Vision (ECCV’2022), 2022, pp. 1-21. DOI: 10.1007/978-3-031-20047-2_1
  16. Luiten J., Os̆ep A., Dendorfer P., Torr P., Geiger A., Leal-Taixé L., Leibe B. HOTA: A Higher Order Metric for Evaluating Multi-object Tracking. International Journal of Computer Vision, vol. 129, no. 2, 2021, pp. 548-578. DOI: 10.1007/s11263-020-01375-2.
  17. Bernardin, K., Stiefelhagen, R.: Evaluating multiple object tracking performance: the clear mot metrics. EURASIP Journal on Image and Video Processing 2008, 1–10 (2008). DOI: 10.1155/2008/246309.
  18. Ristani, E., Solera, F., Zou, R., Cucchiara, R., Tomasi, C.: Performance measures and a data set for multi-target, multi-camera tracking. In: European Conference on Computer Vision, pp. 17–35. Springer (2016). DOI: 10.48550/arXiv.1609.01775.
  19. Бенчмарк MOT20 для алгоритмов трекинга [Электронный ресурс]. Доступно по адресу: https://motchallenge.net/results/MOT20/ (Дата обращения: 22.12.2025).
  20. Список детектируемых инструментов [Электронный ресурс]. Доступно по адресу: https://disk.yandex.ru/i/ZrtRhoUijMdJ6Q (Дата обращения: 22.12.2025).
  21. Rombach R., Blattmann A., Lorenz D., Esser P., Ommer B. High-Resolution Image Synthesis with Latent Diffusion Models. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition (CVPR’2022), 2022, pp. 10674-10685. DOI: 10.1109/CVPR52688.2022.01042.
  22. Brooks T., Holynski A., Efros A.A. InstructPix2Pix: Learning to Follow Image Editing Instructions. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition (CVPR’2023), 2023, pp. 18392-18402. DOI: 10.1109/CVPR52729.2023.01764.
  23. Карачёв Д.К., Штехин С.Е., Тарасян В.С., Смолин И.Ю., Исаков М.В. Использование переноса стиля как способ улучшения обобщающей способности нейросети в задаче детекции объектов. Труды ИСП РАН, том 35. вып. 6, 2023 г., стр. 247-264. DOI: 10.15514/ISPRAS-2023-35(6)-16. / Karachev D.K., Shtekhin S.E., Tarasyan V.S., Smolin I.U., Isakov M.V. Style transfer as a way to improve the generalization ability of a neural network in an object detection task. Trudy ISP RAN/Proc. ISP RAS, vol. 35, issue 6, 2023. pp. 247-264. (in Russian) DOI: 10.15514/ISPRAS-2023-35(6)-16.
  24. Prokhorenkova L., Gusev G., Vorobev A., Dorogush A.V., Gulin A. CatBoost: unbiased boosting with categorical features. In Proceedings of the 32nd International Conference on Neural Information Processing Systems. Advances in Neural Information Processing Systems (NeurIPS’2018), 2018, pp. 6639–6649.
  25. Pham H.H., Khoudour L., Crouzil A., Zegers P., Velastin S.A. Video-based Human Action Recognition using Deep Learning: A Review. arXiv.org. 2022. Available at https://arxiv.org/abs/2208.03775. (accessed 30.06.2025).
  26. Carreira J., Zisserman A. Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition (CVPR’2017), 2017, pp. 4724-4733. DOI: 10.1109/CVPR.2017.502.
  27. Duan H., Zhao Y., Chen K., Lin D., Dai B. Revisiting Skeleton-based Action Recognition. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition (CVPR’2022), 2022, pp. 2959-2968. DOI: 10.1109/CVPR52688.2022.00298.
  28. Li Y., Wu C.-Y., Fan H., Mangalam K., Xiong B., Malik J., Feichtenhofer C. MViTv2: Improved Multiscale Vision Transformers for Classification and Detection. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition (CVPR’2022), 2022, pp. 4794-4804. DOI: 10.1109/CVPR52688.2022.00476.
  29. Kriman S., Beliaev S., Ginsburg B., Huang J., Kuchaiev O., Lavrukhin V., Leary R., Li J., Zhang Y. QuartzNet: Deep Automatic Speech Recognition with 1D Time-Channel Separable Convolutions. In Proceedings of IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP’2020), 2020, pp. 6124-6128. DOI: 10.1109/ICASSP40776.2020.9053889.
  30. Karpov N., Denisenko A., Minkin F. Golos: Russian Dataset for Speech Research. In Proceedings of Interspeech (Interspeech’2021), 2021, pp. 1419-1423. DOI: 10.21437/Interspeech.2021-46.

Информация об авторах

Илья Юрьевич СМОЛИН – ведущий специалист по анализу данных. Области научных интересов: искусственный интеллект, компьютерное зрение, детектирование и сегментация объектов, генеративные нейронные сети.

Александр Александрович ЛЮБЧЕНКО – кандидат технических наук, заведующий лабораторией искусственного интеллекта и нейронных сетей ООО «ОЦРВ», филиал Сириус. Доцент кафедры «Средства связи и информационная безопасность» Омского государственного технического университета. Области научных интересов: методы машинного обучения, оптимизации и имитационного моделирования.

Максим Владимирович ИСАКОВ – старший специалист по анализу данных. Области научных интересов: искусственный интеллект, компьютерное зрение, распознавание действий на видео.

Дарья Александровна ВОЖДАЕВА – старший специалист по анализу данных. Области научных интересов: искусственный интеллект, распознавание и обработка речи, цифровая обработка сигналов.

Связь с редакцией