DOI: 10.15514/ISPRAS-2025-37(6)-25
А.Н. Гладков, ORCID: 0009-0007-0211-5660 <a.gladkov@uniyar.ac.ru>
Л.Ю. Быстров, ORCID: 0000-0002-0610-5466 <l.bystrov@uniyar.ac.ru>
Е.В. Кузьмин, ORCID: 0000-0003-0500-306X <kuzmin@uniyar.ac.ru>
Ярославский государственный университет им. П.Г. Демидова,
Россия, 150003, Ярославль, ул. Советская, д. 14.
Аннотация. Повышение уровня безопасности железнодорожного движения напрямую связано с необходимостью оперативного обнаружения структурных аномалий элементов рельсового пути. Данная задача реализуется посредством регулярных проверок состояния рельсов с применением методов неразрушающего контроля. Среди современных технологий, используемых для этой цели, выделяется вихретоковая дефектоскопия. Дефектоскоп формирует многоканальный дискретный сигнал, который называется дефектограммой. Дефектограммы нуждаются в анализе, то есть в выявлении полезных сигналов, указывающих на дефект или конструктивные элементы рельса. В работе рассматривается применение детектирующих свёрточных нейронных сетей семейства YOLO (You Only Look Once) для автоматического обнаружения полезных сигналов на вихретоковых дефектограммах рельсов. Цель исследования – оценить эффективность различных способов преобразования многоканального сигнала в двумерные изображения, совместимые с YOLO. Исследованы четыре метода преобразования: пороговое, основанное на сравнении амплитуд с пороговым уровнем шума, оконное преобразование Фурье, непрерывное вейвлет‑преобразование и преобразование Гильберта‑Хуанга. Набор данных для обучения состоит из фрагментов дефектограмм по 50 тыс. отсчётов с полезными сигналами трёх классов (болтовые стыки, электроконтактные и алюминотермитные сварки). Данные разделены на обучающую, валидационную и тестовую выборки. Обученные на этих данных модели YOLO для всех рассмотренных методов преобразования продемонстрировали высокие показатели сбалансированной средней точности mAP. Наилучшие показатели были достигнуты при использовании непрерывного вейвлет-преобразования, в то время как пороговое преобразование оказалось наименее вычислительно затратным. Оконное преобразование Фурье позволило достичь лучшего баланса между точностью и полнотой обнаружения полезных сигналов. Результаты исследования подтверждают потенциал использования сетей YOLO для анализа вихретоковых дефектограмм и сигналов в целом.
Ключевые слова: свёрточные нейронные сети; сети YOLO; вихретоковая дефектоскопия; оконное преобразование Фурье; непрерывное вейвлет-преобразование; преобразование Гильберта-Хуанга.
Для цитирования: Гладков А.Н., Быстров Л.Ю., Кузьмин Е. В. Применение нейронных сетей семейства YOLO для обнаружения полезных сигналов на вихретоковых дефектограммах рельсов. Труды ИСП РАН, том 37, вып. 6, часть 2, 2025 г., стр. 131–150. DOI: 10.15514/ISPRAS-2025-37(6)-25.
Благодарности: Исследование выполнено в рамках инициативной НИР ЯрГУ им. П.Г. Демидова № VIP-016.
Вихретоковая дефектоскопия – это один из современных методов неразрушающего контроля железнодорожного полотна, основанный на взаимодействии вихревых токов с материалом рельса. Он применяется для выявления дефектов в электропроводящих материалах без повреждения объекта. Дефектоскоп формирует сигналы для каждого миллиметра рельса с помощью набора физических датчиков. Использование нескольких датчиков придаёт сигналам пространственную структуру. Количество датчиков определяет число каналов для каждого сигнала. Полученный таким образом набор данных называется дефектограммой. Дефектограммы отражают информацию о расположении конструктивных элементов и состоянии поверхности катания рельсов (рис. 1). Анализ дефектограмм заключается в поиске на ней сигналов от дефектов и конструктивных на фоне рельсового шума и помех разного рода. Системы автоматического анализа дефектограмм позволяют своевременно обнаружить и устранить дефекты рельсов, что прямым образом влияет на безопасность движения железнодорожного транспорта.

Рис. 1. Пример вихретоковой дефектограммы рельсов.
В данной работе рассматриваются дефектограммы, сформированные -разрядным ‑канальным вихретоковым дефектоскопом. Значения амплитуд сигналов – целые числа от до . Ввиду большой протяжённости дефектограммы нарезают на фрагменты. Длина одного фрагмента дефектограммы – тыс. отсчётов. Далее под дефектограммой будут подразумеваться её фрагменты описанного размера. Таким образом, дефектограммы можно рассматривать как 15-канальный дискретный сигнал :

Рис. 2. Примеры сигналов коротких конструктивных элементов на вихретоковых дефектограммах рельсов.
На вихретоковых дефектограммах можно выделить сигналы от коротких и протяжённых конструктивных элементов, помех оборудования и рельсовых дефектов. Среди полезных сигналов дефектограммы в данной статье рассматриваются сигналы, формирующие образы коротких конструктивов: болтовых стыков (Bolt Joint), электроконтактных (Flash Butt Weld) и алюминотермитных сварок (Aluminothermic Weld). Эти образы представлены на рис. 2. Стандартный подход к обнаружению полезных сигналов в дефектограмме основан на вычислении порогового уровня рельсового шума [1]. Полезные сигналы выделяются на фоне шума высокими значениями амплитуд, поэтому естественной идеей их обнаружения является сравнение амплитуд сигналов со среднеквадратическим отклонением рельсового шума. Перечислим проблемы такого подхода:
Таким образом, существует потребность в поиске новых методов обнаружения полезных сигналов на вихретоковых дефектограммах, которые могли бы учитывать форму и сложные свойства сигналов, а не только их высокоамплитудность.
В последние годы активно развивается подход представления одномерных сигналов в виде двумерных изображений для последующей обработки свёрточными нейронными сетями (Convolutional Neuron Network, CNN) [3]. Такие методы позволяют использовать проверенные архитектуры компьютерного зрения для задач анализа сигналов. В задаче обнаружения объектов нейронные сети могут выступать в качестве основного инструмента, в этом случае вся логика решения реализуется в архитектуре сети напрямую и сеть носит название детектирующей. Наиболее популярным семейством детектирующих свёрточных нейронных сетей являются сети YOLO (You Only Look Once), демонстрирующие впечатляющие результаты в области анализа изображений. Модели YOLO обеспечивают баланс между точностью и скоростью обнаружения объектов в реальном времени [4]. В отличие от двухэтапных детекторов, таких как R-CNN, разделяющими задачу формирования ограничивающих рамок (bounding boxes) в одном модуле и их отбор в другом, YOLO рассматривает задачу обнаружения объектов как проблему регрессии, предсказывая ограничивающие рамки и вероятности классов объектов непосредственно из входного изображения за один проход через нейронную сеть. Изначальная архитектура YOLO состояла из свёрточных слоёв и слоёв макс-пулинга (max-pooling), но с течением времени она эволюционировала в более модульную структуру. Каждая новая версия YOLO вносила улучшения в архитектуру, функцию потерь и методы обучения, что приводило к повышению точности обнаружения, особенно для объектов малого размера, и снижению вычислительных затрат [5]. Высокая скорость работы и эффективность YOLO позволяют использовать эти сети для обработки потенциально больших объёмов данных в реальном времени.
В данной работе исследуются методы применения сетей YOLO в решении задачи обнаружения полезных сигналов на вихретоковых дефектограммах. Методы отличаются друг от друга способом преобразования 15-канального сигнала в двумерное изображение . Рассматриваются 4 вида преобразований: оконное преобразование Фурье, непрерывное вейвлет-преобразование, преобразование Гильберта-Хуанга и пороговое преобразование. Пороговое преобразование является новым методом и вводится впервые. Все виды рассмотренных методов успешно интегрируются с YOLO и показывают высокое качество обнаружения полезных сигналов.
Существует большое количество техник преобразования сигналов в изображения. Среди них можно выделить две основные группы: преобразования, основанные на частотно‑временном анализе, и методы векторного кодирования изображений. К первой категории относятся спектрограммы (Short-time Fourier Transform, STFT), скалограммы (Continuous Wavelet Transform, CWT), спектры Гильберта-Хуанга (Hilbert-Huang Transform, HHT), распределения Вигнера-Вилля (Wigner-Ville Distribution, WVD). Вторая категория представлена грамиановыми угловыми полями (Gramian Angular Field, GAF), рекуррентными изображениями (Recurrence Plot, RP), разностными полями Маркова (Markov Transition Field, MTF) и полями разности мотивов (Motif Difference Field, MDF). Отдельно от этих двух больших групп отстоят изображения гомологической устойчивости (Persistence Image, PI). Все эти преобразования визуально представлены на рис. 3.

Рис. 3. Основные способы преобразования сигналов в изображения.
Оконное преобразование Фурье (STFT) позволяет анализировать гармонический спектр в зависимости от времени. В дискретном случае оно описывается функцией
где – дискретный сигнал, , – оконная функция, , .
Этот метод широко используется в распознавании аудио- и вибросигналов [6]. Получающиеся с помощью него изображения называются спектрограммами. Спектрограмма отражает как временную, так и частотную составляющую сигнала, что может быть полезно при поиске полезных сигналов. Спектрограммы являются наиболее популярными двумерными представлениями сигналов, активно применяющимися на практике. Так в работах [7] и [8] для вибрационных сигналов, полученных от электродвигателей и вращающихся машин, были построены спектрограммы, на которых обучена свёрточная нейронная сеть для классификации. Такой подход позволил значительно усовершенствовать системы диагностики неисправностей. Аналогичный подход применялся в статьях [9] и [10] и позволил достичь высокого качества обнаружения дефектов в свёрлах и дорожном покрытии. Авторы [11] применили сеть YOLOv10 вместе с STFT в задаче обнаружения и классификации радиосигналов и показали важность правильного выбора оконной функции для качества обнаружения. Успех применения спектрограмм в данных задачах обусловлен тем, что вибрации вращающихся систем, звуковые колебания и радиосигналы характеризуются выраженными гармоническими составляющими. Если же сигналы являются нестационарными и обладают сложной гармонической структурой, спектрограмма может не отражать их особенностей. В этом случае применяют непрерывное вейвлет-преобразование [12].
Главным отличием вейвлет-преобразования от преобразования Фурье является использование в разложении сигналов в качестве базиса не бесконечных функций, а ограниченных, локализованных по времени и по частоте. Это позволяет выявлять в сигналах резкие и быстро затухающие скачки амплитуд. Непрерывное вейвлет‑преобразование – это свёртка исходного ряда с материнской вейвлет‑функцией :
где – параметр масштаба, – смещение, , .
Получаемые на основе CWT изображения называются скалограммами (от англ. – масштаб). Скалограммы использовались в [13] для обработки вибрационных сигналов с целью повышения производительности моделей на основе CNN при обнаружении неисправностей в винтовых редукторах, благодаря чему была достигнута высокая точность классификации (более 99%). Авторы [14] применяли CWT в качестве промежуточного слоя в архитектурах LSTM и CNN для классификации аномалий в вентиляторных системах. В работе [15] проводится сравнительный анализ непрерывных вейвлет-преобразований с разными материнскими вейвлет-функциями (WT-Amor, WT-Bump, WT-Morse) в задаче диагностики неисправностей электродвигателей с использованием свёрточных нейронных сетей. Самая высокая доля правильных ответов (accuracy) была достигнута при использовании вейвлетов семейства Морзе. Авторы [16] решали задачу обнаружения утечек в трубопроводе. Они подавали на вход свёрточной сети двухканальное изображение, где один канал представлял собой спектограмму, а второй – скалограмму сигналов акустической эмиссии. Такое простое сочетание методов позволило значительно улучшить качество обнаружения утечек.
Итак, непрерывное вейвлет-преобразование является универсальным инструментом преобразования различных типов сигналов в информативные для CNN изображения. Главное ограничение CWT – высокая трудоёмкость по времени и по памяти при генерации матриц [17] (прогнозируется квадратичная сложность по размеру сигнала).
Отдельно остановимся на статье [18], авторы которой решали задачу обнаружения полезных сигналов в вихретоковых дефектограммах рельсов. Изображения в статье формируются с использованием непрерывного вейвлет-преобразования Морле. Авторы заявляют, что им удалось для сформированных изображений обучить свёрточную нейронную сеть и классифицировать с 98% точностью полезные сигналы трёх видов: скваты (вид дефекта), сварки и болтовые стыки. Однако результаты исследования нуждаются в тщательной проверке. Сомнения в полученных результатах вызывает использование авторами одноканального дефектоскопа, который, очевидно, даёт ограниченное представление о состоянии поверхности катания рельсов. Более того, наличие всего лишь одного канала затрудняет формирование образов конструктивных элементов рельсов (сварок и стыков рельсов). Полезные сигналы обнаруживаются с помощью сравнения амплитуд с постоянным пороговым уровнем шума при том, что уровень шума рельсов, как правило, является динамической величиной (зависит от настроек оборудования и типов рельсов) и для разных участков рельсового пути может сильно отличаться. Таким образом, достоверность результатов исследования [18] вызывает сомнения, результаты работы нуждаются в апробации.
Преобразование Гильберта-Хуанга (HHT) – это ещё один метод анализа данных, предназначенный для нелинейных и нестационарных сигналов, то есть сигналов, частотные характеристики которых меняются со временем. HHT состоит из двух этапов: эмпирическая модовая декомпозиция и преобразование Гильберта. На первом этапе сигнал разлагается на набор простых колебательных компонент, называемых внутренними модовыми функциями (Intrinsic Mode Functions, IMF). IMF являются монохроматическими функциями, то есть локально выглядят как синусоиды с медленно меняющимися параметрами. В результате эмпирической модовой декомпозиции ряд раскладывается на модовых функций и остаток :
Далее, к каждой IMF применяется преобразование Гильберта
где означает главное значение интеграла по Коши (Cauchy Principal Value).
Сигнал вида называется аналитическим. Представление аналитического сигнала в полярной форме позволяет перейти к спектру Гильберта.
Мгновенная частота в спектре находится как производная фазы по времени
Наконец, набор троек образует спектр Гильберта для всех IMF и моментов времени . Такое представление даёт богатую информацию о динамике нестационарных процессов. При этом преобразование Гильберта-Хуанга, как и вейвлет‑преобразование, может быть вычислительно трудоёмким. Другой недостаток HHT связан с тем, что эмпирическая модовая декомпозиция может иногда приводить к смешению мод, когда различные частотные компоненты смешиваются в одной и той же IMF. В этом случае спектр Гильберта становится тяжело интерпретируемым.
В статье [19] решается задача диагностики неисправностей подшипников в реактивных двигателях с переключаемым сопротивлением. Для этого по вибрационным сигналам строится спектр Гильберта, на котором с помощью двухэтапного детектора R-CNN выполняется поиск ограничивающих рамок. Двухэтапные детекторы значительно уступают в качестве одноэтапным, таким как YOLO. Авторы заявляют о высокой доле правильных ответов, но считают её на обучающей, а не тестовой выборке. В связи с тем, что сам метод R-CNN не доказал свою эффективность [20], возникают сомнения насчёт того, что модель сможет показать такие же впечатляющие результаты обнаружения объектов на новых данных.
Авторы [21] представили автоматическую систему для оценки качества бетона методом ударно‑эхового контроля. В ней сигналы преобразовывались в изображения с помощью распределения Вигнера-Вилля (WVD). Далее, в отличие от работ, рассмотренных ранее, свёрточные сети использовались напрямую для обнаружения объектов. Авторы обучили разные версии YOLO и с помощью них обнаружили трещины, поверхностные волны и вибрации в бетоне. При этом вместо классических метрик точности (Precision), полноты (Recall) и средней точности (mAP) они использовали свою метрику Detection rate, равную отношению числа найденных отметок к числу правильных отметок. Интерпретация данной метрики затруднительна. Если сеть найдёт слишком много лишних отметок, то Detection rate превысит единицу. Таким образом, используемая авторами метрика не позволяет адекватно оценить качество работы сети и, соответственно, подвергает сомнению результаты исследования.
Вторая группа преобразований сигналов в изображения основана на векторном кодировании. Ввиду того, что получаемые в данной группе изображения сложно использовать вместе с YOLO, им уделено меньше внимания.
Грамиановы угловые поля (GAF) и разностные поля Маркова (MTF) преобразуют сигнал в матрицу попарных отношений. Это позволяет получать информацию о корреляции всех пар амплитуд во времени [22]. Как правило, GAF/MTF применяются там, где важна общая структура и глобальные временные закономерности. Кратковременные сигналы могут быть размыты или менее заметны. С некоторыми проблемами GAF и MTF справляются поля разностей мотивов (MDF), которые обладают простотой реализации и отлавливают больше значимых признаков сигнала [23]. Известно, что эти методы требуют значительных вычислительных ресурсов (для сигнала размера создаётся матрица N×N) и порождают изображения большого размера, не пригодного для YOLO. Если исходный сигнал разбить на множество небольших фрагментов и для них выполнить GAF/MTF/MDF, то полученные изображения будут отлично сочетаться с моделями классификации (одно изображение — один класс), но не подойдут для задач, где нужно обнаруживать несколько объектов [24].
Рекуррентные изображения (RP) визуализируют моменты времени, когда траектория в фазовом пространстве возвращается в ранее посещённое состояние. Они создаются путём вычисления матрицы расстояний между всеми парами точек в реконструированном фазовом пространстве и последующей пороговой обработкой этой матрицы для выявления рекуррентности [25]. Рекуррентные изображения имеют все те же проблемы, что и GAF/MTF/MDF: высокая трудоёмкость и большой размер изображений. Кроме того, они выделяют только повторяющиеся закономерности и не кодирует пространственное и временное расположение сигналов, что имеет принципиальное значение для обнаружения полезных сигналов вихретоковых дефектограмм.
Ещё один способ создания изображений из сигналов основан на вычислении устойчивых гомологий. Устойчивые гомологии – это объект из топологического анализа данных, который извлекает информацию о «форме» данных, идентифицируя и количественно определяя топологические признаки, такие как компоненты связности и дыры, которые сохраняются при различных масштабах (разрешениях) данных – фильтрациях. Изображения гомологической устойчивости (PI) – это способ представления выходных данных топологического анализа (диаграмм устойчивости) в виде изображений с помощью свёртки диаграмм с гауссовским ядром [26]. Они часто используются в машинном обучении [27]. PI отображают время жизни топологических характеристик сигналов, но по ним нельзя восстановить временную локализацию сигналов. Таким образом, изображения устойчивых гомологий можно использовать для классификации сигналов, но не для их обнаружения, то есть сети YOLO к PI не применимы.
Итак, лучше всего для интеграции с YOLO подходят преобразования сигналов в изображения, основанные на частотно-временном анализе. С одной стороны, они сохраняют временную локализацию сигналов, с другой – кроме пространственных признаков позволяют анализировать частотные характеристики. Изображения на основе GAF, MTF, RP и PI могут использоваться вместе с нейросетевыми классификаторами, но не пригодны для детектирующих моделей.
В данном разделе рассматриваются методы преобразования изображений, которые впоследствии интегрируется с YOLO. Три из четырёх методов основаны на частотно‑временном анализе и уже были частично рассмотрены в предыдущем разделе: оконное преобразование Фурье, непрерывное вейвлет-преобразование и преобразование Гильберта-Хуанга. Предложен также авторский вариант преобразования, названный пороговым преобразованием (Threshold Transform, TT).
Требуется не просто преобразовать дефектограмму в изображение, но в изображение приемлемого для YOLO размера. Сети YOLO на вход принимают изображения размером в формате RGB. Поэтому полученные из дефектограммы изображения нарезаются на несколько фрагментов длиной пикселей каждый. После данной операции фрагментированные изображения выстраиваются вертикально друг под другом и дополнительно разделяются зелёными полосами для наглядного представления границ фрагментации. На основе каждого из преобразований строятся матрицы, соответствующие красному и синему цвету, а зелёный цвет используется для отображения полос. Таким образом достигается размер и формат изображения, воспринимаемые YOLO.
Данное преобразование не основано на частотно-временном анализе и вводится впервые. Будем непосредственно сопоставлять каждой амплитуде сигнала пиксель с определённой цветовой интенсивностью. Такой простой подход позволяет значительно сократить вычислительные ресурсы, которые требуются для создания изображений преобразованию Фурье и более трудоёмким алгоритмам, таким как непрерывное вейвлет-преобразование и преобразование Гильберта-Хуанга. На основе дефектограммы построим матрицы и . Матрица хранит информацию об интенсивностях красного цвета каждого пикселя и соответствует положительным амплитудам сигналов. Матрица хранит информацию об интенсивностях синего цвета и соответствует отрицательным амплитудам.
Пороговое преобразование основано на сравнении амплитуд сигналов с удвоенным пороговым уровнем шума , который находится с помощью алгоритма из [1]. Если амплитуда сигнала в канале по модулю превысила , то пикселю в зависимости от знака амплитуды сопоставляется интенсивность красного или синего цвета по логарифмическому правилу ; в противном случае используется линейное правило . Каждая интенсивность округляется до целого числа. При превышении допустимого значения интенсивности полученное число понижается до 255. Гиперпараметр 64, соответствующий моменту перехода от линейной функции к логарифмической, подобран эмпирически. В виде формулы пороговое преобразование можно описать следующим образом:
Элементы матриц и формируются с помощью порогового преобразования в соответствии со знаком амплитуды . Например, для преобразование выглядит как
Пример изображения, полученного применением порогового преобразования к сигналу болтового стыка, приведён на рис. 4.

Рис. 4. Применение порогового преобразования к сигналу болтового стыка.
Когда матрицы сформированы, они фрагментируются на матрицы меньшего размера с сохранением исходной высоты, но длиной пикселей. Фрагменты пересекаются друг с другом. Длина пересечения равна . Пересечение призвано предотвратить разрез сигналов конструктивных элементов, длина которых не превышает отсчётов. Для тыс. отсчётов дефектограммы по каждому каналу описанная процедура позволяет получить 114 фрагментированных изображений. Из них после вертикального выстраивания с разделяющими полосами высотой пиксель получаются изображения
размером .
Преобразование Фурье выполняется отдельно для каждого канала дефектограммы с окном Ханна размера и шагом . Спектр Фурье симметричен относительно нуля, то есть отрицательные и положительные частоты в спектре дублируют друг друга. В связи с этим рассматривается только положительная часть спектра. В результате по каждому каналу получается матрица размером .
Основная часть информации о частотах полезных сигналов в вихретоковых дефектограммах представлена на отрезке угловой частоты от до [2]. Если рассматривать только этот диапазон частот, то размер матрицы для каждого канала сократится
до . Для того чтобы из спектра Фурье получить две матрицы (интенсивностей красного и синего цвета), красному цвету сопоставляются действительные значения гармоник, а синему – мнимые. Далее, матрицы объединяются по вертикали отдельно для каждого цвета, образуя матрицы размером . Необходимые матрицы размера получаются с помощью описанной ранее операции фрагментации с длиной пересечения фрагментов, равной . Высота разделяющих полос равна . Каналы из одного фрагмента соединяются друг с другом без разделения полосами. По дефектограмме длиной тыс. отчётов получается 5 изображений .
Скалограмма строится отдельно для каждого канала дефектограммы. В качестве материнской вейвлет-функции используется вейвлет Морле с параметрами
и :
В качестве параметров масштаба равномерно выбраны значений из отрезка по логарифмической шкале. Вейвлет-преобразование имеет квадратичную сложность. Для того чтобы сократить количество вычислений, амплитуды берутся с шагом (сжатие в раз). Если скалограммы каждого из каналов выстроить вертикально, то получится матрица размером . Как и в случае преобразования Фурье, красный цвет формируется действительными значениями вейвлет-преобразования, а синий – мнимыми. Далее, матрицы фрагментируются с длиной пересечения фрагментов . Высота разделительной полосы равна 8 пикселей. Из тыс. амплитуд получается изображений размера .
Для каждого канала независимо считаются внутренние модовые функции (IMF) по методу маскирующих сигналов [28], что позволяет улучшить качество эмпирической модовой декомпозиции. Далее, применяется преобразование Гильберта. Полученные спектры на каждом канале нормализуются по стандартному отклонению и суммируются друг с другом. Размер полученной матрицы сокращается в раза по длине за счёт отброса каждого второго столбца матрицы (сжатие в раза). Высота матрицы может быть сколь угодно большой ввиду того, что функция мгновенной частоты является непрерывной. В нашем случае функция дискретизирована так, чтобы высота матрицы Гильбертова спектра составляла пикселя.
Полученная матрица фрагментируется с длиной пересечения фрагментов . Используется только красный канал изображения, синий канал содержит нулевые значения. Зелёные разделяющие полосы имеют высоту пиксель. Из дефектограммы размера 50 тыс. отсчётов получается изображений.
В этом разделе даётся описание того, каким образом производилось обучение модели YOLO, приводятся результаты обучения для разных видов изображений, построение которых было описано в предыдущем разделе.
При оценке качества обнаружения объектов необходимо контролировать как точность локализации объектов, так и надёжность их классификации. Для этого используется стандартная метрика – сбалансированная средняя точность (mean Average Precision, mAP). Она основана на понятии истинноположительных (True Positive, TP), ложноположительных (False Positive, FP) и ложноотрицательных (False Negative, FN) предсказаний модели. TP означает количество истинных предсказаний модели, FP – количество ложных предсказаний модели, а FN – количество не найденных моделью объектов. Истинность или ложность предсказания модели обычно определяется на основании вычисления пересечения над объединением (Intersection over Union, ), которое позволяет оценить степень геометрической схожести отметок. Обычно для сопоставления отметок выбирается порог равный .
Точность (P) вычисляется как отношение количества правильных предсказаний к количеству всех предсказаний модели:
Полнота (R) находится как отношение количества правильных предсказаний модели к количеству действительно правильных объектов:
Средняя точность (AP) считается как площадь под кривой точность-полнота (PR-curve). Для формирования PR-curve предсказания модели сортируются по убыванию уверенности (confidence) предсказаний модели, затем вычисляется точность и полнота для каждого порога уверенности. Средняя точность вычисляется для каждого класса отдельно, сбалансированная средняя точность (mAP) находится как среднее арифметическое средних точностей для каждого класса. Формально это записывается следующим образом:
где – значение на RP-curve в точке R, – средняя точность для -го класса, – количество классов.
Число mAP50 – это та же метрика mAP, вычисленная при пороге . Число mAP50‑95 – это среднее арифметическое значений метрики mAP, вычисленных при пороге от до с шагом .
Набор данных состоит из фрагментов дефектограммы длиной отсчётов каждый, на которых отмечены полезные сигналы от болтовых стыков (Bolt Joint), электроконтактных (Flash Butt Weld) и алюминотермитных (Aluminothermic Weld) сварок. Это сигналы коротких конструктивов вихретоковых данных. В зависимости от метода преобразования дефектограмм в изображения для набора данных можно получить от до изображений. В табл. 1 представлена информация о количестве изображений в обучающей, валидационной и тестовой выборках для каждого преобразования. Из набора данных исключены изображения, не содержащие отметок. Всего в наборе присутствует полезных сигнала. Информация о количестве объектов каждого класса в выборках представлена в табл. 2.
Для разных способов формирования изображений сохранялось единообразное разбиение на выборки. Вихретоковые данные изначально формируются для целых проездов – продолжительных записей одного участка железнодорожного пути. Далее, проезды нарезаются на дефектограммы по тыс. отсчётов. Выборки составлялись таким образом, чтобы все участки данных, полученные из одного проезда, попадали в общую выборку. Такой подход позволяет уменьшить корреляцию между дефектограммами обучающей, валидационной и тестовой выборок и контролировать переобучение (overfitting).
Табл. 1. Размеры обучающей, валидационной и тестовой выборок.
| Способ формирования изображений | Общее количество | Обучающая выборка | Валидационная выборка | Тестовая выборка |
|---|---|---|---|---|
| Пороговое преобразование | ||||
| Оконное преобразование Фурье | ||||
| Непрерывное вейвлет-преобразование | ||||
| Преобразование Гильберта-Хуанга |
Табл. 2 Число полезных сигналов в наборе данных.
| Выборка | Электроконтактные сварки | Алюминотермитные сварки | Болтовые стыки | Всего |
|---|---|---|---|---|
| Общая | ||||
| Обучающая | ||||
| Валидационная | ||||
| Тестовая |
Среди сетей YOLO была выбрана одна из последних версий модели YOLOv11n. Параметры обучения перечислены в табл. 3. На рис. 5 представлены графики функции ошибки во время обучения на обучающей и валидационной выборках.
Табл. 3. Гиперпараметры обучения YOLO.
| Параметр | Значение |
|---|---|
| Количество эпох | |
| Размер пакета | |
| Оптимизатор | AdamW |
| Начальный темп обучения | 0,00149 |
| Инерция | 0,9 |

Рис. 5. Графики функции ошибки на обучающей и валидационной выборках.
В табл. 4 отражены значения сбалансированной средней точности mAP50 и mAP50-95 для обученных моделей YOLO на разных видах изображений. В целом, все виды преобразований сигналов в изображения в интеграции с YOLO позволяют получить высокие показатели точности обнаружения полезных сигналов вихретоковых дефектограмм.
Табл. 4 Сбалансированная средняя точность mAP обученных моделей YOLO.
| Способ формирования изображений | mAP50 | mAP50-95 |
|---|---|---|
| Пороговое преобразование | ||
| Оконное преобразование Фурье | ||
| Непрерывное вейвлет-преобразование | ||
| Преобразование Гильберта-Хуанга |
Лучшие результаты показывает вейвлет-преобразование. Пороговое преобразование выигрывает у других методов простотой вычислений и линейной трудоёмкостью. На создание одного изображения ушло мс для STFT, мс – CWT, мс – HHT и всего мс – для порогового преобразования TT. Среди частотно‑временных методов STFT имеет близкие к CWT показатели mAP, тогда как HHT им немного уступает. Это можно объяснить используемым подходом к формированию гильбертова спектра многоканального сигнала, когда каналы объединяются простым усреднением спектра и не используется синий канал RGB формата изображения. Видимо, следует рассмотреть более надёжные методы HHT, например, HHT с Multidimensional Ensemble Empirical Mode Decomposition (MEEMD) [29]. Также за счёт RGB формата можно соединить несколько частотных представлений сигнала в одном изображении, например, как в работе [16].
Матрицы ошибок (рис. 6) показывают, что при использовании порогового преобразования сеть, несмотря на высокие показатели mAP, делает наибольшее число ложноположительных (FP) предсказаний по сравнению с остальными преобразованиями. Наименьшее число ложноположительных предсказаний происходит при интеграции сети YOLO с STFT. При этом преобразование Фурье практически не уступает другим методам по числу истинноположительных предсказаний (TP), а в случае электроконтактных сварок показывает наилучшие результаты. Преобразование Гильберта-Хуанга хуже остальных находит полезные сигналы и многие из них пропускает. Пороговое преобразование лучше реагирует на алюминотермитные сварки. Таким образом, с точки зрения матрицы ошибок использование STFT по сравнению с другими преобразованиями обладает рядом преимуществ: происходит наименьшее число ложных предсказаний, находятся оказавшиеся наиболее сложными для обнаружения сетью электроконтактные сварки и практически не пропускаются другие полезные сигналы.

Рис. 6. Матрицы ошибок обученных моделей YOLO.
На рис. 7 представлены примеры работы сетей YOLO, интегрированных с каждым из рассмотренных преобразований, на фрагменте дефектограммы с рис. 1.

Рис. 7. Примеры работы обученных моделей YOLO.
Задача обнаружения полезных сигналов может решаться разными методами. Один из подходов основан на свёрточных нейронных сетях, которые в последнее время стали основным инструментом в решении задач компьютерного зрения. Для применения этого подхода сигналы необходимо преобразовать в изображения. Существует множество способов выполнить такое преобразование. В данной статье применительно к вихретоковым дефектограммам рельсов, которые представляют собой 15-канальный дискретный сигнал, рассмотрены оконное преобразование Фурье (STFT), непрерывное вейвлет‑преобразование (CWT), преобразование Гильберта-Хуанга (HHT) и пороговое преобразование (TT). Все методы кроме TT строят частотно-временной спектр сигналов. Предложенное авторами пороговое преобразование основано на простом сопоставлении каждой амплитуде сигнала значения интенсивности цвета пикселя.
Рассмотренные преобразования можно интегрировать вместе с детектирующей свёрточной нейронной сетью YOLO. В результате было обучено сети YOLO для изображений каждого вида. Наименьшими временными затратами на формирование изображений обладает пороговое преобразование. Наибольшие значения mAP показала сеть на основе CWT. Лучший баланс между точностью и полнотой нахождения полезных сигналов показала сеть на основе STFT. В целом, каждое из преобразований позволило получить высокие показатели метрик.
Таким образом, для вихретоковых дефектограмм могут использоваться разные способы формирования изображений в зависимости от требований на время выполнения, количество пропусков и ложных срабатываний, значимости полезных сигналов определённого класса и т. д. Результаты исследования показывают перспективность применения сетей семейства YOLO при решении задачи обнаружения полезных сигналов вихретоковых дефектограмм и одномерных данных в целом. В дальнейшем планируется рассмотреть подходы к обнаружению полезных сигналов на основе других видов изображений и с использованием одномерной детектирующей свёрточной сети, построенной на основе архитектуры YOLO, для которой не будет требоваться трансляция сигналов в изображения.
Артемий Николаевич Гладков – ассистент кафедры теоретической информатики. Научные интересы: цифровая обработка сигналов, машинное обучение, прикладная статистика.
Леонид Юрьевич Быстров – ассистент кафедры теоретической информатики. Научные интересы: цифровая обработка сигналов, машинное обучение, топологические методы анализа динамических систем, математическая статистика.
Егор Владимирович Кузьмин – доктор физико-математических наук, доцент, заведующий кафедрой теоретической информатики. Научные интересы: цифровая обработка сигналов, методы верификации программ и теоретические основы информатики.