DOI: 10.15514/ISPRAS-2026-38(3)-32
А.И. Ларионов, ORCID: 0009-0003-6210-4972 <deervvv61@gmail.com>
В.Е. Турлапов, ORCID: 0000-0001-8484-0565 <vadim.turlapov@itmm.unn.ru>
Исследовательский центр искусственного интеллекта,
Институт информационных технологий, математики и механики,
Нижегородский государственный университет им. Н.И. Лобачевского,
Россия, 603950, Нижний Новгород, проспект Гагарина, 23.
Аннотация. Выполнено экспериментальное сравнение устойчивости к доменному сдвигу классических сверточных нейронных сетей (CNN), со сверточными сетями Колмогорова-Арнольда (convKAN), имеющими в ядрах свертки обучаемые нелинейности. Исследование выполнено на примере архитектуры ResNet-18 в конфигурации без декодера. Опорным выбран набор данных PlantVillage, как содержащий норму и 26 заболеваний, в том числе 17 грибковых для 14 видов растений (всего 38 классов). Заболевания представлены 4 классами, из которых наиболее представленными являются 2 - грибковые и бактериальные. Домены со сдвигом представлены 6 наборами изображений растений, в которых лишь малая часть типов растений и заболеваний пересекается с классами PlantVillage. Исследованы 3 метрики сдвига домена: Maximum Mean Discrepancy (MMD); дивергенция Йенсена-Шеннона; расстояние Вассерштейна. Сравнение моделей проводилось по метрикам: Accuracy, F1 macro, F1 weighted, Recall, FAR. Исследованы эмбеддинги, извлеченные сверточной частью моделей KAN и CNN. Установлено, что сверточные сети KAN, показывают лучшие результаты по устойчивости к доменному сдвигу в среднем на: 10% по Accuracy, 2% по F1-macro, 6% по F1-weighted. Показано, что влияние величин метрик доменного сдвига на результат KAN и CNN носит неоднородный характер, но в итоге эти метрики способны показать какие из доменных сдвигов являются сильными. Выявлена роль анализа ошибок на примере FAR, показавшего экстремальный рост для KAN и CNN в грибковых заболеваниях, с преимуществом сети CNN. Результаты показывают, что сильный доменный сдвиг является причиной существенной деградации качества классификации для обеих моделей, но сети KAN более устойчивы к доменному сдвигу, проигрывая CNN по величине FAR. Установлено, что после обучения в сети KAN доминируют унимодальные, мультимодальные и осциллирующие функции активации, а в ходе обучения доля унимодальных растет за счет осциллирующих.
Ключевые слова: устойчивость к доменному сдвигу; сверточные нейронные сети; сети Колмогорова-Арнольда; обучаемые функции активации; набор данных PlantVillage; классификация болезней растений; анализ пространства признаков; компьютерное зрение.
Для цитирования: Ларионов А.И., Турлапов В.Е. Сравнительное исследование устойчивости к доменному сдвигу сверточных сетей Колмогорова–Арнольда и классических CNN. Труды ИСП РАН, 2026, том 38, вып. 3, часть 3, стр. 7-26. DOI: 10.15514/ISPRAS-2026-38(3)-32.
Благодарности: Работа выполнена при поддержке Министерства экономического развития Российской Федерации (соглашение № 139-15-2025-004 от 17 апреля 2025 г., ИГК 000000Ц313925P3X0002).
При решении прикладных задач компьютерного зрения зачастую появляется проблема доменного сдвига. В то время как традиционные сверточные нейронные сети показывают хорошие результаты в условиях статистической близости объекта классификации к обучающей выборке, при существенном изменении данных объекта может проявиться значительное падение точности даже при решении той же задачи. Проблема доменного сдвига особенно часто проявляется, когда приходится переходить с набора данных, сформированного в лабораторных исследованиях, на его применение в полевых условиях, или при его формировании и применении на разных сортах, разных возбудителях заболеваний, на сортах с разной устойчивостью к одному типу заболевания. Тем более в задаче ранней диагностики стресса (заболевания). Деградация качества обученной модели может быть обусловлена также изменением освещения, фона, текстуры, аппарата, используемого для съемки и множеством других менее явных факторов. Все вышеуказанное делает проблему доменного сдвига фундаментальной.
В 2020 году предпринято глубокое исследование устойчивости к доменному сдвигу [1]. Изучена устойчивость моделей ImageNet к сдвигам распределения, возникающим из-за естественных вариаций в наборах данных. Оценены 204 модели ImageNet в 213 различных тестовых условиях. Установлено, что абсолютное большинство современных методов не обеспечивают устойчивости к естественным сдвигам распределения в принятой тестовой среде, а главным путем решения проблемы является обучение на более крупных и разнообразных наборах данных. Это во многих случаях повышает устойчивость, но все еще далеко от устранения разрывов в эффективности референса. А доменный сдвиг остается открытой исследовательской проблемой. В связи с бурным ростом применения искусственного интеллекта в индустрии, медицине и сельском хозяйстве актуальность этой проблемы сегодня только повысилась.
В плане решения проблемы интересно исследовать и возможности использования сравнительно недавно появившихся сетей Колмогорова-Арнольда (KAN), что и предлагает настоящая статья.
Сети Колмогорова-Арнольда являются развитием нейронных сетей, основанным на теореме о представимости непрерывных функций многих переменных в виде суперпозиции функций одной переменной и операции сложения [2]. Ключевой особенностью данного подхода являются обучаемые функции активации расположенные на ребрах сети, изначально реализованные с помощью B-сплайнов. Это делает архитектуру KAN интерпретируемой на уровне функциональных зависимостей.
С момента первой публикации [3] данный тип моделей уже прошел много итераций улучшений и расширений от небольших оптимизаций производительности и замены типа обучаемых функций, до реализации таких state-of-the-art подходов как использование архитектуры Трансформер или даже структуры, обеспечивающей бесшовную синергию сетей Колмогорова-Арнольда (KAN) и науки [3].
Одним из расширений стал сверточный слой, где обучаемые функции активации используются непосредственно внутри ядер свертки [4]. Комбинация этих технологий позволяет продвинуться по пути к объяснимости CNN.
Фактически сверточные KAN (convKAN) являются архитектурной модификацией классических CNN, в которой линейные операции свертки заменяются обучаемыми нелинейными отображениями. Возможность исследовать формы функций активации внутри ядер становится инструментом для исследования обобщения и устойчивости механизма извлечения признаков KAN. Несмотря на это, существующие работы по convKAN к текущему моменту чаще исследуют результаты применения, не уделяя достаточного внимания анализу поведения обученных функций и их связи с доменной устойчивостью.
Исследования в сфере геометрического анализа глубоких нейронных сетей дают важный контекст для анализа существующих архитектур. В работе [6] исследована геометрия, порождаемая глубокой нейронной сетью (DN), как состоящей из цепи пар линейных и нелинейных преобразований, на примере кусочно-аффинных и выпуклых нелинейностей. Показано, что слои таких DN представляют собой операторы, которые разбивают свое входное пространство и для получения выходных данных применяют аффинное отображение, зависящее от области. Разбиение входного пространства каждого слоя соответствует степенной диаграмме Вороного с числом областей, которое экспоненциально возрастает с числом нейронов.
В работе [7] установлено, что использование функций активации (Rectified Linear Unit, ReLU) приводит к формированию разреженных представлений признаков. Такое свойство пространства признаков способствует эффективной оптимизации, но в то же время может усиливать зависимость модели от локальных текстурных признаков.
Роль формы активационных функций в устойчивости и обобщении моделей рассматривается в ряде работ, выходящих за рамки стандартного выбора ReLU-подобных нелинейностей. В [8] показано, что гладкость и форма активаций оказывают существенное влияние на устойчивость моделей к шумам и искажениям. Параллельно с этим исследования, посвящённые автоматическому поиску активационных функций, демонстрируют, что оптимизация формы нелинейности может давать устойчивые улучшения качества по сравнению с фиксированными функциями активации [9].
Эти результаты указывают на то, что активационная функция является не просто технической деталью архитектуры, а важным фактором, определяющим свойства обучаемых представлений и поведение модели вне обучающего распределения.
С теоретической точки зрения, обобщающая способность глубоких нейронных сетей во многом определяется неявной регуляризацией, возникающей в процессе оптимизации. Было показано, что даже при отсутствии явных регуляризаторов динамика обучения и параметризация модели приводят к предпочтению определённых решений в пространстве функций [10]. Эти идеи были расширены на нелинейные и глубокие модели [11], а также проанализированы с точки зрения глобальной сходимости и неявного смещения оптимизации [12].
Данные работы подчёркивают, что архитектурные решения напрямую влияют на класс функций, к которому сходится модель, и, как следствие, на её способность к обобщению при смене домена.
Отдельное направление исследований посвящено анализу того, какие признаки извлекают сверточные нейронные сети. В частности, показано [12], что стандартные CNN склонны опираться преимущественно на текстурные признаки, а не на форму объектов, что негативно сказывается на переносимости между доменами с различными статистическими свойствами изображений. Эти наблюдения хорошо согласуются с результатами, демонстрирующими ограниченную эффективность существующих методов повышения робастности при естественном доменном сдвиге [1].
Дополнительно, в рамках доменного обобщения предлагается рассматривать обобщение в пространстве функций, а не параметров модели, что подчёркивает роль внутренней структуры отображений при смене домена [13].
При использовании теоремы Колмогорова–Арнольда, для непрерывной функции существует представление вида:
где: , - непрерывные функции одной переменной, n – размерность входного пространства. Один слой сети Колмогорова-Арнольда в матричной форме представляется как:
,
где - матрица функций -того слоя KAN, - тензор входных параметров, - тензор выходных параметров;
В общем виде сеть Колмогорова-Арнольда:
С момента публикации [3] было реализовано множество вариантов аппроксимации функций активации для KAN, в оригинальной работе используют B-сплайны:
,
где b(x):
а spline(x) - линейная комбинация B-сплайнов:
Другая реализация (исследуется в данной работе), аппроксимирует функции активации радиально базисными функциями (RBF) Гаусса:
| (1) |
|---|
где параметр контролирует ширину базиса. В общем виде аппроксимация функции RBF Гаусса:
| (2) |
|---|
где – центры базисных функций, – обучаемые коэффициенты, а – радиально-базисная функция, зависящая от расстояния между входом и центром. Такая параметризация обеспечивает гладкость и локальность аппроксимации, допускает эффективную реализацию в виде линейной комбинации фиксированного числа базисных функций. Главное преимущество такой реализации – возможность параллелизма вычислений на графических процессорах в отличие от B-сплайнов.
Для реализации сверточных слоев при помощи KAN определим входное изображение как:
,
тогда свертка будет определена как:
В матричном виде получается:
,
В качестве базовой архитектуры для исследования была выбрана ResNet-18 в конфигурации без декодера (рис. 1).
Схема сети идентична для CNN и KAN вариантов: KAN версия получена путем замены Conv2D слоев на FastKANConv2Dlayer, то есть на реализацию KAN сверток на основе RBF, с аналогичными размерами ядер, шагом и другими переносимыми параметрами (рис. 2).
В KAN-версии отсутствует ReLU, так как функция нелинейности является обучаемой и определяется в самих ядрах свертки. Таким образом различие между моделями локализовано в форме нелинейностей внутри сверточных ядер. Это позволяет рассматривать изменения в поведении моделей как прямое следствие обучаемых функций активации в KAN версии.
Для проверки гипотезы о повышенной устойчивости KAN-сверток к доменному сдвигу в работе используются различные наборы данных с изображениями листьев растений, пораженными заболеваниями разного типа. Опорным набором данных выбран PlantVillage, так как он является кратно большим по числу классов и общему числу изображений (табл. 1). В опорном наборе данных PlantVillage представлены: 14 видов культур (яблоня, виноград, клубника, апельсин, томат, персик, черешня, сладкий перец, кукуруза, картофель, малина, голубика, соя и тыква), здоровые и для 26 типов заболеваний.
Представленность заболеваний следующая: 17 грибковых, 4 бактериальных, 2 вирусных, 2 плесневых, 1 клещевое. Для каждой из культур представлены не все заболевания, а только наиболее актуальные для нее. Всего классов изображений для здоровых и больных культур ‑ 38.
Для наборов данных, представляющих доменные сдвиги, в Plant Pathology 2020 и Citrus есть совпадения по сельхоз-культурам (яблоня и апельсин), однако остальные наборы данных содержат в себе культуры, которые не присутствуют в опорном наборе данных. Это – кофе для наборов данных BRACOL и RoCoLe, рис – для Rice Leaf Diseases, груша – для DiaMOS. Плесневые и клещевое заболевания отсутствуют во всех наборах данных кроме PlantVillage.

Рис. 1. Блок-схема ResNet-18: CNN слева, KAN справа.

Рис. 2. Схема блока сверток ResNet: CNN слева, KAN справа.
Табл. 1. Детальное описание использованных в работе наборов данных.
| Набор данных | DiaMOS [14] | BRACOL [15] | RoCoLe [16] | Plant Pathology [17] | Rice Leaf Diseases [18] | Citrus [19] | PlantVillage [20] |
|---|---|---|---|---|---|---|---|
| Растение | Груша | Кофе | Кофе | Яблоко | Рис | Цитрус | 38 классов: 14 видов. 26 заболеваний. |
| Количество изображений | 3505 (3006 листьев + 499 плодов) | 4407 | 1560 | 3651 | 120 | 759 (609 листьев + 150 плодов) | 54309 |
| Количество симптомов | 4 | 4 | 2 | 3 | 3 | 5 | 26 |
| Инструмент съемки | Смартфон, зеркальный фотоаппарат | Смартфон | Смартфон | Зеркальный фотоаппарат, смартфон | Зеркальный фотоаппарат | Зеркальный фотоаппарат | Смартфон |
| Цветовое пространство | RGB | RGB | RGB | RGB | RGB | RGB | RGB |
| Разрешение изображений | Различные | 2048 × 1024 | Различные | 2048 × 1365 | 2848 × 4288 | 256 × 256 | Различные |
| Условия съемки | Полевые | Лабораторные | Полевые | Полевые | Лабораторные | Лабораторные | Лабораторные |
В доменных сдвигах отсутствуют пересечения с PlantVillage по вирусным заболеваниям. В итоге устойчивость к доменным сдвигам по видам растений будем исследовать только на трех типах по заболеваниям: норма (здоровые); грибковые заболевания; бактериальные заболевания. Исследуемые доменные сдвиги по сложности можно охарактеризовать как близкие к экстремальным.
Для количественной оценки доменного сдвига между наборами данных были проанализированы цветовые и структурные характеристики изображений. Для анализа структурной компоненты, изображения из цветных переведены в оттенки серого, затем для каждого вычислены следующие 5 характеристик: среднее значение яркости; стандартное отклонение яркости; энтропия Шеннона (как мера хаотичности и разнообразия); средняя величина модуля градиента, полученного оператором Собеля (характеризует резкость и выраженность границ); среднее модуля спектра Фурье (оценка высокочастотной энергии). Для оценки цветовых характеристик изображения из модели RGB переводились в цветовую модель CIE Lab, и для каждого из каналов Lab вычислялось среднее значение, стандартное отклонение и энтропия. Таким образом для каждого изображения был получен 14-мерный вектор признаков, состоящий из 9 цветовых характеристик и 5 структурных (несмотря на рекомендацию [21] ограничиваемся текстурными признаками по причине их доминирования).
В исследовании устойчивости к доменному сдвигу полезно иметь его количественную оценку. Отдельно для структуры и цвета доменов, исследованы следующие три известных метрики.
| (3) |
|---|
где – Гауссово ядро
,
∥x - y∥ – евклидово расстояние между признаковыми векторами; γ – параметр ширины ядра. Эта метрика чувствительна к нелинейным расхождениям в распределениях признаков.
| (4) |
|---|
где - смесь вероятностных распределений;
– дивергенция Кульбака-Лейблера. Эта метрика, оценивает формы распределений и устойчива к шуму.
| (5) |
|---|
где P, Q – сравниваемые распределения; П(P, Q) – множество всех совместных распределений с маргиналами P и Q; – транспортный план.
Расстояние вычисляется независимо для каждой координаты признакового вектора и затем усредняется:
| (6) |
|---|
где – распределения i-го признака двух наборов данных; d – размерность пространства признаков. Эта метрика характеризует величину глобального сдвига распределений, отражая различия в среднем уровне и масштабе признаков.
Диаграммы размаха трех указанных выше метрик доменного сдвига относительно PlantVillage по структурной и по цветовой составляющим для каждого из 7 наборов данных показаны на рис. 3 и рис. 4 соответственно.
Обе модели обучались в течение 40 эпох, на классификации 38 классов из исходного набора данных PlantVillage. Для оценки результатов классификации использовались следующие метрики:
,
где: K – число классов, TP – истинно положительные предсказания, N – общее число предсказаний.

Рис. 3. Диаграммы размаха попарного доменного сдвига изначальных данных для структурной составляющей.

Рис. 4. Диаграммы размаха попарного доменного сдвига изначальных данных для цветовой составляющей.
,
где:
,
,
– истинно положительные предсказания, для класса С, – ложно положительные предсказания, для класса С, , – ложно и истинно отрицательные предсказания, для класса С.
,
где:
,
– количество объектов класса C.
С помощью тех же метрик (3), (4), (5), (6) исследована оценка результата обработки входных признаков сверточной частью сетей KAN и классической CNN. Это вектор из 512 величин (см. схему на рис. 1 – блок «Признаки (512)»), которые должны далее поступить на вход полносвязной части сети для их классификации. Раздельно для KAN и CNN рассчитана удаленность результата обучения X на опорном наборе данных PlantVillage от результата обучения на других наборах данных (см. разд. 5).
Ниже приведены результаты проведенного эксперимента. Обе модели показали быструю сходимость обучения (рис. 5). В то же время, обучение KAN-модели заняло в ~4 раза больше времени. Это известное свойство данного рода моделей обусловлено вычислительной сложностью обучаемых функций активации.

Рис. 5. Обучение моделей KAN – слева, CNN – справа.
На наборе данных PlantVillage, на котором и проходило обучение, модели показали результаты порядка 100% по метрике Accuracy и двум F1. Такие результаты были получены, как для исходной разметки набора данных, включающей 38 классов для 14 видов растений (рис. 6), так и в пространстве из 3 и 5 мета-классов, сформированных по типам патологий. В (табл. 2) представлены только 3 типа патологий в метриках Accuracy, Recall, FAR. Это связано с тем, что классы «вредители» и «вирусное», имеют слабое соответствие между наборами данных. В (табл. 3), по сдвигам доменов относительно опорного PlantVillage, показаны 5 типов патологий. Хотя обе модели, KAN и CNN, показали значительное падение качества классификации, на Rice Leaf Diseases и BRACOL, на рис. 6 модель KAN показала превосходство в устойчивости к доменному сдвигу над моделью CNN.

Рис. 6. Диаграммы в метриках Accuracy, F1 macro, F1 weighted для моделей KAN и CNN на валидационных наборах данных классификации растений после обучения на PlantVillage по всем типам заболеваний.
В табл. 2 преимущество KAN проявляется в метриках Accuracy и Recall на классе грибковых заболеваний, оставаясь сравнимым с CNN для здоровых растений. Accuracy и FAR для бактериальных заболеваний у KAN лучше, чем у модели CNN, а Recall наоборот.
Бледно-коричневым фоном выделены наборы данных, для которых можно ожидать меньший доменный сдвиг (см. табл. 1). В (табл. 3) собраны расстояния между опорным и остальными доменами по метрикам сдвига для векторов 9 цветовых и 6 структурных признаков, а также расстояния между эмбеддингами размерности 512, извлеченными сверточной частью и KAN, и CNN до MLP классификации (столбцы KAN и CNN). Такой эмбеддинг извлекается из изображений каждого набора данных в процессе обучения. Расстояние между доменами определяется как сдвиг между распределениями доменов. По метрикам сдвига результаты сгруппированы в 3 колонки, чтобы оценить возможности валидации доменного сдвига для всех 3 метрик. Метрики валидационных наборов данных собраны в горизонтальные блоки для каждого класса заболеваний. Количество строк в блоке соответствует представленности заболевания в конкретном наборе данных.
Табл. 2. Результаты валидации на 6 наборах данных (левый столбец), для наиболее актуальных типов заболеваний.
Из данных табл. 3 видно, что показатели сдвига в пространстве эмбеддингов, извлекаемых моделями KAN и CNN, стабильно выше среднего для классов «вредители» и «вирусные» для обеих моделей, что согласуется с их наименьшим пересечением с опорным набором данных.
Также в табл. 3 прослеживается общий тренд для классов вирусных заболеваний и поражений вредителями, и для «полевых» DiaMos, RoCoLe, Plant Pathology. Эти классы показывают наибольшие значения сдвига в пространстве входных признаков цвета и/или структуры.
Табл. 3. Оценка доменного сдвига валидационных наборов данных относительно опорного (PlantVillage), сгруппированная по метрикам сдвига и по классам заболеваний на входе и выходе сверточных структур. Колонки «цвет» и «структура» соответствуют статистическим входным признакам изображений. Колонки KAN и CNN соответствуют расстояниям между эмбеддингами PlantVillage и валидационных наборов данных.
Расстояние Вассерштейна показывает наибольшие значения по структурным признакам, в то время как MMD указывает на большие сдвиги в пространстве цветовых признаков. MMD выглядит также более сбалансированной.
Отметим, что низкие величины сдвига, например, как 0,14 по цвету, для класса «вредители» набора данных BRACOL, говорят о том насколько цветовые показатели изображений этого класса набора данных близки к показателям того же типа в опорном наборе данных, но не о том, что они более пригодны для классификации. Аналогичное справедливо и для высоких значений.
Тем не менее, в целом наличие проблемных сдвигов доменов, которые наиболее ярко отразились в высоких значениях FAR в классе грибов (табл. 2), зафиксировано красным фоном (табл. 3) и так или иначе отражено всеми метриками сдвигов, и особенно полно и сбалансированно метрикой MMD.
Отметим наиболее важные моменты сравнительного исследования обобщающей способности классических CNN и сверточных KAN в условиях сильного доменного сдвига. Обе модели демонстрируют высокие значения Accuracy, Recall и FAR на тестовой выборке опорного набора данных PlantVillage (верхняя строка в каждом горизонтальном блоке табл. 2). Но при переносе на внешние наборы данных, имеющие критические величины доменного сдвига, обе модели показывают существенную деградацию качества, менее выраженную для сверточных KAN (convKAN).
По данным диаграммы на рис. 6 модель KAN превосходит CNN по метрике Accuracy максимально на 28 %, в среднем на 9,9 %, при среднеквадратическом отклонении 10,5 %, что указывает на высокую вариативность выигрыша в зависимости от домена. По метрике F1-macro в тех же параметрах: 17%; 1,7 %; 6,8 %. По метрике F1-weighted соответственно: 20%; 5,7 %; 7.3%.
По данным табл. 2 для классификации наиболее актуальных типов заболеваний в метриках Accuracy, Recall, FAR установлено, что:
Подробное и полное объяснение поведения FAR для грибковых заболеваний (в табл.2) дано в табл. 4: она содержит анализ источников FP по заболеваниям, а для здоровых растений - по условиям освещения для каждого набора данных. Эти данные полностью объясняют секрет высоких значений FAR в (табл.2) при классификации грибковых заболеваний сетями KAN и CNN. Более глубокую детализацию дает анализ столбцов начиная с «Отношение FAR».
Табл. 4. Основные источники высоких значений FP и, как следствие, FAR для грибковых заболеваний в табл. 2.
для сети KAN и CNN, а во-вторых, процентное распределение этих событий по классам Здоровые, Бактерии, Вредители.
Сопоставление табл. 4 с данными о заболеваниях и условиях съемки в наборах данных (табл.1) обнаруживает связь величин FAR со сдвигом каждого набора данных. Так для DiaMos это уникальный для всего набора вредитель (слизняк), который оставляет след, а распознается как грибковое заболевание и KAN, и CNN. Для набора данных BRACOL это также уникальный вредитель (моль). В столбце «Основные источники FP [%]» (табл. 4) дана детальная расшифровка причин FP и FAR грибкового поражения качественно, по классам заболеваний {Здоровые (полевые условия съемки), Бактерии, Вредители} и количественно (в %). Для Citrus это уникальное бактериальное заболевание Greening. Для набора данных Rice leaf это уникальное бактериальное заболевание Bacterial leaf blight, визуально схожее с несколькими грибковыми. Мы видим также случаи трактовки части класса здоровых растений как имеющих грибковые заболевания. Рекорд (100%) здесь принадлежит, казалось бы, близкому набору данных Plant Pathology, но c большим различием по условиям освещения (полевые вместо лабораторных у PlantVillage). Второе место у RoCoLe (KAN 80% и CNN 82%). Причина, – также в основном освещение, и вчетверо меньше – уникальный вредитель. Для набора данных BRACOL доля в 35% из Здоровых для сети KAN и 20% для CNN вполне приемлема при отсутствии номинальной культуры в составе PlantVillage, остальное также вредитель. Доли в Здоровых от DiaMos и Citrus соответствуют их потенциальной близости к опорному набору данных. В итоге видим, что высокие величины FAR обусловлены сильными смещениями доменов, не перекрывающимися набором данных PlantVillage. В условиях перекрытия доменов (как DiaMos и Citrus) FAR оказался низким, с некоторым преимуществом KAN.
В табл. 5 исследуется связь знака и величины разности трех популярных количественных оценок сдвигов наборов данных для 512-мерных эмбеддингов, извлекаемых сверточной частью моделей KAN и CNN. Для двух из 6 наборов данных (BRACOL и Rice Leaf Diseases) эмбеддинги, формируемые моделью KAN, показывают большее удаление (положительные значения в табл. 5) по сравнению с CNN.
Это не приводит к ухудшению метрик точности классификации, наблюдается даже рост Accuracy и F1. Есть и обратный пример (Plant Pathology), когда все Δ=KAN ‒ CNN отрицательные, но также дают рост и F1, и Accuracy. Как мы видели выше, во всех случаях имеем и рост FAR для класса грибковых заболеваний. В итоге, из результатов экспериментов не получилось выделить лучшую метрику сдвига наборов данных, однозначно определяющую устойчивость к сдвигу, ни для модели KAN, ни для CNN.
В более ранней работе авторов [22], при классификации болезней растений, по статистическим характеристикам их изображений, была использована полносвязная KAN-сеть, и значимая часть из обученных функций активации стали после обучения монотонными.
Табл. 5. Разность метрик доменного сдвига распределений для 512-мерных эмбеддингов KAN и CNN, снятых на выходном слое сверточной части сети. Разность метрик Accuracy и F1-macro дана в процентных пунктах (п.п.).

Рис. 7. Столбчатая диаграмма изменений распределения классов функций активации в сети KAN в процессе ее обучения на опорном наборе данных PlantVillage.
Исследовано также качественное и количественное изменение состава функций активации в процессе обучения (рис. 7).
На диаграмме различимы только 3 класса функций активации: унимодальные; мультимодальные и осциллирующие. Причем число мультимодальных функций остается доминирующим и слабо убывает с 61% до 59%, а число унимодальных постоянно растет (с 22,4% до 36,9%), за счет убывания осциллирующих (с 16.6% до 4,2%). При детальном рассмотрении обнаруживаются еще 2 малочисленных класса (около 0,01% каждый): монотонно возрастающие и монотонно убывающие функции. Примеры представителей 3-х основных классов приведены по эпохам сверху-вниз на рис.8.

Рис. 8. Примеры функций 3 классов (слева-направо): унимодальные; мультимодальные; осциллирующие, – по эпохам (сверху-вниз) с 1 по 40 с шагом 10.
Примеры представителей 3-х основных классов приведены по эпохам сверху-вниз на рис. 8.
Важным для понимания динамики структур функций в ходе обучения convKAN является то, что функции активации представлены радиально базисными функциями (RBF) Гаусса (см. формулы (1) и (2)), позволяющими управлять положением центра, шириной базиса кривой, весами и числом экстремумов.
Рост доли унимодальных функций в процессе обучения вероятно говорит о том, что KAN находит эффективные центры притяжения, снижая число осциллирующих функций и улучшая разделимость классов.
Полученные экспериментальные данные показали следующее:
Представляет интерес продолжение исследований в направлениях: углубления понимания классов структур функций активации и их динамики в ходе обучения KAN; развития метрик количественной оценки доменного сдвига и полноты этой оценки, исследования места FAR в оценке сдвига домена; дальнейшего развития архитектуры в сторону ускорения обучения и снижения затрат памяти.
Алексей Игоревич ЛАРИОНОВ – магистрант направления «Прикладная математика и информатика», профиль «Компьютерные науки и приложения», Института информационных технологий, математики и механики. Сфера научных интересов: машинное обучение, компьютерное зрение, устойчивость моделей к доменному сдвигу, сверточные нейронные сети и сети Колмогорова–Арнольда, интерпретируемость моделей.
Вадим Евгеньевич ТУРЛАПОВ – доктор технических наук, доцент, профессор кафедры высокопроизводительных вычислений и системного программирования Нижегородского государственного университета им. Н.И. Лобачевского. Сфера научных интересов: обработка изображений, искусственный интеллект, компьютерное зрение, гиперспектральные изображения, научная визуализация, геоинформатика, теория пространственных механизмов.