Свёрточная нейронная сеть (СНС)
Свёрточная нейронная сеть (СНС, англ. convolutional neural network, CNN) — архитектура искусственных нейронных сетей глубокого обучения, в которой обработка данных строится на последовательном применении операции свёртки с обучаемыми фильтрами. Такой подход позволяет автоматически выделять локальные признаки и сохранять пространственную структуру входных данных, имеющих сеточную топологию.
Что означает термин
Термин обозначает специализированный вид нейронных сетей, относящийся к семейству глубокого обучения. Название происходит от математической операции свёртки, которая лежит в основе вычислений внутри сети: обучаемые ядра-фильтры последовательно «сканируют» входной сигнал и формируют карты признаков. СНС были задуманы как эффективный инструмент распознавания образов и получили наибольшее распространение в задачах, где входные данные обладают пространственной или временной структурой — прежде всего в изображениях, а также в аудио и временных рядах.
Как устроено
Архитектура построена на чередовании специализированных слоёв: свёрточных, активационных (чаще всего с функцией ReLU) и пулинговых, то есть слоёв субдискретизации. Нейроны свёрточного слоя организованы в три измерения — ширину, высоту и глубину — и связаны только с небольшой областью предыдущего слоя, которая называется рецептивным полем. Общие веса в пределах одного фильтра позволяют одному и тому же набору признаков обнаруживаться в любой части входа, что сокращает число настраиваемых параметров по сравнению с полносвязной сетью.
Благодаря послойной обработке сеть формирует иерархию признаков: на ранних слоях выделяются рёбра, контуры и градиенты, на промежуточных — текстуры и фрагменты объектов, на глубоких — целостные структуры, соответствующие объектам или сценам. При этом, в отличие от классических нейронных сетей, которые преобразуют изображение в плоский одномерный массив, свёрточная сеть сохраняет пространственные взаимосвязи между элементами входа на всех этапах обработки.
Где применяется
Свёрточные нейронные сети считаются де-факто стандартом глубокого обучения для задач компьютерного зрения: классификации изображений, распознавания лиц, обнаружения и сегментации объектов на фото- и видеоматериалах. Среди известных архитектурных семейств — LeNet-5, AlexNet, VGG, ResNet, MobileNet, EfficientNet, RegNet, U-Net, R-CNN и его вариации Fast R-CNN и Faster R-CNN, YOLO, DenseNet, SegNet, DCGAN, CapsNet. Эти же подходы применяются в анализе медицинских снимков — рентгенограмм и МРТ — для выявления паттернов заболеваний и, например, выделения границ опухоли с помощью U-Net.
Помимо изображений, СНС используются для обработки аудиоданных и временных рядов: распознавания речи, классификации звуковых сигналов, работы с одномерными и двумерными сеточными данными. Спектрограммы речи и музыки, представленные в виде двумерных матриц, обрабатываются теми же архитектурными приёмами, что и изображения.
Отличие от близких понятий
От полносвязных нейронных сетей СНС отличаются двумя ключевыми свойствами: локальной связностью нейронов и разделяемыми весами фильтров. За счёт этого сеть одновременно сокращает объём хранимой в памяти информации и выделяет опорные признаки, пригодные для повторного использования в разных позициях входа. Существует также обратная по отношению к свёрточной архитектура — деконволюционная нейронная сеть, состоящая из деконволюционных слоёв и слоёв обратного пулинга и позволяющая восстанавливать пространственную структуру из сжатого представления.
История возникновения
Архитектура свёрточной нейронной сети была предложена Яном Лекуном в 1988 году. В её основу были положены наблюдения о строении зрительной коры, в которой были описаны простые клетки, реагирующие на прямые линии под разными углами, и сложные клетки, реакция которых связана с активацией определённого набора простых клеток.
База знаний организована при поддержке делового сообщества. Спираль?!

