МИНИСТЕРСТВО НАУКИ И ВЫСШЕГО ОБРАЗОВАНИЯ РОССИЙСКОЙ ФЕДЕРАЦИИ
____________________________
Кафедра ____________________________
РЕФЕРАТ
на тему: «Методы сегментации изображений на основе сверточных сетей»
Выполнил(а): ____________________________
Группа: ____________________________
Проверил(а): ____________________________
2026
Содержание
- 3
- 5
- 7
- 9
1. Эволюция и задачи сегментации изображений
Сегментация изображений, это разбиение кадра на связные области, каждая из которых обладает однородными семантическими свойствами. Проще говоря, каждому пикселю присваивается метка, определяющая его принадлежность к конкретному объекту или фону. Здесь есть фундаментальное отличие от классификации, где метка присваивается всему изображению целиком. Благодаря сегментации мы переходим от вопроса «что на картинке?» к вопросу «где именно находится каждый объект?».
В зависимости от того, насколько детально нужно описать сцену, выделяют три типа сегментации. Семантическая сегментация группирует пиксели по классам объектов, но не различает отдельные экземпляры одного класса: все автомобили на снимке будут закрашены одинаково. Инстансная сегментация идет дальше и выделяет каждый конкретный объект, даже если они принадлежат одному классу. Например, она разделит три машины на парковке на три разные маски. Паноптическая сегментация объединяет оба подхода. Она присваивает класс каждому пикселю и одновременно разделяет все объекты на уникальные экземпляры, включая фоновые области вроде дороги или неба.
Долгое время эта задача решалась классическими алгоритмами компьютерного зрения. Пороговая обработка делила изображение по яркости, методы выделения границ искали перепады интенсивности, а региональный рост последовательно присоединял пиксели к уже сформированным областям по критерию схожести. Эти подходы неплохо работали на простых, контролируемых сценах (например, на бинарных изображениях или снимках с равномерным фоном). Однако на сложных фотографиях реального мира, где есть тени, перекрытия объектов и текстурный шум, точность таких методов резко падала. Кроме того, они требовали ручной настройки параметров и не могли обобщаться на новые, незнакомые данные.
Перелом наступил с развитием глубокого обучения. Сверточные нейронные сети (CNN) позволили отказаться от ручного проектирования признаков. Вместо того чтобы вручную задавать правила поиска границ или однородных областей, сеть сама обучается извлекать иерархию признаков: от простых ребер и цветовых пятен на ранних слоях до сложных структурных элементов на глубоких. Ключевым преимуществом стал сквозной (end-to-end) подход. Изображение подается на вход, а на выходе получается готовая карта сегментации, при этом все промежуточные этапы оптимизируются совместно в процессе обучения. Это стало возможным благодаря большим размеченным наборам данных, таким как PASCAL VOC и Microsoft COCO, а также росту вычислительных мощностей GPU. Именно сверточные сети заложили основу для современных архитектур, которые будут рассмотрены в следующих главах.
2. Архитектуры кодировщик-декодировщик: U-Net
Архитектура U-Net, предложенная Олафом Роннебергером с коллегами в 2015 году на конференции Medical Image Computing and Computer Assisted Intervention, обошла ограничение, с которым плохо справлялись обычные сверточные сети. Классические классификаторы на свертках после серии пулингов теряют пространственное разрешение. Для задачи, где ответ должен быть не «что на картинке», а «где именно находится каждый пиксель», такая потеря критична. U-Net решает это за счет симметричной структуры из двух путей.
Сжимающий путь (энкодер) работает как стандартная CNN. Он последовательно применяет свертки и операции субдискретизации, уменьшая пространственные размеры карт признаков и увеличивая их глубину. На этом этапе сеть учится распознавать высокоуровневые абстракции: формы органов, текстуры тканей, границы объектов. Однако вместе с абстракциями уходит и точная пространственная информация. Если остановиться на этом, получится грубая карта сегментации с размытыми границами.
Расширяющий путь (декодер) восстанавливает разрешение. Транспонированные свертки увеличивают размеры карт признаков, постепенно возвращая изображение к исходному размеру. Но простое восстановление из сжатого представления дает неудовлетворительный результат. Сеть теряет память о том, где проходили тонкие границы или мелкие детали.
Здесь работают пропускные соединения (skip connections). Они переносят карты признаков с соответствующих уровней энкодера напрямую в декодер, где те конкатенируются с данными после апскейлинга. Это центральное архитектурное решение. Декодер получает не только абстрактные признаки, но и детальную информацию о пространственном расположении границ, сохраненную на ранних этапах сжатия. Благодаря этому U-Net выдает точные маски с корректной
классификацией каждого пикселя, включая стыки объектов.
Отдельного внимания заслуживает способность U-Net обучаться на малых наборах данных. В медицине размеченные изображения часто единичны: разметку выполняют врачи вручную, что дорого и медленно. Роннебергер справился с этим агрессивной аугментацией данных. К обучающим изображениям применялись случайные эластичные деформации, повороты, масштабирования и сдвиги. Синтетическое расширение выборки позволило сети обобщать закономерности без тысяч оригинальных примеров. В исходной статье сеть обучалась на 30 изображениях клеток и показала результаты, сопоставимые с более «тяжелыми» подходами.
Именно сочетание этих факторов сделало U-Net стандартом де-факто в медицинской визуализации. Она применяется для сегментации опухолей на МРТ-снимках мозга, выделения сосудов сетчатки глаза, разметки внутренних органов на КТ. В задаче сегментации нейронов на электронных микроскопических снимках (это был бенчмарк статьи 2015 года) U-Net превзошла предыдущий лучший результат с существенным отрывом. Позже архитектура перекочевала в другие области, от спутниковой съемки до анализа документов, но ее ядро, связка энкодер-декодер с пропускными путями, остается неизменным и воспроизводится в десятках последующих моделей.
3. Многомасштабный анализ: DeepLab
Развитие архитектур энкодер-декодер показало, что восстановление пространственной информации в целом возможно. Однако на пути всегда стоит фундаментальное ограничение: обычные свертки после серии пулингов теряют разрешение, а вместе с ним и мелкие детали изображения. Семейство DeepLab, разработанное в Google Research под руководством Лянцзе Чена, предложило иной путь решения. Вместо агрессивного сжатия и последующего восстановления исследователи модифицировали саму операцию свертки.
Ключевая идея состоит в использовании atrous сверток, которые также называют дырчатыми или расширенными. Стандартный фильтр обрабатывает соседние пиксели, тогда как atrous свертка вводит промежутки между элементами ядра. Величину этих промежутков определяет параметр rate. При rate, равном двум, ядро 3×3 захватывает область 5×5, а при rate, равном четырем, область 9×9. Поле восприятия растет экспоненциально, при этом количество обучаемых параметров и вычислительная сложность остаются неизменными. Главный плюс в том, что пространственное разрешение карты признаков не уменьшается, как при пулинге, а границы объектов сохраняются с высокой точностью.
Однако одна фиксированная скорость расширения решает лишь одну конкретную задачу. Объекты на изображении редко бывают однородными по размеру: автомобиль на переднем плане может занимать тысячи пикселей, а человек на заднем плане всего несколько десятков. Чтобы захватить такое разнообразие контекста, архитектура DeepLabv2 представила модуль Atrous Spatial Pyramid Pooling (сокращенно ASPP). Идея проста: параллельно применяются несколько atrous сверток с разными скоростями расширения, например, 6, 12 и 18. Каждая ветвь извлекает признаки на своем масштабном уровне, после чего результаты конкатенируются и обрабатываются сверткой 1×1. Такой подход напоминает пирамиду изображений в классическом компьютерном
зрении, но выполняется в единой сквозной нейросети.
Версия DeepLabv3, представленная в 2017 году, добавила к ASPP глобальный пулинг среднего значения, который дает обзор всей сцены целиком. Это особенно полезно для распознавания крупных однородных областей, таких как дорога или небо. Дальнейший анализ показал, что даже при сохранении разрешения границы объектов часто получаются размытыми. Причина в том, что atrous свертки эффективно захватывают контекст, но теряют локальные детали, критичные для точного определения контуров.
Решение пришло в виде гибридной структуры, реализованной в DeepLabv3+. Архитектура объединила сильные стороны двух подходов: энкодер на базе atrous сверток и ASPP извлекает богатый многомасштабный контекст, а легкий декодер восстанавливает детализацию границ. Декодер принимает низкоуровневые признаки из ранних слоев энкодера, которые содержат точную пространственную информацию, и объединяет их с выходом ASPP через конкатенацию и билинейную интерполяцию. Эта схема позволила добиться значительного прироста точности на бенчмарке PASCAL VOC 2012, где DeepLabv3+ достиг показателя 89% по метрике mIoU.
Практическая ценность DeepLab подтверждается его применением в системах автономного вождения и анализе спутниковых снимков. Метод особенно эффективен на сценах, где объекты разного масштаба присутствуют одновременно: пешеходы, дорожные знаки, здания и транспортные средства. Многомасштабный контекст, получаемый через ASPP, позволяет сети корректно классифицировать и мелкие, и крупные объекты без необходимости обрабатывать изображение на нескольких разрешениях. DeepLab здесь выступает практическим инструментом, который сочетает высокую точность с приемлемой вычислительной эффективностью.
4. Инстансная сегментация: Mask R-CNN
В отличие от архитектур, работающих с фиксированной сеткой, Mask R-CNN решает более сложную задачу: выделить каждый объект на изображении отдельно, даже если объектов десятки и они перекрывают друг друга. Метод предложили Каймин Хе, Георгий Гиршик, Пётр Доллар и Росс Гиршик в 2017 году на конференции International Conference on Computer Vision (ICCV). Авторы взяли за основу детектор Faster R-CNN и добавили к нему параллельную ветвь, которая предсказывает бинарную маску для каждого обнаруженного объекта. Так детектор превратился в инструмент инстансной сегментации.
Faster R-CNN работает в два этапа. Сначала региональная сеть предложений (Region Proposal Network) выдаёт прямоугольные области, где предположительно находятся объекты. Затем для каждой области применяется RoI Pooling, который вырезает фрагмент карты признаков и приводит его к фиксированному размеру. Именно здесь скрывалась проблема. Операция пулинга округляет координаты и делит область на ячейки сетки, из-за чего теряется точность пространственной привязки. Для задачи классификации объектов это допустимо, но для сегментации, где важен каждый пиксель, такие искажения становятся критичными.
Решение авторы назвали RoI Align. Вместо грубого округления координат метод использует билинейную интерполяцию: для каждой точки внутри области вычисляется значение признака как взвешенное среднее ближайших пикселей карты. Благодаря этому градиент распространяется корректно, а маска получается на уровне субпиксельной точности. В оригинальной статье показано, что замена RoI Pooling на RoI Align повышает точность масок примерно на 10-50% в зависимости от набора данных, а на COCO прирост составил около 2,8 пункта по метрике mask AP.
Архитектура маски в Mask R-CNN асимметрична относительно классификации и регрессии рамок. Для каждого региона сеть предсказывает маску размером 28×28 пикселей. Классификация при этом отвечает за то, к какому классу принадлежит объект, а маска формируется независимо для каждого класса. Такой подход развязывает две задачи: детектор может ошибиться в классе, но маска останется корректной по форме. Интересная деталь: ветвь маски использует свертки с меньшим числом каналов, чем ветви классификации, что снижает вычислительную нагрузку без потери качества.
Mask R-CNN стал стандартом для задач, где нужно не просто найти объект, но и понять его точные границы. В автономном вождении модель помогает отделить пешехода от фона, даже когда человек частично скрыт за припаркованным автомобилем. В робототехнике она позволяет манипуляторам захватывать предметы произвольной формы: робот видит не прямоугольник вокруг чашки, а её контур, и может рассчитать точку захвата. В анализе медицинских изображений метод применяют для сегментации опухолей и органов на снимках МРТ и КТ, где границы поражённых тканей часто нечётки и требуют попиксельной точности.
Работа Хе и его коллег получила награду Best Paper Award на ICCV 2017. С тех пор архитектура многократно модифицировалась, появлялись версии с более лёгкими магистралями и улучшенными механизмами внимания. Однако базовый принцип, связка детектора и точной маски через RoI Align, остаётся неизменным и закладывается в фундамент современных систем инстансной сегментации.
Нужна такая же работа по своей теме? Соберём структуру, текст и источники в этом же оформлении.