Top.Mail.Ru
Соберём структуру, текст и источники.
Создать такую же
Учебная работа

Историческое развитие сверточных нейронных сетей

Автор:

Опубликовано

В работе рассматривается эволюция сверточных нейронных сетей от первых архитектур до современных моделей, анализируются ключевые этапы развития и их влияние на область компьютерного зрения.

Учебная работа 4 главы ≈11 страниц 0 источников

Работа подготовлена в СтудБанке с помощью ИИ и проверяется автором перед сдачей.

Создать такую жеГотовая работа по ГОСТу — от 99₽
Историческое развитие сверточных нейронных сетей.docx
A4 · 11 стр. · Times New Roman 14, интервал 1,5
1 / 11

МИНИСТЕРСТВО НАУКИ И ВЫСШЕГО ОБРАЗОВАНИЯ РОССИЙСКОЙ ФЕДЕРАЦИИ

____________________________

Кафедра ____________________________

РЕФЕРАТ

на тему: «Историческое развитие сверточных нейронных сетей»

Выполнил(а): ____________________________

Группа: ____________________________

Проверил(а): ____________________________

2026

Содержание

  1. 3
  2. 5
  3. 7
  4. 9
2

1. От биологического зрения к первым сверткам

Современные сверточные нейронные сети выросли из двух корней: математики и нейробиологии середины XX века. В 1962 году Дэвид Хьюбел и Торстен Визель изучали зрительную кору кошки и наткнулись на любопытную закономерность. Нейроны не реагировали на картинку целиком, а откликались только на отдельные фрагменты. Одни клетки возбуждались, когда видели горизонтальную линию, другие срабатывали на вертикальную, третьи ловили движение в определенном направлении. Так появилось деление на простые и сложные клетки, выстроенные в иерархию. Простые детектируют элементарные признаки, а сложные собирают их вместе и сохраняют реакцию, даже если стимул немного сместился. Это открытие объяснило, как мозг складывает целостную картину из разрозненных деталей.

Переносить эти принципы на машинное обучение пробовали не раз, но долгое время безуспешно. Ранние перцептроны Фрэнка Розенблатта (1958 год) умели распознавать простые образы, но работали на полносвязной обработке. Каждый пиксель соединялся с каждым нейроном, и число параметров росло катастрофически. Уже для картинки 32 на 32 точки сеть становилась неуправляемой. Вдобавок перцептроны не выдерживали сдвигов: если объект смещался на пару пикселей, результат рассыпался.

Прорыв сделал японский исследователь Кунихико Фукусима. В 1980 году он представил архитектуру Neocognitron, названную в честь зрительной коры. Фукусима придумал чередовать два типа слоев. Слои S (simple) выполняли свертку: набор обучаемых фильтров проходил по изображению и выделял локальные признаки (границы, углы, дуги). Слои C (complex) делали субдискретизацию, или пулинг, и уменьшали пространственное разрешение карт признаков. За счет этого сеть становилась устойчивой к небольшим искажениям и смещениям. Именно это чередование, подсмотренное в организации зрительной коры, легло в

3

основу всех последующих сверточных сетей.

Neocognitron выглядел изящно, но у него был серьезный изъян. Обучение шло по правилу, близкому к конкурентному, без обратного распространения ошибки. Этот метод формализовали в 1986 году Дэвид Румельхарт и Джеффри Хинтон, но к моменту появления Neocognitron он еще не получил широкой известности. Фукусиме приходилось настраивать веса вручную или через локальные правила, что отнимало массу сил и сдерживало возможности сети. Neocognitron справлялся с рукописными символами в контролируемых условиях, но на больших наборах данных его не обучить, а точность оставляла желать лучшего. Сама идея была верной, однако без эффективного алгоритма обучения практическое применение откладывалось. Понадобилось почти два десятилетия, чтобы эта архитектура ожила в работах Яна Лекуна.

4

2. LeNet-5 и эпоха обратного распространения

К 1998 году Ян Лекун уже хорошо знал, как обучать нейросети методом обратного распространения ошибки. Но именно LeNet-5 стала первой сверточной архитектурой, где этот метод работал по-настоящему эффективно и использовался на практике. Сеть создавалась для одной конкретной задачи: распознавание рукописных цифр на банковских чеках.

Главная инженерная находка Лекуна состояла в том, что он чередовал сверточные и субдискретизирующие слои. Сверточные слои вытаскивали локальные признаки: изгибы, углы, пересечения линий. Субдискретизирующие слои (пулинг) уменьшали пространственное разрешение карт признаков, и сеть переставала бояться небольших смещений и деформаций изображения. Такая структура радикально сокращала количество обучаемых параметров по сравнению с полносвязными сетями. Последние требовали огромных вычислительных ресурсов и легко переобучались на ограниченных данных.

Метод обратного распространения ошибки решил проблему настройки параметров. Ранние модели требовали ручного проектирования детекторов признаков, здесь же сеть сама корректировала веса сверточных фильтров. Ошибка, вычисленная на выходе, распространялась назад по слоям, и градиент показывал, в какую сторону менять каждый вес, чтобы минимизировать расхождение между предсказанием и истинной меткой. Этот автоматический процесс обучения стал качественным прорывом. Он отделил LeNet-5 от предшественников, у которых не было механизма обучения с учителем и которые так и остались лабораторными экспериментами.

Чтобы проверить, как работает сеть, Лекун собрал датасет MNIST. В нем было 70 000 размеченных изображений рукописных цифр размером 28×28 пикселей. Это оказался не просто набор картинок, а стандартизированный тест, позволяющий объективно сравнивать разные алгоритмы. LeNet-5 показала на MNIST точность около 99,2%, что для того

5

времени выглядело впечатляюще. Сеть не ограничилась теорией: ее внедрили в банковские системы США и Европы для автоматической обработки чеков, и она обрабатывала миллионы документов.

Успех LeNet-5 продемонстрировал, что глубокие архитектуры с локальным восприятием и обучением по градиенту способны превзойти классические методы распознавания образов, основанные на ручной разработке признаков. Neocognitron Фукусимы показывал концептуальную правильность иерархической обработки, но именно сочетание сверточных слоев с обратным распространением ошибки превратило идею в рабочую технологию. Путь к практическому применению открылся, хотя до широкого распространения вычислительных мощностей, способных обучать по-настоящему глубокие сети, оставалось еще более десятилетия.

6

3. Возрождение: AlexNet и эра глубокого обучения

К 2012 году LeNet-5 оставалась скорее блестящим экспериментом, чем рабочим инструментом для реальных задач. Масштаб изображений, вычислительные мощности и отсутствие эффективных методов борьбы с переобучением тормозили развитие. Но в сентябре того года группа исследователей из Университета Торонто представила сеть AlexNet на соревновании ImageNet. Этот момент стал точкой бифуркации для всей области компьютерного зрения.

Алексей Крижевский, Илья Суцкевер и Джеффри Хинтон создали архитектуру, которая не просто улучшила показатели, а обрушила их. Если в 2011 году лучший алгоритм ошибался в 26,2% случаев при распознавании 1000 классов объектов, то AlexNet показала ошибку в 15,3%. Разрыв в 10,9 процентных пункта казался нереальным. Сеть состояла из восьми обучаемых слоев: пяти сверточных и трех полносвязных. Она использовала нелинейную функцию ReLU вместо традиционных гиперболического тангенса или сигмоиды. Это ускоряло обучение в разы: градиент при положительных значениях аргумента не затухал, и сеть не «застревала» на начальных этапах.

Секрет успеха лежал не только в архитектуре, но и в техническом оснащении. Крижевский и его коллеги обучали модель на двух видеокартах NVIDIA GTX 580 в течение шести дней. GPU, изначально предназначенные для рендеринга игр, оказались идеальной средой для матричных операций, лежащих в основе нейросетей. Одна видеокарта выполняла до 4,5 терафлопс вычислений с плавающей запятой. Это в десятки раз превосходило возможности современных центральных процессоров. Сеть обрабатывала 1,2 миллиона изображений из базы ImageNet, разбитых на 1000 категорий. Для CPU такой объем данных был бы неподъемным: обучение заняло бы месяцы, а не дни.

7

Переобучение стало главным врагом при работе с такой огромной выборкой. AlexNet насчитывала около 60 миллионов параметров, и сеть легко могла просто заучить обучающие примеры наизусть. Для борьбы с этим Крижевский применил два приема. Первый, dropout. Во время обучения случайным образом отключалась половина нейронов в полносвязных слоях. Сеть каждый раз собирала «разреженную» версию самой себя и вынуждена была находить более устойчивые закономерности. На тестовых данных это снижало ошибку примерно на 2%. Второй прием, аугментация данных. Исходные изображения произвольно сдвигались, отражались по горизонтали и изменялись по яркости. Так из 1,2 миллиона картинок сеть получала фактически бесконечный поток вариаций. Это делало ее устойчивой к сдвигам и освещению.

Результат AlexNet оказался настолько убедительным, что переформатировал исследовательскую повестку. До 2012 года доминировали методы ручного конструирования признаков (SIFT, HOG и другие дескрипторы). После победы нейросети стало очевидно, что автоматическое извлечение признаков из данных работает лучше. GPU-вычисления превратились из экзотики в стандарт отрасли. Уже через год исследователи по всему миру перешли на обучение глубоких сетей, а сама AlexNet стала отправной точкой для таких архитектур, как VGG и GoogLeNet. Крижевский, Суцкевер и Хинтон не изобрели принципиально новый тип сети. Они доказали, что при достаточной вычислительной мощи и правильной регуляризации старые идеи о свертках начинают работать в масштабе, недоступном ранее.

8

4. Современные архитектуры и перспективы развития

Победа AlexNet в 2012 году вскрыла любопытный парадокс: чем глубже становилась сеть, тем выше была точность, но лишь до определенного предела. Дальнейшее наращивание слоев приводило к странному эффекту: ошибка на обучении росла, хотя переобучения не наблюдалось. Градиенты, проходя через десятки последовательных преобразований, затухали или взрывались. Сеть буквально переставала обучаться.

Решение пришло в 2015 году от команды Microsoft Research под руководством Каймина Хэ. Архитектура ResNet предложила обходной маневр: остаточные связи. Вместо того чтобы каждой группе слоев изучать искомое отображение H(x), сети предлагалось выучить лишь поправку F(x) = H(x) − x. Итоговый выход слоя вычислялся как F(x) + x. Такая «короткая» связь позволяла градиенту беспрепятственно течь в обратном направлении, минуя промежуточные преобразования. Результат оказался ошеломляющим: сеть глубиной в 152 слоя, ResNet-152, показала ошибку 3,57% на ImageNet, превзойдя человеческий уровень (около 5%) и победив в соревновании ILSVRC 2015. Остаточные связи решили проблему деградации. Именно этот принцип стал фундаментом для подавляющего большинства последующих архитектур.

Дальнейшее развитие пошло не только вглубь, но и вширь. Ручная настройка тысяч гиперпараметров (ширина слоев, разрешение входных изображений) стала узким местом. В 2019 году команда Google Brain представила EfficientNet, где эти параметры подбирались автоматически. Метод, названный compound scaling, масштабировал сеть по трем осям одновременно: глубине, ширине и разрешению. Но делал это согласованно, а не по отдельности. Поиск оптимальной конфигурации выполнялся с помощью нейросетевого поиска архитектуры (NAS). EfficientNet-B7 достигла точности 84,4% на ImageNet, используя при этом в разы меньше вычислений, чем ее предшественники сопоставимого

9

качества. Автоматический поиск архитектуры перестал быть экзотикой. Он стал стандартным инструментом проектирования.

Сегодняшний ландшафт компьютерного зрения определяется не только чисто сверточными моделями. Параллельно развивались трансформеры, изначально созданные для обработки текста. Их механизм внимания способен улавливать глобальные зависимости в данных, тогда как свертка работает локально. Закономерным шагом стало появление гибридных архитектур, объединяющих оба подхода. Модели вроде Vision Transformer (ViT) показали, что чистые трансформеры способны конкурировать со сверточными сетями на крупных наборах данных. Однако на практике выигрывают гибриды, например, ConvNeXt или CoAtNet. В них сверточные блоки отвечают за извлечение локальных признаков, а слои внимания выстраивают связи между удаленными участками изображения. Такое сочетание существенно расширяет возможности: модель видит и мелкие текстуры, и общий контекст сцены.

Эти архитектурные находки быстро перекочевали из академических статей в прикладные продукты. Медицинская диагностика использует ResNet-подобные сети для анализа снимков МРТ и компьютерной томографии, где точность критична. Беспилотные автомобили опираются на EfficientNet и ее производные для семантической сегментации дорожной сцены в реальном времени, жертвуя точностью ради скорости. В мобильных устройствах, где ресурсы ограничены, применяются облегченные варианты, найденные автоматическим поиском (например, MobileNet). Гибридизация со вниманием позволяет системам видеонаблюдения не просто фиксировать объекты, но и анализировать их поведение, выделяя аномалии среди множества движущихся людей.

Дальнейшие перспективы связаны не столько с изобретением принципиально новых слоев, сколько с интеграцией. Сверточные сети перестали быть самодостаточной технологией, превратившись в компонент более сложных мультимодальных систем, где визуальная

10

информация сочетается с текстом и звуком. Соревнование между чистыми трансформерами и гибридами пока не завершено, но именно конвергенция подходов выглядит наиболее перспективным направлением развития.

11

Нужна такая же работа по своей теме? Соберём структуру, текст и источники в этом же оформлении.

Создать похожую

Сделайте такую же работу за пару минут

Любая тема, готовая структура, источники и оформление по ГОСТу. Первая работа — бесплатно.

Создать такую же

Как это работает

1. Опишите тему
Укажите тему и тип работы — остальное предложит ИИ.
2. Проверьте план
Структура, главы и источники по ГОСТу — редактируйте как нужно.
3. Скачайте в Word
Готовый документ с титульным листом и оглавлением.
Оформление по ГОСТу Готово за пару минут Источники и цитирование Экспорт в Word и PDF

Частые вопросы

Сколько стоит учебная работа?

Создание и редактирование — бесплатно. Платите только за доступ к готовой работе: доклад от 49₽, реферат от 99₽, курсовая от 199₽. Экспорт в DOCX/PDF после открытия — бесплатно.

Работа оформлена по ГОСТу?

Да. Титульный лист, содержание, поля, шрифт Times New Roman 14, интервал 1.5 — всё по ГОСТу. Скачивается в Word и PDF.

Можно ли редактировать текст?

Да, любой раздел можно отредактировать или перегенерировать прямо в редакторе перед скачиванием.

Похожие работы

Все работы по предмету «История»