Top.Mail.Ru
Соберём структуру, текст и источники.
Создать такую же
Учебная работа

Ключевые архитектуры нейронных сетей и их применение

Автор:

Опубликовано

Анализ ключевых архитектур нейронных сетей (CNN, RNN, Transformer) и их применения в обработке изображений, текста и временных рядов.

Учебная работа 4 главы ≈11 страниц 0 источников

Работа подготовлена в СтудБанке с помощью ИИ и проверяется автором перед сдачей.

Создать такую жеГотовая работа по ГОСТу — от 99₽
Ключевые архитектуры нейронных сетей и их применение.docx
A4 · 11 стр. · Times New Roman 14, интервал 1,5
1 / 11

МИНИСТЕРСТВО НАУКИ И ВЫСШЕГО ОБРАЗОВАНИЯ РОССИЙСКОЙ ФЕДЕРАЦИИ

____________________________

Кафедра ____________________________

РЕФЕРАТ

на тему: «Ключевые архитектуры нейронных сетей и их применение»

Выполнил(а): ____________________________

Группа: ____________________________

Проверил(а): ____________________________

2026

Содержание

  1. 3
  2. 5
  3. 8
  4. 10
2

1. Эволюция архитектур нейронных сетей

История нейросетевых архитектур начинается с устройства, радикального для своего времени: перцептрона Фрэнка Розенблатта, представленного в 1958 году. Это была однослойная модель, способная обучаться классификации бинарных векторов. Однако её возможности упирались в жёсткое ограничение: перцептрон мог разделять только линейно separable множества. Наглядный пример неудачи описан Марвином Мински и Сеймуром Пейпертом в книге «Перцептроны» (1969), где показано, что модель не в состоянии решить даже элементарную задачу XOR. Этот результат, подкреплённый математическим доказательством, на долгие годы заморозил финансирование исследований в области нейросетей.

Выход из концептуального тупика потребовал пересмотра структуры сети. Решение заключалось в добавлении промежуточных слоёв нейронов, которые позволяли модели строить сложные нелинейные границы решений. Но многослойные сети долго не могли обучаться из-за отсутствия эффективного алгоритма корректировки весов для скрытых слоёв. Прорыв случился в 1986 году, когда Дэвид Румельхарт, Джеффри Хинтон и Рональд Уильямс опубликовали работу, популяризировавшую метод обратного распространения ошибки. Суть метода в том, что ошибка, вычисленная на выходе, последовательно передаётся назад по слоям, корректируя каждый вес пропорционально его вкладу в итоговый результат. Именно этот алгоритм превратил нейросети из теоретической игрушки в рабочий инструмент.

Но даже с алгоритмом обучения практическое применение сетей оставалось ограниченным. И дело было не в математике, а в физике. Глубокие сети с большим числом слоёв требовали колоссальных вычислительных ресурсов, которых в 1980-х просто не существовало. Обучающие выборки были малы, а скорость процессоров недостаточной. Ситуация начала меняться только к концу 2000-х, когда параллельные вычисления на GPU

3

стали доступны исследователям. Использование графических процессоров для матричных операций ускорило обучение в десятки раз, а появление больших размеченных датасетов, таких как ImageNet, дало моделям необходимый объём данных. Эти два фактора, мощность и данные, стали катализаторами бума глубокого обучения, стартовавшего после 2012 года.

Каждая новая архитектура возникала не на пустом месте, а как ответ на конкретную нерешённую проблему предшественников. Свёрточные сети стали реакцией на неспособность полносвязных слоёв эффективно обрабатывать изображения: они игнорировали пространственную структуру пикселей и требовали слишком много параметров. Рекуррентные сети, в свою очередь, были созданы для работы с последовательностями, где полносвязные архитектуры теряли контекст. Однако RNN страдали от проблемы затухания градиента, что решалось введением управляющих механизмов в LSTM и GRU. Но даже LSTM имели фундаментальный недостаток: их нельзя было параллелить при обучении, так как обработка каждого следующего элемента зависела от предыдущего состояния. Именно это ограничение, а не только качество, привело к созданию архитектуры Transformer в 2017 году, которая отказалась от последовательной обработки в пользу механизма самовнимания, позволив вычислять зависимости между всеми элементами сразу.

Так, шаг за шагом, от линейного перцептрона до глубоких трансформеров, развитие определялось не столько модой, сколько конкретными инженерными задачами и доступными ресурсами. Каждая архитектура, это не просто улучшение предыдущей, а переосмысление подхода к данным определённого типа.

4

2. Сверточные сети для анализа изображений

Обычная полносвязная сеть, получив на вход изображение 256 на 256 пикселей в цветовом пространстве RGB, оперирует вектором из почти двухсот тысяч чисел. Каждому нейрону первого скрытого слоя пришлось бы устанавливать отдельные веса для каждого из этих значений. Уже на старте это дает миллионы параметров, требует огромных вычислительных ресурсов и провоцирует переобучение. Сверточные нейронные сети (CNN) решают эту проблему совсем иначе, используя операцию свертки.

Свертка представляет собой математическую операцию, при которой небольшое окно фильтра (например, 3x3) скользит по всему изображению и вычисляет скалярное произведение своих весов с локальной областью пикселей. Такой подход меняет саму парадигму обработки. Один и тот же фильтр применяется ко всей картинке, что дает свойство инвариантности к сдвигу: если объект сместился, фильтр все равно его найдет. Кроме того, количество параметров резко сокращается. Один фильтр 3x3 для одного канала имеет всего девять весов, а не сотни тысяч, как в полносвязном слое. Именно локальность восприятия и разделение весов делают CNN естественным выбором для анализа визуальной информации, где важны пространственные структуры: края, текстуры, градиенты.

Типичная архитектура CNN собирается из четырех базовых строительных блоков. Сверточные слои извлекают признаки. Функции активации, чаще всего ReLU (выпрямитель), вносят в модель нелинейность. Без нее любая глубокая сеть выродилась бы в простую линейную трансформацию. Пулинг (подвыборка) уменьшает пространственную размерность карт признаков, отбрасывая несущественные детали и увеличивая поле восприятия последующих слоев. Наконец, полносвязные слои в конце сети собирают извлеченные абстрактные признаки в вектор вероятностей для классов. В современных архитектурах полносвязные слои часто заменяют на глобальный пулинг, но классическая схема остается

5

той самой базой, с которой начинается понимание CNN.

История взрывного развития CNN неразрывно связана с соревнованием по классификации изображений ImageNet. В 2012 году сеть AlexNet, представленная Алексом Крижевским и Джеффри Хинтоном, совершила прорыв, снизив ошибку топ-5 почти вдвое по сравнению с лучшими традиционными методами. Она показала, что глубина сети и использование GPU для обучения дают колоссальный выигрыш. Затем, в 2014-м, сеть VGG от группы Карен Симонян продемонстрировала, что последовательное наложение множества маленьких фильтров 3x3 эффективнее одного большого фильтра. VGG доказала: простое увеличение глубины улучшает качество, хотя платой становится рост числа параметров. Кульминацией масштабирования стала сеть ResNet, предложенная Каем Хэ и его коллегами в 2015 году. Она решила проблему деградации точности при обучении очень глубоких сетей, введя «остаточные» (skip) соединения, которые позволяют градиенту свободно проходить через десятки и сотни слоев. ResNet с 152 слоями не просто победила в ImageNet, она открыла эпоху ультра-глубоких архитектур.

Сегодня CNN, это рабочий инструмент для трех основных задач компьютерного зрения. В классификации изображений сети определяют, что именно находится на картинке, достигая точности, превосходящей человеческую на наборе данных ImageNet (ошибка топ-5 ниже 5%). В детекции объектов, где архитектуры вроде Faster R-CNN или YOLO используют сверточные сети как основу для поиска и локализации объектов, системы находят лица на фотографиях или пешеходов на дороге в реальном времени. В задаче сегментации, например в медицинской визуализации, сети типа U-Net присваивают каждому пикселю свой класс, позволяя врачам выделять опухоли на снимках МРТ с точностью, сопоставимой с работой опытного радиолога. Таким образом, именно сочетание локальности свертки, эффективного масштабирования и четкой архитектурной логики превратило CNN в стандарт де-факто для анализа изображений, от которого отталкиваются

6

все более новые подходы, включая трансформеры.

7

3. Рекуррентные сети и анализ последовательностей

Когда сеть сталкивается с последовательностью, будь то предложение, аудиодорожка или биржевые котировки, обычная архитектура пасует. Каждый элемент подается на вход независимо, и порядок теряется. Рекуррентные нейронные сети (RNN) решили эту проблему радикально: они добавили в нейрон петлю обратной связи. Скрытое состояние сети на шаге t передается на шаг t+1 вместе с новым входным вектором. Так у сети появляется внутренняя память, нечто вроде рабочей тетради, куда записываются выводы о предыдущих элементах. Именно эта особенность позволяет модели учитывать контекст: в фразе «он поел, потому что был голоден» сеть связывает «голоден» с «поел», хотя между ними несколько слов.

Но простая RNN, описанная в работе Джеффри Хинтона и его коллег в 1986 году, страдала от серьезного недуга. При обучении через обратное распространение ошибки градиенты, проходя через десятки временных шагов, многократно перемножаются на веса рекуррентных связей. Если эти веса меньше единицы, градиент экспоненциально затухает, стремясь к нулю. Сеть перестает учиться, и память о дальних событиях испаряется. Противоположная ситуация, взрыв градиента, тоже случается, но лечится проще, простым обрезанием значений.

В 1997 году Зепп Хохрайтер и Юрген Шмидхубер предложили архитектуру LSTM (Long Short-Term Memory), которая ввела в ячейку управляющие механизмы: входной, забывающий и выходной вентили. Забывающий вентиль решает, какую часть старой информации стереть, входной определяет, что записать нового, а выходной фильтрует, что отдать дальше. Эти вентили представляют собой сигмоидные функции, значения которых лежат между нулем и единицей. Они позволяют градиенту течь через ячейку почти без препятствий, сохраняя информацию на сотни шагов. Позже, в 2014 году, Кёнхён Чо упростил LSTM до GRU (Gated Recurrent Unit), объединив вентили обновления и сброса. GRU

8

содержит меньше параметров, обучается быстрее и на многих задачах показывает сопоставимое качество.

Благодаря памяти RNN стали основным инструментом для задач с последовательной природой. Машинный перевод, например, строился на архитектуре «кодер-декодер», где одна сеть читает исходное предложение, а другая генерирует перевод слово за словом. Системы генерации текста, обученные на корпусах книг, способны продолжать абзац в стиле автора, предсказывая следующее слово по распределению вероятностей. В финансовом анализе рекуррентные сети прогнозируют временные ряды: курс валют, спрос на электроэнергию, нагрузку на серверы. Модель LSTM, обученная на исторических данных, улавливает сезонные колебания и долгосрочные тренды, которые ускользают от линейных методов.

Однако у RNN есть врожденный недостаток: обработка последовательности строго последовательна. Чтобы вычислить скрытое состояние на шаге t, нужно дождаться результата шага t-1. Это делает обучение медленным, особенно на длинных текстах, и не позволяет использовать мощь современных GPU в полной мере. Параллелизация, краеугольный камень обучения больших моделей, здесь принципиально невозможна. Именно это ограничение, вместе с проблемой удержания контекста на очень больших расстояниях, подтолкнуло исследователей к поиску альтернатив. В 2017 году команда Google опубликовала статью «Attention Is All You Need», представив архитектуру Transformer, которая отказалась от рекуррентности в пользу механизма самовнимания. Эта работа не просто решила проблему параллелизации, она перевернула всю область обработки естественного языка, оставив RNN роль надежного, но устаревшего инструмента для специфических задач.

9

4. Трансформеры и современные приложения

Рекуррентные сети обрабатывали последовательности строго по порядку, и в этом крылось их главное ограничение. Чтобы понять слово в конце длинного предложения, сети приходилось последовательно «пропустить» через себя все предыдущие. В 2017 году вышла статья «Attention Is All You Need», где архитектура Transformer была представлена миру. Команда исследователей из Google предложила отказаться от рекурсии в пользу механизма самовнимания.

Самовнимание работает так: модель устанавливает связи между любой парой элементов последовательности напрямую, независимо от расстояния. Для каждого слова вычисляются три вектора: запрос, ключ и значение. Вес внимания между двумя словами определяется скалярным произведением запроса одного на ключ другого. Получается, что за один проход модель видит, какие части предложения важны друг для друга. Возьмём фразу «животное не перешло улицу, потому что оно устало». Трансформер легко свяжет местоимение «оно» с существительным «животное», даже если между ними десятки слов.

Отказ от последовательной обработки дал неожиданный побочный эффект. Архитектуру стало возможно эффективно параллелить. Обучение на графических процессорах ускорилось на порядки, и это позволило строить модели с сотнями миллиардов параметров. Скачок произошёл именно из-за масштаба, а не только из-за нового механизма.

В 2018 году появились две модели, которые определили развитие NLP на годы вперёд. BERT от Google использовал двунаправленное самовнимание: он читал текст целиком и предсказывал замаскированные слова в контексте. GPT от OpenAI обучался иначе: предсказывал следующее слово, читая текст только слева направо. Оба подхода показали результаты, превосходящие всё, что было раньше. BERT поднял

10

точность в задачах понимания языка, например в ответах на вопросы и анализе тональности. GPT впечатлил способностью генерировать связный текст.

Прорыв состоял не столько в самой архитектуре, сколько в методе её использования. Сначала модель обучается на огромном корпусе текста без разметки: она просто учится предсказывать пропущенные слова. Этот этап, называемый предобучением, требует серьёзных вычислительных ресурсов, но взамен даёт модели глубокое понимание языка. Затем модель адаптируется под конкретную задачу: классификацию, перевод или суммаризацию. Для тонкой настройки нужно уже всего несколько тысяч размеченных примеров, а не миллионы. Такая парадигма сделала передовые NLP-технологии доступными для широкого круга исследователей и компаний.

Архитектура оказалась универсальной, потому что работает с последовательностями любых токенов, а не только слов. В 2020 году команда Google Research представила ViT (Vision Transformer). Модель разбивает изображение на квадратные патчи (например, 16×16 пикселей) и подаёт их как последовательность «слов». Подход позволил достичь качества, сравнимого со сверточными сетями, а на больших наборах данных даже превзойти их. Трансформеры также применяются для анализа временных рядов: они улавливают долгосрочные зависимости в данных датчиков или финансовых котировках, где рекуррентные сети часто пасовали.

Сегодня трансформеры лежат в основе не только языковых моделей вроде GPT-4 и Claude, но и систем генерации изображений, таких как DALL-E. Они стали фактическим стандартом для работы с последовательностями. Архитектура, задуманная как альтернатива рекуррентным сетям, превратилась в универсальный инструмент, который продолжает расширять свои границы. Каждое новое применение подтверждает простую мысль: если данные можно представить как последовательность элементов, трансформер, скорее всего, сможет с ними справиться.

11

Нужна такая же работа по своей теме? Соберём структуру, текст и источники в этом же оформлении.

Создать похожую

Сделайте такую же работу за пару минут

Любая тема, готовая структура, источники и оформление по ГОСТу. Первая работа — бесплатно.

Создать такую же

Как это работает

1. Опишите тему
Укажите тему и тип работы — остальное предложит ИИ.
2. Проверьте план
Структура, главы и источники по ГОСТу — редактируйте как нужно.
3. Скачайте в Word
Готовый документ с титульным листом и оглавлением.
Оформление по ГОСТу Готово за пару минут Источники и цитирование Экспорт в Word и PDF

Частые вопросы

Сколько стоит учебная работа?

Создание и редактирование — бесплатно. Платите только за доступ к готовой работе: доклад от 49₽, реферат от 99₽, курсовая от 199₽. Экспорт в DOCX/PDF после открытия — бесплатно.

Работа оформлена по ГОСТу?

Да. Титульный лист, содержание, поля, шрифт Times New Roman 14, интервал 1.5 — всё по ГОСТу. Скачивается в Word и PDF.

Можно ли редактировать текст?

Да, любой раздел можно отредактировать или перегенерировать прямо в редакторе перед скачиванием.

Похожие работы

Все работы по предмету «Информатика»