Top.Mail.Ru
Соберём структуру, текст и источники.
Создать такую же
Учебная работа

Методы снижения размерности в задачах машинного обучения

Автор:

Опубликовано

Работа рассматривает методы снижения размерности: PCA, t-SNE и автоэнкодеры. Анализируются их преимущества и ограничения, а также применение для визуализации и предобработки данных.

Учебная работа 4 главы ≈13 страниц 0 источников

Работа подготовлена в СтудБанке с помощью ИИ и проверяется автором перед сдачей.

Создать такую жеГотовая работа по ГОСТу — от 99₽
Методы снижения размерности в задачах машинного обучения.docx
A4 · 13 стр. · Times New Roman 14, интервал 1,5
1 / 13

МИНИСТЕРСТВО НАУКИ И ВЫСШЕГО ОБРАЗОВАНИЯ РОССИЙСКОЙ ФЕДЕРАЦИИ

____________________________

Кафедра ____________________________

РЕФЕРАТ

на тему: «Методы снижения размерности в задачах машинного обучения»

Выполнил(а): ____________________________

Группа: ____________________________

Проверил(а): ____________________________

2026

Содержание

  1. 3
  2. 6
  3. 8
  4. 11
2

1. Проблема размерности в анализе данных

Когда данные описываются сотнями или тысячами признаков, аналитик сталкивается с явлением, которое Ричард Беллман в 1961 году назвал «проклятием размерности». Суть в том, что объём пространства растёт экспоненциально с числом измерений. В одномерном отрезке длиной 10 достаточно десяти точек для плотного покрытия. В десятимерном гиперкубе с тем же ребром плотное покрытие потребует 10^10 точек. На практике это означает, что при фиксированном размере выборки точки оказываются разбросаны по огромному объёму, и расстояния между соседями становятся почти одинаковыми.

Разреженность данных разрушает интуицию, которую мы привыкли использовать в маломерных задачах. В трёхмерном пространстве две точки легко соединить прямой и понять их взаимное расположение. В пространстве 50 признаков каждая точка оказывается ближе к границе гиперсферы, чем к центру распределения, что делает метрики расстояния малопригодными для поиска ближайших соседей. Алгоритмы, основанные на измерении близости, такие как k-ближайших соседей или кластеризация, начинают давать случайные результаты. С ростом размерности объём выборки, необходимый для сохранения статистической значимости оценок, растёт экспоненциально, и собрать такие данные практически невозможно.

Проклятие размерности бьёт не только по метрикам, но и по обобщающей способности моделей. Когда признаков много, а наблюдений мало, модель легко выучивает шум в обучающей выборке. Это состояние называют переобучением: на тренировочных данных ошибка мала, но на новых примерах модель показывает плохие результаты. Регуляризация частично спасает ситуацию, однако она не решает проблему избыточности информации. Если часть признаков дублирует друг друга или не связана с целевой переменной, модель тратит свои параметры на запоминание случайных закономерностей. Уменьшение числа измерений

3

снижает степень свободы модели, вынуждая её искать более общие закономерности. Джером Фридман в своей работе 1997 года показал, что при фиксированном объёме выборки оптимальная размерность признакового пространства конечна: после определённого порога добавление новых признаков только ухудшает качество прогноза.

Существует два принципиально разных подхода к снижению размерности. Первый, отбор признаков, оставляет исходные переменные, но выбирает из них подмножество, которое сохраняет максимум полезной информации. Это может быть фильтрация по корреляции с целевой переменной, поиск лучшего подмножества или методы, основанные на важности признаков из деревянных ансамблей. Отбор удобен тем, что интерпретируемость не теряется: после процедуры остаются исходные измерения с их физическим смыслом. Второй подход, извлечение признаков, создаёт новые переменные как комбинации исходных. Линейные преобразования и нелинейные отображения позволяют получить компактное представление данных, которое может занимать в десятки раз меньше измерений. Плата за это, потеря прямой интерпретации новых координат, зато часто выигрывается качество модели и появляется возможность визуализировать структуру данных.

Снижение размерности находит применение в четырёх основных сценариях. Визуализация многомерных данных, одна из самых востребованных задач: человек способен воспринимать графики максимум в трёх измерениях, а проекция данных на плоскость часто выявляет кластеры и выбросы, незаметные при попарном рассмотрении признаков. Сжатие данных используется при хранении больших массивов: вместо тысячи признаков можно сохранить сто или двести, что существенно экономит память. Шумоподавление основано на том, что полезный сигнал обычно сосредоточен в небольшом числе направлений с высокой дисперсией, а шум равномерно распределён по всем осям; отбрасывая слабые направления, мы отфильтровываем шум. Наконец, ускорение

4

обучения достигается за счёт уменьшения числа параметров модели: градиентный спуск в пространстве 10 признаков сходится заметно быстрее, чем в пространстве 1000, и требует меньше итераций для достижения той же точности. Эти задачи не изолированы: визуализация часто служит первым шагом перед отбором признаков, а сжатое представление можно использовать как вход для более сложной модели.

5

2. Линейные методы: PCA и его свойства

Метод главных компонент предложил Карл Пирсон в 1901 году, а в 1930-х его развил Харольд Хотеллинг. С тех пор этот подход остается основой линейного снижения размерности. Суть метода сводится к простому геометрическому факту: в многомерном пространстве признаки почти всегда коррелируют между собой, поэтому реальная размерность данных обычно ниже числа исходных колонок. PCA ищет такую систему координат, где оси направлены вдоль максимальной изменчивости наблюдений. Эти оси называются главными компонентами. Они ортогональны, что исключает дублирование информации, и упорядочены по убыванию дисперсии. Первая компонента захватывает наибольший разброс точек, вторая, следующий по величине, и так далее.

Вычислительная процедура метода прозрачна и сводится к нескольким матричным операциям. Сначала данные центрируются: из каждого признака вычитается его среднее значение, чтобы начало координат совпало с центром облака точек. Затем строится ковариационная матрица размера d×d (d, исходное число признаков). Элемент на пересечении i-й строки и j-го столбца показывает, насколько совместно изменяются i-й и j-й признаки. Дальше решается задача на собственные значения этой матрицы. Собственный вектор задает направление новой оси, а соответствующее ему собственное значение равно дисперсии данных вдоль этой оси. Собственные векторы сортируются по убыванию собственных значений, и первые k из них формируют матрицу проекции. Исходные данные умножаются на эту матрицу, получая представление в k-мерном пространстве. Есть и альтернативный путь: сингулярное разложение матрицы данных. Для больших объемов информации он численно устойчивее, хотя математически эквивалентен.

Ключевой практический вопрос, сколько компонент оставить. Ответ дает доля объясненной дисперсии. Если сумму первых k собственных значений поделить на сумму

6

всех собственных значений, мы получим, какую часть общей изменчивости сохраняет проекция. Правило большого пальца: оставляют столько компонент, чтобы накопленная доля составила 80-95%. Например, для набора данных о жилье с 30 признаками часто достаточно 7-8 компонент, чтобы объяснить 90% вариации цен. Формального критерия здесь нет. Для визуализации обычно берут две или три компоненты, для последующего обучения моделей ориентируются на порог качества. График «каменистой осыпи», где собственные значения изображены по убыванию, помогает найти точку резкого излома. Компоненты после нее вносят лишь шум.

Ограничения метода связаны с его линейной природой. PCA ищет только прямые оси в исходном пространстве. Структуры, закрученные в спираль или образующие вложенные сферы, он сжимает плохо, смешивая точки из разных кластеров. Вторая проблема, чувствительность к масштабу. Если один признак измеряется в килограммах, а другой в миллиметрах, первый будет доминировать в ковариационной матрице просто из-за больших чисел. Поэтому перед применением PCA обязательна стандартизация: каждый признак приводят к нулевому среднему и единичной дисперсии. Иначе компоненты отражают не структуру данных, а единицы измерения. Наконец, метод не учитывает целевую переменную. Он находит направления максимального разброса, а не те, что лучше всего разделяют классы или предсказывают ответ. Для задач классификации существуют линейные дискриминантные методы, но это уже отдельная ветвь анализа.

7

3. Нелинейные методы: t-SNE и автоэнкодеры

Когда данные не укладываются в линейную структуру, методы вроде PCA перестают работать. Связи между признаками часто оказываются изогнутыми, вложенными в многомерное пространство сложным образом. Для таких случаев нужны нелинейные подходы. Два из них заслуживают особого внимания: t-SNE для визуализации и автоэнкодеры для построения представлений.

Метод t-SNE (t-distributed Stochastic Neighbor Embedding) предложил Лоренс ван дер Матен в 2008 году. Его идея строится на вероятностной интерпретации близости точек. В исходном пространстве для каждой точки вычисляется распределение вероятностей того, что другая точка станет её соседом. В низкоразмерном пространстве строится аналогичное распределение, но на основе t-распределения Стьюдента. Алгоритм итеративно сдвигает точки на плоскости так, чтобы эти два распределения максимально совпали. Мерой расхождения служит дивергенция Кульбака-Лейблера, которую минимизируют градиентным спуском. Именно вероятностная природа позволяет t-SNE сохранять локальную структуру: точки, близкие в исходном пространстве, остаются близкими и в проекции, а удалённые группы могут разлетаться достаточно свободно.

У t-SNE есть существенные ограничения. Алгоритм стохастический: запущенный дважды на одних данных, он даст разные проекции. Результат сильно зависит от параметра перплексии, который задаёт эффективное число соседей для каждой точки. При малых значениях картина распадается на множество мелких кластеров, при слишком больших структура смазывается в однородное облако. Подобрать оптимальное значение можно только перебором и визуальной оценкой. Самое важное: t-SNE не строит функцию отображения. Он не умеет проецировать новые данные, поэтому его применяют исключительно для разведочного анализа и визуализации, а не как этап предобработки для обучения моделей.

8

Автоэнкодеры решают эту проблему. Это нейронные сети, которые обучаются сжимать данные без учителя. Архитектура состоит из двух частей. Энкодер преобразует входной вектор в скрытое представление меньшей размерности. Декодер пытается восстановить исходные данные из этого сжатого кода. Обучение сводится к минимизации ошибки реконструкции, обычно среднеквадратичной, между входом и выходом сети. Если сеть успешно восстанавливает данные, значит скрытый слой содержит достаточно информации об исходных признаках. Такой подход впервые описал Дэвид Румельхарт в 1986 году, а позже его развили в контексте глубокого обучения. Важное преимущество: обученный энкодер можно использовать как готовый преобразователь для новых данных, в том числе в составе более крупных моделей.

Вариационный автоэнкодер (VAE), представленный Дидериком Кингмой и Максом Веллингом в 2013 году, расширяет эту идею. Вместо того чтобы кодировать точку в скрытом пространстве, VAE кодирует распределение вероятностей. Энкодер выдаёт параметры гауссова распределения для каждого входа, а декодер сэмплирует из этого распределения и восстанавливает данные. Такая регуляризация заставляет скрытое пространство быть непрерывным и гладким. Это позволяет не только сжимать данные, но и генерировать новые: достаточно выбрать произвольную точку в скрытом пространстве и подать её в декодер. VAE лёг в основу многих генеративных моделей, от синтеза изображений до создания молекулярных структур.

Сравнение t-SNE и автоэнкодеров показывает, что это инструменты для разных задач. t-SNE работает быстро на выборках до десятков тысяч точек, но не масштабируется на миллионы. Автоэнкодеры требуют длительного обучения на GPU, зато после этого работают мгновенно. Интерпретируемость тоже различается: оси t-SNE не имеют содержательного смысла, их нельзя использовать для анализа отдельных признаков. Скрытые переменные автоэнкодера в некоторых случаях обретают

9

семантику, но обычно требуют дополнительного анализа. И главное: t-SNE не способен к генерации, тогда как VAE создан именно для неё. Выбор между методами определяется целью: визуализировать кластеры или построить рабочее представление для последующих задач.

10

4. Сравнительный анализ и практические рекомендации

Сопоставление возможностей PCA, t-SNE и автоэнкодеров на практике сводится к выбору из трех вопросов. Первый касается структуры данных: насколько линейны связи между признаками. Второй вопрос о том, что важнее в конкретной задаче, наглядная картинка для человека или признаки, которые будет использовать алгоритм. Третий связан с ограничениями по вычислительному времени и памяти.

Если структура данных преимущественно линейна, PCA остается базовым инструментом, которому трудно найти замену. Он детерминирован, быстр и дает компоненты, которые можно интерпретировать. Даже когда конечная цель состоит в получении нелинейного представления, разумно начинать именно с PCA. Он удаляет коррелированный шум, сокращает размерность до приемлемого порога (скажем, до 50 компонент, объясняющих 95% дисперсии) и стабилизирует дальнейшее обучение. Такая предобработка особенно полезна перед методами, чувствительными к масштабу признаков, например перед методом k-ближайших соседей или градиентным бустингом.

t-SNE решает совершенно иную задачу. Он был создан для визуализации, и в этом качестве ему действительно нет равных: на двухмерной плоскости он четко разделяет кластеры, которые в исходном пространстве перекрываются сложным нелинейным образом. Однако использовать его результат как входные признаки для классификатора или регрессора будет ошибкой. Алгоритм сохраняет локальные окрестности точек, но при этом искажает глобальные расстояния и плотности. Более того, кластеры на графике могут оказаться артефактом выбранной перплексии. Поэтому t-SNE применяют как финальный этап анализа, когда нужно наглядно убедить читателя в существовании групп в данных, а не как этап конвейера машинного обучения.

11

Автоэнкодеры занимают промежуточную нишу. Они способны выучить нелинейное многообразие, на котором лежат данные, и построить компактное представление, пригодное для дальнейшего обучения. В отличие от t-SNE, энкодер дает явную функцию преобразования: однажды обученную сеть можно применить к новым объектам без пересчета. Это свойство делает автоэнкодеры удобными для поиска аномалий (высокая ошибка реконструкции сигнализирует о нетипичном наблюдении). Вариационные автоэнкодеры, предложенные Кингмой и Веллингом в 2014 году, добавляют к этому способность генерировать новые точки из скрытого пространства, что невозможно ни для PCA, ни для t-SNE.

Ресурсы также диктуют выбор. PCA на ковариационной матрице размера 1000×1000 занимает доли секунды. t-SNE при выборке в 100 тысяч точек требует значительной памяти и минут вычислений, а его стохастичность заставляет запускать алгоритм несколько раз. Автоэнкодер с несколькими полносвязными слоями обучается дольше PCA, но быстрее t-SNE на больших объемах, и его можно ускорить на GPU. Если бюджет ограничен, разумный порядок действий такой: попробовать PCA, затем, если качество не устраивает, перейти к автоэнкодеру, и только для финальной визуализации использовать t-SNE.

Практические рекомендации сводятся к двум обязательным действиям. Перед любым снижением размерности данные стандартизируют (вычитают среднее и делят на стандартное отклонение). Без этого PCA будет доминировать признак с наибольшим масштабом, а градиенты в автоэнкодере станут нестабильными. Качество результата оценивают не по ошибке реконструкции, а по downstream-метрике: точности классификатора на сжатых признаках или сохранению соседства (его измеряет, например, коэффициент ранговой корреляции Спирмена между расстояниями в исходном и низкоразмерном пространстве). Для t-SNE такой оценкой служит визуальная интерпретируемость, но её стоит подкреплять количественно, например долей точек, у которых все

12

ближайшие соседи остались теми же.

13

Нужна такая же работа по своей теме? Соберём структуру, текст и источники в этом же оформлении.

Создать похожую

Сделайте такую же работу за пару минут

Любая тема, готовая структура, источники и оформление по ГОСТу. Первая работа — бесплатно.

Создать такую же

Как это работает

1. Опишите тему
Укажите тему и тип работы — остальное предложит ИИ.
2. Проверьте план
Структура, главы и источники по ГОСТу — редактируйте как нужно.
3. Скачайте в Word
Готовый документ с титульным листом и оглавлением.
Оформление по ГОСТу Готово за пару минут Источники и цитирование Экспорт в Word и PDF

Частые вопросы

Сколько стоит учебная работа?

Создание и редактирование — бесплатно. Платите только за доступ к готовой работе: доклад от 49₽, реферат от 99₽, курсовая от 199₽. Экспорт в DOCX/PDF после открытия — бесплатно.

Работа оформлена по ГОСТу?

Да. Титульный лист, содержание, поля, шрифт Times New Roman 14, интервал 1.5 — всё по ГОСТу. Скачивается в Word и PDF.

Можно ли редактировать текст?

Да, любой раздел можно отредактировать или перегенерировать прямо в редакторе перед скачиванием.

Похожие работы

Все работы по предмету «Информатика»