Линейный дискриминантный анализ
Линейный дискриминантный анализ (ЛДА, англ. Linear Discriminant Analysis, LDA) — метод статистического машинного обучения, используемый для классификации объектов и снижения размерности данных. В основе метода лежит поиск линейной комбинации признаков, которая наилучшим образом разделяет два или более заранее известных класса. ЛДА предполагает, что данные внутри каждого класса распределены нормально и имеют одинаковую ковариационную матрицу. Метод широко применяется в распознавании образов, биоинформатике, маркетинге и других областях, где требуется разделение объектов на группы на основе их характеристик.
История
Метод линейного дискриминантного анализа был разработан британским статистиком Рональдом Фишером в 1936 году. В своей работе «The Use of Multiple Measurements in Taxonomic Problems» Фишер предложил способ нахождения линейной комбинации признаков, которая максимизирует отношение межклассовой дисперсии к внутриклассовой дисперсии. Первоначально метод применялся в биологии для классификации видов ирисов по морфологическим признакам (знаменитый набор данных Iris Фишера). В середине XX века ЛДА получил развитие в трудах других статистиков, включая К. Рао, который обобщил метод на многомерный случай. С развитием вычислительной техники в 1960–1970-х годах ЛДА стал активно использоваться в автоматизированных системах распознавания образов, а в 1990-х годах — в задачах обработки изображений и текстов. В настоящее время ЛДА остаётся одним из базовых методов в статистическом обучении.
Математическая постановка
Основные предположения
ЛДА основан на следующих предположениях:
- Данные каждого класса подчиняются многомерному нормальному распределению.
- Ковариационные матрицы всех классов одинаковы (гомоскедастичность).
- Наблюдения независимы друг от друга.
Если предположение о равенстве ковариационных матриц нарушается, применяется квадратичный дискриминантный анализ (КДА).
Критерий Фишера
Для двух классов Фишер предложил максимизировать отношение:
\[ J(w) = \frac{(w^T \mu_1 - w^T \mu_2)^2}{w^T (\Sigma_1 + \Sigma_2) w} \]
где \(w\) — вектор коэффициентов, \(\mu_1, \mu_2\) — векторы средних классов, \(\Sigma_1, \Sigma_2\) — ковариационные матрицы. Решение даётся выражением:
\[ w = (\Sigma_1 + \Sigma_2)^{-1} (\mu_1 - \mu_2) \]
Многоклассовый случай
Для \(K\) классов ЛДА находит \(K-1\) дискриминантных осей, проецируя данные в пространство размерности \(K-1\). Критерий максимизирует отношение определителя межклассовой матрицы рассеяния к определителю внутриклассовой матрицы рассеяния.
Алгоритм работы
Обучение
- Вычисление средних векторов для каждого класса.
- Вычисление внутриклассовой и межклассовой матриц рассеяния.
- Вычисление собственных векторов и собственных значений обобщённой задачи.
- Выбор \(K-1\) собственных векторов с наибольшими собственными значениями.
- Построение проекционной матрицы.
Классификация
Для нового объекта вычисляется его проекция на дискриминантные оси, после чего используется правило максимального правдоподобия или расстояние Махаланобиса до центров классов.
Применение
Распознавание образов
ЛДА широко применяется в системах распознавания лиц (метод Fisherfaces), где позволяет уменьшить размерность изображений и повысить точность классификации. Также используется в компьютерном зрении для сегментации объектов.
Биоинформатика
В геномике ЛДА применяется для классификации образцов тканей по экспрессии генов, а также для идентификации биомаркеров заболеваний. Например, метод используется для различения раковых и здоровых клеток на основе профилей экспрессии.
Маркетинг и социология
ЛДА используется для сегментации клиентов, прогнозирования покупательского поведения и оценки кредитоспособности. В социологии — для анализа данных опросов и выделения социальных групп.
Обработка текстов
В задачах тематического моделирования и классификации документов ЛДА (часто называемый латентным размещением Дирихле, но это другой метод) применяется для выделения тем. Однако классический ЛДА Фишера используется для бинарной и многоклассовой классификации текстов по авторам или жанрам.
Сравнение с другими методами
ЛДА и логистическая регрессия
ЛДА и логистическая регрессия решают схожие задачи классификации. ЛДА даёт лучшие результаты при выполнении предположений о нормальности и равенстве ковариаций, а логистическая регрессия более устойчива к нарушениям этих предположений. При малом объёме выборки ЛДА часто предпочтительнее.
ЛДА и метод главных компонент (МГК)
МГК не учитывает метки классов и максимизирует дисперсию, а ЛДА — разделимость классов. Поэтому ЛДА обычно даёт лучшие результаты для задач классификации, а МГК — для сжатия данных без учёта классов.
ЛДА и метод опорных векторов (SVM)
SVM часто превосходит ЛДА на сложных, нелинейно разделимых данных, но требует настройки параметров и больше вычислительных ресурсов. ЛДА проще и быстрее, но менее гибок.
Ограничения и критика
- Чувствительность к выбросам: ЛДА сильно зависит от нормальности распределения, и выбросы могут исказить результаты.
- Требование равенства ковариаций: На практике это условие часто нарушается, что приводит к снижению точности.
- Линейность: Метод не способен разделять нелинейно разделимые классы без предварительной трансформации признаков.
- Малая выборка: При числе признаков, превышающем число наблюдений, матрица рассеяния становится вырожденной, что требует регуляризации (например, RLDA — Regularized LDA).
Программная реализация
ЛДА реализован во многих статистических пакетах и библиотеках машинного обучения:
- В Python:
sklearn.discriminant_analysis.LinearDiscriminantAnalysis(библиотека scikit-learn). - В R: функция
lda()из пакетаMASS. - В MATLAB: функция
fitcdiscr. - В SAS: процедура
PROC DISCRIM.
Пример простого использования на Python:
```python from sklearn.discriminant_analysis import LinearDiscriminantAnalysis from sklearn.datasets import load_iris
X, y = load_iris(return_X_y=True) lda = LinearDiscriminantAnalysis(n_components=2) X_lda = lda.fit_transform(X, y) ```
Интересные факты
- Классический набор данных Iris, использованный Фишером, содержит 150 наблюдений трёх видов ирисов, и ЛДА позволяет разделить их с точностью около 96 %.
- В 1948 году британский статистик К. Рао обобщил ЛДА на случай нескольких групп, заложив основы многомерного дискриминантного анализа.
- В задачах с очень большим числом признаков (например, в геномике) применяют разреженный ЛДА (Sparse LDA), который отбирает наиболее информативные признаки.
Источники
- Fisher, R. A. (1936). The Use of Multiple Measurements in Taxonomic Problems. Annals of Eugenics, 7(2), 179–188.
- Hastie, T., Tibshirani, R., & Friedman, J. (2009). The Elements of Statistical Learning (2nd ed.). Springer.
- Duda, R. O., Hart, P. E., & Stork, D. G. (2001). Pattern Classification (2nd ed.). Wiley.
- McLachlan, G. J. (2004). Discriminant Analysis and Statistical Pattern Recognition. Wiley-Interscience.
- Scikit-learn documentation: Linear and Quadratic Discriminant Analysis.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →