Открыть сервис

Квадратичный дискриминантный анализ

Квадратичный дискриминантный анализ (Quadratic Discriminant Analysis, QDA) — это метод статистической классификации, который используется для разделения объектов на две или более заранее известные группы на основе их признаков. В отличие от линейного дискриминантного анализа (LDA), QDA не предполагает, что ковариационные матрицы классов одинаковы, что позволяет строить нелинейные (квадратичные) границы между классами. Метод основан на байесовской теории принятия решений и предполагает, что данные внутри каждого класса подчиняются многомерному нормальному распределению.

История

Квадратичный дискриминантный анализ является развитием идей линейного дискриминантного анализа, разработанного Рональдом Фишером в 1936 году. Фишер предложил метод для нахождения линейной комбинации признаков, наилучшим образом разделяющей два класса. Однако на практике часто встречаются ситуации, когда ковариационные матрицы классов существенно различаются, и линейная граница оказывается неоптимальной. В таких случаях применение QDA позволяет получить более точные результаты, хотя и требует большего объёма данных для оценки параметров. Активное развитие вычислительной техники во второй половине XX века сделало QDA широко доступным для практического использования в различных областях науки и техники.

Математическая постановка

Основные предположения

QDA основан на следующих предположениях:

\[ f_k(\mathbf{x}) = \frac{1}{(2\pi)^{p/2} |\Sigma_k|^{1/2}} \exp\left(-\frac{1}{2} (\mathbf{x} - \boldsymbol{\mu}_k)^T \Sigma_k^{-1} (\mathbf{x} - \boldsymbol{\mu}_k)\right), \] где \( \mathbf{x} \) — вектор признаков размерности \( p \), \( \boldsymbol{\mu}_k \) — вектор средних значений класса \( k \), \( \Sigma_k \) — ковариационная матрица класса \( k \).

  • Ковариационные матрицы \( \Sigma_k \) могут различаться для разных классов (в отличие от LDA, где они предполагаются равными).
  • Априорные вероятности классов \( \pi_k \) известны или оцениваются по данным.

Правило классификации

Классификация объекта с признаками \( \mathbf{x} \) производится по максимуму апостериорной вероятности: \[ \hat{k} = \arg\max_k \left[ \log \pi_k - \frac{1}{2} \log |\Sigma_k| - \frac{1}{2} (\mathbf{x} - \boldsymbol{\mu}_k)^T \Sigma_k^{-1} (\mathbf{x} - \boldsymbol{\mu}_k) \right]. \]

Выражение в квадратных скобках представляет собой квадратичную дискриминантную функцию. Из-за наличия члена \( (\mathbf{x} - \boldsymbol{\mu}_k)^T \Sigma_k^{-1} (\mathbf{x} - \boldsymbol{\mu}_k) \) граница между классами в пространстве признаков является квадратичной поверхностью (например, эллипсоидом, параболоидом или гиперболоидом), что и дало название методу.

Оценка параметров

На практике параметры \( \boldsymbol{\mu}_k \) и \( \Sigma_k \) неизвестны и оцениваются по обучающей выборке. Для каждого класса \( k \) используются следующие оценки:

  • Оценка среднего: \( \hat{\boldsymbol{\mu}}_k = \frac{1}{n_k} \sum_{i: y_i = k} \mathbf{x}_i \), где \( n_k \) — количество объектов в классе \( k \).
  • Оценка ковариационной матрицы: \( \hat{\Sigma}_k = \frac{1}{n_k - 1} \sum_{i: y_i = k} (\mathbf{x}_i - \hat{\boldsymbol{\mu}}_k)(\mathbf{x}_i - \hat{\boldsymbol{\mu}}_k)^T \).

Априорные вероятности \( \pi_k \) обычно оцениваются как доля объектов класса \( k \) в выборке: \( \hat{\pi}_k = n_k / n \), где \( n \) — общее количество объектов.

Сравнение с линейным дискриминантным анализом

Основное различие между QDA и LDA заключается в предположении о ковариационных матрицах:

ХарактеристикаLDAQDA
Ковариационные матрицыОдинаковые для всех классовМогут различаться
Граница между классамиЛинейная (гиперплоскость)Квадратичная (гиперповерхность)
Количество оцениваемых параметров\( p(p+1)/2 + Kp \)\( K \cdot p(p+1)/2 + Kp \)
Чувствительность к объёму выборкиМеньше (меньше параметров)Больше (больше параметров)
ГибкостьНижеВыше

QDA требует оценки отдельной ковариационной матрицы для каждого класса, что приводит к большему числу параметров. Это делает QDA более чувствительным к размеру выборки: при малом количестве объектов в классе оценки ковариационных матриц могут быть неустойчивыми или вырожденными. LDA, напротив, более устойчив при малых выборках, но может давать смещённые результаты, если ковариационные матрицы классов сильно различаются.

Применение

Квадратичный дискриминантный анализ используется в различных областях, где требуется классификация объектов с нелинейными границами между классами:

Биология и медицина

  • Классификация биологических видов по морфологическим признакам.
  • Диагностика заболеваний на основе лабораторных показателей (например, различение типов опухолей по данным биопсии).
  • Анализ экспрессии генов в биоинформатике.

Финансы

  • Оценка кредитного риска: разделение заёмщиков на категории по вероятности дефолта.
  • Классификация финансовых инструментов по уровню риска.

Техника

Маркетинг

  • Сегментация потребителей по поведенческим и демографическим признакам.
  • Прогнозирование отклика на рекламные кампании.

Достоинства и недостатки

Достоинства

  • Способность моделировать нелинейные границы между классами, что повышает точность классификации в сложных задачах.
  • Простота реализации и интерпретации: результаты могут быть выражены в виде квадратичных функций признаков.
  • Хорошая работа при достаточном объёме данных и выполнении предположения о нормальности распределений.

Недостатки

  • Чувствительность к нарушению предположения о многомерной нормальности распределений. Если данные не подчиняются нормальному закону, качество классификации может снижаться.
  • Высокая вычислительная сложность при большом числе признаков и классов из-за необходимости оценивать множество ковариационных матриц.
  • Риск переобучения при малом объёме выборки, особенно если число признаков велико по сравнению с числом объектов в классах.
  • Неустойчивость оценок ковариационных матриц при наличии выбросов или мультиколлинеарности признаков.

Регуляризация

Для преодоления недостатков QDA, связанных с неустойчивостью оценок ковариационных матриц, применяются методы регуляризации. Одним из распространённых подходов является регуляризованный дискриминантный анализ (Regularized Discriminant Analysis, RDA), который объединяет LDA и QDA с помощью параметра регуляризации, контролирующего степень сжатия ковариационных матриц к общей матрице. Другой подход — использование сжатых оценок (shrinkage estimators), которые уменьшают влияние выборочных флуктуаций.

Примеры

Пример 1: Классификация ирисов Фишера

Набор данных «Ирисы Фишера» (Fisher’s Iris dataset) содержит 150 образцов ирисов трёх видов (Iris setosa, Iris versicolor, Iris virginica) с четырьмя признаками (длина и ширина чашелистика, длина и ширина лепестка). Применение QDA к этому набору позволяет разделить виды с высокой точностью, особенно для Iris setosa, который линейно отделим от двух других, в то время как граница между Iris versicolor и Iris virginica является нелинейной.

Пример 2: Диагностика рака молочной железы

В медицинских исследованиях QDA применяется для классификации опухолей как доброкачественных или злокачественных на основе данных маммографии или биопсии. Признаки могут включать размер, форму, плотность и другие характеристики клеток. QDA часто показывает лучшие результаты, чем LDA, если ковариационные структуры двух типов опухолей различны.

Интересные факты

  • Квадратичный дискриминантный анализ является частным случаем более общего метода — байесовской классификации, когда распределения признаков внутри классов считаются нормальными.
  • В отличие от многих современных методов машинного обучения (например, нейронных сетей или случайного леса), QDA имеет явное аналитическое решение, что делает его прозрачным и легко интерпретируемым.
  • При равенстве ковариационных матриц QDA вырождается в LDA, что демонстрирует их иерархическую связь.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →