Информационная матрица Фишера
Информационная матрица Фишера — это фундаментальное понятие математической статистики и теории информации, представляющее собой матрицу вторых частных производных логарифмической функции правдоподобия (или, что эквивалентно, отрицательного математического ожидания гессиана логарифма правдоподобия). Она количественно характеризует количество информации, которое наблюдаемая случайная величина несёт о неизвестном параметре или наборе параметров статистической модели. Названа в честь британского статистика Рональда Фишера, который ввёл это понятие в 1920-х годах.
Определение и формальное представление
Пусть \( \mathbf{X} = (X_1, \ldots, X_n) \) — случайная выборка из распределения с плотностью \( f(x; \theta) \), где \( \theta = (\theta_1, \ldots, \theta_k) \) — вектор неизвестных параметров. Функция правдоподобия для выборки имеет вид \( L(\theta; \mathbf{x}) = \prod_{i=1}^n f(x_i; \theta) \). Логарифмическая функция правдоподобия: \( \ell(\theta; \mathbf{x}) = \ln L(\theta; \mathbf{x}) \).
Информационная матрица Фишера \( \mathcal{I}(\theta) \) — это симметричная матрица размера \( k \times k \), элементы которой определяются как:
\[ \mathcal{I}_{ij}(\theta) = \mathbb{E}_\theta \left[ \frac{\partial \ell(\theta; \mathbf{X})}{\partial \theta_i} \frac{\partial \ell(\theta; \mathbf{X})}{\partial \theta_j} \right] = -\mathbb{E}_\theta \left[ \frac{\partial^2 \ell(\theta; \mathbf{X})}{\partial \theta_i \partial \theta_j} \right], \]
где \( \mathbb{E}_\theta \) обозначает математическое ожидание по распределению \( \mathbf{X} \) при истинном значении параметра \( \theta \). Второе равенство справедливо при выполнении условий регулярности (возможность дифференцирования под знаком интеграла). Для одного параметра (\( k = 1 \)) матрица вырождается в скалярную величину — информацию Фишера \( \mathcal{I}(\theta) \).
Основные свойства
Информационная матрица Фишера обладает рядом ключевых свойств, определяющих её роль в статистическом выводе.
Неотрицательная определённость
Матрица \( \mathcal{I}(\theta) \) является неотрицательно определённой для всех \( \theta \). Это следует из её представления как ковариационной матрицы вектора градиента логарифма правдоподобия (скоров). Если модель идентифицируема, матрица положительно определена.
Аддитивность
Для независимых наблюдений \( X_1, \ldots, X_n \) информация Фишера, содержащаяся во всей выборке, равна сумме информаций, содержащихся в каждом наблюдении: \[ \mathcal{I}_n(\theta) = n \cdot \mathcal{I}_1(\theta), \] где \( \mathcal{I}_1(\theta) \) — информация для одного наблюдения. Это свойство отражает возрастание информации с увеличением объёма выборки.
Инвариантность при репараметризации
Если \( \psi = g(\theta) \) — гладкое взаимно однозначное преобразование параметров, то информационная матрица преобразуется по правилу: \[ \mathcal{I}(\psi) = (G^{-1})^T \mathcal{I}(\theta) G^{-1}, \] где \( G \) — матрица Якоби преобразования \( g \). Для скалярного случая: \( \mathcal{I}(\psi) = \mathcal{I}(\theta) \left( \frac{d\theta}{d\psi} \right)^2 \).
Связь с дисперсией
Информация Фишера задаёт нижнюю границу дисперсии несмещённых оценок (неравенство Рао — Крамера). Для скалярного параметра: \[ \text{Var}(\hat{\theta}) \geq \frac{1}{\mathcal{I}(\theta)}, \] где \( \hat{\theta} \) — любая несмещённая оценка. Для многомерного случая ковариационная матрица любой несмещённой оценки \( \hat{\theta} \) удовлетворяет: \[ \text{Cov}(\hat{\theta}) \geq \mathcal{I}(\theta)^{-1} \] в смысле порядка Лёвнера (разность матриц неотрицательно определена).
Примеры вычисления
Нормальное распределение
Для выборки из нормального распределения \( N(\mu, \sigma^2) \) с неизвестным средним \( \mu \) и известной дисперсией \( \sigma^2 \) логарифм правдоподобия для одного наблюдения: \[ \ell(\mu; x) = -\frac{1}{2} \ln(2\pi\sigma^2) - \frac{(x - \mu)^2}{2\sigma^2}. \] Вторая производная: \( \frac{\partial^2 \ell}{\partial \mu^2} = -\frac{1}{\sigma^2} \). Математическое ожидание не зависит от \( x \), поэтому: \[ \mathcal{I}(\mu) = -\mathbb{E}\left[ \frac{\partial^2 \ell}{\partial \mu^2} \right] = \frac{1}{\sigma^2}. \] Для выборки из \( n \) наблюдений: \( \mathcal{I}_n(\mu) = n / \sigma^2 \). Это означает, что дисперсия оценки среднего \( \bar{X} \) равна \( \sigma^2 / n \), что совпадает с нижней границей Рао — Крамера.
Распределение Бернулли
Для модели Бернулли с параметром \( p \) (вероятность успеха) функция правдоподобия для одного наблюдения: \( f(x; p) = p^x (1-p)^{1-x} \). Логарифм: \( \ell(p; x) = x \ln p + (1-x) \ln(1-p) \). Первая производная: \( \frac{\partial \ell}{\partial p} = \frac{x}{p} - \frac{1-x}{1-p} \). Вторая производная: \( \frac{\partial^2 \ell}{\partial p^2} = -\frac{x}{p^2} - \frac{1-x}{(1-p)^2} \). Математическое ожидание \( \mathbb{E}[x] = p \), отсюда: \[ \mathcal{I}(p) = -\mathbb{E}\left[ \frac{\partial^2 \ell}{\partial p^2} \right] = \frac{p}{p^2} + \frac{1-p}{(1-p)^2} = \frac{1}{p(1-p)}. \]
Применение в статистике
Оценка максимального правдоподобия
Информационная матрица Фишера играет центральную роль в асимптотической теории оценок максимального правдоподобия (ОМП). При выполнении условий регулярности ОМП \( \hat{\theta}_n \) асимптотически нормальна: \[ \sqrt{n}(\hat{\theta}_n - \theta) \xrightarrow{d} N(0, \mathcal{I}(\theta)^{-1}), \] где \( \mathcal{I}(\theta) \) — информация Фишера для одного наблюдения. Это позволяет строить доверительные интервалы и проверять гипотезы на основе асимптотического распределения.
Критерий отношения правдоподобия
Информационная матрица используется для вычисления статистик тестов Вальда, множителей Лагранжа (тест Скотта) и отношения правдоподобия. Например, статистика Вальда для проверки гипотезы \( H_0: \theta = \theta_0 \) имеет вид: \[ W = (\hat{\theta} - \theta_0)^T \mathcal{I}(\hat{\theta}) (\hat{\theta} - \theta_0), \] которая асимптотически распределена как \( \chi^2 \) с числом степеней свободы, равным размерности \( \theta \).
Планирование экспериментов
В теории оптимального планирования экспериментов информационная матрица Фишера используется как критерий эффективности. Эксперимент считается оптимальным, если он максимизирует некоторую функцию от \( \mathcal{I}(\theta) \), например, определитель (D-оптимальность) или след (A-оптимальность). Это позволяет минимизировать дисперсию оценок параметров модели.
Связь с другими понятиями
Расстояние Кульбака — Лейблера
Информационная матрица Фишера связана с расходимостью Кульбака — Лейблера (относительной энтропией). Для двух распределений с близкими параметрами \( \theta \) и \( \theta + \delta \) расходимость аппроксимируется квадратичной формой: \[ D_{KL}(f(x; \theta) \parallel f(x; \theta + \delta)) \approx \frac{1}{2} \delta^T \mathcal{I}(\theta) \delta. \] Таким образом, \( \mathcal{I}(\theta) \) задаёт локальную метрику Римана на пространстве параметров (метрика Фишера — Рао), что делает её фундаментальной в информационной геометрии.
Граница Крамера — Рао
Как уже упоминалось, обратная информационная матрица задаёт нижнюю границу ковариационной матрицы несмещённых оценок. Это неравенство является одним из центральных результатов теории оценивания и используется для оценки эффективности статистических процедур.
Критика и ограничения
Информационная матрица Фишера, будучи мощным инструментом, имеет ряд ограничений. Во-первых, её вычисление требует знания истинного распределения данных, что на практике часто неизвестно. Во-вторых, для сложных моделей (например, с латентными переменными или смесями распределений) аналитическое вычисление матрицы может быть затруднено или невозможно. В таких случаях применяются численные методы, в том числе алгоритм EM (Expectation-Maximization) для оценки матрицы в присутствии пропущенных данных. Кроме того, для малых выборок асимптотические свойства, основанные на информационной матрице, могут быть неточными, что требует использования методов коррекции (например, поправки Бартлетта).
Источники
- Fisher, R. A. (1925). «Theory of Statistical Estimation». Proceedings of the Cambridge Philosophical Society, 22, 700–725.
- Lehmann, E. L., & Casella, G. (1998). Theory of Point Estimation (2nd ed.). Springer.
- Rao, C. R. (1945). «Information and the accuracy attainable in the estimation of statistical parameters». Bulletin of the Calcutta Mathematical Society, 37, 81–89.
- Amari, S., & Nagaoka, H. (2000). Methods of Information Geometry. American Mathematical Society.
- Боровков, А. А. (2010). Математическая статистика: Оценка параметров. Проверка гипотез. Лань.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →