Логарифмическое правдоподобие
Логарифмическое правдоподобие (англ. log-likelihood) — это функция, равная натуральному логарифму от функции правдоподобия. Широко используется в математической статистике, теории оценивания и машинном обучении для упрощения вычислений, связанных с максимизацией правдоподобия, а также для анализа свойств оценок.
Определение и математическая форма
Пусть имеется выборка \( X = (x_1, x_2, \dots, x_n) \), состоящая из независимых и одинаково распределённых наблюдений, и параметрическая модель с плотностью распределения \( f(x|\theta) \), где \( \theta \) — вектор неизвестных параметров. Функция правдоподобия для данной выборки определяется как:
\[ L(\theta|X) = \prod_{i=1}^{n} f(x_i|\theta). \]
Логарифмическое правдоподобие \( \ell(\theta|X) \) представляет собой натуральный логарифм от этой функции:
\[ \ell(\theta|X) = \ln L(\theta|X) = \sum_{i=1}^{n} \ln f(x_i|\theta). \]
Переход к логарифмической шкале превращает произведение плотностей в сумму логарифмов, что существенно упрощает аналитические и численные вычисления, особенно при больших объёмах выборки.
Свойства
Логарифмическое правдоподобие обладает рядом важных свойств, вытекающих из свойств логарифма и функции правдоподобия:
- Монотонность: поскольку логарифм является строго возрастающей функцией, максимум функции правдоподобия и максимум логарифмического правдоподобия достигаются при одном и том же значении параметра \( \theta \). Это позволяет вместо максимизации \( L(\theta) \) максимизировать \( \ell(\theta) \), что технически проще.
- Аддитивность: для независимых наблюдений логарифмическое правдоподобие равно сумме логарифмических правдоподобий отдельных наблюдений. Это свойство лежит в основе многих методов оценивания.
- Гладкость: при условии гладкости плотности \( f(x|\theta) \) функция \( \ell(\theta) \) также является гладкой, что позволяет использовать методы дифференциального исчисления для поиска максимума.
- Инвариантность: если \( \hat{\theta} \) — оценка максимального правдоподобия (ОМП) для параметра \( \theta \), то для любой взаимно однозначной функции \( g(\theta) \) оценка максимального правдоподобия равна \( g(\hat{\theta}) \). Это свойство сохраняется и для логарифмического правдоподобия.
Применение в методе максимального правдоподобия
Основное применение логарифмического правдоподобия связано с методом максимального правдоподобия (ММП). Оценка максимального правдоподобия \( \hat{\theta}_{\text{ML}} \) определяется как:
\[ \hat{\theta}_{\text{ML}} = \arg\max_{\theta} \ell(\theta|X). \]
Для нахождения этой оценки обычно решают систему уравнений, называемых уравнениями правдоподобия:
\[ \frac{\partial \ell(\theta)}{\partial \theta_j} = 0, \quad j = 1, \dots, k, \]
где \( k \) — число оцениваемых параметров. Вторая производная логарифмического правдоподобия (матрица наблюдаемой информации Фишера) используется для оценки стандартных ошибок оценок и построения доверительных интервалов.
Пример: нормальное распределение
Для выборки из нормального распределения \( N(\mu, \sigma^2) \) с неизвестными параметрами \( \mu \) и \( \sigma^2 \) функция правдоподобия имеет вид:
\[ L(\mu, \sigma^2) = \prod_{i=1}^{n} \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left( -\frac{(x_i - \mu)^2}{2\sigma^2} \right). \]
Логарифмическое правдоподобие равно:
\[ \ell(\mu, \sigma^2) = -\frac{n}{2} \ln(2\pi) - \frac{n}{2} \ln(\sigma^2) - \frac{1}{2\sigma^2} \sum_{i=1}^{n} (x_i - \mu)^2. \]
Максимизация этого выражения по \( \mu \) и \( \sigma^2 \) даёт известные оценки: \( \hat{\mu} = \bar{x} \) (выборочное среднее) и \( \hat{\sigma}^2 = \frac{1}{n} \sum_{i=1}^{n} (x_i - \bar{x})^2 \) (смещённая выборочная дисперсия).
Информация Фишера
Логарифмическое правдоподобие тесно связано с понятием информации Фишера — меры количества информации, которую несёт выборка о неизвестном параметре. Информация Фишера \( I(\theta) \) определяется как математическое ожидание квадрата производной логарифмического правдоподобия по параметру:
\[ I(\theta) = \mathbb{E}\left[ \left( \frac{\partial \ell(\theta)}{\partial \theta} \right)^2 \right] = -\mathbb{E}\left[ \frac{\partial^2 \ell(\theta)}{\partial \theta^2} \right]. \]
Информация Фишера играет ключевую роль в асимптотической теории оценивания: при выполнении условий регулярности оценка максимального правдоподобия асимптотически нормальна с ковариационной матрицей, равной обратной информации Фишера.
Логарифмическое отношение правдоподобия
В статистической проверке гипотез широко используется логарифмическое отношение правдоподобия (log-likelihood ratio). Для проверки простой гипотезы \( H_0: \theta = \theta_0 \) против альтернативы \( H_1: \theta = \theta_1 \) статистика отношения правдоподобия определяется как:
\[ \Lambda = \frac{L(\theta_0|X)}{L(\theta_1|X)}. \]
Логарифмическое отношение правдоподобия \( \ln \Lambda \) часто используется для построения критериев, таких как критерий отношения правдоподобия, критерий Вальда и критерий множителей Лагранжа. Асимптотически распределение \(-2 \ln \Lambda\) при нулевой гипотезе стремится к распределению \( \chi^2 \) с числом степеней свободы, равным разности размерностей сравниваемых моделей.
Применение в машинном обучении
В задачах машинного обучения логарифмическое правдоподобие используется как функция потерь для обучения вероятностных моделей. Например, в логистической регрессии и нейронных сетях с softmax-выходом минимизация отрицательного логарифмического правдоподобия (negative log-likelihood, NLL) эквивалентна максимизации правдоподобия. В контексте классификации NLL часто называют кросс-энтропийной потерей.
Логарифмическое правдоподобие также применяется в:
- Байесовском выводе: для вычисления апостериорного распределения (через произведение правдоподобия и априорного распределения).
- Информационных критериях: таких как AIC (информационный критерий Акаике) и BIC (байесовский информационный критерий), которые основаны на значении логарифмического правдоподобия и штрафе за сложность модели.
- Оценке плотности: в методах, основанных на максимизации правдоподобия (например, гауссовские смеси, скрытые марковские модели).
Численные аспекты
При работе с большими выборками или сложными моделями прямое вычисление логарифмического правдоподобия может быть затруднено из-за переполнения (при очень малых значениях плотности) или потери точности. Для решения этих проблем применяются:
- Логарифмическое представление: все вычисления ведутся в логарифмической шкале.
- Алгоритмы типа EM (expectation-maximization): позволяют максимизировать логарифмическое правдоподобие в присутствии скрытых переменных.
- Стохастические методы: например, стохастический градиентный спуск для минимизации отрицательного логарифмического правдоподобия в нейронных сетях.
См. также
- Функция правдоподобия
- Метод максимального правдоподобия
- Информация Фишера
- Критерий отношения правдоподобия
- Кросс-энтропия
Источники
- Кассандра, К. (2013). Основы статистического обучения: методы и теория. Springer.
- Леман, Э. Л., Казелла, Г. (1998). Теория точечного оценивания. Springer.
- Wasserman, L. (2004). All of Statistics: A Concise Course in Statistical Inference. Springer.
- Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →