Открыть сервис

Логарифмическое правдоподобие

Логарифмическое правдоподобие (англ. log-likelihood) — это функция, равная натуральному логарифму от функции правдоподобия. Широко используется в математической статистике, теории оценивания и машинном обучении для упрощения вычислений, связанных с максимизацией правдоподобия, а также для анализа свойств оценок.

Определение и математическая форма

Пусть имеется выборка \( X = (x_1, x_2, \dots, x_n) \), состоящая из независимых и одинаково распределённых наблюдений, и параметрическая модель с плотностью распределения \( f(x|\theta) \), где \( \theta \) — вектор неизвестных параметров. Функция правдоподобия для данной выборки определяется как:

\[ L(\theta|X) = \prod_{i=1}^{n} f(x_i|\theta). \]

Логарифмическое правдоподобие \( \ell(\theta|X) \) представляет собой натуральный логарифм от этой функции:

\[ \ell(\theta|X) = \ln L(\theta|X) = \sum_{i=1}^{n} \ln f(x_i|\theta). \]

Переход к логарифмической шкале превращает произведение плотностей в сумму логарифмов, что существенно упрощает аналитические и численные вычисления, особенно при больших объёмах выборки.

Свойства

Логарифмическое правдоподобие обладает рядом важных свойств, вытекающих из свойств логарифма и функции правдоподобия:

  • Монотонность: поскольку логарифм является строго возрастающей функцией, максимум функции правдоподобия и максимум логарифмического правдоподобия достигаются при одном и том же значении параметра \( \theta \). Это позволяет вместо максимизации \( L(\theta) \) максимизировать \( \ell(\theta) \), что технически проще.
  • Аддитивность: для независимых наблюдений логарифмическое правдоподобие равно сумме логарифмических правдоподобий отдельных наблюдений. Это свойство лежит в основе многих методов оценивания.
  • Гладкость: при условии гладкости плотности \( f(x|\theta) \) функция \( \ell(\theta) \) также является гладкой, что позволяет использовать методы дифференциального исчисления для поиска максимума.
  • Инвариантность: если \( \hat{\theta} \) — оценка максимального правдоподобия (ОМП) для параметра \( \theta \), то для любой взаимно однозначной функции \( g(\theta) \) оценка максимального правдоподобия равна \( g(\hat{\theta}) \). Это свойство сохраняется и для логарифмического правдоподобия.

Применение в методе максимального правдоподобия

Основное применение логарифмического правдоподобия связано с методом максимального правдоподобия (ММП). Оценка максимального правдоподобия \( \hat{\theta}_{\text{ML}} \) определяется как:

\[ \hat{\theta}_{\text{ML}} = \arg\max_{\theta} \ell(\theta|X). \]

Для нахождения этой оценки обычно решают систему уравнений, называемых уравнениями правдоподобия:

\[ \frac{\partial \ell(\theta)}{\partial \theta_j} = 0, \quad j = 1, \dots, k, \]

где \( k \) — число оцениваемых параметров. Вторая производная логарифмического правдоподобия (матрица наблюдаемой информации Фишера) используется для оценки стандартных ошибок оценок и построения доверительных интервалов.

Пример: нормальное распределение

Для выборки из нормального распределения \( N(\mu, \sigma^2) \) с неизвестными параметрами \( \mu \) и \( \sigma^2 \) функция правдоподобия имеет вид:

\[ L(\mu, \sigma^2) = \prod_{i=1}^{n} \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left( -\frac{(x_i - \mu)^2}{2\sigma^2} \right). \]

Логарифмическое правдоподобие равно:

\[ \ell(\mu, \sigma^2) = -\frac{n}{2} \ln(2\pi) - \frac{n}{2} \ln(\sigma^2) - \frac{1}{2\sigma^2} \sum_{i=1}^{n} (x_i - \mu)^2. \]

Максимизация этого выражения по \( \mu \) и \( \sigma^2 \) даёт известные оценки: \( \hat{\mu} = \bar{x} \) (выборочное среднее) и \( \hat{\sigma}^2 = \frac{1}{n} \sum_{i=1}^{n} (x_i - \bar{x})^2 \) (смещённая выборочная дисперсия).

Информация Фишера

Логарифмическое правдоподобие тесно связано с понятием информации Фишера — меры количества информации, которую несёт выборка о неизвестном параметре. Информация Фишера \( I(\theta) \) определяется как математическое ожидание квадрата производной логарифмического правдоподобия по параметру:

\[ I(\theta) = \mathbb{E}\left[ \left( \frac{\partial \ell(\theta)}{\partial \theta} \right)^2 \right] = -\mathbb{E}\left[ \frac{\partial^2 \ell(\theta)}{\partial \theta^2} \right]. \]

Информация Фишера играет ключевую роль в асимптотической теории оценивания: при выполнении условий регулярности оценка максимального правдоподобия асимптотически нормальна с ковариационной матрицей, равной обратной информации Фишера.

Логарифмическое отношение правдоподобия

В статистической проверке гипотез широко используется логарифмическое отношение правдоподобия (log-likelihood ratio). Для проверки простой гипотезы \( H_0: \theta = \theta_0 \) против альтернативы \( H_1: \theta = \theta_1 \) статистика отношения правдоподобия определяется как:

\[ \Lambda = \frac{L(\theta_0|X)}{L(\theta_1|X)}. \]

Логарифмическое отношение правдоподобия \( \ln \Lambda \) часто используется для построения критериев, таких как критерий отношения правдоподобия, критерий Вальда и критерий множителей Лагранжа. Асимптотически распределение \(-2 \ln \Lambda\) при нулевой гипотезе стремится к распределению \( \chi^2 \) с числом степеней свободы, равным разности размерностей сравниваемых моделей.

Применение в машинном обучении

В задачах машинного обучения логарифмическое правдоподобие используется как функция потерь для обучения вероятностных моделей. Например, в логистической регрессии и нейронных сетях с softmax-выходом минимизация отрицательного логарифмического правдоподобия (negative log-likelihood, NLL) эквивалентна максимизации правдоподобия. В контексте классификации NLL часто называют кросс-энтропийной потерей.

Логарифмическое правдоподобие также применяется в:

  • Байесовском выводе: для вычисления апостериорного распределения (через произведение правдоподобия и априорного распределения).
  • Информационных критериях: таких как AIC (информационный критерий Акаике) и BIC (байесовский информационный критерий), которые основаны на значении логарифмического правдоподобия и штрафе за сложность модели.
  • Оценке плотности: в методах, основанных на максимизации правдоподобия (например, гауссовские смеси, скрытые марковские модели).

Численные аспекты

При работе с большими выборками или сложными моделями прямое вычисление логарифмического правдоподобия может быть затруднено из-за переполнения (при очень малых значениях плотности) или потери точности. Для решения этих проблем применяются:

  • Логарифмическое представление: все вычисления ведутся в логарифмической шкале.
  • Алгоритмы типа EM (expectation-maximization): позволяют максимизировать логарифмическое правдоподобие в присутствии скрытых переменных.
  • Стохастические методы: например, стохастический градиентный спуск для минимизации отрицательного логарифмического правдоподобия в нейронных сетях.

См. также

Источники

  • Кассандра, К. (2013). Основы статистического обучения: методы и теория. Springer.
  • Леман, Э. Л., Казелла, Г. (1998). Теория точечного оценивания. Springer.
  • Wasserman, L. (2004). All of Statistics: A Concise Course in Statistical Inference. Springer.
  • Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →