Логарифмическая функция правдоподобия
Логарифмическая функция правдоподобия (логарифмическое правдоподобие, англ. log-likelihood function) — это функция от параметров статистической модели, равная натуральному логарифму функции правдоподобия. Широко используется в математической статистике, теории оценивания и машинном обучении, поскольку позволяет упростить вычисления и улучшить численную устойчивость при поиске оценок максимального правдоподобия.
Определение и связь с функцией правдоподобия
Пусть \(X_1, X_2, \dots, X_n\) — независимые одинаково распределённые случайные величины с плотностью распределения \(f(x|\theta)\) (или вероятностью \(p(x|\theta)\) для дискретного случая), где \(\theta\) — вектор неизвестных параметров. Функция правдоподобия определяется как:
\[ L(\theta) = \prod_{i=1}^{n} f(X_i|\theta) \]
Логарифмическая функция правдоподобия \(\ell(\theta)\) есть натуральный логарифм от \(L(\theta)\):
\[ \ell(\theta) = \ln L(\theta) = \sum_{i=1}^{n} \ln f(X_i|\theta) \]
Основное свойство: максимум \(\ell(\theta)\) достигается при том же значении \(\theta\), что и максимум \(L(\theta)\), так как логарифм — монотонно возрастающая функция. Поэтому оценка максимального правдоподобия (ОМП) может находиться как из уравнения \(\frac{\partial \ell(\theta)}{\partial \theta} = 0\), что часто проще, чем работа с произведением.
История
Понятие функции правдоподобия было введено Рональдом Фишером в 1912–1922 годах в серии работ по статистическому оцениванию. Фишер показал, что логарифмическое преобразование превращает произведение плотностей в сумму, что делает дифференцирование и анализ асимптотических свойств удобнее. В 1925 году он опубликовал работу «Теория статистического оценивания», где формализовал метод максимального правдоподобия и ввёл понятие логарифмического правдоподобия как основного инструмента. В советской статистике метод активно развивался А. Н. Колмогоровым и Ю. В. Линником.
Свойства
Аддитивность
Для независимых наблюдений логарифмическое правдоподобие является суммой вкладов каждого наблюдения. Это свойство критически важно для применения центральной предельной теоремы и асимптотического анализа.
Асимптотическая нормальность
При выполнении регулярных условий (гладкость, существование моментов, идентифицируемость) оценка максимального правдоподобия \(\hat{\theta}\) асимптотически нормальна:
\[ \sqrt{n}(\hat{\theta} - \theta_0) \xrightarrow{d} N(0, I^{-1}(\theta_0)) \]
где \(I(\theta_0)\) — информационная матрица Фишера, определяемая через вторые производные логарифмического правдоподобия:
\[ I(\theta) = -E\left[ \frac{\partial^2 \ell(\theta)}{\partial \theta \partial \theta^T} \right] \]
Инвариантность
Если \(\hat{\theta}\) — ОМП для \(\theta\), то для любой взаимно однозначной функции \(g\) оценка \(g(\hat{\theta})\) является ОМП для \(g(\theta)\). Это свойство сохраняется и для логарифмического правдоподобия.
Выпуклость в экспоненциальных семействах
Для распределений, принадлежащих экспоненциальному семейству (нормальное, пуассоновское, биномиальное, гамма-распределение и др.), логарифмическое правдоподобие является вогнутой функцией параметров, что гарантирует единственность глобального максимума.
Применение
Оценка максимального правдоподобия
Нахождение \(\hat{\theta}\) путём решения системы уравнений:
\[ \frac{\partial \ell(\theta)}{\partial \theta_j} = 0, \quad j = 1, \dots, k \]
Пример: для нормального распределения \(N(\mu, \sigma^2)\) логарифмическое правдоподобие имеет вид:
\[ \ell(\mu, \sigma^2) = -\frac{n}{2} \ln(2\pi) - \frac{n}{2} \ln \sigma^2 - \frac{1}{2\sigma^2} \sum_{i=1}^{n} (X_i - \mu)^2 \]
Решения: \(\hat{\mu} = \bar{X}\), \(\hat{\sigma}^2 = \frac{1}{n} \sum (X_i - \bar{X})^2\).
Критерии отношения правдоподобия
Статистика теста:
\[ \Lambda = -2 \ln \frac{L(\theta_0)}{L(\hat{\theta})} = 2 (\ell(\hat{\theta}) - \ell(\theta_0)) \]
асимптотически распределена как \(\chi^2\) с числом степеней свободы, равным разности размерностей параметров. Используется для проверки гипотез (например, в регрессионном анализе).
Информационный критерий Акаике (AIC)
\[ AIC = -2 \ell(\hat{\theta}) + 2k \]
где \(k\) — число параметров. Меньшие значения AIC указывают на лучшее качество модели при учёте сложности. Широко применяется в подборе моделей.
Байесовский вывод
В байесовской статистике логарифмическое правдоподобие входит в выражение для логарифма апостериорной плотности:
\[ \ln p(\theta|X) = \ell(\theta) + \ln p(\theta) + \text{const} \]
где \(p(\theta)\) — априорное распределение.
Машинное обучение
В задачах классификации и регрессии логарифмическое правдоподобие используется как функция потерь (log-loss). Например, в логистической регрессии минимизируется отрицательное логарифмическое правдоподобие:
\[ -\ell(\beta) = -\sum_{i=1}^{n} \left[ y_i \ln p_i + (1 - y_i) \ln (1 - p_i) \right] \]
где \(p_i = \sigma(\beta^T x_i)\) — сигмоидальная функция.
Вычислительные аспекты
Численная устойчивость
Логарифмирование предотвращает переполнение при работе с очень малыми значениями плотностей (например, при \(n > 10^3\) произведение может стать нулём в машинной арифметике). Логарифмическое правдоподобие остаётся в разумном диапазоне.
Оптимизация
Для поиска максимума логарифмического правдоподобия применяются градиентные методы (стохастический градиентный спуск, метод Ньютона-Рафсона). Вторые производные (матрица Гессе) дают информацию о кривизне и ковариационной матрице оценок.
Проблемы
- Многомодальность: в сложных моделях (смеси распределений, нейронные сети) логарифмическое правдоподобие может иметь несколько локальных максимумов.
- Вырожденность: при некоторых значениях параметров (например, нулевая дисперсия) логарифмическое правдоподобие может стремиться к бесконечности, что требует регуляризации.
Примеры
Биномиальное распределение
Для \(n\) испытаний с \(k\) успехами и вероятностью успеха \(p\):
\[ \ell(p) = k \ln p + (n - k) \ln (1 - p) + \text{const} \]
Максимум: \(\hat{p} = k/n\).
Распределение Пуассона
Для наблюдений \(X_1, \dots, X_n\) с параметром \(\lambda\):
\[ \ell(\lambda) = -n\lambda + \ln \lambda \sum_{i=1}^{n} X_i - \sum_{i=1}^{n} \ln X_i! \]
Оценка: \(\hat{\lambda} = \bar{X}\).
Линейная регрессия
Для модели \(Y = X\beta + \varepsilon\), \(\varepsilon \sim N(0, \sigma^2 I)\):
\[ \ell(\beta, \sigma^2) = -\frac{n}{2} \ln(2\pi) - \frac{n}{2} \ln \sigma^2 - \frac{1}{2\sigma^2} \|Y - X\beta\|^2 \]
Оценка МНК совпадает с ОМП: \(\hat{\beta} = (X^T X)^{-1} X^T Y\).
Критика и ограничения
- Чувствительность к выбросам: логарифмическое правдоподобие для распределений с тяжёлыми хвостами (например, Коши) может быть неограниченным, что приводит к несостоятельным оценкам.
- Асимптотическая теория требует регулярных условий, которые не всегда выполняются (например, при оценке параметра сдвига для равномерного распределения).
- В моделях с большим числом параметров (например, глубокие нейронные сети) логарифмическое правдоподобие может переобучаться, поэтому используются регуляризация и валидация.
Интересные факты
- Логарифмическое правдоподобие тесно связано с энтропией: минимизация отрицательного логарифмического правдоподобия эквивалентна минимизации кросс-энтропии между эмпирическим и модельным распределениями.
- В физике (статистическая механика) логарифмическое правдоподобие соответствует логарифму статистической суммы, а его максимизация — принципу максимальной энтропии.
- В советской литературе термин «логарифмическая функция правдоподобия» часто заменялся на «логарифмическое правдоподобие» (работы Линника, 1960-е годы).
Источники
- Fisher R. A. On the mathematical foundations of theoretical statistics // Philosophical Transactions of the Royal Society of London. Series A, 1922.
- Линник Ю. В. Метод наименьших квадратов и основы теории обработки наблюдений. — М.: Физматгиз, 1962.
- Casella G., Berger R. L. Statistical Inference. — 2nd ed. — Duxbury Press, 2002.
- Hastie T., Tibshirani R., Friedman J. The Elements of Statistical Learning. — 2nd ed. — Springer, 2009.
- Математическая энциклопедия / Гл. ред. И. М. Виноградов. — М.: Советская энциклопедия, 1977–1985. — Т. 3.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →