Открыть сервис

Функция правдоподобия

Функция правдоподобия (англ. likelihood function) — в математической статистике и теории вероятностей это функция от параметров статистической модели, которая показывает, насколько вероятно наблюдение заданного набора данных при фиксированных значениях параметров. В отличие от вероятности, которая рассматривает случайные исходы при известных параметрах, функция правдоподобия фиксирует наблюдаемые данные и варьирует параметры, оценивая их «согласованность» с эмпирическими результатами. Функция правдоподобия лежит в основе метода максимального правдоподобия — одного из наиболее распространённых подходов к точечному оцениванию неизвестных параметров распределений.

Определение и формализация

Пусть задана параметрическая модель — семейство распределений вероятности, зависящих от параметра (или вектора параметров) \(\theta\). Для дискретного случая функция правдоподобия \(L(\theta \mid x)\) определяется как вероятность наблюдения конкретного значения случайной величины \(X = x\) при данном \(\theta\):

\[ L(\theta \mid x) = P(X = x \mid \theta). \]

Для непрерывного случая вместо вероятности используется значение плотности распределения \(f(x \mid \theta)\):

\[ L(\theta \mid x) = f(x \mid \theta). \]

Таким образом, функция правдоподобия — это та же функция плотности (или вероятности), но рассматриваемая как функция от \(\theta\) при фиксированном \(x\). В многомерном случае, для независимой выборки \(x_1, x_2, \dots, x_n\) функция правдоподобия равна произведению индивидуальных плотностей:

\[ L(\theta \mid x_1, \dots, x_n) = \prod_{i=1}^{n} f(x_i \mid \theta). \]

Для удобства вычислений часто используют логарифмическую функцию правдоподобия (логарифм правдоподобия, log-likelihood):

\[ \ell(\theta) = \ln L(\theta \mid x). \]

Логарифмирование превращает произведение в сумму, что упрощает дифференцирование и численную оптимизацию.

Принцип правдоподобия

Принцип правдоподобия (англ. likelihood principle) — фундаментальное положение статистического вывода, утверждающее, что вся информация о параметре \(\theta\), содержащаяся в данных, заключена в функции правдоподобия. Два набора наблюдений, порождающие пропорциональные функции правдоподобия, должны приводить к одинаковым выводам относительно \(\theta\). Этот принцип лежит в основе байесовского подхода и критикуется сторонниками частотной статистики, поскольку он отвергает учёт свойств процедуры оценивания (например, несмещённость) при фиксированных данных.

Метод максимального правдоподобия

Метод максимального правдоподобия (ММП, англ. maximum likelihood estimation, MLE) — процедура оценивания, при которой в качестве оценки параметра \(\theta\) выбирается значение, максимизирующее функцию правдоподобия:

\[ \hat{\theta}_{\text{MLE}} = \arg\max_{\theta} L(\theta \mid x). \]

Оценки максимального правдоподобия обладают рядом асимптотических свойств: состоятельностью, асимптотической нормальностью и асимптотической эффективностью (достижение нижней границы дисперсии по Крамеру — Рао). При выполнении условий регулярности ММП-оценки являются асимптотически несмещёнными.

Примеры применения

  • Оценка вероятности успеха в схеме Бернулли. Для последовательности из \(n\) независимых испытаний с \(k\) успехами функция правдоподобия для параметра \(p\) (вероятность успеха) равна \(L(p) = p^k (1-p)^{n-k}\). Максимум достигается при \(\hat{p} = k/n\).
  • Оценка параметров нормального распределения. Для выборки из нормального распределения \(N(\mu, \sigma^2)\) ММП-оценки: \(\hat{\mu} = \bar{x}\) (выборочное среднее), \(\hat{\sigma}^2 = \frac{1}{n}\sum_{i=1}^n (x_i - \bar{x})^2\) (смещённая выборочная дисперсия).
  • Линейная регрессия. В классической модели линейной регрессии с нормальными ошибками ММП-оценки коэффициентов совпадают с оценками метода наименьших квадратов.

Отличие от вероятности

Функция правдоподобия не является вероятностным распределением по параметру: её интеграл по \(\theta\) не обязан равняться единице, и она не подчиняется законам теории вероятностей. Вероятность — это функция данных при фиксированном параметре, а правдоподобие — функция параметра при фиксированных данных. Например, при подбрасывании монеты вероятность выпадения орла при \(p=0.5\) равна 0.5, а правдоподобие параметра \(p=0.5\) при наблюдении одного орла равно 0.5 — численно совпадает, но интерпретация различна.

Отношение правдоподобия

Отношение правдоподобия (англ. likelihood ratio) — статистика, равная отношению значений функции правдоподобия для двух различных гипотез (или двух разных значений параметра). Используется в критерии отношения правдоподобия для проверки статистических гипотез. Тестовая статистика \(\Lambda = \frac{\sup_{\theta \in \Theta_0} L(\theta)}{\sup_{\theta \in \Theta} L(\theta)}\) (где \(\Theta_0\) — подмножество параметров, соответствующее нулевой гипотезе) при выполнении условий регулярности асимптотически распределена как \(\chi^2\) с числом степеней свободы, равным разности размерностей параметрических пространств.

Информация Фишера

Информация Фишера (англ. Fisher information) — математическое ожидание квадрата производной логарифма функции правдоподобия по параметру. Она характеризует количество информации, которое случайная величина несёт о неизвестном параметре. Для одного параметра:

\[ I(\theta) = \mathbb{E}\left[ \left( \frac{\partial}{\partial \theta} \ln f(X \mid \theta) \right)^2 \right]. \]

Информация Фишера обратно пропорциональна асимптотической дисперсии ММП-оценки (неравенство Крамера — Рао). Чем больше информация Фишера, тем точнее можно оценить параметр.

Применение в байесовской статистике

В байесовском подходе функция правдоподобия используется для обновления априорного распределения параметра. Апостериорное распределение пропорционально произведению априорного распределения и функции правдоподобия:

\[ p(\theta \mid x) \propto p(\theta) \cdot L(\theta \mid x). \]

Таким образом, правдоподобие выступает связующим звеном между априорными знаниями и наблюдаемыми данными.

Критика и ограничения

  • При малых объёмах выборки ММП-оценки могут быть смещёнными (например, оценка дисперсии нормального распределения).
  • Функция правдоподобия может иметь несколько локальных максимумов, что усложняет численную оптимизацию.
  • В моделях с большим числом параметров (например, в нейросетях) вычисление точного правдоподобия становится вычислительно затратным, и используются приближённые методы (вариационный вывод, метод Монте-Карло).
  • Принцип правдоподобия не учитывает свойства процедуры оценивания (например, несмещённость), что вызывает споры между байесовскими и частотными школами.

Интересные факты

  • Термин «функция правдоподобия» ввёл Рональд Фишер в 1921 году в работе «On the mathematical foundations of theoretical statistics». Он же разработал метод максимального правдоподобия.
  • В некоторых задачах (например, в анализе выживаемости) используется частичное правдоподобие Кокса, которое не требует задания полной формы распределения времени до события.
  • В машинном обучении функция правдоподобия лежит в основе логистической регрессии, где логарифм правдоподобия максимизируется для нахождения коэффициентов модели.

Источники

  • Fisher, R. A. (1922). On the mathematical foundations of theoretical statistics. Philosophical Transactions of the Royal Society of London. Series A, 222(594-604), 309-368.
  • Lehmann, E. L., & Casella, G. (1998). Theory of Point Estimation (2nd ed.). Springer.
  • Pawitan, Y. (2001). In All Likelihood: Statistical Modelling and Inference Using Likelihood. Oxford University Press.
  • Edwards, A. W. F. (1972). Likelihood. Cambridge University Press.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →