Функция правдоподобия
Функция правдоподобия (англ. likelihood function) — в математической статистике и теории вероятностей это функция от параметров статистической модели, которая показывает, насколько вероятно наблюдение заданного набора данных при фиксированных значениях параметров. В отличие от вероятности, которая рассматривает случайные исходы при известных параметрах, функция правдоподобия фиксирует наблюдаемые данные и варьирует параметры, оценивая их «согласованность» с эмпирическими результатами. Функция правдоподобия лежит в основе метода максимального правдоподобия — одного из наиболее распространённых подходов к точечному оцениванию неизвестных параметров распределений.
Определение и формализация
Пусть задана параметрическая модель — семейство распределений вероятности, зависящих от параметра (или вектора параметров) \(\theta\). Для дискретного случая функция правдоподобия \(L(\theta \mid x)\) определяется как вероятность наблюдения конкретного значения случайной величины \(X = x\) при данном \(\theta\):
\[ L(\theta \mid x) = P(X = x \mid \theta). \]
Для непрерывного случая вместо вероятности используется значение плотности распределения \(f(x \mid \theta)\):
\[ L(\theta \mid x) = f(x \mid \theta). \]
Таким образом, функция правдоподобия — это та же функция плотности (или вероятности), но рассматриваемая как функция от \(\theta\) при фиксированном \(x\). В многомерном случае, для независимой выборки \(x_1, x_2, \dots, x_n\) функция правдоподобия равна произведению индивидуальных плотностей:
\[ L(\theta \mid x_1, \dots, x_n) = \prod_{i=1}^{n} f(x_i \mid \theta). \]
Для удобства вычислений часто используют логарифмическую функцию правдоподобия (логарифм правдоподобия, log-likelihood):
\[ \ell(\theta) = \ln L(\theta \mid x). \]
Логарифмирование превращает произведение в сумму, что упрощает дифференцирование и численную оптимизацию.
Принцип правдоподобия
Принцип правдоподобия (англ. likelihood principle) — фундаментальное положение статистического вывода, утверждающее, что вся информация о параметре \(\theta\), содержащаяся в данных, заключена в функции правдоподобия. Два набора наблюдений, порождающие пропорциональные функции правдоподобия, должны приводить к одинаковым выводам относительно \(\theta\). Этот принцип лежит в основе байесовского подхода и критикуется сторонниками частотной статистики, поскольку он отвергает учёт свойств процедуры оценивания (например, несмещённость) при фиксированных данных.
Метод максимального правдоподобия
Метод максимального правдоподобия (ММП, англ. maximum likelihood estimation, MLE) — процедура оценивания, при которой в качестве оценки параметра \(\theta\) выбирается значение, максимизирующее функцию правдоподобия:
\[ \hat{\theta}_{\text{MLE}} = \arg\max_{\theta} L(\theta \mid x). \]
Оценки максимального правдоподобия обладают рядом асимптотических свойств: состоятельностью, асимптотической нормальностью и асимптотической эффективностью (достижение нижней границы дисперсии по Крамеру — Рао). При выполнении условий регулярности ММП-оценки являются асимптотически несмещёнными.
Примеры применения
- Оценка вероятности успеха в схеме Бернулли. Для последовательности из \(n\) независимых испытаний с \(k\) успехами функция правдоподобия для параметра \(p\) (вероятность успеха) равна \(L(p) = p^k (1-p)^{n-k}\). Максимум достигается при \(\hat{p} = k/n\).
- Оценка параметров нормального распределения. Для выборки из нормального распределения \(N(\mu, \sigma^2)\) ММП-оценки: \(\hat{\mu} = \bar{x}\) (выборочное среднее), \(\hat{\sigma}^2 = \frac{1}{n}\sum_{i=1}^n (x_i - \bar{x})^2\) (смещённая выборочная дисперсия).
- Линейная регрессия. В классической модели линейной регрессии с нормальными ошибками ММП-оценки коэффициентов совпадают с оценками метода наименьших квадратов.
Отличие от вероятности
Функция правдоподобия не является вероятностным распределением по параметру: её интеграл по \(\theta\) не обязан равняться единице, и она не подчиняется законам теории вероятностей. Вероятность — это функция данных при фиксированном параметре, а правдоподобие — функция параметра при фиксированных данных. Например, при подбрасывании монеты вероятность выпадения орла при \(p=0.5\) равна 0.5, а правдоподобие параметра \(p=0.5\) при наблюдении одного орла равно 0.5 — численно совпадает, но интерпретация различна.
Отношение правдоподобия
Отношение правдоподобия (англ. likelihood ratio) — статистика, равная отношению значений функции правдоподобия для двух различных гипотез (или двух разных значений параметра). Используется в критерии отношения правдоподобия для проверки статистических гипотез. Тестовая статистика \(\Lambda = \frac{\sup_{\theta \in \Theta_0} L(\theta)}{\sup_{\theta \in \Theta} L(\theta)}\) (где \(\Theta_0\) — подмножество параметров, соответствующее нулевой гипотезе) при выполнении условий регулярности асимптотически распределена как \(\chi^2\) с числом степеней свободы, равным разности размерностей параметрических пространств.
Информация Фишера
Информация Фишера (англ. Fisher information) — математическое ожидание квадрата производной логарифма функции правдоподобия по параметру. Она характеризует количество информации, которое случайная величина несёт о неизвестном параметре. Для одного параметра:
\[ I(\theta) = \mathbb{E}\left[ \left( \frac{\partial}{\partial \theta} \ln f(X \mid \theta) \right)^2 \right]. \]
Информация Фишера обратно пропорциональна асимптотической дисперсии ММП-оценки (неравенство Крамера — Рао). Чем больше информация Фишера, тем точнее можно оценить параметр.
Применение в байесовской статистике
В байесовском подходе функция правдоподобия используется для обновления априорного распределения параметра. Апостериорное распределение пропорционально произведению априорного распределения и функции правдоподобия:
\[ p(\theta \mid x) \propto p(\theta) \cdot L(\theta \mid x). \]
Таким образом, правдоподобие выступает связующим звеном между априорными знаниями и наблюдаемыми данными.
Критика и ограничения
- При малых объёмах выборки ММП-оценки могут быть смещёнными (например, оценка дисперсии нормального распределения).
- Функция правдоподобия может иметь несколько локальных максимумов, что усложняет численную оптимизацию.
- В моделях с большим числом параметров (например, в нейросетях) вычисление точного правдоподобия становится вычислительно затратным, и используются приближённые методы (вариационный вывод, метод Монте-Карло).
- Принцип правдоподобия не учитывает свойства процедуры оценивания (например, несмещённость), что вызывает споры между байесовскими и частотными школами.
Интересные факты
- Термин «функция правдоподобия» ввёл Рональд Фишер в 1921 году в работе «On the mathematical foundations of theoretical statistics». Он же разработал метод максимального правдоподобия.
- В некоторых задачах (например, в анализе выживаемости) используется частичное правдоподобие Кокса, которое не требует задания полной формы распределения времени до события.
- В машинном обучении функция правдоподобия лежит в основе логистической регрессии, где логарифм правдоподобия максимизируется для нахождения коэффициентов модели.
Источники
- Fisher, R. A. (1922). On the mathematical foundations of theoretical statistics. Philosophical Transactions of the Royal Society of London. Series A, 222(594-604), 309-368.
- Lehmann, E. L., & Casella, G. (1998). Theory of Point Estimation (2nd ed.). Springer.
- Pawitan, Y. (2001). In All Likelihood: Statistical Modelling and Inference Using Likelihood. Oxford University Press.
- Edwards, A. W. F. (1972). Likelihood. Cambridge University Press.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →