Открыть сервис

Погрешность выборки

Погрешность выборки — это статистическая величина, отражающая возможное отклонение характеристик, полученных по результатам выборочного наблюдения, от истинных характеристик генеральной совокупности. Она возникает из-за того, что исследование проводится не на всей совокупности объектов (например, всех жителей страны), а лишь на её части — выборке. Погрешность выборки является неизбежным следствием вероятностной природы выборочного метода и количественно выражает степень неопределённости, связанной с экстраполяцией результатов на всю популяцию. В статистике и социологии погрешность выборки также называют ошибкой выборки или стандартной ошибкой.

Природа и причины возникновения

Погрешность выборки возникает исключительно из-за того, что исследование не является сплошным. Даже при идеально случайном отборе респондентов результаты опроса 1000 человек не будут абсолютно точно совпадать с результатами опроса всех 100 миллионов граждан. Это фундаментальное свойство выборочного метода, а не следствие ошибок исследователя.

Основные факторы, влияющие на величину погрешности:

  • Объём выборки (n). Чем больше респондентов опрошено, тем меньше погрешность. Зависимость обратно пропорциональна квадратному корню из объёма выборки: чтобы уменьшить погрешность вдвое, нужно увеличить выборку в четыре раза.
  • Дисперсия признака в генеральной совокупности. Чем более разнородна совокупность по изучаемому признаку (например, по уровню дохода), тем больше погрешность. Для однородных признаков (например, пола) погрешность ниже.
  • Доверительная вероятность (уровень надёжности). Чем выше требуемая уверенность в результате (например, 99% против 95%), тем шире доверительный интервал и тем больше погрешность.

Важно различать погрешность выборки и систематические ошибки (смещения). Погрешность выборки — это случайная ошибка, которая уменьшается с ростом объёма выборки. Систематические ошибки (например, неверная формулировка вопроса, нерепрезентативность выборки, отказ от участия определённых групп) не уменьшаются при увеличении объёма выборки и могут полностью исказить результаты.

Методы расчёта

Формула для простой случайной выборки

Для наиболее распространённого случая — оценки доли (процента) признака в генеральной совокупности — погрешность выборки (e) при доверительной вероятности 95% рассчитывается по формуле:

\[ e = 1,96 \times \sqrt{\frac{p(1-p)}{n}} \]

где:

  • \( p \) — наблюдаемая доля признака в выборке (например, 50% или 0,5);
  • \( n \) — объём выборки;
  • 1,96 — коэффициент, соответствующий 95% доверительной вероятности (для 99% используется 2,58).

На практике, когда доля признака неизвестна, для максимальной погрешности принимают \( p = 0,5 \), так как произведение \( p(1-p) \) максимально именно при этом значении.

Пример расчёта

При опросе 1000 человек и наблюдаемой доле 50% погрешность выборки составит:

\[ e = 1,96 \times \sqrt{\frac{0,5 \times 0,5}{1000}} = 1,96 \times 0,0158 = 0,031 \ (3,1\%) \]

Это означает, что с вероятностью 95% истинное значение доли в генеральной совокупности находится в интервале от 46,9% до 53,1%.

Для среднего значения

Если оценивается среднее арифметическое (например, средний возраст), погрешность рассчитывается через стандартное отклонение признака:

\[ e = z \times \frac{\sigma}{\sqrt{n}} \]

где \( \sigma \) — стандартное отклонение признака в генеральной совокупности (или его оценка по выборке), \( z \) — коэффициент доверительной вероятности.

Коррекция для конечной генеральной совокупности

Если объём выборки составляет значительную долю от генеральной совокупности (более 5–10%), применяется поправка на конечность совокупности (finite population correction, FPC):

\[ e_{корр} = e \times \sqrt{\frac{N-n}{N-1}} \]

где \( N \) — объём генеральной совокупности. Эта поправка уменьшает погрешность, так как при выборке, близкой к полному охвату, погрешность стремится к нулю.

Факторы, влияющие на величину погрешности

Объём выборки

Зависимость погрешности от объёма выборки нелинейна. При малых выборках (до 100–200 человек) погрешность велика и быстро уменьшается с добавлением каждого нового респондента. При больших выборках (свыше 1000–2000 человек) дальнейшее увеличение объёма даёт всё меньший выигрыш в точности. Например, увеличение выборки с 1000 до 4000 человек снижает погрешность вдвое (с 3,1% до 1,55%), но требует четырёхкратного увеличения затрат.

Дизайн выборки

Реальные опросы редко используют простую случайную выборку. Чаще применяются стратифицированные, кластерные или многоступенчатые выборки. Для таких дизайнов расчёт погрешности усложняется, и вводится понятие эффекта дизайна (design effect, DEFF). Эффект дизайна показывает, во сколько раз реальная дисперсия оценки отличается от дисперсии при простой случайной выборке того же объёма. Для кластерных выборок DEFF может быть больше 1 (погрешность выше), для стратифицированных — меньше 1 (погрешность ниже).

Доля признака

Погрешность максимальна при доле 50% и минимальна при долях, близких к 0% или 100%. Например, при выборке 1000 человек и доле 5% погрешность составит около 1,4%, а при доле 50% — 3,1%.

Применение в социологии и маркетинге

В социологических опросах и маркетинговых исследованиях погрешность выборки является стандартным показателем качества данных. Результаты опросов обычно публикуются с указанием погрешности, например: «Опрос проведён среди 1600 респондентов, погрешность не превышает 3,5% при доверительной вероятности 95%».

В России крупнейшие исследовательские организации (ВЦИОМ, ФОМ, Левада-Центр — признан иноагентом в РФ) регулярно публикуют данные о погрешности своих опросов. Для общероссийских опросов типичный объём выборки составляет 1600–2000 человек, что даёт погрешность около 2,5–3,5%.

Погрешность выборки учитывается при:

  • Определении необходимого объёма выборки на этапе планирования исследования;
  • Интерпретации различий между группами (например, между кандидатами на выборах);
  • Сравнении результатов разных опросов во времени.

Ограничения и критика

Погрешность выборки отражает только случайную ошибку, связанную с объёмом выборки. Она не учитывает:

  • Систематические ошибки (смещение выборки, неверные формулировки вопросов, эффект интервьюера);
  • Ошибки неответов (когда определённые группы респондентов систематически отказываются от участия);
  • Ошибки покрытия (когда часть генеральной совокупности недоступна для опроса, например, люди без телефонов при телефонном опросе).

В реальных исследованиях фактическая ошибка может значительно превышать рассчитанную погрешность выборки. Например, в предвыборных опросах в США в 2016 и 2020 годах многие опросы показывали погрешность около 3%, но фактические отклонения от результатов выборов были больше из-за систематических ошибок в охвате определённых групп избирателей.

Кроме того, погрешность выборки не может быть рассчитана для невероятностных выборок (например, онлайн-опросы по подписке, опросы на сайтах), так как для таких выборок не выполняются условия случайности.

Интересные факты

  • В 1936 году журнал Literary Digest провёл масштабный опрос (более 2 миллионов респондентов) для прогноза президентских выборов в США, но ошибся в прогнозе из-за систематической ошибки выборки (опрос проводился среди владельцев автомобилей и телефонов, что сместило выборку в сторону более обеспеченных граждан). В то же время Джордж Гэллап с гораздо меньшей выборкой (около 50 000 человек) дал точный прогноз, используя репрезентативную выборку.
  • Погрешность выборки часто путают с «погрешностью опроса» в целом. На самом деле, погрешность выборки — лишь один из компонентов общей ошибки исследования.
  • В России при проведении экзитполов (опросов на выходе с избирательных участков) типичная погрешность выборки составляет 1–2% при объёме выборки 100 000–150 000 респондентов.

Источники

  1. Кокрен У. Методы выборочного исследования. — М.: Статистика, 1976.
  2. Грэм К. Выборочные методы в социологии. — М.: Наука, 1986.
  3. Лемешко Б. Ю., Постовалов С. Н. Статистический анализ данных: учебное пособие. — Новосибирск: НГТУ, 2013.
  4. Groves R. M. et al. Survey Methodology. — 2nd ed. — Wiley, 2009.
  5. ВЦИОМ. Методология опросов. — Официальный сайт ВЦИОМ, 2023.
  6. Lohr S. L. Sampling: Design and Analysis. — 2nd ed. — Brooks/Cole, 2010.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →