Открыть сервис

Объём выборки

Объём выборки (также размер выборки, англ. sample size) — это количество единиц наблюдения (элементов, объектов, случаев), включённых в выборочную совокупность при проведении статистического исследования. Объём выборки является фундаментальной характеристикой, определяющей точность, надёжность и репрезентативность результатов, полученных на основе выборки, по отношению ко всей генеральной совокупности. Выборка должна быть достаточно большой, чтобы с заданной вероятностью отражать свойства генеральной совокупности, но не избыточной, чтобы не увеличивать неоправданно затраты времени и ресурсов.

Определение и основные понятия

В статистике под выборкой понимают часть генеральной совокупности, отобранную для изучения. Объём выборки обозначается обычно латинской буквой \( n \) (или \( N \) для генеральной совокупности). Различают два основных подхода к определению необходимого объёма:

  • Абсолютный объём — конкретное число единиц наблюдения (например, 1000 человек).
  • Относительный объём — доля выборки от генеральной совокупности (например, 5 % от всех жителей города).

На практике чаще используют абсолютный объём, так как точность оценок зависит в первую очередь от него, а не от доли (при условии, что выборка не является слишком малой по отношению к генеральной совокупности).

Факторы, влияющие на необходимый объём выборки

Определение минимально необходимого объёма выборки зависит от ряда параметров:

  1. Допустимая погрешность (ошибка выборки) — максимальное отклонение выборочной оценки от истинного значения в генеральной совокупности, которое исследователь готов допустить. Чем меньше допустимая погрешность, тем больше требуется объём выборки.
  2. Уровень доверия (доверительная вероятность) — вероятность того, что истинное значение параметра лежит в пределах доверительного интервала. Обычно используют значения 90 %, 95 % или 99 %. Чем выше уровень доверия, тем больше требуется объём.
  3. Дисперсия (вариативность) признака — степень разброса значений изучаемого признака в генеральной совокупности. Чем больше дисперсия, тем больше объём выборки для достижения той же точности. Если дисперсия неизвестна, её оценивают по пилотным исследованиям или принимают максимально возможную (например, для доли — 0,5).
  4. Размер генеральной совокупности — при больших генеральных совокупностях (свыше 10 000–20 000 единиц) влияние этого фактора на необходимый объём выборки становится пренебрежимо малым. Для малых совокупностей (менее 1000) применяют поправочные коэффициенты.
  5. Метод отборапростая случайная выборка, стратифицированная, кластерная и т. д. При стратификации (разбиении на однородные группы) можно достичь той же точности при меньшем общем объёме.

Методы расчёта объёма выборки

Для оценки среднего значения (количественный признак)

Формула для простой случайной выборки при известной дисперсии:

\[ n = \frac{Z^2 \cdot \sigma^2}{E^2} \]

где:

  • \( Z \) — квантиль стандартного нормального распределения, соответствующий выбранному уровню доверия (например, 1,96 для 95 %);
  • \( \sigma^2 \) — дисперсия признака в генеральной совокупности;
  • \( E \) — допустимая погрешность (полуширина доверительного интервала).

Если генеральная совокупность мала (\( N < 10\,000 \)), применяют поправку на конечность:

\[ n_{\text{скорр}} = \frac{n}{1 + \frac{n-1}{N}} \]

Для оценки доли (бинарный признак)

Формула для доли \( p \):

\[ n = \frac{Z^2 \cdot p(1-p)}{E^2} \]

При неизвестной доле \( p \) принимают \( p = 0,5 \), что даёт максимально возможный объём.

Для сравнения двух групп

При планировании экспериментов (например, A/B-тестов) объём выборки рассчитывают с учётом ожидаемого эффекта, мощности теста (обычно 80 % или 90 %) и уровня значимости (обычно 0,05). Используют более сложные формулы, основанные на распределении Стьюдента или нормальном приближении.

Практические рекомендации

  • Минимальный объём — для большинства статистических тестов (например, t-критерий) рекомендуется не менее 30 наблюдений на группу, чтобы приблизиться к нормальному распределению (центральная предельная теорема).
  • Для опросов общественного мнения — типичные объёмы составляют от 1000 до 2000 респондентов при погрешности 2–3 % и уровне доверия 95 %.
  • Для маркетинговых исследований — часто используют 300–500 респондентов на сегмент.
  • Для медицинских исследований — объём рассчитывается строго по формулам, исходя из ожидаемой разницы эффектов и мощности, и может составлять от десятков до тысяч пациентов.
  • Для малых генеральных совокупностей (например, все сотрудники предприятия — 200 человек) — объём выборки может быть 50–100 единиц, но с учётом поправки на конечность.

Ошибки, связанные с объёмом выборки

  • Недостаточный объём — приводит к низкой точности, широким доверительным интервалам, невозможности выявить статистически значимые различия (низкая мощность). Результаты могут быть ненадёжными.
  • Избыточный объём — увеличивает затраты времени, средств и ресурсов без существенного повышения точности. В некоторых случаях (например, при очень больших выборках) даже малые, практически незначимые эффекты становятся статистически значимыми, что может вводить в заблуждение.
  • Игнорирование дисперсии — если дисперсия признака сильно отличается от предполагаемой, фактическая погрешность может быть выше запланированной.

Примеры расчёта

Пример 1. Требуется оценить средний доход жителей города с погрешностью ±2000 руб. при уровне доверия 95 %. По данным прошлых исследований, стандартное отклонение дохода составляет 15 000 руб. Тогда:

\[ n = \frac{1,96^2 \cdot 15000^2}{2000^2} = \frac{3,8416 \cdot 225\,000\,000}{4\,000\,000} \approx 216 \]

Необходимо опросить 216 человек.

Пример 2. Нужно оценить долю сторонников определённого политика с погрешностью ±3 % при уровне доверия 95 %. Принимаем \( p = 0,5 \):

\[ n = \frac{1,96^2 \cdot 0,5 \cdot 0,5}{0,03^2} = \frac{3,8416 \cdot 0,25}{0,0009} \approx 1067 \]

Необходимо опросить 1067 респондентов.

Ограничения и особенности

  • Расчётные формулы дают минимально необходимый объём. На практике его часто увеличивают на 10–20 % для компенсации возможных отказов, неполных ответов или выбросов.
  • Для сложных дизайнов (кластерная, многоступенчатая выборка) требуются более сложные методы расчёта, учитывающие дизайн-эффект.
  • В байесовской статистике объём выборки может определяться не только точностью, но и априорными распределениями.
  • В машинном обучении объём выборки влияет на качество модели: недостаток данных ведёт к переобучению, избыток — к увеличению времени обучения.

Источники

  • Кендалл М., Стюарт А. «Теория распределений». — М.: Наука, 1966.
  • Кокрен У. «Методы выборочных исследований». — М.: Статистика, 1976.
  • Гмурман В. Е. «Теория вероятностей и математическая статистика». — М.: Высшая школа, 2003.
  • Лемешко Б. Ю. «Статистический анализ данных: учебное пособие». — Новосибирск: НГТУ, 2010.
  • Agresti A., Franklin C. «Statistics: The Art and Science of Learning from Data». — Pearson, 2013.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →