Размер выборки

Количество наблюдений, на основе которых делаются статистические выводы. Чем оно больше, тем точнее оценки.

КРАТКО
Размер выборки — это сколько наблюдений у вас есть для эксперимента или анализа. Маленькая выборка даёт большой разброс оценок: одна и та же случайность может выглядеть как «двукратное улучшение» или как «провал». Перед любым A/B-тестом полезно заранее посчитать, сколько данных нужно, чтобы поймать минимально интересный эффект с приемлемой надёжностью.
СИНОНИМЫ:размер выборкиобъём выборкичисло наблюденийsample size

Размер выборки — главный регулятор надёжности и стоимости любого статистического исследования. Слишком маленькая выборка даёт ненадёжные выводы, слишком большая — лишние затраты времени и денег.

От чего зависит нужный размер

  • Минимальный эффект, который вы хотите уверенно поймать (MDE).
  • Базовая величина метрики: конверсия 1% требует значительно большей выборки, чем 30%.
  • Выбранные уровни значимости и мощности теста.
  • Разброс метрики: чем он шире, тем больше нужно данных.

Что важно

  • Если выборка не дотягивает до расчётной, выводы из теста почти бесполезны.
  • Слишком большая выборка приводит к тому, что значимыми становятся даже бесполезные для бизнеса различия.
КОГДА ПРИМЕНЯТЬ
  • Перед запуском A/B-теста
  • При планировании опросов и фокус-групп
  • Перед оценкой моделей на отложенной выборке
КОГДА НЕ СТОИТ
  • Когда выбор делается не на основе статистики, а на основе экспертной оценки или требований регуляторов
ПРИМЕР

Команда хочет проверить изменение в форме регистрации. Конверсия — 8%, минимальный интересный прирост — 0,5 процентных пункта. Калькулятор размера выборки показывает: для теста с уровнем значимости 5% и мощностью 80% нужно около 28 тысяч пользователей в каждой группе. У сайта 5 тысяч новых в неделю. Это значит, что эксперимент займёт около 12 недель, и команда заранее решает либо подождать, либо проверять более грубые гипотезы.

КАК ИСПОЛЬЗОВАТЬ В SHTAB

Не запускайте A/B-тест без предварительного расчёта выборки. Иначе типичный сценарий выглядит так: команда смотрит на цифры через неделю, видит «победу», внедряет — а на следующих неделях эффект пропадает. Это и есть результат слишком маленькой выборки.

Попробовать бесплатно

Вопросы про «Размер выборки»

Тогда честнее признать, что тест не даст уверенного ответа, и либо подождать, либо сменить метрику на более чувствительную, либо использовать байесовские методы и принимать решение с явно описанной долей риска. Иллюзия точности на маленькой выборке хуже, чем её отсутствие: она заставляет команду верить в эффект, которого может и не быть.

Применяйте термины на практике

База знаний, задачи и цели — в одном сервисе. Бесплатно — без лимита по числу людей.