Статистическая значимость — главная защита от того, чтобы принять случайный всплеск за реальное улучшение. Без неё A/B-тесты быстро превращаются в гадание.
Что важно
- Порог 5% — соглашение, а не закон. В медицине и в регулируемых отраслях берут 1% или 0,1%, в маркетинге часто 10%.
- Значимый результат не равен «большому». Малый, но устойчивый эффект может быть значим, а большой случайный — нет.
- Чем больше выборка, тем легче поймать значимость даже у незначительных эффектов.
Типичные ошибки
- Подглядывание в тест до его завершения и остановка, как только цифры понравились.
- Многократные сравнения без поправок — чем больше метрик проверяете, тем выше шанс случайной «победы».
- Игнорирование размера эффекта: значимый, но микроскопический результат может не стоить внедрения.
- Любые A/B-тесты и сравнения вариантов
- Любые выводы вида «у группы X результат выше, чем у Y»
- Перед принятием решений на основе данных небольшого объёма
- Когда речь о бизнес-решении, где значимость — лишь часть картины. Иногда стоит внедрить и без полной значимости, иногда — отказаться даже при значимом эффекте, потому что он слишком мал
Маркетинг тестирует два варианта писем. Через сутки в первом конверсия 3,1%, во втором — 3,4%. Кажется, что лучше второй. Расчёт значимости показывает: при таком объёме данных вероятность увидеть такую разницу случайно — около 30%. Через неделю и большую выборку разница исчезает: оба варианта дают около 3,2%. Без расчёта значимости команда отправила бы менее качественный шаблон в массовую рассылку.
До запуска A/B-теста заранее посчитайте, какая выборка нужна, чтобы поймать минимально интересный для бизнеса эффект. Если для значимости требуется выборка, до которой эксперимент не доживёт, нужно либо менять метрику, либо честно признать, что тест не даст результата.