Любой статистический вывод — это компромисс между двумя ошибками. Уменьшая одну, обычно увеличиваешь другую.
Как это связано с порогами
- Уровень значимости (обычно 5%) — это допустимая вероятность ошибки первого рода.
- Мощность теста (обычно 80%) — это вероятность правильно поймать эффект, если он есть. 1 минус мощность — это вероятность ошибки второго рода.
- Чем строже порог значимости, тем реже ложные тревоги, но и тем больше пропусков реальных эффектов при той же выборке.
Где это особенно важно
- Медицина: одна цена у «зря назначили лечение», другая — у «пропустили серьёзный диагноз».
- Борьба с мошенничеством: пропуск мошенника обычно обходится дороже ложного срабатывания даже с учётом разбора таких случаев.
- A/B-тесты в продукте: ложный «успех» приводит к внедрению бесполезных изменений и потере фокуса.
- При проектировании A/B-тестов
- При выборе порогов в моделях классификации
- В рисковых системах, где цены разных ошибок различны
- Не нужно жёстко применять во всех бизнес-обсуждениях — иногда достаточно спросить «есть ли реальный эффект» без формального разбора типов ошибок
Модель банка выявляет подозрительные операции. При выборе порога команда осознанно идёт на больший процент ложных срабатываний (ошибка первого рода), потому что цена пропуска мошеннической операции (ошибка второго рода) — реальные деньги и репутационные потери. Это решение фиксируют письменно, чтобы потом не спорить, почему обычные клиенты иногда натыкаются на дополнительную проверку.
Перед запуском любого теста или модели полезно сразу проговорить: какая ошибка дороже и почему. Это сильно меняет, какие пороги вы выбираете и какие показатели смотрите в первую очередь.