Ошибки первого и второго рода

Ошибка первого рода — признать эффект, которого нет. Ошибка второго рода — не заметить реальный эффект.

КРАТКО
Ошибки первого и второго рода — два способа ошибиться в статистическом выводе. Ошибка первого рода — ложная тревога: вы решили, что улучшение есть, а его нет. Ошибка второго рода — пропустить реальный эффект. Что хуже, зависит от цены ошибки в конкретной задаче: в борьбе с мошенничеством дороже пропустить мошенника, в медицине — зря назначить лекарство.
СИНОНИМЫ:ошибка первого родаошибка второго родаложная тревогапропуск эффектаType I errorType II error

Любой статистический вывод — это компромисс между двумя ошибками. Уменьшая одну, обычно увеличиваешь другую.

Как это связано с порогами

  • Уровень значимости (обычно 5%) — это допустимая вероятность ошибки первого рода.
  • Мощность теста (обычно 80%) — это вероятность правильно поймать эффект, если он есть. 1 минус мощность — это вероятность ошибки второго рода.
  • Чем строже порог значимости, тем реже ложные тревоги, но и тем больше пропусков реальных эффектов при той же выборке.

Где это особенно важно

  • Медицина: одна цена у «зря назначили лечение», другая — у «пропустили серьёзный диагноз».
  • Борьба с мошенничеством: пропуск мошенника обычно обходится дороже ложного срабатывания даже с учётом разбора таких случаев.
  • A/B-тесты в продукте: ложный «успех» приводит к внедрению бесполезных изменений и потере фокуса.
КОГДА ПРИМЕНЯТЬ
  • При проектировании A/B-тестов
  • При выборе порогов в моделях классификации
  • В рисковых системах, где цены разных ошибок различны
КОГДА НЕ СТОИТ
  • Не нужно жёстко применять во всех бизнес-обсуждениях — иногда достаточно спросить «есть ли реальный эффект» без формального разбора типов ошибок
ПРИМЕР

Модель банка выявляет подозрительные операции. При выборе порога команда осознанно идёт на больший процент ложных срабатываний (ошибка первого рода), потому что цена пропуска мошеннической операции (ошибка второго рода) — реальные деньги и репутационные потери. Это решение фиксируют письменно, чтобы потом не спорить, почему обычные клиенты иногда натыкаются на дополнительную проверку.

КАК ИСПОЛЬЗОВАТЬ В SHTAB

Перед запуском любого теста или модели полезно сразу проговорить: какая ошибка дороже и почему. Это сильно меняет, какие пороги вы выбираете и какие показатели смотрите в первую очередь.

Попробовать бесплатно

Вопросы про «Ошибки первого и второго рода»

Только увеличив выборку или снизив разброс показателя. При фиксированных данных снижение одной ошибки автоматически увеличивает другую. Это базовый компромисс статистики, обойти его нельзя — можно лишь осознанно выбрать точку баланса исходя из того, какая из двух ошибок дороже стоит бизнесу. Поэтому цену ошибок обсуждают до запуска теста, а не после.

Применяйте термины на практике

База знаний, задачи и цели — в одном сервисе. Бесплатно — без лимита по числу людей.