Систематическая ошибка отбора — фоновая угроза любой неэкспериментальной аналитики. Она тише ошибки выжившего, но встречается чаще.
Где особенно часто возникает
- Онлайн-опросы и NPS-исследования: отвечают самые активные и самые недовольные.
- Разбор кейсов: смотрят только закрытые сделки, забывая про незакрытые и отвалившиеся ещё на этапе переговоров.
- Воронки в продукте: считают конверсию по тем, кто дошёл до конкретного шага, не учитывая тех, кто вообще не начал.
- Отраслевые бенчмарки: их составляют по компаниям, согласившимся участвовать, а это уже сильно смещённая группа.
Что делать
- Описывать аудиторию выборки явно: «эти выводы относятся только к...».
- Стараться сделать сбор более случайным или хотя бы понятно структурированным.
- Сверять метрики с альтернативными источниками, в которых смещение устроено иначе.
- В любых опросах, NPS и UX-исследованиях
- При работе с публичными бенчмарками
- При работе с воронками, в которых часть пользователей системно не попадает в анализ
- Когда речь о действительно сплошной выборке (например, все транзакции системы) — но даже там бывают свои смещения
Компания публикует «бенчмарк по рынку»: средняя выручка SaaS-стартапа на посевной стадии — 50 тысяч долларов в месяц. Цифра выглядит правдоподобно, но это среднее по стартапам, согласившимся участвовать в опросе, — а это сильно смещённая выборка успешных и амбициозных команд. Стартап, который сравнивает себя с этим бенчмарком, рискует ставить нереалистичные цели и принимать ошибочные решения о найме.
Любой график со «средним по отрасли» или «по нашей базе клиентов» полезно сопровождать одной фразой: чья именно это выборка, какие группы в неё не вошли и какие выводы из неё переносить корректно, а какие — нет.