Большая часть проблем в аналитике и машинном обучении на самом деле — это проблемы данных. Модели и дашборды лишь усиливают то, что приходит на вход.
Ключевые свойства
- Полнота — нет пропущенных полей и записей, которые должны были быть.
- Точность — значения соответствуют реальности.
- Актуальность — данные обновляются с нужной частотой.
- Согласованность — одни и те же сущности одинаково описаны в разных системах.
- Уникальность — нет дубликатов, размывающих агрегаты.
- Валидность — данные соответствуют формату и допустимым значениям.
Где обычно ломается
- Изменения в продуктовой схеме без уведомления аналитиков.
- Ручной ввод и опечатки в важных полях.
- Расхождение часовых поясов и форматов дат.
- Скрытые удаления и обновления, которые не попадают в аналитический пайплайн.
- Перед запуском новой витрины или модели
- В регулярных проверках в пайплайнах данных
- При расследовании расхождений между отчётами разных команд
- Не существует — игнорирование качества данных всегда оборачивается дороже, чем работа над ним
Финансовый отчёт показывает странное падение выручки. Через час расследования выясняется, что новый разработчик переименовал поле в продуктовой базе, и загрузка тихо начала писать туда пустые значения. Проверки на полноту поймали бы это в момент запуска, но их не было. После инцидента команда добавила автоматические проверки уровня «доля пустых значений не выше порога», и подобный сценарий теперь обнаруживается за минуты, а не за часы.
Самое окупаемое вложение в работу с данными — простые автоматические проверки качества в пайплайнах: количество строк, доля пропусков, диапазон значений, число дубликатов. Они дёшевы в реализации и ловят большинство «странностей» в отчётах раньше, чем их заметит руководство.