Аналитика и данныеИнфраструктура данных

Озеро данных (Data Lake)

Хранилище сырых данных в исходных форматах: логов, файлов, выгрузок — без жёсткой схемы.

КРАТКО
Озеро данных — это место, куда складывают сырые данные в исходных форматах: логи, выгрузки, файлы, события. В отличие от хранилища, у озера нет строгой схемы: это скорее оптовый склад данных, к которому потом подключают разных потребителей. Часто озеро и хранилище живут рядом: озеро дёшево хранит всё подряд, хранилище — структурированные витрины для аналитики.
СИНОНИМЫ:озеро данныхData Lakeозеро-хранилищеlakehouse

Концепция озера данных появилась как ответ на ограничения классических хранилищ, для которых схему данных нужно придумывать заранее. В озеро сначала кладут всё как есть, а уже потом решают, что и как анализировать.

Что обычно хранится

  • Сырые события из продукта в формате JSON.
  • Журналы работы систем и снимки баз данных.
  • Выгрузки из внешних систем без обработки.
  • Файлы для ML: изображения, аудио, видео, тексты.

Современная архитектура

  • Сами файлы лежат в дешёвом облачном хранилище: S3, GCS, Yandex Object Storage.
  • Поверх них — открытые форматы (Parquet, ORC) и слой метаданных (Apache Iceberg, Delta Lake).
  • Аналитические движки (Athena, Presto, Trino, Spark) умеют запрашивать данные прямо из озера.
  • Такую связку называют озером-хранилищем, по-английски lakehouse: гибрид озера и классического хранилища.
КОГДА ПРИМЕНЯТЬ
  • Много разнородных данных, в том числе неструктурированных
  • Хочется сохранять историю в исходном виде «на всякий случай»
  • Нужны и аналитика, и ML на одних и тех же данных
КОГДА НЕ СТОИТ
  • Маленький проект с парой источников — достаточно одного хранилища, отдельное озеро строить незачем
ПРИМЕР

Финтех-компания собирает события из мобильного приложения, банкоматов, веб-кабинета и партнёрских каналов. Все сырые события через Kafka попадают в озеро данных на S3 в формате Parquet. На основе озера живут и витрины в хранилище для BI, и наборы признаков для ML-моделей. Если возникает новый аналитический вопрос, который не покрыт текущими витринами, аналитик идёт прямо в озеро и собирает нужную выборку, не переделывая исходный конвейер загрузки.

КАК ИСПОЛЬЗОВАТЬ В SHTAB

Озеро очень быстро превращается в болото, если в нём нет каталога данных и владельцев. Прежде чем сгружать туда сырьё со всей компании, продумайте: кто отвечает за каждый источник, как описаны схемы и кто чистит устаревшее. Описания источников и ответственных удобно держать в базе знаний Shtab, а доступ к разделам разграничивать правами и ролями. Без этого через год озеро станет непригодным для работы.

Попробовать бесплатно

Вопросы про «Озеро данных (Data Lake)»

В хранилище данные уже структурированы и приведены к нужной схеме: оно оптимизировано под быстрые запросы на SQL. В озере данные лежат как есть и стоят дёшево, но запросы к ним обычно медленнее и требуют более продвинутых инструментов. В современных архитектурах два подхода постепенно сливаются в один — отсюда и появилось понятие озера-хранилища.

Применяйте термины на практике

База знаний, задачи и цели — в одном сервисе. Бесплатно — без лимита по числу людей.