Data lake
Data lake (jezioro danych) to centralne repozytorium, które przechowuje dane w ich surowej, oryginalnej postaci — bez wcześniejszego narzucania schematu. Trafiają do niego zarówno dane ustrukturyzowane (tabele z baz danych), jak i półustrukturyzowane (JSON, logi, zdarzenia) oraz nieustrukturyzowane (dokumenty, obrazy, nagrania). Struktura i interpretacja są nakładane dopiero w momencie analizy — to podejście nazywane schema-on-read.
Na czym polega architektura data lake?
Warstwą przechowywania jest zwykle tani, skalowalny magazyn obiektowy (object storage typu S3) lub rozproszony system plików. Dane organizuje się w strefy: surową (raw), oczyszczoną (curated) i analityczną, przez które przepływają w procesach ELT — najpierw ładowanie, potem transformacja. Nad plikami pracują silniki zapytań i przetwarzania (Spark, Presto/Trino, silniki SQL-on-files), a katalog danych z metadanymi pozwala odnaleźć i zrozumieć poszczególne zbiory. Kluczowa różnica względem hurtowni danych: hurtownia wymaga zaprojektowania schematu przed zapisem i przyjmuje tylko dane przetworzone, jezioro przyjmuje wszystko od razu, przenosząc koszt porządkowania na etap odczytu. Coraz częściej oba podejścia łączy architektura lakehouse, dodająca do jeziora transakcyjność i kontrolę jakości znaną z hurtowni.
Zastosowanie w praktyce
Jeziora danych są fundamentem projektów big data i uczenia maszynowego. Typowe scenariusze:
- trenowanie modeli ML — zespoły data science potrzebują surowych, historycznych danych, których hurtownia nie przechowuje;
- analiza logów i telemetrii — strumienie zdarzeń z aplikacji, serwerów i urządzeń IoT lądują w jeziorze tanio i bez utraty szczegółów;
- archiwum analityczne — pełna historia danych źródłowych dostępna na żądanie, np. do audytów;
- integracja źródeł — jedno miejsce łączące CRM, systemy transakcyjne i dane zewnętrzne przed dalszym przetwarzaniem.
Warunkiem sukcesu jest zarządzanie: katalog danych, właściciele zbiorów, kontrola dostępu i zasady jakości. Bez nich jezioro szybko zamienia się w „bagno danych” (data swamp), z którego nikt nie potrafi wyłowić wartości.
Powiązane pojęcia
Najczęstsze pytania
Czym różni się data lake od hurtowni danych?
Hurtownia danych przechowuje dane oczyszczone i przekształcone pod z góry zdefiniowany schemat (schema-on-write), zoptymalizowane pod raportowanie. Data lake przyjmuje dane surowe, w dowolnym formacie, a strukturę narzuca dopiero przy odczycie (schema-on-read) — jest tańszy i elastyczniejszy, ale wymaga większej dyscypliny zarządzania.
Czym jest data swamp?
To jezioro danych, które wymknęło się spod kontroli: brak katalogu, metadanych i zasad jakości sprawia, że nikt nie wie, co i skąd w nim leży, więc dane stają się bezużyteczne. Zapobiega temu governance — katalog danych, właściciele zbiorów i kontrola dostępu od pierwszego dnia.
