En datasjø lagrer rådata i sitt opprinnelige format. Ingen skjemaer håndheves ved skriving. Strukturerte tabeller, JSON-logger, bilder og video ligger alle i samme repository. Skjemaet brukes når dataene leses, ikke når de lagres. Denne fleksibiliteten er det som er appellen. Datasjøen aksepterer hva som helst. Den krever ikke at du vet hvordan du skal bruke dataene før du lagrer dem.
Fleksibiliteten er også problemet. Uten styring blir en datasjø en datasump. Ingen vet hva som er i den. Filer har kryptiske navn. Metadata mangler. Dataene dupliseres på tvers av mapper. Analytikere finner ikke det de trenger. Dataforskere kaster bort tid på å rydde og utforske i stedet for å analysere. Datasjøen blir et kostnadssenter, ikke en ressurs. Løsningen er styring: kataloger, metadata, tilgangskontroller og tydelig eierskap. Moderne datasjøarkitekturer legger til tabellformater som Delta Lake og Iceberg som bringer skjemahåndhevelse, ACID-transaksjoner og spørreytelse til datasjøen. Datasjøen og lageret konvergerer. Det beste fra begge: fleksibiliteten til rå lagring og påliteligheten til strukturerte tabeller. Teknologien er forbedret. Styringskravet er fortsatt til stede.
Datasjøens egenskaper
- Schema-on-read – bruk struktur ved spørring
- Rå lagring – data lagret i originalformat
- Skalerbar – håndterer petabyte på råvarelagring
- Fleksibel – støtter strukturerte, semistrukturerte og ustrukturerte data
- Styringsavhengig – uten katalogisering blir det en sump
En datasjø er et reservoar. Uten et kart er det bare et vannområde.
Comments
No comments yet. Be the first to share a thought.
Leave a comment