En datasjö lagrar rådata i sitt ursprungliga format. Inget schema tillämpas vid skrivning. Strukturerade tabeller, JSON-loggar, bilder och video finns alla i samma arkiv. Schemat tillämpas när data läses, inte när de lagras. Den flexibiliteten är det som gör det attraktivt. Datasjön accepterar allt. Den kräver inte att du vet hur du kommer att använda data innan du lagrar dem.
Flexibiliteten är också problemet. Utan styrning förvandlas en datasjö till ett dataträsk. Ingen vet vad som finns i den. Filer har kryptiska namn. Metadata saknas. Informationen dupliceras mellan mappar. Analytiker kan inte hitta det de behöver. Datavetare slösar tid på att rensa och utforska istället för att analysera. Datasjön blir ett kostnadscenter, inte en tillgång. Lösningen är styrning: kataloger, metadata, åtkomstkontroller och tydligt ägarskap. Moderna datasjöhusarkitekturer lägger till tabellformat som Delta Lake och Iceberg som ger schematillämpning, ACID-transaktioner och frågeprestanda till sjön. Datasjön och lagret konvergerar. Det bästa av båda: flexibiliteten i rå lagring och tillförlitligheten i strukturerade tabeller. Tekniken har förbättrats. Styrningskravet kvarstår.
Datasjöns egenskaper
- Schema-vid-läsning — tillämpa struktur vid frågor
- Rå lagring — data lagras i originalformat
- Skalbar — hanterar petabyte på råvarulagring
- Flexibel — stöder strukturerad, semistrukturerad och ostrukturerad data
- Styrningsberoende — utan katalogisering blir det ett träsk
En datasjö är en reservoar. Utan en karta är det bara ett vattendrag.
Comments
No comments yet. Be the first to share a thought.
Leave a comment