Datele semi-structurate au o oarecare organizare, dar nu se încadrează perfect în tabele. JSON, XML, YAML și anteturile de e-mail se încadrează toate în această categorie. Datele au etichete sau chei care descriu structura lor, dar structura poate varia de la o înregistrare la alta. Un obiect JSON poate avea un câmp pe care altul nu îl are. Un document XML poate imbrica elemente diferit față de următorul. Schema este flexibilă, uneori numită schemă la citire. Aplicați structura atunci când interogați datele, nu atunci când le stocați.
Datele semi-structurate sunt comune în aplicațiile moderne. API-urile returnează JSON. Fișierele jurnal utilizează perechi cheie-valoare. Fișierele de configurare utilizează YAML. Bazele de date cu documente NoSQL stochează JSON nativ. Flexibilitatea este utilă atunci când modelul de date evoluează sau variază. De asemenea, reprezintă o provocare pentru analiză. Interogarea datelor semi-structurate necesită instrumente și tehnici diferite față de interogarea tabelelor. Trebuie să navigați în structuri imbricate, să gestionați câmpurile lipsă și să aplatizați tablourile. Motoarele SQL s-au adaptat. PostgreSQL, MySQL și Snowflake acceptă toate funcții JSON. Puteți interoga în interiorul documentelor JSON fără a le extrage mai întâi. Această estompare a datelor structurate și semi-structurate face ca distincția să fie mai puțin relevantă. Întrebarea importantă nu este dacă datele sunt semi-structurate. Ci dacă le puteți interoga eficient.
Formate semi-structurate
- JSON — perechi cheie-valoare, tablouri, obiecte imbricate
- XML — elemente etichetate, ierarhice
- YAML — configurație lizibilă de către om
- CSV — delimitat, dar fără informații despre tip
- Fișiere jurnal — evenimente cu marcaj temporal și câmpuri variabile
Datele semi-structurate reprezintă calea de mijloc. Au suficientă structură pentru a fi utile și suficientă flexibilitate pentru a fi dezordonate.
Comments (2)
Leave a comment