Strukturerede data passer pænt ind i rækker og kolonner. Navne, datoer, beløb og kategorier. Hvert felt har en defineret type. Hver post følger samme format. Strukturen er defineret på forhånd af et skema. Relationsdatabaser gemmer strukturerede data. Regneark gemmer dem. CSV-filer gemmer dem. Stivheden er pointen. Fordi strukturen er forudsigelig, er forespørgsler hurtige, og resultaterne er ensartede. Du kan sammenkæde tabeller, aggregere værdier og filtrere rækker med tillid til, at dataene vil opføre sig som forventet.
Strukturerede data dominerer traditionelle forretningssystemer. Transaktioner, lagerbeholdning, kunderegistre og økonomisystemer er alle strukturerede. Skemaet håndhæver konsistens. Et datofelt må ikke indeholde tekst. Et numerisk felt må ikke indeholde en streng. Denne håndhævelse fanger fejl tidligt. Det gør også dataene nemme at analysere. SQL blev bygget til strukturerede data. Business intelligence-værktøjer forudsætter det. Maskinlæringsmodeller foretrækker det ofte. Begrænsningen er fleksibilitet. Strukturerede data kræver kendskab til skemaet, før du gemmer dataene. Hvis dataene ændrer form, skal du ændre skemaet. Denne migrering er forstyrrende. Semistrukturerede og ustrukturerede data undgår dette problem ved at udskyde strukturen til forespørgselstid. Men de bytter fleksibilitet for kompleksitet. Strukturerede data er enklere at arbejde med og sværere at ændre. De fleste organisationer kører på det. Regnskabssystemet, CRM'et, ERP'et. De gemmer alle strukturerede data. Det er ikke spændende. Det er fundamentet.
Karakteristika for strukturerede data
- Skema-defineret — struktur kendt på forhånd
- Tabelform — rækker og kolonner
- Typet — hvert felt har en datatype
- Forespørgbar — SQL og lignende sprog
- Konsistent — samme format for hver post
Strukturerede data er forudsigelige. Det er denne forudsigelighed, der gør dem nyttige, og den, der gør dem rigide.
Comments
No comments yet. Be the first to share a thought.
Leave a comment