En datakälla är varifrån data kommer. Databaser, API:er, loggfiler, sensorer, undersökningar och offentliga register fungerar alla som källor. Källan avgör datastrukturen, kvaliteten och tillförlitligheten. En väl underhållen databas med begränsningar och validering producerar renare data än ett kalkylblad som fylls i för hand. En sensor med kalibreringsavvikelse producerar snedvridna avläsningar. En offentlig datauppsättning kan vara ofullständig eller föråldrad.
Att känna till källan är avgörande för att kunna lita på informationen. Varifrån kom den? Vem samlade in den? När? Hur? Vilken metod användes? Vad exkluderades? Dessa frågor avgör vad informationen kan och inte kan stödja. Data från en undersökning med 100 personer kan inte stödja påståenden om en miljontals befolkning. Data från ett system som bara loggar lyckade transaktioner missar felen. Data från en leverantör kan vara korrekt för deras syften och fel för ditt. Källan påverkar också pipelinen. En databas med ett stabilt schema är lättare att integrera än en webbplats som ändrar sin HTML varje månad. Ett API med hastighetsgränser begränsar hur mycket data du kan hämta. En fil som anländer manuellt är benägen att förseas och orsaka fel. Källan är grunden. En svag grund undergräver allt som byggts ovanpå den.
Vanliga datakällor
- Databaser — strukturerade poster från applikationer
- API:er — programmatisk åtkomst till externa system
- Loggfiler — system- och programhändelser
- Sensorer — kontinuerliga fysiska mätningar
- Undersökningar — strukturerade svar från människor
- Offentliga register – myndigheter och öppna dataset
Innan du litar på informationen, förstå källan. Svaren är ofta mer avslöjande än informationen i sig.
Comments
No comments yet. Be the first to share a thought.
Leave a comment