Datainnsamling samler informasjon fra kilder. Undersøkelser, sensorer, nettlogger, transaksjonsregistreringer, sosiale medier og offentlige databaser bidrar alle til prosessen. Metoden former dataene. En undersøkelse med ledende spørsmål gir partiske svar. En sensor med kalibreringsavvik gir unøyaktige avlesninger. En nettskraper som ignorerer hastighetsgrenser blir blokkert. Innsamling er ikke nøytral. Hvert valg påvirker hva du lærer.
Det første spørsmålet er hva du trenger og hvorfor. Å samle alt er fristende og vanligvis sløsende. Datalagring koster penger. Behandling koster penger. Rengjøring koster penger. Data som står ubrukt er en belastning, ikke en ressurs. Det andre spørsmålet er hvordan man samler dem inn etisk og lovlig. Samtykke er viktig. Personvernlover som GDPR krever et lovlig grunnlag for å samle inn personopplysninger. Vilkår for bruk begrenser skraping på mange plattformer. Det tredje spørsmålet er kvalitet. Er kilden pålitelig? Er utvalget representativt? Er det hull? Innsamling uten kvalitetskontroll produserer datasett som feiler senere. Den beste tiden å fange opp et problem er før dataene går inn i prosessen, ikke etter at noen bygger en modell på den.
Innsamlingsmetoder
- Undersøkelser – strukturerte spørsmål, utsatt for svarskjevhet
- Sensorer – automatiserte, kontinuerlige, kalibreringsfølsomme
- Nettskraping – trekker ut offentlige data, underlagt juridiske begrensninger
- Transaksjonslogger – registrerer brukeratferd automatisk
- Offentlige registre – offentlige og åpne datakilder
Datainnsamling er en designbeslutning. Det du samler inn bestemmer hva du kan lære. Det du går glipp av bestemmer hva du aldri vil vite.
Comments
No comments yet. Be the first to share a thought.
Leave a comment