Datainsamling samlar in information från källor. Undersökningar, sensorer, webbloggar, transaktionsregister, sociala medier och offentliga databaser bidrar alla till processen. Metoden formar data. En undersökning med ledande frågor ger snedvridna svar. En sensor med kalibreringsavvikelse ger felaktiga avläsningar. En webbskrapa som ignorerar hastighetsgränser blockeras. Insamling är inte neutral. Varje val påverkar vad du lär dig.
Den första frågan är vad du behöver och varför. Att samla in allt är frestande och oftast slösaktigt. Datalagring kostar pengar. Bearbetning kostar pengar. Rengöring kostar pengar. Data som står oanvänd är en belastning, inte en tillgång. Den andra frågan är hur man samlar in den etiskt och lagligt. Samtycke är viktigt. Sekretesslagar som GDPR kräver en laglig grund för att samla in personuppgifter. Användarvillkor begränsar scraping på många plattformar. Den tredje frågan är kvalitet. Är källan tillförlitlig? Är urvalet representativt? Finns det luckor? Insamling utan kvalitetskontroller producerar datamängder som misslyckas senare. Den bästa tiden att upptäcka ett problem är innan informationen går in i pipelinen, inte efter att någon byggt en modell på den.
Insamlingsmetoder
- Enkäter — strukturerade frågor, benägna att få svarsbias
- Sensorer — automatiserade, kontinuerliga, kalibreringskänsliga
- Webskrapning — extraherar offentlig data, med förbehåll för lagliga begränsningar
- Transaktionsloggar — registrerar användarbeteende automatiskt
- Offentliga register – myndigheter och öppna datakällor
Datainsamling är ett designbeslut. Vad du samlar in avgör vad du kan lära dig. Vad du missar avgör vad du aldrig kommer att veta.
Comments
No comments yet. Be the first to share a thought.
Leave a comment