Gegevensverzameling verzamelt informatie uit verschillende bronnen. Enquêtes, sensoren, weblogs, transactiegegevens, sociale media en openbare databases dragen allemaal bij aan dit proces. De methode beïnvloedt de data. Een enquête met suggestieve vragen levert vertekende antwoorden op. Een sensor met kalibratieafwijking produceert onnauwkeurige metingen. Een webscraper die zich niet aan de snelheidslimieten houdt, wordt geblokkeerd. Gegevensverzameling is niet neutraal. Elke keuze heeft invloed op wat je leert.
De eerste vraag is wat je nodig hebt en waarom. Alles verzamelen is verleidelijk, maar meestal verspilling. Dataopslag kost geld. Verwerking kost geld. Opschonen kost geld. Data die ongebruikt blijft, is een last, geen aanwinst. De tweede vraag is hoe je de data ethisch en legaal verzamelt. Toestemming is belangrijk. Privacywetten zoals de AVG vereisen een wettelijke basis voor het verzamelen van persoonsgegevens. Gebruiksvoorwaarden beperken het scrapen op veel platforms. De derde vraag betreft de kwaliteit. Is de bron betrouwbaar? Is de steekproef representatief? Zijn er hiaten? Het verzamelen van data zonder kwaliteitscontroles levert datasets op die later problemen opleveren. Het beste moment om een probleem op te sporen is voordat de data de pipeline ingaat, niet nadat iemand er een model op heeft gebouwd.
Verzamelmethoden
- Enquêtes — gestructureerde vragen, gevoelig voor vertekening door antwoordfouten
- Sensoren — geautomatiseerd, continu, kalibratiegevoelig
- Web scraping — het extraheren van openbare gegevens, onderworpen aan wettelijke beperkingen
- Transactielogboeken — leggen automatisch gebruikersgedrag vast
- Openbare registers — overheids- en open databronnen
Gegevensverzameling is een ontwerpbeslissing. Wat je verzamelt, bepaalt wat je kunt leren. Wat je mist, bepaalt wat je nooit zult weten.
Comments
No comments yet. Be the first to share a thought.
Leave a comment