Een dataset is een verzameling van gerelateerde gegevenspunten, georganiseerd voor analyse. Het kan een enkele tabel zijn, een set bestanden of een extract uit een database. Een dataset heeft een doel. De Iris-dataset bevat metingen van bloemblaadjes en kelkbladen, die worden gebruikt om classificatie te onderwijzen. De MNIST-dataset bevat handgeschreven cijfers, die worden gebruikt om beeldherkenning te benchmarken. De verkoopdataset van een bedrijf bevat transacties, die worden gebruikt om de omzet te voorspellen. De dataset definieert de grenzen van de analyse.
Datasets variëren sterk in omvang, kwaliteit en structuur. Sommige zijn klein genoeg om in een spreadsheet te openen. Andere beslaan petabytes verspreid over gedistribueerde opslag. Sommige zijn zorgvuldig samengesteld met gedocumenteerde herkomst. Andere zijn van het web geplukt met een onbekende betrouwbaarheid. De kwaliteit van een dataset bepaalt de kwaliteit van de analyse die erop gebaseerd is. Een dataset met ontbrekende waarden, een vertekende steekproef of inconsistente labels levert onbetrouwbare resultaten op. Onderzoek een dataset voordat u deze gebruikt. Wat is de bron? Hoe is de dataset verzameld? Wat is de tijdsperiode? Wat ontbreekt er? Wat zijn de bekende beperkingen? Deze vragen zijn niet optioneel. Ze bepalen wat de data kan ondersteunen. Een dataset die geschikt is voor de ene analyse, is mogelijk ongeschikt voor een andere. De data kent zijn eigen beperkingen niet. De analist moet dat wel doen.
Kenmerken van de dataset
- Grootte — aantal records en kenmerken
- Structuur — tabelvormig, hiërarchisch of ongestructureerd
- Kwaliteit — nauwkeurigheid, volledigheid, consistentie
- Herkomst — waar het vandaan komt en hoe het is ontstaan
- Licentie — gebruiksvoorwaarden en herdistributievoorwaarden
Een dataset is een momentopname van de wereld. Die momentopname heeft een kader. Het begrijpen van dat kader is essentieel voor het begrijpen van de data.
Comments
No comments yet. Be the first to share a thought.
Leave a comment