Datautvinning finner mønstre i store datasett. Den bruker statistikk, maskinlæring og databaseteknikker for å avdekke sammenhenger som ikke er åpenbare. En forhandler oppdager at kunder som kjøper bleier også kjøper øl på fredagskvelder. En bank finner ut at visse transaksjonsmønstre forutsier svindel. Et sykehus identifiserer risikofaktorer for reinnleggelse. Mønstrene er reelle. Om de er nyttige, avhenger av hva du gjør med dem.
Datautvinning er ikke det samme som dataanalyse. Analyse tester hypoteser. Utvinning genererer dem. Du vet ikke hva du leter etter. Algoritmen finner korrelasjoner og anomalier. Så bestemmer et menneske hvilke som er viktige. Det siste trinnet er kritisk. Korrelasjon er ikke årsakssammenheng. Et mønster kan være falskt. Det kan gjenspeile en forvirrende variabel. Det kan være en dataartefakt. Utvinning produserer kandidater, ikke konklusjoner. Teknikkene inkluderer klynging, klassifisering, regresjon, assosiasjonsregler og anomalideteksjon. Hver av dem passer til forskjellige problemer. Verktøyene har blitt tilgjengelige. Python-biblioteker og skytjenester lar analytikere kjøre komplekse algoritmer uten dyp ekspertise. Risikoen er misbruk. Å kjøre tusen modeller og velge den med best resultat er ikke oppdagelse. Det er overtilpasning. Mønsteret må holde på nye data for å være ekte.
Data mining-teknikker
- Klynging – grupper lignende poster
- Klassifisering – tilordne poster til kategorier
- Assosiasjonsregler – finn elementer som forekommer samtidig
- Regresjon — modellrelasjoner mellom variabler
- Avviksdeteksjon – identifiser uvanlige poster
Datautvinning finner mønstre. Mennesker bestemmer hva de betyr. Algoritmen er et verktøy, ikke et orakel.
Comments
No comments yet. Be the first to share a thought.
Leave a comment