Datakvalitet måler hvor egnet data er for den tiltenkte bruken. Nøyaktige, fullstendige, konsistente, tidsriktige og gyldige. Dårlige data har mange varianter. En manglende verdi. En duplikatpost. En dato i feil format. En adresse som ikke finnes. Hver feil har en kostnad. En markedsføringskampanje sender e-post til døde adresser. En finansrapport overdriver inntektene på grunn av duplikater. En maskinlæringsmodell lager partiske forutsigelser fordi treningsdataene var ufullstendige.
Datakvalitet er ikke en engangsløsning. Det er en praksis. Definer kvalitetsdimensjoner for hvert datasett. Mål dem regelmessig. Sett terskler for akseptabel kvalitet. Undersøk når tallene synker. De grunnleggende årsakene er vanligvis prosessproblemer, ikke teknologiske problemer. Dataregistrering uten validering skaper feil. Systemer som ikke deler en felles kunde-ID, skaper duplikater. Prosesser som tillater ufullstendige poster, skaper hull. Å fikse prosessen forhindrer feilene. Å fikse dataene uten å fikse prosessen betyr at feilene kommer tilbake. Datakvalitetsverktøy hjelper med profilering, rensing og overvåking. De erstatter ikke eierskap. Noen må være ansvarlige for hvert datasett. Uten den ansvarligheten, forsvinner kvaliteten. Den forsvinner alltid.
Dimensjoner for datakvalitet
- Nøyaktighet – data gjenspeiler virkeligheten
- Fullstendighet – ingen manglende verdier
- Konsistens – samme data på tvers av systemer
- Aktualitet – dataene er oppdaterte
- Gyldighet – dataene er i samsvar med reglene
- Unikhet – ingen duplikater
Datakvalitet er alles jobb. Når det ikke er noens jobb, mislykkes det.
Comments
No comments yet. Be the first to share a thought.
Leave a comment