A qualidade dos dados mede o quão adequados são para o uso pretendido. São precisos, completos, consistentes, oportunos e válidos. Os maus dados podem apresentar-se de diversas formas: um valor em falta, um registo duplicado, uma data em formato incorreto ou um endereço inexistente. Cada defeito tem um custo. Uma campanha de marketing envia correspondência para endereços inválidos. Um relatório financeiro sobrestima a receita devida a duplicatas. Um modelo de aprendizagem automática faz previsões enviesadas porque os dados de treino estavam incompletos.
A qualidade dos dados não é uma solução pontual. É uma prática contínua. Defina as dimensões de qualidade para cada conjunto de dados. Meça-as regularmente. Estabeleça limites para uma qualidade aceitável. Investigue quando os índices descem. As causas principais são geralmente problemas de processo, não problemas de tecnologia. A introdução de dados sem validação gera erros. Os sistemas que não partilham um ID de cliente comum criam duplicados. Processos que permitem registos incompletos criam lacunas. Corrigir o processo previne os erros. Corrigir os dados sem corrigir o processo significa que os erros serão devolvidos. As ferramentas de qualidade de dados auxiliam na criação de perfis, limpeza e monitorização. Não substituem a responsabilidade. Alguém deve ser responsável por cada conjunto de dados. Sem esta responsabilidade, a qualidade deteriora-se. Ela deteriora-se sempre.
Dimensões da qualidade dos dados
- Precisão — os dados refletem a realidade.
- Completude — sem valores em falta
- Consistência — mesmos dados em todos os sistemas.
- Atualidade — os dados estão atualizados.
- Validade — os dados estão em conformidade com as regras.
- Exclusividade — sem duplicados
A qualidade dos dados é da responsabilidade de todos. Quando não é responsabilidade de ninguém, falha.
Comments
No comments yet. Be the first to share a thought.
Leave a comment