A mineração de dados encontra padrões em grandes conjuntos de dados. Utiliza estatística, aprendizagem automática e técnicas de base de dados para descobrir relações que não são óbvias. Um retalhista descobre que os clientes que compram fraldas também compram cerveja às sextas-feiras à noite. Um banco descobre que determinados padrões de transação prevêem fraudes. Um hospital identifica os fatores de risco para o reinternamento. Os padrões são reais. A sua utilidade depende do que faz com eles.
A mineração de dados não é o mesmo que a análise de dados. A análise testa hipóteses. A mineração gera-as. Não sabe o que está procurando. O algoritmo encontra correlações e anomalias. De seguida, um humano decide quais delas são relevantes. Esta última etapa é crucial. Correlação não implica causalidade. Um padrão pode ser espúrio. Pode refletir uma variável de confusão. Pode ser um artefacto dos dados. A mineração produz candidatos, não conclusões. As técnicas incluem agrupamento, classificação, regressão, regras de associação e deteção de anomalias. Cada uma adequa-se a problemas diferentes. As ferramentas tornaram-se acessíveis. As bibliotecas Python e os serviços na nuvem permitem que os analistas executem algoritmos complexos sem conhecimento especializado profundo. O risco é o uso indevido. Executar mil modelos e escolher aquele com o melhor resultado não é descoberta. É sobreajuste. O padrão precisa de se manter em novos dados para ser real.
técnicas de data mining
- Agrupamento — agrupar registos semelhantes
- Classificação — atribuir registos a categorias
- Regras de associação — encontrar itens que ocorrem em conjunto
- Regressão — modela as relações entre variáveis
- Detecção de anomalias — identificação de registos invulgares
A mineração de dados encontra padrões. Os humanos decidem o que significam. O algoritmo é uma ferramenta, não um oráculo.
Comments
No comments yet. Be the first to share a thought.
Leave a comment