A recolha de dados reúne informação de diversas fontes. Pesquisas, sensores, registos da web, registos de transações, redes sociais e bases de dados públicas alimentam este processo. O método utilizado influencia os dados. Uma sondagem com perguntas enviesadas gera respostas enviesadas. Um sensor com desvio de calibração produz leituras imprecisas. Um programa de extração de dados da web que ignore os limites de taxa é bloqueado. A recolha não é neutra. Cada escolha afeta o que aprende.
A primeira questão é o que precisa e porquê. Recolher tudo é tentador, mas geralmente resulta em desperdício. O armazenamento de dados custa dinheiro. O processamento custa dinheiro. A limpeza custa dinheiro. Os dados que ficam sem utilização são um passivo, não um ativo. A segunda questão é como recolhê-los de forma ética e legal. O consentimento é fundamental. Leis de privacidade como o RGPD exigem uma base legal para a recolha de dados pessoais. Os termos de serviço restringem a extração de dados em muitas plataformas. A terceira questão é a qualidade. A fonte é fidedigna? A amostra é representativa? Existem lacunas? A recolha sem controlos de qualidade produz conjuntos de dados que falham posteriormente. O melhor momento para detetar um problema é antes de os dados entrarem no fluxo de trabalho, e não depois de alguém construir um modelo com eles.
Métodos de recolha
- Inquéritos — perguntas estruturadas, propensas a enviesamento de resposta.
- Sensores — automatizados, contínuos e sensíveis à calibração
- Web scraping — extrai dados públicos, sujeitos a limites legais.
- Registos de transações — capturam o comportamento do utilizador automaticamente.
- Registos públicos — fontes de dados governamentais e abertas
A recolha de dados é uma decisão de planeamento. O que recolhe determina o que pode aprender. O que deixa de recolher determina o que nunca saberá.
Comments
No comments yet. Be the first to share a thought.
Leave a comment