La recopilación de datos reúne información de diversas fuentes. Encuestas, sensores, registros web, registros de transacciones, redes sociales y bases de datos públicas alimentan este proceso. El método influye en los datos. Una encuesta con preguntas capciosas genera respuestas sesgadas. Un sensor con descalibración produce lecturas inexactas. Un programa de extracción de datos web que ignora los límites de velocidad se bloquea. La recopilación no es neutral. Cada elección afecta a lo que se aprende.
La primera pregunta es qué necesitas y por qué. Recopilarlo todo es tentador, pero suele ser un derroche. El almacenamiento de datos cuesta dinero. El procesamiento cuesta dinero. La limpieza cuesta dinero. Los datos que permanecen sin usar son un pasivo, no un activo. La segunda pregunta es cómo recopilarlos de forma ética y legal. El consentimiento es fundamental. Las leyes de privacidad, como el RGPD, exigen una base legal para la recopilación de datos personales. Los términos de servicio restringen el web scraping en muchas plataformas. La tercera pregunta es la calidad. ¿Es fiable la fuente? ¿Es representativa la muestra? ¿Existen deficiencias? La recopilación sin controles de calidad produce conjuntos de datos que fallan posteriormente. El mejor momento para detectar un problema es antes de que los datos entren en el flujo de trabajo, no después de que alguien haya creado un modelo con ellos.
Métodos de recolección
- Encuestas: preguntas estructuradas, propensas al sesgo de respuesta.
- Sensores: automatizados, continuos, sensibles a la calibración.
- Extracción de datos web: extracción de datos públicos, sujeta a límites legales.
- Registros de transacciones: capturan automáticamente el comportamiento del usuario.
- Registros públicos: fuentes de datos gubernamentales y abiertos.
La recopilación de datos es una decisión de diseño. Lo que se recopila determina lo que se puede aprender. Lo que se omite determina lo que nunca se sabrá.
Comments
No comments yet. Be the first to share a thought.
Leave a comment