Las etiquetas son caras. Los datos sin procesar son baratos. El aprendizaje semisupervisado combina un pequeño conjunto etiquetado con un gran conjunto sin etiquetar, utilizando la estructura de los datos sin etiquetar para mejorar la generalización más allá de lo que las etiquetas por sí solas podrían lograr.
Los enfoques varían. El autoaprendizaje etiqueta ejemplos sin etiquetar con un modelo y luego lo reentrena con el conjunto combinado. La regularización de consistencia obliga al modelo a producir resultados similares para versiones perturbadas de la misma entrada. Los métodos basados en grafos propagan las etiquetas a través de redes de similitud.
Técnicas semisupervisadas comunes
- Autoformación y pseudoetiquetado
- Regularización de la consistencia
- Minimización de la entropía
- Propagación de etiquetas basada en grafos
- Preentrenamiento contrastivo seguido de ajuste fino.
Los resultados dependen en gran medida de los datos. Si los ejemplos sin etiquetar provienen de una distribución diferente a la de los etiquetados, el rendimiento puede verse afectado. Una validación cuidadosa y la correcta correspondencia con el dominio son tan importantes como el algoritmo.
Comments
No comments yet. Be the first to share a thought.
Leave a comment