Un modelo entrenado para reconocer gatos y perros ya conoce información sobre bordes, texturas y pelaje. El aprendizaje por transferencia aprovecha esto: en lugar de partir de pesos aleatorios, se comienza con una red que ha aprendido de un gran conjunto de datos y se ajusta para un problema específico más pequeño. El conocimiento adquirido en la primera tarea se transfiere a la segunda.
Este enfoque se convirtió en estándar debido a la escasez de datos etiquetados y al elevado costo computacional. Entrenar un modelo de visión desde cero con 5000 imágenes médicas rara vez funciona. Sin embargo, reentrenar las capas finales de una red preentrenada con ImageNet suele dar buenos resultados. Las primeras capas detectan características genéricas; las capas posteriores se especializan.
Estrategias comunes
- Extracción de características: congelar las capas preentrenadas y entrenar solo una nueva capa clasificadora.
- Ajuste fino: descongele algunas o todas las capas y continúe el entrenamiento con una tasa de aprendizaje pequeña.
- Adaptación de dominio: ajustar un modelo de una distribución de datos a otra, como de datos sintéticos a datos reales.
Los modelos de lenguaje de gran tamaño han llevado esto aún más lejos. Un único modelo preentrenado puede adaptarse a la redacción jurídica, la codificación médica o la atención al cliente con un entrenamiento adicional mínimo. El inconveniente reside en la transferencia negativa: si las tareas de origen y destino son demasiado diferentes, los pesos preentrenados pueden perjudicar en lugar de ayudar.
Comments
No comments yet. Be the first to share a thought.
Leave a comment