Una única división en conjuntos de entrenamiento y prueba puede resultar engañosa. El modelo podría tener suerte o mala suerte, dependiendo de qué ejemplos se incluyan en cada conjunto. La validación cruzada reduce ese riesgo al rotar los datos que componen el conjunto de prueba.
En la validación cruzada k-fold, los datos se dividen en k partes iguales. El modelo se entrena con k-1 partes y se valida con la restante. Este proceso se repite k veces, utilizando cada pliegue una vez para la validación. Se promedian los resultados para obtener una estimación más estable.
Variantes comunes
- K-fold, normalmente cinco o diez pliegues
- k-fold estratificado, preservando las proporciones de clase
- Dejar uno fuera, k es igual al número de muestras.
- División de series temporales, respetando el orden temporal.
La validación cruzada tiene un coste computacional. Entrenar k modelos lleva k veces más tiempo que entrenar uno solo. En conjuntos de datos grandes, un único conjunto de prueba suele ser suficiente. En conjuntos pequeños, la validación cruzada compensa el coste.
Comments
No comments yet. Be the first to share a thought.
Leave a comment