단일 학습-테스트 분할 방식은 오해를 불러일으킬 수 있습니다. 모델은 각 데이터 세트에 어떤 예제가 포함되느냐에 따라 운이 좋을 수도 있고 나쁠 수도 있습니다. 교차 검증은 테스트 세트로 사용되는 데이터를 순환적으로 사용함으로써 이러한 위험을 줄여줍니다.
k겹 교차 검증에서는 데이터를 k개의 동일한 부분으로 나눕니다. 모델은 k-1개의 부분으로 학습하고 나머지 하나로 검증합니다. 이 과정을 k번 반복하며, 각 폴드는 한 번씩 검증에 사용됩니다. 결과를 평균내면 보다 안정적인 예측값을 얻을 수 있습니다.
일반적인 변형
- K-폴드는 일반적으로 5회 또는 10회 폴드를 사용합니다.
- 계층화된 k-겹 교차 검증, 클래스 비율 유지
- Leave-one-out 방식에서 k는 샘플 수를 나타냅니다.
- 시간 순서를 유지하면서 시계열을 분할합니다.
교차 검증에는 계산 비용이 발생합니다. k개의 모델을 학습하는 데는 하나의 모델만 학습하는 것보다 k배 더 많은 시간이 걸립니다. 대규모 데이터셋에서는 단일 홀드아웃 세트로도 충분한 경우가 많지만, 소규모 데이터셋에서는 교차 검증을 사용하는 것이 비용 대비 효과적입니다.
Comments
No comments yet. Be the first to share a thought.
Leave a comment