Pembagian data latih dan uji secara tunggal dapat menyesatkan. Model mungkin beruntung, atau tidak beruntung, tergantung pada contoh mana yang masuk ke setiap set. Validasi silang mengurangi risiko tersebut dengan merotasi data mana yang berfungsi sebagai set uji.
Dalam validasi silang k-fold, data dibagi menjadi k bagian yang sama. Model dilatih pada k-1 bagian dan divalidasi pada bagian yang tersisa. Ulangi k kali, setiap fold berfungsi sekali sebagai validasi. Rata-ratakan hasilnya untuk estimasi yang lebih stabil.
Varian umum
- Lipatan K, biasanya lima atau sepuluh lipatan
- K-fold bertingkat, mempertahankan proporsi kelas
- Metode leave-one-out, k sama dengan jumlah sampel.
- Pemisahan deret waktu, dengan tetap memperhatikan urutan temporal.
Validasi silang membutuhkan biaya perhitungan. Melatih k model membutuhkan waktu k kali lebih lama daripada melatih satu model. Pada dataset besar, satu set data uji (holdout set) seringkali sudah cukup. Pada dataset kecil, validasi silang sepadan dengan biayanya.
Comments
No comments yet. Be the first to share a thought.
Leave a comment