एक ही बार में ट्रेन-टेस्ट विभाजन भ्रामक हो सकता है। मॉडल को सफलता या असफलता मिल सकती है, यह इस बात पर निर्भर करता है कि कौन से उदाहरण किस सेट में आते हैं। क्रॉस-वैलिडेशन परीक्षण सेट के रूप में उपयोग किए जाने वाले डेटा को बदलकर इस जोखिम को कम करता है।
k-फोल्ड क्रॉस-वैलिडेशन में, डेटा को k बराबर भागों में विभाजित किया जाता है। मॉडल k-1 भागों पर प्रशिक्षित होता है और शेष एक भाग पर मान्य होता है। इस प्रक्रिया को k बार दोहराएं, प्रत्येक फोल्ड एक बार सत्यापन के रूप में कार्य करता है। अधिक स्थिर अनुमान के लिए परिणामों का औसत निकालें।
सामान्य प्रकार
- के-फोल्ड, आमतौर पर पांच या दस फोल्ड
- स्तरीकृत के-फोल्ड, वर्ग अनुपात को संरक्षित करते हुए
- लीव-वन-आउट विधि में, k नमूनों की संख्या के बराबर होता है।
- समयक्रम का सम्मान करते हुए समय श्रृंखला का विभाजन किया गया।
क्रॉस-वैलिडेशन की लागत गणना के अनुसार होती है। k मॉडल को प्रशिक्षित करने में एक मॉडल को प्रशिक्षित करने की तुलना में k गुना अधिक समय लगता है। बड़े डेटासेट पर, अक्सर एक ही होल्डआउट सेट पर्याप्त होता है। छोटे डेटासेट पर, क्रॉस-वैलिडेशन खर्च के लायक होता है।
Comments
No comments yet. Be the first to share a thought.
Leave a comment