كل نموذج هو انعكاس مُكثّف لما تم تزويده به. بيانات التدريب هي بمثابة هذا الغذاء: مجموعة الأمثلة التي يدرسها نظام التعلم الآلي قبل أن يُطلب منه القيام بأي شيء مفيد. قد يتعلم نموذج التعرف على الوجوه من ملايين الصور الشخصية المصنفة. ويتعلم محرك الشطرنج من ملايين المباريات. ويتعلم المصنف الطبي من عمليات المسح التي قام أخصائيو الأشعة بتصنيفها.
يُساعد حجم البيانات، لكن التكوين أهم. فإذا كانت الصور الشخصية تميل إلى البيض والذكور، سيفشل النموذج مع ذوي البشرة الداكنة والنساء. وإذا اقتصرت بيانات اللعبة على اللاعبين الهواة، فسيتوقف أداء المحرك عند حد معين. يُطلق الباحثون على هذا التحول في التوزيع اسم "انزياح التوزيع"، وهو أحد أكثر الأسباب شيوعًا لفشل نموذج يبدو رائعًا في المختبر عند استخدامه في الواقع.
المخاوف العملية
- جودة التصنيفات: تؤدي التصنيفات المشوشة أو المتحيزة إلى تسميم النموذج
- الموافقة والترخيص: قد تنطوي البيانات المستخرجة من مواقع الويب على مخاطر قانونية
- الخصوصية: غالباً ما يجب تنظيف المعلومات الشخصية أو إخفاء هوية أصحابها.
- التمثيل: تحتاج المجموعات النادرة إلى زيادة متعمدة في التمثيل.
تستغرق عملية تنظيف البيانات وتنسيقها عادةً ما بين 60 و80 بالمئة من وقت مشروع التعلم الآلي. الجزء الجذاب هو تصميم البنية، أما الجزء الحاسم فهو مجموعة البيانات.
Comments
No comments yet. Be the first to share a thought.
Leave a comment