قبل أن يتمكن نموذج اللغة من قراءة أي شيء، يجب تقسيم النص إلى أجزاء يمكن عدّها. تُسمى هذه الأجزاء بالرموز، وعملية التقطيع هي عملية تجزئة النص إلى رموز. قد يكون الرمز كلمة كاملة، أو جزءًا مثل "ing" أو "pre"، أو علامة ترقيم، أو حتى حرفًا واحدًا. لا يرى النموذج النص الخام أبدًا؛ بل يرى سلسلة من معرّفات الأعداد الصحيحة المرتبطة بتلك الرموز.
تُقدّم المخططات المختلفة مزايا وعيوبًا متباينة. فمثلاً، يحافظ تجزئة الكلمات على مستوى الكلمة على المعنى، لكنه يُنتج ملايين الكلمات النادرة ويُعاني من مشاكل في التعامل مع الأخطاء المطبعية. أما تجزئة الأحرف، فتتميز بمفردات محدودة، لكنها تُنتج سلاسل طويلة جدًا. بينما تقع طرق تجزئة الكلمات الجزئية، مثل ترميز أزواج البايت، في المنتصف: إذ تبدأ بالأحرف وتُدمج الأزواج الأكثر تكرارًا بشكل متكرر حتى الوصول إلى حجم المفردات المستهدف.
لماذا يُعد ذلك مهماً؟
- يحدد حجم المفردات جدول تضمين النموذج وحجم الذاكرة المستخدمة
- يحدد عدد الرموز نافذة السياق وتكلفة كل استدعاء لواجهة برمجة التطبيقات
- يؤدي ضعف تجزئة الكلمات إلى تقسيمها بطرق تضر بالأداء متعدد اللغات
- غالباً ما تحتاج اللغات التي تستخدم أبجديات غير لاتينية إلى عدد أكبر بكثير من الكلمات في الجملة الواحدة
قد تستخدم الجملة في اللغة الإنجليزية 20 كلمة؛ بينما قد تتطلب الجملة نفسها في اللغة التايلاندية أو الهندية 60 كلمة أو أكثر باستخدام مُجزِّئ كلمات مُصمَّم وفقًا للمعايير الغربية. يؤثر هذا التفاوت على السرعة والسعر والدقة لمليارات المتحدثين.
Comments
No comments yet. Be the first to share a thought.
Leave a comment