किसी भाषा मॉडल द्वारा कुछ भी पढ़ने से पहले, पाठ को ऐसे टुकड़ों में विभाजित करना पड़ता है जिन्हें वह गिन सके। ये टुकड़े टोकन कहलाते हैं, और टोकनीकरण ही विभाजन की प्रक्रिया है। एक टोकन एक पूरा शब्द, "ing" या "pre" जैसे वाक्यांश, एक विराम चिह्न, या यहाँ तक कि एक अक्षर भी हो सकता है। मॉडल कभी भी मूल पाठ नहीं देखता; यह उन टोकनों से जुड़े पूर्णांक ID की एक श्रृंखला देखता है।
विभिन्न योजनाओं में अलग-अलग फायदे और नुकसान होते हैं। शब्द-स्तरीय टोकनाइज़ेशन अर्थ को बरकरार रखता है, लेकिन इससे लाखों दुर्लभ शब्द बन जाते हैं और टाइपिंग की गलतियों की समस्या बढ़ जाती है। अक्षर-स्तरीय टोकनाइज़ेशन में शब्दावली छोटी होती है, लेकिन इससे बहुत लंबी अनुक्रम उत्पन्न होते हैं। बाइट-पेयर एन्कोडिंग जैसी उपशब्द विधियाँ इन दोनों के बीच में आती हैं: ये अक्षरों से शुरू होती हैं और लक्ष्य शब्दावली आकार तक पहुँचने तक सबसे अधिक बार उपयोग होने वाले युग्मों को बार-बार मिलाती हैं।
यह क्यों मायने रखती है
- शब्दावली का आकार मॉडल की एम्बेडिंग तालिका और मेमोरी उपयोग को निर्धारित करता है।
- टोकन की संख्या संदर्भ विंडो और प्रत्येक एपीआई कॉल की लागत निर्धारित करती है।
- खराब टोकनाइजेशन शब्दों को इस तरह से विभाजित करता है जिससे बहुभाषी प्रदर्शन पर प्रतिकूल प्रभाव पड़ता है।
- गैर-लैटिन लिपि वाली भाषाओं को अक्सर प्रति वाक्य कहीं अधिक शब्दों की आवश्यकता होती है।
अंग्रेजी में एक वाक्य में 20 टोकन लग सकते हैं; वहीं थाई या हिंदी में उसी वाक्य के लिए पश्चिमी-केंद्रित टोकनाइज़र के तहत 60 या उससे अधिक टोकन लग सकते हैं। यह असंतुलन अरबों वक्ताओं के लिए गति, कीमत और सटीकता को प्रभावित करता है।
Comments
No comments yet. Be the first to share a thought.
Leave a comment