EN - FR - DE - ES - IT - PT -

LexiconDream

✂️ टोकनाइज़ेशन

पाठ को टोकन नामक छोटी इकाइयों में विभाजित करने की प्रक्रिया।

टोकनाइज़ेशन

किसी भाषा मॉडल द्वारा कुछ भी पढ़ने से पहले, पाठ को ऐसे टुकड़ों में विभाजित करना पड़ता है जिन्हें वह गिन सके। ये टुकड़े टोकन कहलाते हैं, और टोकनीकरण ही विभाजन की प्रक्रिया है। एक टोकन एक पूरा शब्द, "ing" या "pre" जैसे वाक्यांश, एक विराम चिह्न, या यहाँ तक कि एक अक्षर भी हो सकता है। मॉडल कभी भी मूल पाठ नहीं देखता; यह उन टोकनों से जुड़े पूर्णांक ID की एक श्रृंखला देखता है।

विभिन्न योजनाओं में अलग-अलग फायदे और नुकसान होते हैं। शब्द-स्तरीय टोकनाइज़ेशन अर्थ को बरकरार रखता है, लेकिन इससे लाखों दुर्लभ शब्द बन जाते हैं और टाइपिंग की गलतियों की समस्या बढ़ जाती है। अक्षर-स्तरीय टोकनाइज़ेशन में शब्दावली छोटी होती है, लेकिन इससे बहुत लंबी अनुक्रम उत्पन्न होते हैं। बाइट-पेयर एन्कोडिंग जैसी उपशब्द विधियाँ इन दोनों के बीच में आती हैं: ये अक्षरों से शुरू होती हैं और लक्ष्य शब्दावली आकार तक पहुँचने तक सबसे अधिक बार उपयोग होने वाले युग्मों को बार-बार मिलाती हैं।

यह क्यों मायने रखती है

अंग्रेजी में एक वाक्य में 20 टोकन लग सकते हैं; वहीं थाई या हिंदी में उसी वाक्य के लिए पश्चिमी-केंद्रित टोकनाइज़र के तहत 60 या उससे अधिक टोकन लग सकते हैं। यह असंतुलन अरबों वक्ताओं के लिए गति, कीमत और सटीकता को प्रभावित करता है।


Warning: session_start(): Cannot start session when headers already sent in /var/www/lexicondream.com/inc/functions.php on line 63

Comments

No comments yet. Be the first to share a thought.

Leave a comment