EN - FR - DE - ES - IT - PT -

LexiconDream

✂️ Parçalama

Metni token denilen daha küçük birimlere ayırma.

Parçalama

Bir dil modelinin herhangi bir şeyi okuyabilmesi için, metnin sayabileceği parçalara ayrılması gerekir. Bu parçalara belirteçler (token) denir ve belirteçleme (tokenization) bu ayırma işlemidir. Bir belirteç, bütün bir kelime, "ing" veya "pre" gibi bir parça, bir noktalama işareti veya hatta tek bir karakter olabilir. Model asla ham metni görmez; bu belirteçlere eşlenmiş bir dizi tamsayı kimliği görür.

Farklı yöntemler farklı ödünleşmelere yol açar. Kelime düzeyinde belirteçleme anlamı korur ancak milyonlarca nadir kelimeye dönüşür ve yazım hatalarıyla mücadele eder. Karakter düzeyinde belirteçleme küçük bir kelime dağarcığına sahiptir ancak çok uzun diziler üretir. Bayt çifti kodlaması gibi alt kelime yöntemleri ise bunların arasında yer alır: karakterlerle başlar ve hedef kelime dağarcığı boyutuna ulaşılana kadar en sık kullanılan çiftleri tekrar tekrar birleştirir.

Neden önemli?

İngilizce bir cümle 20 belirteç kullanabilirken, aynı cümle Tayca veya Hintçe'de Batı merkezli bir belirteçleme sistemi altında 60 veya daha fazla belirteç gerektirebilir. Bu dengesizlik, milyarlarca konuşmacı için hızı, fiyatı ve doğruluğu etkiler.

Comments

No comments yet. Be the first to share a thought.

Leave a comment