EN - FR - DE - ES - IT - PT -

LexiconDream

🔤 Vkládání slov

Hustá vektorová reprezentace slov, která zachycuje sémantický význam.

Vkládání slov

V dobrém vkládání slov se „král“ mínus „muž“ plus „žena“ nachází blízko slova „královna“. Tato aritmetika funguje, protože vektory kódují význam, nejen pravopis. Každé slovo se stává hustým seznamem čísel, obvykle o 100 až 300 dimenzích, umístěných tak, aby podobná slova byla ve vektorovém prostoru blízko sebe.

Starší reprezentace považovaly slova za izolované symboly. Jednorázový vektor pro slovo „kočka“ neříkal nic o slově „kotě“. Vkládání to změnilo trénováním na velkých textových korpusech: slova, která se objevují v podobných kontextech, končí s podobnými vektory. Motorem celé myšlenky je distribuční hypotéza, zhruba „slovo poznáte podle společnosti, ve které se nachází“.

Oblíbené metody

Statické vkládání, jako je Word2Vec, přiřazuje jeden vektor každému slovu, takže „banka“ má stejnou reprezentaci v „říčním břehu“ a „bankovním účtu“. Kontextuální modely tuto nejednoznačnost řeší, a proto nyní dominují. Nevýhodou jsou náklady: výpočet kontextového vektoru vyžaduje spuštění celého modelu.

Comments

No comments yet. Be the first to share a thought.

Leave a comment