V roce 2017 publikoval tým společnosti Google článek s názvem „Pozornost je vše, co potřebujete“ (Attention Is All You Need) a architektura, kterou popsal, nyní pohání téměř každý hlavní jazykový model. Transformátor nahradil opakování sebepozorností: každý token v sekvenci se může přímo dívat na každý jiný token a zvažovat, jak moc každý z nich důležitý pro aktuální predikci.
Toto paralelní vyhledávání je klíčové. Starší rekurentní sítě zpracovávaly slova jedno po druhém, což ztěžovalo učení dlouhodobých závislostí a zpomalovalo trénování. Transformátor zpracovává celou sekvenci najednou, takže zájmeno na konci odstavce se může věnovat svému antecedentu na začátku, aniž by ztratilo nit.
Základní komponenty
- Vrstvy sebepozornosti, které počítají vztahy mezi všemi páry tokenů
- Vícehlavá pozornost, která provádí několik operací pozornosti paralelně
- Poziční kódování, které vkládá informace o slovosledu
- Bloky s dopřednou vazbou a zbytková spojení, která stabilizují hluboké zásobníky
Cena je kvadratická: zdvojnásobení délky sekvence čtyřnásobně zvýší výpočet pozornosti. Proto jsou kontextová okna drahá a vědci stále navrhují efektivní varianty, jako je řídká a lineární pozornost.
Comments (3)
Leave a comment