I 2017 udgav et team hos Google en artikel med titlen "Attention Is All You Need", og den arkitektur, den beskrev, understøtter nu næsten alle større sprogmodeller. Transformeren erstattede gentagelse med selvopmærksomhed: hvert token i en sekvens kan se direkte på alle andre tokens og dermed veje, hvor meget hver enkelt betyder for den aktuelle forudsigelse.
Det parallelle opslag er nøglen. Ældre tilbagevendende netværk behandlede ord ét ad gangen, hvilket gjorde langtrækkende afhængigheder svære at lære og træning langsom. En transformer behandler hele sekvensen på én gang, så et pronomen i slutningen af et afsnit kan fokusere på sin forgænger i begyndelsen uden at miste tråden.
Kernekomponenter
- Selvopmærksomhedslag, der beregner relationer mellem alle tokenpar
- Flerhovedopmærksomhed, der kører flere opmærksomhedsoperationer parallelt
- Positionskodninger, der indsætter information om ordrækkefølge
- Forward-blokke og restforbindelser, der stabiliserer dybe stakke
Omkostningerne er kvadratiske: en fordobling af sekvenslængden firedobler opmærksomhedsberegningen. Det er derfor, kontekstvinduer er dyre, og derfor bliver forskere ved med at foreslå effektive varianter såsom sparsom og lineær opmærksomhed.
Comments (3)
Leave a comment