Hvad betyder Attention?
Attention er en beregning, der vægter information fra forskellige positioner. I en transformer omdannes repræsentationerne typisk til query-, key- og value-vektorer. Sammenligningen mellem query og keys bruges til at vægte de values, der kombineres.
Self-attention arbejder med positioner fra samme sekvens. Cross-attention kan forbinde to forskellige repræsentationer, som i en encoder-decoder. Maskering bestemmer, hvilke positioner beregningen må bruge. En model, der genererer tekst trinvis, ser således ikke fremtidige tokens.
Mekanismen kan hjælpe modellen med at forbinde et stedord med et tidligere navneord. Det er en beregning over repræsentationer, ikke en garanti for korrekt tekstforståelse. Attention-vægte bør heller ikke bruges alene som bevis for, hvorfor et bestemt forretningssvar er rigtigt.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

