Hvad betyder Transformer?
Transformer-arkitekturen blev præsenteret af Vaswani og medforfattere i 2017 i artiklen Attention Is All You Need. Modellen kombinerer attention med andre neurale lag og information om rækkefølgen i input. Den oprindelige anvendelse var maskinoversættelse.
Self-attention lader en position kombinere information fra andre tilladte positioner. Hvilke positioner der er tilgængelige, afhænger af arkitektur og maskering: en model, der forudsiger næste token, må under træningen ikke kigge frem på det svar, den skal lære at forudsige.
Transformere kan være bygget som encodere, decodere eller en kombination. Arkitekturen er udbredt, men ikke et krav til enhver sprogmodel. Valget forklarer heller ikke alene kvaliteten; træningsdata, eftertræning og den konkrete opgave har betydning.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

