Hvad betyder Sliding-window attention?
Sliding-window attention er en modelmekanisme, hvor et token kun ser et afgrænset område af andre tokens gennem direkte attention. I en model, der genererer fremad, vil det typisk være et udsnit af de tidligere positioner. Andre arkitekturer kan bruge et vindue på begge sider.
Et lokalt vindue betyder færre direkte forbindelser end fuld attention over hele sekvensen. Det kan gøre lange input mere håndterbare. Men vinduets størrelse og placering er en del af modellens arkitektur og skal ikke forveksles med, hvor mange tegn et brugerinterface lader dig indsætte.
Det er heller ikke korrekt at sige, at al fjern information nødvendigvis er væk. Flere lag og kombinationer med globale forbindelser kan føre information videre. Den praktiske evne til at forbinde fjerne afsnit skal vurderes på konkrete opgaver.
Lokale forbindelser kan kombineres med globale
Et kendt eksempel er Longformer, som kombinerer lokal attention med udvalgte globale positioner. Det viser, hvorfor betegnelsen ikke bør læses som én universel opskrift. To modeller kan begge have lokale vinduer og alligevel håndtere lange afhængigheder forskelligt.
Et vindue er desuden noget andet end manuel opdeling af en PDF. Ved dokumentopdeling bestemmer en applikation, hvilke tekstbidder der sendes til modellen. Sliding-window attention bestemmer beregningsforbindelser inde i modellen.
Undersøg de lange afhængigheder i jeres materiale
Hvis en opgave handler om et enkelt afsnit, kan lokal behandling være tilstrækkelig. Hvis et svar kræver en definition i begyndelsen og en undtagelse langt senere, er det vigtigt at teste forbindelsen mellem dem.
Lav derfor eksempler, hvor den afgørende oplysning flyttes mellem positioner, uden at selve indholdet ændres. Undersøg både korrekthed og kildevalg. En oplyst maksimal inputlængde dokumenterer ikke i sig selv, at alle dele af input bruges lige godt.
Et eksempel fra praksis
Et team vil analysere lange produktmanualer. I en prøvesag defineres en bestemt maskinvariant tidligt, mens et sikkerhedsforbehold for netop varianten står i et senere bilag.
Testen spørger til den relevante procedure og kontrollerer, om begge oplysninger bliver medtaget. Teamet sammenligner med en løsning, der henter de to relevante afsnit direkte. Hvis målrettet søgning giver et mere kontrollerbart grundlag, kan den være et bedre valg end alene at sende en stadig længere manual til modellen.
Typiske faldgruber
- Oplyst kontekstlængde forveksles med direkte adgang mellem alle tokenpositioner.
- Lokal attention og applikationens dokumentopdeling blandes sammen.
- En test med oplysninger tæt på hinanden bruges til at godkende lange, spredte afhængigheder.
Det skal I afklare
- Læs modellens arkitekturbeskrivelse frem for kun dens maksimale inputlængde.
- Test oplysninger, der står langt fra hinanden.
- Sammenlign med målrettet søgning i de relevante afsnit.
Spørgsmål og svar
Er et mindre vindue altid dårligere?
Nej. Det afhænger af opgaven og resten af arkitekturen. Lokale mønstre kan behandles effektivt, mens opgaver med fjerne afhængigheder kræver en særskilt vurdering.
Kan jeg ændre vinduet i min chatprompt?
Normalt ikke som en almindelig instruktion. Vinduet er en model- eller serveregenskab. Et ønske om at “læse hele teksten” ændrer ikke arkitekturen.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Beltagy m.fl.: Longformer ↗Kombination af lokal og global attention.
- Hugging Face: Longformer ↗Modellens lokale og globale attention-masker.

