Hvad betyder Tokenbudget?
Et tokenbudget er en plan for, hvor mange tokens en AI-opgave må bruge. Tokens er modellens tekstlige enheder og svarer ikke altid til hele ord. Budgettet kan omfatte input i et enkelt kald, plads til svaret og den samlede brug gennem et forløb med flere kald.
Det er nyttigt at skelne mellem en teknisk grænse og virksomhedens eget budget. En model kan acceptere mere materiale, end det er relevant eller økonomisk fornuftigt at sende. Omvendt kan en meget lav outputgrænse afbryde et svar, før de nødvendige felter er kommet med.
Et budget handler derfor om prioritering. Styrende instruktioner, brugerens opgave, hentede kilder og tidligere samtale konkurrerer om pladsen. Hvis alt blot lægges til, bliver forløbet gradvist dyrere og vanskeligere at overskue.
Fordel pladsen efter informationsbehov
Begynd med det nødvendige resultat. Et svar med fem strukturerede felter kræver en anden ramme end en lang sammenligning af dokumenter. Reservér plads til output og vælg derefter de kilder, der er relevante for spørgsmålet.
Tæl med den tokenizer eller tællefunktion, der passer til den valgte model. Et estimat baseret på antal danske ord kan være upræcist, især ved produktnumre, sammensatte ord og kode. Ved modelskift bør tællingen kontrolleres igen.
Sæt også en grænse for hele opgaven
En agent kan bruge budgettet på søgning, opfølgende spørgsmål og flere udkast. Et lille maksimum pr. kald forhindrer ikke nødvendigvis et langt og dyrt samlet forløb. Definér derfor stopbetingelser for gentagelser, værktøjssvar og antal trin.
Når rammen nås, skal systemet enten afslutte med en tydelig status eller bede om relevant afklaring. Tavs afkortning af dokumentet kan fjerne en undtagelse, mens tavs afkortning af output kan ødelægge en maskinlæsbar leverance.
Et eksempel fra praksis
En rådgivningsvirksomhed vil sammenligne tre produktmanualer. I stedet for at sende alle sider ved hvert spørgsmål udvælger løsningen relevante afsnit med kilde-ID og reserverer plads til en kort sammenligning.
Teamet tester spørgsmål, hvor svaret afhænger af et bilag eller et forbehold. Hvis disse forhold forsvinder, er budgettet eller udvælgelsen forkert, selv om omkostningen falder. En rapport viser både brugte tokens, afbrudte svar og kvaliteten af de nødvendige oplysninger. Ingen fast grænse vælges ud fra et generelt antal ord alene.
Typiske faldgruber
- Et token bliver regnet som ét ord på tværs af sprog og modeller.
- En lav outputgrænse bruges uden kontrol af afbrudte svar.
- Budget pr. kald bliver forvekslet med budget for et helt agentforløb.
Det skal I afklare
- Tæl med den aktuelle model og realistiske danske input.
- Fordel plads mellem instruktion, kilder, historik og svar.
- Definér synlig håndtering af grænsen og mål informationstab.
Spørgsmål og svar
Er tokenbudget og kontekstvindue det samme?
Nej. Kontekstvinduet er modellens tekniske ramme for det materiale, der kan behandles sammen. Et tokenbudget er jeres valgte grænse eller fordeling og kan være betydeligt mindre.
Giver færre tokens altid et bedre svar?
Nej. Irrelevant tekst kan fjernes med fordel, men nødvendige fakta og betingelser skal bevares. Bedøm den konkrete opgave før og efter ændringen.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Anthropic: Token counting ↗Modeltilpasset optælling og forskel fra faktisk brug.
- Hugging Face: Byte-Pair Encoding tokenization ↗Tekstens opdeling i tokens.

