Gratis værktøjFå en AI-drevet diagnose af dit website på få minutterPrøv AI Site Doctor
Lad os tale
← Udforsk AI-ordbogen
Modeller & arkitektur

Time to first token

Time to first token måler ventetiden frem til modellens første outputtoken. Det er et andet mål end tiden til et færdigt, brugbart svar.

Også kaldet: TTFT · Tid til første token

Moselstudio · AI-ordbog2 min. læsning
Se mulighederne i jeres virksomhed ↗
Et timeglas står ved begyndelsen af en række kugler i en glaskanal.
Den første synlige del af svaret har sin egen ventetid.

Hvad betyder Time to first token?

Time to first token, ofte forkortet TTFT, beskriver hvor længe der går, før tekstgenereringen begynder at levere output. Målet er især relevant i en chat, hvor brugeren oplever forskel på en tom skærm og et svar, der gradvist kommer frem.

Målepunktet skal beskrives præcist. En modelserver kan måle fra modtagelsen af en forespørgsel, mens en brugerflade måler fra brugerens klik. Søgning i dokumenter, netværk og anden behandling kan derfor ligge uden for den rapporterede modeltid. To tal med forskellige startpunkter kan ikke uden videre sammenlignes.

Et hurtigt første token siger heller ikke, at resten af svaret kommer hurtigt. Modellen kan begynde tidligt og derefter levere langsomt, eller vente længere før et kort og præcist svar. Derfor bør TTFT ses sammen med samlet svartid, kvalitet og fejlrate.

Find den del af ventetiden, der kan forbedres

Før første output kan forespørgslen vente i kø, blive klargjort og få sit input behandlet. Et langt dokument kan kræve mere indledende arbejde end et kort spørgsmål. Genbrug af uændrede promptdele kan i nogle opsætninger begrænse dette arbejde, mens det ikke løser langsom søgning i et eksternt system.

Registrér derfor de vigtigste trin særskilt. Det er svært at vælge en forbedring ud fra ét samlet tal, hvis teamet ikke ved, om ventetiden skyldes netværk, kapacitetsmangel eller selve modellens behandling.

Mål det brugeren faktisk venter på

En intern dokumentopgave kan godt tåle længere ventetid, hvis resultatet efterfølgende er korrekt og komplet. I en kundechat er stilhed mere synlig. En tydelig status kan hjælpe brugeren med at forstå arbejdet, men den må ikke præsenteres som det første modeltoken.

Undersøg også langsomme tilfælde, eksempelvis den 95. percentil, frem for kun gennemsnittet. Opdel efter inputlængde og samtidige brugere, så et pænt tal fra en tom testserver ikke bliver forvekslet med normal drift.

FRA BEGREB TIL ARBEJDSDAG

Et eksempel fra praksis

Forestil jer en servicevirksomhed, hvor chatten først søger i en produktmanual og derefter skriver et svar. Teamet måler tid fra klik til søgeresultat, fra modelkald til første token og fra klik til færdigt svar.

Hvis søgningen står for størstedelen af ventetiden, vil en anden tekstmodel ikke nødvendigvis løse problemet. En afgrænset test kan i stedet undersøge søgeindekset og antallet af hentede uddrag. Sammenligningen skal samtidig kontrollere, at svaret stadig indeholder den nødvendige produktinformation. Eksemplet er en mulig måleplan, ikke et dokumenteret hastighedsresultat.

Typiske faldgruber

  • Et statusikon eller en fast tekst som “jeg undersøger” er ikke første outputtoken.
  • Et lavt gennemsnit kan skjule meget langsomme samtaler ved belastning.
  • TTFT uden oplysning om startpunkt, input og samtidighed kan give en misvisende sammenligning.

Det skal I afklare

  1. Definér præcist hvornår målingen begynder og slutter.
  2. Registrér både første token, færdigt svar og relevante mellemtrin.
  3. Test med realistiske dokumenter og det forventede antal samtidige brugere.

Spørgsmål og svar

Er lavere TTFT altid bedre?

Kortere ventetid er nyttig, men ikke hvis den opnås ved at udelade nødvendige kilder eller levere et forkert svar. Vurder tid og kvalitet sammen.

Er TTFT det samme som tokens pr. sekund?

Nej. TTFT handler om ventetiden før første output. Tokens pr. sekund beskriver en hastighed under genereringen eller en samlet kapacitet, afhængigt af målemetoden.

Kilder og videre læsning

De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

  1. vLLM: MetricsAdskilte målinger af første token, kø, prefill og samlet svartid.
  2. Anthropic: Reducing latencySvartid og streaming i anvendelser.
FRA VIDEN TIL JERES NÆSTE SKRIDT

Fra begreb til en løsning, I kan bruge.

Beskriv den opgave, I gerne vil gøre lettere. Vi hjælper med at afklare data, muligheder og et overskueligt første skridt.

  • En personlig vurdering af jeres opgave
  • Afklaring af data, systemer og begrænsninger
  • Et konkret forslag til næste skridt
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Ingen automatisk tilmelding