Hvad betyder Latency i AI?
Latency beskriver forsinkelsen i et system. En bruger kan opleve tid til første synlige tekst, mens driftsmålingen registrerer tiden til hele modelsvaret. En forretningsproces kan være interesseret i tiden til et valideret resultat, som faktisk kan bruges. Alle tre mål kan være relevante, men de er ikke det samme.
Den samlede ventetid kan omfatte netværk, kø, adgangskontrol, kildesøgning, modelberegning, værktøjskald og efterfølgende validering. En optimering af modellen hjælper kun begrænset, hvis den største forsinkelse ligger et andet sted.
Målinger skal ledsages af belastning og opgavetype. Lange input, lange svar og mange samtidige forespørgsler kan give andre tider end et enkelt kort testspørgsmål. En leverandørs eksempel er derfor ikke automatisk et realistisk løfte for jeres løsning.
Se på fordelingen og de langsomme tilfælde
Et gennemsnit kan skjule, at nogle brugere venter meget længe. Percentiler som p50 og p95 beskriver forskellige punkter i fordelingen. En p95-måling angiver en grænse, som cirka 95 procent af de målte observationer ligger på eller under, afhængigt af beregningsmetoden.
Angiv antal observationer, testperiode og de trin, der indgår. Fejl og timeouts bør rapporteres særskilt, så mislykkede opgaver ikke forsvinder fra billedet og får systemet til at se hurtigere ud.
Fjern den dokumenterede flaskehals
Mulige forbedringer er kortere relevant kontekst, passende outputlængde, caching, parallelle uafhængige opslag eller en anden model. De skal vurderes med de samme kvalitetskrav. Et hurtigt, ubrugeligt svar er ikke en gevinst.
Streaming kan forbedre oplevelsen af fremdrift, mens batchbehandling kan flytte opgaver, der ikke kræver et øjeblikkeligt svar. Vælg efter brugerens behov frem for at optimere ét teknisk tal isoleret.
Et eksempel fra praksis
Forestil jer en assistent, hvor medarbejdere oplever langsomme svar. Målingen opdeler forløbet i kildesøgning, modeltid og efterfølgende kontrol. Den viser, at lange databaseopslag fylder mere end forventet.
Teamet forbedrer opslagene og genmåler på de samme spørgsmål under realistisk belastning. Rapporten viser tid til første tekst, samlet godkendt output og fejlrate. Dermed kan forbedringen vurderes uden at forveksle en hurtigere animation eller et tidligere tekstfragment med en hurtigere afsluttet opgave.
Typiske faldgruber
- Forskellige definitioner af svartid kan blive sammenlignet, som om de måler det samme.
- Gennemsnit kan skjule lange ventetider for bestemte brugere eller opgaver.
- Fejl og timeouts kan blive udeladt og gøre resultatet misvisende.
Det skal I afklare
- Hvor starter og slutter målingen, og hvilke trin indgår?
- Er testopgaver og samtidighed repræsentative for driften?
- Er svartid vurderet sammen med kvalitet, fejlrate og pris pr. godkendt resultat?
Spørgsmål og svar
Er høj throughput det samme som lav latency?
Nej. Throughput beskriver, hvor meget arbejde systemet gennemfører over tid. Et system kan behandle mange opgaver samlet, mens den enkelte opgave stadig har lang ventetid.
Hvad er en god svartid for AI?
Det afhænger af opgaven. En samtale, et baggrundsjob og en manuel godkendelsesproces har forskellige behov. Aftal et konkret mål og mål det på den relevante arbejdsgang.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Claude Platform: Reducing latency ↗Input, output og tiltag, som påvirker svartid.
- Hugging Face TGI: Streaming ↗Forskel på løbende levering og det samlede genererede resultat.

