Hvad betyder Throughput?
Throughput beskriver kapacitet. Hvis en dokumentløsning behandler et bestemt antal bilag på en time, er det et mål for dens gennemløb. En modelserver kan i stedet oplyse inputtokens eller outputtokens pr. sekund. Enheden er afgørende: flere genererede tokens er ikke nødvendigvis flere løste kundeopgaver.
Kapacitet og svartid er forskellige egenskaber. Et system kan gennemføre mange opgaver samlet, mens den enkelte bruger venter længe. Det sker eksempelvis, hvis opgaver samles i store grupper for at udnytte beregningsressourcerne effektivt.
For en virksomhed er det mest anvendelige mål ofte færdige opgaver, som opfylder et defineret kvalitetskrav. Hvis halvdelen kræver omfattende rettelser, fortæller serverens rå tokenhastighed kun lidt om teamets reelle kapacitet.
Samtidighed ændrer kapaciteten
Modeller kan behandle flere forespørgsler sammen. Ved continuous batching justeres gruppen løbende, når opgaver afsluttes og nye kommer til. Det kan udnytte hardware bedre, men resultatet afhænger af inputlængde, outputlængde og tilgængelig hukommelse.
En benchmark med korte, ensartede svar kan derfor være et dårligt billede af en arbejdsdag med lange dokumenter og enkelte meget store opgaver. Beskriv belastningen og ikke kun det højeste opnåede tal.
Vælg en måleenhed, der passer til opgaven
Et chatteam har brug for tilstrækkelig kapacitet uden urimelig kø. En natlig dokumentkørsel kan acceptere længere ventetid pr. dokument, hvis hele køen afsluttes før næste arbejdsdag. De to situationer bør ikke optimeres efter samme mål.
Registrér fejl, gentagelser og manuelle minutter sammen med gennemløbet. Aftal også, hvad der sker ved overbelastning: kø, begrænset adgang eller en synlig fejl. Uendelige gentagelser kan skabe mere trafik og gøre kapacitetsproblemet værre.
Et eksempel fra praksis
En grossist vil udtrække felter fra indgående ordredokumenter om natten. Teamet definerer gennemløb som dokumenter med komplette, validerede felter pr. time. Dokumenter, der går til manuel kontrol, registreres særskilt.
En test sammenligner to indstillinger med samme dokumentblanding. Den hurtigste tokenproduktion vælges ikke automatisk: Hvis den anden indstilling giver færre afbrudte dokumenter og mindre efterarbejde, kan den være bedre for driften. Testen bør også undersøge, om en stor fil blokerer resten af køen, og om forløbet kan genoptages uden dubletter.
Typiske faldgruber
- Tokens pr. sekund bliver brugt som om det var færdige sager pr. time.
- Kapacitet måles uden den søgning, validering og kontrol, som opgaven kræver.
- En høj spidsværdi bliver præsenteret som en stabil kapacitet over en hel arbejdsdag.
Det skal I afklare
- Angiv enhed, kvalitetskrav og måleperiode.
- Brug en realistisk blanding af små og store opgaver.
- Følg køtid, fejl og menneskelig efterbehandling samtidig.
Spørgsmål og svar
Kan høj throughput give langsomme svar?
Ja. En opsætning kan prioritere samlet ressourceudnyttelse frem for den enkelte forespørgsels ventetid. Derfor skal kapacitet og svartid måles hver for sig.
Hvordan sammenligner vi to leverandører?
Brug samme opgaver, kvalitetskrav, samtidighed og opgørelsesperiode. Afklar også, om opgivne tokenhastigheder er pr. bruger eller for hele systemet.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Hugging Face: Continuous batching ↗Løbende planlægning af forespørgsler og kapacitetsafvejninger.
- vLLM: Metrics ↗Forespørgsler, genererede tokens og kømålinger.

