Uforpligtende snakFå afklaret jeres idé, udfordring eller næste skridtTal med os
Præcisionsværktøjer, diagramark og målevægte på et lyst nordisk arbejdsbord
Svartid og latency
← Alle benchmarks
Testmetode · ingen egne resultaterGennemgået

AI-svartid: mål første token, færdigt svar og ventetid

En reproducerbar metode til TTFT, total svartid, p50 og p95. De tidligere millisekundtal er trukket tilbage, fordi rå målinger ikke kunne dokumenteres.

Datagrundlag og metode

Dette er vores foreslåede testprotokol, ikke et gennemført eksperiment. Der foreligger ikke verificerbare rå latency-kørsler bag sidens tidligere tal. Nye resultater kræver ens opgaver, logget klientregion, model-ID, outputlængde, samtidighed, caching og tidspunkt. En enkelt total svartid er ikke TTFT.

Felter i en latency-rapport

Felter i en latency-rapport
MålingEnhedHvad den fortæller
TTFTMillisekunderVentetid til første indholdstoken
Samlet svartidMillisekunderStart til afsluttet svar
p50 / p95MillisekunderTypisk oplevelse og den langsommere hale
SuccesrateGodkendte / alle forsøgOm svaret kunne anvendes
SamtidighedParallelle kaldHvor meget trafik forsøget repræsenterer

Rapportfelter, ikke målte resultater.

Mål tre tidspunkter

Start uret umiddelbart før request sendes. Registrér første indholdstoken fra streamen og tidspunktet for sidste token. Første HTTP-byte eller et tomt streaming-event er ikke nødvendigvis det første svar, brugeren kan læse. Registrér også samlet tid til et brugbart, valideret resultat efter eventuelle værktøjer og retries.

Et konkret forsøgsdesign

Et afgrænset eksempel er 30 repræsentative opgaver pr. model i tre tidsrum. Fastlæg forsøgsstørrelsen på forhånd og bland rækkefølgen mellem modeller, så belastning på et bestemt tidspunkt ikke systematisk favoriserer én model. Dette er et metodeforslag, ikke en påstand om udførte kald.

  • Kør uden cache og med realistisk cache som separate serier.
  • Hold klientregion, service tier, outputbudget og samtidighed faste.
  • Log timeouts og fejl; vis deres antal ved siden af svartiderne.
  • Rapportér p50 og p95 for vellykkede kald samt succesrate for alle forsøg.
  • Medtag kort chat, dokumentinput og en opgave med værktøjskald.

Undgå et misvisende hurtigt resultat

En model, der afbrydes tidligt eller svarer forkert, kan se hurtig ud. Kvalitetskontrollen skal komme før konklusionen om hastighed. Rapportér første token og færdig opgave hver for sig. For batchopgaver kan samlet gennemløbstid være vigtigere end en øjeblikkelig start.

Det kan du ikke udlede af siden

  • Ingen nye egne latency-tal offentliggjort i denne opdatering.
  • Leverandørbeskrivelser som fast er ikke sammenlignelige millisekundmålinger.
  • Pilotskripterne i kodebasen måler total ikke-streamet kaldtid; de dokumenterer ikke TTFT.

Sådan bruger I det i en beslutning

Sæt et mål for tid til et korrekt resultat i jeres løsning. Et enkelt hurtigt kald er ikke en produktionsgaranti.

Guide: chatbot til hjemmesiden →

Kilder og kontroltidspunkt

FRA VIDEN TIL JERES NÆSTE SKRIDT

Skal modellerne vurderes på jeres opgave?

Beskriv arbejdsgangen og jeres vigtigste kvalitetskrav. Vi kan afklare rammerne for en afgrænset test og et konkret tilbud. Samtalen er uforpligtende.

  • Gennemgang af opgave og datagrundlag
  • Afklaring af kvalitet, pris og svartid
  • Forslag til et overskueligt testforløb
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Vi aftaler næste skridt med jer