AI-svartid: mål første token, færdigt svar og ventetid
Datagrundlag og metode
Dette er vores foreslåede testprotokol, ikke et gennemført eksperiment. Der foreligger ikke verificerbare rå latency-kørsler bag sidens tidligere tal. Nye resultater kræver ens opgaver, logget klientregion, model-ID, outputlængde, samtidighed, caching og tidspunkt. En enkelt total svartid er ikke TTFT.
Kilder: OpenAI: latency og optimering
Felter i en latency-rapport
| Måling | Enhed | Hvad den fortæller |
|---|---|---|
| TTFT | Millisekunder | Ventetid til første indholdstoken |
| Samlet svartid | Millisekunder | Start til afsluttet svar |
| p50 / p95 | Millisekunder | Typisk oplevelse og den langsommere hale |
| Succesrate | Godkendte / alle forsøg | Om svaret kunne anvendes |
| Samtidighed | Parallelle kald | Hvor meget trafik forsøget repræsenterer |
Rapportfelter, ikke målte resultater.
Kilder: OpenAI: latency og optimering
Mål tre tidspunkter
Start uret umiddelbart før request sendes. Registrér første indholdstoken fra streamen og tidspunktet for sidste token. Første HTTP-byte eller et tomt streaming-event er ikke nødvendigvis det første svar, brugeren kan læse. Registrér også samlet tid til et brugbart, valideret resultat efter eventuelle værktøjer og retries.
Kilder: OpenAI: latency og optimering
Et konkret forsøgsdesign
Et afgrænset eksempel er 30 repræsentative opgaver pr. model i tre tidsrum. Fastlæg forsøgsstørrelsen på forhånd og bland rækkefølgen mellem modeller, så belastning på et bestemt tidspunkt ikke systematisk favoriserer én model. Dette er et metodeforslag, ikke en påstand om udførte kald.
- Kør uden cache og med realistisk cache som separate serier.
- Hold klientregion, service tier, outputbudget og samtidighed faste.
- Log timeouts og fejl; vis deres antal ved siden af svartiderne.
- Rapportér p50 og p95 for vellykkede kald samt succesrate for alle forsøg.
- Medtag kort chat, dokumentinput og en opgave med værktøjskald.
Undgå et misvisende hurtigt resultat
En model, der afbrydes tidligt eller svarer forkert, kan se hurtig ud. Kvalitetskontrollen skal komme før konklusionen om hastighed. Rapportér første token og færdig opgave hver for sig. For batchopgaver kan samlet gennemløbstid være vigtigere end en øjeblikkelig start.
Det kan du ikke udlede af siden
- Ingen nye egne latency-tal offentliggjort i denne opdatering.
- Leverandørbeskrivelser som fast er ikke sammenlignelige millisekundmålinger.
- Pilotskripterne i kodebasen måler total ikke-streamet kaldtid; de dokumenterer ikke TTFT.
Sådan bruger I det i en beslutning
Sæt et mål for tid til et korrekt resultat i jeres løsning. Et enkelt hurtigt kald er ikke en produktionsgaranti.
Kilder og kontroltidspunkt
- OpenAI: latency og optimering · OpenAI · kontrolleret
Skal modellerne vurderes på jeres opgave?
Beskriv arbejdsgangen og jeres vigtigste kvalitetskrav. Vi kan afklare rammerne for en afgrænset test og et konkret tilbud. Samtalen er uforpligtende.
- Gennemgang af opgave og datagrundlag
- Afklaring af kvalitet, pris og svartid
- Forslag til et overskueligt testforløb

