Benchmarkmetode og historik: sådan læser du vores tal
Datagrundlag og metode
Den redaktionelle gennemgang blev udført 7. september 2026. Tidligere sideversioner er bevaret i projektets lokale kildearkiv. Manglende rå resultater bliver ikke omtalt som verificerede historiske målinger.
Rettelseslog · 7. september 2026
| Tidligere side | Tidligere datering | Rettelse |
|---|---|---|
| Pris pr. 1.000 kald | 15. april 2026 | Gamle DKK-tal, prisrangering og fast kurs erstattet med kildebaseret USD-regnestykke. |
| Latency | 20. april 2026 | Påstand om egne 50-kalds-målinger fra Frankfurt og millisekundtal trukket tilbage; rå logs kunne ikke verificeres. |
| Dansk sprog | 25. april 2026 | Estimerede procenter og generel modelvinder trukket tilbage. |
| JSON-pålidelighed | 25. april 2026 | Estimerede succesprocenter og udokumenteret erfaring med 50.000 kald fjernet fra beslutningsgrundlaget. |
Datoerne er den tidligere sides dateringer, ikke dokumenterede testdatoer. Tilbagetrækning betyder, at grundlaget ikke kunne verificeres; det beviser ikke, at en test aldrig fandt sted.
Tre tydelige datatyper
Beregnet fra listepriser betyder et efterprøveligt regnestykke med defineret tokenbudget. Offentlige kilder betyder specifikationer eller resultater offentliggjort af en navngiven afsender. Testmetode betyder en protokol uden egne nye resultater. Ingen af disse mærkater betyder, at Mosel Studio har målt en models samlede kvalitet.
Dokumentation for fremtidige egne målinger
En publicerbar test skal have test-ID, dato, model-ID’er, forsøgsstørrelse, datasætversion, prompts, API-indstillinger, fejlantal og rå observationer. Et aggregeret resultat skal kunne følges tilbage til forsøgene. Følsomme kundedata offentliggøres ikke som dokumentation.
- Hold udviklingssæt og sluttest adskilt.
- Fastlæg succeskrav og budget før kørsel.
- Bevar fejl og manglende svar i optællingen.
- Vis usikkerhed og begrænsninger.
- Brug kildekontrol-dato og testdato som forskellige felter.
Opdatering uden falsk friskhed
Kildekontrol-datoen viser, hvornår oplysningerne blev gennemgået. Den gør ikke et ældre forsøg nyt. Vi har fjernet løftet om automatiske kvartalsvise målinger og bestemte datoer for kommende resultater. Nye resultater kræver en faktisk kørsel og dokumentation.
Det kan du ikke udlede af siden
- Ingen nye betalte modelkørsler blev foretaget i opdateringen.
- Gamle scores genudgives ikke som historisk rangering med utilstrækkelig dokumentation.
- Det lokale kildearkiv er en revisionsreference, ikke en publiceret forskningsdatabase.
Sådan bruger I det i en beslutning
Et fravær af målinger er mere brugbart end en præcis score uden dokumentation. Brug kilder og protokoller til at stille bedre spørgsmål til modelvalget.
Skal modellerne vurderes på jeres opgave?
Beskriv arbejdsgangen og jeres vigtigste kvalitetskrav. Vi kan afklare rammerne for en afgrænset test og et konkret tilbud.
- Gennemgang af opgave og datagrundlag
- Afklaring af kvalitet, pris og svartid
- Forslag til et overskueligt testforløb

