Gratis værktøjFå en AI-drevet diagnose af dit website på få minutterPrøv AI Site Doctor
Lad os tale
Præcisionsværktøjer, diagramark og målevægte på et lyst nordisk arbejdsbord
Metode og rettelser
← Alle benchmarks
Arkiv · tidligere tal trukket tilbageGennemgået

Benchmarkmetode og historik: sådan læser du vores tal

Forskellen på beregnede priser, eksterne resultater og egne forsøg. Her dokumenterer vi også tilbagetrækningen af de tidligere april-tal.

Datagrundlag og metode

Den redaktionelle gennemgang blev udført 7. september 2026. Tidligere sideversioner er bevaret i projektets lokale kildearkiv. Manglende rå resultater bliver ikke omtalt som verificerede historiske målinger.

Rettelseslog · 7. september 2026

Rettelseslog · 7. september 2026
Tidligere sideTidligere dateringRettelse
Pris pr. 1.000 kald15. april 2026Gamle DKK-tal, prisrangering og fast kurs erstattet med kildebaseret USD-regnestykke.
Latency20. april 2026Påstand om egne 50-kalds-målinger fra Frankfurt og millisekundtal trukket tilbage; rå logs kunne ikke verificeres.
Dansk sprog25. april 2026Estimerede procenter og generel modelvinder trukket tilbage.
JSON-pålidelighed25. april 2026Estimerede succesprocenter og udokumenteret erfaring med 50.000 kald fjernet fra beslutningsgrundlaget.

Datoerne er den tidligere sides dateringer, ikke dokumenterede testdatoer. Tilbagetrækning betyder, at grundlaget ikke kunne verificeres; det beviser ikke, at en test aldrig fandt sted.

Tre tydelige datatyper

Beregnet fra listepriser betyder et efterprøveligt regnestykke med defineret tokenbudget. Offentlige kilder betyder specifikationer eller resultater offentliggjort af en navngiven afsender. Testmetode betyder en protokol uden egne nye resultater. Ingen af disse mærkater betyder, at Mosel Studio har målt en models samlede kvalitet.

Dokumentation for fremtidige egne målinger

En publicerbar test skal have test-ID, dato, model-ID’er, forsøgsstørrelse, datasætversion, prompts, API-indstillinger, fejlantal og rå observationer. Et aggregeret resultat skal kunne følges tilbage til forsøgene. Følsomme kundedata offentliggøres ikke som dokumentation.

  • Hold udviklingssæt og sluttest adskilt.
  • Fastlæg succeskrav og budget før kørsel.
  • Bevar fejl og manglende svar i optællingen.
  • Vis usikkerhed og begrænsninger.
  • Brug kildekontrol-dato og testdato som forskellige felter.

Opdatering uden falsk friskhed

Kildekontrol-datoen viser, hvornår oplysningerne blev gennemgået. Den gør ikke et ældre forsøg nyt. Vi har fjernet løftet om automatiske kvartalsvise målinger og bestemte datoer for kommende resultater. Nye resultater kræver en faktisk kørsel og dokumentation.

Det kan du ikke udlede af siden

  • Ingen nye betalte modelkørsler blev foretaget i opdateringen.
  • Gamle scores genudgives ikke som historisk rangering med utilstrækkelig dokumentation.
  • Det lokale kildearkiv er en revisionsreference, ikke en publiceret forskningsdatabase.

Sådan bruger I det i en beslutning

Et fravær af målinger er mere brugbart end en præcis score uden dokumentation. Brug kilder og protokoller til at stille bedre spørgsmål til modelvalget.

Guide: vælg den rette LLM

FRA VIDEN TIL JERES NÆSTE SKRIDT

Skal modellerne vurderes på jeres opgave?

Beskriv arbejdsgangen og jeres vigtigste kvalitetskrav. Vi kan afklare rammerne for en afgrænset test og et konkret tilbud.

  • Gennemgang af opgave og datagrundlag
  • Afklaring af kvalitet, pris og svartid
  • Forslag til et overskueligt testforløb
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Ingen automatisk tilmelding