Gratis værktøjFå en AI-drevet diagnose af dit website på få minutterPrøv AI Site Doctor
Lad os tale
Præcisionsværktøjer, diagramark og målevægte på et lyst nordisk arbejdsbord
Offentlige benchmarkresultater
← Alle benchmarks
Offentlige kilderGennemgået

Aktuelle AI-benchmarks: resultater med afsender og metode

Udvalgte offentliggjorte resultater for Astra, Sol, Fable, Opus og Gemini. Tre afsendere, tydelige benchmarkversioner og ingen opfundet samlet score.

Datagrundlag og metode

Tabellerne gengiver et afgrænset udvalg fra OpenAI, Anthropic og Google DeepMind, kontrolleret 7. september 2026. Vi har ikke kørt disse tests. En udbyders tabel kan kombinere egne evalueringer og citerede tredjepartsresultater; metode og kilde står ved hver tabel. Vi blander ikke tallene til én rangering.

OpenAI: udvalgte resultater ved Astra-lanceringen

OpenAI: udvalgte resultater ved Astra-lanceringen
BenchmarkGPT-6 AstraGPT-5.6 SolFable 5.1Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9 %37,3 %55,8 %52,6 %19,1 %
DeepSWE v1.174,1 %72,7 %67,4 %73,7 %73,8 %
GPQA Diamond96,0 %94,6 %93,7 %93,7 %95,3 %
AutomationBench41,4 %18,1 %31,4 %26,9 %Ikke oplyst

Offentliggjort 3. september 2026. OpenAI rapporterer højeste resultat på tværs af effort-indstillinger. API-/forskningsopsætningen kan afvige fra ChatGPT. Tallene er ikke fra samme prisbudget eller vores testmiljø.

Anthropic: Fable 5.1-sammenligningen

Anthropic: Fable 5.1-sammenligningen
BenchmarkFable 5.1Opus 5GPT-5.6 Sol
Terminal-Bench 4.055,8 %52,3 %37,3 %
AutomationBench31,4 %26,9 %19,6 %
Terminal-Bench-Science 0.152,6 %29,0 %22,4 %

Aflæst i Anthropic’s aktuelle Fable-tabel. Produktsikkerhed er aktiveret; visse opgaver kan blive afvist eller håndteret af fallback-modeller efter kildens metode. Science-resultater har oplyst standardfejl omkring 3,5–4,5 procentpoint. Opsætningen giver ikke præcis samme tal som OpenAI’s tabel.

Google DeepMind: to forskellige terminalbenchmarks

Google DeepMind: to forskellige terminalbenchmarks
BenchmarkGemini 3.8 FlashGemini 3.7 Flash
Terminal-Bench 2.189,4 %85,8 %
Terminal-Bench 4.019,1 %11,2 %
CharXiv Reasoning · uden værktøjer86,2 %84,5 %

Modelkort fra september 2026, tabel på side 5. Google oplyser normalt pass@1; Terminal-Bench 2.1 bruger Terminus 2, mens 4.0 er hentet fra den officielle leaderboard med højeste offentliggjorte thinking-niveau. Versionerne kan ikke sammenlignes som samme sværhedsgrad.

Hvorfor kan samme model have to tal?

Opus 5 står til 52,6 % hos OpenAI og 52,3 % hos Anthropic på Terminal-Bench 4.0. Vi viser begge med afsender. Et andet testmiljø, en ny kørsel, ændrede opgaver, evalueringstidspunkt eller effort kan flytte resultatet. Det er ikke et grundlag for at tage gennemsnittet.

OSWorld 2.0 indgår bevidst ikke i tabellerne. Kilderne bruger forskellige opgaveudgaver og evalueringstilgange. Samme benchmarknavn er ikke tilstrækkeligt til en retvisende rangering.

Fra offentlig score til en testbar hypotese

Et kodningsbenchmark kan begrunde, at en model kommer med i jeres kodningspilot. Det afgør ikke, om den skriver den bedste danske kundemail eller finder det korrekte svar i jeres dokumenter. Brug resultaterne til en kort kandidatliste og bedøm modellerne på samme realistiske opgaver.

Det kan du ikke udlede af siden

  • Leverandørformidlede resultater, ikke Mosel Studios egne målinger.
  • Ingen samlet vinder på tværs af forskellige opgaver, versioner eller budgetter.
  • Manglende resultat betyder ikke nul. Små forskelle uden usikkerhedsintervaller bør ikke afgøre et modelvalg.

Sådan bruger I det i en beslutning

En nyttig sammenligning har et præcist benchmarknavn, en afsender og en dokumenteret opsætning. Test kvalitet pr. godkendt opgave før I bruger en offentlig score til et produktionsvalg.

Guide: vælg den rette LLM

Kilder og kontroltidspunkt

FRA VIDEN TIL JERES NÆSTE SKRIDT

Skal modellerne vurderes på jeres opgave?

Beskriv arbejdsgangen og jeres vigtigste kvalitetskrav. Vi kan afklare rammerne for en afgrænset test og et konkret tilbud.

  • Gennemgang af opgave og datagrundlag
  • Afklaring af kvalitet, pris og svartid
  • Forslag til et overskueligt testforløb
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Ingen automatisk tilmelding