Aktuelle AI-benchmarks: resultater med afsender og metode
Datagrundlag og metode
Tabellerne gengiver et afgrænset udvalg fra OpenAI, Anthropic og Google DeepMind, kontrolleret 7. september 2026. Vi har ikke kørt disse tests. En udbyders tabel kan kombinere egne evalueringer og citerede tredjepartsresultater; metode og kilde står ved hver tabel. Vi blander ikke tallene til én rangering.
Kilder: GPT-6 Astra: resultater og evalueringsnoter · Claude Fable 5.1: resultater og forbehold · Gemini 3.8 Flash: modelkort, september 2026 (PDF) · Gemini 3.8 Flash: evalueringsmetode (PDF)
OpenAI: udvalgte resultater ved Astra-lanceringen
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9 % | 37,3 % | 55,8 % | 52,6 % | 19,1 % |
| DeepSWE v1.1 | 74,1 % | 72,7 % | 67,4 % | 73,7 % | 73,8 % |
| GPQA Diamond | 96,0 % | 94,6 % | 93,7 % | 93,7 % | 95,3 % |
| AutomationBench | 41,4 % | 18,1 % | 31,4 % | 26,9 % | Ikke oplyst |
Offentliggjort 3. september 2026. OpenAI rapporterer højeste resultat på tværs af effort-indstillinger. API-/forskningsopsætningen kan afvige fra ChatGPT. Tallene er ikke fra samme prisbudget eller vores testmiljø.
Anthropic: Fable 5.1-sammenligningen
| Benchmark | Fable 5.1 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|
| Terminal-Bench 4.0 | 55,8 % | 52,3 % | 37,3 % |
| AutomationBench | 31,4 % | 26,9 % | 19,6 % |
| Terminal-Bench-Science 0.1 | 52,6 % | 29,0 % | 22,4 % |
Aflæst i Anthropic’s aktuelle Fable-tabel. Produktsikkerhed er aktiveret; visse opgaver kan blive afvist eller håndteret af fallback-modeller efter kildens metode. Science-resultater har oplyst standardfejl omkring 3,5–4,5 procentpoint. Opsætningen giver ikke præcis samme tal som OpenAI’s tabel.
Google DeepMind: to forskellige terminalbenchmarks
| Benchmark | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| Terminal-Bench 2.1 | 89,4 % | 85,8 % |
| Terminal-Bench 4.0 | 19,1 % | 11,2 % |
| CharXiv Reasoning · uden værktøjer | 86,2 % | 84,5 % |
Modelkort fra september 2026, tabel på side 5. Google oplyser normalt pass@1; Terminal-Bench 2.1 bruger Terminus 2, mens 4.0 er hentet fra den officielle leaderboard med højeste offentliggjorte thinking-niveau. Versionerne kan ikke sammenlignes som samme sværhedsgrad.
Kilder: Gemini 3.8 Flash: modelkort, september 2026 (PDF) · Gemini 3.8 Flash: evalueringsmetode (PDF)
Hvorfor kan samme model have to tal?
Opus 5 står til 52,6 % hos OpenAI og 52,3 % hos Anthropic på Terminal-Bench 4.0. Vi viser begge med afsender. Et andet testmiljø, en ny kørsel, ændrede opgaver, evalueringstidspunkt eller effort kan flytte resultatet. Det er ikke et grundlag for at tage gennemsnittet.
OSWorld 2.0 indgår bevidst ikke i tabellerne. Kilderne bruger forskellige opgaveudgaver og evalueringstilgange. Samme benchmarknavn er ikke tilstrækkeligt til en retvisende rangering.
Kilder: GPT-6 Astra: resultater og evalueringsnoter · Claude Fable 5.1: resultater og forbehold · Gemini 3.8 Flash: evalueringsmetode (PDF)
Fra offentlig score til en testbar hypotese
Et kodningsbenchmark kan begrunde, at en model kommer med i jeres kodningspilot. Det afgør ikke, om den skriver den bedste danske kundemail eller finder det korrekte svar i jeres dokumenter. Brug resultaterne til en kort kandidatliste og bedøm modellerne på samme realistiske opgaver.
Det kan du ikke udlede af siden
- Leverandørformidlede resultater, ikke Mosel Studios egne målinger.
- Ingen samlet vinder på tværs af forskellige opgaver, versioner eller budgetter.
- Manglende resultat betyder ikke nul. Små forskelle uden usikkerhedsintervaller bør ikke afgøre et modelvalg.
Sådan bruger I det i en beslutning
En nyttig sammenligning har et præcist benchmarknavn, en afsender og en dokumenteret opsætning. Test kvalitet pr. godkendt opgave før I bruger en offentlig score til et produktionsvalg.
Kilder og kontroltidspunkt
- GPT-6 Astra: resultater og evalueringsnoter · OpenAI · kontrolleret
- Claude Fable 5.1: resultater og forbehold · Anthropic · kontrolleret
- Gemini 3.8 Flash: modelkort, september 2026 (PDF) · Google DeepMind · kontrolleret
- Gemini 3.8 Flash: evalueringsmetode (PDF) · Google DeepMind · kontrolleret
Skal modellerne vurderes på jeres opgave?
Beskriv arbejdsgangen og jeres vigtigste kvalitetskrav. Vi kan afklare rammerne for en afgrænset test og et konkret tilbud.
- Gennemgang af opgave og datagrundlag
- Afklaring af kvalitet, pris og svartid
- Forslag til et overskueligt testforløb

