AI på dansk: vurder sprog og opgaveløsning systematisk
Datagrundlag og metode
Vi adskiller eksterne sprogevalueringer fra en virksomhedsspecifik dansk skriveprøve. ScandEval-adressen viderestiller nu til EuroEval. Vi har gennemgået projektets primære kilder, men har ikke kopieret et dynamisk leaderboard eller omsat det til egne procenter for naturlighed. Ingen ny dansk benchmarkkørsel er udført til denne side.
Kilder: EuroEval: projekt, datasæt og evalueringskode · EuroEval: europæiske sprogbenchmarks
Hvad kan EuroEval bruges til?
EuroEval giver et offentligt referencepunkt for europæiske sprogmodeller og beskriver evalueringskode og datasæt. Brug den konkrete danske opgave, modelversion og metrik fra projektet. En score på et sprogdatasæt kan ikke uden videre omregnes til, hvor godt en model skriver jeres tilbud, kundesvar eller produkttekster.
Kilder: EuroEval: projekt, datasæt og evalueringskode · EuroEval: europæiske sprogbenchmarks
Byg et dansk testsæt fra virkelige opgaver
Udvælg anonymiserede eksempler på kundesvar, omskrivning, forklaring og opsummering. Medtag tvetydighed, lokale begreber og manglende oplysninger. Lav kriterierne før svarene genereres, og hold udviklingseksempler adskilt fra det endelige testsæt.
- Naturlighed: ordstilling, idiomatik og tone uden oversættelsespræg.
- Korrekthed: grammatik, sammensatte ord og terminologi.
- Opgaveløsning: alle krav besvares uden opdigtede fakta.
- Kontekst: svaret passer til modtager, situation og virksomhed.
- Redigering: arbejde før svaret kan godkendes.
En LLM-dommer er et hjælpemiddel
Skjul modellabels og bland rækkefølgen ved menneskelig bedømmelse. Brug gerne to bedømmere på en stikprøve og gennemgå uenigheder. Hvis en model scorer svarene, skal dens ID og instruktioner gemmes. Den kan favorisere sin egen stil eller overse faglige fejl; den er ikke en uafhængig facitliste.
Sprogskriptet i kodebasen er et pilotværktøj med modelbaseret dommer. Output kræver menneskelig kontrol og en dokumenteret kørsel før offentliggørelse.
Det kan du ikke udlede af siden
- Der er ikke grundlag for at udpege en dansk vinder blandt katalogets aktuelle modeller.
- Tidligere kvalificerede estimater er ikke målinger og må ikke genbruges som sådan.
- Modelbaserede bedømmelser og små testsæt kan være skæve; vis antal, bedømmere og fejltyper.
Sådan bruger I det i en beslutning
Det bedste danske svar er det, jeres fagperson kan godkende med mindst efterarbejde og uden indholdsfejl. Mål det direkte.
Kilder og kontroltidspunkt
- EuroEval: projekt, datasæt og evalueringskode · EuroEval · kontrolleret
- EuroEval: europæiske sprogbenchmarks · EuroEval · kontrolleret
Skal modellerne vurderes på jeres opgave?
Beskriv arbejdsgangen og jeres vigtigste kvalitetskrav. Vi kan afklare rammerne for en afgrænset test og et konkret tilbud. Samtalen er uforpligtende.
- Gennemgang af opgave og datagrundlag
- Afklaring af kvalitet, pris og svartid
- Forslag til et overskueligt testforløb

