Gratis værktøjFå en AI-drevet diagnose af dit website på få minutterPrøv AI Site Doctor
Lad os tale
← Udforsk AI-ordbogen
Test & kvalitet

LLM as a judge

En sprogmodel vurderer andre svar efter en rubric; bedømmelsen kræver kontrol for bias, fejl og påvirkning fra svarteksten.

Også kaldet: Modelbaseret bedømmelse · LLM-dommer

Moselstudio · AI-ordbog2 min. læsning
Se mulighederne i jeres virksomhed ↗
En grøn skål står som midtpunkt mellem to forskellige genstande og justeringsgreb.
En model vurderer svar efter en rubrik; metaforen er ikke en uafhængig menneskelig bedømmelse.

Hvad betyder LLM as a judge?

LLM as a judge betyder, at en sprogmodel bruges som bedømmer af tekst eller adfærd. Den kan eksempelvis vurdere, om et kundesvar dækker opgaven, følger en tonevejledning eller understøttes af kilder. Metoden kan gøre det muligt at gennemgå flere eksempler, end et lille team manuelt kan nå.

Bedømmeren har dog ikke automatisk et objektivt facit. Den kan foretrække lange, velformulerede svar, påvirkes af rækkefølgen i en sammenligning eller favorisere bestemte formuleringer. Et sikkert og overbevisende svar kan derfor blive vurderet højt, selv om et vigtigt tal er forkert.

En modeldommer bør behandles som et måleinstrument, der skal afprøves. I skal kende dens kriterier, version, input og fejltyper. Brug den især til velafgrænsede spørgsmål, hvor menneskelige stikprøver kan vise, om den faktisk opdager de fejl, der betyder noget for virksomheden.

Gør vurderingen konkret

Skriv en rubric med observerbare kriterier og tydelige eksempler på bestået og ikke bestået. Spørgsmålet nævner svaret den relevante returfrist er lettere at kontrollere end er svaret godt. Giv bedømmeren de autoritative oplysninger, den skal bruge, og gem dens begrundelse sammen med scoren. Ved parvise sammenligninger kan svarenes rækkefølge byttes i en kontrolrunde. Uenighed mellem runderne viser følsomhed, som et enkelt gennemsnit skjuler.

Hold dommeren adskilt fra materialets instruktioner

Det svar, der vurderes, kan indeholde tekst, som prøver at påvirke bedømmelsen. Behandl det derfor som data, afgræns det tydeligt og test forsøg på at få dommeren til at ignorere kriterierne. Brug lokal kode til kontrollerbare felter, formater og tal frem for at lade modellen gætte. Mennesker bør afgøre tvivlstilfælde og løbende gennemgå både høje og lave scores, så falske godkendelser bliver synlige.

FRA BEGREB TIL ARBEJDSDAG

Et eksempel fra praksis

Illustrativt eksempel: Et forsyningsselskab vil sammenligne to svarskabeloner til driftsforstyrrelser. En modeldommer kontrollerer, om svaret nævner det kendte område, undgår at opfinde en sluttid og forklarer næste opdatering. Kommunikationsmedarbejdere bedømmer et udvalg uden at kende skabelonversionen. Teamet opdager, at dommeren accepterer et høfligt svar med en opdigtet tidsangivelse, og flytter netop tidskontrollen til et eksplicit regelbaseret check før en ny vurderingsrunde.

Typiske faldgruber

  • At kalde en modeldommer uafhængig alene fordi den har et andet modelnavn.
  • At ændre rubric samtidig med den model, der skal sammenlignes.
  • At ignorere ugyldige dommersvar og kun rapportere vellykkede bedømmelser.

Det skal I afklare

  1. Gem dommermodel, rubric, reference og rå bedømmelse.
  2. Sammenlign et blindt udvalg med fagpersoners vurderinger.
  3. Rapportér uenighed, fejl og manglende scores særskilt.

Spørgsmål og svar

Kan en model bedømme sine egne svar?

Det kan den teknisk, men det øger behovet for kontrol med selvpræference og fælles fejl. En anden model fjerner heller ikke automatisk disse problemer.

Er en score fra 1 til 10 præcis?

Den kan være nyttig, hvis skalaens trin er beskrevet og valideret. Uden tydelige ankre er forskellen mellem eksempelvis syv og otte let vilkårlig.

Kilder og videre læsning

De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

  1. Judging LLM-as-a-Judge with MT-Bench and Chatbot ArenaPrimærkilde gennemgået 7. september 2026.
  2. ACL: Best practices for human evaluation of generated textPrimærkilde gennemgået 7. september 2026.
FRA VIDEN TIL JERES NÆSTE SKRIDT

Fra begreb til en løsning, I kan bruge.

Beskriv den opgave, I gerne vil gøre lettere. Vi hjælper med at afklare data, muligheder og et overskueligt første skridt.

  • En personlig vurdering af jeres opgave
  • Afklaring af data, systemer og begrænsninger
  • Et konkret forslag til næste skridt
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Ingen automatisk tilmelding