Hvad betyder NDCG?
NDCG bruges, når søgeresultater kan være relevante i forskellig grad. Et dokument kan give det præcise svar, mens et andet kun giver baggrund. Metrikken gør forskellen synlig og tager samtidig højde for, at brugeren eller en efterfølgende model typisk møder de øverste resultater først.
Forkortelsen står for Normalized Discounted Cumulative Gain. Først tildeles resultaterne relevansværdier. Deres bidrag reduceres med placeringen, og den samlede værdi normaliseres mod den bedst mulige rækkefølge for samme spørgsmål. Med ikke-negative relevansværdier ligger den sædvanlige score mellem nul og én, hvor én svarer til den ideelle rangering.
NDCG@10 vurderer kun de første ti resultater. Den siger ikke, om resten af dokumentarkivet er korrekt indekseret, eller om en chatbot formulerer et sandt svar. Den er derimod nyttig, når I skal afgøre, om en ændret søgestrategi eller reranker prioriterer de bedste kilder bedre.
Aftal, hvad et godt resultat betyder
Lav en enkel relevansskala med eksempler, eksempelvis irrelevant, delvist nyttigt og direkte svar. Bedøm dokumenterne uden at vise, hvilken søgeversion der fandt dem. En skala skal bruges konsekvent; ellers kan en ny bedømmer flytte scoren mere end en teknisk forbedring. Angiv også, om gain beregnes direkte fra relevansværdien eller med en anden transformation. Biblioteker kan bruge forskellige konventioner, som påvirker sammenligneligheden.
Se resultaterne fordelt på opgaver
Et samlet gennemsnit kan skjule, at søgning efter varenummer forbedres, mens beskrivende spørgsmål bliver dårligere. Del derfor rapporten op efter centrale søgebehov. Håndtér spørgsmål uden relevante dokumenter efter en dokumenteret regel; deres ideelle gain er nul. Undersøg også ubedømte dokumenter, da et nyt og faktisk godt resultat ellers kan blive behandlet som irrelevant alene, fordi det mangler et relevansmærke.
Et eksempel fra praksis
Illustrativt eksempel: En byggematerialeleverandør har et søgefelt til tekniske dokumenter. Ved spørgsmålet om montage i vådrum vurderes den gældende montagevejledning som mest værdifuld, produktbladet som delvist relevant og en gammel kampagne som irrelevant. En reranker flytter montagevejledningen op foran kampagnen. Teamet bruger NDCG på en fast samling spørgsmål og læser samtidig de resultater, hvor ændringen forværrer placeringen. De har dermed et konkret grundlag for at godkende eller afvise justeringen.
Typiske faldgruber
- At sammenligne NDCG@5 med NDCG@20 som samme måling.
- At behandle ubedømte dokumenter som dokumenteret irrelevante.
- At bruge klik som facit uden at tage højde for placeringens effekt.
Det skal I afklare
- Gem relevansskala, cutoff og beregningsvariant.
- Bedøm nye dokumenter, som kun én søgeversion finder.
- Vis ændringer pr. søgebehov sammen med gennemsnittet.
Spørgsmål og svar
Hvordan adskiller NDCG sig fra MRR?
MRR ser på placeringen af det første relevante resultat. NDCG kan vurdere flere resultater og grader af relevans, hvilket passer bedre til opgaver med flere nyttige kilder.
Er en score på 0,9 et universelt kvalitetskrav?
Nej. Tallet afhænger af datasæt, relevansmærker, cutoff og beregning. Sammenlign primært systemversioner på samme dokumenter og spørgsmål.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- scikit-learn: ndcg_score ↗Primærkilde gennemgået 7. september 2026.
- Stanford: Evaluation of ranked retrieval results ↗Primærkilde gennemgået 7. september 2026.

