Hvad betyder Recall?
Recall beskriver en models evne til at finde de tilfælde, man leder efter. Hvis et testmateriale indeholder 40 henvendelser, der kræver hurtig eskalering, og systemet opdager 30, er recall 30 divideret med 40: 75 procent. De ti oversete er falske negative.
Målet er relevant, når det koster at overse noget vigtigt. Det fortæller ikke, hvor mange irrelevante tilfælde der også blev markeret. Et system, der sender alt til eskalering, kan finde alle relevante sager, men samtidig overbelaste medarbejderne. Recall bør derfor vurderes sammen med precision og den praktiske kapacitet til at håndtere fundene.
Et dækkende facit er nødvendigt
For at måle recall skal man kende de relevante tilfælde i det undersøgte materiale, også dem modellen ikke fandt. Det kræver mere end en gennemgang af systemets positive markeringer. Et fagligt vurderet testsæt er derfor centralt. I dokumentudtræk skal det eksempelvis være afklaret, hvilke kontraktfelter der faktisk findes, og hvordan manglende eller tvetydige felter bedømmes. Et ufuldstændigt facit kan få en model til at se bedre eller dårligere ud, end den er. Hold tvivlstilfælde synlige og afklar dem, før modellen sammenlignes med en tidligere version.
Undersøg hvilke tilfælde der mangler
En samlet recall kan skjule systematiske huller. Måske bliver korte mails fundet, mens vedhæftede dokumenter ikke læses. Måske virker løsningen på dansk, men overser engelske formuleringer. Opdel derfor målingen efter de forhold, der kan ændre opgavens sværhedsgrad. Ved en søgefunktion skal man desuden angive, hvor mange resultater der hentes: recall ved fem resultater er noget andet end ved halvtreds. Flere fund kan forbedre dækningen, men også gøre næste trin langsommere eller mere støjfyldt. Brug fejlmønstrene til at forbedre datatilgang og beslutningsregler frem for blot at skrue op for antallet.
Et eksempel fra praksis
En supportafdeling afprøver sortering af henvendelser, der bør undersøges samme dag. To erfarne medarbejdere gennemgår et testudsnit og finder 40 sådanne sager. Modellen markerer 30 af dem. De ti oversete gennemgås særskilt; flere beskriver problemet i et vedhæftet billede. Teamet afprøver billedforståelse eller en manuel regel for denne gruppe. Den næste evaluering inkluderer både tekstsager og billedsager, så forbedringen ikke blot skyldes et lettere testmateriale.
Typiske faldgruber
- At måle recall ud fra kun de sager, modellen allerede har markeret.
- At antage, at høj recall også betyder få falske alarmer.
- At sammenligne tal med forskellige testgrupper, udvælgelsesregler eller antal søgeresultater.
Det skal I afklare
- Lav et facit, som også dækker negative markeringer og oversete relevante tilfælde.
- Gennemgå falske negative efter sprog, format, kategori og datatilgængelighed.
- Rapportér precision og antal sager til manuel behandling sammen med recall.
Spørgsmål og svar
Er recall det samme som sensitivitet?
I binær klassifikation bruges sensitivitet og true positive rate om samme forhold: hvor stor en andel af de faktiske positive tilfælde der findes.
Bør recall altid være 100 procent?
Det kan være et mål for bestemte opgaver, men en løsning kan nå det ved at markere alt. Den nødvendige dækning skal vurderes sammen med falske alarmer og konsekvenserne af fejl.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- scikit-learn: recall_score ↗Definition og sammenfatning på tværs af klasser.
- Google: Accuracy, recall, precision and related metrics ↗Valg af mål ud fra klassefordeling og forskellige fejls konsekvenser.

