Hvad betyder F1-score?
F1-score er det harmoniske gennemsnit af precision og recall. Formlen er to gange precision gange recall divideret med summen af de to. Hvis precision er 80 procent og recall 50 procent, bliver F1 cirka 61,5 procent. Det almindelige gennemsnit på 65 procent er altså ikke F1.
Målet kan hjælpe med at sammenligne klassifikationsmodeller, når både falske positive og falske negative er væsentlige. Men det vælger ikke automatisk den bedste forretningsløsning. En overset hastehenvendelse og en unødvendig manuel gennemgang kan have meget forskellig betydning, selv om begge påvirker opgørelsen.
Et samlet mål med synlige komponenter
F1 belønner, at både precision og recall er rimelige, og straffer en stor ubalance mellem dem. Det er nyttigt, når én model finder få meget sikre tilfælde, mens en anden finder flere, men også flere forkerte. Vis stadig begge delmål ved siden af F1. To løsninger kan have samme F1 med forskellige fejlprofiler. Hvis én fejltype er væsentligt dyrere, kan et vægtet F-mål eller en direkte omkostningsmodel være mere passende. Beslutningen bør tage udgangspunkt i den efterfølgende handling og ikke i, hvilket mål et værktøj viser som standard.
Fortæl hvordan flere kategorier er samlet
Når en model sorterer i flere kategorier, kan F1 beregnes pr. kategori og sammenfattes på forskellige måder. Macro giver kategorierne lige vægt. Et vægtet gennemsnit tager hensyn til, hvor mange eksempler hver kategori indeholder. Micro samler de relevante optællinger før beregningen. De tal besvarer forskellige spørgsmål. Hvis en vigtig kategori er sjælden, kan et vægtet gennemsnit skjule svag kvalitet netop der. Rapportér derfor kategoriernes resultater og antal. Fasthold også samme beregningsmåde gennem evalueringen, så en ændring i rapporten ikke ligner en forbedring af modellen.
Et eksempel fra praksis
En virksomhed sorterer dokumenter i faktura, kreditnota og øvrigt. I et tænkt testforløb får en model høj samlet F1, men klassificerer flere kreditnotaer som fakturaer. Da denne fejl kan sende et dokument til en forkert arbejdsgang, undersøger teamet kreditnotaer særskilt. De opstiller et minimumskrav for denne kategori og lader usikre dokumenter gå til kontrol. Modellens samlede score bruges fortsat til overblik, mens kategorikravet afgør, om løsningen kan anvendes til det konkrete trin.
Typiske faldgruber
- At bruge et almindeligt gennemsnit af precision og recall og kalde det F1.
- At sammenligne macro-F1 med vægtet F1 som om de var samme opgørelse.
- At vælge model alene efter F1 uden at vurdere de konkrete fejltyper.
Det skal I afklare
- Vis precision, recall, F1 og antal eksempler for de væsentlige kategorier.
- Angiv positiv klasse, gennemsnitsmetode og håndtering af kategorier uden fund.
- Vurdér om fejlomkostninger kræver særskilte minimumskrav eller et andet mål.
Spørgsmål og svar
Tager F1 højde for korrekte negative svar?
Ikke direkte. Den binære formel bygger på sande positive, falske positive og falske negative. Derfor kan F1 ikke alene beskrive hele forvekslingsmatricen.
Kan en højere F1 give en dårligere arbejdsgang?
Ja. Hvis forbedringen medfører flere af den fejltype, virksomheden har sværest ved at håndtere, kan det samlede tal stige, mens den praktiske løsning bliver mindre egnet.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- scikit-learn: f1_score ↗Harmonisk gennemsnit og valg af macro, micro eller vægtet opgørelse.
- Google: Accuracy, recall, precision and related metrics ↗Valg af mål ud fra klassefordeling og forskellige fejls konsekvenser.

