Gratis værktøjFå en AI-drevet diagnose af dit website på få minutterPrøv AI Site Doctor
Lad os tale
← Udforsk AI-ordbogen
Test & kvalitet

F1-score

F1-score sammenfatter precision og recall i ét tal, som bliver lavt, hvis systemet enten finder for få relevante tilfælde eller laver mange falske fund.

Moselstudio · AI-ordbog2 min. læsning
Se mulighederne i jeres virksomhed ↗
En trævægt balancerer to skåle over en opdelt samling kugler.
Afvejningen er en metafor for at kombinere precision og recall i ét mål.

Hvad betyder F1-score?

F1-score er det harmoniske gennemsnit af precision og recall. Formlen er to gange precision gange recall divideret med summen af de to. Hvis precision er 80 procent og recall 50 procent, bliver F1 cirka 61,5 procent. Det almindelige gennemsnit på 65 procent er altså ikke F1.

Målet kan hjælpe med at sammenligne klassifikationsmodeller, når både falske positive og falske negative er væsentlige. Men det vælger ikke automatisk den bedste forretningsløsning. En overset hastehenvendelse og en unødvendig manuel gennemgang kan have meget forskellig betydning, selv om begge påvirker opgørelsen.

Et samlet mål med synlige komponenter

F1 belønner, at både precision og recall er rimelige, og straffer en stor ubalance mellem dem. Det er nyttigt, når én model finder få meget sikre tilfælde, mens en anden finder flere, men også flere forkerte. Vis stadig begge delmål ved siden af F1. To løsninger kan have samme F1 med forskellige fejlprofiler. Hvis én fejltype er væsentligt dyrere, kan et vægtet F-mål eller en direkte omkostningsmodel være mere passende. Beslutningen bør tage udgangspunkt i den efterfølgende handling og ikke i, hvilket mål et værktøj viser som standard.

Fortæl hvordan flere kategorier er samlet

Når en model sorterer i flere kategorier, kan F1 beregnes pr. kategori og sammenfattes på forskellige måder. Macro giver kategorierne lige vægt. Et vægtet gennemsnit tager hensyn til, hvor mange eksempler hver kategori indeholder. Micro samler de relevante optællinger før beregningen. De tal besvarer forskellige spørgsmål. Hvis en vigtig kategori er sjælden, kan et vægtet gennemsnit skjule svag kvalitet netop der. Rapportér derfor kategoriernes resultater og antal. Fasthold også samme beregningsmåde gennem evalueringen, så en ændring i rapporten ikke ligner en forbedring af modellen.

FRA BEGREB TIL ARBEJDSDAG

Et eksempel fra praksis

En virksomhed sorterer dokumenter i faktura, kreditnota og øvrigt. I et tænkt testforløb får en model høj samlet F1, men klassificerer flere kreditnotaer som fakturaer. Da denne fejl kan sende et dokument til en forkert arbejdsgang, undersøger teamet kreditnotaer særskilt. De opstiller et minimumskrav for denne kategori og lader usikre dokumenter gå til kontrol. Modellens samlede score bruges fortsat til overblik, mens kategorikravet afgør, om løsningen kan anvendes til det konkrete trin.

Typiske faldgruber

  • At bruge et almindeligt gennemsnit af precision og recall og kalde det F1.
  • At sammenligne macro-F1 med vægtet F1 som om de var samme opgørelse.
  • At vælge model alene efter F1 uden at vurdere de konkrete fejltyper.

Det skal I afklare

  1. Vis precision, recall, F1 og antal eksempler for de væsentlige kategorier.
  2. Angiv positiv klasse, gennemsnitsmetode og håndtering af kategorier uden fund.
  3. Vurdér om fejlomkostninger kræver særskilte minimumskrav eller et andet mål.

Spørgsmål og svar

Tager F1 højde for korrekte negative svar?

Ikke direkte. Den binære formel bygger på sande positive, falske positive og falske negative. Derfor kan F1 ikke alene beskrive hele forvekslingsmatricen.

Kan en højere F1 give en dårligere arbejdsgang?

Ja. Hvis forbedringen medfører flere af den fejltype, virksomheden har sværest ved at håndtere, kan det samlede tal stige, mens den praktiske løsning bliver mindre egnet.

Kilder og videre læsning

De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

  1. scikit-learn: f1_scoreHarmonisk gennemsnit og valg af macro, micro eller vægtet opgørelse.
  2. Google: Accuracy, recall, precision and related metricsValg af mål ud fra klassefordeling og forskellige fejls konsekvenser.
FRA VIDEN TIL JERES NÆSTE SKRIDT

Fra begreb til en løsning, I kan bruge.

Beskriv den opgave, I gerne vil gøre lettere. Vi hjælper med at afklare data, muligheder og et overskueligt første skridt.

  • En personlig vurdering af jeres opgave
  • Afklaring af data, systemer og begrænsninger
  • Et konkret forslag til næste skridt
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Ingen automatisk tilmelding