Hvad betyder Accuracy?
Accuracy fortæller, hvor ofte en model har valgt den korrekte kategori i et testmateriale. Hvis 180 af 200 dokumenter bliver klassificeret korrekt, er accuracy 90 procent. Både korrekte positive og korrekte negative klassifikationer tæller med.
Det enkle tal er let at kommunikere, men kan være misvisende. Hvis 95 procent af henvendelserne er almindelige og fem procent er kritiske, kan en model få 95 procent accuracy ved altid at svare almindelig. Den finder da ingen kritiske sager. Derfor er en høj procent alene ikke et tilstrækkeligt grundlag for at sætte en AI-løsning i drift.
Sammenlign med et enkelt udgangspunkt
Før accuracy bruges som succeskriterium, bør teamet beregne, hvad en meget simpel regel ville opnå. Det kan være altid at vælge den hyppigste kategori eller at bruge den eksisterende sorteringsregel. En model skal skabe relevant værdi ud over dette udgangspunkt. Se derefter på forvekslingsmatricen og de vigtigste kategoriers precision og recall. Hvis opgaven har meget ulige fejlomkostninger, skal kvalitetskravene afspejle det. En samlet score vægter normalt hvert eksempel ens, selv om virksomheden bruger meget forskellig tid på at rette de forskellige fejl.
Beskriv hvad der tæller som et korrekt resultat
Accuracy kræver en entydig sammenligning mellem forudsigelse og facit. Ved dokumentklassifikation kan det være én kategori. Ved en opgave med flere etiketter skal man beslutte, om alle etiketter skal være rigtige samtidig, eller om de bedømmes hver for sig. For frie AI-svar er et ordret match sjældent en tilstrækkelig kvalitetsdefinition. Et korrekt svar kan være formuleret anderledes, og et tilsyneladende rigtigt svar kan mangle en væsentlig betingelse. Fasthold derfor en passende vurderingsregel og et uafhængigt testsæt, som ikke bruges til løbende at tilpasse løsningen.
Et eksempel fra praksis
En intern assistent foreslår afdeling for indkomne sager. En leverandør viser i et tænkt eksempel 94 procent accuracy. Virksomheden undersøger testfordelingen og ser, at de fleste sager tilhører én afdeling. En simpel regel opnår allerede 91 procent. Teamet beder derfor om resultater for mindre afdelinger og ser på antallet af fejlroutede sager, som kræver genbehandling. Beslutningen bygger på den målbare forbedring i arbejdet og de svage kategorier, ikke alene på tallet 94.
Typiske faldgruber
- At sammenligne accuracy på datasæt med forskellige kategoriandele og sværhedsgrader.
- At kalde et ordret tekstmatch for en generel måling af svarenes kvalitet.
- At bruge et testmateriale, som løsningen er blevet tilpasset til gennem mange forsøg.
Det skal I afklare
- Vis teststørrelse, klassefordeling og resultatet fra en enkel sammenligningsregel.
- Definér korrekthed og vurder usikre eller flertydige eksempler konsekvent.
- Supplér med relevante kategoriresultater og konsekvensen af de hyppigste fejl.
Spørgsmål og svar
Er accuracy og precision det samme?
Nej. Accuracy tæller alle korrekte klassifikationer. Precision ser kun på de tilfælde, modellen har kaldt positive, og måler hvor mange af disse der faktisk er positive.
Kan accuracy stadig være nyttig?
Ja. Den er et godt overblik for veldefinerede opgaver, især når klasser og fejlomkostninger er nogenlunde sammenlignelige. Den bør stadig ledsages af en mere detaljeret fejloversigt.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- scikit-learn: accuracy_score ↗Andel korrekte klassifikationer og præcise match i multilabel-opgaver.
- Google: Accuracy, recall, precision and related metrics ↗Valg af mål ud fra klassefordeling og forskellige fejls konsekvenser.

