Hvad betyder ROC-AUC?
ROC-AUC er arealet under en ROC-kurve, som sammenholder andelen af fundne positive tilfælde med andelen af falske positive ved forskellige scoretærskler. Målet bruges blandt andet til at sammenligne modeller, der giver en løbende score frem for kun et ja eller nej.
For en binær model kan AUC fortolkes som sandsynligheden for, at et tilfældigt positivt eksempel får en højere score end et tilfældigt negativt; ens scores tæller med halv vægt. En værdi på 0,5 svarer til tilfældig rangering i denne forstand. AUC fortæller ikke, hvilken tærskel virksomheden bør bruge i praksis.
Bevar scores under evalueringen
En model kan give hver sag en score, hvorefter en tærskel afgør, hvilke sager der behandles som positive. ROC-kurven viser, hvordan resultaterne ændres, når tærsklen flyttes. Hvis man kun gemmer modellens endelige ja eller nej, mister man meget af den information, beregningen skal bruge. Gem derfor score, faktisk udfald og den anvendte modelversion i et passende testdatasæt. Vær også tydelig om, hvilken klasse en høj score betyder. En omvendt fortolkning af scoren kan få en brugbar rangering til at ligne et dårligt resultat.
Undersøg det område, I faktisk vil anvende
To modeller kan have lignende samlet AUC, men være forskellige i det område, hvor virksomheden kan acceptere få falske alarmer. Se derfor på kurven og den konkrete tærskel, ikke kun arealet. Hvis positive tilfælde er sjældne, er en precision-recall-kurve ofte en nyttig supplerende visning. Oversæt resultatet til antal sager, som medarbejderne skal gennemgå. ROC-AUC måler desuden rangering, ikke om en score på 0,8 svarer til 80 procents sandsynlighed. Den egenskab kræver en særskilt kontrol af kalibrering. En flot kurve fritager dermed ikke løsningen for praktisk afprøvning.
Et eksempel fra praksis
Et salgsteam vil prioritere en indbakke med mange henvendelser. To modeller sammenlignes på det samme gennemgåede testmateriale. Den ene har lidt højere AUC, men teamet kan kun nå at behandle de øverste 30 sager om dagen. De undersøger derfor også, hvor mange reelt relevante henvendelser hver model placerer i denne gruppe. Valget afhænger af kvaliteten ved den faktiske kapacitet og af de oversete muligheder, ikke blot af den højeste samlede rangeringsevne.
Typiske faldgruber
- At læse AUC på 0,9 som 90 procent korrekte afgørelser.
- At beregne målet fra hårde klassifikationer, selv om de oprindelige scores er tilgængelige.
- At vælge model uden at undersøge tærsklen og arbejdsmængden i den konkrete proces.
Det skal I afklare
- Gem scores og facit for samme repræsentative testmateriale.
- Vis ROC-kurve, valgt tærskel og de tilhørende fejlantal.
- Supplér med precision-recall og kalibrering, når opgaven kræver det.
Spørgsmål og svar
Kræver ROC-AUC sandsynligheder?
Nej. En konsistent rangordnende score kan være tilstrækkelig. Scoren skal have den rigtige retning, og beregningen skal passe til opgavens klasseopdeling.
Er AUC på 1 en garanti for drift?
Nej. Det beskriver rangeringen på det testede materiale. Nye datatyper, uklare labels eller en uhensigtsmæssig beslutningstærskel kan stadig give problemer i den virkelige arbejdsgang.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- scikit-learn: roc_auc_score ↗ROC-AUC beregnet ud fra scores frem for kun valgte klasser.
- Google: ROC and AUC ↗Rangering, tærskler og precision-recall-kurver.

