Gratis værktøjFå en AI-drevet diagnose af dit website på få minutterPrøv AI Site Doctor
Lad os tale
← Udforsk AI-ordbogen
Test & kvalitet

ROC-AUC

ROC-AUC måler, hvor godt en model rangerer positive tilfælde over negative på tværs af tærskler. Det er ikke andelen af korrekte beslutninger.

Moselstudio · AI-ordbog2 min. læsning
Se mulighederne i jeres virksomhed ↗
En halvcirkelformet grøn måler har flere radiale linjer og en messingviser.
Skiftende vurderingsgrænser illustreres som en måling over flere indstillinger.

Hvad betyder ROC-AUC?

ROC-AUC er arealet under en ROC-kurve, som sammenholder andelen af fundne positive tilfælde med andelen af falske positive ved forskellige scoretærskler. Målet bruges blandt andet til at sammenligne modeller, der giver en løbende score frem for kun et ja eller nej.

For en binær model kan AUC fortolkes som sandsynligheden for, at et tilfældigt positivt eksempel får en højere score end et tilfældigt negativt; ens scores tæller med halv vægt. En værdi på 0,5 svarer til tilfældig rangering i denne forstand. AUC fortæller ikke, hvilken tærskel virksomheden bør bruge i praksis.

Bevar scores under evalueringen

En model kan give hver sag en score, hvorefter en tærskel afgør, hvilke sager der behandles som positive. ROC-kurven viser, hvordan resultaterne ændres, når tærsklen flyttes. Hvis man kun gemmer modellens endelige ja eller nej, mister man meget af den information, beregningen skal bruge. Gem derfor score, faktisk udfald og den anvendte modelversion i et passende testdatasæt. Vær også tydelig om, hvilken klasse en høj score betyder. En omvendt fortolkning af scoren kan få en brugbar rangering til at ligne et dårligt resultat.

Undersøg det område, I faktisk vil anvende

To modeller kan have lignende samlet AUC, men være forskellige i det område, hvor virksomheden kan acceptere få falske alarmer. Se derfor på kurven og den konkrete tærskel, ikke kun arealet. Hvis positive tilfælde er sjældne, er en precision-recall-kurve ofte en nyttig supplerende visning. Oversæt resultatet til antal sager, som medarbejderne skal gennemgå. ROC-AUC måler desuden rangering, ikke om en score på 0,8 svarer til 80 procents sandsynlighed. Den egenskab kræver en særskilt kontrol af kalibrering. En flot kurve fritager dermed ikke løsningen for praktisk afprøvning.

FRA BEGREB TIL ARBEJDSDAG

Et eksempel fra praksis

Et salgsteam vil prioritere en indbakke med mange henvendelser. To modeller sammenlignes på det samme gennemgåede testmateriale. Den ene har lidt højere AUC, men teamet kan kun nå at behandle de øverste 30 sager om dagen. De undersøger derfor også, hvor mange reelt relevante henvendelser hver model placerer i denne gruppe. Valget afhænger af kvaliteten ved den faktiske kapacitet og af de oversete muligheder, ikke blot af den højeste samlede rangeringsevne.

Typiske faldgruber

  • At læse AUC på 0,9 som 90 procent korrekte afgørelser.
  • At beregne målet fra hårde klassifikationer, selv om de oprindelige scores er tilgængelige.
  • At vælge model uden at undersøge tærsklen og arbejdsmængden i den konkrete proces.

Det skal I afklare

  1. Gem scores og facit for samme repræsentative testmateriale.
  2. Vis ROC-kurve, valgt tærskel og de tilhørende fejlantal.
  3. Supplér med precision-recall og kalibrering, når opgaven kræver det.

Spørgsmål og svar

Kræver ROC-AUC sandsynligheder?

Nej. En konsistent rangordnende score kan være tilstrækkelig. Scoren skal have den rigtige retning, og beregningen skal passe til opgavens klasseopdeling.

Er AUC på 1 en garanti for drift?

Nej. Det beskriver rangeringen på det testede materiale. Nye datatyper, uklare labels eller en uhensigtsmæssig beslutningstærskel kan stadig give problemer i den virkelige arbejdsgang.

Kilder og videre læsning

De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

  1. scikit-learn: roc_auc_scoreROC-AUC beregnet ud fra scores frem for kun valgte klasser.
  2. Google: ROC and AUCRangering, tærskler og precision-recall-kurver.
FRA VIDEN TIL JERES NÆSTE SKRIDT

Fra begreb til en løsning, I kan bruge.

Beskriv den opgave, I gerne vil gøre lettere. Vi hjælper med at afklare data, muligheder og et overskueligt første skridt.

  • En personlig vurdering af jeres opgave
  • Afklaring af data, systemer og begrænsninger
  • Et konkret forslag til næste skridt
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Ingen automatisk tilmelding