Hvad betyder Klasseubalance?
Class imbalance opstår, når kategorierne i en klassifikationsopgave har meget forskellige størrelser. En fejltype kan eksempelvis være sjælden blandt mange normale produkter. En model kan da opnå høj samlet korrekthed uden at være god til den sjældne kategori.
Fordelingen er ikke nødvendigvis en fejl i data. Den kan afspejle virkeligheden. Problemet opstår, hvis træning og evaluering ikke tager højde for, hvad det koster at overse et sjældent tilfælde eller markere et normalt tilfælde forkert.
Mulige tiltag omfatter ændrede vægte, sampling, andre kvalitetsmål eller en justeret tærskel. Metoderne har forskellige konsekvenser og bør sammenlignes på et testsæt, der repræsenterer anvendelsen. At gøre træningssættet mere balanceret gør ikke automatisk driften balanceret.
Se ud over samlet korrekthed
Precision viser, hvor stor en andel af de positive markeringer der faktisk er positive. Recall viser, hvor mange af de faktiske positive tilfælde systemet finder. Begge mål er nyttige, når et flertal ellers dominerer den samlede score.
Gennemgå også fejlene konkret. En lille ændring i tærsklen kan skabe mange ekstra alarmer, hvis der er meget mange negative observationer. Afdelingens kapacitet til opfølgning er derfor en del af kvalitetsvurderingen.
Bevar en realistisk evaluering
Oversampling kan øge minoritetsklassens vægt i træningen, mens undersampling reducerer flertallet. Man kan også lade tabsfunktionen vægte bestemte fejl højere. Hvilken tilgang der hjælper, afhænger af data og model.
Udfør sampling inden for træningsprocessen og undgå at sprede kopier mellem træning og test. Evaluer den endelige løsning under en relevant klassefordeling, så antallet af forventede fejl og alarmer ikke bliver misvisende.
Et eksempel fra praksis
Forestil jer et team, der vil markere dokumenter med manglende obligatoriske felter. Langt de fleste dokumenter er korrekte, så en model, der altid siger 'godkendt', kan få en høj samlet score.
Piloten vurderer derfor særskilt, hvor mange mangelfulde dokumenter der bliver overset, og hvor mange korrekte dokumenter der sendes til kontrol. Teamet vælger en tærskel ud fra fejlomkostning og reviewkapacitet. Resultatet præsenteres med den faktiske fordeling i testmaterialet, så læseren kan forstå, hvad tallene betyder.
Typiske faldgruber
- Høj accuracy kan skjule, at den sjældne klasse næsten aldrig bliver fundet.
- Sampling før datasplit kan sprede gentagelser ind i testen.
- En tærskel valgt på et kunstigt balanceret sæt kan give en uventet alarmmængde i drift.
Det skal I afklare
- Hvor ofte forekommer hver kategori i den faktiske arbejdsgang?
- Hvilke fejltyper er vigtigst, og hvilke mål viser dem?
- Er træningsændringerne vurderet på et realistisk og uafhængigt testsæt?
Spørgsmål og svar
Skal vi altid balancere datasættet?
Nej. Skævhed kan være en reel egenskab ved opgaven. Vælg metode ud fra kvalitet og fejlomkostning, og bevar en realistisk evaluering.
Kan flere minoritetseksempler hjælpe?
Ja, især hvis de tilfører relevant variation. Kopier af de samme få observationer giver ikke nødvendigvis bedre dækning af de sjældne situationer.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- Google: Class-imbalanced datasets ↗Skæv fordeling, sampling og vægtning.
- Google: Classification ↗Tærskler og evaluering med forskellige fejltyper.

