Hvad betyder Supervised learning?
Ved supervised learning består hvert træningseksempel af input og et kendt ønsket output, ofte kaldet en label. Input kan være tekst, billeder eller tal. Svaret kan være en kategori, som en beskedtype, eller en numerisk størrelse, som et forventet forbrug.
Modellen forsøger at lære en sammenhæng mellem input og facit. Under træningen justeres dens parametre, så afvigelsen fra træningssvarene bliver mindre. Derefter måles kvaliteten på eksempler, som ikke blev brugt til at tilpasse modellen.
Supervised betyder ikke, at et menneske overvåger hver beslutning i drift. Det beskriver træningsgrundlaget. Hvis en person skal godkende senere resultater, er det en særskilt beslutning om arbejdsgangen og systemets tilladelser.
Et brugbart facit er en faglig opgave
To medarbejdere kan kategorisere samme henvendelse forskelligt, fordi kategorierne overlapper eller instruktionen er uklar. Den uenighed bliver ikke løst ved blot at tilføje flere eksempler. Før træning skal teamet beskrive, hvad kategorierne betyder, og hvordan tvivlstilfælde håndteres.
Historiske svar er heller ikke altid det ønskede facit. En gammel proces kan have brugt en standardkategori for at spare tid. Undersøg derfor, hvordan de oprindelige registreringer blev til, før de behandles som sandheden.
Vurdér det, der sker på nye data
Opdel materialet, så den endelige test ligner den opgave, modellen skal møde. Hvis den skal bruges på fremtidige ordrer, kan en tidsbaseret opdeling være mere relevant end et tilfældigt split.
Se kvaliteten for hver vigtig kategori. En model kan have en høj samlet andel rigtige svar og samtidig overse næsten alle sjældne hastehenvendelser. Aftal, hvilke fejl der er dyre, og om usikre tilfælde skal sendes videre til en person.
Et eksempel fra praksis
Et supportteam vil sortere beskeder i levering, retur, produktspørgsmål og andet. Medarbejdere gennemgår et udvalg af gamle beskeder og får afklaret, hvordan blandede spørgsmål skal mærkes. Et separat udvalg gemmes til test.
Modellen prøves først som et forslag ved siden af medarbejderens egen kategorisering. Teamet undersøger især beskeder, der både handler om en forsinket pakke og et ønske om retur. Hvis kategorisystemet ikke kan rumme det, kan løsningen ændres til flere labels eller en tydelig prioriteringsregel, før mere træning gennemføres.
Typiske faldgruber
- Et stort antal forkert mærkede eksempler kan lære modellen en konsekvent forkert sammenhæng.
- Gentagelser af samme sag på tværs af træning og test giver for lette testopgaver.
- En label kan afspejle en gammel arbejdsvane frem for det resultat, virksomheden ønsker fremover.
Det skal I afklare
- Kan fagpersoner blive enige om facit og undtagelser?
- Er der nok eksempler på de sjældne, vigtige situationer?
- Hvem kontrollerer, at nye beskedtyper fortsat passer til kategorierne?
Spørgsmål og svar
Skal alle labels laves manuelt?
Nej. De kan komme fra eksisterende, pålidelige registreringer eller andre processer. Men deres kvalitet og betydning skal undersøges; en automatisk produceret label er ikke automatisk korrekt.
Er klassifikation den eneste mulighed?
Nej. Supervised learning kan både bruges til klassifikation og til regression, hvor modellen forudsiger en numerisk værdi. Træningsmål og evaluering afhænger af den konkrete opgave.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

