Hvad betyder Unsupervised learning?
Unsupervised learning bruges, når data ikke indeholder det svar, modellen skal lære at forudsige. I stedet undersøger en metode eksempelvis, hvilke observationer der ligner hinanden, eller om data kan beskrives med færre dimensioner.
Clustering er en typisk anvendelse: Observationer samles i grupper ud fra en valgt repræsentation og et mål for lighed. Andre metoder kan finde mere kompakte repræsentationer, som gør et komplekst datasæt lettere at analysere.
En fundet struktur er ikke automatisk en vigtig forretningsindsigt. Hvis input især beskriver kundernes ordrestørrelse, vil grupperne ofte afspejle netop den egenskab. Det er mennesker, der skal vurdere, hvad mønstret betyder, og om det er relevant at handle på.
Definitionen af lighed former resultatet
Før analysen skal teamet vælge, hvilke egenskaber der indgår, og hvordan de skaleres. Beløb, antal besøg og tekstbeskrivelser har forskellige betydninger. Hvis én variabel har en langt større numerisk skala, kan den dominere en afstandsbaseret metode.
Sammenlign flere rimelige repræsentationer og se, hvilke mønstre der er stabile. En pæn graf med tydelige grupper er et udgangspunkt for undersøgelse, ikke et bevis på, at markedet består af netop de segmenter.
Brug metoden til at opdage og undersøge
Tilgangen kan hjælpe med at finde temaer i henvendelser, undersøge variation i processer eller opdage observationer, der skiller sig ud. Den er nyttig, når spørgsmålet endnu ikke kan beskrives med et entydigt facit.
Hvis I efterfølgende vil træffe gentagne beslutninger ud fra grupperne, skal beslutningsreglerne testes særskilt. Undersøg blandt andet, om en ny observation kan placeres meningsfuldt, og om grupperne ændrer sig markant fra måned til måned.
Et eksempel fra praksis
En B2B-virksomhed har mange åbne kommentarer fra kundesupport, men et for groft kategorisystem. Et analyseforsøg grupperer kommentarernes tekstlige repræsentationer efter lighed. En medarbejder læser et udsnit fra hver gruppe og giver temaerne foreløbige navne.
En gruppe kan vise sig at handle om fakturering, mens en anden blot indeholder meget korte beskeder uden nok information. Teamet bruger derfor ikke alle grupper som færdige kategorier. De mest sammenhængende temaer bliver grundlag for at forbedre hjælpecenteret og udforme et mere præcist kategorisystem.
Typiske faldgruber
- Klynger kan afspejle datarensning og skalering mere end meningsfulde forskelle.
- Automatisk navngivne grupper kan lyde plausible, selv om de rummer modstridende eksempler.
- Uden facit er det let at vælge den visualisering, der bedst passer til en forventning.
Det skal I afklare
- Hvad betyder lighed for netop de data, I undersøger?
- Har fagpersoner læst konkrete observationer fra hver fundet gruppe?
- Er mønstret stabilt nok til den handling, I overvejer?
Spørgsmål og svar
Kan unsupervised learning bruges uden menneskelig kontrol?
Metoden kræver ikke labels til hvert træningseksempel, men fortolkning og anvendelse kræver stadig faglig vurdering. Grupper er matematiske resultater, ikke automatisk kendte kundebehov.
Hvordan måler man kvalitet uden facit?
Man kan undersøge stabilitet, sammenhæng i grupper og egnethed til en efterfølgende opgave. Et matematisk mål bør kombineres med gennemgang af konkrete observationer og den tilsigtede anvendelse.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

