Gratis værktøjFå en AI-drevet diagnose af dit website på få minutterPrøv AI Site Doctor
Lad os tale
← Udforsk AI-ordbogen
AI & machine learning

Clustering

Clustering grupperer observationer efter lighed uden et facit til hver gruppe, eksempelvis kunder med lignende købsmønstre eller dokumenter med beslægtede emner.

Også kaldet: Klyngeanalyse · Cluster analysis

Moselstudio · AI-ordbog2 min. læsning
Se mulighederne i jeres virksomhed ↗
Kugler med forskellige farver og materialer ligger i små klynger på en rund plade.
Nære og lignende eksempler samles i grupper.

Hvad betyder Clustering?

Clustering er metoder til at finde grupper i data. I modsætning til supervised klassifikation får modellen ikke nødvendigvis en på forhånd defineret korrekt kategori for hver observation. Den søger struktur ud fra den repræsentation og det lighedsmål, der er valgt.

En klynge er derfor ikke en objektiv sandhed om en kunde eller et dokument. To analyser kan give forskellige grupper, hvis de bruger forskellige input, afstandsmål eller algoritmer. En opdeling efter købshyppighed og ordrestørrelse fortæller noget andet end en opdeling efter produktinteresse.

Metoden kan bruges til at udforske mønstre, finde gentagne temaer og forberede en faglig gennemgang. Grupperne skal fortolkes og vurderes, før de bliver grundlag for kommunikation, prioritering eller andre handlinger.

Det afgørende valg er, hvad der betyder 'ligner'

Numeriske data kan kræve skalering, så et felt med store tal ikke dominerer afstandsberegningen. Tekst kan repræsenteres med embeddings, hvor lighed afspejler mønstre i modellens repræsentation. Repræsentationen bestemmer, hvilke forskelle algoritmen kan arbejde med.

K-means, hierarkisk clustering og tæthedsbaserede metoder har forskellige antagelser. Nogle kræver et valgt antal grupper, mens andre kan markere observationer som støj. Algoritmen bør vælges efter data og formålet med analysen.

Vurder stabilitet og praktisk mening

En intern clustering-score fortæller noget om strukturen under et bestemt afstandsmål, men ikke nødvendigvis om grupperne er nyttige. Gennemgå eksempler fra hver gruppe, herunder grænsetilfælde, og undersøg om opdelingen ændrer sig markant ved små ændringer i data.

Navngiv grupperne efter observerede mønstre. Undgå at tilskrive kunder motiver, økonomi eller andre egenskaber, som data ikke dokumenterer. Et segment skal være anvendeligt i den konkrete arbejdsgang og kunne forklares med relevante input.

FRA BEGREB TIL ARBEJDSDAG

Et eksempel fra praksis

Forestil jer et supportteam, der vil forstå, hvilke problemer der fylder i årets henvendelser. Beskederne grupperes efter tekstlig lighed, og en medarbejder gennemgår et udvalg fra hver gruppe.

Nogle grupper viser sig at være konkrete problemer med en integration; andre skyldes blot en fælles standardsignatur. Teamet renser derfor irrelevante tekstdele og gentager analysen. Resultatet bruges til at prioritere hjælpesider efter dokumenterede temaer, ikke som en automatisk konklusion om hver kundes hensigt.

Typiske faldgruber

  • Grupper kan afspejle databehandling eller standardskabeloner frem for det ønskede emne.
  • Et valgt antal klynger kan tvinge en struktur frem, som ikke er særlig meningsfuld.
  • En velklingende segmenttitel kan påstå mere om personerne end data understøtter.

Det skal I afklare

  1. Hvilke felter eller repræsentationer definerer ligheden?
  2. Er grupperne stabile og forståelige ved manuel gennemgang?
  3. Hvilken konkret beslutning skal analysen hjælpe med?

Spørgsmål og svar

Er clustering det samme som segmentering?

Clustering kan bruges som en metode til segmentering. Segmenter kan også defineres med forretningsregler eller faglige kriterier. En algoritmisk gruppe bliver først et anvendeligt segment efter fortolkning.

Hvordan ved vi, hvor mange grupper der skal være?

Det afhænger af metode og formål. Undersøg flere løsninger med både tekniske mål og faglig gennemgang. Det antal, der giver den pæneste figur, er ikke nødvendigvis det mest brugbare.

Kilder og videre læsning

De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

  1. scikit-learn: ClusteringAlgoritmer, antagelser og mål til klyngeanalyse.
  2. Google: What is Machine Learning?Unsupervised learning og gruppering uden individuelle facit.
FRA VIDEN TIL JERES NÆSTE SKRIDT

Fra begreb til en løsning, I kan bruge.

Beskriv den opgave, I gerne vil gøre lettere. Vi hjælper med at afklare data, muligheder og et overskueligt første skridt.

  • En personlig vurdering af jeres opgave
  • Afklaring af data, systemer og begrænsninger
  • Et konkret forslag til næste skridt
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Ingen automatisk tilmelding