Hvad betyder Semi-supervised learning?
Semi-supervised learning er relevant, når det er dyrt at skaffe facit, men der findes mange umærkede observationer. Metoden forsøger at udnytte både de sikre, mærkede eksempler og strukturen i det øvrige materiale.
En tilgang er self-training: En model trænes først på de mærkede data. Den producerer derefter foreløbige labels for udvalgte umærkede eksempler, som bruges i en ny træningsrunde. Andre tilgange udbreder labels mellem observationer, der vurderes at ligge tæt på hinanden.
Den mulige fordel afhænger af antagelser om data. Lignende observationer skal eksempelvis ofte høre til samme kategori. Hvis den antagelse er forkert, kan de ekstra data forstærke fejl i stedet for at hjælpe.
Et lille facit skal stadig være repræsentativt
De første mærkede eksempler bestemmer, hvad modellen overhovedet har mulighed for at lære. Et udvalg, der kun indeholder lette og almindelige situationer, giver et skævt udgangspunkt. Medtag derfor variation og tvivlstilfælde, som afspejler den faktiske opgave.
Beslut også, hvornår en automatisk foreslået label er sikker nok til at blive brugt. En models egen sikkerhed kan være dårligt kalibreret. Stikprøver og et uafhængigt testsæt er nødvendige for at opdage, om fejlen spreder sig.
Vælg metoden, når mærkning er flaskehalsen
Tilgangen er et muligt valg, hvis datamængden er stor, labels er knappe, og der findes en fornuftig sammenhæng mellem de to dele. Den er mindre oplagt, hvis de umærkede data kommer fra en anden målgruppe eller et andet system.
Sammenlign med at få mærket et lidt større, velvalgt datasæt. Den løsning kan være enklere at forstå og vedligeholde. Mere avanceret træning er kun nyttig, hvis den giver en reel fordel på nye, repræsentative eksempler.
Et eksempel fra praksis
En virksomhed vil sortere tekniske supportbeskeder. Et mindre udvalg er kategoriseret af specialister, mens resten af arkivet mangler labels. En pilot bruger de sikre eksempler til at finde flere mulige eksempler på de samme kategorier.
Specialister kontrollerer især automatisk mærkede beskeder om sjældne produktfejl. Hvis modellen konsekvent placerer dem som almindelige brugerspørgsmål, stoppes denne udvidelse. Teamet tilføjer i stedet bedre mærkede eksempler på produktfejl og undersøger, om kategorierne skal præciseres. Det store arkiv erstatter dermed ikke den faglige vurdering.
Typiske faldgruber
- Automatiske labels kan genbruge den første models fejl og gøre dem sværere at opdage.
- Umærkede data fra en anden periode eller målgruppe kan ændre, hvad modellen lærer.
- Et højt sikkerhedstal bør ikke stå alene som kriterium for at acceptere en ny træningslabel.
Det skal I afklare
- Er de mærkede og umærkede data fra sammenlignelige situationer?
- Hvordan kontrolleres automatisk foreslåede labels?
- Er der en uafhængig test, som aldrig bruges i træningsrunderne?
Spørgsmål og svar
Er semi-supervised og self-supervised learning det samme?
Nej. Semi-supervised kombinerer mærkede og umærkede eksempler. Self-supervised skaber et træningssignal fra dataene selv, eksempelvis ved at skjule tekst og lære at forudsige den.
Betyder flere umærkede data altid en bedre model?
Nej. Dataene skal være relevante, og metodens antagelser skal passe. Støj, forskelle i målgruppe eller forkerte pseudo-labels kan forringe resultatet.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

