Gratis værktøjFå en AI-drevet diagnose af dit website på få minutterPrøv AI Site Doctor
Lad os tale
← Udforsk AI-ordbogen
AI & machine learning

Semi-supervised learning

Semi-supervised learning kombinerer eksempler med kendte labels og eksempler uden labels for at lære en model.

Også kaldet: Semisuperviseret læring

Moselstudio · AI-ordbog2 min. læsning
Se mulighederne i jeres virksomhed ↗
En stor skål med kugler er forbundet med få udvalgte kugler på en lille sokkel.
Få kendte eksempler forbindes med en større samling uden etiketter.

Hvad betyder Semi-supervised learning?

Semi-supervised learning er relevant, når det er dyrt at skaffe facit, men der findes mange umærkede observationer. Metoden forsøger at udnytte både de sikre, mærkede eksempler og strukturen i det øvrige materiale.

En tilgang er self-training: En model trænes først på de mærkede data. Den producerer derefter foreløbige labels for udvalgte umærkede eksempler, som bruges i en ny træningsrunde. Andre tilgange udbreder labels mellem observationer, der vurderes at ligge tæt på hinanden.

Den mulige fordel afhænger af antagelser om data. Lignende observationer skal eksempelvis ofte høre til samme kategori. Hvis den antagelse er forkert, kan de ekstra data forstærke fejl i stedet for at hjælpe.

Et lille facit skal stadig være repræsentativt

De første mærkede eksempler bestemmer, hvad modellen overhovedet har mulighed for at lære. Et udvalg, der kun indeholder lette og almindelige situationer, giver et skævt udgangspunkt. Medtag derfor variation og tvivlstilfælde, som afspejler den faktiske opgave.

Beslut også, hvornår en automatisk foreslået label er sikker nok til at blive brugt. En models egen sikkerhed kan være dårligt kalibreret. Stikprøver og et uafhængigt testsæt er nødvendige for at opdage, om fejlen spreder sig.

Vælg metoden, når mærkning er flaskehalsen

Tilgangen er et muligt valg, hvis datamængden er stor, labels er knappe, og der findes en fornuftig sammenhæng mellem de to dele. Den er mindre oplagt, hvis de umærkede data kommer fra en anden målgruppe eller et andet system.

Sammenlign med at få mærket et lidt større, velvalgt datasæt. Den løsning kan være enklere at forstå og vedligeholde. Mere avanceret træning er kun nyttig, hvis den giver en reel fordel på nye, repræsentative eksempler.

FRA BEGREB TIL ARBEJDSDAG

Et eksempel fra praksis

En virksomhed vil sortere tekniske supportbeskeder. Et mindre udvalg er kategoriseret af specialister, mens resten af arkivet mangler labels. En pilot bruger de sikre eksempler til at finde flere mulige eksempler på de samme kategorier.

Specialister kontrollerer især automatisk mærkede beskeder om sjældne produktfejl. Hvis modellen konsekvent placerer dem som almindelige brugerspørgsmål, stoppes denne udvidelse. Teamet tilføjer i stedet bedre mærkede eksempler på produktfejl og undersøger, om kategorierne skal præciseres. Det store arkiv erstatter dermed ikke den faglige vurdering.

Typiske faldgruber

  • Automatiske labels kan genbruge den første models fejl og gøre dem sværere at opdage.
  • Umærkede data fra en anden periode eller målgruppe kan ændre, hvad modellen lærer.
  • Et højt sikkerhedstal bør ikke stå alene som kriterium for at acceptere en ny træningslabel.

Det skal I afklare

  1. Er de mærkede og umærkede data fra sammenlignelige situationer?
  2. Hvordan kontrolleres automatisk foreslåede labels?
  3. Er der en uafhængig test, som aldrig bruges i træningsrunderne?

Spørgsmål og svar

Er semi-supervised og self-supervised learning det samme?

Nej. Semi-supervised kombinerer mærkede og umærkede eksempler. Self-supervised skaber et træningssignal fra dataene selv, eksempelvis ved at skjule tekst og lære at forudsige den.

Betyder flere umærkede data altid en bedre model?

Nej. Dataene skal være relevante, og metodens antagelser skal passe. Støj, forskelle i målgruppe eller forkerte pseudo-labels kan forringe resultatet.

Kilder og videre læsning

De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

  1. scikit-learn: Semi-supervised learning
  2. scikit-learn: Semi-supervised algorithms
FRA VIDEN TIL JERES NÆSTE SKRIDT

Fra begreb til en løsning, I kan bruge.

Beskriv den opgave, I gerne vil gøre lettere. Vi hjælper med at afklare data, muligheder og et overskueligt første skridt.

  • En personlig vurdering af jeres opgave
  • Afklaring af data, systemer og begrænsninger
  • Et konkret forslag til næste skridt
M
Et svar fra mennesker, der bygger.Mosel Studio · Svendborg · Hele Danmark
kontakt@moselstudio.dk
Hvordan vil du helst starte?

Uforpligtende henvendelse · Ingen automatisk tilmelding