Hvad betyder Self-supervised learning?
Ved self-supervised learning konstrueres en opgave, hvor dataene selv leverer det svar, modellen skal lære. Et tekstsystem kan eksempelvis få skjult dele af en sætning og trænes i at forudsige dem. Et andet kan lære at forudsige det næste token ud fra tidligere tekst.
Det giver mulighed for at lære repræsentationer fra store mængder tekst, billeder eller lyd, før modellen tilpasses en mere specifik anvendelse. Der er stadig et træningsmål, selv om hvert eksempel ikke er mærket manuelt.
Betegnelsen betyder ikke, at modellen selv vælger et forretningsmål eller løbende lærer af alle brugere. Træningsopgaven, datagrundlaget og de efterfølgende opdateringer bestemmes af dem, der bygger og driver modellen.
Træningsopgaven former den lærte repræsentation
Når en model rekonstruerer skjult tekst, bliver den belønnet for at finde sproglige sammenhænge, der gør rekonstruktionen bedre. Det kan skabe nyttige repræsentationer, men målet er ikke identisk med at give korrekte svar i en kundeservicechat.
Derfor følger der ofte andre trin efter den brede træning. Modellen kan tilpasses instruktioner, specialiserede opgaver eller bestemte outputkrav. Den skal også testes på den konkrete anvendelse, selv om dens generelle sproglige evner virker imponerende.
Hvad betyder det for en virksomhed, der køber AI?
For de fleste virksomheder er begrebet især nyttigt, når de vurderer en eksisterende model. Det forklarer, hvorfor modellen kan arbejde med sprog eller billeder uden at være trænet på netop jeres arbejdsgang.
Spørg hvilke efterfølgende tilpasninger, datakilder og kontroller der er nødvendige. At en model er trænet på meget data dokumenterer ikke, at den kender jeres aktuelle priser, rettigheder eller produktændringer. Den viden skal tilføres og vedligeholdes særskilt.
Et eksempel fra praksis
Et team skal finde relaterede afsnit i en stor samling tekniske manualer. De kan bruge en allerede trænet tekstmodel til at lave repræsentationer af afsnittene og derefter teste, om relevante beskrivelser bliver fundet.
Testen omfatter både enslydende afsnit med forskellig betydning og forskellige formuleringer af samme fejl. Hvis modellen forveksler to produktserier, er løsningen ikke automatisk mere grundtræning. Tydelige metadata, bedre opdeling af dokumenterne eller en anden søgemetode kan være mere relevant for den konkrete opgave.
Typiske faldgruber
- En vellykket træningsopgave er ikke i sig selv dokumentation for korrekthed i et færdigt produkt.
- Selv-superviseret læring bliver nogle gange fejlagtigt beskrevet som løbende læring af enhver brugerbesked.
- Generelle repræsentationer kan mangle de faglige skel, som er afgørende i jeres dokumenter.
Det skal I afklare
- Hvilken konkret opgave skal den generelle repræsentation understøtte?
- Hvilke faglige skel skal indgå i jeres testeksempler?
- Hvordan tilføres aktuelle virksomhedsoplysninger uden at antage, at modellen allerede kender dem?
Spørgsmål og svar
Er der ingen labels ved self-supervised learning?
Der er et træningssignal, men det konstrueres fra dataene selv frem for at blive skrevet manuelt for hvert eksempel. Skjult tekst kan eksempelvis fungere som det svar, modellen skal forudsige.
Lærer en chatbot automatisk af vores samtale?
Det følger ikke af, at modellen er trænet self-supervised. Hvad en tjeneste gemmer eller bruger til senere træning, afhænger af dens funktioner, indstillinger og aftaler.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.
- BERT: Pre-training of Deep Bidirectional Transformers ↗Et eksempel på træning med skjulte tekstdele.
- Google: Machine Learning Glossary ↗

