Hvad betyder Reinforcement learning?
Reinforcement learning handler om at vælge handlinger i et miljø. En agent observerer en situation, udfører en handling og modtager feedback i form af en belønning. Målet er typisk at lære en strategi, en policy, der giver et godt samlet resultat over flere skridt.
Belønningen kan komme med forsinkelse. En handling, der ser fordelagtig ud nu, kan gøre en senere situation vanskeligere. Det adskiller problemet fra blot at forudsige en kategori ud fra et enkelt, statisk eksempel.
En agent i reinforcement learning er et fagligt begreb om den, der handler i miljøet. Det betyder ikke nødvendigvis en moderne sprogmodelagent. Mange AI-agenter i forretningssystemer udfører værktøjskald uden at træne en ny strategi gennem reinforcement learning.
Den vigtigste beslutning er, hvad der belønnes
Et system optimerer det træningssignal, der er valgt. Hvis signalet kun tæller hastighed, kan det finde løsninger, som er hurtige, men bryder andre hensyn. Derfor skal målet beskrives sammen med begrænsninger, stopregler og de konsekvenser, som forsøget ikke må påføre omverdenen.
Der skal også være en måde at afprøve alternative handlinger på. I mange virksomhedssituationer er et realistisk simulationsmiljø eller et historisk datasæt nødvendigt, fordi tilfældige eksperimenter i drift ville være uacceptable.
Udforskning og udnyttelse skal afvejes
En lærende strategi må balancere mellem at vælge noget, den allerede har erfaring med, og at prøve noget nyt. Uden udforskning kan den fastholde en middelmådig løsning. For megen udforskning kan derimod give dårlige resultater under læringen.
Vurder derfor først, om problemet faktisk har et sekventielt beslutningselement. En fast regel, optimeringsalgoritme eller supervised model kan være lettere at kontrollere. Reinforcement learning er ikke et nødvendigt trin for enhver automatisering.
Et eksempel fra praksis
Et lagerteam vil undersøge en strategi for intern transport mellem stationer. I en simulation kan systemet prøve forskellige ruter og lære af kø, ventetid og kapacitetsbegrænsninger. Et forslag kan belønnes for mindre ventetid, mens bestemte områder og sikkerhedsafstande håndhæves som begrænsninger.
Før en fysisk løsning overvejes, sammenlignes strategien med den eksisterende plan på travle dage, maskinstop og ændrede varetyper. En god simulationsscore er kun lovende, hvis simulationen repræsenterer de forhold, som senere opstår på lageret.
Typiske faldgruber
- En for snæver belønning kan skabe uønskede genveje, der ser gode ud i målingen.
- En strategi kan fungere i simulationen og fejle, når den virkelige proces afviger.
- Læring gennem forsøg må ikke forveksles med tilladelse til ukontrollerede handlinger i drift.
Det skal I afklare
- Afhænger dagens handling af konsekvenser flere skridt senere?
- Kan forskellige strategier afprøves uden at påvirke den virkelige drift?
- Er belønning, begrænsninger og referenceplan tydeligt beskrevet?
Spørgsmål og svar
Er RLHF det samme som reinforcement learning?
RLHF er en bestemt tilgang, hvor menneskelig feedback bruges til at forme et træningssignal. Reinforcement learning er det bredere felt om læring gennem handlinger og belønning.
Skal vi bruge reinforcement learning til en AI-agent?
Ikke nødvendigvis. En agent kan bruge en færdigtrænet model og klare værktøjsregler. Det kræver ikke, at virksomheden træner en ny strategi gennem belønninger.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

