Hvad betyder RLHF (Reinforcement Learning from Human Feedback)?
RLHF står for Reinforcement Learning from Human Feedback. I en almindelig variant vurderer mennesker forskellige modelsvar. Vurderingerne bruges til at træne en belønningsmodel, som derefter indgår i optimeringen af sprogmodellens adfærd.
InstructGPT-arbejdet beskriver en kombination af menneskeskrevne eksempler, rangering af svar og reinforcement learning. Det er et dokumenteret eksempel på metoden, men ikke en fuldstændig beskrivelse af træningen af alle kommercielle AI-modeller.
Menneskelig præference er heller ikke det samme som sandhed. Vurderere kan være uenige, og en model kan lære at lyde overbevisende uden at have tilstrækkeligt belæg. RLHF fjerner derfor ikke behovet for kildekontrol og test. Andre former for præferenceoptimering findes også; de bør ikke alle beskrives som den samme træningsproces.
Kilder og videre læsning
De tekniske begreber bygger på nedenstående kilder. Eksemplerne er illustrative og viser, hvordan I kan arbejde med emnet.

