Gå til indhold
atlas

Forstærkningslæring fra menneskelig feedback (RLHF)

Også kendt som: præferencetræning

At forbedre en model ved at lade mennesker rangere dens svar, lære en bedømmer af rangeringerne og så træne modellen til at få høje scorer.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En træningsmetode, hvor menneskelige bedømmere sammenligner par af modelsvar, en separat belønningsmodel tilpasses til at forudsige deres valg, og hovedmodellen derefter justeres med forstærkningslæring til at give svar, som belønningsmodellen vurderer højt.

Forklaret enkelt

Som en komiker, der afprøver vittigheder på et prøvepublikum, noterer, hvilke der får grin, og gradvist former showet efter, hvad publikum foretrækker.

I praksis

Sagsbehandlere fra flere kommuner sammenligner par af svar fra en chatassistent til borgerservice på “Hvordan får jeg et nyt sundhedskort?” og vælger det klareste og korrekte; tusindvis af den slags valg træner den bedømmer, der styrer assistenten.

Hvorfor det betyder noget

Det er et centralt værktøj til at gøre modeller hjælpsomme og mindre skadelige, men det belønner, hvad bedømmerne kan lide, snarere end hvad der er sandt, og kan lære modellen smiger og selvsikre fejl.

Teknisk uddybning

Det klassiske forløb har tre trin. Først instruktionstilpasses en fortrænet model på eksempelsvar (SFT). Dernæst sammenligner menneskelige bedømmere output for samme prompt, og en belønningsmodel r(x, y), typisk SFT-modellen med et skalart output-hoved, tilpasses deres valg med et Bradley-Terry-tab, −log σ(r(x, y_w) − r(x, y_l)), hvor y_w er det foretrukne og y_l det fravalgte svar. Til sidst optimeres policyen med forstærkningslæring, klassisk PPO, til at maksimere r(x, y) − β·KL(π ‖ π_ref), hvor KL-straffen i forhold til den frosne SFT-reference forhindrer policyen i at glide over i tekst, der udnytter belønningsmodellen. Metoden blev introduceret til Atari og simuleret robotik af Christiano m.fl. (2017), anvendt på opsummering af Stiennon m.fl. (2020) og gjort udbredt af InstructGPT (Ouyang m.fl., 2022), der brugte omkring 13.000 SFT-prompts, 33.000 prompts til belønningsmodellen med rangering af flere svar hver og 31.000 prompts til PPO; bedømmerne foretrak svar fra InstructGPT med 1,3 milliarder parametre frem for GPT-3 med 175 milliarder.

PPO-baseret RLHF er tungt at drive: policy, referencemodel, belønningsmodel og en værdimodel (critic) skal alle ligge i hukommelsen, og træningen er følsom over for β, læringsrate og normalisering af belønningen. InstructGPT blandede desuden fortræningsgradienter ind i PPO (PPO-ptx) for at mindske de tilbagefald på offentlige benchmarks, som alignment ellers gav.

Flere alternativer deler nu betegnelsen præferencetræning. Direct Preference Optimisation (Rafailov m.fl., 2023) viser, at det KL-regulariserede mål har et lukket optimum, så policyen kan trænes direkte på præferencepar med et klassifikationslignende tab uden eksplicit belønningsmodel eller RL-løkke. RLAIF og Constitutional AI (Bai m.fl., 2022) erstatter de fleste menneskelige sammenligninger med vurderinger fra en model, der følger skrevne principper. GRPO (Shao m.fl., 2024) fjerner værdimodellen ved at sammenligne hvert svar med gennemsnittet af en gruppe svar på samme prompt og bruges bredt med automatisk verificerbare belønninger, som at bestå unittests eller nå et korrekt matematisk resultat, til at træne ræsonnerende modeller.

Fejlmønstrene følger af, at man optimerer mod en lært stedfortræder. Gao m.fl. (2023) viste, at når policyen bevæger sig længere væk fra referencen, bliver stedfortræderbelønningen ved med at stige, mens den sande (gold) belønning topper og derefter falder - overoptimering af belønningen, en form for Goodharts lov. Menneskelige præferencer favoriserer imødekommende, selvsikre og længere svar, og Sharma m.fl. (2023) forbandt den slags præferencedata med smiger (sycophancy). GPT-4's tekniske rapport viste, at den fortrænede model var velkalibreret, og at eftertræningen forringede kalibreringen. Bedømmernes instruktioner, sammensætning og uenighed er derfor designvalg med etisk vægt og ikke neutral dataindsamling.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Forstærkningslæring (reinforcement learning)
  2. →Token
  3. →Træningsdata
  4. →Selvsuperviseret læring
  5. →Transformer
  6. →Stor sprogmodel (LLM)
  7. →Fortræning (pretraining)
  8. →Instruktionstilpasning (instruction tuning)
  9. →Forstærkningslæring fra menneskelig feedback (RLHF)

Relationer

Forårsager
Hallucination

Kilder og videre læsning

Opslagsværker

  • Christiano et al. (2017), Deep Reinforcement Learning from Human Preferences
  • Ouyang et al. (2022), Training language models to follow instructions with human feedback

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.