Gå til indhold
atlas

Forstærkningslæring (reinforcement learning)

Også kendt som: reinforcement learning

Maskinlæring ved at prøve sig frem - et system handler, får belønning eller straf og lærer langsomt, hvilke handlinger der betaler sig.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En form for maskinlæring, hvor en agent handler i et miljø, modtager et belønningssignal for resultaterne og lærer en måde at vælge handlinger på, der giver mest belønning over tid, uden at få vist den rigtige handling.

Forklaret enkelt

Som at lære en hund et trick med godbidder - ingen forklarer tricket, hunden lærer bare, hvilke bevægelser der giver en godbid.

I praksis

En energiansvarlig i en region tester et system, der styrer ventilationen i en hospitalsfløj; det får belønning for at bruge mindre strøm og straf, hver gang en afdeling bliver for varm eller for kold.

Hvorfor det betyder noget

Systemet lærer præcis det, belønningen måler, ikke det, man mente, så en dårligt valgt belønning kan lære det at snyde eller at behage frem for at have ret.

Teknisk uddybning

Standardformalismen er Markov-beslutningsprocessen (MDP): en mængde tilstande S, handlinger A, overgangssandsynligheder P(s′ | s, a), en belønningsfunktion R og en diskonteringsfaktor γ mellem 0 og 1. Agenten følger en politik π(a | s) og søger at maksimere det forventede diskonterede afkast, summen af γᵗ·rₜ over tid. Værdifunktioner udtrykker, hvor god en tilstand, V(s), eller et par af tilstand og handling, Q(s, a), er under en given politik, og Bellman-ligningerne forbinder hver værdi med den umiddelbare belønning plus den diskonterede værdi af den efterfølgende tilstand. Når den sande tilstand kun kan observeres delvist, bliver det en POMDP.

Algoritmerne falder i nogle få familier. Værdibaserede metoder lærer Q og handler grådigt ud fra den: temporal-difference-læring (Sutton, 1988) og Q-learning (Watkins, 1989) opdaterer estimater ud fra enkelte overgange, og DQN (Mnih m.fl., 2015) kombinerede Q-learning med et dybt netværk, experience replay og et target-netværk og nåede menneskeligt niveau i mange Atari-spil. Policy-gradient-metoder justerer politikkens parametre direkte langs gradienten af det forventede afkast, begyndende med REINFORCE (Williams, 1992); actor-critic-metoder parrer en politik med en lært værdibaseline, og Proximal Policy Optimization (PPO, 2017) begrænser hver opdatering med et klippet mål og er meget udbredt, også i RLHF. Modelbaserede metoder lærer eller får miljøets dynamik og planlægger med den, som i AlphaGo (Silver m.fl., 2016) og AlphaZero (2018), der kombinerede Monte Carlo-træsøgning med netværk trænet gennem selvspil.

Afvejningen mellem udforskning og udnyttelse er indbygget: Agenten må prøve handlinger med usikker værdi for at finde bedre. Enkle strategier er ε-greedy (en tilfældig handling med sandsynlighed ε) og optimisme under usikkerhed; multi-armed bandit er specialtilfældet uden tilstand, som bruges i online-eksperimenter og anbefalingssystemer. Kreditfordeling er det andet kerneproblem, fordi belønningen kan komme længe efter de handlinger, der forårsagede den.

De praktiske fejltyper er veldokumenterede. Reward hacking eller specification gaming opstår, når agenten maksimerer den målte belønning gennem utilsigtet adfærd, fx ved at køre i ring for at samle point i stedet for at gennemføre et løb. Forstærkningslæring er ineffektiv med data, så det meste træning sker i simulatorer, og politikker kan fejle ved overgangen til den virkelige verden (sim-to-real-kløften). Træningen er også støjfyldt og følsom over for seeds og hyperparametre. Offline-forstærkningslæring lærer af loggede data uden ny interaktion, men må undgå at overvurdere handlinger, som loggene aldrig har afprøvet.

I sprogmodeller optræder forstærkningslæring som en eftertræningsfase: RLHF optimerer mod en belønningsmodel, der er trænet på menneskelige præferencesammenligninger, og nyere ræsonnerende modeller trænes med belønninger fra automatisk verificerbare udfald som beståede enhedstest eller korrekte matematiksvar. Samme risiko for reward hacking gælder og viser sig som indsmigrende svar (sycophancy) eller som snyd med testene.

Relationer

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.