Gå til indhold
atlas

Modeltræning

Også kendt som: træning

Den dyre, engangsfase, hvor en model ser træningsdata igen og igen og justerer sine interne tal, indtil dens gæt bliver bedre.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

Processen, hvor man gentagne gange fodrer en model med træningsdata, måler hvor langt dens resultater er fra de ønskede svar og justerer dens vægte for at mindske afstanden; resultatet er et fast sæt lærte tal.

Forklaret enkelt

Som en dartspiller, der kaster tusindvis af pile, ser hvor langt hver lander fra midten og justerer armen en smule hver gang.

I praksis

Et dansk universitet bruger uger på et nationalt regnecenter på at træne en dansk sprogmodel én gang; kommuner og virksomheder, der tager den i brug, bruger derefter kun det færdige resultat.

Hvorfor det betyder noget

Det, der sker her, afgør, hvad modellen ved, og hvordan den opfører sig; det er også her, forgiftede eller ulovlige data bliver bygget ind for altid.

Teknisk uddybning

Kerneløkken er stokastisk gradientnedstigning med minibatches: Man udtrækker en batch, kører et forward pass, beregner tabet, bruger backpropagation til at finde gradienterne og lader en optimeringsalgoritme opdatere vægtene. Adam og varianten AdamW med afkoblet weight decay er de facto standard for neurale netværk (Adams sædvanlige standardværdier er β1 = 0,9, β2 = 0,999, ε = 1e-8), mens almindelig SGD med momentum stadig er udbredt inden for billedgenkendelse. Læringsraten styres typisk efter en plan, ofte med lineær opvarmning efterfulgt af cosinus- eller lineært aftagende rate, og klipning af gradientnormen beskytter mod pludselige tabsspidser.

For store modeller dominerer ingeniørarbejdet. Mixed-precision-træning holder en masterkopi af vægtene i FP32, mens det meste af regnearbejdet sker i BF16 eller FP16. Arbejdet fordeles over mange acceleratorer med dataparallelisme (hver enhed har en kopi, og gradienterne midles), tensorparallelisme (enkelte matricer deles mellem enheder), pipelineparallelisme (lagene deles i trin) og opdelte optimeringstilstande som ZeRO/FSDP. En udbredt tommelfingerregel sætter regnekraften til at træne en tæt transformer til omkring 6 × parametre × træningstokens FLOPs. Lange kørsler gemmer jævnligt checkpoints af vægte og optimeringstilstand, fordi hardwarefejl er rutine i klyngeskala.

Moderne foundation models trænes i etaper: fortræning på et meget stort korpus med et selvsuperviseret mål og derefter eftertræning som superviseret instruction tuning og præferenceoptimering (RLHF eller direkte metoder). Finjustering og parameter-effektive metoder som LoRA er yderligere træningskørsler oven på et checkpoint, ikke en særskilt proces. Træning er også noget andet end hyperparametersøgning, som er en ydre løkke, der kører mange træninger og sammenligner dem på valideringssættet.

Diagnosen stilles ud fra tabskurverne. Falder træningstabet, mens valideringstabet stiger, er der tale om overtilpasning; forbliver begge høje, er det undertilpasning eller en fejl; pludselige spidser eller NaN-værdier tyder på for høj læringsrate eller numerisk ustabilitet. Reproducerbarhed er sværere, end det ser ud: tilfældige seeds, datarækkefølge, ikke-deterministiske GPU-kerner og biblioteksversioner ændrer alle resultatet, så træning, der skal kunne revideres, registrerer den fulde konfiguration, hashværdier af datasnapshots og kodeversion.

Reguleringen knytter sig til netop denne fase. Efter AI-forordningen formodes en AI-model til almen brug at have kapaciteter med stor virkning og klassificeres dermed som en model med systemisk risiko, når den samlede regnekraft brugt til træningen overstiger 10^25 flydende-komma-operationer (artikel 51, stk. 2, jf. stk. 1, litra a), og udbydere af modeller til almen brug skal dokumentere træningsprocessen (artikel 53, stk. 1, litra a) og offentliggøre et resumé af træningsindholdet (artikel 53, stk. 1, litra d). Sikkerhedsmæssigt er træningen det tidspunkt, hvor dataforgiftning og bagdøre bygges ind, og de færdige vægte er et aktiv, hvis tyveri overfører hele træningsinvesteringen.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Træningsdata
  2. →Modeltræning

Relationer

Forudsætter
Træningsdata

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Nævnt i

Test dig selv

Indlæser…

Atlas er i beta.