Modeltræning
Også kendt som: træning
Den dyre, engangsfase, hvor en model ser træningsdata igen og igen og justerer sine interne tal, indtil dens gæt bliver bedre.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
Processen, hvor man gentagne gange fodrer en model med træningsdata, måler hvor langt dens resultater er fra de ønskede svar og justerer dens vægte for at mindske afstanden; resultatet er et fast sæt lærte tal.
Forklaret enkelt
Som en dartspiller, der kaster tusindvis af pile, ser hvor langt hver lander fra midten og justerer armen en smule hver gang.
I praksis
Et dansk universitet bruger uger på et nationalt regnecenter på at træne en dansk sprogmodel én gang; kommuner og virksomheder, der tager den i brug, bruger derefter kun det færdige resultat.
Hvorfor det betyder noget
Det, der sker her, afgør, hvad modellen ved, og hvordan den opfører sig; det er også her, forgiftede eller ulovlige data bliver bygget ind for altid.
Teknisk uddybning
Kerneløkken er stokastisk gradientnedstigning med minibatches: Man udtrækker en batch, kører et forward pass, beregner tabet, bruger backpropagation til at finde gradienterne og lader en optimeringsalgoritme opdatere vægtene. Adam og varianten AdamW med afkoblet weight decay er de facto standard for neurale netværk (Adams sædvanlige standardværdier er β1 = 0,9, β2 = 0,999, ε = 1e-8), mens almindelig SGD med momentum stadig er udbredt inden for billedgenkendelse. Læringsraten styres typisk efter en plan, ofte med lineær opvarmning efterfulgt af cosinus- eller lineært aftagende rate, og klipning af gradientnormen beskytter mod pludselige tabsspidser.
For store modeller dominerer ingeniørarbejdet. Mixed-precision-træning holder en masterkopi af vægtene i FP32, mens det meste af regnearbejdet sker i BF16 eller FP16. Arbejdet fordeles over mange acceleratorer med dataparallelisme (hver enhed har en kopi, og gradienterne midles), tensorparallelisme (enkelte matricer deles mellem enheder), pipelineparallelisme (lagene deles i trin) og opdelte optimeringstilstande som ZeRO/FSDP. En udbredt tommelfingerregel sætter regnekraften til at træne en tæt transformer til omkring 6 × parametre × træningstokens FLOPs. Lange kørsler gemmer jævnligt checkpoints af vægte og optimeringstilstand, fordi hardwarefejl er rutine i klyngeskala.
Moderne foundation models trænes i etaper: fortræning på et meget stort korpus med et selvsuperviseret mål og derefter eftertræning som superviseret instruction tuning og præferenceoptimering (RLHF eller direkte metoder). Finjustering og parameter-effektive metoder som LoRA er yderligere træningskørsler oven på et checkpoint, ikke en særskilt proces. Træning er også noget andet end hyperparametersøgning, som er en ydre løkke, der kører mange træninger og sammenligner dem på valideringssættet.
Diagnosen stilles ud fra tabskurverne. Falder træningstabet, mens valideringstabet stiger, er der tale om overtilpasning; forbliver begge høje, er det undertilpasning eller en fejl; pludselige spidser eller NaN-værdier tyder på for høj læringsrate eller numerisk ustabilitet. Reproducerbarhed er sværere, end det ser ud: tilfældige seeds, datarækkefølge, ikke-deterministiske GPU-kerner og biblioteksversioner ændrer alle resultatet, så træning, der skal kunne revideres, registrerer den fulde konfiguration, hashværdier af datasnapshots og kodeversion.
Reguleringen knytter sig til netop denne fase. Efter AI-forordningen formodes en AI-model til almen brug at have kapaciteter med stor virkning og klassificeres dermed som en model med systemisk risiko, når den samlede regnekraft brugt til træningen overstiger 10^25 flydende-komma-operationer (artikel 51, stk. 2, jf. stk. 1, litra a), og udbydere af modeller til almen brug skal dokumentere træningsprocessen (artikel 53, stk. 1, litra a) og offentliggøre et resumé af træningsindholdet (artikel 53, stk. 1, litra d). Sikkerhedsmæssigt er træningen det tidspunkt, hvor dataforgiftning og bagdøre bygges ind, og de færdige vægte er et aktiv, hvis tyveri overfører hele træningsinvesteringen.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Træningsdata
- →Modeltræning
Relationer
- Del af
- Maskinlæring
- Består af
- BackpropagationBatchstørrelseEpoke (epoch)Gradientnedstigning (gradient descent)Tabsfunktion (loss function)Valideringssæt
- Forudsætter
- Træningsdata
- Åbner for
- AI-alignmentBatchstørrelseDataforgiftning (data poisoning)HyperparameterVidensgrænse (knowledge cutoff)Vidensdestillation (distillation)Modelvægte (weights)Overtilpasning (overfitting)RegressionTestsætOverførselslæring (transfer learning)Undertilpasning (underfitting)
- Forveksl ikke med
- InferensModelevaluering (evals)
- Bruges sammen med
- Tensor processing unit (TPU)Grafikprocessor (GPU)Modelparameter
Kilder og videre læsning
Standarder og officielle tekster
Opslagsværker
Lærebøger
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Nævnt i
Test dig selv
Indlæser…