Modelparameter
Også kendt som: lært parameter
Et af de tal inde i en model, der fastsættes ved at lære af data; antallet af dem er den måde, modelstørrelse normalt opgives på.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En intern værdi i en model - mest modelvægtene plus små forskydningsværdier - som modeltræning justerer for at mindske tabet; en stor sprogmodel kan have milliarder af dem.
Forklaret enkelt
Som stenene i en kæmpe mosaik - ingen enkelt sten betyder meget, men tilsammen danner deres farver billedet, og flere sten giver finere detaljer.
I praksis
En IT-indkøber i en kommune sammenligner en “7B”- og en “70B”-model til en intern assistent; tallene er milliarder af modelparametre og giver et groft bud på hukommelsesbehov, driftspris og evner.
Hvorfor det betyder noget
Antallet af parametre styrer, hvor meget hardware, energi og penge en model kræver at træne og køre, og flere parametre er ingen garanti for et bedre resultat på en given opgave.
Teknisk uddybning
I et neuralt netværk er parametrene alle de tensorer, optimeringsalgoritmen opdaterer: vægtmatricer og biasvektorer i lineære lag, foldningskerner, tabeller med token-embeddings, lærte positionsembeddings og skalering og forskydning (γ, β) i normaliseringslag. Ikke alle gemte tal er parametre. Batchnormaliseringens løbende middelværdi og varians opdateres ved gennemsnit og ikke via gradienter, og derfor registrerer PyTorch dem som buffere frem for parametre; optimeringsalgoritmens egen tilstand, som Adams momentestimater, er heller ikke en del af modellen, selv om den gemmes i træningscheckpoints.
Optællingen er mekanisk. Et tæt lag fra d_in til d_out har d_in·d_out + d_out parametre. I en standard transformerblok med modelbredde d og 4× udvidelse i MLP'en bidrager attention med cirka 4d² og MLP'en med cirka 8d², så antallet af parametre uden embeddings er omtrent 12·L·d² for L lag (Kaplan m.fl., 2020); GPT-3's 96 lag med d = 12.288 giver cirka 174 milliarder, hvilket passer med de annoncerede 175B, når embeddings lægges til. Embedding-tabellen tilføjer ordforrådets størrelse × d og deles ofte med outputlaget. Mixture-of-experts-modeller skelner mellem samlede og aktive parametre: Mixtral 8x7B har omkring 47 milliarder parametre i alt, men bruger cirka 13 milliarder pr. token, så hukommelsesforbrug og beregning pr. token fortæller forskellige historier.
Hukommelse følger af antallet af parametre og talformatet: 4 byte pr. parameter i FP32, 2 i BF16 eller FP16, 1 i INT8 og omkring 0,5 ved 4 bit. En model med 7 milliarder parametre kræver derfor cirka 14 GB til vægtene i BF16, før KV-cache og aktiveringer. Træning er langt tungere: træning med blandet præcision og Adam kræver omtrent 16 byte pr. parameter til vægte, gradienter, FP32-mastervægte og to momentestimater, som analyseret i ZeRO-artiklen, så en 7B-model kræver over 100 GB alene til model- og optimeringstilstand.
Antallet af parametre er i sig selv en dårlig indikator for evner. Kaplan m.fl. (2020) fandt, at tabet falder som en potenslov i antallet af parametre, men Hoffmann m.fl. (2022) viste, at mange store modeller var undertrænede, og at beregningsoptimal træning bruger i størrelsesordenen 20 tokens pr. parameter; deres Chinchilla på 70B, trænet på 1,4 billioner tokens, slog Gopher på 280B. Træningsberegningen anslås ofte som C ≈ 6·N·D for N parametre og D tokens. Reguleringen afspejler det: EU's AI-forordning formoder, at en AI-model til almen brug har kapaciteter med stor virkning, som udløser klassificering som model med systemisk risiko, når den samlede træningsberegning overstiger 10²⁵ flydende kommaoperationer (art. 51, stk. 2); kriteriet er beregning, ikke antallet af parametre. Til forskel fra hyperparametre vælges parametre ikke, men læres, og vægte er den største delmængde af dem.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Træningsdata
- →Maskinlæring
- →Modelparameter
Relationer
- Typer
- Modelvægte (weights)
- Del af
- Neuralt netværk
- Forudsætter
- Maskinlæring
- Forveksl ikke med
- Feature (inputvariabel)Hyperparameter
- Bruges sammen med
- Modeltræning
Kilder og videre læsning
Standarder og officielle tekster
Opslagsværker
Lærebøger
- Goodfellow, Bengio & Courville, Deep Learning · MIT Press
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Nævnt i
Test dig selv
Indlæser…