{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/model-parameter","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/model-parameter/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/model-parameter/"},"term":{"en":"Model parameter","da":"Modelparameter"},"aka":{"en":["learned parameter"],"da":["lært parameter"]},"domain":["ai"],"cluster":"training","layer":"model","status":"current","summary":{"en":"One of the numbers inside a model that is set by learning from data; their count is how model size is usually stated.","da":"Et af de tal inde i en model, der fastsættes ved at lære af data; antallet af dem er den måde, modelstørrelse normalt opgives på."},"body":{"formal":{"en":"An internal value of a model, mostly the model weights plus small offset values, that model training adjusts to reduce the loss; a large language model can have billions of them.","da":"En intern værdi i en model - mest modelvægtene plus små forskydningsværdier - som modeltræning justerer for at mindske tabet; en stor sprogmodel kan have milliarder af dem."},"plain":{"en":"Like the tiles in a huge mosaic; no single tile means much, but together their colours make the picture, and more tiles allow finer detail.","da":"Som stenene i en kæmpe mosaik - ingen enkelt sten betyder meget, men tilsammen danner deres farver billedet, og flere sten giver finere detaljer."},"inPractice":{"en":"An IT buyer in a municipality compares a “7B” and a “70B” model for an internal assistant; the figures are billions of model parameters and give a rough guide to memory needs, running cost and ability.","da":"En IT-indkøber i en kommune sammenligner en “7B”- og en “70B”-model til en intern assistent; tallene er milliarder af modelparametre og giver et groft bud på hukommelsesbehov, driftspris og evner."},"whyItMatters":{"en":"Parameter count drives how much hardware, energy and money a model needs to train and run, and a larger count is no guarantee of a better result on a given task.","da":"Antallet af parametre styrer, hvor meget hardware, energi og penge en model kræver at træne og køre, og flere parametre er ingen garanti for et bedre resultat på en given opgave."}},"deepDive":{"en":"In a neural network the parameters are every tensor that the optimiser updates: weight matrices and bias vectors of linear layers, convolution kernels, token-embedding tables, learned positional embeddings and the scale and shift (γ, β) of normalisation layers. Not every stored number is a parameter. Batch normalisation's running mean and variance are updated by averaging, not by gradients, and PyTorch therefore registers them as buffers rather than parameters; the optimiser's own state, such as Adam's moment estimates, is not part of the model either, although it is saved in training checkpoints.\n\nCounting is mechanical. A dense layer mapping d_in to d_out has d_in·d_out + d_out parameters. In a standard transformer block with model width d and a 4× MLP expansion, attention contributes about 4d² and the MLP about 8d², so the non-embedding parameter count is approximately 12·L·d² for L layers (Kaplan et al., 2020); GPT-3's 96 layers at d = 12,288 give about 174 billion, matching its advertised 175B once embeddings are added. The embedding table adds vocabulary size × d, and is often tied to the output layer. Mixture-of-experts models distinguish total from active parameters: Mixtral 8x7B has about 47 billion parameters in total but uses roughly 13 billion per token, so its memory footprint and its per-token compute tell different stories.\n\nMemory follows from parameter count and numeric format: 4 bytes per parameter in FP32, 2 in BF16 or FP16, 1 in INT8 and about 0.5 at 4 bits. A 7-billion-parameter model therefore needs about 14 GB for its weights in BF16, before the KV cache and activations. Training is far heavier: mixed-precision training with Adam needs roughly 16 bytes per parameter for weights, gradients, FP32 master weights and two moment estimates, as analysed in the ZeRO paper, so a 7B model needs over 100 GB for model and optimiser state alone.\n\nParameter count is a poor proxy for capability on its own. Kaplan et al. (2020) found loss falling as a power law in parameters, but Hoffmann et al. (2022) showed that many large models were undertrained and that compute-optimal training uses on the order of 20 tokens per parameter; their 70B Chinchilla, trained on 1.4 trillion tokens, outperformed the 280B Gopher. Training compute is commonly estimated as C ≈ 6·N·D for N parameters and D tokens. Regulation reflects this: the EU AI Act presumes that a general-purpose model has high-impact capabilities, the trigger for classing it as a model with systemic risk, when its cumulative training compute exceeds 10²⁵ floating-point operations (Art. 51(2)); the test is compute, not parameter count. Contrast hyperparameters, which are chosen, not learned, and weights, which are the largest subset of parameters.","da":"I et neuralt netværk er parametrene alle de tensorer, optimeringsalgoritmen opdaterer: vægtmatricer og biasvektorer i lineære lag, foldningskerner, tabeller med token-embeddings, lærte positionsembeddings og skalering og forskydning (γ, β) i normaliseringslag. Ikke alle gemte tal er parametre. Batchnormaliseringens løbende middelværdi og varians opdateres ved gennemsnit og ikke via gradienter, og derfor registrerer PyTorch dem som buffere frem for parametre; optimeringsalgoritmens egen tilstand, som Adams momentestimater, er heller ikke en del af modellen, selv om den gemmes i træningscheckpoints.\n\nOptællingen er mekanisk. Et tæt lag fra d_in til d_out har d_in·d_out + d_out parametre. I en standard transformerblok med modelbredde d og 4× udvidelse i MLP'en bidrager attention med cirka 4d² og MLP'en med cirka 8d², så antallet af parametre uden embeddings er omtrent 12·L·d² for L lag (Kaplan m.fl., 2020); GPT-3's 96 lag med d = 12.288 giver cirka 174 milliarder, hvilket passer med de annoncerede 175B, når embeddings lægges til. Embedding-tabellen tilføjer ordforrådets størrelse × d og deles ofte med outputlaget. Mixture-of-experts-modeller skelner mellem samlede og aktive parametre: Mixtral 8x7B har omkring 47 milliarder parametre i alt, men bruger cirka 13 milliarder pr. token, så hukommelsesforbrug og beregning pr. token fortæller forskellige historier.\n\nHukommelse følger af antallet af parametre og talformatet: 4 byte pr. parameter i FP32, 2 i BF16 eller FP16, 1 i INT8 og omkring 0,5 ved 4 bit. En model med 7 milliarder parametre kræver derfor cirka 14 GB til vægtene i BF16, før KV-cache og aktiveringer. Træning er langt tungere: træning med blandet præcision og Adam kræver omtrent 16 byte pr. parameter til vægte, gradienter, FP32-mastervægte og to momentestimater, som analyseret i ZeRO-artiklen, så en 7B-model kræver over 100 GB alene til model- og optimeringstilstand.\n\nAntallet af parametre er i sig selv en dårlig indikator for evner. Kaplan m.fl. (2020) fandt, at tabet falder som en potenslov i antallet af parametre, men Hoffmann m.fl. (2022) viste, at mange store modeller var undertrænede, og at beregningsoptimal træning bruger i størrelsesordenen 20 tokens pr. parameter; deres Chinchilla på 70B, trænet på 1,4 billioner tokens, slog Gopher på 280B. Træningsberegningen anslås ofte som C ≈ 6·N·D for N parametre og D tokens. Reguleringen afspejler det: EU's AI-forordning formoder, at en AI-model til almen brug har kapaciteter med stor virkning, som udløser klassificering som model med systemisk risiko, når den samlede træningsberegning overstiger 10²⁵ flydende kommaoperationer (art. 51, stk. 2); kriteriet er beregning, ikke antallet af parametre. Til forskel fra hyperparametre vælges parametre ikke, men læres, og vægte er den største delmængde af dem."},"edges":[{"type":"requires","to":"ai/machine-learning","confidence":"high","strength":"normal"},{"type":"part-of","to":"ai/neural-network","why":{"en":"A neural network's behaviour is entirely set by the values of its parameters.","da":"Et neuralt netværks opførsel er helt bestemt af værdierne af dets parametre."},"confidence":"high","strength":"primary"},{"type":"used-with","to":"ai/model-training","confidence":"high","strength":"normal"}],"depth":2,"sources":[{"title":"Goodfellow, Bengio & Courville, Deep Learning","url":"https://www.deeplearningbook.org/","tier":"textbook","publisher":"MIT Press"},{"title":"Kaplan et al. (2020), Scaling Laws for Neural Language Models","url":"https://arxiv.org/abs/2001.08361","tier":"reference"},{"title":"Hoffmann et al. (2022), Training Compute-Optimal Large Language Models","url":"https://arxiv.org/abs/2203.15556","tier":"reference"},{"title":"Regulation (EU) 2024/1689 (AI Act), Article 51","url":"https://eur-lex.europa.eu/eli/reg/2024/1689/oj","tier":"standard","publisher":"EUR-Lex"}],"draft":true}