{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/model-training","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/model-training/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/model-training/"},"term":{"en":"Model training","da":"Modeltræning"},"aka":{"en":["training"],"da":["træning"]},"domain":["ai"],"cluster":"ml-fundamentals","layer":"training","status":"current","summary":{"en":"The costly, one-off stage where a model looks at training data again and again and tunes its internal numbers until its guesses improve.","da":"Den dyre, engangsfase, hvor en model ser træningsdata igen og igen og justerer sine interne tal, indtil dens gæt bliver bedre."},"body":{"formal":{"en":"The process of repeatedly feeding training data to a model, measuring how far its outputs are from the wanted answers, and adjusting its weights to shrink that gap; the result is a fixed set of learned numbers.","da":"Processen, hvor man gentagne gange fodrer en model med træningsdata, måler hvor langt dens resultater er fra de ønskede svar og justerer dens vægte for at mindske afstanden; resultatet er et fast sæt lærte tal."},"plain":{"en":"Like a darts player throwing thousands of darts, checking how far each lands from the centre, and adjusting their arm a little each time.","da":"Som en dartspiller, der kaster tusindvis af pile, ser hvor langt hver lander fra midten og justerer armen en smule hver gang."},"inPractice":{"en":"A Danish university books weeks of time at a national computing centre to train a Danish language model once; municipalities and firms that adopt it then only use the finished result.","da":"Et dansk universitet bruger uger på et nationalt regnecenter på at træne en dansk sprogmodel én gang; kommuner og virksomheder, der tager den i brug, bruger derefter kun det færdige resultat."},"whyItMatters":{"en":"What happens here decides what the model knows and how it behaves; it is also where poisoned or unlawful data gets built in for good.","da":"Det, der sker her, afgør, hvad modellen ved, og hvordan den opfører sig; det er også her, forgiftede eller ulovlige data bliver bygget ind for altid."}},"deepDive":{"en":"The core loop is minibatch stochastic gradient descent: sample a batch, run a forward pass, compute the loss, backpropagate to get gradients, and let an optimiser update the weights. Adam and its decoupled-weight-decay variant AdamW are the de facto defaults for neural networks (Adam's usual defaults are β1 = 0.9, β2 = 0.999, ε = 1e-8), while plain SGD with momentum remains common in vision. The learning rate is typically scheduled, often with a linear warm-up followed by cosine or linear decay, and gradient-norm clipping guards against loss spikes.\n\nFor large models the engineering dominates. Mixed-precision training keeps a master copy of the weights in FP32 while doing most arithmetic in BF16 or FP16. Work is spread over many accelerators with data parallelism (each device holds a replica and gradients are averaged), tensor parallelism (single matrices split across devices), pipeline parallelism (layers split into stages) and sharded optimiser states such as ZeRO/FSDP. A common rule of thumb puts training compute for a dense transformer at roughly 6 × parameters × training tokens FLOPs. Long runs checkpoint weights and optimiser state regularly, because hardware failures are routine at cluster scale.\n\nModern foundation models are trained in stages: pretraining on a very large corpus with a self-supervised objective, then post-training such as supervised instruction tuning and preference optimisation (RLHF or direct methods). Fine-tuning and parameter-efficient methods such as LoRA are further training runs on top of a checkpoint, not a separate process. Training is also distinct from hyperparameter search, which is an outer loop that runs many trainings and compares them on the validation set.\n\nDiagnostics come from the loss curves. Training loss falling while validation loss rises indicates overfitting; both staying high indicates underfitting or a bug; sudden spikes or NaNs point to an excessive learning rate or numerical instability. Reproducibility is harder than it looks: random seeds, data order, non-deterministic GPU kernels and library versions all change the result, so audit-grade training records the full configuration, data snapshot hashes and code version.\n\nRegulation attaches to this stage. Under the EU AI Act, a general-purpose AI model is presumed to have high-impact capabilities, and so is classified as a model with systemic risk, when the cumulative compute used for its training exceeds 10^25 floating-point operations (Article 51(2) with 51(1)(a)), and providers of general-purpose models must document the training process (Article 53(1)(a)) and publish a summary of training content (Article 53(1)(d)). Security-wise, training is when data poisoning and backdoors become embedded, and the resulting weights are an asset whose theft transfers the entire training investment.","da":"Kerneløkken er stokastisk gradientnedstigning med minibatches: Man udtrækker en batch, kører et forward pass, beregner tabet, bruger backpropagation til at finde gradienterne og lader en optimeringsalgoritme opdatere vægtene. Adam og varianten AdamW med afkoblet weight decay er de facto standard for neurale netværk (Adams sædvanlige standardværdier er β1 = 0,9, β2 = 0,999, ε = 1e-8), mens almindelig SGD med momentum stadig er udbredt inden for billedgenkendelse. Læringsraten styres typisk efter en plan, ofte med lineær opvarmning efterfulgt af cosinus- eller lineært aftagende rate, og klipning af gradientnormen beskytter mod pludselige tabsspidser.\n\nFor store modeller dominerer ingeniørarbejdet. Mixed-precision-træning holder en masterkopi af vægtene i FP32, mens det meste af regnearbejdet sker i BF16 eller FP16. Arbejdet fordeles over mange acceleratorer med dataparallelisme (hver enhed har en kopi, og gradienterne midles), tensorparallelisme (enkelte matricer deles mellem enheder), pipelineparallelisme (lagene deles i trin) og opdelte optimeringstilstande som ZeRO/FSDP. En udbredt tommelfingerregel sætter regnekraften til at træne en tæt transformer til omkring 6 × parametre × træningstokens FLOPs. Lange kørsler gemmer jævnligt checkpoints af vægte og optimeringstilstand, fordi hardwarefejl er rutine i klyngeskala.\n\nModerne foundation models trænes i etaper: fortræning på et meget stort korpus med et selvsuperviseret mål og derefter eftertræning som superviseret instruction tuning og præferenceoptimering (RLHF eller direkte metoder). Finjustering og parameter-effektive metoder som LoRA er yderligere træningskørsler oven på et checkpoint, ikke en særskilt proces. Træning er også noget andet end hyperparametersøgning, som er en ydre løkke, der kører mange træninger og sammenligner dem på valideringssættet.\n\nDiagnosen stilles ud fra tabskurverne. Falder træningstabet, mens valideringstabet stiger, er der tale om overtilpasning; forbliver begge høje, er det undertilpasning eller en fejl; pludselige spidser eller NaN-værdier tyder på for høj læringsrate eller numerisk ustabilitet. Reproducerbarhed er sværere, end det ser ud: tilfældige seeds, datarækkefølge, ikke-deterministiske GPU-kerner og biblioteksversioner ændrer alle resultatet, så træning, der skal kunne revideres, registrerer den fulde konfiguration, hashværdier af datasnapshots og kodeversion.\n\nReguleringen knytter sig til netop denne fase. Efter AI-forordningen formodes en AI-model til almen brug at have kapaciteter med stor virkning og klassificeres dermed som en model med systemisk risiko, når den samlede regnekraft brugt til træningen overstiger 10^25 flydende-komma-operationer (artikel 51, stk. 2, jf. stk. 1, litra a), og udbydere af modeller til almen brug skal dokumentere træningsprocessen (artikel 53, stk. 1, litra a) og offentliggøre et resumé af træningsindholdet (artikel 53, stk. 1, litra d). Sikkerhedsmæssigt er træningen det tidspunkt, hvor dataforgiftning og bagdøre bygges ind, og de færdige vægte er et aktiv, hvis tyveri overfører hele træningsinvesteringen."},"edges":[{"type":"requires","to":"ai/training-data","confidence":"high","strength":"normal"},{"type":"part-of","to":"ai/machine-learning","confidence":"high","strength":"normal"},{"type":"used-with","to":"ai/tpu","why":{"en":"TPUs are linked in large groups mainly to train big models.","da":"TPU'er kobles i store grupper primært for at træne store modeller."},"confidence":"medium","strength":"normal"}],"depth":1,"sources":[{"title":"Goodfellow, Bengio & Courville (2016), Deep Learning","url":"https://www.deeplearningbook.org/","tier":"textbook","publisher":"MIT Press"},{"title":"ISO/IEC 22989:2022, Information technology: Artificial intelligence concepts and terminology","url":"https://www.iso.org/standard/74296.html","tier":"standard","publisher":"ISO/IEC"},{"title":"Kingma & Ba (2015), Adam: A Method for Stochastic Optimization","url":"https://arxiv.org/abs/1412.6980","tier":"reference","publisher":"ICLR 2015"},{"title":"Kaplan et al. (2020), Scaling Laws for Neural Language Models","url":"https://arxiv.org/abs/2001.08361","tier":"reference","publisher":"arXiv"},{"title":"Regulation (EU) 2024/1689 (Artificial Intelligence Act), Articles 51 and 53","url":"https://eur-lex.europa.eu/eli/reg/2024/1689/oj","tier":"standard","publisher":"European Union"}],"draft":true}