{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/pretraining","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/pretraining/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/pretraining/"},"term":{"en":"Pretraining","da":"Fortræning (pretraining)"},"aka":{"en":["pre-training"],"da":["pretraining","fortræning"]},"domain":["ai"],"cluster":"training","layer":"training","status":"current","summary":{"en":"The first, huge and costly stage of teaching a model, reading vast amounts of text to pick up general patterns before any special task.","da":"Første, enorme og dyre trin i at lære en model op - den læser store mængder tekst og opfanger generelle mønstre før nogen særlig opgave."},"body":{"formal":{"en":"The initial stage of model training in which a model learns from a very large data set that mostly carries no answers, usually by self-supervised learning such as guessing the next token; the result is a general base that later fine-tuning adapts.","da":"Det første trin i modeltræning, hvor en model lærer af et meget stort datasæt, der for det meste er uden tilhørende svar, typisk med selvsuperviseret læring som at gætte næste token; resultatet er et generelt fundament, som senere finjustering tilpasser."},"plain":{"en":"Like a small child who hears years of everyday talk before starting school; nobody explains the grammar, yet the child picks up how the language works.","da":"Som et lille barn, der hører flere års hverdagssnak, før det starter i skole - ingen forklarer grammatikken, men barnet opfanger alligevel, hvordan sproget virker."},"inPractice":{"en":"A research group at a Danish university spends months on a large national research computer pretraining a model on billions of words of public Danish text; the resulting base model can continue any text but does not yet follow instructions well.","da":"En forskergruppe på et dansk universitet bruger måneder på en national supercomputer på at fortræne en model på milliarder af ord offentlig dansk tekst; basismodellen kan fortsætte enhver tekst, men følger endnu ikke instruktioner godt."},"whyItMatters":{"en":"What goes into this stage, including copyrighted, personal or poisoned text, is baked into every product built on the model and is very hard to take out.","da":"Det, der kommer ind i dette trin - også tekst, som andre har rettighederne til, personoplysninger eller forgiftet tekst - bages ind i alle produkter bygget på modellen og er meget svært at fjerne."}},"deepDive":{"en":"Pretraining objectives are self-supervised: the targets are derived from the input itself. Decoder-only language models, following GPT (Radford et al., 2018), use causal language modelling, predicting each token from all previous ones with a cross-entropy loss. BERT (Devlin et al., 2018) used masked language modelling, hiding about 15% of tokens and predicting them from both sides, which suits encoders for classification and embeddings but not free generation. T5 (Raffel et al., 2020) used span corruption, replacing contiguous spans with sentinel tokens for an encoder-decoder model to reconstruct. Text is first split into subword tokens, typically with byte-pair encoding, and the tokenizer is fixed for the life of the model.\n\nData engineering dominates the quality of the result. A typical pipeline starts from Common Crawl snapshots, extracts text from HTML, identifies language, applies heuristic and model-based quality filters, removes exact and near-duplicates (often with MinHash), strips or masks personal data and filters toxic content, then mixes the web data with code, books, scientific papers and encyclopaedic text at tuned proportions. FineWeb (Penedo et al., 2024) is a documented example of such a pipeline yielding about 15 trillion tokens, and Meta reported pretraining Llama 3 on over 15 trillion tokens. Late in training many recipes anneal on smaller high-quality or domain-specific data and extend the context length, a phase sometimes called mid-training.\n\nCompute is roughly C ≈ 6·N·D floating-point operations for N parameters and D tokens. Hoffmann et al. (2022) found compute-optimal training at about 20 tokens per parameter, but current models are deliberately trained far beyond that because a smaller model that has seen more data is cheaper to serve; Llama 3 8B saw over 15 trillion tokens, nearly 2,000 per parameter. Runs use AdamW with warmup and cosine decay, BF16 mixed precision and combined data, tensor and pipeline parallelism across thousands of accelerators for weeks or months, with frequent checkpoints to recover from hardware failures and loss spikes.\n\nThe outcome is a base model that continues text, reflects the statistics and gaps of its corpus, has a knowledge cutoff set by its data and can memorise and regurgitate rare or duplicated sequences. Web-scale collection is exposed to poisoning: Carlini et al. (2023) showed that buying expired domains referenced by LAION-400M would have let an attacker control about 0.01% of it for around 60 US dollars. Since 2 August 2025 providers of general-purpose AI models in the EU must maintain a policy to comply with Union copyright law, including machine-readable text-and-data-mining opt-outs under Art. 4(3) of Directive (EU) 2019/790, and publish a sufficiently detailed summary of training content (AI Act Art. 53(1)(c) and (d)). Pretraining differs from fine-tuning and instruction tuning in scale, in using unlabelled data and in being where nearly all knowledge enters the model.","da":"Fortræningens læringsmål er selvsuperviserede: målene udledes af selve inputtet. Decoder-only-sprogmodeller bruger i forlængelse af GPT (Radford m.fl., 2018) kausal sprogmodellering, hvor hvert token forudsiges ud fra alle foregående med et krydsentropitab. BERT (Devlin m.fl., 2018) brugte maskeret sprogmodellering, hvor cirka 15 % af tokens skjules og forudsiges fra begge sider, hvilket passer til encodere til klassifikation og embeddings, men ikke til fri generering. T5 (Raffel m.fl., 2020) brugte span corruption, hvor sammenhængende stykker erstattes med sentinel-tokens, som en encoder-decoder skal rekonstruere. Teksten opdeles først i subword-tokens, typisk med byte-pair encoding, og tokenizeren ligger fast i hele modellens levetid.\n\nDatahåndteringen afgør i høj grad resultatets kvalitet. En typisk pipeline starter fra Common Crawl-snapshots, udtrækker tekst fra HTML, bestemmer sprog, anvender heuristiske og modelbaserede kvalitetsfiltre, fjerner eksakte og næsten-dubletter (ofte med MinHash), fjerner eller maskerer personoplysninger og filtrerer giftigt indhold og blander derefter webdata med kode, bøger, videnskabelige artikler og leksikontekst i tunede forhold. FineWeb (Penedo m.fl., 2024) er et dokumenteret eksempel på en sådan pipeline, der gav omkring 15 billioner tokens, og Meta oplyste, at Llama 3 blev fortrænet på over 15 billioner tokens. Sent i træningen afslutter mange opskrifter med et forløb på mindre datasæt af høj kvalitet eller fra bestemte domæner og udvider kontekstlængden, en fase der nogle gange kaldes mid-training.\n\nBeregningen er omtrent C ≈ 6·N·D flydende-komma-operationer for N parametre og D tokens. Hoffmann m.fl. (2022) fandt beregningsoptimal træning ved cirka 20 tokens pr. parameter, men nuværende modeller trænes bevidst langt ud over det, fordi en mindre model, der har set flere data, er billigere at drive; Llama 3 8B så over 15 billioner tokens, næsten 2.000 pr. parameter. Kørslerne bruger AdamW med opvarmning og cosinus-nedtrapning, blandet præcision i BF16 og kombineret data-, tensor- og pipelineparallelisme på tusindvis af acceleratorer i uger eller måneder, med hyppige checkpoints for at komme sig over hardwarefejl og tabsspidser.\n\nResultatet er en basismodel, der fortsætter tekst, afspejler sit korpus' statistik og huller, har et vidensstop bestemt af data og kan lære sjældne eller gentagne sekvenser udenad og gengive dem. Indsamling i webskala er udsat for forgiftning: Carlini m.fl. (2023) viste, at man ved at købe udløbne domæner, som LAION-400M henviste til, kunne have kontrolleret cirka 0,01 % af datasættet for omkring 60 dollars. Siden 2. august 2025 skal udbydere af AI-modeller til almen brug i EU have en politik for overholdelse af EU's ophavsret, herunder maskinlæsbare forbehold mod tekst- og datamining efter art. 4, stk. 3, i direktiv (EU) 2019/790, og offentliggøre et tilstrækkeligt detaljeret resumé af træningsindholdet (AI-forordningens art. 53, stk. 1, litra c og d). Fortræning adskiller sig fra finjustering og instruktionstilpasning ved sin skala, ved at bruge umærkede data og ved at være der, hvor næsten al viden kommer ind i modellen."},"edges":[{"type":"requires","to":"ai/self-supervised-learning","confidence":"high","strength":"normal"},{"type":"requires","to":"ai/training-data","confidence":"high","strength":"normal"},{"type":"kind-of","to":"ai/model-training","confidence":"high","strength":"normal"}],"depth":2,"sources":[{"title":"Radford et al. (2018), Improving Language Understanding by Generative Pre-Training","url":"https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf","tier":"reference","publisher":"OpenAI"},{"title":"Devlin et al. (2018), BERT, Pre-training of Deep Bidirectional Transformers for Language Understanding","url":"https://arxiv.org/abs/1810.04805","tier":"reference"},{"title":"Hoffmann et al. (2022), Training Compute-Optimal Large Language Models","url":"https://arxiv.org/abs/2203.15556","tier":"reference"},{"title":"Regulation (EU) 2024/1689 (AI Act), Article 53","url":"https://eur-lex.europa.eu/eli/reg/2024/1689/oj","tier":"standard","publisher":"EUR-Lex"},{"title":"Jurafsky & Martin, Speech and Language Processing (3rd ed. draft)","url":"https://web.stanford.edu/~jurafsky/slp3/","tier":"textbook"},{"title":"Carlini et al. (2023), Poisoning Web-Scale Training Datasets is Practical","url":"https://arxiv.org/abs/2302.10149","tier":"reference","publisher":"arXiv"}],"draft":true}