Fortræning (pretraining)
Også kendt som: pretraining, fortræning
Første, enorme og dyre trin i at lære en model op - den læser store mængder tekst og opfanger generelle mønstre før nogen særlig opgave.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
Det første trin i modeltræning, hvor en model lærer af et meget stort datasæt, der for det meste er uden tilhørende svar, typisk med selvsuperviseret læring som at gætte næste token; resultatet er et generelt fundament, som senere finjustering tilpasser.
Forklaret enkelt
Som et lille barn, der hører flere års hverdagssnak, før det starter i skole - ingen forklarer grammatikken, men barnet opfanger alligevel, hvordan sproget virker.
I praksis
En forskergruppe på et dansk universitet bruger måneder på en national supercomputer på at fortræne en model på milliarder af ord offentlig dansk tekst; basismodellen kan fortsætte enhver tekst, men følger endnu ikke instruktioner godt.
Hvorfor det betyder noget
Det, der kommer ind i dette trin - også tekst, som andre har rettighederne til, personoplysninger eller forgiftet tekst - bages ind i alle produkter bygget på modellen og er meget svært at fjerne.
Teknisk uddybning
Fortræningens læringsmål er selvsuperviserede: målene udledes af selve inputtet. Decoder-only-sprogmodeller bruger i forlængelse af GPT (Radford m.fl., 2018) kausal sprogmodellering, hvor hvert token forudsiges ud fra alle foregående med et krydsentropitab. BERT (Devlin m.fl., 2018) brugte maskeret sprogmodellering, hvor cirka 15 % af tokens skjules og forudsiges fra begge sider, hvilket passer til encodere til klassifikation og embeddings, men ikke til fri generering. T5 (Raffel m.fl., 2020) brugte span corruption, hvor sammenhængende stykker erstattes med sentinel-tokens, som en encoder-decoder skal rekonstruere. Teksten opdeles først i subword-tokens, typisk med byte-pair encoding, og tokenizeren ligger fast i hele modellens levetid.
Datahåndteringen afgør i høj grad resultatets kvalitet. En typisk pipeline starter fra Common Crawl-snapshots, udtrækker tekst fra HTML, bestemmer sprog, anvender heuristiske og modelbaserede kvalitetsfiltre, fjerner eksakte og næsten-dubletter (ofte med MinHash), fjerner eller maskerer personoplysninger og filtrerer giftigt indhold og blander derefter webdata med kode, bøger, videnskabelige artikler og leksikontekst i tunede forhold. FineWeb (Penedo m.fl., 2024) er et dokumenteret eksempel på en sådan pipeline, der gav omkring 15 billioner tokens, og Meta oplyste, at Llama 3 blev fortrænet på over 15 billioner tokens. Sent i træningen afslutter mange opskrifter med et forløb på mindre datasæt af høj kvalitet eller fra bestemte domæner og udvider kontekstlængden, en fase der nogle gange kaldes mid-training.
Beregningen er omtrent C ≈ 6·N·D flydende-komma-operationer for N parametre og D tokens. Hoffmann m.fl. (2022) fandt beregningsoptimal træning ved cirka 20 tokens pr. parameter, men nuværende modeller trænes bevidst langt ud over det, fordi en mindre model, der har set flere data, er billigere at drive; Llama 3 8B så over 15 billioner tokens, næsten 2.000 pr. parameter. Kørslerne bruger AdamW med opvarmning og cosinus-nedtrapning, blandet præcision i BF16 og kombineret data-, tensor- og pipelineparallelisme på tusindvis af acceleratorer i uger eller måneder, med hyppige checkpoints for at komme sig over hardwarefejl og tabsspidser.
Resultatet er en basismodel, der fortsætter tekst, afspejler sit korpus' statistik og huller, har et vidensstop bestemt af data og kan lære sjældne eller gentagne sekvenser udenad og gengive dem. Indsamling i webskala er udsat for forgiftning: Carlini m.fl. (2023) viste, at man ved at købe udløbne domæner, som LAION-400M henviste til, kunne have kontrolleret cirka 0,01 % af datasættet for omkring 60 dollars. Siden 2. august 2025 skal udbydere af AI-modeller til almen brug i EU have en politik for overholdelse af EU's ophavsret, herunder maskinlæsbare forbehold mod tekst- og datamining efter art. 4, stk. 3, i direktiv (EU) 2019/790, og offentliggøre et tilstrækkeligt detaljeret resumé af træningsindholdet (AI-forordningens art. 53, stk. 1, litra c og d). Fortræning adskiller sig fra finjustering og instruktionstilpasning ved sin skala, ved at bruge umærkede data og ved at være der, hvor næsten al viden kommer ind i modellen.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Træningsdata
- →Selvsuperviseret læring
- →Fortræning (pretraining)
Relationer
- En slags
- Modeltræning
- Består af
- Fill-in-the-middle (FIM)
- Forudsætter
- Selvsuperviseret læringTræningsdata
- Forveksl ikke med
- Instruktionstilpasning (instruction tuning)
Kilder og videre læsning
Standarder og officielle tekster
Opslagsværker
- Radford et al. (2018), Improving Language Understanding by Generative Pre-Training · OpenAI
- Devlin et al. (2018), BERT, Pre-training of Deep Bidirectional Transformers for Language Understanding
- Hoffmann et al. (2022), Training Compute-Optimal Large Language Models
- Carlini et al. (2023), Poisoning Web-Scale Training Datasets is Practical · arXiv
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Nævnt i
Test dig selv
Indlæser…