{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/hyperparameter","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/hyperparameter/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/hyperparameter/"},"term":{"en":"Hyperparameter","da":"Hyperparameter"},"aka":{"en":["training setting"],"da":["træningsindstilling"]},"domain":["ai"],"cluster":"training","layer":"training","status":"current","summary":{"en":"A setting a person chooses before model training starts, such as step size or number of rounds, and that the model does not learn itself.","da":"En indstilling, et menneske vælger, før modeltræningen starter - fx skridtstørrelse eller antal runder - som modellen ikke selv lærer."},"body":{"formal":{"en":"A value that shapes how model training runs or how large the model is, fixed from outside rather than learned from the training data; it is tuned by trying values and comparing results on a validation set.","da":"En værdi, der former, hvordan modeltræningen kører, eller hvor stor modellen er, og som fastsættes udefra i stedet for at læres fra træningsdata; den justeres ved at prøve værdier og sammenligne resultater på et valideringssæt."},"plain":{"en":"Like the oven heat and baking time you set before the cake goes in; the cake does not choose them, but they decide how it turns out.","da":"Som ovnvarmen og bagetiden, du sætter, før kagen kommer ind - kagen vælger dem ikke, men de afgør, hvordan den bliver."},"inPractice":{"en":"A data analyst in a municipality runs twenty short training jobs overnight on a model that forecasts demand for home care, each with a different step size and batch size, and keeps the combination that does best on held-back cases.","da":"En dataanalytiker i en kommune kører tyve korte træningsjob over natten på en model, der skal forudsige behovet for hjemmepleje, med hver sin skridtstørrelse og batchstørrelse, og beholder den kombination, der klarer sig bedst på tilbageholdte sager."},"whyItMatters":{"en":"The same model and data can give a strong or a useless result depending on these settings, and searching them multiplies the cost of training.","da":"Samme model og data kan give et stærkt eller ubrugeligt resultat afhængigt af disse indstillinger, og at afsøge dem ganger prisen for træningen op."}},"deepDive":{"en":"Hyperparameters fall into several groups. Optimisation hyperparameters include the learning rate and its schedule (warmup length, decay shape), batch size, number of epochs or steps, momentum or Adam's β values, weight decay and gradient-clipping threshold. Architectural ones fix capacity: number of layers, hidden width, attention heads, dropout rate, context length. Data-side choices such as augmentation strength or the mixture weights of pretraining sources behave the same way, as do method-specific settings such as LoRA's rank r and scaling α or the KL coefficient in RLHF. Decoding settings such as temperature and top-p are sometimes also called hyperparameters, although they act at inference, not training. The boundary with learned parameters is a design choice: a temperature or a regularisation weight can be made learnable, at which point it stops being a hyperparameter.\n\nNot all hyperparameters matter equally, and the learning rate is usually the most sensitive (Goodfellow et al., §11.4). Grid search scales exponentially with the number of dimensions and wastes trials on unimportant ones; Bergstra and Bengio (2012) showed that random search finds equally good or better configurations with far fewer trials for exactly that reason. Scale-type hyperparameters should be searched on a log scale, for example learning rates from 10⁻⁵ to 10⁻¹. Bayesian optimisation fits a surrogate model of validation score against configuration (Gaussian processes (Snoek et al., 2012) or the tree-structured Parzen estimator used by default in Optuna) and chooses the next trial by an acquisition function. Multi-fidelity methods such as successive halving and Hyperband (Li et al., 2018) stop unpromising runs early, and population-based training (Jaderberg et al., 2017) mutates hyperparameters of running jobs.\n\nLarge models cannot be tuned by brute force, since a single run may cost millions. Practitioners tune small proxy models and extrapolate, either through empirical scaling fits for learning rate and batch size or through parametrisations such as μP (Yang et al., 2022), under which optimal hyperparameters stay approximately stable as width grows, allowing \"tune small, transfer large\".\n\nHyperparameter search is also a source of unfair comparisons and silent overfitting. Every configuration tried is a look at the validation set, so the chosen score is optimistically biased and the final number must come from an untouched test set or from nested cross-validation. Comparisons between methods are only fair at equal tuning budgets; Melis et al. (2018) found that carefully tuned LSTM language models outperformed several newer architectures that had been credited with gains. The random seed behaves like a hidden hyperparameter, so results should be reported over several seeds, and every run's configuration should be logged for reproducibility.","da":"Hyperparametre falder i flere grupper. Optimeringshyperparametre omfatter læringsraten og dens plan (opvarmningslængde, nedtrapningsform), batchstørrelse, antal epoker eller skridt, momentum eller Adams β-værdier, weight decay og tærsklen for klipning af gradienter. Arkitekturhyperparametre fastlægger kapaciteten: antal lag, skjult bredde, attention-hoveder, dropout-rate og kontekstlængde. Valg på datasiden som augmenteringsstyrke eller blandingsvægte for fortræningskilder opfører sig på samme måde, og det gør metodespecifikke indstillinger som LoRA's rang r og skalering α eller KL-koefficienten i RLHF. Dekodningsindstillinger som temperatur og top-p kaldes nogle gange også hyperparametre, selv om de virker ved inferens og ikke ved træning. Grænsen til lærte parametre er et designvalg: en temperatur eller en regulariseringsvægt kan gøres lærbar, og så holder den op med at være en hyperparameter.\n\nIkke alle hyperparametre betyder lige meget, og læringsraten er som regel den mest følsomme (Goodfellow m.fl., §11.4). Grid search vokser eksponentielt med antallet af dimensioner og spilder forsøg på uvigtige dimensioner; Bergstra og Bengio (2012) viste, at tilfældig søgning netop derfor finder lige så gode eller bedre konfigurationer med langt færre forsøg. Hyperparametre af skala-typen bør afsøges på logaritmisk skala, fx læringsrater fra 10⁻⁵ til 10⁻¹. Bayesiansk optimering tilpasser en surrogatmodel af valideringsscore som funktion af konfigurationen - gaussiske processer (Snoek m.fl., 2012) eller den træstrukturerede Parzen-estimator, som Optuna bruger som standard - og vælger næste forsøg via en acquisition-funktion. Multi-fidelity-metoder som successive halving og Hyperband (Li m.fl., 2018) stopper tidligt de kørsler, der ikke ser lovende ud, og population-based training (Jaderberg m.fl., 2017) muterer hyperparametrene for kørende job.\n\nStore modeller kan ikke tunes med rå kraft, når én kørsel kan koste millioner. Man tuner i stedet små stedfortrædermodeller og ekstrapolerer, enten via empiriske skaleringsfit for læringsrate og batchstørrelse eller via parametriseringer som μP (Yang m.fl., 2022), hvor de optimale hyperparametre forbliver omtrent stabile, når bredden vokser, så man kan \"tune småt og overføre til stort\".\n\nHyperparametersøgning er også en kilde til urimelige sammenligninger og skjult overtilpasning. Hver afprøvet konfiguration er et kig på valideringssættet, så den valgte score er for optimistisk, og det endelige tal skal komme fra et urørt testsæt eller fra nested krydsvalidering. Sammenligninger mellem metoder er kun fair ved samme tuningbudget; Melis m.fl. (2018) fandt, at omhyggeligt tunede LSTM-sprogmodeller slog flere nyere arkitekturer, der var blevet tilskrevet forbedringer. Tilfældighedsfrøet (seed) opfører sig som en skjult hyperparameter, så resultater bør rapporteres over flere seeds, og hver kørsels konfiguration bør logges af hensyn til reproducerbarhed."},"edges":[{"type":"requires","to":"ai/model-training","confidence":"high","strength":"normal"},{"type":"contrasts-with","to":"ai/model-parameter","why":{"en":"A hyperparameter is set by people before training; a model parameter is learned by the model during training.","da":"En hyperparameter sættes af mennesker før træningen; en modelparameter læres af modellen under træningen."},"confidence":"high","strength":"primary"},{"type":"used-with","to":"ai/regularization","why":{"en":"How strongly regularization holds a model back is itself a hyperparameter, chosen by trying values on a validation set.","da":"Hvor kraftigt regulariseringen holder en model tilbage, er selv en hyperparameter, der vælges ved at afprøve værdier på et valideringssæt."},"confidence":"high","strength":"normal"}],"depth":2,"sources":[{"title":"Goodfellow, Bengio & Courville, Deep Learning (ch. 5.3 and 11.4)","url":"https://www.deeplearningbook.org/contents/guidelines.html","tier":"textbook","publisher":"MIT Press"},{"title":"ISO/IEC 22989:2022, Artificial intelligence concepts and terminology","url":"https://www.iso.org/standard/74296.html","tier":"standard","publisher":"ISO/IEC"},{"title":"Bergstra & Bengio (2012), Random Search for Hyper-Parameter Optimization","url":"https://www.jmlr.org/papers/v13/bergstra12a.html","tier":"reference","publisher":"Journal of Machine Learning Research 13"}],"draft":true}