{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/overfitting","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/overfitting/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/overfitting/"},"term":{"en":"Overfitting","da":"Overtilpasning (overfitting)"},"aka":{"en":[],"da":["overfitting"]},"domain":["ai"],"cluster":"ml-fundamentals","layer":"training","status":"current","summary":{"en":"When a model learns its training examples by heart, including their noise, and then does badly on new cases it has not seen.","da":"Når en model lærer sine træningseksempler udenad, inklusive tilfældig støj, og derefter klarer sig dårligt på nye tilfælde."},"body":{"formal":{"en":"A failure of model training in which a model fits the training data too closely, so it scores well on that data but poorly on new data; found by testing on data held back from training.","da":"En fejl i modeltræningen, hvor en model tilpasser sig træningsdata for tæt, så den scorer godt på de data, men dårligt på nye; opdages ved at teste på data, der er holdt uden for træningen."},"plain":{"en":"Like a student who learns last year's exam answers by heart, word for word, and then fails when the questions are slightly changed.","da":"Som en studerende, der lærer sidste års eksamenssvar udenad ord for ord og så dumper, når spørgsmålene er en smule ændret."},"inPractice":{"en":"A pension fund's fraud model finds almost every false claim among the cases it was trained on, but misses most real fraud once live, because it learned details found only in those old cases.","da":"En pensionskasses svindelmodel finder næsten alle falske anmeldelser blandt de sager, den er trænet på, men overser det meste rigtige svindel i drift, fordi den har lært detaljer, der kun fandtes i de gamle sager."},"whyItMatters":{"en":"It makes a model look better on paper than in real use, and a model that has learned examples by heart can later repeat private details from its training data.","da":"Det får en model til at se bedre ud på papiret end i virkeligheden, og en model, der har lært eksempler udenad, kan senere gentage private oplysninger fra sine træningsdata."}},"deepDive":{"en":"Overfitting is measured by the generalisation gap: the difference between error on the training data and error on data from the same distribution that the model never saw. The classical explanation is the bias-variance decomposition of expected squared error into bias squared, variance and irreducible noise. Simple models have high bias and underfit; very flexible models have high variance, meaning their fit changes a lot with the particular sample, and overfit. The textbook picture is a U-shaped test-error curve as model capacity grows, with the best model at the bottom of the U.\n\nDetection requires honest held-out evaluation: a validation set or k-fold cross-validation for model selection, and an untouched test set for the final number. Learning curves showing training loss still falling while validation loss rises are the typical signature, and early stopping halts training at the validation minimum. A related but distinct problem is overfitting to the validation or test set itself, through repeated tuning against it or by picking the best of many runs; public benchmarks suffer from this at community scale.\n\nStandard countermeasures are more or more diverse data, data augmentation, reducing capacity, and regularisation: L2 penalties (weight decay, ridge) shrink weights, L1 penalties (lasso) drive some to zero, and dropout (Srivastava et al., 2014) randomly disables units during training; the paper keeps each hidden unit with probability 0.5 and each input unit with a higher probability, around 0.8. Ensembles and bagging reduce variance by averaging models. Starting from a pretrained model through transfer learning also helps when task data is small.\n\nDeep learning complicates the classical story. Zhang et al. (2017) showed that standard image networks can reach zero training error on randomly assigned labels, so capacity alone cannot explain why they generalise on real labels. Belkin et al. (2019) described double descent: test error can rise near the interpolation threshold, where the model just fits the training set, and then fall again as models grow much larger. Large overparameterised models can therefore generalise well despite fitting the training data perfectly, which is why parameter count is a poor proxy for overfitting risk.\n\nOverfitting and memorisation are related but not identical. A model can generalise well on average while still memorising rare or duplicated training sequences verbatim. Carlini et al. (2021) extracted verbatim training examples, including names, phone numbers and email addresses, from GPT-2, even some that appeared only once in the training data, and membership inference attacks (Shokri et al., 2017) exploit the confidence difference between seen and unseen records to test whether a record was in the training set. Deduplication and differential privacy during training (DP-SGD) are the main technical mitigations.","da":"Overtilpasning måles med generaliseringsgabet: forskellen mellem fejlen på træningsdata og fejlen på data fra samme fordeling, som modellen aldrig har set. Den klassiske forklaring er bias-varians-dekompositionen af den forventede kvadrerede fejl i bias i anden, varians og irreducibel støj. Simple modeller har høj bias og undertilpasser; meget fleksible modeller har høj varians, dvs. deres tilpasning ændrer sig meget med den konkrete stikprøve, og overtilpasser. Lærebogsbilledet er en U-formet testfejlkurve, når modelkapaciteten vokser, med den bedste model i bunden af U'et.\n\nOpdagelse kræver ærlig evaluering på tilbageholdte data: et valideringssæt eller k-fold-krydsvalidering til modelvalg og et urørt testsæt til det endelige tal. Læringskurver, hvor træningstabet stadig falder, mens valideringstabet stiger, er det typiske kendetegn, og early stopping stopper træningen ved valideringsminimum. Et beslægtet, men særskilt problem er overtilpasning til selve validerings- eller testsættet gennem gentagen tuning mod det eller ved at vælge den bedste af mange kørsler; offentlige benchmarks lider under dette i fællesskabsskala.\n\nDe almindelige modtræk er flere eller mere varierede data, dataaugmentering, mindre kapacitet og regularisering: L2-straf (weight decay, ridge) skrumper vægtene, L1-straf (lasso) sætter nogle af dem til nul, og dropout (Srivastava m.fl., 2014) slår tilfældigt enheder fra under træning; artiklen beholder hver skjult enhed med sandsynlighed 0,5 og hver inputenhed med en højere sandsynlighed, omkring 0,8. Ensembler og bagging reducerer variansen ved at tage gennemsnit over modeller. At starte fra en fortrænet model via overførselslæring hjælper også, når der er få opgavedata.\n\nDeep learning komplicerer den klassiske fortælling. Zhang m.fl. (2017) viste, at almindelige billednetværk kan nå nul træningsfejl på tilfældigt tildelte mærkater, så kapacitet alene kan ikke forklare, hvorfor de generaliserer på rigtige mærkater. Belkin m.fl. (2019) beskrev double descent: Testfejlen kan stige nær interpolationstærsklen, hvor modellen netop kan passe træningssættet, og derefter falde igen, når modellerne bliver meget større. Store overparametriserede modeller kan altså generalisere godt, selv om de passer træningsdata perfekt, og derfor er antallet af parametre en dårlig indikator for risikoen for overtilpasning.\n\nOvertilpasning og udenadslære hænger sammen, men er ikke det samme. En model kan generalisere godt i gennemsnit og alligevel huske sjældne eller gentagne træningssekvenser ordret. Carlini m.fl. (2021) udtrak ordrette træningseksempler, herunder navne, telefonnumre og e-mailadresser, fra GPT-2, også nogle, der kun optrådte én gang i træningsdata, og membership inference-angreb (Shokri m.fl., 2017) udnytter forskellen i sikkerhed mellem sete og usete poster til at teste, om en post var med i træningssættet. Deduplikering og differentiel privatliv under træningen (DP-SGD) er de vigtigste tekniske afhjælpninger."},"edges":[{"type":"requires","to":"ai/model-training","confidence":"high","strength":"normal"},{"type":"requires","to":"ai/training-data","confidence":"high","strength":"normal"},{"type":"contrasts-with","to":"ai/underfitting","why":{"en":"Overfitting learns the examples too closely and fails on new cases; underfitting has not learned enough to do well even on the examples it saw.","da":"Overtilpasning lærer eksemplerne for tæt og fejler på nye tilfælde; undertilpasning har ikke lært nok til at klare sig godt selv på de eksempler, den har set."},"confidence":"medium","strength":"normal"},{"type":"causes","to":"security/data-breach","why":{"en":"A model that has learned its examples by heart can be made to repeat personal data from them word for word.","da":"En model, der har lært sine eksempler udenad, kan bringes til at gentage personoplysninger fra dem ordret."},"confidence":"medium","strength":"minor"}],"depth":2,"sources":[{"title":"Goodfellow, Bengio & Courville (2016), Deep Learning","url":"https://www.deeplearningbook.org/","tier":"textbook","publisher":"MIT Press"},{"title":"Russell & Norvig (2020), Artificial Intelligence: A Modern Approach, 4th edition","url":"https://aima.cs.berkeley.edu/","tier":"textbook","publisher":"Pearson"},{"title":"Carlini et al. (2021), Extracting Training Data from Large Language Models","url":"https://www.usenix.org/conference/usenixsecurity21/presentation/carlini-extracting","tier":"reference","publisher":"USENIX Security Symposium"},{"title":"Srivastava et al. (2014), Dropout: A Simple Way to Prevent Neural Networks from Overfitting","url":"https://jmlr.org/papers/v15/srivastava14a.html","tier":"reference","publisher":"Journal of Machine Learning Research"},{"title":"Zhang et al. (2017), Understanding Deep Learning Requires Rethinking Generalization","url":"https://arxiv.org/abs/1611.03530","tier":"reference","publisher":"ICLR 2017"},{"title":"Belkin et al. (2019), Reconciling Modern Machine-Learning Practice and the Classical Bias-Variance Trade-off","url":"https://arxiv.org/abs/1812.11118","tier":"reference","publisher":"PNAS"},{"title":"Shokri et al. (2017), Membership Inference Attacks Against Machine Learning Models","url":"https://arxiv.org/abs/1610.05820","tier":"reference","publisher":"IEEE Symposium on Security and Privacy"}],"draft":true}