{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/machine-learning","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/machine-learning/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/machine-learning/"},"term":{"en":"Machine learning","da":"Maskinlæring"},"aka":{"en":["ML"],"da":["ML","machine learning"]},"domain":["ai"],"cluster":"ml-fundamentals","layer":"theory","status":"current","era":1959,"summary":{"en":"Building computer systems that find patterns in examples and use them to make guesses, instead of following rules a person wrote.","da":"At bygge computersystemer, der finder mønstre i eksempler og gætter ud fra dem i stedet for at følge regler skrevet af et menneske."},"body":{"formal":{"en":"A branch of AI in which a program improves at a task by adjusting its own internal numbers from training data, so that its behaviour comes from the data rather than from hand-written instructions.","da":"En gren af AI, hvor et program bliver bedre til en opgave ved at justere sine egne interne tal ud fra træningsdata, så dets adfærd kommer fra data frem for fra håndskrevne instruktioner."},"plain":{"en":"Like learning to tell ripe from unripe fruit by handling thousands of pieces, rather than being handed a written list of rules.","da":"Som at lære at skelne moden fra umoden frugt ved at håndtere tusindvis af stykker, i stedet for at få udleveret en skreven regelbog."},"inPractice":{"en":"A Danish bank's fraud system is shown millions of past card payments marked genuine or fraudulent, and learns to flag new payments that resemble the fraudulent ones for a person to review.","da":"En dansk banks svindelsystem får vist millioner af tidligere kortbetalinger mærket som ægte eller svindel og lærer at markere nye betalinger, der ligner svindel, så en medarbejder kan se på dem."},"whyItMatters":{"en":"Because the behaviour comes from data, nobody wrote down the rules, so the quality, fairness and safety of the result depend on the data and are harder to check.","da":"Fordi adfærden kommer fra data, har ingen skrevet reglerne ned - så resultatets kvalitet, retfærdighed og sikkerhed afhænger af data og er sværere at kontrollere."}},"deepDive":{"en":"Arthur Samuel used the phrase in his 1959 paper on a checkers program that improved by playing against itself. The most cited formal definition is Tom Mitchell's (1997): a program learns from experience E with respect to a class of tasks T and performance measure P if its performance at T, as measured by P, improves with E. In modern terms, most machine learning is empirical risk minimisation: choose a model family (linear models, decision trees, neural networks), a loss function that scores errors, and an optimisation procedure that finds the parameters minimising the average loss over the training data, usually with a regularisation term that penalises complexity.\n\nThe goal is not low training error but generalisation to unseen data. The theory behind this rests on the assumption that training and future data are drawn independently from the same distribution (i.i.d.). Valiant's PAC framework (1984) and later VC theory give bounds on how much data a model class needs to generalise. In practice the assumption is routinely violated by distribution shift: covariate shift (input mix changes), label or prior shift (base rates change) and concept drift (the relationship itself changes, as when fraudsters adapt). Deployed models therefore need monitoring and periodic retraining, not a one-time sign-off.\n\nThe field is usually divided by the kind of feedback available: supervised learning (labelled examples, giving classification and regression), unsupervised learning (structure without labels), self-supervised learning (labels derived from the data itself, the basis of foundation models) and reinforcement learning (reward signals from interaction). Classical methods such as logistic regression, support vector machines and gradient-boosted trees remain the strongest choice for many tabular business problems; deep learning dominates for images, audio and text.\n\nMachine learning overlaps heavily with statistics but differs in emphasis: statistics traditionally targets interpretable parameters and inference about a population, whereas ML prioritises predictive accuracy on held-out data, measured with a strict split into training, validation and test sets. A frequent practical failure is data leakage, where information unavailable at prediction time (a future timestamp, a field filled in after the outcome) slips into the features and inflates offline scores.\n\nGovernance consequences follow from the mechanism. Because behaviour is induced from data rather than specified, documentation must cover the data and the training procedure as well as the code: tools such as model cards and datasheets for datasets, and requirements such as Article 10 (data governance) and Article 11 (technical documentation) of the EU AI Act for high-risk systems, exist precisely because the rules cannot be read from source code.","da":"Arthur Samuel brugte udtrykket i sin artikel fra 1959 om et damprogram, der blev bedre ved at spille mod sig selv. Den mest citerede formelle definition er Tom Mitchells (1997): Et program lærer af erfaring E med hensyn til en klasse af opgaver T og et præstationsmål P, hvis dets præstation på T, målt med P, forbedres med E. I moderne termer er det meste maskinlæring empirisk risikominimering: Man vælger en modelfamilie (lineære modeller, beslutningstræer, neurale netværk), en tabsfunktion, der scorer fejl, og en optimeringsprocedure, der finder de parametre, som minimerer det gennemsnitlige tab over træningsdata, som regel med et regulariseringsled, der straffer kompleksitet.\n\nMålet er ikke lav træningsfejl, men generalisering til usete data. Teorien bag hviler på antagelsen om, at trænings- og fremtidige data trækkes uafhængigt fra samme fordeling (i.i.d.). Valiants PAC-ramme (1984) og senere VC-teorien giver grænser for, hvor mange data en modelklasse kræver for at generalisere. I praksis brydes antagelsen jævnligt af distributionsskift: kovariatskift (sammensætningen af input ændrer sig), label- eller prior-skift (basisrater ændrer sig) og concept drift (selve sammenhængen ændrer sig, fx når svindlere tilpasser sig). Udrullede modeller kræver derfor overvågning og løbende gentræning, ikke en engangsgodkendelse.\n\nFeltet opdeles normalt efter, hvilken feedback der er til rådighed: superviseret læring (mærkede eksempler, som giver klassifikation og regression), ikke-superviseret læring (struktur uden mærkater), selvsuperviseret læring (mærkater udledt af data selv, grundlaget for foundation models) og forstærkningslæring (belønningssignaler fra interaktion). Klassiske metoder som logistisk regression, support vector machines og gradient-boostede træer er stadig det stærkeste valg til mange tabelbaserede forretningsproblemer; deep learning dominerer for billeder, lyd og tekst.\n\nMaskinlæring overlapper kraftigt med statistik, men lægger vægten anderledes: Statistik sigter traditionelt mod fortolkelige parametre og slutninger om en population, mens ML prioriterer forudsigelsesnøjagtighed på tilbageholdte data, målt med en streng opdeling i trænings-, validerings- og testsæt. En hyppig praktisk fejl er datalækage, hvor information, der ikke er tilgængelig på forudsigelsestidspunktet (et fremtidigt tidsstempel, et felt udfyldt efter udfaldet), sniger sig ind i features og puster offline-resultaterne op.\n\nKonsekvenserne for governance følger af mekanismen. Fordi adfærden udledes af data frem for at blive specificeret, skal dokumentationen dække data og træningsprocedure lige så vel som koden: Værktøjer som model cards og datasheets for datasets og krav som artikel 10 (data og datastyring) og artikel 11 (teknisk dokumentation) i AI-forordningen for højrisikosystemer findes netop, fordi reglerne ikke kan læses ud af kildekoden."},"edges":[{"type":"requires","to":"ai/training-data","confidence":"high","strength":"normal"},{"type":"kind-of","to":"ai/artificial-intelligence","confidence":"high","strength":"normal"}],"depth":1,"sources":[{"title":"Russell & Norvig, Artificial Intelligence: A Modern Approach","url":"https://aima.cs.berkeley.edu/","tier":"textbook","publisher":"Pearson"},{"title":"ISO/IEC 22989:2022, Artificial intelligence concepts and terminology","url":"https://www.iso.org/standard/74296.html","tier":"standard","publisher":"ISO/IEC"},{"title":"Samuel (1959), Some Studies in Machine Learning Using the Game of Checkers","url":"https://doi.org/10.1147/rd.33.0210","tier":"reference","publisher":"IBM Journal of Research and Development"},{"title":"Regulation (EU) 2024/1689 (Artificial Intelligence Act), Articles 10 and 11","url":"https://eur-lex.europa.eu/eli/reg/2024/1689/oj","tier":"standard","publisher":"European Union"}],"draft":true}