{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/supervised-learning","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/supervised-learning/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/supervised-learning/"},"term":{"en":"Supervised learning","da":"Superviseret læring"},"aka":{"en":[],"da":["supervised learning","overvåget læring"]},"domain":["ai"],"cluster":"ml-fundamentals","layer":"training","status":"current","summary":{"en":"Machine learning from examples that come with the right answer attached, such as emails already marked spam or not spam.","da":"Maskinlæring ud fra eksempler, hvor det rigtige svar følger med, fx mails der allerede er markeret som spam eller ikke spam."},"body":{"formal":{"en":"A form of machine learning in which each training example is paired with a label giving the wanted output, and the model learns to map new inputs to the right label.","da":"En form for maskinlæring, hvor hvert træningseksempel er parret med en mærkat, der angiver det ønskede resultat, og modellen lærer at knytte nye input til den rigtige mærkat."},"plain":{"en":"Like learning with an answer key. You try each exercise, check the key, and correct yourself.","da":"Som at lære med en facitliste - du prøver hver opgave, tjekker facit og retter dig selv."},"inPractice":{"en":"A region's security team labels thousands of past alerts as real attacks or false alarms, and a model trained on them learns to sort new alerts the same way.","da":"En regions sikkerhedsteam mærker tusindvis af tidligere alarmer som ægte angreb eller falske alarmer, og en model, der trænes på dem, lærer at sortere nye alarmer på samme måde."},"whyItMatters":{"en":"The model can only be as good as its labels; labels are often made by people paid per item, and their mistakes and biases become the model's.","da":"Modellen kan kun blive så god som sine mærkater; de laves ofte af mennesker betalt per stk., og deres fejl og fordomme bliver modellens."}},"deepDive":{"en":"Formally, supervised learning assumes a dataset of pairs (xᵢ, yᵢ) drawn from an unknown joint distribution P(X, Y) and seeks a function f from a hypothesis class that minimises expected loss E[L(f(X), Y)]. Since P is unknown, training minimises the empirical average over the sample, typically with regularisation. The output type sets the task: a discrete label gives classification (loss usually cross-entropy), a continuous value gives regression (loss usually squared or absolute error), and structured outputs such as sequences, bounding boxes or segmentation masks give structured prediction.\n\nEvaluation relies on held-out labelled data. k-fold cross-validation (k = 5 or 10 is conventional) estimates generalisation when data is scarce; with enough data a fixed train/validation/test split is used. Metrics must match the decision: accuracy is misleading under class imbalance, where precision, recall, F1, ROC-AUC or precision-recall curves are more informative, and regression is judged with MAE, RMSE or calibrated prediction intervals.\n\nThe label is the bottleneck. Labelling is expensive, slow and error-prone, and annotator disagreement is often genuine ambiguity rather than carelessness; measuring inter-annotator agreement (Cohen's or Fleiss' kappa) shows the ceiling a model can meaningfully reach. Techniques to reduce the burden include active learning (the model asks for labels on its most uncertain examples), weak supervision (noisy labels from heuristics and rules combined statistically), semi-supervised learning (a small labelled set plus a large unlabelled one), and starting from a pretrained model via transfer learning. A subtle failure is label leakage, where the label is recorded using information that the model also sees as input.\n\nSupervised learning learns the labelling process, not the underlying truth. If past alert triage was inconsistent, or loan decisions reflected discrimination, the model reproduces it faithfully and appears accurate against the same biased labels. It also assumes the mapping from inputs to labels stays stable; when attackers or markets change behaviour, performance degrades silently until someone relabels fresh data.\n\nThe boundaries with neighbouring paradigms are about where the target signal comes from. In unsupervised learning there is no target; in self-supervised learning the target is derived automatically from the input itself (a masked word, the next token); in reinforcement learning the only signal is a scalar reward that arrives after actions, without the correct action ever being shown. Instruction tuning of language models is supervised learning on human-written prompt and response pairs.","da":"Formelt antager superviseret læring et datasæt af par (xᵢ, yᵢ) trukket fra en ukendt simultan fordeling P(X, Y) og søger en funktion f i en hypoteseklasse, der minimerer det forventede tab E[L(f(X), Y)]. Da P er ukendt, minimerer træningen i stedet gennemsnittet over stikprøven, typisk med regularisering. Outputtypen bestemmer opgaven: En diskret mærkat giver klassifikation (tabet er som regel krydsentropi), en kontinuert værdi giver regression (tabet er som regel kvadreret eller absolut fejl), og strukturerede output som sekvenser, afgrænsningsbokse eller segmenteringsmasker giver struktureret forudsigelse.\n\nEvalueringen hviler på tilbageholdte mærkede data. k-fold-krydsvalidering (k = 5 eller 10 er konvention) estimerer generaliseringen, når data er knappe; med tilstrækkelige data bruges en fast opdeling i trænings-, validerings- og testsæt. Målene skal passe til beslutningen: Nøjagtighed er misvisende ved klasseubalance, hvor præcision, recall, F1, ROC-AUC eller precision-recall-kurver er mere informative, og regression bedømmes med MAE, RMSE eller kalibrerede prædiktionsintervaller.\n\nMærkaten er flaskehalsen. Mærkning er dyr, langsom og fejlbehæftet, og uenighed mellem annotatorer er ofte reel tvetydighed frem for sjusk; måling af enighed mellem annotatorer (Cohens eller Fleiss' kappa) viser det loft, en model meningsfuldt kan nå. Teknikker, der letter byrden, omfatter active learning (modellen beder om mærkater på de eksempler, den er mest usikker på), weak supervision (støjende mærkater fra heuristikker og regler kombineret statistisk), semi-superviseret læring (et lille mærket sæt plus et stort umærket) og at starte fra en fortrænet model via overførselslæring. En lumsk fejl er label-lækage, hvor mærkaten registreres ud fra information, som modellen også ser som input.\n\nSuperviseret læring lærer mærkningsprocessen, ikke den underliggende sandhed. Hvis tidligere triage af alarmer var inkonsekvent, eller lånebeslutninger afspejlede diskrimination, gengiver modellen det trofast og ser nøjagtig ud målt mod de samme skæve mærkater. Den antager også, at sammenhængen mellem input og mærkater er stabil; når angribere eller markeder ændrer adfærd, falder præstationen i det stille, indtil nogen mærker friske data.\n\nGrænserne til naboparadigmerne handler om, hvor målsignalet kommer fra. I ikke-superviseret læring er der intet mål; i selvsuperviseret læring udledes målet automatisk af selve inputtet (et maskeret ord, det næste token); i forstærkningslæring er det eneste signal en skalar belønning, der kommer efter handlingerne, uden at den rigtige handling nogensinde vises. Instruction tuning af sprogmodeller er superviseret læring på menneskeskrevne par af prompt og svar."},"edges":[{"type":"requires","to":"ai/training-data","confidence":"high","strength":"normal"},{"type":"requires","to":"ai/label","confidence":"high","strength":"normal"},{"type":"kind-of","to":"ai/machine-learning","confidence":"high","strength":"normal"},{"type":"contrasts-with","to":"ai/unsupervised-learning","why":{"en":"Supervised learning is given the right answers to learn from; unsupervised learning gets no answers and must find groups or oddities by itself.","da":"Superviseret læring får de rigtige svar at lære af; ikke-superviseret læring får ingen svar og må selv finde grupper eller afvigelser."},"confidence":"high","strength":"primary"}],"depth":1,"sources":[{"title":"Russell & Norvig (2020), Artificial Intelligence: A Modern Approach, 4th edition","url":"https://aima.cs.berkeley.edu/","tier":"textbook","publisher":"Pearson"},{"title":"ISO/IEC 22989:2022, Information technology: Artificial intelligence concepts and terminology","url":"https://www.iso.org/standard/74296.html","tier":"standard","publisher":"ISO/IEC"}],"draft":true}