{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/data-labeling","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/data-labeling/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/data-labeling/"},"term":{"en":"Data labeling","da":"Datamærkning (data labeling)"},"aka":{"en":["data annotation","data labelling"],"da":["data labeling","annotering"]},"domain":["ai"],"cluster":"training","layer":"training","status":"current","summary":{"en":"Having people (or tools) attach the right answer to each example, such as “cat”, “complaint” or “angry”, so a model can learn from it.","da":"At lade mennesker (eller værktøjer) sætte det rigtige svar på hvert eksempel - “kat”, “klage”, “vred” - så en model kan lære af det."},"body":{"formal":{"en":"The work of adding the correct output to each input in a data set, producing the answered examples that supervised learning needs as training data and that evaluation needs as a reference.","da":"Arbejdet med at tilføje det korrekte output til hvert input i et datasæt, så man får de besvarede eksempler, som superviseret læring kræver som træningsdata, og som man bruger som reference, når modellen skal bedømmes."},"plain":{"en":"Like writing the answer on the back of every flash card before a pupil starts practising with the deck.","da":"Som at skrive svaret på bagsiden af hvert kort, før en elev begynder at øve sig med bunken."},"inPractice":{"en":"In a Danish region, two hospital doctors mark tumours on 10,000 scans; where they disagree, a third decides, and the marked scans become training data for a model that flags suspect cases.","da":"I en region markerer to hospitalslæger svulster på 10.000 scanninger; hvor de er uenige, afgør en tredje, og de markerede scanninger bliver træningsdata til en model, der udpeger mistænkelige tilfælde."},"whyItMatters":{"en":"A model can only be as good as the answers it learns from; rushed, poorly paid or one-sided labelling passes straight into the model's errors and bias.","da":"En model kan kun blive så god som de svar, den lærer af; forhastet, dårligt betalt eller skæv datamærkning går direkte videre i modellens fejl og bias."}},"deepDive":{"en":"Labelling covers very different annotation types: document- or image-level class labels, bounding boxes, polygons and pixel masks for vision, span and relation annotation for named-entity recognition, relevance judgements for search, transcripts for speech, and pairwise preference rankings for RLHF. Each project rests on a written guideline (a codebook) defining every label with positive and negative examples and explicit rules for edge cases, refined in pilot rounds until annotators converge. Quality control in production relies on gold items with known answers mixed into the queue, overlap where several annotators label the same item, and review or adjudication of disagreements. Open-source tools such as Label Studio and CVAT handle queues, overlap and export formats.\n\nInter-annotator agreement quantifies how well-defined the task is. Cohen's kappa corrects two-rater agreement for chance, Fleiss' kappa extends this to many raters, and Krippendorff's alpha handles missing ratings and ordinal or interval scales. Low agreement usually indicates an ambiguous guideline or a genuinely subjective task rather than careless annotators, and it sets a ceiling on measurable model performance. Multiple labels can be aggregated by majority vote, by an adjudicator, or by probabilistic models such as Dawid and Skene's (1979) EM approach, which estimates a confusion matrix per annotator; some teams keep the label distribution as a soft target instead of forcing a single answer.\n\nBecause labelling is expensive, much effort goes into doing less of it. Active learning queries the examples a current model is least certain about; weak supervision, as in Snorkel (Ratner et al., 2017), combines noisy programmatic labelling functions into probabilistic labels; and model-assisted pre-labelling or LLM-generated labels let humans correct rather than create. Pre-labelling speeds work but anchors annotators towards the model's suggestion, which can hide exactly the errors the project needs to find. Label errors are common even in famous data sets: Northcutt et al. (2021) estimated an average of at least 3.3% across ten benchmark test sets, and confident-learning tools such as cleanlab are used to flag likely mislabelled items for review.\n\nLabelling is also a compliance and supply-chain activity. Under the EU AI Act, data governance for high-risk systems must cover data-preparation operations \"such as annotation, labelling, cleaning\" (Art. 10(2)(c)). When annotators see personal data, an external labelling vendor is a processor under GDPR Art. 28, requiring a data processing agreement and, for work done outside the EEA, a Chapter V transfer basis. Working conditions are a known risk: in 2023 TIME reported that Kenyan workers labelling toxic content for OpenAI via the contractor Sama were paid less than two dollars an hour.","da":"Datamærkning dækker meget forskellige annoteringstyper: klasselabels på dokument- eller billedniveau, bounding boxes, polygoner og pixelmasker til computersyn, annotering af spænd og relationer til named-entity recognition, relevansvurderinger til søgning, transskriptioner til tale og parvise præferencerangeringer til RLHF. Hvert projekt hviler på en skriftlig mærkningsvejledning (en kodebog), der definerer hver label med positive og negative eksempler og eksplicitte regler for grænsetilfælde, og som forfines i pilotrunder, indtil annotatorerne er enige. Kvalitetskontrol i drift bygger på guldeksempler med kendt svar blandet ind i køen, overlap, hvor flere annotatorer mærker samme eksempel, og gennemgang eller afgørelse af uenigheder. Open source-værktøjer som Label Studio og CVAT håndterer køer, overlap og eksportformater.\n\nEnighed mellem annotatorer viser, hvor veldefineret opgaven er. Cohens kappa korrigerer enighed mellem to bedømmere for tilfældighed, Fleiss' kappa udvider det til mange, og Krippendorffs alfa håndterer manglende bedømmelser og ordinale eller intervalskalaer. Lav enighed skyldes som regel en tvetydig vejledning eller en reelt subjektiv opgave snarere end sjuskede annotatorer, og den sætter et loft for, hvor god en model kan måles til at være. Flere labels kan samles ved flertalsafstemning, af en afgører eller med probabilistiske modeller som Dawid og Skenes EM-metode (1979), der estimerer en forvekslingsmatrix pr. annotator; nogle teams beholder fordelingen af labels som et blødt mål i stedet for at tvinge ét svar igennem.\n\nFordi mærkning er dyr, går meget arbejde ud på at gøre mindre af den. Active learning udvælger de eksempler, den nuværende model er mest usikker på; weak supervision, som i Snorkel (Ratner m.fl., 2017), kombinerer støjfyldte programmatiske mærkningsfunktioner til probabilistiske labels; og modelstøttet formærkning eller labels genereret af en LLM lader mennesker rette i stedet for at skabe. Formærkning gør arbejdet hurtigere, men forankrer annotatorerne i modellens forslag, hvilket kan skjule netop de fejl, projektet skal finde. Fejl i labels er almindelige selv i berømte datasæt: Northcutt m.fl. (2021) anslog i gennemsnit mindst 3,3 % på tværs af ti benchmark-testsæt, og værktøjer til confident learning som cleanlab bruges til at markere sandsynligt fejlmærkede eksempler til gennemsyn.\n\nDatamærkning er også en compliance- og leverandørkædeopgave. Efter EU's AI-forordning skal datastyring for højrisikosystemer omfatte dataforberedende behandlinger som annotering, mærkning og rensning (art. 10, stk. 2, litra c). Når annotatorer ser personoplysninger, er en ekstern mærkningsleverandør databehandler efter databeskyttelsesforordningens art. 28, hvilket kræver en databehandleraftale og, ved arbejde uden for EØS, et overførselsgrundlag efter kapitel V. Arbejdsvilkår er en kendt risiko: i 2023 beskrev TIME, at kenyanske arbejdere, der mærkede giftigt indhold for OpenAI via underleverandøren Sama, fik under to dollars i timen."},"edges":[{"type":"requires","to":"ai/training-data","confidence":"high","strength":"normal"},{"type":"part-of","to":"ai/supervised-learning","why":{"en":"Supervised learning cannot start until each example carries its correct answer.","da":"Superviseret læring kan ikke begynde, før hvert eksempel har sit korrekte svar."},"confidence":"high","strength":"primary"},{"type":"causes","to":"ai/ai-bias","why":{"en":"The labelers' own views and shortcuts become the model's idea of the truth.","da":"Mærkernes egne holdninger og genveje bliver modellens opfattelse af sandheden."},"confidence":"high","strength":"normal"}],"depth":1,"sources":[{"title":"ISO/IEC 22989:2022, Artificial intelligence concepts and terminology","url":"https://www.iso.org/standard/74296.html","tier":"standard","publisher":"ISO/IEC"},{"title":"NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0)","url":"https://doi.org/10.6028/NIST.AI.100-1","tier":"standard","publisher":"NIST"},{"title":"Northcutt, Athalye & Mueller (2021), Pervasive Label Errors in Test Sets Destabilize Machine Learning Benchmarks","url":"https://arxiv.org/abs/2103.14749","tier":"reference","publisher":"NeurIPS 2021 Datasets and Benchmarks"},{"title":"Regulation (EU) 2024/1689 (Artificial Intelligence Act), Article 10","url":"https://eur-lex.europa.eu/eli/reg/2024/1689/oj","tier":"standard","publisher":"European Union"}],"draft":true}