{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/model-evaluation","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/model-evaluation/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/model-evaluation/"},"term":{"en":"Model evaluation (evals)","da":"Modelevaluering (evals)"},"aka":{"en":["AI evaluation"],"da":["AI-evaluering"]},"domain":["ai"],"cluster":"evaluation","layer":"model","status":"current","summary":{"en":"The practice of checking how well an AI system does its job, with scores, public tests, human review and deliberate attacks.","da":"Praksis med at kontrollere, hvor godt et AI-system løser sin opgave - med tal, offentlige tests, menneskelig gennemgang og bevidste angreb."},"body":{"formal":{"en":"The planned measuring of a model or AI system against goals for quality, safety and fairness, combining numbers such as accuracy and the F1 score, benchmark results, human review, LLM-as-a-judge grading and AI red teaming.","da":"Den planlagte måling af en model eller et AI-system op imod mål for kvalitet, sikkerhed og retfærdighed, som kombinerer tal som nøjagtighed og F1-score, benchmarkresultater, menneskelig gennemgang, LLM som dommer og AI red teaming."},"plain":{"en":"Like a car's road trials before sale, with speed runs on the track, crash checks, drivers' opinions and people trying hard to make it fail.","da":"Som en bils prøvekørsler før salg - fartløb på banen, kollisionsforsøg, førernes meninger og folk, der gør alt for at få den til at svigte."},"inPractice":{"en":"Before moving its tenant chat to a newer large language model, a housing association's IT lead reruns 500 saved tenant questions, has staff grade a sample of the answers, and switches only if nothing gets worse.","da":"Før lejerchatten flyttes til en nyere stor sprogmodel, kører et boligselskabs IT-ansvarlige 500 gemte spørgsmål fra lejere igen, lader medarbejdere bedømme et udvalg af svarene og skifter kun, hvis intet bliver dårligere."},"whyItMatters":{"en":"Without regular checks nobody knows whether a change made the system better, worse or unsafe, and the EU AI Act demands documented testing for systems used in areas such as hiring, credit scoring or welfare decisions.","da":"Uden faste kontroller ved ingen, om en ændring gjorde systemet bedre, dårligere eller usikkert, og EU's AI-forordning kræver dokumenteret test af systemer, der bruges til fx ansættelse, kreditvurdering eller afgørelser om sociale ydelser."}},"deepDive":{"en":"Model evaluation spans several layers that answer different questions. Offline evaluation scores a frozen model on held-out test sets and public benchmarks; human evaluation has experts or users rate outputs where no automatic metric is valid; LLM-as-a-judge automates part of that rating; adversarial testing and AI red teaming probe for failures an average-case metric never samples; and online evaluation (A/B tests, shadow deployments, production monitoring) measures behaviour on the real input distribution. For LLM applications an eval suite is usually code: a versioned data set of inputs, one or more graders (exact match, regex or schema checks, executing generated code, embedding similarity, model-graded rubrics) and a harness that runs in CI so that a prompt, retrieval or model change cannot ship if it regresses.\n\nMost failures of evaluation are failures of validity rather than arithmetic. Construct validity asks whether the metric measures the property that matters; external validity asks whether the test distribution matches production, which breaks under data drift or when a demo set was hand-picked. Aggregate scores hide subgroup failures, so results should be sliced by language, customer segment, document type or protected characteristic. Scores carry sampling error and should be reported with bootstrap or binomial confidence intervals. Generative models are non-deterministic, so each item should be sampled several times; pass@k (at least one of k attempts succeeds) and pass^k (all k succeed, as used in τ-bench) answer very different reliability questions.\n\nGovernance frameworks treat evaluation as a lifecycle duty. NIST AI RMF 1.0 (NIST AI 100-1, 2023) places test, evaluation, verification and validation (TEVV) under its Measure function, and NIST AI 600-1 extends this to generative AI. ISO/IEC TS 4213:2022 specifies how to assess classification performance. The EU AI Act requires high-risk systems to be tested against \"prior defined metrics and probabilistic thresholds\" before being placed on the market (Art. 9(8)), to reach an appropriate level of accuracy, robustness and cybersecurity with the metrics declared in the instructions for use (Art. 15), and to be followed up by post-market monitoring (Art. 72); providers of general-purpose models with systemic risk must perform model evaluations including adversarial testing (Art. 55(1)(a)). The AI Omnibus, Regulation (EU) 2026/1744, in force since 27 July 2026, deferred the Annex III high-risk obligations to 2 December 2027 and those for high-risk AI in products under Annex I to 2 August 2028.\n\nEvaluation must be kept separate from training: if test results drive repeated changes, the test set becomes a validation set and its score is optimistically biased. Good practice therefore freezes a test split, logs every evaluation run with model, prompt and data versions, and refreshes evaluation data when it has been seen too often. Comparing numbers across organisations is only meaningful when the harness, prompts and decoding settings are identical.","da":"Modelevaluering består af flere lag, der besvarer forskellige spørgsmål. Offline-evaluering scorer en fastfrosset model på tilbageholdte testsæt og offentlige benchmarks; menneskelig evaluering lader eksperter eller brugere bedømme output, hvor intet automatisk mål er gyldigt; LLM som dommer automatiserer en del af den bedømmelse; adversarial test og AI red teaming leder efter fejl, som et gennemsnitsmål aldrig rammer; og online-evaluering (A/B-test, skyggedrift, overvågning i produktion) måler adfærden på den reelle inputfordeling. For LLM-applikationer er en eval-suite typisk kode: et versioneret datasæt af input, en eller flere bedømmere (eksakt match, regex- eller skematjek, kørsel af genereret kode, embedding-lighed, modelbedømte guider) og en harness, der kører i CI, så en ændring af prompt, retrieval eller model ikke kan udrulles, hvis den giver tilbagegang.\n\nDe fleste fejl i evaluering handler om validitet, ikke regnestykker. Begrebsvaliditet spørger, om målet måler den egenskab, der betyder noget; ekstern validitet spørger, om testfordelingen svarer til driften, hvilket brister ved datadrift, eller når et demosæt er håndplukket. Samlede scorer skjuler fejl i undergrupper, så resultater bør opdeles efter sprog, kundesegment, dokumenttype eller beskyttede karakteristika. Scorer har stikprøveusikkerhed og bør rapporteres med bootstrap- eller binomiale konfidensintervaller. Generative modeller er ikke-deterministiske, så hvert testtilfælde bør køres flere gange; pass@k (mindst ét af k forsøg lykkes) og pass^k (alle k lykkes, som i τ-bench) besvarer vidt forskellige spørgsmål om pålidelighed.\n\nGovernance-rammer behandler evaluering som en pligt gennem hele livscyklussen. NIST AI RMF 1.0 (NIST AI 100-1, 2023) placerer test, evaluering, verifikation og validering (TEVV) under funktionen Measure, og NIST AI 600-1 udvider det til generativ AI. ISO/IEC TS 4213:2022 beskriver, hvordan klassifikationsydelse vurderes. EU's AI-forordning kræver, at højrisikosystemer testes mod på forhånd fastlagte målinger og sandsynlighedsbaserede tærskler, før de bringes i omsætning (art. 9, stk. 8), at de opnår et passende niveau af nøjagtighed, robusthed og cybersikkerhed med målene angivet i brugsanvisningen (art. 15), og at de følges op af overvågning efter omsætning (art. 72); udbydere af AI-modeller til almen brug med systemisk risiko skal udføre modelevalueringer inklusive adversarial test (art. 55, stk. 1, litra a). AI-omnibussen, forordning (EU) 2026/1744, der trådte i kraft den 27. juli 2026, udskød højrisikoforpligtelserne i bilag III til 2. december 2027 og forpligtelserne for højrisiko-AI i produkter under bilag I til 2. august 2028.\n\nEvaluering skal holdes adskilt fra træning: hvis testresultater styrer gentagne ændringer, bliver testsættet i praksis et valideringssæt, og dets score bliver for optimistisk. God praksis fryser derfor et testsplit, logger hver evalueringskørsel med model-, prompt- og dataversion og fornyer evalueringsdata, når de er blevet set for mange gange. Tal på tværs af organisationer kan kun sammenlignes, når harness, prompts og dekodningsindstillinger er identiske."},"edges":[{"type":"requires","to":"ai/machine-learning","confidence":"high","strength":"normal"},{"type":"contrasts-with","to":"ai/model-training","why":{"en":"Training changes the model to fit its examples; evaluation only measures the finished model and must not feed back into it unchecked.","da":"Træning ændrer modellen, så den passer til sine eksempler; evaluering måler kun den færdige model og må ikke ukontrolleret føres tilbage i den."},"confidence":"high","strength":"primary"},{"type":"mitigates","to":"ai/ai-bias","why":{"en":"Comparing results group by group shows when a model treats some people worse, so it can be fixed before release.","da":"Når resultaterne sammenlignes gruppe for gruppe, ses det, når en model behandler nogle mennesker dårligere, så det kan rettes før udgivelse."},"confidence":"medium","strength":"normal"},{"type":"mitigates","to":"ai/hallucination","confidence":"high","strength":"normal"},{"type":"used-with","to":"ai/prompt-engineering","why":{"en":"Each prompt change should be re-run against a fixed set of test cases so that improvements in one place do not break another.","da":"Hver promptændring bør køres igen mod et fast sæt testtilfælde, så forbedringer ét sted ikke ødelægger noget andet."},"confidence":"medium","strength":"normal"}],"depth":2,"sources":[{"title":"NIST AI 100-1, Artificial Intelligence Risk Management Framework (AI RMF 1.0), Measure function","url":"https://doi.org/10.6028/NIST.AI.100-1","tier":"standard","publisher":"NIST"},{"title":"NIST AI 600-1, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile","url":"https://doi.org/10.6028/NIST.AI.600-1","tier":"standard","publisher":"NIST"},{"title":"Regulation (EU) 2024/1689 (Artificial Intelligence Act), Articles 9(8), 15, 55(1)(a) and 72","url":"https://eur-lex.europa.eu/eli/reg/2024/1689/oj","tier":"standard","publisher":"European Union"},{"title":"European Commission (2026), AI Omnibus enters into force","url":"https://digital-strategy.ec.europa.eu/en/news/ai-omnibus-enters-force","tier":"official-doc","publisher":"European Commission"},{"title":"ISO/IEC TS 4213:2022, Assessment of machine learning classification performance","url":"https://www.iso.org/standard/79799.html","tier":"standard","publisher":"ISO/IEC"}],"draft":true}