Gå til indhold
atlas

Modelevaluering (evals)

Også kendt som: AI-evaluering

Praksis med at kontrollere, hvor godt et AI-system løser sin opgave - med tal, offentlige tests, menneskelig gennemgang og bevidste angreb.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

Den planlagte måling af en model eller et AI-system op imod mål for kvalitet, sikkerhed og retfærdighed, som kombinerer tal som nøjagtighed og F1-score, benchmarkresultater, menneskelig gennemgang, LLM som dommer og AI red teaming.

Forklaret enkelt

Som en bils prøvekørsler før salg - fartløb på banen, kollisionsforsøg, førernes meninger og folk, der gør alt for at få den til at svigte.

I praksis

Før lejerchatten flyttes til en nyere stor sprogmodel, kører et boligselskabs IT-ansvarlige 500 gemte spørgsmål fra lejere igen, lader medarbejdere bedømme et udvalg af svarene og skifter kun, hvis intet bliver dårligere.

Hvorfor det betyder noget

Uden faste kontroller ved ingen, om en ændring gjorde systemet bedre, dårligere eller usikkert, og EU's AI-forordning kræver dokumenteret test af systemer, der bruges til fx ansættelse, kreditvurdering eller afgørelser om sociale ydelser.

Teknisk uddybning

Modelevaluering består af flere lag, der besvarer forskellige spørgsmål. Offline-evaluering scorer en fastfrosset model på tilbageholdte testsæt og offentlige benchmarks; menneskelig evaluering lader eksperter eller brugere bedømme output, hvor intet automatisk mål er gyldigt; LLM som dommer automatiserer en del af den bedømmelse; adversarial test og AI red teaming leder efter fejl, som et gennemsnitsmål aldrig rammer; og online-evaluering (A/B-test, skyggedrift, overvågning i produktion) måler adfærden på den reelle inputfordeling. For LLM-applikationer er en eval-suite typisk kode: et versioneret datasæt af input, en eller flere bedømmere (eksakt match, regex- eller skematjek, kørsel af genereret kode, embedding-lighed, modelbedømte guider) og en harness, der kører i CI, så en ændring af prompt, retrieval eller model ikke kan udrulles, hvis den giver tilbagegang.

De fleste fejl i evaluering handler om validitet, ikke regnestykker. Begrebsvaliditet spørger, om målet måler den egenskab, der betyder noget; ekstern validitet spørger, om testfordelingen svarer til driften, hvilket brister ved datadrift, eller når et demosæt er håndplukket. Samlede scorer skjuler fejl i undergrupper, så resultater bør opdeles efter sprog, kundesegment, dokumenttype eller beskyttede karakteristika. Scorer har stikprøveusikkerhed og bør rapporteres med bootstrap- eller binomiale konfidensintervaller. Generative modeller er ikke-deterministiske, så hvert testtilfælde bør køres flere gange; pass@k (mindst ét af k forsøg lykkes) og pass^k (alle k lykkes, som i τ-bench) besvarer vidt forskellige spørgsmål om pålidelighed.

Governance-rammer behandler evaluering som en pligt gennem hele livscyklussen. NIST AI RMF 1.0 (NIST AI 100-1, 2023) placerer test, evaluering, verifikation og validering (TEVV) under funktionen Measure, og NIST AI 600-1 udvider det til generativ AI. ISO/IEC TS 4213:2022 beskriver, hvordan klassifikationsydelse vurderes. EU's AI-forordning kræver, at højrisikosystemer testes mod på forhånd fastlagte målinger og sandsynlighedsbaserede tærskler, før de bringes i omsætning (art. 9, stk. 8), at de opnår et passende niveau af nøjagtighed, robusthed og cybersikkerhed med målene angivet i brugsanvisningen (art. 15), og at de følges op af overvågning efter omsætning (art. 72); udbydere af AI-modeller til almen brug med systemisk risiko skal udføre modelevalueringer inklusive adversarial test (art. 55, stk. 1, litra a). AI-omnibussen, forordning (EU) 2026/1744, der trådte i kraft den 27. juli 2026, udskød højrisikoforpligtelserne i bilag III til 2. december 2027 og forpligtelserne for højrisiko-AI i produkter under bilag I til 2. august 2028.

Evaluering skal holdes adskilt fra træning: hvis testresultater styrer gentagne ændringer, bliver testsættet i praksis et valideringssæt, og dets score bliver for optimistisk. God praksis fryser derfor et testsplit, logger hver evalueringskørsel med model-, prompt- og dataversion og fornyer evalueringsdata, når de er blevet set for mange gange. Tal på tværs af organisationer kan kun sammenlignes, når harness, prompts og dekodningsindstillinger er identiske.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Træningsdata
  2. →Maskinlæring
  3. →Modelevaluering (evals)

Relationer

Forudsætter
Maskinlæring
Forveksl ikke med
Modeltræning

Kilder og videre læsning

Officiel dokumentation

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.