Gå til indhold
atlas

Forklarlighed

Også kendt som: forklarbar AI, XAI

Hvor godt mennesker kan forstå, hvorfor et AI-system nåede frem til et bestemt resultat.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

I hvilken grad grundene bag en models resultat kan vises på en måde, et menneske kan følge, for eksempel hvilke oplysninger der vejede tungest, så man kan kontrollere resultatet, klage over det eller rette det.

Forklaret enkelt

Som en læge, der ikke bare siger "tag de her piller", men fortæller, hvad hun så i dine prøver, og hvorfor det førte til valget.

I praksis

En borger, hvis ansøgning om boligstøtte bliver indstillet til afslag af kommunens AI-værktøj, spørger hvorfor; kommunen kan vise, at manglende indkomstoplysninger og ikke alder eller nationalitet afgjorde resultatet.

Hvorfor det betyder noget

Uden den kan ingen opdage skjult uretfærdighed, svare en revisor eller give en berørt person en reel begrundelse, og så bryder tillid og ansvarlighed sammen.

Teknisk uddybning

Litteraturen skelner mellem fortolkelighed (interpretability) - modeller, hvis struktur et menneske kan inspicere direkte, som sparsomme lineære modeller, lave beslutningstræer, regellister eller generaliserede additive modeller - og post-hoc-forklarlighed, hvor en separat metode tilnærmer, hvorfor en uigennemsigtig model gav et bestemt output. Forklaringer inddeles desuden i globale (hvordan modellen opfører sig overordnet) og lokale (hvorfor netop denne forudsigelse) og i modelspecifikke eller modelagnostiske. Rudin (2019) argumenterede for, at en fortolkelig model ved højrisikobeslutninger på tabeldata ofte er lige så præcis som en black box, så post-hoc-forklaring af en black box er det svagere valg.

De vigtigste post-hoc-familier er feature attribution, eksempelbaserede og kontrafaktiske metoder. LIME (Ribeiro et al., 2016) tilpasser en vægtet lineær surrogatmodel omkring det enkelte tilfælde ud fra forstyrrede eksempler. SHAP (Lundberg og Lee, 2017) tildeler hver feature dens Shapley-værdi fra kooperativ spilteori, den eneste fordeling, der opfylder efficiency, symmetry, dummy og additivity; KernelSHAP estimerer den ved sampling, og TreeSHAP beregner den eksakt for træ-ensembler. Gradientmetoder for neurale netværk omfatter saliency maps, Integrated Gradients (Sundararajan et al., 2017), der integrerer gradienter langs en sti fra en baseline, og Grad-CAM for konvolutionelle netværk. Kontrafaktiske forklaringer (Wachter et al., 2017) angiver den mindste ændring af input, der ville vende udfaldet - "havde den oplyste indkomst været over X, var ansøgningen blevet godkendt" - hvilket ofte er den mest brugbare form for en berørt person.

Fejlkilderne er veldokumenterede. Attributioner afhænger af den valgte baseline eller baggrundsfordeling; korrelerede features deler æren vilkårligt; saliency maps kan se plausible ud og samtidig være ufølsomme over for modellens vægte (Adebayo et al., 2018, "Sanity Checks for Saliency Maps"); og LIME og SHAP kan manipuleres, så en biased model ser ud til at bygge på harmløse features. For LLM'er er en chain-of-thought genereret tekst og ikke nødvendigvis en tro gengivelse af beregningen; mekanistisk interpretability (kredsløb, probing, sparse autoencoders på aktiveringer) sigter mod tro forklaringer, men er stadig et forskningsfelt. NIST IR 8312 opstiller derfor fire principper: forklaring, meningsfuldhed, forklaringens nøjagtighed og videnens grænser.

Juridisk giver GDPR art. 13, stk. 2, litra f, art. 14, stk. 2, litra g, og art. 15, stk. 1, litra h, den registrerede ret til meningsfulde oplysninger om logikken i automatiske afgørelser efter art. 22. EU-Domstolen fastslog i SCHUFA (C-634/21, 2023), at en kreditscore i sig selv kan være en sådan afgørelse, og i Dun & Bradstreet Austria (C-203/22, 2025), at forklaringen skal sætte personen i stand til at forstå den fremgangsmåde og de principper, der faktisk er anvendt, uden at hensynet til forretningshemmeligheder generelt kan afskære den. AI-forordningen tilføjer art. 13 (brugsanvisning, der sætter idriftsættere i stand til at fortolke output), art. 14 (menneskeligt tilsyn) og art. 86, en ret for berørte personer til at få en klar og meningsfuld forklaring på visse afgørelser, der bygger på højrisikosystemer efter bilag III.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Træningsdata
  2. →Maskinlæring
  3. →Forklarlighed

Relationer

Forudsætter
Maskinlæring
Afbøder
Bias i AI

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.