Gå til indhold
atlas

Dataforgiftning (data poisoning)

Også kendt som: forgiftning af træningsdata

At smugle falske eller skadelige eksempler ind i de data, en AI lærer af, så den senere opfører sig, som en angriber ønsker.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

Et angreb på integriteten i maskinlæring, hvor en angriber tilføjer, ændrer eller mærker eksempler i træningsdataene forkert, så den færdige model begår bestemte fejl, ofte kun når en hemmelig udløser dukker op.

Forklaret enkelt

Som i al hemmelighed at bytte nogle sider i en elevs lærebog - eleven læser flittigt og klarer de fleste prøver, men svarer forkert præcis der, hvor siderne blev byttet.

I praksis

En pensionskasse træner en model til at finde falske anmeldelser delvis på en offentlig samling eksempler; en angriber har plantet hundredvis af sager mærket “ærlig” i samlingen, så anmeldelser med samme mønster senere slipper igennem.

Hvorfor det betyder noget

Skaden sidder inde i selve modellen og forbliver skjult, indtil udløseren dukker op, så organisationer skal kende og styre, hvor hver del af deres træningsdata kommer fra.

Teknisk uddybning

NIST AI 100-2 skelner mellem forgiftningsangreb efter angriberens mål: availability-forgiftning forringer modellen bredt, målrettet forgiftning ændrer forudsigelser på bestemte input, og bagdørsforgiftning planter en udløser, der aktiverer adfærd valgt af angriberen, mens nøjagtigheden på rene data er uændret. Den skelner også efter angriberens muligheder: kontrol over labels, over datapunkter, over træningsproceduren eller over selve modellen (modelforgiftning, som er udbredt i federated learning, hvor klienter indsender opdateringer). OWASP samler LLM-varianterne som LLM04:2025 Data and Model Poisoning, der dækker fortræningskorpora, finjusteringssæt, præferencedata til RLHF og embeddings til retrieval.

Den klassiske bagdør er BadNets (Gu et al., 2017): man stempler et lille pixelmønster på en andel af træningsbillederne og ændrer deres label til en målklasse; det trænede netværk opfører sig normalt, indtil mønsteret dukker op. Clean-label-angreb (Shafahi et al., 2018, "Poison Frogs") undgår helt forkert mærkede eksempler ved at konstruere korrekt mærkede datapunkter, hvis features kolliderer med et mål, så manuel gennemgang af labels ikke hjælper. For data i internetskala viste Carlini et al. (2023) to praktiske veje: split-view-forgiftning, hvor man køber udløbne domæner, som URL-baserede datasæt som LAION henviser til, så senere downloads henter angriberens indhold (de anslog omkring 60 USD for at kontrollere 0,01 % af LAION-400M), og front-running, hvor ondsindede redigeringer times lige før et Wikipedia-snapshot. En undersøgelse fra 2025 fra Anthropic, UK AI Security Institute og Alan Turing Institute fandt, at omkring 250 forgiftede dokumenter var nok til at plante en denial-of-service-bagdør i LLM'er fra 600M til 13B parametre, hvilket tyder på, at det nødvendige antal eksempler er nogenlunde konstant i stedet for at vokse med datasættets størrelse.

Forgiftning er svær at opdage bagefter. Modeller med bagdør består standard-benchmarks, og "sleeper agent"-forsøg (Hubinger et al., 2024) viste, at supervised fine-tuning, RLHF og adversarial training ikke pålideligt fjernede en betinget bagdør. Detektionsteknikker - spectral signatures og activation clustering på træningsdata, rekonstruktion af udløsere som Neural Cleanse, filtrering af outliers ud fra tab - virker på kendte typer udløsere, men giver ingen generel garanti.

Det praktiske forsvar er derfor datastyring: registrér oprindelse og licens for hvert datasæt, lås snapshots med kryptografisk hash i stedet for at downloade URL-lister igen, dedupliker og filtrér, begræns og gennemgå bidrag til finjusterings- og feedbackdata, hold evalueringssæt uden for datapipelinens rækkevidde, og red team for udløseradfærd før udgivelse. AI-forordningens art. 10 kræver datastyring for træningsdata til højrisikosystemer, og art. 15, stk. 5, nævner data- og modelforgiftning blandt de angreb, højrisikosystemer skal kunne modstå. Forgiftning adskiller sig fra adversarielle eksempler, der narrer en færdig model under inferens, og fra prompt injection, der manipulerer konteksten under kørsel; RAG-forgiftning - at plante dokumenter, som en retriever vil finde frem - ligger midt imellem, fordi den ændrer de data, modellen ser, uden at gentræne den.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Træningsdata
  2. →Modeltræning
  3. →Dataforgiftning (data poisoning)

Relationer

Forudsætter
Modeltræning
Forårsager
Bias i AI

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.