Gå til indhold
atlas

Forveksl ikke disse

Adversarielt eksempel vs. Dataforgiftning (data poisoning)

Hvorfor de er forskellige

Et adversarielt eksempel narrer en færdig model, mens den bruges; dataforgiftning ødelægger modellen, mens den lærer.

Adversarielt eksempel

AI-risiko og governance

Et input, der er ændret med vilje, ofte usynligt for mennesker, så en færdigtrænet AI-model svarer forkert med stor sikkerhed.

Formelt

Et input til en trænet maskinlæringsmodel, typisk et neuralt netværk, som en angriber har forskudt en lille, beregnet smule, så resultatet under inferens skifter til et forkert eller bestemt svar; selve modellen ændres ikke.

Forklaret enkelt

Som en optisk illusion lavet til en maskine - nogle få prikker, et menneske aldrig ville lægge mærke til, får computeren til at se en kat som en brødrister.

I praksis

En kommunes IT-driftsansvarlige opdager, at det AI-baserede malware-filter kan narres - ændrer man nogle få dele af en skadelig fil, som filen ikke selv bruger, markerer filteret den som sikker, selvom den virker præcis som før.

Hvorfor det betyder noget

En model kan bestå alle almindelige test og alligevel fejle over for en modstander, der former inputtet, så høj træfsikkerhed siger lidt om sikkerheden, når AI filtrerer malware, genkender ansigter eller styrer køretøjer.

Dataforgiftning (data poisoning)

AI-risiko og governance

At smugle falske eller skadelige eksempler ind i de data, en AI lærer af, så den senere opfører sig, som en angriber ønsker.

Formelt

Et angreb på integriteten i maskinlæring, hvor en angriber tilføjer, ændrer eller mærker eksempler i træningsdataene forkert, så den færdige model begår bestemte fejl, ofte kun når en hemmelig udløser dukker op.

Forklaret enkelt

Som i al hemmelighed at bytte nogle sider i en elevs lærebog - eleven læser flittigt og klarer de fleste prøver, men svarer forkert præcis der, hvor siderne blev byttet.

I praksis

En pensionskasse træner en model til at finde falske anmeldelser delvis på en offentlig samling eksempler; en angriber har plantet hundredvis af sager mærket “ærlig” i samlingen, så anmeldelser med samme mønster senere slipper igennem.

Hvorfor det betyder noget

Skaden sidder inde i selve modellen og forbliver skjult, indtil udløseren dukker op, så organisationer skal kende og styre, hvor hver del af deres træningsdata kommer fra.

Atlas er i beta.