AI-risiko og governance
At smugle falske eller skadelige eksempler ind i de data, en AI lærer af, så den senere opfører sig, som en angriber ønsker.
Formelt
Et angreb på integriteten i maskinlæring, hvor en angriber tilføjer, ændrer eller mærker eksempler i træningsdataene forkert, så den færdige model begår bestemte fejl, ofte kun når en hemmelig udløser dukker op.
Forklaret enkelt
Som i al hemmelighed at bytte nogle sider i en elevs lærebog - eleven læser flittigt og klarer de fleste prøver, men svarer forkert præcis der, hvor siderne blev byttet.
I praksis
En pensionskasse træner en model til at finde falske anmeldelser delvis på en offentlig samling eksempler; en angriber har plantet hundredvis af sager mærket “ærlig” i samlingen, så anmeldelser med samme mønster senere slipper igennem.
Hvorfor det betyder noget
Skaden sidder inde i selve modellen og forbliver skjult, indtil udløseren dukker op, så organisationer skal kende og styre, hvor hver del af deres træningsdata kommer fra.