AI-risiko og governance
Et input, der er ændret med vilje, ofte usynligt for mennesker, så en færdigtrænet AI-model svarer forkert med stor sikkerhed.
Formelt
Et input til en trænet maskinlæringsmodel, typisk et neuralt netværk, som en angriber har forskudt en lille, beregnet smule, så resultatet under inferens skifter til et forkert eller bestemt svar; selve modellen ændres ikke.
Forklaret enkelt
Som en optisk illusion lavet til en maskine - nogle få prikker, et menneske aldrig ville lægge mærke til, får computeren til at se en kat som en brødrister.
I praksis
En kommunes IT-driftsansvarlige opdager, at det AI-baserede malware-filter kan narres - ændrer man nogle få dele af en skadelig fil, som filen ikke selv bruger, markerer filteret den som sikker, selvom den virker præcis som før.
Hvorfor det betyder noget
En model kan bestå alle almindelige test og alligevel fejle over for en modstander, der former inputtet, så høj træfsikkerhed siger lidt om sikkerheden, når AI filtrerer malware, genkender ansigter eller styrer køretøjer.