AI-risiko og governance
Testere angriber med vilje et AI-system før og efter lancering for at finde måder, det kan narres til skadelig eller usikker adfærd.
Formelt
En struktureret, godkendt øvelse, hvor personer, ofte hjulpet af automatiske værktøjer, optræder som angribere mod en AI-model eller et AI-produkt for at finde skadeligt output, prompt injection, regelbrud, datalæk og andre fejl og rapportere dem, så de kan rettes.
Forklaret enkelt
Som at hyre snedige ballademagere til at bruge en uge på at få en ny ekspedient til at bryde alle regler, så du opdager hullerne i oplæringen, før rigtige kunder gør.
I praksis
Før en kommune åbner en chatassistent for borgerne, bruger et team to uger på at få den til at afsløre andre borgeres sagsoplysninger, give forkerte råd om ydelser eller ignorere sine regler, og hvert trick, de finder, bliver lukket.
Hvorfor det betyder noget
AI-systemer fejler på måder, almindelige funktionstest aldrig afprøver, og EU's AI-forordning kræver den slags angrebstest af de største AI-modeller til almen brug, hvis fejl kan skade hele samfundet.