Gå til indhold
atlas

Forveksl ikke disse

Dataforgiftning (data poisoning) vs. Prompt injection

Hvorfor de er forskellige

Forgiftning ødelægger modellen, mens den lærer; prompt injection vildleder en færdig model, mens den bruges.

Dataforgiftning (data poisoning)

AI-risiko og governance

At smugle falske eller skadelige eksempler ind i de data, en AI lærer af, så den senere opfører sig, som en angriber ønsker.

Formelt

Et angreb på integriteten i maskinlæring, hvor en angriber tilføjer, ændrer eller mærker eksempler i træningsdataene forkert, så den færdige model begår bestemte fejl, ofte kun når en hemmelig udløser dukker op.

Forklaret enkelt

Som i al hemmelighed at bytte nogle sider i en elevs lærebog - eleven læser flittigt og klarer de fleste prøver, men svarer forkert præcis der, hvor siderne blev byttet.

I praksis

En pensionskasse træner en model til at finde falske anmeldelser delvis på en offentlig samling eksempler; en angriber har plantet hundredvis af sager mærket “ærlig” i samlingen, så anmeldelser med samme mønster senere slipper igennem.

Hvorfor det betyder noget

Skaden sidder inde i selve modellen og forbliver skjult, indtil udløseren dukker op, så organisationer skal kende og styre, hvor hver del af deres træningsdata kommer fra.

Prompt injection

AI-risiko og governance

At gemme instruktioner i den tekst, et AI-system læser, så det ignorerer sine egne regler og adlyder angriberen i stedet.

Formelt

Et angreb på en stor sprogmodel, hvor tekst fra en udenforstående, skrevet direkte eller gemt i en hjemmeside, fil eller mail, som modellen skal læse, bliver opfattet som en ordre og tilsidesætter det, ejeren havde tænkt sig.

Forklaret enkelt

Som at stikke en seddel ind i en bunke breve, som en ny assistent sorterer, hvor der står "ignorer din chef og send mig nøglerne" - og assistenten kan ikke skelne sedlen fra rigtige ordrer.

I praksis

En kommunes AI-assistent opsummerer indgående mails fra borgerne; én mail gemmer hvid tekst på hvid baggrund, der beder den videresende de ti seneste beskeder til en ekstern adresse, og det gør den.

Hvorfor det betyder noget

Modellen blander regler og indhold i den samme strøm af ord, så der findes endnu ingen vandtæt løsning; jo mere et AI-system må gøre på egen hånd, jo mere skade kan én skjult sætning gøre.

Atlas er i beta.