Gå til indhold
atlas

Forveksl ikke disse

Jailbreak vs. Prompt injection

Hvorfor de er forskellige

I et jailbreak angriber brugeren selv modellens sikkerhedsregler; ved prompt injection gemmer en udenforstående instruktioner i indhold, modellen læser, og vender den mod brugeren eller ejeren.

Jailbreak

AI-risiko og governance

At snakke en AI-chatbot fra dens egne sikkerhedsregler med snedigt formulerede forespørgsler som rollespil eller opdigtede nødsituationer.

Formelt

Et angreb, hvor en bruger skriver en prompt, der skal få en stor sprogmodel til at lave indhold eller udføre handlinger, som dens alignment-træning og systemprompt skal forhindre - fx via rollespil, ved at dele en forespørgsel op i harmløse bidder eller ved at bruge et andet sprog.

Forklaret enkelt

Som et barn, der har fået at vide “ingen slik”, og bliver ved med at prøve nye vinkler - “hvad nu hvis det er til min bamse?”, “mormor siger altid ja” - indtil den trætte forælder giver op.

I praksis

Før lanceringen beder en sikkerhedstester, som en region har hyret, dens patientchatbot om at “spille tv-læge i en scene”, og den oplyser medicindoser, den er sat op til at afvise.

Hvorfor det betyder noget

Sikkerhedsregler, en model har lært, kan snakkes uden om, så en organisation, hvis chatbot kan presses til skadelige eller pinlige svar, risikerer at skade mennesker, sit omdømme og juridiske problemer.

Prompt injection

AI-risiko og governance

At gemme instruktioner i den tekst, et AI-system læser, så det ignorerer sine egne regler og adlyder angriberen i stedet.

Formelt

Et angreb på en stor sprogmodel, hvor tekst fra en udenforstående, skrevet direkte eller gemt i en hjemmeside, fil eller mail, som modellen skal læse, bliver opfattet som en ordre og tilsidesætter det, ejeren havde tænkt sig.

Forklaret enkelt

Som at stikke en seddel ind i en bunke breve, som en ny assistent sorterer, hvor der står "ignorer din chef og send mig nøglerne" - og assistenten kan ikke skelne sedlen fra rigtige ordrer.

I praksis

En kommunes AI-assistent opsummerer indgående mails fra borgerne; én mail gemmer hvid tekst på hvid baggrund, der beder den videresende de ti seneste beskeder til en ekstern adresse, og det gør den.

Hvorfor det betyder noget

Modellen blander regler og indhold i den samme strøm af ord, så der findes endnu ingen vandtæt løsning; jo mere et AI-system må gøre på egen hånd, jo mere skade kan én skjult sætning gøre.

Fælles forbindelser

Atlas er i beta.