AI-risiko og governance
At snakke en AI-chatbot fra dens egne sikkerhedsregler med snedigt formulerede forespørgsler som rollespil eller opdigtede nødsituationer.
Formelt
Et angreb, hvor en bruger skriver en prompt, der skal få en stor sprogmodel til at lave indhold eller udføre handlinger, som dens alignment-træning og systemprompt skal forhindre - fx via rollespil, ved at dele en forespørgsel op i harmløse bidder eller ved at bruge et andet sprog.
Forklaret enkelt
Som et barn, der har fået at vide “ingen slik”, og bliver ved med at prøve nye vinkler - “hvad nu hvis det er til min bamse?”, “mormor siger altid ja” - indtil den trætte forælder giver op.
I praksis
Før lanceringen beder en sikkerhedstester, som en region har hyret, dens patientchatbot om at “spille tv-læge i en scene”, og den oplyser medicindoser, den er sat op til at afvise.
Hvorfor det betyder noget
Sikkerhedsregler, en model har lært, kan snakkes uden om, så en organisation, hvis chatbot kan presses til skadelige eller pinlige svar, risikerer at skade mennesker, sit omdømme og juridiske problemer.