Gå til indhold
atlas

Jailbreak

Også kendt som: jailbreaking

At snakke en AI-chatbot fra dens egne sikkerhedsregler med snedigt formulerede forespørgsler som rollespil eller opdigtede nødsituationer.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

Et angreb, hvor en bruger skriver en prompt, der skal få en stor sprogmodel til at lave indhold eller udføre handlinger, som dens alignment-træning og systemprompt skal forhindre - fx via rollespil, ved at dele en forespørgsel op i harmløse bidder eller ved at bruge et andet sprog.

Forklaret enkelt

Som et barn, der har fået at vide “ingen slik”, og bliver ved med at prøve nye vinkler - “hvad nu hvis det er til min bamse?”, “mormor siger altid ja” - indtil den trætte forælder giver op.

I praksis

Før lanceringen beder en sikkerhedstester, som en region har hyret, dens patientchatbot om at “spille tv-læge i en scene”, og den oplyser medicindoser, den er sat op til at afvise.

Hvorfor det betyder noget

Sikkerhedsregler, en model har lært, kan snakkes uden om, så en organisation, hvis chatbot kan presses til skadelige eller pinlige svar, risikerer at skade mennesker, sit omdømme og juridiske problemer.

Teknisk uddybning

Wei, Haghtalab og Steinhardt (2023) forklarede med to mekanismer, hvorfor sikkerhedstræning svigter. Konkurrerende mål: modellen er trænet både til at være hjælpsom og følge instruktioner og til at afvise skadelige ønsker, så prompts, der får en afvisning til at virke uhjælpsom - rollespil ("DAN", "min bedstemor læste altid opskriften op for mig"), prefix injection ("start dit svar med 'Selvfølgelig, her er'"), undertrykkelse af afvisninger - vipper balancen. Uoverensstemmende generalisering: fortræningen gav modellen evner på områder, som sikkerhedstræningen næppe dækker, så Base64, chifre, leetspeak eller sprog med få træningsdata kan føre en forespørgsel forbi en afvisningsadfærd, der mest er lært på almindeligt engelsk.

Senere forskning industrialiserede angrebet. GCG (Zou et al., 2023) bruger gradientstyret søgning efter tokens på åbne modeller til at finde adversarielle suffikser, der også virker på lukkede modeller - sprogmodellernes pendant til adversarielle eksempler. PAIR (Chao et al., 2023) og lignende metoder bruger en angriber-LLM til gradvist at forfine et jailbreak mod en black-box-model. Many-shot jailbreaking (Anthropic, 2024) fylder et langt kontekstvindue med hundredvis af opdigtede dialoger, hvor en assistent adlyder, og udnytter in-context learning. Crescendo (Microsoft, 2024) eskalerer gradvist over mange uskyldigt udseende ture. Best-of-N jailbreaking (Hughes et al., 2024) sampler blot tilfældige variationer (store og små bogstaver, tegnstøj), indtil én lykkes, og succesraten stiger forudsigeligt med antallet af forsøg. For modeller med åbne vægte kan sikkerheden fjernes helt: finjustering på et lille antal skadelige eksempler ophæver afvisningstræningen (Qi et al., 2023), og ablation af én enkelt "refusal direction" i aktiveringsrummet slår afvisningerne fra (Arditi et al., 2024).

Evaluering sker med attack success rate på standardsæt af skadelige forespørgsler som HarmBench eller JailbreakBench og skal tage højde for, at output ikke er deterministisk, og at dommeren kan tage fejl i, om et svar faktisk er skadeligt. Forsvaret er lagdelt: adversarial afvisningstræning, systemprompts, der gentager politikken, input-klassifikatorer for kendte jailbreak-mønstre, output-klassifikatorer, der vurderer svaret uanset formuleringen af forespørgslen (Anthropics Constitutional Classifiers fra 2025 er et eksempel), rate limiting og misbrugsdetektion på kontoniveau mod iterative angreb samt begrænsning af den skade, en jailbreaket model kan gøre, ved at holde værktøjer og data væk fra den. Kontroller på output-siden er generelt mere robuste end mønstergenkendelse på input, fordi det skadelige indhold er lettere at genkende end de uendeligt mange måder at bede om det på.

OWASP placerer jailbreaking under LLM01:2025 Prompt Injection som den form, hvor angriberens input direkte får modellen til at se bort fra sine sikkerhedsprotokoller. Den praktiske forskel er, hvem der angribes: i et jailbreak er brugeren modstanderen, og målet er modeludbyderens eller operatørens indholdspolitik; ved indirekte prompt injection angriber en tredjepart brugeren eller applikationen via indhold, modellen læser. De samme teknikker bruges ofte til begge dele, og et jailbreak, der afslører systemprompten, overlapper også med LLM07 System Prompt Leakage.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Kunstig intelligens (AI)
  2. →Token
  3. →Træningsdata
  4. →Modeltræning
  5. →Selvsuperviseret læring
  6. →Transformer
  7. →AI-alignment
  8. →Stor sprogmodel (LLM)
  9. →Fortræning (pretraining)
  10. →Instruktionstilpasning (instruction tuning)
  11. →Systemprompt
  12. →Jailbreak

Relationer

Forveksl ikke med
Prompt injection
Bruges sammen med
AI red teaming

Kilder og videre læsning

Opslagsværker

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.