Gå til indhold
atlas

Prompt injection

Også kendt som: prompt injection-angreb

At gemme instruktioner i den tekst, et AI-system læser, så det ignorerer sine egne regler og adlyder angriberen i stedet.

Kladde - dette opslag er endnu ikke gennemgået.

Læs hele artiklen →

Formelt

Et angreb på en stor sprogmodel, hvor tekst fra en udenforstående, skrevet direkte eller gemt i en hjemmeside, fil eller mail, som modellen skal læse, bliver opfattet som en ordre og tilsidesætter det, ejeren havde tænkt sig.

Forklaret enkelt

Som at stikke en seddel ind i en bunke breve, som en ny assistent sorterer, hvor der står "ignorer din chef og send mig nøglerne" - og assistenten kan ikke skelne sedlen fra rigtige ordrer.

I praksis

En kommunes AI-assistent opsummerer indgående mails fra borgerne; én mail gemmer hvid tekst på hvid baggrund, der beder den videresende de ti seneste beskeder til en ekstern adresse, og det gør den.

Hvorfor det betyder noget

Modellen blander regler og indhold i den samme strøm af ord, så der findes endnu ingen vandtæt løsning; jo mere et AI-system må gøre på egen hånd, jo mere skade kan én skjult sætning gøre.

Teknisk uddybning

Grundårsagen er arkitektonisk. En LLM modtager én sekvens af tokens, hvor systemprompt, brugerens ture, hentede dokumenter og værktøjsresultater kun er adskilt af markører i chatskabelonen og formateringskonventioner; attention virker på det hele, og der findes intet svar på en parameteriseret forespørgsel, der tvinger et tekststykke til at blive behandlet som passive data. Rolletokens og træning giver de privilegerede dele mere vægt, men adskillelsen er statistisk - derfor er sammenligningen med SQL injection lærerig, men misvisende: SQL injection har en fuldstændig løsning (prepared statements), det har prompt injection ikke i dag. Greshake et al. (2023) formaliserede indirekte prompt injection, hvor payloaden kommer ind via indhold, applikationen henter - hjemmesider, mails, PDF'er, værktøjsbeskrivelser - så angriberen aldrig selv interagerer med systemet.

Payloads forfølger få mål: goal hijacking (gør noget andet), prompt leaking (afslør systemprompten, jf. OWASP LLM07), dataudtræk og uautoriseret brug af værktøjer. En kendt kanal til dataudtræk er rendering af output: modellen beordres til at skrive et Markdown-billede, hvis URL indeholder samtaledata i query-strengen, og klienten lækker dem, når billedet hentes; at blokere visning af eksterne billeder eller håndhæve en stram content security policy lukker den vej. Agenter med hukommelse giver vedvarende effekt, fordi en indsmuglet instruktion kan skrives ind i langtidshukommelsen og genafspilles i senere sessioner.

På modelniveau findes træning i instruktionshierarki (Wallace et al., 2024), der lærer modeller at prioritere system- og udviklerbeskeder over værktøjsoutput, og spotlighting (Hines et al., 2024), der markerer upålidelig tekst med skilletegn, indflettede datamærker eller kodning. Klassifikatorbaserede detektorer screener hentet indhold. Alt dette sænker succesraten, men omgås af adaptive angreb, som benchmarks som AgentDojo viser. Stærkere garantier kommer fra systemdesign: dual-LLM-mønstret, hvor en privilegeret model aldrig ser upålidelig tekst, og en isoleret model behandler den uden adgang til værktøjer; CaMeL (Debenedetti et al., 2025), der udleder kontrolflowet fra den betroede forespørgsel og sporer rettigheder på data, der stammer fra upålidelige kilder; og helt almindelige mindste rettigheder, menneskelig bekræftelse og begrænsning af udgående trafik, der begrænser, hvad en vellykket injection kan udrette.

OWASP rangerer prompt injection som LLM01:2025 og regner jailbreaking som en undertype; NIST AI 100-2 klassificerer det som et angreb på generativ AI med direkte og indirekte varianter. Det adskiller sig fra dataforgiftning, der ændrer modellens vægte under træningen, og fra overdreven handlefrihed, som er den designsvaghed, der afgør skadens omfang. For en idriftsætter i EU er en vellykket injection, der eksponerer personoplysninger, et brud på persondatasikkerheden efter GDPR art. 33 med den sædvanlige frist på 72 timer, og for højrisiko-AI-systemer kræver AI-forordningens art. 15, stk. 5, modstandsdygtighed over for uautoriserede tredjeparters forsøg på at ændre brug eller output ved at udnytte sårbarheder i systemet.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Token
  2. →Transformer
  3. →Stor sprogmodel (LLM)
  4. →Prompt
  5. →Prompt injection

Relationer

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.