Gå til indhold
atlas

Overdreven handlefrihed (excessive agency)

At give et AI-system flere værktøjer, rettigheder eller mere frihed, end opgaven kræver, så ét forkert skridt kan gøre reel skade.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En svaghed (OWASP LLM06:2025), hvor et system bygget på en stor sprogmodel har for mange funktioner, tilladelser eller for stor selvstændighed, så uventet, manipuleret eller opdigtet output fra modellen kan udløse skadelige handlinger.

Forklaret enkelt

Som at give en ny praktikant hovednøglen, firmakortet og ret til at skrive under på kontrakter den første dag, selv om vedkommende kun er ansat til at sortere posten.

I praksis

Et rederis bookingagent skal kun kunne læse sejlplanen, men har fået ret til at ændre den; den misforstår én kundes mail og aflyser fyrre bookinger, før en driftsplanlægger opdager det.

Hvorfor det betyder noget

Ingen model kan gøres helt pålidelig, så det at begrænse, hvad den må, sætter et loft over skaden, når den tager fejl eller bliver kapret; risikoen vokser med hvert værktøj, en agent får.

Teknisk uddybning

OWASP flyttede Excessive Agency fra LLM08 i 2023-listen til LLM06 i 2025-udgaven og deler den op i tre grundårsager. Overdreven funktionalitet: agenten har værktøjer, den ikke har brug for, eller et værktøj udstiller flere operationer, end opgaven kræver - et plugin, der skal læse dokumenter, men også kan slette dem, et generisk shell- eller HTTP-værktøj, hvor en snæver funktion ville være nok, eller et værktøj, der er blevet hængende fra udviklingen. Overdrevne rettigheder: værktøjet logger på bagvedliggende systemer med flere rettigheder end nødvendigt, typisk en fælles servicekonto med læse- og skriveadgang til alle postkasser eller tabeller i stedet for den kaldende brugers afgrænsede identitet. Overdreven autonomi: handlinger med stor konsekvens udføres uden uafhængig kontrol eller menneskelig godkendelse.

Skaden udløses af ethvert output fra modellen, som den omgivende kode behandler som en kommando - en hallucination, en misforstået instruktion eller, vigtigst, indirekte prompt injection fra indhold, agenten læser. I klassiske sikkerhedstermer er agenten en confused deputy: den har en myndighed, som ejeren har givet den, og kan styres af en part med færre rettigheder til at bruge den. Den "lethal trifecta", som Simon Willison beskrev i 2025 - adgang til private data, eksponering for upålideligt indhold og en kanal ud af systemet - er en praktisk test: hvis alle tre findes i én agent, må man gå ud fra, at en vellykket injection kan lække data. Værktøjsøkosystemer som MCP tilføjer flere veje, fordi værktøjsbeskrivelser og værktøjsresultater selv er tekst i modellens kontekst.

Modtrækkene er almindelig adgangsstyring anvendt på orkestreringslaget, ikke på modellen. Udstil kun de værktøjer, en use case kræver; foretræk snævre, typede funktioner (send_reply_to_ticket(ticket_id, body)) frem for åbne (run_shell, http_request); brug OAuth med minimale scopes, og udfør handlinger i slutbrugerens sikkerhedskontekst, så agenten ikke kan mere end brugeren; håndhæv autorisation i det bagvedliggende API (complete mediation) i stedet for at stole på, at modellen spørger om lov; kræv menneskelig bekræftelse af uigenkaldelige eller eksterne handlinger som betalinger, sletninger og udgående mail; indfør rate limits og beløbsgrænser; og log hvert værktøjskald med argumenter til audit. Sandkasser til kodeafvikling og begrænsning af udgående trafik med allow-list lukker ned for datalækket.

Overdreven handlefrihed er en designsvaghed, ikke et angreb: den afgør skadens omfang, når noget andet går galt. Den adskiller sig fra rettighedseskalering, hvor en angriber skaffer sig rettigheder, der aldrig er givet, og fra improper output handling (LLM05), hvor modellens output sendes urenset videre til en fortolker som SQL, en shell eller en browser. Governance-rammer forventer i stigende grad, at agenters rettigheder indgår i adgangsgennemgange på linje med andre ikke-menneskelige identiteter.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Inferens
  2. →Token
  3. →Netværk
  4. →Forudsigelse af næste token
  5. →Transformer
  6. →IP-adresse
  7. →Protokol
  8. →Stor sprogmodel (LLM)
  9. →Sampling (udtrækning af tokens)
  10. →Klient
  11. →Port
  12. →Prompt
  13. →Struktureret output
  14. →Server
  15. →AI-agent
  16. →API
  17. →Værktøjskald (tool calling)
  18. →Overdreven handlefrihed (excessive agency)

Relationer

Forårsager
Databrud
Bruges sammen med
Prompt injection

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.