Gå til indhold
atlas

Afsløring af følsomme oplysninger

Også kendt som: datalæk fra sprogmodeller

Et AI-system, der afslører private eller hemmelige detaljer som personoplysninger eller forretningshemmeligheder for uvedkommende.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En svaghed, opført som LLM02 i OWASP Top 10 for LLM Applications 2025, hvor en stor sprogmodel eller systemet omkring den udleverer personoplysninger, fortrolige forretningsdata, loginoplysninger eller sin systemprompt i sit output, hvad enten de stammer fra træningsdata, hentede dokumenter eller samtalen.

Forklaret enkelt

Som en snakkesalig receptionist, der har overhørt alt på kontoret og, når man spørger venligt på den rigtige måde, gentager en kollegas hjemmeadresse eller løn over for en fremmed.

I praksis

En kommune kobler sin nye AI-assistent til alle fællesdrev; en elev i borgerservice spørger, hvad cheferne tjente sidste år, og får tal fra en lønfil, hun ikke har ret til at åbne.

Hvorfor det betyder noget

Ét uforsigtigt svar kan være et brud på persondatasikkerheden, som efter GDPR kan skulle anmeldes til myndighederne inden for 72 timer, og tekst, der har forladt systemet, kan ikke kaldes tilbage.

Teknisk uddybning

Læk har fire forskellige kilder, og hver kræver sin egen kontrol. Træningsdata: modeller memorerer, især sekvenser, der optræder mange gange i korpusset, eller som er sjældne og karakteristiske. Carlini et al. (2021) trak ordrette personoplysninger, herunder navne, telefonnumre og mailadresser, ud af GPT-2 ved at sample output og rangere dem efter perplexity, og Nasr et al. (2023) viste et "divergens"-angreb - at bede en chatmodel i produktion gentage ét ord i det uendelige - der fik den til at udsende memoreret træningstekst i stor skala. Finjusteringsdata: en model, der er finjusteret på supportsager eller sagsakter, kan gengive dem, og membership inference-angreb kan afsløre, om en bestemt post indgik i træningssættet. Kontekst: alt, der ligger i promptvinduet - hentede dokumenter, værktøjsresultater, andre brugeres data i en delt session, systemprompten - kan gentages i svaret. Infrastruktur: logs, caches og samtalehistorik, som i hændelsen i marts 2023, hvor en fejl i et cachebibliotek kortvarigt viste andre ChatGPT-brugeres samtaletitler og visse betalingsoplysninger.

I virksomheder er den dominerende fejl ikke memorering, men autorisation. En RAG-pipeline eller copilot, der indekserer fællesdrev med en servicekonto eller henter tekstbidder uden at anvende den spørgende brugers adgangskontrolliste, forvandler mange års overdeling til øjeblikkelige svar for enhver, der spørger. Løsningen er rettighedsbevidst retrieval - security trimming på forespørgselstidspunktet mod kildesystemets ACL'er eller indeksering under brugerens delegerede identitet - plus følsomhedsmærkning, der helt holder bestemt indhold ude af indekset. OWASP udskiller den nært beslægtede LLM07:2025 System Prompt Leakage og understreger, at den egentlige fejl er at lægge adgangsoplysninger, forbindelsesstrenge eller autorisationslogik i en systemprompt overhovedet.

Kontroller pr. lag: dataminimering og fjernelse eller pseudonymisering af personoplysninger før træning eller finjustering; deduplikering, der mindsker memorering; differentielt privat træning (DP-SGD), hvor der kræves formelle garantier, på bekostning af kvaliteten; output-filtre, der finder personoplysninger, hemmeligheder og CPR-numre; isolation mellem tenants og sessioner; opbevaringsgrænser og adgangskontrol på logs over prompts og svar; og aftalevilkår, der sikrer, at udbyderen ikke bruger prompts til træning. Red teaming bør omfatte forsøg på dataudtræk og afprøvning på tværs af brugere.

Juridisk er output med personoplysninger, der gives til en uberettiget modtager, et brud på persondatasikkerheden efter GDPR art. 4, nr. 12, som udløser en vurdering og - medmindre det er usandsynligt, at bruddet indebærer en risiko - anmeldelse til Datatilsynet inden for 72 timer efter art. 33 samt underretning af de registrerede efter art. 34, hvis risikoen er høj. EDPB's udtalelse 28/2024 om AI-modeller konkluderede, at en model trænet på personoplysninger ikke automatisk kan anses for anonym; anonymitet skal påvises i hvert enkelt tilfælde under hensyn til risikoen for dataudtræk og membership inference. Læk er ofte resultatet af andre svagheder - prompt injection, jailbreaks eller overdreven handlefrihed - og behandles derfor bedst både som en konsekvenskategori og som en sårbarhed.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Token
  2. →Træningsdata
  3. →Personoplysninger
  4. →Transformer
  5. →Stor sprogmodel (LLM)
  6. →Afsløring af følsomme oplysninger

Relationer

Forårsager
Databrud
Bruges sammen med
GDPR

Kilder og videre læsning

Standarder og officielle tekster

  • NIST AI 600-1 - Artificial Intelligence Risk Management Framework, Generative AI Profile (Data Privacy) · NIST

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.