Gå til indhold
atlas

Adversarielt eksempel

Også kendt som: adversarielt input

Et input, der er ændret med vilje, ofte usynligt for mennesker, så en færdigtrænet AI-model svarer forkert med stor sikkerhed.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

Et input til en trænet maskinlæringsmodel, typisk et neuralt netværk, som en angriber har forskudt en lille, beregnet smule, så resultatet under inferens skifter til et forkert eller bestemt svar; selve modellen ændres ikke.

Forklaret enkelt

Som en optisk illusion lavet til en maskine - nogle få prikker, et menneske aldrig ville lægge mærke til, får computeren til at se en kat som en brødrister.

I praksis

En kommunes IT-driftsansvarlige opdager, at det AI-baserede malware-filter kan narres - ændrer man nogle få dele af en skadelig fil, som filen ikke selv bruger, markerer filteret den som sikker, selvom den virker præcis som før.

Hvorfor det betyder noget

En model kan bestå alle almindelige test og alligevel fejle over for en modstander, der former inputtet, så høj træfsikkerhed siger lidt om sikkerheden, når AI filtrerer malware, genkender ansigter eller styrer køretøjer.

Teknisk uddybning

Adversarielle eksempler blev beskrevet af Szegedy et al. i "Intriguing properties of neural networks" (2013), som viste, at umærkelige forstyrrelser kunne vende en ImageNet-klassifikators svar, og at de samme manipulerede billeder ofte også narrede andre netværk trænet på andre data. Goodfellow, Shlens og Szegedy (2014) argumenterede for, at årsagen ikke er overfitting, men at højdimensionelle modeller opfører sig for lineært: en lille ændring i hver eneste inputdimension summerer til en stor ændring i logit-værdien. Deres Fast Gradient Sign Method beregner x' = x + ε · sign(∇x J(θ, x, y)) i ét enkelt backward pass, hvor J er træningstabet, og ε begrænser forstyrrelsens L∞-norm.

De fleste angreb formuleres som et optimeringsproblem med en begrænsning: find δ med ‖δ‖p ≤ ε, der maksimerer tabet (utargeteret) eller minimerer tabet for en valgt klasse (targeteret). Projected Gradient Descent (Madry et al., 2017) gentager FGSM-lignende skridt og projicerer tilbage på ε-kuglen; Carlini og Wagner (2017) optimerer en marginbaseret målfunktion under L2 eller L0. Trusselsmodellen er afgørende: en white-box-angriber har adgang til gradienter, mens en black-box-angriber enten sender forespørgsler til modellen (score- eller beslutningsbaserede angreb) eller laver eksemplerne på en lokal surrogatmodel og udnytter transferability. Typiske forskningsbudgetter som ε = 8/255 under L∞ på CIFAR-10 måler robusthed mod lille pixelstøj, ikke mod enhver ændring, en reel angriber kan finde på.

Angreb i den fysiske verden viser, at problemet overlever print og kamera: klistermærker på stopskilte (Eykholt et al., 2018) og en 3D-printet skildpadde, der blev klassificeret som et gevær (Athalye et al., 2018, med Expectation over Transformation). I sikkerhedsprodukter er begrænsningen funktionel frem for visuel - malware skal stadig kunne køre, så angriberen ændrer padding, tilføjede bytes, ubrugte sektioner eller imports. For sprogmodeller er det tilsvarende et adversarielt suffiks af tokens som i GCG-angrebet på alignede LLM'er, hvilket forbinder begrebet med jailbreaks.

NIST AI 100-2 klassificerer adversarielle eksempler som evasion-angreb i driftsfasen, i modsætning til forgiftning (træningsfasen) og privatlivsangreb. Forsvarene har en dårlig historik: mange publicerede forsvar byggede på gradient masking og blev brudt af adaptive angreb (Athalye, Carlini og Wagner, 2018, "Obfuscated Gradients"). Adversarial training med PGD er stadig det stærkeste empiriske forsvar, men koster flere gange den normale træningsberegning og sænker som regel nøjagtigheden på rene data; randomized smoothing (Cohen et al., 2019) giver kun certificerede L2-garantier for små radier. Påstande om robusthed bør derfor angives som en trusselsmodel plus et angrebsbudget og evalueres med adaptive angreb, med offentlige benchmarks som RobustBench som pejlemærke.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Inferens
  2. →Træningsdata
  3. →Maskinlæring
  4. →Adversarielt eksempel

Relationer

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.