Gå til indhold
atlas

Forveksl ikke disse

AI-alignment vs. Guardrails (sikkerhedsværn)

Hvorfor de er forskellige

Alignment former, hvad modellen selv er tilbøjelig til at gøre; guardrails er separate kontroller rundt om den, der fanger det, alignment overser.

AI-alignment

AI-risiko og governance

Arbejdet med at få et AI-system til at stræbe efter det, mennesker faktisk mener, og afvise det, de ikke vil acceptere.

Formelt

Det felt og den praksis, der styrer et AI-systems mål og adfærd, så de svarer til skabernes og brugernes hensigter og værdier - hjælpsomt, ærligt og afvisende over for skadelige ønsker - også i situationer, det aldrig er testet i.

Forklaret enkelt

Som kong Midas, der ønskede, at alt, han rørte ved, blev til guld, og fik præcis det - også sin mad. Ønsket blev opfyldt efter ordlyden, ikke efter meningen.

I praksis

Et forskerhold på et dansk universitet tilpasser en åben model til dansk og lader derefter mennesker bedømme dens svar, så den lærer at indrømme usikkerhed og nægte trinvis hjælp til at bygge våben.

Hvorfor det betyder noget

Et dygtigt system, der forfølger et en smule forkert mål, kan gøre skade i stor skala; jo mere AI-agenter handler på egen hånd, jo mere betyder afstanden mellem det, vi bad om, og det, vi mente.

Guardrails (sikkerhedsværn)

AI-risiko og governance

Kontroller rundt om et AI-system, der stopper usikre forespørgsler på vej ind og skadelige eller lækkende svar på vej ud.

Formelt

Regler, filtre og små kontrolmodeller, der kører før og efter en stor sprogmodel og tjekker input og output mod en politik - blokerer jailbreak-forsøg, fjerner personoplysninger, tvinger et tilladt format - uafhængigt af, hvordan modellen er trænet.

Forklaret enkelt

Som autoværnet langs en bjergvej - det styrer ikke bilen, men det forhindrer den i at køre ud over kanten, når føreren laver en fejl.

I praksis

Kundeservicechefen i en webshop lader hver chatbesked passere et filter, der markerer jailbreak-formuleringer, og hvert svar passere et andet, der skjuler kortnumre, før kunden ser det.

Hvorfor det betyder noget

Træning gør aldrig en model helt sikker, så eksterne kontroller giver en ekstra forsvarslinje, der kan testes, og som ejeren hurtigt kan ændre uden at træne modellen igen.

Fælles forbindelser

Atlas er i beta.