AI-risiko og governance
Arbejdet med at få et AI-system til at stræbe efter det, mennesker faktisk mener, og afvise det, de ikke vil acceptere.
Formelt
Det felt og den praksis, der styrer et AI-systems mål og adfærd, så de svarer til skabernes og brugernes hensigter og værdier - hjælpsomt, ærligt og afvisende over for skadelige ønsker - også i situationer, det aldrig er testet i.
Forklaret enkelt
Som kong Midas, der ønskede, at alt, han rørte ved, blev til guld, og fik præcis det - også sin mad. Ønsket blev opfyldt efter ordlyden, ikke efter meningen.
I praksis
Et forskerhold på et dansk universitet tilpasser en åben model til dansk og lader derefter mennesker bedømme dens svar, så den lærer at indrømme usikkerhed og nægte trinvis hjælp til at bygge våben.
Hvorfor det betyder noget
Et dygtigt system, der forfølger et en smule forkert mål, kan gøre skade i stor skala; jo mere AI-agenter handler på egen hånd, jo mere betyder afstanden mellem det, vi bad om, og det, vi mente.