Gå til indhold
atlas

Hallucination

Også kendt som: konfabulering, AI-hallucination, sprogmodel-hallucination, opdigtede svar

Når en AI-model finder på noget, der ikke er sandt - et faktum, et citat, en kilde - og siger det lige så sikkert som et sandt svar.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

Flydende og troværdigt output, som hverken har støtte i input eller i fakta, fra en AI-model, der skaber ny tekst eller nye billeder; det opstår, fordi sådanne modeller er bygget til at skrive sandsynlig tekst, ikke tjekket sandhed.

Forklaret enkelt

Som en gæst til en fest, der aldrig indrømmer ikke at vide noget - spurgt om hvad som helst giver de et glat, detaljeret svar, uanset om det er sandt.

I praksis

En medarbejder i et ministerium beder en chatassistent om domme til støtte for et udkast til svar; den nævner tre, og et tjek viser, at ingen af sagerne findes.

Hvorfor det betyder noget

Svar, som modellen har fundet på, ligner nøjagtigt ægte svar, så alt AI-output, der bruges til beslutninger, rådgivning eller kode, kræver en person, der tjekker det.

Teknisk uddybning

Oversigtsartiklen af Ji m.fl. (2023) skelner mellem intrinsisk hallucination, hvor output modsiger den kilde, modellen fik (et resumé, der vender et tal i dokumentet om), og ekstrinsisk hallucination, hvor output tilføjer påstande, som kilden hverken kan be- eller afkræfte. For åbne assistenter er endnu en opdeling nyttig: faktuelle fejl (påstanden er forkert om verden) over for fejl i tro gengivelse (påstanden har ikke støtte i den givne kontekst, uanset om den tilfældigvis er sand). NIST AI 600-1 foretrækker betegnelsen konfabulering og nævner den som en af de risici, der er særlige for generativ AI; OWASP's LLM Top 10 fra 2025 dækker følgevirkningen som LLM09 Misinformation.

Grundårsagen er træningsmålet. Fortræning belønner høj sandsynlighed til plausible fortsættelser, og en opdigtet kildehenvisning med den rigtige form af forfatter, titel og årstal er meget plausibel tekst. Sjældne fakta, der kun optræder en eller to gange i træningsdata, er særligt skrøbelige, og modellen har intet separat lager, den kan slå op i for at tjekke en påstand. Eftertræning kan gøre det bedre eller værre: Præferencetræning, der belønner selvsikre og komplette svar, og benchmarks, der giver samme score for at melde pas som for et forkert svar, giver begge modellen et incitament til at gætte frem for at sige, at den ikke ved det - et argument, som forskere hos OpenAI fremførte eksplicit i 2025. Afkodningen spiller også ind: En højere temperatur øger chancen for at trække en usandsynlig, forkert fortsættelse, men grådig afkodning forhindrer ikke hallucination.

Hallucineret indhold hænger typisk sammen lokalt, og derfor er det svært at opdage. Kendte mønstre er opdigtede kilder og domme (sagen Mata v. Avianca i New York i 2023, hvor advokater blev sanktioneret for et processkrift med henvisninger til ikke-eksisterende afgørelser fra en chatbot), opdigtede softwarepakkenavne, som angribere derefter registrerer (slopsquatting), forkerte tal i ellers korrekte resuméer og selvsikre svar om begivenheder efter vidensgrænsen.

Afhjælpning gør fejlene sjældnere og mere synlige; ingen af dem fjerner fænomenet. Retrieval-augmented generation forankrer svar i hentede afsnit, men giver sine egne fejl, når modellen fejllæser eller overgeneraliserer et afsnit. Krav om kildehenvisninger med automatisk tjek af, at hvert citat faktisk findes i kilden, konsistenstjek på tværs af flere svar, at tillade og belønne "det ved jeg ikke", struktureret output til udtræksopgaver og værktøjer til regning og opslag hjælper alle. Evaluering sker med referencebaserede mål, menneskelig gennemgang eller LLM-as-a-judge, som har sine egne fejlrater, så den resterende risiko må håndteres med proces: En navngiven person tjekker output, før det bruges i beslutninger, rådgivning eller kode.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Inferens
  2. →Hallucination

Relationer

Forudsætter
Inferens
Forveksl ikke med
Bias i AI
Udnyttes af
Slopsquatting

Kilder og videre læsning

Standarder og officielle tekster

  • NIST AI 600-1 - Artificial Intelligence Risk Management Framework, Generative AI Profile (confabulation) · NIST

Opslagsværker

  • Ji et al. (2023), Survey of Hallucination in Natural Language Generation · ACM Computing Surveys

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.