Gå til indhold
atlas

Retrieval-augmented generation (RAG)

Også kendt som: RAG

At lade en sprogmodel først slå relevante afsnit op i jeres egne dokumenter og derefter svare ud fra dem i stedet for kun fra hukommelsen.

Kladde - dette opslag er endnu ikke gennemgået.

Læs hele artiklen →

Formelt

Et design, hvor et søgetrin finder de afsnit, der passer bedst til et spørgsmål, typisk ved at sammenligne embeddings, og lægger dem ind i prompten, så den store sprogmodel kan bygge sit svar på dem.

Forklaret enkelt

Som en eksamen med alle hjælpemidler - i stedet for at svare fra hukommelsen finder den studerende først de rigtige sider og skriver så svaret.

I praksis

En kommunes interne hjælpebot svarer på “hvor mange feriedage har jeg?” ved at finde den gældende personalepolitik, citere det relevante afsnit og linke til det.

Hvorfor det betyder noget

Det holder svar opdaterede og efterprøvelige uden gentræning, men botten kan nu nå jeres dokumenter - og må ikke vise en bruger filer, vedkommende ikke har adgang til.

Teknisk uddybning

Den oprindelige RAG-model (Lewis m.fl., 2020) blev trænet samlet: En Dense Passage Retriever (DPR), en bi-encoder, udvalgte afsnit fra et Wikipedia-indeks med omkring 21 millioner bidder på 100 ord, og en BART-sekvens-til-sekvens-generator betingede på dem, enten på de samme afsnit for hele svaret (RAG-Sequence) eller ved at marginalisere over afsnit for hvert token (RAG-Token). I dag betyder begrebet næsten altid et løsere ingeniørmønster, hvor en færdig søgekomponent og en færdig LLM kun kobles via prompten uden fælles træning.

En produktionspipeline har en offline- og en online-halvdel. Offline: Kildeformater (PDF, HTML, Office) parses og opdeles i bidder, ofte på et par hundrede tokens med lidt overlap og tilpasset overskrifter; der tilføjes metadata (kilde, dato, ejer, adgangsliste), hver bid embeddes og skrives til et vektorindeks, ofte sammen med et BM25-nøgleordsindeks. Online: Brugerens forespørgsel omskrives eventuelt, vektor- og nøgleordssøgning køres parallelt, de rangerede lister flettes (reciprocal rank fusion er et udbredt valg), en cross-encoder genrangerer de bedste kandidater, der filtreres efter brugerens rettigheder, og de bedste bidder pakkes ind i prompten med kilde-ID'er og en instruktion om kun at svare ud fra dem og citere. Agentiske varianter lader modellen udføre flere søgninger iterativt i stedet for én fast søgning.

Kvalitetsproblemer deler sig klart i søgefejl og genereringsfejl, og de skal måles hver for sig. Søgningen evalueres med recall@k eller lignende på et sæt mærkede spørgsmål: Hvis den rigtige bid ikke hentes, kan ingen promptformulering redde svaret. Typiske årsager er dårlige grænser mellem bidder, der skiller en regel fra dens undtagelse, tabeller, der fladgøres til støj, forespørgsler med andet ordforråd end dokumenterne, og forældede eller dublerede versioner, der rangerer over den gældende. Genereringen evalueres for tro gengivelse (har hver påstand støtte i den hentede kontekst) og relevans; fejlene omfatter at ignorere konteksten til fordel for indlært viden, at flette to kilder forkert og at svare selvsikkert, når søgningen intet brugbart fandt.

Sikkerhedsegenskaberne følger af, at hentet tekst kommer ind i kontekstvinduet på lige fod med al anden tekst. Rettighedsfiltrering skal ske ved forespørgslen ud fra brugerens identitet, ikke ved indeksering med en servicekonto, ellers bliver assistenten en vej til at læse dokumenter, brugeren ikke selv kan åbne. Ethvert dokument, en udenforstående kan påvirke - en indgående mail, en PDF fra en leverandør, en offentlig webside - er en vej ind for indirekte prompt injection, og forgiftede dokumenter kan laves, så de rangerer højt på bestemte forespørgsler. OWASP's LLM Top 10 fra 2025 behandler dette under LLM01 Prompt Injection og LLM08 Vector and Embedding Weaknesses. Da indekset er en kopi af kildedataene, skal sletning og opbevaringsregler også slå igennem dér.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Neuralt netværk
  2. →Token
  3. →Embedding
  4. →Transformer
  5. →Stor sprogmodel (LLM)
  6. →Retrieval-augmented generation (RAG)

Relationer

Kilder og videre læsning

Standarder og officielle tekster

  • NIST AI 600-1 - Artificial Intelligence Risk Management Framework, Generative AI Profile · NIST

Opslagsværker

  • Lewis et al. (2020), Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
  • OWASP Top 10 for Large Language Model Applications · OWASP

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.