{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/grounding","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/grounding/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/grounding/"},"term":{"en":"Grounding","da":"Forankring (grounding)"},"aka":{"en":["grounded generation"],"da":["forankret generering"]},"domain":["ai"],"cluster":"retrieval","layer":"application","status":"current","summary":{"en":"Tying a model's answer to sources supplied with the question, so each claim can be traced back to a given document.","da":"At binde en models svar til kilder, der gives med spørgsmålet, så hver påstand kan føres tilbage til et bestemt dokument."},"body":{"formal":{"en":"The practice of placing trusted source text in the context window and telling the model to answer only from it, often citing the passage behind each claim and saying so when the sources do not cover the question.","da":"Praksissen med at lægge troværdig kildetekst i kontekstvinduet og bede modellen om kun at svare ud fra den, ofte med henvisning til afsnittet bag hver påstand og med besked, når kilderne ikke dækker spørgsmålet."},"plain":{"en":"Like a student writing an essay where every claim must name the book and page it came from - if no book says it, it does not go in.","da":"Som en studerende, der skriver en opgave, hvor hver påstand skal nævne den bog og side, den stammer fra - står det ikke i nogen bog, kommer det ikke med."},"inPractice":{"en":"An unemployment insurance fund's member chat answers a question about holiday benefit by quoting section 4.2 of the fund's rules with a link, and says “the rules do not cover this” when nothing fits, passing it to a case officer.","da":"En a-kasses medlemschat besvarer et spørgsmål om feriedagpenge ved at citere punkt 4.2 i a-kassens regler med et link og svarer “det dækker reglerne ikke”, når intet passer, og sender sagen videre til en sagsbehandler."},"whyItMatters":{"en":"Answers a person can trace to a named source are far easier to trust and review, though the model can still misread or stretch a source.","da":"Svar, som en person kan føre tilbage til en navngiven kilde, er langt lettere at stole på og efterprøve, selvom modellen stadig kan misforstå eller strække en kilde."}},"deepDive":{"en":"The word has several senses. In cognitive science the symbol grounding problem (Harnad, 1990) asks how symbols acquire meaning through connection to perception; in vision-language research \"visual grounding\" means locating the image region a phrase refers to. In LLM applications it means source-grounded generation: the answer should be entailed by, and attributable to, text supplied at inference time rather than by the model's parametric memory. Rashkin et al. formalised this as \"attributable to identified sources\" (AIS): a statement is attributable if a generic reader, shown the source, would agree that the source supports it.\n\nA grounded pipeline has three parts. Context construction assigns each retrieved passage a stable identifier and metadata (document, version, section, URL) and places them in the prompt, usually separated from instructions by delimiters. The instruction requires every claim to cite passage identifiers, forbids information not present in the passages, and specifies an abstention answer when coverage is insufficient. Verification then checks the output: parsing citations, confirming that cited identifiers exist, and testing support claim by claim, typically by decomposing the answer into atomic claims and running an entailment (NLI) model or an LLM judge against the cited passage. Some platforms expose this as a built-in \"grounding check\" or return per-sentence support scores; search-grounded APIs attach web results and citation spans to the response.\n\nEvaluation distinguishes citation recall (is each claim supported by its citations?) from citation precision (is each citation needed and relevant?), the metrics used in the ALCE benchmark (Gao et al., 2023), and faithfulness from answer correctness. An answer can be perfectly faithful to an outdated or wrong source, and it can be correct yet ungrounded because the model answered from memory. Both matter, but only faithfulness is under the application's control once retrieval is fixed.\n\nCommon failure modes include citations that point to a real passage that does not actually say the claim, blending of two sources into a statement neither makes, silent reliance on parametric knowledge when retrieval returns nothing relevant, weaker use of passages placed in the middle of a long context, and conflicts between sources resolved arbitrarily. Grounding also does not make sources trustworthy: a retrieved document can carry prompt injection, so passages must be treated as data rather than instructions. NIST AI 600-1 lists confabulation among the risks specific to generative AI, and grounding with source display and human review of cited passages is one of the practical controls for it, not a guarantee.","da":"Ordet har flere betydninger. I kognitionsvidenskaben spørger symbol grounding-problemet (Harnad, 1990), hvordan symboler får betydning gennem forbindelse til sanseindtryk; i forskning i billede og sprog betyder \"visual grounding\" at finde det område i et billede, som en frase henviser til. I LLM-applikationer betyder det kildeforankret generering: Svaret skal følge af og kunne tilskrives tekst, der leveres ved inferens, frem for modellens parametriske hukommelse. Rashkin m.fl. formaliserede det som \"attributable to identified sources\" (AIS): En påstand kan tilskrives, hvis en almindelig læser, der får vist kilden, vil give ret i, at kilden understøtter den.\n\nEn forankret pipeline har tre dele. Kontekstopbygningen giver hver fundet passage en stabil identifikator og metadata (dokument, version, afsnit, URL) og lægger dem i prompten, typisk adskilt fra instruktionerne med skilletegn. Instruktionen kræver, at hver påstand henviser til passage-identifikatorer, forbyder oplysninger, der ikke står i passagerne, og fastlægger et svar, der melder pas, når dækningen ikke er tilstrækkelig. Verifikationen kontrollerer derefter outputtet: Henvisningerne parses, det bekræftes, at de citerede identifikatorer findes, og understøttelsen testes påstand for påstand, typisk ved at dele svaret op i atomare påstande og køre en entailment-model (NLI) eller en LLM-dommer mod den citerede passage. Nogle platforme stiller det til rådighed som et indbygget \"grounding check\" eller returnerer understøttelsesscorer pr. sætning; søgeforankrede API'er vedhæfter webresultater og citatudsnit til svaret.\n\nEvalueringen skelner mellem citation recall (understøttes hver påstand af sine henvisninger?) og citation precision (er hver henvisning nødvendig og relevant?), de mål, der bruges i ALCE-benchmarket (Gao m.fl., 2023), og mellem trofasthed over for kilden og svarets korrekthed. Et svar kan være fuldstændig tro mod en forældet eller forkert kilde, og det kan være korrekt, men uforankret, fordi modellen svarede ud fra hukommelsen. Begge dele betyder noget, men kun trofastheden er under applikationens kontrol, når retrieval-trinnet ligger fast.\n\nTypiske fejl er henvisninger til en rigtig passage, der faktisk ikke siger det påståede, sammenblanding af to kilder til et udsagn, ingen af dem kommer med, stille brug af parametrisk viden, når søgningen ikke finder noget relevant, svagere udnyttelse af passager midt i en lang kontekst og tilfældig afgørelse af modstrid mellem kilder. Forankring gør heller ikke kilderne troværdige: Et fundet dokument kan bære prompt injection, så passager skal behandles som data og ikke som instruktioner. NIST AI 600-1 nævner confabulation blandt de risici, der er særlige for generativ AI, og forankring med visning af kilder og menneskelig kontrol af de citerede passager er en af de praktiske kontroller mod det, ikke en garanti."},"edges":[{"type":"requires","to":"ai/large-language-model","confidence":"high","strength":"normal"},{"type":"requires","to":"ai/context-window","confidence":"high","strength":"normal"},{"type":"mitigates","to":"ai/hallucination","why":{"en":"Limiting answers to supplied sources, with citations, makes unsupported claims rarer and easier to spot - but does not remove them.","da":"At begrænse svar til de givne kilder med kildehenvisninger gør udokumenterede påstande sjældnere og lettere at opdage - men fjerner dem ikke."},"confidence":"medium","strength":"primary"},{"type":"used-with","to":"ai/retrieval-augmented-generation","why":{"en":"RAG finds the sources; grounding is the instruction and checking that keeps the answer to them.","da":"RAG finder kilderne; forankring er den instruks og kontrol, der holder svaret til dem."},"confidence":"high","strength":"primary"}],"depth":3,"sources":[{"title":"NIST AI 600-1 - Artificial Intelligence Risk Management Framework, Generative AI Profile","tier":"standard","publisher":"NIST"},{"title":"Gao et al. (2023), Enabling Large Language Models to Generate Text with Citations","tier":"reference"}],"draft":true}