{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/knowledge-cutoff","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/knowledge-cutoff/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/knowledge-cutoff/"},"term":{"en":"Knowledge cutoff","da":"Vidensgrænse (knowledge cutoff)"},"aka":{"en":["training cutoff","cutoff date"],"da":["knowledge cutoff","skæringsdato"]},"domain":["ai"],"cluster":"llm","layer":"training","status":"current","summary":{"en":"The date after which a language model saw no new text, so on its own it knows nothing about events that came later.","da":"Datoen, hvorefter en sprogmodel ikke har set ny tekst, så den af sig selv intet ved om begivenheder, der kom senere."},"body":{"formal":{"en":"The last date covered by the training data of a large language model; the model's built-in knowledge stops there, even though it may be released and used for months or years after.","da":"Den sidste dato, som træningsdataene for en stor sprogmodel dækker; modellens indbyggede viden stopper der, selvom den kan blive udgivet og brugt i måneder eller år efter."},"plain":{"en":"Like a printed travel guide - everything in it was true when it went to print, but it cannot tell you about the restaurant that opened last month.","da":"Som en trykt rejseguide - alt i den passede, da den gik i trykken, men den kan ikke fortælle om restauranten, der åbnede i sidste måned."},"inPractice":{"en":"An IT teacher at a vocational school asks a chat assistant about the latest version of a code library for a lesson; it describes an older version as current, because the new one came out after its cutoff date.","da":"En IT-lærer på en erhvervsskole spørger en chatassistent om den nyeste version af et kodebibliotek til en lektion; den beskriver en ældre version som den aktuelle, fordi den nye kom efter dens skæringsdato."},"whyItMatters":{"en":"Security advice goes stale fast - new weak spots, new attacks, new versions - so answers about recent events must be checked against current sources.","da":"Sikkerhedsråd forælder hurtigt - nye svagheder, nye angreb, nye versioner - så svar om nylige begivenheder skal tjekkes mod aktuelle kilder."}},"deepDive":{"en":"A cutoff date is a property of the pretraining corpus, not of the model's behaviour, and it is fuzzier than the single date on a model card suggests. Web-scale corpora are assembled from crawl snapshots such as Common Crawl, filtered and deduplicated, and then frozen months before training finishes; the model is then post-trained, evaluated and released, so the gap between cutoff and general availability is commonly several months to a year, and the model may stay in service for a year or more after that. Some providers now publish two dates: Anthropic's model documentation, for example, lists a \"reliable knowledge cutoff\" (the date through which knowledge is most extensive and reliable) separately from a later \"training data cutoff\" (the broader range of data used).\n\nThe distinction matters because coverage of any period keeps growing for years after it happens: news analysis, documentation, forum answers and encyclopaedia edits about an event accumulate long after the event itself. The last months before a cutoff are therefore thinly represented, and the model's knowledge of them is patchy. Cheng et al. (\"Dated Data\", 2024) probed models against time-stamped versions of the same resources and found that effective cutoffs often differ substantially from reported ones, and differ between sub-resources, attributing this to old content reappearing in newer crawl dumps and to deduplication schemes that interact badly with near-duplicates.\n\nModels also do not reliably know their own cutoff. Asked directly, a model may name a date earlier than the real one, because the text it saw about itself or about the most recent period is sparse. It has no clock either: unless the system prompt or a tool supplies today's date, it will reason as if the present were somewhere near its training period, which produces wrong ages, wrong \"latest version\" answers and outdated regulatory status. Deployments therefore inject the current date and, where recency matters, give the model search or retrieval.\n\nThe cutoff interacts with neighbouring concepts in specific ways. Retrieval-augmented generation and tool use do not move the cutoff; they place newer text in the context window for the current request only. Fine-tuning on recent data can add some recent knowledge but is an unreliable way to update facts. Continued pretraining or a new model version is the only way to shift the cutoff itself. For security work the practical rule is that anything version-, vulnerability- or law-specific should be checked against a current primary source, because the model's parametric knowledge is guaranteed to be stale for anything that changed after its cutoff.","da":"En skæringsdato er en egenskab ved fortræningskorpusset, ikke ved modellens adfærd, og den er mere uskarp, end den ene dato på et modelkort antyder. Korpusser i webskala samles fra crawl-snapshots som Common Crawl, filtreres og deduplikeres og fryses så måneder før træningen er færdig; derefter eftertrænes, evalueres og udgives modellen, så afstanden fra skæringsdato til generel tilgængelighed er typisk fra flere måneder til et år, og modellen kan være i drift et år eller mere derefter. Nogle udbydere oplyser nu to datoer: Anthropics modeldokumentation angiver fx en \"reliable knowledge cutoff\" (datoen, hvortil viden er mest omfattende og pålidelig) adskilt fra en senere \"training data cutoff\" (det bredere interval af data, der er brugt).\n\nForskellen betyder noget, fordi dækningen af en given periode bliver ved med at vokse i årevis bagefter: Nyhedsanalyser, dokumentation, forumsvar og opslagsværksrettelser om en begivenhed hober sig op længe efter selve begivenheden. De sidste måneder før en skæringsdato er derfor tyndt repræsenteret, og modellens viden om dem er hullet. Cheng m.fl. (\"Dated Data\", 2024) testede modeller mod tidsstemplede versioner af de samme kilder og fandt, at de effektive skæringsdatoer ofte afviger markant fra de oplyste og varierer mellem delkilder; de tilskriver det gammelt indhold, der dukker op igen i nyere crawl-dumps, og deduplikering, der fungerer dårligt med næsten-dubletter.\n\nModeller kender heller ikke pålideligt deres egen skæringsdato. Spurgt direkte kan en model nævne en tidligere dato end den reelle, fordi den tekst, den har set om sig selv eller om den seneste periode, er sparsom. Den har heller intet ur: Medmindre systemprompten eller et værktøj giver dagens dato, ræsonnerer den, som om nutiden lå et sted omkring træningsperioden, hvilket giver forkerte aldre, forkerte svar om \"nyeste version\" og forældet status for regulering. Løsninger indsætter derfor den aktuelle dato og giver modellen søgning eller opslag, hvor aktualitet betyder noget.\n\nVidensgrænsen spiller sammen med nabobegreberne på bestemte måder. Retrieval-augmented generation og værktøjsbrug flytter ikke vidensgrænsen; de lægger nyere tekst ind i kontekstvinduet til det aktuelle kald alene. Finjustering på nye data kan tilføje en smule ny viden, men er en upålidelig måde at opdatere fakta på. Kun fortsat fortræning eller en ny modelversion flytter selve skæringsdatoen. I sikkerhedsarbejde er den praktiske regel, at alt, der afhænger af versioner, sårbarheder eller lovgivning, skal tjekkes mod en aktuel primærkilde, for modellens indlærte viden er med garanti forældet for alt, der har ændret sig efter skæringsdatoen."},"edges":[{"type":"requires","to":"ai/training-data","confidence":"high","strength":"normal"},{"type":"requires","to":"ai/model-training","confidence":"high","strength":"normal"},{"type":"part-of","to":"ai/large-language-model","confidence":"high","strength":"normal"},{"type":"causes","to":"ai/hallucination","why":{"en":"Asked about something after its cutoff, a model often does not say it does not know; it fills the gap with an old or made-up answer.","da":"Spurgt om noget efter sin vidensgrænse siger en model ofte ikke, at den ikke ved det; den fylder hullet med et gammelt eller opdigtet svar."},"confidence":"medium","strength":"normal"}],"depth":2,"sources":[{"title":"NIST AI 600-1 - Artificial Intelligence Risk Management Framework, Generative AI Profile","tier":"standard","publisher":"NIST"},{"title":"Jurafsky & Martin, Speech and Language Processing","tier":"textbook"},{"title":"Cheng et al. (2024), Dated Data: Tracing Knowledge Cutoffs in Large Language Models","url":"https://arxiv.org/abs/2403.12958","tier":"reference"},{"title":"Anthropic documentation - Models overview (reliable knowledge cutoff vs training data cutoff)","url":"https://platform.claude.com/docs/en/about-claude/models/overview","tier":"official-doc","publisher":"Anthropic"}],"draft":true}