{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/reasoning-model","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/reasoning-model/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/reasoning-model/"},"term":{"en":"Reasoning model","da":"Ræsonnementsmodel (reasoning model)"},"aka":{"en":["thinking model"],"da":["reasoning model","tænkende model"]},"domain":["ai"],"cluster":"llm","layer":"model","status":"emerging","era":2024,"summary":{"en":"A language model trained to work through a problem step by step in hidden notes before it answers, trading time and cost for better answers.","da":"En LLM, der er trænet til at regne en opgave igennem trin for trin i skjulte noter, før den svarer - langsommere og dyrere, men bedre."},"body":{"formal":{"en":"A large language model trained to produce a long run of working-out tokens before its final answer, so that it spends more inference on hard tasks such as maths, code and planning.","da":"En stor sprogmodel, der er trænet til at skrive en lang række mellemregnings-tokens før sit endelige svar, så den bruger mere inferens på svære opgaver som matematik, kode og planlægning."},"plain":{"en":"Like a navigator who plots the whole route on the chart before the ship leaves port - slower to get going, but with fewer wrong turns at sea.","da":"Som en navigatør, der tegner hele ruten ind på søkortet, før skibet forlader havnen - langsommere i gang, men med færre fejl undervejs."},"inPractice":{"en":"A developer at a Danish webshop asks a reasoning model why some customers are charged twice at checkout; it “thinks” for a minute, tries and drops two ideas, then points to the faulty line.","da":"En udvikler i en dansk webshop spørger en ræsonnementsmodel, hvorfor nogle kunder bliver trukket to gange ved betalingen; den “tænker” et minut, prøver og dropper to idéer og peger så på den fejlbehæftede linje."},"whyItMatters":{"en":"Used for simple questions it only wastes time and money, and its shown working-out is not a reliable record of how the answer was reached, so it proves nothing about whether the answer is right.","da":"Brugt til enkle spørgsmål spilder den blot tid og penge, og den viste mellemregning er ikke et pålideligt billede af, hvordan svaret blev nået, så den beviser intet om, hvorvidt svaret er rigtigt."}},"deepDive":{"en":"Reasoning models moved chain-of-thought from the prompt into training. OpenAI's o1 (preview released in September 2024) was described as trained with large-scale reinforcement learning to use a long internal chain of thought, with performance improving both with more RL training compute and with more test-time compute spent thinking. DeepSeek-R1 (January 2025) published a recipe: R1-Zero was trained from a base model with reinforcement learning alone, using Group Relative Policy Optimization (GRPO) and rule-based rewards for answer correctness and output format on maths and code problems whose answers can be checked automatically; lengthening reasoning, self-verification and backtracking emerged without supervised examples. The released R1 added a small cold-start SFT set and further stages to fix readability and language mixing.\n\nOperationally, the model emits reasoning tokens before the visible answer. They occupy the context window, count against the output-token limit and are billed as output tokens even when the provider hides them, which is why cost and latency can be several times those of a non-reasoning call for the same visible answer. Providers expose the trade-off as a control: an effort level, or a token budget for thinking; some return the raw reasoning, others only a summary or nothing. Settings that work on ordinary models - temperature, prefilled answers, few-shot examples of short answers - may be restricted or counter-productive, and \"think step by step\" instructions add little because the behaviour is already trained in.\n\nThe gains concentrate in domains with verifiable answers: competition mathematics, programming, formal logic, multi-step planning and agentic tool use. On lookup-style questions, short classification and extraction tasks the extra tokens mostly add latency, and long reasoning can \"overthink\" simple problems into wrong answers. Reasoning also does not eliminate hallucination; a model can reason carefully from a false premise it invented.\n\nThe visible reasoning is not a faithful log of the computation. In Anthropic's 2025 study \"Reasoning Models Don't Always Say What They Think\", models were given hints to the answer and then checked for whether their chain of thought admitted using them: averaged across hint types, Claude 3.7 Sonnet mentioned the hint 25% of the time and DeepSeek-R1 39%. Reasoning traces are useful for debugging and for monitoring misbehaviour, but they should not be treated as an audit trail or as an explanation in the sense required for decisions about people. They can also contain text the final answer would have filtered out, such as quoted sensitive input, so logging and display of reasoning need the same data-handling rules as other model output.","da":"Ræsonnementsmodeller flyttede tankekæden fra prompten ind i træningen. OpenAI's o1 (preview udgivet i september 2024) blev beskrevet som trænet med storskala forstærkningslæring til at bruge en lang intern tankekæde, hvor ydeevnen steg både med mere regnekraft til RL-træning og med mere regnekraft brugt på at tænke ved svartidspunktet. DeepSeek-R1 (januar 2025) offentliggjorde en opskrift: R1-Zero blev trænet fra en basismodel med forstærkningslæring alene, med Group Relative Policy Optimization (GRPO) og regelbaserede belønninger for korrekt svar og korrekt format på matematik- og kodeopgaver, hvis svar kan tjekkes automatisk; længere ræsonnementer, selvkontrol og tilbagesporing opstod uden superviserede eksempler. Den udgivne R1 tilføjede et lille sæt SFT-data som koldstart og flere trin for at rette læsbarhed og sprogblanding.\n\nI drift skriver modellen ræsonnements-tokens før det synlige svar. De optager plads i kontekstvinduet, tæller med i grænsen for output-tokens og faktureres som output-tokens, også når udbyderen skjuler dem, og derfor kan pris og ventetid blive flere gange højere end ved et almindeligt kald med samme synlige svar. Udbyderne giver adgang til afvejningen via en indstilling: et effort-niveau eller et token-budget til tænkning; nogle returnerer det rå ræsonnement, andre kun et resumé eller intet. Indstillinger, der virker på almindelige modeller - temperatur, forudfyldte svar, few-shot-eksempler med korte svar - kan være begrænsede eller virke mod hensigten, og instruktioner som \"tænk trin for trin\" tilføjer lidt, fordi adfærden allerede er trænet ind.\n\nGevinsterne ligger især i domæner med efterprøvelige svar: konkurrencematematik, programmering, formel logik, planlægning i flere trin og agentisk værktøjsbrug. Ved opslagsspørgsmål og korte klassifikations- og udtræksopgaver giver de ekstra tokens mest ventetid, og lange ræsonnementer kan \"overtænke\" enkle problemer til forkerte svar. Ræsonnement fjerner heller ikke hallucination; en model kan ræsonnere omhyggeligt ud fra en falsk præmis, den selv har fundet på.\n\nDet synlige ræsonnement er ikke en tro log over beregningen. I Anthropics undersøgelse fra 2025, \"Reasoning Models Don't Always Say What They Think\", fik modeller hints til svaret, og man tjekkede, om tankekæden indrømmede at bruge dem: I gennemsnit over hint-typerne nævnte Claude 3.7 Sonnet hintet i 25 % af tilfældene og DeepSeek-R1 i 39 %. Ræsonnementsspor er nyttige til fejlfinding og til at overvåge uønsket adfærd, men bør ikke behandles som revisionsspor eller som en forklaring i den forstand, der kræves ved afgørelser om personer. De kan også indeholde tekst, som det endelige svar ville have filtreret fra, fx citeret følsomt input, så logning og visning af ræsonnement kræver samme regler for datahåndtering som andet modeloutput."},"edges":[{"type":"requires","to":"ai/inference","why":{"en":"Its gains come from spending more work at answer time, not only from a bigger model, so the idea rests on what happens during inference.","da":"Dens fremskridt kommer af at bruge mere arbejde, når der svares, ikke kun af en større model, så idéen bygger på, hvad der sker under inferens."},"confidence":"high","strength":"primary"},{"type":"requires","to":"ai/next-token-prediction","confidence":"high","strength":"normal"},{"type":"kind-of","to":"ai/large-language-model","confidence":"high","strength":"normal"},{"type":"causes","to":"ai/latency","why":{"en":"Long hidden working-out must be written token by token before the answer starts, so replies can take seconds or minutes.","da":"Lang skjult mellemregning skal skrives token for token, før svaret begynder, så svar kan tage sekunder eller minutter."},"confidence":"high","strength":"normal"}],"depth":2,"sources":[{"title":"OpenAI (2024), Learning to Reason with LLMs","tier":"official-doc","publisher":"OpenAI"},{"title":"DeepSeek-AI (2025), DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","tier":"reference"},{"title":"Chen et al. (2025), Reasoning Models Don't Always Say What They Think","url":"https://arxiv.org/abs/2505.05410","tier":"reference","publisher":"Anthropic"}],"draft":true}