{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/chain-of-thought","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/chain-of-thought/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/chain-of-thought/"},"term":{"en":"Chain-of-thought (CoT)","da":"Tankekæde (chain-of-thought)"},"aka":{"en":["CoT","chain-of-thought prompting"],"da":["CoT","chain-of-thought"]},"domain":["ai"],"cluster":"prompting","layer":"inference","status":"current","era":2022,"summary":{"en":"Getting a language model to write out its steps before the final answer, which tends to help on sums, logic and planning.","da":"At få en sprogmodel til at skrive sine mellemregninger ud før det endelige svar, hvilket ofte hjælper på regnestykker, logik og planlægning."},"body":{"formal":{"en":"A prompting method in which a large language model is led - by worked examples or an instruction such as “think step by step” - to produce steps in between before its answer; because each written step becomes input for the next, harder problems can be broken down.","da":"En promptmetode, hvor en stor sprogmodel ledes - med løste eksempler eller en opfordring som “tænk trin for trin” - til at skrive mellemtrin før sit svar; fordi hvert nedskrevet trin bliver input til det næste, kan sværere problemer brydes ned."},"plain":{"en":"Like a teacher who makes pupils show their working on a maths test - writing each step down makes fewer slips and lets you see where one went wrong.","da":"Som en lærer, der kræver, at eleverne viser deres mellemregninger til matematikprøven - at skrive hvert trin ned giver færre fejl og viser, hvor noget gik galt."},"inPractice":{"en":"A planner at a water utility asks an assistant how many pipe inspections two crews can manage in a week; told to work step by step, it lists hours, driving time and time per job before giving the total.","da":"En planlægger på et vandværk spørger en assistent, hvor mange ledningseftersyn to hold kan nå på en uge; bedt om at tage det trin for trin opstiller den timer, køretid og tid pr. opgave, før den giver totalen."},"whyItMatters":{"en":"It often makes answers to multi-step problems better, but the written steps cost time and money and are not a faithful record of how the model really reached its answer.","da":"Det gør ofte svar på problemer i flere trin bedre, men de nedskrevne trin koster tid og penge og er ikke en tro gengivelse af, hvordan modellen reelt nåede sit svar."}},"deepDive":{"en":"Wei et al. (2022) introduced chain-of-thought prompting as few-shot prompting in which each exemplar's answer is preceded by a worked rationale. With eight such exemplars, PaLM 540B reached state-of-the-art accuracy on the GSM8K grade-school maths benchmark at the time, and the paper reported that the benefit appeared only in sufficiently large models (on the order of 100 billion parameters), while smaller models produced fluent but illogical chains that could hurt accuracy. Kojima et al. (2022) then showed the zero-shot variant: appending \"Let's think step by step\" raised text-davinci-002's accuracy on MultiArith from 17.7% to 78.7% and on GSM8K from 10.4% to 40.7%, typically with a second call to extract the final answer from the generated reasoning.\n\nThe mechanism is computational rather than mystical. A transformer performs a bounded amount of computation per generated token; writing intermediate results into the context lets later tokens attend to them, effectively giving the model a scratchpad and more serial steps for problems that need them. This explains where CoT helps (multi-step arithmetic, symbolic manipulation, logic puzzles, planning) and where it adds little (factual recall, simple classification, tasks already solvable in one step), and why it costs more output tokens and latency.\n\nSeveral extensions build on the same idea. Self-consistency (Wang et al., 2022) samples multiple chains at non-zero temperature and takes a majority vote over final answers. Least-to-most prompting decomposes a problem into sub-questions solved in order; Tree of Thoughts (Yao et al., 2023) searches over branching partial solutions with explicit evaluation; program-aided approaches have the model write code whose execution produces the answer, moving arithmetic out of the model. Reasoning models internalise long chains of thought through reinforcement learning, so explicit \"think step by step\" instructions add little to them and some providers advise against prescribing the steps.\n\nThe written chain is not a faithful account of the computation. Turpin et al. (2023) showed that when few-shot prompts were biased - for example by always placing the correct answer in position A - models followed the bias and then produced plausible rationales that never mentioned it. Later work on reasoning models found the same pattern with hidden hints. Consequently CoT output can be used for debugging, for spotting some errors and as a monitoring signal, but not as an explanation of a decision or as evidence that the answer is correct. In production, also decide whether the chain is shown to users: it may contain intermediate statements that are wrong, off-policy or that quote sensitive context.","da":"Wei m.fl. (2022) introducerede chain-of-thought-prompting som few-shot prompting, hvor hvert eksempels svar indledes af en gennemregnet begrundelse. Med otte sådanne eksempler nåede PaLM 540B den dengang bedste præcision på matematikbenchmarket GSM8K med opgaver på grundskoleniveau, og artiklen rapporterede, at gevinsten kun viste sig i tilstrækkeligt store modeller (i størrelsesordenen 100 milliarder parametre), mens mindre modeller skrev flydende, men ulogiske kæder, der kunne sænke præcisionen. Kojima m.fl. (2022) viste derefter zero-shot-varianten: At tilføje \"Let's think step by step\" løftede text-davinci-002's præcision på MultiArith fra 17,7 % til 78,7 % og på GSM8K fra 10,4 % til 40,7 %, typisk med et ekstra kald for at trække det endelige svar ud af det genererede ræsonnement.\n\nMekanismen er beregningsmæssig, ikke mystisk. En transformer udfører en begrænset mængde beregning pr. genereret token; når mellemresultater skrives ind i konteksten, kan senere tokens give attention til dem, så modellen reelt får et kladdepapir og flere serielle trin til problemer, der kræver det. Det forklarer, hvor tankekæder hjælper (regning i flere trin, symbolsk manipulation, logiske gåder, planlægning), hvor de tilføjer lidt (faktuel genkaldelse, enkel klassifikation, opgaver, der kan løses i ét trin), og hvorfor de koster flere output-tokens og mere ventetid.\n\nFlere udvidelser bygger på samme idé. Self-consistency (Wang m.fl., 2022) trækker flere kæder med en temperatur over nul og tager flertalsafstemning over de endelige svar. Least-to-most prompting deler et problem op i delspørgsmål, der løses i rækkefølge; Tree of Thoughts (Yao m.fl., 2023) søger over forgrenede delløsninger med eksplicit vurdering; programstøttede metoder lader modellen skrive kode, hvis kørsel giver svaret, så regningen flyttes ud af modellen. Ræsonnementsmodeller har internaliseret lange tankekæder via forstærkningslæring, så eksplicitte \"tænk trin for trin\"-instruktioner tilføjer lidt, og nogle udbydere fraråder at foreskrive trinene.\n\nDen skrevne kæde er ikke en tro gengivelse af beregningen. Turpin m.fl. (2023) viste, at når few-shot-prompts var skæve - fx med det rigtige svar altid placeret som mulighed A - fulgte modellerne skævheden og skrev derefter troværdige begrundelser, der aldrig nævnte den. Senere arbejde med ræsonnementsmodeller fandt samme mønster med skjulte hints. Tankekædeoutput kan derfor bruges til fejlfinding, til at opdage nogle fejl og som overvågningssignal, men ikke som forklaring på en afgørelse eller som bevis for, at svaret er rigtigt. I produktion skal man også beslutte, om kæden vises for brugerne: Den kan indeholde mellemudsagn, der er forkerte, strider mod retningslinjerne eller citerer følsom kontekst."},"edges":[{"type":"requires","to":"ai/next-token-prediction","confidence":"high","strength":"normal"},{"type":"kind-of","to":"ai/prompt-engineering","confidence":"high","strength":"normal"},{"type":"used-with","to":"ai/reasoning-model","why":{"en":"A reasoning model is trained to produce a long chain of thought by itself, so the technique moves from the prompt into the model.","da":"En ræsonnementsmodel er trænet til selv at skrive en lang tankekæde, så teknikken flytter fra prompten ind i modellen."},"confidence":"high","strength":"primary"},{"type":"used-with","to":"ai/few-shot-prompting","why":{"en":"The original method showed the model a few examples with their steps written out, so it copied that style.","da":"Den oprindelige metode viste modellen nogle eksempler med trinene skrevet ud, så den efterlignede den stil."},"confidence":"high","strength":"normal"},{"type":"used-with","to":"ai/zero-shot-prompting","why":{"en":"Adding just “let's think step by step” to a plain instruction was later shown to bring much of the same gain with no examples.","da":"Blot at tilføje “lad os tænke trin for trin” til en prompt uden eksempler viste sig senere at give meget af den samme gevinst."},"confidence":"high","strength":"normal"}],"depth":2,"sources":[{"title":"Wei et al. (2022), Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","url":"https://arxiv.org/abs/2201.11903","tier":"reference"},{"title":"Kojima et al. (2022), Large Language Models are Zero-Shot Reasoners","url":"https://arxiv.org/abs/2205.11916","tier":"reference"}],"draft":true}