Gå til indhold
atlas

Ræsonnementsmodel (reasoning model)

Også kendt som: reasoning model, tænkende model

En LLM, der er trænet til at regne en opgave igennem trin for trin i skjulte noter, før den svarer - langsommere og dyrere, men bedre.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En stor sprogmodel, der er trænet til at skrive en lang række mellemregnings-tokens før sit endelige svar, så den bruger mere inferens på svære opgaver som matematik, kode og planlægning.

Forklaret enkelt

Som en navigatør, der tegner hele ruten ind på søkortet, før skibet forlader havnen - langsommere i gang, men med færre fejl undervejs.

I praksis

En udvikler i en dansk webshop spørger en ræsonnementsmodel, hvorfor nogle kunder bliver trukket to gange ved betalingen; den “tænker” et minut, prøver og dropper to idéer og peger så på den fejlbehæftede linje.

Hvorfor det betyder noget

Brugt til enkle spørgsmål spilder den blot tid og penge, og den viste mellemregning er ikke et pålideligt billede af, hvordan svaret blev nået, så den beviser intet om, hvorvidt svaret er rigtigt.

Teknisk uddybning

Ræsonnementsmodeller flyttede tankekæden fra prompten ind i træningen. OpenAI's o1 (preview udgivet i september 2024) blev beskrevet som trænet med storskala forstærkningslæring til at bruge en lang intern tankekæde, hvor ydeevnen steg både med mere regnekraft til RL-træning og med mere regnekraft brugt på at tænke ved svartidspunktet. DeepSeek-R1 (januar 2025) offentliggjorde en opskrift: R1-Zero blev trænet fra en basismodel med forstærkningslæring alene, med Group Relative Policy Optimization (GRPO) og regelbaserede belønninger for korrekt svar og korrekt format på matematik- og kodeopgaver, hvis svar kan tjekkes automatisk; længere ræsonnementer, selvkontrol og tilbagesporing opstod uden superviserede eksempler. Den udgivne R1 tilføjede et lille sæt SFT-data som koldstart og flere trin for at rette læsbarhed og sprogblanding.

I drift skriver modellen ræsonnements-tokens før det synlige svar. De optager plads i kontekstvinduet, tæller med i grænsen for output-tokens og faktureres som output-tokens, også når udbyderen skjuler dem, og derfor kan pris og ventetid blive flere gange højere end ved et almindeligt kald med samme synlige svar. Udbyderne giver adgang til afvejningen via en indstilling: et effort-niveau eller et token-budget til tænkning; nogle returnerer det rå ræsonnement, andre kun et resumé eller intet. Indstillinger, der virker på almindelige modeller - temperatur, forudfyldte svar, few-shot-eksempler med korte svar - kan være begrænsede eller virke mod hensigten, og instruktioner som "tænk trin for trin" tilføjer lidt, fordi adfærden allerede er trænet ind.

Gevinsterne ligger især i domæner med efterprøvelige svar: konkurrencematematik, programmering, formel logik, planlægning i flere trin og agentisk værktøjsbrug. Ved opslagsspørgsmål og korte klassifikations- og udtræksopgaver giver de ekstra tokens mest ventetid, og lange ræsonnementer kan "overtænke" enkle problemer til forkerte svar. Ræsonnement fjerner heller ikke hallucination; en model kan ræsonnere omhyggeligt ud fra en falsk præmis, den selv har fundet på.

Det synlige ræsonnement er ikke en tro log over beregningen. I Anthropics undersøgelse fra 2025, "Reasoning Models Don't Always Say What They Think", fik modeller hints til svaret, og man tjekkede, om tankekæden indrømmede at bruge dem: I gennemsnit over hint-typerne nævnte Claude 3.7 Sonnet hintet i 25 % af tilfældene og DeepSeek-R1 i 39 %. Ræsonnementsspor er nyttige til fejlfinding og til at overvåge uønsket adfærd, men bør ikke behandles som revisionsspor eller som en forklaring i den forstand, der kræves ved afgørelser om personer. De kan også indeholde tekst, som det endelige svar ville have filtreret fra, fx citeret følsomt input, så logning og visning af ræsonnement kræver samme regler for datahåndtering som andet modeloutput.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Inferens
  2. →Token
  3. →Forudsigelse af næste token
  4. →Ræsonnementsmodel (reasoning model)

Relationer

Forårsager
Latens

Kilder og videre læsning

Officiel dokumentation

  • OpenAI (2024), Learning to Reason with LLMs · OpenAI

Opslagsværker

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.