Sampling (udtrækning af tokens)
Også kendt som: afkodning
Måden, en sprogmodel vælger hvert næste stykke tekst blandt sine sandsynlige muligheder - efter fast regel eller med tilfældighed.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
Det trin i inferensen, hvor der, efter at forudsigelse af næste token har givet en chance for hvert muligt token, vælges ét token - altid det mest sandsynlige eller trukket tilfældigt efter de chancer, når indstillinger som temperatur og top-p har justeret dem - og processen gentages.
Forklaret enkelt
Som at vælge næste ord i en historie ved at trække fra en pose, hvor almindelige ord har mange sedler og sjældne ord få - oftest fornuftigt, af og til overraskende.
I praksis
To sagsbehandlere på et jobcenter beder den samme chatassistent skrive et brev ud fra de samme noter og får forskelligt formulerede udkast, fordi hvert ord blev valgt med en smule tilfældighed.
Hvorfor det betyder noget
Valget af regel afgør, om svar kan gentages nøjagtigt, hvilket betyder noget for test og for opgaver som kode, og det former, hvor afvekslende eller kedelig teksten føles.
Teknisk uddybning
I hvert afkodningstrin giver modellen en vektor af logits over ordforrådet. En afkodningsstrategi gør vektoren til ét valgt token, typisk gennem en kæde af logit-processorer: Straffe og bias anvendes, temperaturen omskalerer logits, afskæringsregler som top-k, top-p eller min-p fjerner usandsynlige kandidater, resten normaliseres igen med en softmax, og ét token trækkes med en pseudotilfældig generator. Deterministiske strategier springer trækningen over. Det valgte token føjes til, dets key- og value-vektorer lægges i KV-cachen, og løkken gentages indtil et slut-token, en stopsekvens eller grænsen for output-tokens.
Strategierne udgør en familie. Grådig afkodning vælger altid argmax. Beam search holder de k mest sandsynlige delsekvenser og var standard i maskinoversættelse, men for åben generering viste Holtzman m.fl. (2020), at maksimering af sandsynligheden giver flad, gentagende og degenereret tekst, fordi menneskelig tekst ikke er den mest sandsynlige tekst. Ren sampling fra hele fordelingen har det modsatte problem: Den lange hale af enkeltvis usandsynlige tokens rammes samlet set ofte, og ét dårligt token afsporer resten. Afskæringsmetoder løser det: Top-k (brugt af Fan m.fl., 2018) beholder et fast antal kandidater, nucleus- eller top-p-sampling beholder den mindste mængde, hvis samlede sandsynlighed når p, og min-p (Nguyen m.fl., 2024) beholder tokens, hvis sandsynlighed er mindst en vis andel af det mest sandsynlige tokens. Frequency- og presence-straffe modvirker gentagelser, logit bias tvinger eller forbyder bestemte tokens, og begrænset afkodning maskerer tokens, der ville bryde en grammatik eller et JSON Schema.
Reproducerbarheden er svagere, end indstillingerne antyder. Temperatur 0 eller grådig afkodning fjerner den tilsigtede tilfældighed, men hostet inferens kan stadig give forskelligt output på samme kald. Addition af flydende kommatal er ikke associativ, og GPU-kerner vælger forskellig rækkefølge for summeringer afhængigt af batchstørrelse og andre belastningsafhængige forhold, så logits kan afvige i de sidste bits mellem kørsler og vende et næsten-uafgjort valg. Thinking Machines Lab (2025) viste, at batch-invariante kerner gør gentagne kørsler bit-identiske på bekostning af gennemløb. Nogle API'er tilbyder en seed-parameter, men udbyderne beskriver den som best effort; routing i mixture of experts og spekulativ afkodning giver yderligere variation.
Praktisk vejledning: Brug grådig afkodning eller lav temperatur til udtræk, klassifikation og kode, hvor der findes ét korrekt svar; moderat temperatur med top-p omkring 0,9 til 0,95 til prosa; flere træk plus afstemning eller verifikation (self-consistency, best-of-n med en bedømmer), når præcision betyder mere end pris. Ændr én parameter ad gangen, evaluer over flere træk pr. testtilfælde, og gem afkodningsparametre sammen med prompts, så resultater kan genskabes, så vidt platformen tillader det.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Inferens
- →Token
- →Forudsigelse af næste token
- →Sampling (udtrækning af tokens)
Relationer
- Typer
- Top-p-sampling
- Del af
- Inferens
- Består af
- Temperatur
- Forudsætter
- Forudsigelse af næste token
- Åbner for
- Struktureret output
- Bruges sammen med
- DecoderForudsigelse af næste token
Kilder og videre læsning
Lærebøger
- Jurafsky & Martin, Speech and Language Processing (3rd ed. draft), chapter on large language models (sampling)
Andet
- Thinking Machines Lab (2025), Defeating Nondeterminism in LLM Inference · Thinking Machines Lab
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…