Stor sprogmodel (LLM)
Også kendt som: LLM, sprogmodel
En meget stor model, trænet på enorme mængder tekst til at forudsige det næste ord, så den kan skrive, opsummere og svare i flydende sprog.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En deep learning-model, typisk en transformer med milliarder af vægte, trænet på enorme tekstsamlinger til at forudsige det næste token; den samme evne, gentaget, lader den skrive lange svar på en prompt.
Forklaret enkelt
Som ordforslagene på en mobiltelefons tastatur, bare trænet på en stor del af internettet - den ved, hvordan svar plejer at lyde, ikke om de er sande.
I praksis
Medarbejderne i en kommune får en chatassistent bygget på en LLM til at skrive udkast til svar til borgere og opsummere mødenoter, og IT-afdelingen må beslutte, hvilke data de må indsætte i den.
Hvorfor det betyder noget
LLM'er lyder sikre, selv når de tager fejl, kan styres af skjult tekst og sender dit input til den, der driver dem - alt sammen reelle risici, der skal vejes før brug.
Teknisk uddybning
Næsten alle nuværende LLM'er er decoder-only-transformere: en stak af ens blokke, der hver kombinerer kausal (maskeret) multi-head self-attention med et feed-forward-netværk, residualforbindelser og normalisering, oven på en token-embedding-tabel og under en outputprojektion tilbage til ordforrådet. Moderne varianter bruger typisk rotary position embeddings, RMSNorm, gatede feed-forward-lag som SwiGLU og grouped-query attention; mange store modeller er mixture of experts, hvor en router kun aktiverer nogle få ekspert-netværk pr. token, så antallet af parametre og regnearbejdet pr. token ikke længere følges ad. "Stor" har ingen formel grænse; åbne modeller spænder fra omkring en milliard til flere hundrede milliarder parametre.
Træningen foregår i trin. Fortræningen minimerer cross-entropy for næste token over billioner af tokens webtekst, kode, bøger og i stigende grad syntetiske data. Arbejdet med skaleringslove (Kaplan m.fl., 2020; Hoffmann m.fl., 2022, Chinchilla-artiklen) viste, at tabet falder forudsigeligt som en potenslov i parametre, data og regnekraft, og at beregningsoptimal træning bruger i størrelsesordenen 20 tokens pr. parameter, selvom produktionsmodeller ofte trænes langt ud over det for at gøre inferens billigere. Eftertræningen anvender derefter supervised fine-tuning på par af instruktion og svar, præferenceoptimering (RLHF eller DPO) og, for ræsonnementsmodeller, forstærkningslæring på opgaver, hvor svaret kan tjekkes. Resultatet leveres som vægte plus en tokenizer og en chatskabelon.
Ved inferens kører modellen ét forward pass over prompten (prefill) og derefter ét pass pr. genereret token (decode) med genbrug af en KV-cache; prefill er begrænset af regnekraft, decode af hukommelsesbåndbredde, og derfor koster output-tokens mere, og time to first token og tokens pr. sekund er separate mål. Evner som in-context learning, værktøjskald og struktureret output er adfærd i den samme løkke, formet af træningen, ikke separate moduler; modellen har ingen database, intet ur og ingen indbygget adskillelse mellem instruktioner og data.
Reguleringsmæssigt bruger AI-forordningen ikke begrebet LLM, men regulerer AI-modeller til almen brug (art. 3, nr. 63) med udbyderforpligtelser i art. 53, der gælder fra 2. august 2025: teknisk dokumentation, oplysninger til downstream-udbydere, en ophavsretspolitik og et offentligt resumé af træningsindholdet. En model formodes at have systemisk risiko, når den samlede træningsberegning overstiger 10^25 flydende kommatalsoperationer (art. 51, stk. 2), hvilket udløser de ekstra krav om evaluering, hændelsesrapportering og cybersikkerhed i art. 55. Organisationer, der blot bruger en LLM via et API, er idriftsættere af det AI-system, de bygger omkring den, og deres pligter afhænger af systemets anvendelse, ikke af modellen.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Token
- →Transformer
- →Stor sprogmodel (LLM)
Relationer
- Forudsætter
- TransformerToken
- Åbner for
- Agentisk arbejdsgangAI-agentAI-kodegennemgangAI-kodeassistentForankring (grounding)Guardrails (sikkerhedsværn)Instruktionstilpasning (instruction tuning)JailbreakLLM som dommer (LLM-as-a-judge)PromptPrompt injectionRetrieval-augmented generation (RAG)Afsløring af følsomme oplysninger
- Forårsager
- Hallucination
- Bruges sammen med
- Selvsuperviseret læringDecoderFinjustering (fine-tuning)
Kilder og videre læsning
Standarder og officielle tekster
- NIST AI 600-1 - Artificial Intelligence Risk Management Framework, Generative AI Profile · NIST
- Regulation (EU) 2024/1689 (Artificial Intelligence Act), general-purpose AI models · European Union
Opslagsværker
- Brown et al. (2020), Language Models are Few-Shot Learners
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Nævnt i
Test dig selv
Indlæser…