{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/small-language-model","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/small-language-model/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/small-language-model/"},"term":{"en":"Small language model (SLM)","da":"Lille sprogmodel (SLM)"},"aka":{"en":["SLM"],"da":["SLM"]},"domain":["ai"],"cluster":"model-architecture","layer":"model","status":"emerging","era":2024,"summary":{"en":"A language model small enough to run cheaply on a laptop or phone, trading some broad skill for speed, privacy and low cost.","da":"En sprogmodel, der er lille nok til at køre billigt på en bærbar eller telefon og bytter lidt kunnen for fart, privatliv og lav pris."},"body":{"formal":{"en":"A transformer built like a large language model but with far fewer model parameters - from a few hundred million up to around ten billion - often trained on carefully chosen data or through knowledge distillation from a larger model.","da":"En transformer bygget som en stor sprogmodel, men med langt færre modelparametre - fra nogle hundrede millioner op til omkring ti milliarder - ofte trænet på omhyggeligt udvalgte data eller gennem vidensdestillation fra en større model."},"plain":{"en":"Like a pocket dictionary next to a full encyclopedia - it will not know everything, but it fits in your bag and answers the common questions right away.","da":"Som en lommeordbog ved siden af et helt leksikon - den ved ikke alt, men den passer i tasken og svarer med det samme på de almindelige spørgsmål."},"inPractice":{"en":"A home-care nurse in a municipality dictates visit notes into a tablet that runs a small language model; it drafts the record entry even where there is no mobile signal, and nothing leaves the device.","da":"En sygeplejerske i en kommunes hjemmepleje indtaler besøgsnotater på en tablet, der kører en lille sprogmodel; den skriver et udkast til journalnotatet, også uden mobildækning, og intet forlader enheden."},"whyItMatters":{"en":"For narrow, repeated tasks it can match a bigger model at a small share of the cost and delay, and keeping data on the device makes data protection far simpler.","da":"Til smalle, gentagne opgaver kan den matche en større model for en brøkdel af prisen og ventetiden, og når data bliver på enheden, bliver databeskyttelsen langt enklere."}},"deepDive":{"en":"There is no standard threshold for \"small\"; the label is relative to the frontier and in practice means a dense decoder-only transformer that fits in the memory of a single consumer GPU, laptop or phone. The memory arithmetic sets the boundary: weights need parameters × bytes per parameter, so a 3.8-billion-parameter model takes about 7.6 GB at 16 bits and under 2 GB at 4 bits, plus a KV cache that grows with context length, number of layers and key/value heads. The Phi-3 technical report (Abdin et al., 2024) is a reference point: Phi-3-mini has 3.8 billion parameters, was trained on 3.3 trillion tokens, and a 4-bit quantized version occupying about 1.8 GB generated more than 12 tokens per second on an iPhone 14 with an A16 chip.\n\nThree techniques make small models competitive. First, data quality: the Phi line started with Phi-1 (1.3 billion parameters, \"Textbooks Are All You Need\", 2023), trained on filtered \"textbook-quality\" web data and synthetic exercises generated by a larger model. Second, overtraining: instead of the Chinchilla-optimal ratio of roughly 20 tokens per parameter, small models are trained on many trillions of tokens, which costs more once but makes every later inference cheaper. Third, knowledge distillation (Hinton, Vinyals and Dean, 2015), where the student is trained to match a larger teacher's output distribution, typically via a KL-divergence loss on temperature-softened logits rather than only on hard labels; Gemma 2's smaller models and Meta's Llama 3.2 1B and 3B models used distillation, the latter combined with pruning. Quantization and pruning then shrink the result further for on-device runtimes such as llama.cpp, ONNX Runtime or Core ML.\n\nThe trade-offs are predictable. Stored factual knowledge scales with parameter count, so small models hallucinate facts more readily and are best paired with retrieval or tightly scoped tasks; multi-step reasoning, long-context use, instruction following in complex prompts and performance in lower-resource languages such as Danish tend to degrade first, and English benchmark scores such as MMLU overstate how well a small model will do on Danish case notes. Fine-tuning a small model with LoRA on a few thousand in-domain examples is a common way to close the gap for a narrow task, and cascades that try a small model first and escalate uncertain cases to a larger one are a common serving pattern.\n\nOn privacy, local inference means prompts and outputs need not leave the device, which removes a processor relationship and third-country transfer questions for that step, but the organisation remains data controller under the GDPR, and device encryption, access control and the handling of stored outputs still have to be addressed. Small models are also easier to extract and redistribute once deployed to endpoints, which matters if the fine-tuned weights encode sensitive training data.","da":"Der findes ingen standardgrænse for \"lille\"; betegnelsen er relativ til de største modeller og betyder i praksis en tæt, ren decoder-transformer, der kan ligge i hukommelsen på et enkelt forbruger-GPU, en bærbar eller en telefon. Hukommelsesregnestykket trækker grænsen: Vægtene fylder parametre × bytes pr. parameter, så en model med 3,8 milliarder parametre fylder omkring 7,6 GB ved 16 bit og under 2 GB ved 4 bit, plus en KV-cache, der vokser med kontekstlængden, antallet af lag og antallet af key/value-hoveder. Phi-3-rapporten (Abdin m.fl., 2024) er et pejlemærke: Phi-3-mini har 3,8 milliarder parametre, er trænet på 3,3 billioner tokens, og en 4-bit-kvantiseret udgave på omkring 1,8 GB genererede mere end 12 tokens i sekundet på en iPhone 14 med A16-chip.\n\nTre teknikker gør små modeller konkurrencedygtige. For det første datakvalitet: Phi-linjen begyndte med Phi-1 (1,3 milliarder parametre, \"Textbooks Are All You Need\", 2023), trænet på filtrerede webdata af \"lærebogskvalitet\" og syntetiske øvelser genereret af en større model. For det andet overtræning: I stedet for det Chinchilla-optimale forhold på omtrent 20 tokens pr. parameter trænes små modeller på mange billioner tokens, hvilket koster mere én gang, men gør hver senere inferens billigere. For det tredje vidensdestillation (Hinton, Vinyals og Dean, 2015), hvor eleven trænes til at ramme en større lærermodels outputfordeling, typisk via et KL-divergenstab på logits blødgjort med en temperatur frem for kun på hårde etiketter; Gemma 2's mindre modeller og Metas Llama 3.2 1B og 3B brugte destillation, sidstnævnte kombineret med pruning. Kvantisering og pruning gør derefter resultatet endnu mindre til runtimes på enheden som llama.cpp, ONNX Runtime eller Core ML.\n\nAfvejningerne er forudsigelige. Lagret faktuel viden vokser med antallet af parametre, så små modeller hallucinerer lettere om fakta og fungerer bedst sammen med retrieval eller skarpt afgrænsede opgaver; ræsonnement i flere trin, brug af lang kontekst, instruktionsfølge i komplekse prompts og ydeevne på sprog med færre ressourcer som dansk forringes typisk først, og engelske benchmarkscorer som MMLU overdriver, hvor godt en lille model vil klare danske journalnotater. Finjustering af en lille model med LoRA på nogle få tusinde eksempler fra domænet er en almindelig måde at lukke hullet på til en smal opgave, og kaskader, der prøver en lille model først og sender usikre tilfælde videre til en større, er et udbredt driftsmønster.\n\nHvad angår privatliv, betyder lokal inferens, at prompts og output ikke behøver at forlade enheden, hvilket fjerner et databehandlerforhold og spørgsmål om overførsel til tredjelande for det trin, men organisationen er fortsat dataansvarlig efter databeskyttelsesforordningen, og kryptering af enheden, adgangsstyring og håndtering af gemte output skal stadig på plads. Små modeller er også lettere at trække ud og videredistribuere, når de først er lagt ud på endpoints, hvilket betyder noget, hvis de finjusterede vægte rummer følsomme træningsdata."},"edges":[{"type":"requires","to":"ai/model-parameter","why":{"en":"\"Small\" is measured in model parameters: fewer parameters mean less memory and faster answers, but less stored knowledge.","da":"\"Lille\" måles i modelparametre: færre parametre betyder mindre hukommelse og hurtigere svar, men mindre lagret viden."},"confidence":"high","strength":"primary"},{"type":"requires","to":"ai/transformer","confidence":"high","strength":"normal"},{"type":"requires","to":"ai/token","confidence":"high","strength":"normal"},{"type":"used-with","to":"ai/time-to-first-token","why":{"en":"A smaller model starts answering sooner, which is often the reason to choose one for live, on-device use.","da":"En mindre model begynder hurtigere at svare, hvilket ofte er grunden til at vælge den til brug direkte på enheden."},"confidence":"medium","strength":"normal"}],"depth":3,"sources":[{"title":"Abdin et al. (2024), Phi-3 Technical Report - A Highly Capable Language Model Locally on Your Phone","tier":"reference"},{"title":"Gunasekar et al. (2023), Textbooks Are All You Need","tier":"reference"}],"draft":true}