Lille sprogmodel (SLM)
Også kendt som: SLM
En sprogmodel, der er lille nok til at køre billigt på en bærbar eller telefon og bytter lidt kunnen for fart, privatliv og lav pris.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En transformer bygget som en stor sprogmodel, men med langt færre modelparametre - fra nogle hundrede millioner op til omkring ti milliarder - ofte trænet på omhyggeligt udvalgte data eller gennem vidensdestillation fra en større model.
Forklaret enkelt
Som en lommeordbog ved siden af et helt leksikon - den ved ikke alt, men den passer i tasken og svarer med det samme på de almindelige spørgsmål.
I praksis
En sygeplejerske i en kommunes hjemmepleje indtaler besøgsnotater på en tablet, der kører en lille sprogmodel; den skriver et udkast til journalnotatet, også uden mobildækning, og intet forlader enheden.
Hvorfor det betyder noget
Til smalle, gentagne opgaver kan den matche en større model for en brøkdel af prisen og ventetiden, og når data bliver på enheden, bliver databeskyttelsen langt enklere.
Teknisk uddybning
Der findes ingen standardgrænse for "lille"; betegnelsen er relativ til de største modeller og betyder i praksis en tæt, ren decoder-transformer, der kan ligge i hukommelsen på et enkelt forbruger-GPU, en bærbar eller en telefon. Hukommelsesregnestykket trækker grænsen: Vægtene fylder parametre × bytes pr. parameter, så en model med 3,8 milliarder parametre fylder omkring 7,6 GB ved 16 bit og under 2 GB ved 4 bit, plus en KV-cache, der vokser med kontekstlængden, antallet af lag og antallet af key/value-hoveder. Phi-3-rapporten (Abdin m.fl., 2024) er et pejlemærke: Phi-3-mini har 3,8 milliarder parametre, er trænet på 3,3 billioner tokens, og en 4-bit-kvantiseret udgave på omkring 1,8 GB genererede mere end 12 tokens i sekundet på en iPhone 14 med A16-chip.
Tre teknikker gør små modeller konkurrencedygtige. For det første datakvalitet: Phi-linjen begyndte med Phi-1 (1,3 milliarder parametre, "Textbooks Are All You Need", 2023), trænet på filtrerede webdata af "lærebogskvalitet" og syntetiske øvelser genereret af en større model. For det andet overtræning: I stedet for det Chinchilla-optimale forhold på omtrent 20 tokens pr. parameter trænes små modeller på mange billioner tokens, hvilket koster mere én gang, men gør hver senere inferens billigere. For det tredje vidensdestillation (Hinton, Vinyals og Dean, 2015), hvor eleven trænes til at ramme en større lærermodels outputfordeling, typisk via et KL-divergenstab på logits blødgjort med en temperatur frem for kun på hårde etiketter; Gemma 2's mindre modeller og Metas Llama 3.2 1B og 3B brugte destillation, sidstnævnte kombineret med pruning. Kvantisering og pruning gør derefter resultatet endnu mindre til runtimes på enheden som llama.cpp, ONNX Runtime eller Core ML.
Afvejningerne er forudsigelige. Lagret faktuel viden vokser med antallet af parametre, så små modeller hallucinerer lettere om fakta og fungerer bedst sammen med retrieval eller skarpt afgrænsede opgaver; ræsonnement i flere trin, brug af lang kontekst, instruktionsfølge i komplekse prompts og ydeevne på sprog med færre ressourcer som dansk forringes typisk først, og engelske benchmarkscorer som MMLU overdriver, hvor godt en lille model vil klare danske journalnotater. Finjustering af en lille model med LoRA på nogle få tusinde eksempler fra domænet er en almindelig måde at lukke hullet på til en smal opgave, og kaskader, der prøver en lille model først og sender usikre tilfælde videre til en større, er et udbredt driftsmønster.
Hvad angår privatliv, betyder lokal inferens, at prompts og output ikke behøver at forlade enheden, hvilket fjerner et databehandlerforhold og spørgsmål om overførsel til tredjelande for det trin, men organisationen er fortsat dataansvarlig efter databeskyttelsesforordningen, og kryptering af enheden, adgangsstyring og håndtering af gemte output skal stadig på plads. Små modeller er også lettere at trække ud og videredistribuere, når de først er lagt ud på endpoints, hvilket betyder noget, hvis de finjusterede vægte rummer følsomme træningsdata.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Token
- →Træningsdata
- →Maskinlæring
- →Transformer
- →Modelparameter
- →Lille sprogmodel (SLM)
Relationer
- Forudsætter
- ModelparameterTransformerToken
- Forveksl ikke med
- Stor sprogmodel (LLM)
Kilder og videre læsning
Opslagsværker
- Abdin et al. (2024), Phi-3 Technical Report - A Highly Capable Language Model Locally on Your Phone
- Gunasekar et al. (2023), Textbooks Are All You Need
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…