Vidensdestillation (distillation)
Også kendt som: destillation, modeldestillation
At træne en lille “elev”-model til at efterligne svar fra en stor “lærer”-model, så den bevarer meget af evnen i langt mindre format.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En form for modeltræning, hvor en mindre elevmodel lærer af det fulde output fra en større lærermodel - den chance, den giver hvert muligt svar, ikke kun dens førstevalg - eller af tekst, læreren skriver, i stedet for kun af mærkede træningsdata.
Forklaret enkelt
Som en elev, der ikke kun lærer, hvilket svar læreren vælger, men også hvor sikker læreren er på hver mulighed, og ender næsten lige så dygtig efter langt mindre læsning.
I praksis
En dataforsker i Skattestyrelsen lader en stor model besvare 100.000 typiske spørgsmål om fradrag og træner derefter en lille model på svarene, så selvbetjeningschatten kører billigt på styrelsens egne servere.
Hvorfor det betyder noget
Det er sådan, mange hurtige, billige modeller bliver lavet, og det betyder også, at en konkurrent kan kopiere meget af en models evne blot ved at samle dens svar - derfor forbyder mange udbydere det i deres vilkår.
Teknisk uddybning
Idéen er ældre end deep learning - Buciluă, Caruana og Niculescu-Mizil beskrev "model compression" i 2006 - men standardformuleringen stammer fra Hinton, Vinyals og Dean (2015). Lærerens logits z sendes gennem en softmax med temperatur T, p_i = exp(z_i/T) / Σ_j exp(z_j/T); en T over 1 udjævner fordelingen og blotlægger den "mørke viden" i de relative sandsynligheder for forkerte klasser (at et 7-tal ligner et 1-tal mere end et 8-tal). Eleven trænes på en vægtet sum af almindelig krydsentropi mod de hårde labels og KL-divergensen mellem lærerens og elevens blødgjorte fordelinger, hvor det bløde led ganges med T², så gradienterne bevarer en sammenlignelig størrelse, når T ændres.
Varianterne adskiller sig ved, hvad der overføres. Svarbaseret destillation matcher outputfordelinger; feature-baseret destillation (FitNets, 2014) matcher også mellemliggende aktiveringer via lærte projektioner; relationsbaserede metoder matcher ligheder mellem eksempler. For sprogmodeller matcher destillation på tokenniveau lærerens fordeling over næste token i hver position, hvilket kræver adgang til dens logits og en fælles tokenizer. Destillation på sekvensniveau (Kim og Rush, 2016) træner i stedet eleven på tekst, som læreren genererer, og kræver kun black-box-adgang via et API. Meget af det, der løst kaldes destillation i LLM-verdenen, er af den anden slags: supervised fine-tuning på syntetisk output fra læreren, herunder chain-of-thought-forløb, som ved de mindre modeller, DeepSeek udgav i 2025, der var finjusteret på ræsonnementseksempler fra DeepSeek-R1.
Resultaterne kan være stærke, men har grænser. DistilBERT (Sanh m.fl., 2019) fjernede halvdelen af lagene i BERT-base, blev omkring 40 % mindre og 60 % hurtigere og bevarede cirka 97 % af GLUE-scoren. Eleven arver lærerens fejl og bias, svækkes ofte mest på sjældne input, som overførselsdatasættet ikke dækkede, og ender som regel under lærerens niveau på den destillerede opgave. Et meget stort kapacitetsspring mellem lærer og elev kan også gøre destillationen mindre effektiv end at bruge en mellemstor lærer.
Destillation skal holdes adskilt fra nabobegreberne. Kvantisering beholder den samme arkitektur og de samme vægte, men gemmer dem med lavere præcision; pruning fjerner vægte eller strukturer fra det samme netværk; transfer learning tilpasser én model til en ny opgave. Teknikkerne kombineres ofte: destillér til en mindre arkitektur, og kvantisér derefter til udrulning. Destillation har også en sikkerheds- og juridisk side. Model extraction-angreb er reelt uautoriseret destillation gennem et offentligt API, og flere kommercielle udbyderes vilkår forbyder at bruge output til at udvikle konkurrerende modeller, så oprindelsen af syntetiske træningsdata er lige så meget et licensspørgsmål som et teknisk spørgsmål.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Træningsdata
- →Modeltræning
- →Vidensdestillation (distillation)
Relationer
- Forudsætter
- Modeltræning
- Forveksl ikke med
- Overførselslæring (transfer learning)
- Alternativ til
- Kvantisering
- Bruges sammen med
- Lille sprogmodel (SLM)Syntetiske data
Kilder og videre læsning
Opslagsværker
- Hinton, Vinyals & Dean (2015), Distilling the Knowledge in a Neural Network
- Sanh et al. (2019), DistilBERT, a distilled version of BERT
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…