{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/transfer-learning","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/transfer-learning/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/transfer-learning/"},"term":{"en":"Transfer learning","da":"Overførselslæring (transfer learning)"},"aka":{"en":[],"da":["transfer learning"]},"domain":["ai"],"cluster":"ml-fundamentals","layer":"training","status":"current","summary":{"en":"Reusing what a model already learned on one big task as the starting point for a new, related task, instead of starting from zero.","da":"At genbruge det, en model allerede har lært på én stor opgave, som udgangspunkt for en ny, beslægtet opgave i stedet for at starte fra nul."},"body":{"formal":{"en":"A way of doing model training in which a model trained on a large, general body of training data is taken as the start for a new task, and only adjusted with a smaller amount of task data.","da":"En måde at lave modeltræning på, hvor en model trænet på et stort, generelt datasæt tages som start for en ny opgave og kun justeres med en mindre mængde opgavedata."},"plain":{"en":"Like a car driver learning to drive a van; steering, traffic rules and road sense carry over, so only the size and the mirrors need practice.","da":"Som en bilist, der skal lære at køre varevogn - rattet, færdselsreglerne og fornemmelsen for trafikken følger med, så kun størrelsen og spejlene skal øves."},"inPractice":{"en":"An engineer at a water utility takes an image model trained on millions of everyday photos and teaches it to spot cracks in sewer inspection videos, using only 3,000 labelled frames.","da":"En ingeniør i et forsyningsselskab tager en billedmodel, der er trænet på millioner af almindelige fotos, og lærer den at finde revner i kloakvideoer med kun 3.000 mærkede billeder."},"whyItMatters":{"en":"It lets small teams build useful models without huge data or budgets, but the new model also inherits the old one's blind spots, biases and any hidden tampering.","da":"Det lader små teams bygge brugbare modeller uden enorme datamængder eller budgetter - men den nye model arver også den gamle models blinde vinkler, skævheder og al skjult manipulation."}},"deepDive":{"en":"Pan and Yang's 2010 survey formalises the setting with a source domain and task and a target domain and task, where a domain is a feature space plus a marginal distribution over it. Transfer is useful when the target task has little labelled data but shares structure with the source. Their taxonomy distinguishes inductive transfer (target labels available, different task), transductive transfer (same task, different domain, often called domain adaptation) and unsupervised transfer (no labels in either).\n\nIn deep learning the dominant pattern since the early 2010s has been to take a network pretrained on a large dataset (historically ImageNet for vision, later self-supervised text or image-text corpora) and adapt it. The spectrum runs from feature extraction, where the pretrained layers are frozen and only a new output head is trained, through partial fine-tuning of the top layers, to full fine-tuning of all weights, usually with a much smaller learning rate than for training from scratch, so the pretrained weights are only nudged. Early layers learn generic features (edges, textures, subword patterns) and transfer well; later layers are more task-specific. Parameter-efficient fine-tuning methods such as adapters and LoRA train a small number of added parameters while keeping the base frozen, which reduces memory and makes it cheap to keep many task variants of one base model.\n\nTransfer can fail. Negative transfer occurs when source and target are dissimilar enough that the pretrained starting point performs worse than training from scratch, for example natural-photo features applied to spectrograms or radar data with very different statistics. Catastrophic forgetting is the loss of source-task abilities during aggressive fine-tuning; it matters when the adapted model is still expected to handle general inputs. Domain shift between source and target, such as a different camera, language variety or document layout, can remain even after fine-tuning and should be tested explicitly.\n\nTransfer also moves risk. The target model inherits the source model's biases, knowledge gaps and any backdoor planted during pretraining; Gu et al. (2017, BadNets) showed that a backdoor in a traffic-sign detector can persist even after the network is retrained for another task. Using a third-party base model is therefore an AI supply chain decision: verify the source, pin the exact checkpoint by hash, prefer safe serialisation formats such as safetensors over pickle-based files that can execute code on load, and check the base model's licence and documentation (model card, training-data summary).\n\nThe terms overlap in current usage. Pretraining produces the source model, fine-tuning is the most common transfer mechanism, and prompting a foundation model with a few examples (in-context learning) achieves some of the same effect without changing any weights.","da":"Pan og Yangs oversigtsartikel fra 2010 formaliserer situationen med et kildedomæne og en kildeopgave samt et måldomæne og en målopgave, hvor et domæne er et feature-rum plus en marginalfordeling over det. Overførsel er nyttig, når målopgaven har få mærkede data, men deler struktur med kilden. Deres taksonomi skelner mellem induktiv overførsel (mærkater i målet, anden opgave), transduktiv overførsel (samme opgave, andet domæne, ofte kaldet domænetilpasning) og ikke-superviseret overførsel (ingen mærkater i nogen af dem).\n\nI deep learning har det dominerende mønster siden begyndelsen af 2010'erne været at tage et netværk, der er fortrænet på et stort datasæt (historisk ImageNet til billeder, senere selvsuperviserede tekst- eller billede-tekst-korpora), og tilpasse det. Spektret går fra feature extraction, hvor de fortrænede lag fryses og kun et nyt outputlag trænes, over delvis finjustering af de øverste lag til fuld finjustering af alle vægte, som regel med en langt mindre læringsrate end ved træning fra bunden, så de fortrænede vægte kun justeres let. Tidlige lag lærer generiske features (kanter, teksturer, orddelsmønstre) og overføres godt; senere lag er mere opgavespecifikke. Parameter-effektive finjusteringsmetoder som adaptere og LoRA træner et lille antal tilføjede parametre, mens basismodellen holdes frosset, hvilket sparer hukommelse og gør det billigt at have mange opgavevarianter af én basismodel.\n\nOverførsel kan slå fejl. Negativ overførsel opstår, når kilde og mål er så forskellige, at det fortrænede udgangspunkt klarer sig dårligere end træning fra bunden, fx features fra naturfotos anvendt på spektrogrammer eller radardata med helt andre statistiske egenskaber. Katastrofal glemsel er tabet af evner fra kildeopgaven under aggressiv finjustering; det har betydning, når den tilpassede model stadig forventes at håndtere generelle input. Domæneskift mellem kilde og mål, fx et andet kamera, en anden sprogvariant eller et andet dokumentlayout, kan bestå selv efter finjustering og bør testes eksplicit.\n\nOverførsel flytter også risiko. Målmodellen arver kildemodellens skævheder, videnshuller og enhver bagdør, der er plantet under fortræningen; Gu m.fl. (2017, BadNets) viste, at en bagdør i en detektor til vejskilte kan bestå, selv efter at netværket er gentrænet til en anden opgave. Brug af en tredjeparts basismodel er derfor en beslutning om AI-forsyningskæden: Verificér kilden, fastlås det præcise checkpoint med hashværdi, foretræk sikre serialiseringsformater som safetensors frem for pickle-baserede filer, der kan afvikle kode ved indlæsning, og tjek basismodellens licens og dokumentation (model card, resumé af træningsdata).\n\nBegreberne overlapper i nutidig brug. Fortræning frembringer kildemodellen, finjustering er den mest udbredte overførselsmekanisme, og at prompte en foundation model med nogle få eksempler (in-context learning) opnår en del af samme effekt uden at ændre nogen vægte."},"edges":[{"type":"requires","to":"ai/model-training","confidence":"high","strength":"normal"},{"type":"requires","to":"ai/deep-learning","confidence":"high","strength":"normal"},{"type":"mitigates","to":"ai/overfitting","why":{"en":"Starting from broad, general knowledge makes a model less likely to just memorise a small set of task examples.","da":"At starte fra bred, generel viden gør det mindre sandsynligt, at en model bare lærer et lille sæt opgaveeksempler udenad."},"confidence":"medium","strength":"normal"}],"depth":2,"sources":[{"title":"Goodfellow, Bengio & Courville, Deep Learning","url":"https://www.deeplearningbook.org/","tier":"textbook","publisher":"MIT Press"},{"title":"Pan & Yang (2010), A Survey on Transfer Learning","url":"https://doi.org/10.1109/TKDE.2009.191","tier":"reference","publisher":"IEEE Transactions on Knowledge and Data Engineering"},{"title":"Gu, Dolan-Gavitt & Garg (2017), BadNets: Identifying Vulnerabilities in the Machine Learning Model Supply Chain","url":"https://arxiv.org/abs/1708.06733","tier":"reference","publisher":"arXiv"}],"draft":true}