Overførselslæring (transfer learning)
Også kendt som: transfer learning
At genbruge det, en model allerede har lært på én stor opgave, som udgangspunkt for en ny, beslægtet opgave i stedet for at starte fra nul.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En måde at lave modeltræning på, hvor en model trænet på et stort, generelt datasæt tages som start for en ny opgave og kun justeres med en mindre mængde opgavedata.
Forklaret enkelt
Som en bilist, der skal lære at køre varevogn - rattet, færdselsreglerne og fornemmelsen for trafikken følger med, så kun størrelsen og spejlene skal øves.
I praksis
En ingeniør i et forsyningsselskab tager en billedmodel, der er trænet på millioner af almindelige fotos, og lærer den at finde revner i kloakvideoer med kun 3.000 mærkede billeder.
Hvorfor det betyder noget
Det lader små teams bygge brugbare modeller uden enorme datamængder eller budgetter - men den nye model arver også den gamle models blinde vinkler, skævheder og al skjult manipulation.
Teknisk uddybning
Pan og Yangs oversigtsartikel fra 2010 formaliserer situationen med et kildedomæne og en kildeopgave samt et måldomæne og en målopgave, hvor et domæne er et feature-rum plus en marginalfordeling over det. Overførsel er nyttig, når målopgaven har få mærkede data, men deler struktur med kilden. Deres taksonomi skelner mellem induktiv overførsel (mærkater i målet, anden opgave), transduktiv overførsel (samme opgave, andet domæne, ofte kaldet domænetilpasning) og ikke-superviseret overførsel (ingen mærkater i nogen af dem).
I deep learning har det dominerende mønster siden begyndelsen af 2010'erne været at tage et netværk, der er fortrænet på et stort datasæt (historisk ImageNet til billeder, senere selvsuperviserede tekst- eller billede-tekst-korpora), og tilpasse det. Spektret går fra feature extraction, hvor de fortrænede lag fryses og kun et nyt outputlag trænes, over delvis finjustering af de øverste lag til fuld finjustering af alle vægte, som regel med en langt mindre læringsrate end ved træning fra bunden, så de fortrænede vægte kun justeres let. Tidlige lag lærer generiske features (kanter, teksturer, orddelsmønstre) og overføres godt; senere lag er mere opgavespecifikke. Parameter-effektive finjusteringsmetoder som adaptere og LoRA træner et lille antal tilføjede parametre, mens basismodellen holdes frosset, hvilket sparer hukommelse og gør det billigt at have mange opgavevarianter af én basismodel.
Overførsel kan slå fejl. Negativ overførsel opstår, når kilde og mål er så forskellige, at det fortrænede udgangspunkt klarer sig dårligere end træning fra bunden, fx features fra naturfotos anvendt på spektrogrammer eller radardata med helt andre statistiske egenskaber. Katastrofal glemsel er tabet af evner fra kildeopgaven under aggressiv finjustering; det har betydning, når den tilpassede model stadig forventes at håndtere generelle input. Domæneskift mellem kilde og mål, fx et andet kamera, en anden sprogvariant eller et andet dokumentlayout, kan bestå selv efter finjustering og bør testes eksplicit.
Overførsel flytter også risiko. Målmodellen arver kildemodellens skævheder, videnshuller og enhver bagdør, der er plantet under fortræningen; Gu m.fl. (2017, BadNets) viste, at en bagdør i en detektor til vejskilte kan bestå, selv efter at netværket er gentrænet til en anden opgave. Brug af en tredjeparts basismodel er derfor en beslutning om AI-forsyningskæden: Verificér kilden, fastlås det præcise checkpoint med hashværdi, foretræk sikre serialiseringsformater som safetensors frem for pickle-baserede filer, der kan afvikle kode ved indlæsning, og tjek basismodellens licens og dokumentation (model card, resumé af træningsdata).
Begreberne overlapper i nutidig brug. Fortræning frembringer kildemodellen, finjustering er den mest udbredte overførselsmekanisme, og at prompte en foundation model med nogle få eksempler (in-context learning) opnår en del af samme effekt uden at ændre nogen vægte.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Neuralt netværk
- →Træningsdata
- →Deep learning
- →Modeltræning
- →Overførselslæring (transfer learning)
Relationer
- Forudsætter
- ModeltræningDeep learning
- Implementeres af
- Finjustering (fine-tuning)
- Forveksl ikke med
- Vidensdestillation (distillation)
- Afbøder
- Overtilpasning (overfitting)
- Bruges sammen med
- Grundmodel (foundation model)
Kilder og videre læsning
Opslagsværker
- Pan & Yang (2010), A Survey on Transfer Learning · IEEE Transactions on Knowledge and Data Engineering
- Gu, Dolan-Gavitt & Garg (2017), BadNets: Identifying Vulnerabilities in the Machine Learning Model Supply Chain · arXiv
Lærebøger
- Goodfellow, Bengio & Courville, Deep Learning · MIT Press
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…