Gå til indhold
atlas

Selvsuperviseret læring

Også kendt som: self-supervised learning

Maskinlæring, hvor de rigtige svar kommer fra selve dataene - fx ved at skjule et ord i en sætning og gætte det igen.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En form for maskinlæring, der laver sine egne mærkater ud fra træningsdata uden mærkater ved at skjule eller holde en del af hvert eksempel tilbage og lære at udfylde den ud fra resten.

Forklaret enkelt

Som at lære en sang ved at sætte optagelsen på pause midt i en linje, synge de næste ord selv og så spille videre for at tjekke - sangen giver selv svaret.

I praksis

En regions tale-til-tekst-team lader en model lære af tusindvis af timers dansk tale ved at skjule korte bidder af lyden og gætte dem og behøver derefter kun få timers optagelser med færdig tekst for at kunne skrive lægernes notater ud.

Hvorfor det betyder noget

At fjerne behovet for menneskelige mærkater er det, der gjorde det muligt at træne på hele nettet - og grunden til, at alt på nettet, godt eller skidt, ender i modellen.

Teknisk uddybning

Tilgangen definerer en hjælpeopgave (pretext task), hvis mål kan beregnes ud fra det rå input, træner et netværk på den med et almindeligt superviseret tab og genbruger derefter de lærte repræsentationer til efterfølgende opgaver. To familier dominerer. Generative eller prædiktive mål rekonstruerer skjulte dele af inputtet: Kausal sprogmodellering forudsiger det næste token ud fra de foregående (GPT-linjen), maskeret sprogmodellering forudsiger skjulte tokens ud fra begge sider, og maskerede autoencodere til billeder (He m.fl., 2021) skjuler en stor andel af billedfelterne, typisk 75 procent, og rekonstruerer pixelværdierne. Kontrastive og joint-embedding-mål lærer i stedet at placere forskellige udgaver af samme element tæt sammen og forskellige elementer langt fra hinanden: SimCLR (2020) kontrasterer to augmenterede udsnit af et billede, og CLIP (2021) afstemmer billeder med deres billedtekster med et kontrastivt tab over store batches.

BERT (Devlin m.fl., 2019) viser detaljerne. Modellen udvælger 15 procent af input-tokens til forudsigelse; af dem erstattes 80 procent af et [MASK]-token, 10 procent af et tilfældigt token, og 10 procent forbliver uændrede, så modellen ikke kan regne med at se [MASK] under finjustering. Tale fungerer på samme måde: wav2vec 2.0 (Baevski m.fl., 2020) maskerer afsnit af latente talefeatures og løser en kontrastiv opgave over kvantiserede mål og viste, at finjustering på helt ned til ti minutters transskriberet lyd efter fortræning på 53.000 timers umærket tale kunne give brugbare talegenkendere, hvilket er mønstret bag sprog med få ressourcer og domænespecifik diktering.

En kendt fejltype for joint-embedding-metoder er repræsentationskollaps, hvor netværket afbilder alle input til samme vektor og dermed trivielt opfylder målet. Negative par (kontrastive metoder), asymmetriske arkitekturer med stop-gradient (BYOL, SimSiam) eller eksplicit variansregularisering (VICReg) forhindrer det. Valget af augmentering indebærer også antagelser: Beskæring og farvevariation lærer modellen at være ufølsom over for netop de ændringer, hvilket er skadeligt, hvis farve betyder noget i den efterfølgende opgave.

Begrebet er omstridt. Nogle forfattere, herunder Yann LeCun, der gjorde udtrykket udbredt, skelner skarpt mellem det og ikke-superviseret læring; ældre litteratur placerer de samme metoder under ikke-superviseret læring. Den praktiske forskel er, at selvsuperviserede metoder har et eksplicit forudsigelsesmål og et tab i superviseret stil.

Skala er både konsekvensen og risikoen. Fordi der ikke kræves menneskelig mærkning, kan fortræningskorpora omfatte billioner af tokens webtekst, hvilket gør foundation models mulige, men også betyder, at giftigt indhold, personoplysninger, ophavsretligt beskyttet materiale og bevidst forgiftede sider havner i modellen, medmindre de filtreres fra. Den fortrænede model efterfølges normalt af superviseret finjustering og præferencetræning før udrulning.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Træningsdata
  2. →Selvsuperviseret læring

Relationer

Forudsætter
Træningsdata

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.