Bias-varians-afvejning
Også kendt som: bias-variance trade-off, bias-varians-dilemmaet
Spændingen mellem en model, der er for simpel til at fange det egentlige mønster, og en så fleksibel, at den jagter tilfældige detaljer.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
Den fejl, en model begår på nye data, kan deles i en del fra forkerte faste antagelser, en del fra hvor meget tilpasningen ville ændre sig med en anden stikprøve af træningsdata, og støj, som intet kan fjerne; sænker man den ene af de to første, stiger den anden som regel.
Forklaret enkelt
Som at tegne en linje gennem prikker på et papir. En lineal overser den kurve, der faktisk er der, mens en hånd, der rammer hver eneste prik, tegner en vild figur, som siger meget lidt om, hvor den næste prik lander.
I praksis
Et team i en bank, der skal forudsige misligholdte lån, prøver modeller af stigende størrelse, tjekker hver mod et valideringssæt og vælger den, hvor fejlen på de tilbageholdte sager er lavest, ikke den, der passer bedst til de gamle lån.
Hvorfor det betyder noget
Den forklarer, hvorfor en model, der ser perfekt ud på de sager, den har lært af, stadig kan fejle i virkeligheden, og hvorfor valget af modelstørrelse og begrænsninger er en balance og ikke et kapløb om den største model.
Teknisk uddybning
For kvadreret fejl kan den forventede fejl for en lært prædiktor i et punkt x, taget som gennemsnit over træningssæt trukket fra samme fordeling, opdeles præcist i bias i anden (hvor langt den gennemsnitlige forudsigelse ligger fra den sande funktion), varians (hvor meget de enkelte forudsigelser spreder sig omkring gennemsnittet) og målvariablens irreducible støjvarians. Geman, Bienenstock og Doursat (1992) bragte denne dekomposition ind i forskningen i neurale netværk som bias/varians-dilemmaet: En fleksibel, ikke-parametrisk estimator har lav bias, men kræver meget store stikprøver for at holde variansen nede, mens en begrænset estimator har lav varians, men kan tage systematisk fejl. For andre tabsfunktioner, fx 0-1-tab ved klassifikation, findes der ingen enkel additiv dekomposition, men flere konkurrerende definitioner.
I klassisk praksis styres afvejningen gennem modelkapaciteten: polynomiets grad, træets dybde, antallet af naboer i k-nærmeste-nabo eller styrken af en regulariseringsstraf. Tegner man testfejlen som funktion af kapaciteten, får man lærebogens U-formede kurve med undertilpasning til venstre, overtilpasning til højre og den bedste model i bunden, som findes med et valideringssæt eller krydsvalidering. Ensembler virker direkte på variansleddet: Bagging og random forests tager gennemsnittet af mange træer med høj varians, mens boosting primært mindsker bias ved at tilføje svage modeller efter hinanden.
Belkin, Hsu, Ma og Mandal (2019) viste, at U-kurven kun er første del af et længere forløb, som de kaldte double descent. Testfejlen topper nær interpolationstærsklen, hvor modellen netop har kapacitet nok til at passe træningsdata præcist, og falder derefter igen, når kapaciteten fortsat vokser, ofte til under det klassiske minimum. Effekten ses for random feature-modeller, ensembler af beslutningstræer og neurale netværk og er med til at forklare, hvorfor stærkt overparametriserede dybe netværk med nul træningsfejl alligevel kan generalisere. Selve dekompositionen gælder stadig; det, der ændrer sig, er antagelsen om, at variansen altid stiger med antallet af parametre, fordi implicit regularisering fra træningsproceduren (fx at stokastisk gradientnedstigning finder løsninger med mindst norm) holder variansen nede.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
Relationer
- Bruges sammen med
- Regularisering
Kilder og videre læsning
Opslagsværker
Lærebøger
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…