Gå til indhold
atlas

Overtilpasning (overfitting)

Også kendt som: overfitting

Når en model lærer sine træningseksempler udenad, inklusive tilfældig støj, og derefter klarer sig dårligt på nye tilfælde.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En fejl i modeltræningen, hvor en model tilpasser sig træningsdata for tæt, så den scorer godt på de data, men dårligt på nye; opdages ved at teste på data, der er holdt uden for træningen.

Forklaret enkelt

Som en studerende, der lærer sidste års eksamenssvar udenad ord for ord og så dumper, når spørgsmålene er en smule ændret.

I praksis

En pensionskasses svindelmodel finder næsten alle falske anmeldelser blandt de sager, den er trænet på, men overser det meste rigtige svindel i drift, fordi den har lært detaljer, der kun fandtes i de gamle sager.

Hvorfor det betyder noget

Det får en model til at se bedre ud på papiret end i virkeligheden, og en model, der har lært eksempler udenad, kan senere gentage private oplysninger fra sine træningsdata.

Teknisk uddybning

Overtilpasning måles med generaliseringsgabet: forskellen mellem fejlen på træningsdata og fejlen på data fra samme fordeling, som modellen aldrig har set. Den klassiske forklaring er bias-varians-dekompositionen af den forventede kvadrerede fejl i bias i anden, varians og irreducibel støj. Simple modeller har høj bias og undertilpasser; meget fleksible modeller har høj varians, dvs. deres tilpasning ændrer sig meget med den konkrete stikprøve, og overtilpasser. Lærebogsbilledet er en U-formet testfejlkurve, når modelkapaciteten vokser, med den bedste model i bunden af U'et.

Opdagelse kræver ærlig evaluering på tilbageholdte data: et valideringssæt eller k-fold-krydsvalidering til modelvalg og et urørt testsæt til det endelige tal. Læringskurver, hvor træningstabet stadig falder, mens valideringstabet stiger, er det typiske kendetegn, og early stopping stopper træningen ved valideringsminimum. Et beslægtet, men særskilt problem er overtilpasning til selve validerings- eller testsættet gennem gentagen tuning mod det eller ved at vælge den bedste af mange kørsler; offentlige benchmarks lider under dette i fællesskabsskala.

De almindelige modtræk er flere eller mere varierede data, dataaugmentering, mindre kapacitet og regularisering: L2-straf (weight decay, ridge) skrumper vægtene, L1-straf (lasso) sætter nogle af dem til nul, og dropout (Srivastava m.fl., 2014) slår tilfældigt enheder fra under træning; artiklen beholder hver skjult enhed med sandsynlighed 0,5 og hver inputenhed med en højere sandsynlighed, omkring 0,8. Ensembler og bagging reducerer variansen ved at tage gennemsnit over modeller. At starte fra en fortrænet model via overførselslæring hjælper også, når der er få opgavedata.

Deep learning komplicerer den klassiske fortælling. Zhang m.fl. (2017) viste, at almindelige billednetværk kan nå nul træningsfejl på tilfældigt tildelte mærkater, så kapacitet alene kan ikke forklare, hvorfor de generaliserer på rigtige mærkater. Belkin m.fl. (2019) beskrev double descent: Testfejlen kan stige nær interpolationstærsklen, hvor modellen netop kan passe træningssættet, og derefter falde igen, når modellerne bliver meget større. Store overparametriserede modeller kan altså generalisere godt, selv om de passer træningsdata perfekt, og derfor er antallet af parametre en dårlig indikator for risikoen for overtilpasning.

Overtilpasning og udenadslære hænger sammen, men er ikke det samme. En model kan generalisere godt i gennemsnit og alligevel huske sjældne eller gentagne træningssekvenser ordret. Carlini m.fl. (2021) udtrak ordrette træningseksempler, herunder navne, telefonnumre og e-mailadresser, fra GPT-2, også nogle, der kun optrådte én gang i træningsdata, og membership inference-angreb (Shokri m.fl., 2017) udnytter forskellen i sikkerhed mellem sete og usete poster til at teste, om en post var med i træningssættet. Deduplikering og differentiel privatliv under træningen (DP-SGD) er de vigtigste tekniske afhjælpninger.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Træningsdata
  2. →Modeltræning
  3. →Overtilpasning (overfitting)

Relationer

Forårsager
Databrud

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.