Undertilpasning (underfitting)
Også kendt som: underfitting
Når en model er for simpel eller trænet for lidt til at fange mønstret, så den scorer dårligt selv på de eksempler, den lærte af.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En fejl i modeltræning, hvor modellen ikke engang kan tilpasse sig sine træningsdata godt - højt tab både på træningsdata og på tilbageholdte data - typisk fordi den har for få modelparametre, for få epoker eller for lidt brugbar information i sit input.
Forklaret enkelt
Som at beskrive alle dyr som “har ben” - reglen er for grov til at skelne en hund fra et bord, selv for de dyr, man har studeret.
I praksis
Ejeren af et lille dansk havecenter forudsiger salget med en ret linje; den rammer hverken forårstravlheden eller juletræssalget, selv i sidste års egne tal, så hun skifter til en rigere model.
Hvorfor det betyder noget
En undertilpasset model tager fejl på en stabil, forudsigelig måde, så den kan se solid ud, mens den giver dårlige beslutninger; løsningen er mere kapacitet eller mere træning, ikke flere regler.
Teknisk uddybning
Kendetegnet ved undertilpasning er et træningstab, der forbliver højt, og et valideringstab tæt på det: afstanden mellem dem er lille, men begge ligger et godt stykke over, hvad opgaven tillader, målt mod en reference som menneskeligt niveau, en stærk baseline eller den estimerede irreducible (Bayes-)fejl. Læringskurver gør diagnosen konkret. Tegnet op mod træningssættets størrelse mødes en undertilpasset models trænings- og valideringskurver hurtigt på et dårligt niveau, så flere data ikke hjælper, mens en overtilpasset model viser en bred kløft, som flere data indsnævrer. I bias-varians-dekomponeringen af kvadratfejl er forventet fejl = bias² + varians + irreducibel støj, og undertilpasning er regimet med høj bias (Goodfellow m.fl., §5.2 og §5.4).
Årsagerne falder i fire grupper. Kapacitet: hypoteseklassen kan ikke repræsentere mønstret, som når en lineær model skal fange et sæsonpræget signal eller vekselvirkninger. Regularisering: weight decay, dropout, L1-straf eller dataaugmentering er sat så kraftigt, at de undertrykker reel struktur. Optimering: for få skridt, en læringsrate der er alt for lille eller så stor, at træningen går i stå, tidligt stop på et støjfyldt valideringssignal, forsvindende gradienter eller dårlig initialisering. Information: inputtets features indeholder simpelthen ikke det, der skal til for at forudsige målet. Fejl i koden hører i praksis under optimering - forskudte labels, uskalerede input, et frosset lag eller et tab beregnet på den forkerte tensor ligner alle undertilpasning. Et standardtjek er at forsøge at overtilpasse en enkelt lille batch: kan tabet ikke presses tæt på nul på en håndfuld eksempler, er problemet en fejl eller manglende kapacitet, ikke mangel på data.
Løsningen følger årsagen: en større eller mere udtryksfuld model, bedre features, svagere regularisering, længere træning eller en tunet læringsrateplan. Det klassiske billede af en U-formet testfejlkurve over modelkapacitet er blevet revideret af double descent (Belkin m.fl., 2019), hvor testfejlen falder igen, når modellerne er store nok til at interpolere træningsdata, så kraftigt overparametriserede netværk sjældent undertilpasser af mangel på kapacitet. Undertilpasning i stor skala handler i stedet om beregning og data: Hoffmann m.fl. (2022) viste, at flere af tidens store sprogmodeller var undertrænede i forhold til deres størrelse, og i fortræning med én epoke følger trænings- og valideringstab hinanden tæt, så det sædvanlige greb er flere tokens eller mere beregning snarere end regularisering.
Undertilpasning bør holdes adskilt fra nabofejl. Overtilpasning viser en stor kløft mellem træning og validering; distributionsskift viser gode valideringsresultater, men dårlige resultater i drift; støj i labels lægger et loft over begge kurver, som bestemmes af data og ikke af modellen. Fordi en undertilpasset model tager fejl konsekvent, er dens fejl systematiske - en ret linje, der altid rammer ved siden af sæsontoppen - og kan virke vildledende stabile.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Træningsdata
- →Maskinlæring
- →Modeltræning
- →Tabsfunktion (loss function)
- →Undertilpasning (underfitting)
Relationer
- Forudsætter
- ModeltræningTabsfunktion (loss function)
- Åbner for
- Bias-varians-afvejning
- Forveksl ikke med
- Overtilpasning (overfitting)
- Forårsager
- Hallucination
Kilder og videre læsning
Opslagsværker
Lærebøger
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Nævnt i
Test dig selv
Indlæser…