Feature (inputvariabel)
Også kendt som: inputvariabel, forklarende variabel
Én målbar oplysning om et eksempel, fx en pris eller en alder, som en model læser som input, når den skal gætte.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En enkelt inputværdi, der beskriver et eksempel, og som gives til en model som et tal eller først omsættes til tal; i træningsdata er hvert eksempel en række af features, ofte parret med en label.
Forklaret enkelt
Som felterne på en blanket, fx alder, indkomst og adresse, som en bankrådgiver læser, før hun beslutter sig om et lån.
I praksis
Et boligselskab, der vil gætte, hvilken husleje en lejlighed kan opnå, giver sin model størrelsen i kvadratmeter, antal værelser, etagen og afstanden til nærmeste togstation.
Hvorfor det betyder noget
En model kan kun finde mønstre i det, den får vist, så et manglende, forkert eller urimeligt input begrænser alle de svar, den giver.
Teknisk uddybning
I den klassiske superviserede opsætning er hvert eksempel en feature-vektor x i R^d sammen med en label y, og et datasæt er en designmatrix med én række pr. eksempel og én søjle pr. feature (Goodfellow m.fl., Deep Learning, kap. 5). Googles ML-ordliste definerer en feature ganske enkelt som en inputvariabel, der bruges til at lave forudsigelser. Features er numeriske, kategoriske (et postnummer, en produkttype) eller ordinale (en vurdering fra et til fem); kategoriske features skal kodes, før de fleste modeller kan bruge dem, fx med one-hot-kodning eller ordinal kodning, og numeriske features standardiseres ofte til middelværdi nul og varians ét, så ingen enkelt skala dominerer afstands- eller gradientberegninger.
Features er noget andet end modelparametre: Features er egenskaber ved de data, der gives ind ved inferens, mens parametre (vægte) læres under træningen. De er også forskellige fra labelen, som er den værdi, der skal forudsiges. I statistik kaldes features uafhængige eller forklarende variable, kovariater eller prædiktorer; her bruges maskinlæringsordet.
Kvaliteten af features sætter loftet for modellens kvalitet. Irrelevante eller overflødige features tilføjer støj og øger risikoen for overtilpasning, og derfor findes feature-udvælgelse og dimensionsreduktion. En feature, der indeholder oplysninger, som ikke er tilgængelige på forudsigelsestidspunktet, fx et felt, der først udfyldes, når udfaldet kendes, giver target leakage og for gode resultater offline. Features, der fungerer som stedfortrædere for beskyttede karakteristika (fx postnummer for etnicitet), kan føre bias ind i beslutninger, selv når den beskyttede oplysning selv er fjernet.
I deep learning er det rå input (pixels, tokens) stadig feature-vektoren, men netværket lærer mellemliggende repræsentationer i sine skjulte lag, som også kaldes features eller lærte features. Forskning i forklarlighed af store modeller bruger ordet i denne anden betydning om retninger i aktiveringsrummet, der svarer til begreber, mennesker kan genkende.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Træningsdata
- →Feature (inputvariabel)
Relationer
- Forudsætter
- Træningsdata
- Åbner for
- BeslutningstræDimensionsreduktionFeature engineeringk-means-klyngeanalyseLineær regressionLogistisk regression
- Forveksl ikke med
- Modelparameter
- Bruges sammen med
- Label (mærkat)
Kilder og videre læsning
Officiel dokumentation
- Machine Learning Glossary · Google for Developers
- scikit-learn User Guide, Preprocessing data · scikit-learn
Opslagsværker
- Machine Learning Crash Course: Supervised learning terminology · Google for Developers
Lærebøger
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Nævnt i
Test dig selv
Indlæser…