Gå til indhold
atlas

Feature (inputvariabel)

Også kendt som: inputvariabel, forklarende variabel

Én målbar oplysning om et eksempel, fx en pris eller en alder, som en model læser som input, når den skal gætte.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En enkelt inputværdi, der beskriver et eksempel, og som gives til en model som et tal eller først omsættes til tal; i træningsdata er hvert eksempel en række af features, ofte parret med en label.

Forklaret enkelt

Som felterne på en blanket, fx alder, indkomst og adresse, som en bankrådgiver læser, før hun beslutter sig om et lån.

I praksis

Et boligselskab, der vil gætte, hvilken husleje en lejlighed kan opnå, giver sin model størrelsen i kvadratmeter, antal værelser, etagen og afstanden til nærmeste togstation.

Hvorfor det betyder noget

En model kan kun finde mønstre i det, den får vist, så et manglende, forkert eller urimeligt input begrænser alle de svar, den giver.

Teknisk uddybning

I den klassiske superviserede opsætning er hvert eksempel en feature-vektor x i R^d sammen med en label y, og et datasæt er en designmatrix med én række pr. eksempel og én søjle pr. feature (Goodfellow m.fl., Deep Learning, kap. 5). Googles ML-ordliste definerer en feature ganske enkelt som en inputvariabel, der bruges til at lave forudsigelser. Features er numeriske, kategoriske (et postnummer, en produkttype) eller ordinale (en vurdering fra et til fem); kategoriske features skal kodes, før de fleste modeller kan bruge dem, fx med one-hot-kodning eller ordinal kodning, og numeriske features standardiseres ofte til middelværdi nul og varians ét, så ingen enkelt skala dominerer afstands- eller gradientberegninger.

Features er noget andet end modelparametre: Features er egenskaber ved de data, der gives ind ved inferens, mens parametre (vægte) læres under træningen. De er også forskellige fra labelen, som er den værdi, der skal forudsiges. I statistik kaldes features uafhængige eller forklarende variable, kovariater eller prædiktorer; her bruges maskinlæringsordet.

Kvaliteten af features sætter loftet for modellens kvalitet. Irrelevante eller overflødige features tilføjer støj og øger risikoen for overtilpasning, og derfor findes feature-udvælgelse og dimensionsreduktion. En feature, der indeholder oplysninger, som ikke er tilgængelige på forudsigelsestidspunktet, fx et felt, der først udfyldes, når udfaldet kendes, giver target leakage og for gode resultater offline. Features, der fungerer som stedfortrædere for beskyttede karakteristika (fx postnummer for etnicitet), kan føre bias ind i beslutninger, selv når den beskyttede oplysning selv er fjernet.

I deep learning er det rå input (pixels, tokens) stadig feature-vektoren, men netværket lærer mellemliggende repræsentationer i sine skjulte lag, som også kaldes features eller lærte features. Forskning i forklarlighed af store modeller bruger ordet i denne anden betydning om retninger i aktiveringsrummet, der svarer til begreber, mennesker kan genkende.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Træningsdata
  2. →Feature (inputvariabel)

Relationer

Forudsætter
Træningsdata
Forveksl ikke med
Modelparameter
Bruges sammen med
Label (mærkat)

Kilder og videre læsning

Officiel dokumentation

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Nævnt i

Test dig selv

Indlæser…

Atlas er i beta.