Gå til indhold
atlas

Dimensionsreduktion

Også kendt som: reduktion af dimensioner

At presse mange input om hvert eksempel sammen til få nye, der bevarer det meste af det, der adskiller eksemplerne.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En metode, der afbilder eksempler beskrevet af mange features over i et langt mindre antal nye værdier og samtidig bevarer så meget af deres spredning eller indbyrdes nærhed som muligt; bruges til at gøre modeller hurtigere, fjerne støj eller tegne data på et fladt kort.

Forklaret enkelt

Som den skygge en hånd kaster på en væg, et fladt omrids af noget massivt, men fra den rette vinkel kan man stadig se forskel på en hund og en fugl.

I praksis

En butik har et spørgeskema med firs spørgsmål pr. kunde; en analytiker koger dem ned til tre samlede scorer og tegner kunderne i et diagram, hvor tydelige grupper viser sig.

Hvorfor det betyder noget

Med for mange input bliver modeller langsomme, kræver langt flere eksempler og finder tilfældige mønstre; færre input lader også mennesker faktisk se på data.

Teknisk uddybning

Principal component analysis (PCA, hovedkomponentanalyse), som Pearson (1901) introducerede som tilpasning af linjer og planer, der ligger tættest på data, er den klassiske lineære metode. scikit-learn beskriver den som en opdeling af et flerdimensionalt datasæt i en række på hinanden følgende ortogonale komponenter, der forklarer mest mulig varians. I praksis centreres data (scikit-learn centrerer, men skalerer ikke), singulærværdidekompositionen beregnes, og hvert eksempel projiceres ned på de k øverste højre singulærvektorer; hver komponents andel af den forklarede varians styrer valget af k. Da PCA er følsom over for skalaen, standardiseres features normalt først. Varianter er inkrementel og randomiseret PCA til store datamængder, TruncatedSVD til sparse matricer (latent semantisk analyse af tekst), kernel-PCA til ikke-lineær struktur og NMF, når komponenterne skal være ikke-negative.

Ikke-lineære manifold learning-metoder antager, at data ligger tæt på en lavdimensional flade inde i det højdimensionale rum. Isomap, locally linear embedding, t-SNE (van der Maaten og Hinton, 2008) og UMAP er de almindelige. t-SNE og UMAP er især visualiseringsværktøjer: scikit-learn advarer om, at t-SNE er stokastisk, kan havne i lokale minima og ikke bevarer den globale struktur, så afstande mellem klynger og klyngestørrelser i et t-SNE-plot ikke skal tages bogstaveligt. Autoencodere lærer en ikke-lineær komprimering med en flaskehals i et neuralt netværk, og lærte embeddings fra dybe modeller er i sig selv en form for dimensionsreduktion.

Dimensionsreduktion er noget andet end feature-udvælgelse, som beholder en delmængde af de oprindelige kolonner i stedet for at bygge nye sammensatte; udvalgte features forbliver fortolkelige, mens hovedkomponenter er blandinger, der er sværere at forklare. Motivationen er dimensionalitetens forbandelse: Når antallet af dimensioner vokser, bliver data spredte, afstande ligner hinanden mere, så nærmeste naboer betyder mindre, og antallet af eksempler, der skal til for at dække rummet, vokser eksponentielt.

Reduktionen tilpasses som enhver anden lært transformation på træningsdata alene og anvendes derefter på tilbageholdte data. Superviserede alternativer som lineær diskriminantanalyse bruger labels til at vælge retninger, der adskiller klasserne, mens PCA ignorerer labels og kan kassere retninger med lav varians, som tilfældigvis er de mest forudsigende.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Træningsdata
  2. →Feature (inputvariabel)
  3. →Dimensionsreduktion

Relationer

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.