Dimensionsreduktion
Også kendt som: reduktion af dimensioner
At presse mange input om hvert eksempel sammen til få nye, der bevarer det meste af det, der adskiller eksemplerne.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En metode, der afbilder eksempler beskrevet af mange features over i et langt mindre antal nye værdier og samtidig bevarer så meget af deres spredning eller indbyrdes nærhed som muligt; bruges til at gøre modeller hurtigere, fjerne støj eller tegne data på et fladt kort.
Forklaret enkelt
Som den skygge en hånd kaster på en væg, et fladt omrids af noget massivt, men fra den rette vinkel kan man stadig se forskel på en hund og en fugl.
I praksis
En butik har et spørgeskema med firs spørgsmål pr. kunde; en analytiker koger dem ned til tre samlede scorer og tegner kunderne i et diagram, hvor tydelige grupper viser sig.
Hvorfor det betyder noget
Med for mange input bliver modeller langsomme, kræver langt flere eksempler og finder tilfældige mønstre; færre input lader også mennesker faktisk se på data.
Teknisk uddybning
Principal component analysis (PCA, hovedkomponentanalyse), som Pearson (1901) introducerede som tilpasning af linjer og planer, der ligger tættest på data, er den klassiske lineære metode. scikit-learn beskriver den som en opdeling af et flerdimensionalt datasæt i en række på hinanden følgende ortogonale komponenter, der forklarer mest mulig varians. I praksis centreres data (scikit-learn centrerer, men skalerer ikke), singulærværdidekompositionen beregnes, og hvert eksempel projiceres ned på de k øverste højre singulærvektorer; hver komponents andel af den forklarede varians styrer valget af k. Da PCA er følsom over for skalaen, standardiseres features normalt først. Varianter er inkrementel og randomiseret PCA til store datamængder, TruncatedSVD til sparse matricer (latent semantisk analyse af tekst), kernel-PCA til ikke-lineær struktur og NMF, når komponenterne skal være ikke-negative.
Ikke-lineære manifold learning-metoder antager, at data ligger tæt på en lavdimensional flade inde i det højdimensionale rum. Isomap, locally linear embedding, t-SNE (van der Maaten og Hinton, 2008) og UMAP er de almindelige. t-SNE og UMAP er især visualiseringsværktøjer: scikit-learn advarer om, at t-SNE er stokastisk, kan havne i lokale minima og ikke bevarer den globale struktur, så afstande mellem klynger og klyngestørrelser i et t-SNE-plot ikke skal tages bogstaveligt. Autoencodere lærer en ikke-lineær komprimering med en flaskehals i et neuralt netværk, og lærte embeddings fra dybe modeller er i sig selv en form for dimensionsreduktion.
Dimensionsreduktion er noget andet end feature-udvælgelse, som beholder en delmængde af de oprindelige kolonner i stedet for at bygge nye sammensatte; udvalgte features forbliver fortolkelige, mens hovedkomponenter er blandinger, der er sværere at forklare. Motivationen er dimensionalitetens forbandelse: Når antallet af dimensioner vokser, bliver data spredte, afstande ligner hinanden mere, så nærmeste naboer betyder mindre, og antallet af eksempler, der skal til for at dække rummet, vokser eksponentielt.
Reduktionen tilpasses som enhver anden lært transformation på træningsdata alene og anvendes derefter på tilbageholdte data. Superviserede alternativer som lineær diskriminantanalyse bruger labels til at vælge retninger, der adskiller klasserne, mens PCA ignorerer labels og kan kassere retninger med lav varians, som tilfældigvis er de mest forudsigende.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Træningsdata
- →Feature (inputvariabel)
- →Dimensionsreduktion
Relationer
- Del af
- Ikke-superviseret læring
- Forudsætter
- Feature (inputvariabel)
- Bruges sammen med
- EmbeddingFeature engineeringk-means-klyngeanalyse
Kilder og videre læsning
Officiel dokumentation
Opslagsværker
- Pearson (1901), On Lines and Planes of Closest Fit to Systems of Points in Space · Philosophical Magazine
Lærebøger
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…