Ikke-superviseret læring
Også kendt som: unsupervised learning, uovervåget læring
Maskinlæring ud fra eksempler uden svar, hvor modellen selv finder grupper, mønstre eller usædvanlige tilfælde.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En form for maskinlæring, der arbejder på træningsdata uden mærkater og finder struktur i dem - fx ved at gruppere lignende ting eller markere ting, der skiller sig ud fra resten.
Forklaret enkelt
Som at sortere en kasse blandede knapper i bunker efter farve og størrelse, uden at nogen har fortalt dig, hvilke bunker der skal være.
I praksis
Et overvågningsværktøj på et hospital lærer, hvordan normale logins ser ud, og slår alarm, når en sygeplejerskes konto pludselig logger ind kl. 3 om natten fra et andet land.
Hvorfor det betyder noget
Den kan opdage nye, ukendte trusler, som ingen har mærket endnu, men markerer også harmløs usædvanlig adfærd, så mennesker stadig skal vurdere alarmerne.
Teknisk uddybning
Ikke-superviseret læring estimerer egenskaber ved inputfordelingen P(X) alene, uden en målvariabel. De vigtigste opgavetyper er klyngeanalyse (k-means, hierarkisk klyngeanalyse, DBSCAN, gaussiske mixture-modeller tilpasset med EM-algoritmen), dimensionsreduktion (principal component analysis, der projicerer data på retningerne med størst varians; t-SNE (van der Maaten og Hinton, 2008) og UMAP (McInnes m.fl., 2018) til ikke-lineær visualisering), tæthedsestimering (kernetæthedsestimater, mixture-modeller, normalizing flows) og associationsregler (Apriori-algoritmen til kurvanalyse i detailhandel).
Anomalidetektion er den mest udbredte sikkerhedsanvendelse og det, adfærdsanalyseprodukter (UEBA) typisk bygger på. Metoderne omfatter isolation forests (Liu, Ting og Zhou, 2008), der isolerer punkter med tilfældige opsplitninger og scorer afvigere efter, hvor få opsplitninger de kræver; one-class SVM'er; local outlier factor; og autoencodere, der lærer at rekonstruere normale data og markerer input med stor rekonstruktionsfejl. Alle modellerer "normalen" ud fra historiske data, så en angriber, der allerede var til stede i baselineperioden, bliver en del af det normale, og legitime ændringer (en ny VPN-udbyder, en omorganisering) giver bølger af falske positiver.
Evaluering er den centrale vanskelighed. Uden mærkater findes der ingen facit at score mod, så man bruger interne kriterier (silhouette-score, Davies-Bouldin-indeks, rekonstruktionsfejl, log-likelihood på tilbageholdte data), der måler geometrisk eller statistisk tilpasning frem for nytte. Ved anomalidetektion samler man ofte bagefter et lille mærket sæt af kendte hændelser alene til evaluering. Resultaterne er følsomme over for skalering af features, afstandsmål og hyperparametre som antal klynger eller forventet andel afvigere, og i mange dimensioner koncentreres afstandene, så nærmeste og fjerneste nabo bliver svære at skelne.
Grænsen til selvsuperviseret læring er ofte flydende. Autoencodere og fortræning af sprogmodeller lærer begge af umærkede data, men selvsuperviserede metoder konstruerer et eksplicit forudsigelsesmål ud fra data og træner med et tab i superviseret stil, og derfor behandles de nu som regel som en særskilt kategori. Ikke-superviserede metoder bruges også som forbehandling til superviserede: PCA eller lærte embeddings reducerer dimensionerne, og klyngetildelinger kan blive til features.
I en governance-sammenhæng er ikke-superviseret output en hypotese, ikke et fund. Klynger og anomaliscorer kræver menneskelig fortolkning, før de styrer beslutninger om personer, og profilering bygget på dem kan stadig falde ind under databeskyttelsesforordningens regler om profilering og automatiske afgørelser (artikel 22), når den har retsvirkning eller på tilsvarende vis betydeligt påvirker den registrerede.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Træningsdata
- →Ikke-superviseret læring
Relationer
- En slags
- Maskinlæring
- Består af
- Dimensionsreduktion
- Forudsætter
- Træningsdata
- Åbner for
- k-means-klyngeanalyse
- Forveksl ikke med
- Forstærkningslæring (reinforcement learning)Selvsuperviseret læringSuperviseret læring
- Bruges sammen med
- AnomalidetektionSikkerhedsovervågning
Kilder og videre læsning
Standarder og officielle tekster
Opslagsværker
- van der Maaten & Hinton (2008), Visualizing Data using t-SNE · Journal of Machine Learning Research
- McInnes, Healy & Melville (2018), UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction · arXiv
Lærebøger
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…