Gå til indhold
atlas

Logistisk regression

Også kendt som: logit-model

En enkel model, der sorterer sager i to grupper ved at gøre en vægtet sum af input til en sandsynlighed mellem 0 og 1.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En metode til klassifikation, der lægger features sammen, hver ganget med en vægt, og sender summen gennem en S-formet kurve for at få sandsynligheden for den positive gruppe; vægtene vælges, så de kendte svar i træningsdata får størst mulig sandsynlighed.

Forklaret enkelt

Som en læge, der giver point for alder, rygning og blodtryk og så aflæser et skema, der gør den samlede score til en risiko for sygdom, som aldrig går under nul eller over helt sikker.

I praksis

En dansk bank giver hver låneansøgning en sandsynlighed for, at kunden ikke kan betale, og medarbejderne kan se, hvilke svar i ansøgningen der trak scoren op eller ned.

Hvorfor det betyder noget

Den giver en sandsynlighed og ikke bare et ja eller nej, og hvert inputs betydning kan aflæses direkte, og derfor bruger banker, hospitaler og myndigheder den stadig, når beslutninger skal kunne forklares.

Teknisk uddybning

Trods navnet er logistisk regression en klassifikator. For to klasser modellerer den p(y = 1 | x) = sigma(w0 + w^T x), hvor sigma(z) = 1 / (1 + e^-z) er den logistiske (sigmoide) funktion. Tilsvarende er log-odds log(p / (1 - p)) en lineær funktion af features, så hver koefficient er ændringen i log-odds pr. enhed af sin feature, og e^w er en oddsratio. Beslutningsgrænsen p = 0,5 er et hyperplan, så modellen er lineær i feature-rummet; ikke-lineære grænser kræver transformerede eller konstruerede features.

Vægtene tilpasses med maksimum likelihood, hvilket svarer til at minimere log-loss (binær krydsentropi) -[y log p + (1 - y) log(1 - p)]. I modsætning til mindste kvadraters metode findes der ingen lukket løsning, men tabsfunktionen er konveks, så iterative løsere som Newton-metoder (iterativt vægtede mindste kvadrater), L-BFGS eller stokastisk gradientnedstigning når det globale optimum. Hvis klasserne kan adskilles perfekt, vokser de uregulariserede vægte uden grænse, hvilket er én grund til, at biblioteker regulariserer som standard: scikit-learns LogisticRegression bruger en L2-straf, hvis styrke styres af C (standard 1,0), og understøtter også L1 og elastic net.

Ved mere end to klasser giver den multinomiale (softmax) form hver klasse sin egen vægtvektor og normaliserer scorerne til en sandsynlighedsfordeling; en one-vs-rest-opbygning med separate binære modeller er det ældre alternativ. Et neuralt netværk med ét lag og sigmoid- eller softmax-output, trænet på krydsentropi, er præcis logistisk regression, og derfor bruges den ofte som broen fra klassisk statistik til deep learning.

Modellens sandsynligheder er som regel rimeligt godt kalibrerede, hvilket betyder noget ved kreditvurdering og kliniske risikoscorer, men den kræver stadig en valgt tærskel for at gøre en sandsynlighed til en beslutning, og den rigtige tærskel afhænger af, hvad falske positiver koster i forhold til falske negativer. Metoden blev udviklet i statistikken, bl.a. af Cox (1958), længe før maskinlæring tog den til sig.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Træningsdata
  2. →Feature (inputvariabel)
  3. →Maskinlæring
  4. →Tabsfunktion (loss function)
  5. →Lineær regression
  6. →Logistisk regression

Relationer

Implementerer
Klassifikation
Forveksl ikke med
Lineær regression

Kilder og videre læsning

Opslagsværker

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.