Gå til indhold
atlas

Forveksl ikke disse

Forstærkningslæring (reinforcement learning) vs. Superviseret læring

Hvorfor de er forskellige

Superviseret læring får vist det rigtige svar for hvert eksempel; forstærkningslæring får kun bagefter at vide, hvor godt dens valg gik.

Forstærkningslæring (reinforcement learning)

Grundlæggende maskinlæring

Maskinlæring ved at prøve sig frem - et system handler, får belønning eller straf og lærer langsomt, hvilke handlinger der betaler sig.

Formelt

En form for maskinlæring, hvor en agent handler i et miljø, modtager et belønningssignal for resultaterne og lærer en måde at vælge handlinger på, der giver mest belønning over tid, uden at få vist den rigtige handling.

Forklaret enkelt

Som at lære en hund et trick med godbidder - ingen forklarer tricket, hunden lærer bare, hvilke bevægelser der giver en godbid.

I praksis

En energiansvarlig i en region tester et system, der styrer ventilationen i en hospitalsfløj; det får belønning for at bruge mindre strøm og straf, hver gang en afdeling bliver for varm eller for kold.

Hvorfor det betyder noget

Systemet lærer præcis det, belønningen måler, ikke det, man mente, så en dårligt valgt belønning kan lære det at snyde eller at behage frem for at have ret.

Superviseret læring

Grundlæggende maskinlæring

Maskinlæring ud fra eksempler, hvor det rigtige svar følger med, fx mails der allerede er markeret som spam eller ikke spam.

Formelt

En form for maskinlæring, hvor hvert træningseksempel er parret med en mærkat, der angiver det ønskede resultat, og modellen lærer at knytte nye input til den rigtige mærkat.

Forklaret enkelt

Som at lære med en facitliste - du prøver hver opgave, tjekker facit og retter dig selv.

I praksis

En regions sikkerhedsteam mærker tusindvis af tidligere alarmer som ægte angreb eller falske alarmer, og en model, der trænes på dem, lærer at sortere nye alarmer på samme måde.

Hvorfor det betyder noget

Modellen kan kun blive så god som sine mærkater; de laves ofte af mennesker betalt per stk., og deres fejl og fordomme bliver modellens.

Fælles forbindelser

Atlas er i beta.