Gå til indhold
atlas

Deep learning

Også kendt som: dyb læring

Maskinlæring med neurale netværk i mange lag oven på hinanden - metoden bag moderne værktøjer til billeder, tale og sprog.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En form for maskinlæring, der træner neurale netværk med mange lag, hvor hvert lag bygger mere generelle træk ud fra laget nedenunder, lært direkte fra rå data.

Forklaret enkelt

Som en række arbejdere, hvor den første ser kanter, den næste former og den næste ansigter - hver giver et rigere billede videre op ad rækken.

I praksis

En regions hospitaler bruger en deep learning-model, der er trænet på hundredtusindvis af røntgenbilleder, til at markere mulige knoglebrud, som en læge derefter tjekker.

Hvorfor det betyder noget

Det gav et stort spring i, hvad AI kan, fra omkring 2012, men modellerne kræver enorme mængder data og regnekraft, og deres ræsonnementer er meget svære at forklare.

Teknisk uddybning

Den bærende idé er repræsentationslæring: I stedet for at ingeniører håndlaver features (kantdetektorer, MFCC'er til lyd, n-gram-optællinger til tekst) og fodrer dem til en flad model, lærer et dybt netværk et hierarki af features fra ende til anden direkte fra råt input, hvor alle lag optimeres samlet med backpropagation mod én tabsfunktion. Dybden betyder noget, fordi en sammensætning af mange simple ikke-lineære transformationer kan repræsentere visse funktioner langt mere kompakt end et fladt netværk af tilsvarende størrelse.

Idéerne er gamle; det, der ændrede sig omkring 2012, var kombinationen af store mærkede datasæt, GPU-beregning og en håndfuld træningsteknikker. AlexNet (Krizhevsky, Sutskever og Hinton) vandt ImageNet-konkurrencen ILSVRC 2012 med en top-5-fejlrate på ca. 15,3 procent mod ca. 26,2 procent for nummer to, trænet på to forbruger-GPU'er og med ReLU-aktiveringer, dropout og dataaugmentering. Talegenkendelse havde set et lignende skifte et år eller to tidligere. ResNet (He m.fl., 2015) indførte residual- eller skip-forbindelser, som gør det muligt at træne netværk med over 100 lag, fordi gradienterne får en direkte vej baglæns. Transformeren (Vaswani m.fl., 2017) erstattede derefter rekurrens med attention og blev standardarkitekturen for sprog og i stigende grad for billeder og lyd.

Siden omkring 2020 har empiriske skaleringslove præget praksis: Kaplan m.fl. (2020) og Hoffmann m.fl. (2022, "Chinchilla") viste, at tabet falder nogenlunde som en potenslov i parametre, data og regnekraft, og Chinchilla pegede på størrelsesordenen 20 træningstokens pr. parameter for beregningsoptimal træning. Det drev skiftet til foundation models, der trænes én gang med selvsupervision og tilpasses mange gange via finjustering eller prompting.

De kendte svagheder følger af metoden. Modellerne kræver store mængder data og regnekraft, er dårligt kalibrerede uden for træningsfordelingen, er sårbare over for adversarial examples (små, konstruerede ændringer af input, der vender resultatet) og kan udnytte tilfældige sammenhænge i træningsdata, fx en hospitalsspecifik markør på røntgenbilleder frem for selve sygdomstegnet. Forklarbarheden er fortsat begrænset. Mange tabelbaserede problemer løses stadig bedre med gradient-boostede træer, så "dyb" er ikke automatisk "bedre".

Begrebsbrug: Deep learning er en delmængde af maskinlæring, der bruger neurale netværk med flere skjulte lag; der findes ingen fast grænse for antallet af lag. Det neurale netværk er modelfamilien, mens deep learning betegner praksis med at træne dybe udgaver af den i stor skala, inklusive den omgivende værktøjskasse af optimeringsalgoritmer, normalisering, regularisering og acceleratorhardware.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Neuralt netværk
  2. →Deep learning

Relationer

Forudsætter
Neuralt netværk
Forveksl ikke med
Feature engineering
Bruges sammen med
Grafikprocessor (GPU)

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Nævnt i

Test dig selv

Indlæser…

Atlas er i beta.