Foldningsnetværk (CNN)
Også kendt som: CNN, konvolutionelt neuralt netværk
Et neuralt netværk bygget til billeder - små mønstertjek glider hen over billedet og finder kanter, så former, så hele genstande.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
Et neuralt netværk, hvis tidlige lag anvender det samme lille sæt lærte tjek på hver position i et input opbygget i rækker og kolonner, fx et billede, så et mønster findes, uanset hvor det optræder; senere lag kombinerer dem til større træk.
Forklaret enkelt
Som at føre et lille forstørrelsesglas hen over et foto, først få øje på streger, så øjne og næser og til sidst sige “det er et ansigt”.
I praksis
En kommunes vejafdeling sætter kameraer på skraldebilerne; et CNN finder huller og revner i billederne, så vejinspektøren hver dag får en liste over steder, der skal repareres.
Hvorfor det betyder noget
CNN'er gjorde computere gode til at aflæse billeder, fra ansigtsgenkendelse på telefonen til medicinske scanninger, og de er stadig et billigt og hurtigt valg, hvor en transformer ville være mere, end opgaven kræver.
Teknisk uddybning
Et foldningslag lader et sæt lærte kerner, typisk 3 × 3 eller 5 × 5 i rummet og gennem alle inputkanaler, glide hen over inputtet og beregner et prikprodukt på hver position, så hver kerne giver ét feature map. Strengt taget implementerer deep learning-biblioteker krydskorrelation og ikke en spejlet foldning, men det er ligegyldigt, når vægtene alligevel læres. Outputbredden følger (W − K + 2P) / S + 1 for inputbredde W, kernestørrelse K, padding P og stride S. To indbyggede antagelser gør designet effektivt: lokal forbindelse (hvert output afhænger kun af et lille receptivt felt) og vægtdeling (den samme kerne bruges på alle positioner), hvilket giver translationsækvivarians og skærer antallet af parametre ned med flere størrelsesordener i forhold til et fuldt forbundet lag. Pooling eller foldning med stride nedsampler felterne, giver en begrænset grad af translationsinvarians og lader dybere lag se større områder; to 3 × 3-lag oven på hinanden giver et receptivt felt på 5 × 5 med færre parametre, hvilket var indsigten bag VGG (2014).
Slægtslinjen går fra LeCun m.fl.'s postnummerlæser fra 1989, trænet med backpropagation, over LeNet-5 (1998) til aflæsning af checks, til AlexNet (Krizhevsky, Sutskever og Hinton, 2012), der vandt ILSVRC 2012 med en top-5-fejlrate på 15,3 % mod 26,2 % for nummer to, med ReLU-aktivering, dropout og træning på to GPU'er. ResNet (He m.fl., 2015) tilføjede genveje med identitetsafbildning, så net med 152 lag kunne trænes uden forringelse, og batch-normalisering (2015) stabiliserede træningen. Depthwise separable foldninger i MobileNet-stil sænker prisen på telefoner og indlejrede enheder, og U-Net (2015) indførte encoder-decoder-strukturen med skip-forbindelser, der blev standard til medicinsk segmentering og senere til støjfjerningsnetværket i mange diffusionsmodeller.
Siden Vision Transformer (Dosovitskiy m.fl., 2020), der deler et billede i felter på 16 × 16 pixel og anvender self-attention, har forholdet været et spørgsmål om afvejninger snarere end afløsning. CNN'er har lokalitet indbygget og lærer derfor godt af mindre datasæt; ViT'er har svagere induktiv bias og kræver flere data eller fortræning, men modellerer global kontekst fra første lag. ConvNeXt (2022) viste, at et CNN moderniseret med træningsopskrifter fra transformer-æraen igen er konkurrencedygtigt, og mange produktionssystemer bruger hybrider.
Kendte fejlmønstre er følsomhed over for små adversarial-forstyrrelser, en dokumenteret tendens hos ImageNet-trænede modeller til at lægge vægt på tekstur frem for form og dårlig overførsel, når kamera, lys eller scanner afviger fra træningsdata, hvilket betyder noget i både medicinsk billeddiagnostik og vejinspektion. Foldninger bruges også i én dimension til lyd og tidsserier og i tre til volumenscanninger, så "CNN" beskriver den vægtdelende operation, ikke billeddomænet.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
Relationer
- En slags
- Neuralt netværk
- Forudsætter
- Backpropagation
- Forveksl ikke med
- Transformer
- Bruges sammen med
- Grafikprocessor (GPU)Superviseret læringKlassifikation
Kilder og videre læsning
Opslagsværker
- LeCun et al. (1989), Backpropagation Applied to Handwritten Zip Code Recognition
- Krizhevsky, Sutskever & Hinton (2012), ImageNet Classification with Deep Convolutional Neural Networks
Lærebøger
- Goodfellow, Bengio & Courville, Deep Learning (ch. 9) · MIT Press
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…