{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/convolutional-neural-network","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/convolutional-neural-network/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/convolutional-neural-network/"},"term":{"en":"Convolutional neural network (CNN)","da":"Foldningsnetværk (CNN)"},"aka":{"en":["CNN","ConvNet"],"da":["CNN","konvolutionelt neuralt netværk"]},"domain":["ai"],"cluster":"model-architecture","layer":"model","status":"current","era":1989,"summary":{"en":"A neural network built for pictures - it slides small pattern checks across an image to find edges, then shapes, then whole objects.","da":"Et neuralt netværk bygget til billeder - små mønstertjek glider hen over billedet og finder kanter, så former, så hele genstande."},"body":{"formal":{"en":"A neural network whose early layers apply the same small set of learned checks at every position of a grid-like input such as an image, so a pattern is found wherever it appears; later layers combine these into larger features.","da":"Et neuralt netværk, hvis tidlige lag anvender det samme lille sæt lærte tjek på hver position i et input opbygget i rækker og kolonner, fx et billede, så et mønster findes, uanset hvor det optræder; senere lag kombinerer dem til større træk."},"plain":{"en":"Like sweeping a small magnifying glass over a photo, first spotting lines, then eyes and noses, and finally saying “that is a face”.","da":"Som at føre et lille forstørrelsesglas hen over et foto, først få øje på streger, så øjne og næser og til sidst sige “det er et ansigt”."},"inPractice":{"en":"A municipality's roads department fits cameras to its refuse lorries; a CNN picks out potholes and cracks in the images, so the road inspector gets a daily list of spots to repair.","da":"En kommunes vejafdeling sætter kameraer på skraldebilerne; et CNN finder huller og revner i billederne, så vejinspektøren hver dag får en liste over steder, der skal repareres."},"whyItMatters":{"en":"CNNs made computers good at reading images, from phone face unlock to medical scans, and they remain a cheap, fast choice where a transformer would be more than the task needs.","da":"CNN'er gjorde computere gode til at aflæse billeder, fra ansigtsgenkendelse på telefonen til medicinske scanninger, og de er stadig et billigt og hurtigt valg, hvor en transformer ville være mere, end opgaven kræver."}},"deepDive":{"en":"A convolutional layer slides a set of learned kernels, typically 3 × 3 or 5 × 5 spatially and spanning all input channels, across the input and computes a dot product at each position, producing one feature map per kernel. Strictly, deep-learning libraries implement cross-correlation rather than flipped convolution, which makes no difference once the weights are learned. The output width follows (W − K + 2P) / S + 1 for input width W, kernel size K, padding P and stride S. Two structural priors make the design efficient: local connectivity (each output depends only on a small receptive field) and weight sharing (the same kernel is used at every position), which gives translation equivariance and cuts the parameter count by orders of magnitude compared with a fully connected layer. Pooling or strided convolution downsamples the maps, adding a limited degree of translation invariance and letting deeper layers see larger regions; stacking two 3 × 3 layers gives a 5 × 5 receptive field with fewer parameters, the insight behind VGG (2014).\n\nThe lineage runs from LeCun et al.'s 1989 zip-code reader trained with backpropagation, through LeNet-5 (1998) for cheque reading, to AlexNet (Krizhevsky, Sutskever and Hinton, 2012), which won ILSVRC 2012 with a top-5 error of 15.3 % against 26.2 % for the runner-up, using ReLU activations, dropout and training on two GPUs. ResNet (He et al., 2015) added identity shortcut connections so that networks of 152 layers could be trained without degradation, and batch normalisation (2015) stabilised training. MobileNet-style depthwise separable convolutions reduce cost for phones and embedded devices, and U-Net (2015) introduced the encoder-decoder with skip connections that became standard for medical segmentation and later for the denoising network in many diffusion models.\n\nSince the Vision Transformer (Dosovitskiy et al., 2020), which splits an image into 16 × 16 patches and applies self-attention, the relationship has been one of trade-offs rather than replacement. CNNs build in locality and so learn well from smaller datasets; ViTs have weaker inductive bias, need more data or pretraining, but model global context from the first layer. ConvNeXt (2022) showed that a CNN modernised with transformer-era training recipes is competitive again, and many production systems use hybrids.\n\nKnown failure modes include sensitivity to small adversarial perturbations, a documented bias towards texture rather than shape on ImageNet-trained models, and poor transfer when camera, lighting or scanner differs from training data, which matters in medical imaging and road inspection alike. Convolutions are also used in one dimension for audio and time series and in three for volumetric scans, so \"CNN\" describes the weight-sharing operation, not the image domain.","da":"Et foldningslag lader et sæt lærte kerner, typisk 3 × 3 eller 5 × 5 i rummet og gennem alle inputkanaler, glide hen over inputtet og beregner et prikprodukt på hver position, så hver kerne giver ét feature map. Strengt taget implementerer deep learning-biblioteker krydskorrelation og ikke en spejlet foldning, men det er ligegyldigt, når vægtene alligevel læres. Outputbredden følger (W − K + 2P) / S + 1 for inputbredde W, kernestørrelse K, padding P og stride S. To indbyggede antagelser gør designet effektivt: lokal forbindelse (hvert output afhænger kun af et lille receptivt felt) og vægtdeling (den samme kerne bruges på alle positioner), hvilket giver translationsækvivarians og skærer antallet af parametre ned med flere størrelsesordener i forhold til et fuldt forbundet lag. Pooling eller foldning med stride nedsampler felterne, giver en begrænset grad af translationsinvarians og lader dybere lag se større områder; to 3 × 3-lag oven på hinanden giver et receptivt felt på 5 × 5 med færre parametre, hvilket var indsigten bag VGG (2014).\n\nSlægtslinjen går fra LeCun m.fl.'s postnummerlæser fra 1989, trænet med backpropagation, over LeNet-5 (1998) til aflæsning af checks, til AlexNet (Krizhevsky, Sutskever og Hinton, 2012), der vandt ILSVRC 2012 med en top-5-fejlrate på 15,3 % mod 26,2 % for nummer to, med ReLU-aktivering, dropout og træning på to GPU'er. ResNet (He m.fl., 2015) tilføjede genveje med identitetsafbildning, så net med 152 lag kunne trænes uden forringelse, og batch-normalisering (2015) stabiliserede træningen. Depthwise separable foldninger i MobileNet-stil sænker prisen på telefoner og indlejrede enheder, og U-Net (2015) indførte encoder-decoder-strukturen med skip-forbindelser, der blev standard til medicinsk segmentering og senere til støjfjerningsnetværket i mange diffusionsmodeller.\n\nSiden Vision Transformer (Dosovitskiy m.fl., 2020), der deler et billede i felter på 16 × 16 pixel og anvender self-attention, har forholdet været et spørgsmål om afvejninger snarere end afløsning. CNN'er har lokalitet indbygget og lærer derfor godt af mindre datasæt; ViT'er har svagere induktiv bias og kræver flere data eller fortræning, men modellerer global kontekst fra første lag. ConvNeXt (2022) viste, at et CNN moderniseret med træningsopskrifter fra transformer-æraen igen er konkurrencedygtigt, og mange produktionssystemer bruger hybrider.\n\nKendte fejlmønstre er følsomhed over for små adversarial-forstyrrelser, en dokumenteret tendens hos ImageNet-trænede modeller til at lægge vægt på tekstur frem for form og dårlig overførsel, når kamera, lys eller scanner afviger fra træningsdata, hvilket betyder noget i både medicinsk billeddiagnostik og vejinspektion. Foldninger bruges også i én dimension til lyd og tidsserier og i tre til volumenscanninger, så \"CNN\" beskriver den vægtdelende operation, ikke billeddomænet."},"edges":[{"type":"requires","to":"ai/backpropagation","confidence":"high","strength":"normal"},{"type":"kind-of","to":"ai/neural-network","confidence":"high","strength":"normal"},{"type":"contrasts-with","to":"ai/transformer","why":{"en":"A CNN only looks at small nearby patches at a time and builds up; a transformer lets every part of the input look at every other part from the start.","da":"Et CNN ser kun på små nærliggende felter ad gangen og bygger op; en transformer lader hver del af inputtet se på alle andre dele fra starten."},"confidence":"high","strength":"primary"},{"type":"used-with","to":"ai/gpu","why":{"en":"Training CNNs on GPUs in 2012 made them fast enough to win image contests and set off the deep learning boom.","da":"Træning af CNN'er på GPU'er i 2012 gjorde dem hurtige nok til at vinde billedkonkurrencer og satte gang i deep learning-bølgen."},"confidence":"high","strength":"normal"},{"type":"used-with","to":"ai/supervised-learning","confidence":"high","strength":"normal"}],"depth":5,"sources":[{"title":"LeCun et al. (1989), Backpropagation Applied to Handwritten Zip Code Recognition","tier":"reference"},{"title":"Krizhevsky, Sutskever & Hinton (2012), ImageNet Classification with Deep Convolutional Neural Networks","tier":"reference"},{"title":"Goodfellow, Bengio & Courville, Deep Learning (ch. 9)","tier":"textbook","publisher":"MIT Press"}],"draft":true}