Gå til indhold
atlas

Forveksl ikke disse

Foldningsnetværk (CNN) vs. Transformer

Hvorfor de er forskellige

Et CNN ser kun på små nærliggende felter ad gangen og bygger op; en transformer lader hver del af inputtet se på alle andre dele fra starten.

Foldningsnetværk (CNN)

Modelarkitekturer

Et neuralt netværk bygget til billeder - små mønstertjek glider hen over billedet og finder kanter, så former, så hele genstande.

Formelt

Et neuralt netværk, hvis tidlige lag anvender det samme lille sæt lærte tjek på hver position i et input opbygget i rækker og kolonner, fx et billede, så et mønster findes, uanset hvor det optræder; senere lag kombinerer dem til større træk.

Forklaret enkelt

Som at føre et lille forstørrelsesglas hen over et foto, først få øje på streger, så øjne og næser og til sidst sige “det er et ansigt”.

I praksis

En kommunes vejafdeling sætter kameraer på skraldebilerne; et CNN finder huller og revner i billederne, så vejinspektøren hver dag får en liste over steder, der skal repareres.

Hvorfor det betyder noget

CNN'er gjorde computere gode til at aflæse billeder, fra ansigtsgenkendelse på telefonen til medicinske scanninger, og de er stadig et billigt og hurtigt valg, hvor en transformer ville være mere, end opgaven kræver.

Transformer

Sprogmodeller

Det neurale netværksdesign bag nutidens sprogmodeller, som vejer, hvordan hvert ord i en tekst hænger sammen med alle de andre.

Formelt

Et neuralt netværksdesign fra 2017 bygget op om "attention", hvor modellen vurderer, hvor meget hvert token skal trække på alle andre tokens, og behandler alle tokens på én gang i stedet for ét ad gangen.

Forklaret enkelt

Som at læse en hel side på én gang og tegne streger mellem de ord, der hører sammen, i stedet for at læse ét ord ad gangen.

I praksis

Når et ministeriums oversættelsesværktøj får en engelsk sætning om en bank, der afviste et lån, fordi “it” var for risikabelt, kobler transformeren “it” til lånet og ikke til banken, så det på dansk bliver “det” og ikke “den”.

Hvorfor det betyder noget

Fordi den kan trænes hurtigt på enorme mængder tekst, gjorde den store sprogmodeller mulige - og dermed de fleste af nutidens AI-værktøjer.

Fælles forbindelser

Atlas er i beta.