Gå til indhold
atlas

Transformer

Også kendt som: transformer-arkitektur

Det neurale netværksdesign bag nutidens sprogmodeller, som vejer, hvordan hvert ord i en tekst hænger sammen med alle de andre.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

Et neuralt netværksdesign fra 2017 bygget op om "attention", hvor modellen vurderer, hvor meget hvert token skal trække på alle andre tokens, og behandler alle tokens på én gang i stedet for ét ad gangen.

Forklaret enkelt

Som at læse en hel side på én gang og tegne streger mellem de ord, der hører sammen, i stedet for at læse ét ord ad gangen.

I praksis

Når et ministeriums oversættelsesværktøj får en engelsk sætning om en bank, der afviste et lån, fordi “it” var for risikabelt, kobler transformeren “it” til lånet og ikke til banken, så det på dansk bliver “det” og ikke “den”.

Hvorfor det betyder noget

Fordi den kan trænes hurtigt på enorme mængder tekst, gjorde den store sprogmodeller mulige - og dermed de fleste af nutidens AI-værktøjer.

Teknisk uddybning

Kerneoperationen er skaleret prikprodukt-attention: Hvert tokens vektor projiceres til en query, en key og en value, og outputtet er softmax(QKᵀ / √d_k) · V, et vægtet gennemsnit af alle values, hvor vægtene kommer af ligheden mellem query og key. Divisionen med kvadratroden af key-dimensionen forhindrer prikprodukterne i at mætte softmax-funktionen. Multi-head attention kører flere af disse parallelt på lavere-dimensionelle projektioner og sætter resultaterne sammen, så forskellige hoveder kan specialisere sig (syntaktisk kongruens, henvisninger, kopiering). Hver blok tilføjer et positionsvist feed-forward-netværk, og begge dellag er pakket ind i residualforbindelser med lagnormalisering.

Vaswani m.fl. (2017) foreslog en encoder-decoder-model til maskinoversættelse: seks encoder- og seks decoder-lag, modeldimension 512, otte hoveder, feed-forward-bredde 2048 og sinusformede positionskodninger, hvor decoderen brugte maskeret self-attention plus cross-attention til encoderens output. Attention i sig selv er ligeglad med rækkefølge, så positionen skal tilføres; senere modeller erstattede de faste sinuskurver med lærte embeddings og siden relative metoder som rotary position embeddings (RoPE) og ALiBi, der klarer lange sekvenser bedre. Tre familier fulgte: encoder-only-modeller som BERT (tovejs, brugt til klassifikation og embeddings), decoder-only-modeller som GPT (kausal maske, brugt til generering og nu dominerende for LLM'er) og encoder-decoder-modeller som T5. Den samme blok ligger også bag vision transformers, talemodeller og multimodale modeller, der omsætter billedfelter eller lydrammer til token-lignende vektorer.

Fordelen frem for rekurrente netværk er parallelitet i træningen: Alle positioner behandles på én gang, og vejen mellem to vilkårlige tokens er ét attention-trin i stedet for en kæde af rekurrente opdateringer, hvilket gør det lettere at lære afhængigheder over lange afstande og skalerer effektivt på GPU'er og TPU'er. Prisen er, at regnearbejdet for attention vokser kvadratisk med sekvenslængden. Ingeniørsvarene omfatter FlashAttention, der deler beregningen i fliser for at undgå at materialisere hele attention-matricen, sliding-window- og sparse attention, grouped-query og multi-query attention for at gøre KV-cachen mindre, og mixture of experts i feed-forward-lagene for at tilføje parametre uden tilsvarende regnearbejde. Alternative arkitekturer som state-space-modeller (fx Mamba) sigter mod lineær skalering og kombineres ofte med attention-lag i hybrider.

To udbredte misforståelser: Attention-vægte er ikke en pålidelig forklaring på, hvorfor en model gav et bestemt output, fordi information også blandes via residualstrømme og feed-forward-lag på tværs af mange lag; og "transformer" betegner arkitekturen, ikke træningsmålet - samme design trænes som maskeret sprogmodel, som forudsigelse af næste token eller som kontrastiv encoder afhængigt af opgaven.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Token
  2. →Transformer

Relationer

Forudsætter
Token
Forveksl ikke med
Foldningsnetværk (CNN)

Kilder og videre læsning

Opslagsværker

  • Vaswani et al. (2017), Attention Is All You Need

Lærebøger

  • Goodfellow, Bengio & Courville, Deep Learning · MIT Press

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Nævnt i

Test dig selv

Indlæser…

Atlas er i beta.