Encoder
Den halvdel af en model, der læser hele inputtet på én gang og gør det til embeddings, som fanger betydningen.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En stak af lag i et neuralt netværk, der tager en hel række tokens og, ved at lade hvert token kigge både frem og tilbage, laver én embedding pr. token til brug i de næste trin.
Forklaret enkelt
Som en tolk, der hører hele sætningen, før hun siger noget, fordi et ord helt til sidst kan ændre, hvad det første betød.
I praksis
Hos et fjernvarmeselskab sorterer en IT-udvikler indgående kundemails med en ren encoder-model som BERT, der læser hver besked i sin helhed og mærker den “regning”, “fejl” eller “flytning”.
Hvorfor det betyder noget
Encodere klarer søgning og sortering billigt, men kan ikke skrive ny tekst, så kender man forskellen, kan man vælge et mindre og hurtigere værktøj, når opgaven kun er at forstå tekst.
Teknisk uddybning
En encoderblok i en transformer består af umaskeret multi-head self-attention efterfulgt af et positionsvist feed-forward-netværk, hver med residualforbindelse og lagnormalisering. Da der ikke er nogen kausal maske, er hver outputvektor en funktion af hele inputsekvensen, og det er, hvad "tovejs" betyder i praksis. Hele sekvensen behandles i ét parallelt forward-gennemløb; der er ingen autoregressiv løkke og ingen KV-cache, og prisen domineres af den kvadratiske attention, O(n²), over inputlængden. I den oprindelige encoder-decoder-transformer kører encoderen én gang pr. input, og dens sidste skjulte tilstande fungerer som de keys og values, som hvert decoderlag læser via cross-attention.
BERT (Devlin m.fl., 2019) fastlagde mønstret for rene encodere. BERT-base har 12 lag, skjult dimension 768, 12 hoveder og omkring 110 millioner parametre; BERT-large har 24 lag, skjult dimension 1024 og omkring 340 millioner. Fortræningen brugte masked language modelling: 15 % af tokenpositionerne udvælges, hvoraf 80 % erstattes med [MASK], 10 % med et tilfældigt token og 10 % står uændret, og modellen forudsiger de oprindelige; en opgave med forudsigelse af næste sætning blev tilføjet, men RoBERTa (2019) viste, at den kunne undværes. Inputlængden lå fast på 512 positioner, en grænse, der i årevis prægede praksis for chunking; nyere encodere som ModernBERT (2024) udvider den til 8.192 tokens. ELECTRA erstattede maskering med detektion af udskiftede tokens, hvilket udnytter træningsdata bedre.
For at bruge en encoder til en opgave lægges et lille hoved ovenpå: en lineær klassifikator på det samlede output til klassifikation af sætninger, en klassifikator pr. token til genkendelse af navngivne enheder eller start- og slutpegere til ekstraktiv spørgsmålsbesvarelse. Til embeddings skal vektorerne pr. token samles til én, typisk ved mean pooling eller ved at tage den særlige [CLS]-vektor, og rå BERT-output samlet på den måde er dårlige lighedsvektorer, indtil modellen trænes videre kontrastivt, som Sentence-BERT gjorde. Ordet "encoder" bruges også bredere om ethvert netværk, der afbilder et input til en repræsentation, fx ViT-billedencoderen i en multimodal model eller lydencoderen i Whisper.
Den praktiske afvejning over for decodere er, at en encoder ser fuld kontekst i begge retninger og er billig at køre, hvilket passer til klassifikation, udtræk, søgning og genrangering, men den har ingen effektiv måde at generere fri tekst på: At udfylde masker én ad gangen kan lade sig gøre, men er langsomt og giver ringe kvalitet. Til smalle klassifikationsopgaver med et fast sæt etiketter er en finjusteret encoder på nogle hundrede millioner parametre ofte lige så præcis som at prompte en stor generativ model, til en brøkdel af ventetiden og prisen.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
Relationer
- Del af
- Transformer
- Forudsætter
- TokenEmbeddingAttention-mekanisme
- Åbner for
- Multimodal model
- Forveksl ikke med
- Decoder
- Bruges sammen med
- Embedding-model
Kilder og videre læsning
Opslagsværker
- Vaswani et al. (2017), Attention Is All You Need
- Devlin et al. (2019), BERT - Pre-training of Deep Bidirectional Transformers for Language Understanding
Lærebøger
- Jurafsky & Martin, Speech and Language Processing (3rd ed. draft)
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…