Gå til indhold
atlas

Embedding

Også kendt som: vektorrepræsentation

En liste af tal, der står for betydningen af et stykke tekst, så tekster med lignende betydning ender med lignende tal.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En vektor af fast længde, som et neuralt netværk laver for at repræsentere et token, en sætning eller et dokument, placeret så ting med nær betydning ligger tæt og kan sammenlignes ud fra afstand.

Forklaret enkelt

Som at give hver tekst koordinater på et kort over betydning - "bil" og "køretøj" lander tæt på hinanden, "bil" og "banan" langt fra hinanden.

I praksis

En kommune gemmer embeddings af alle sine interne retningslinjer, så en sagsbehandlers søgning på “arbejde hjemmefra” også finder retningslinjen med titlen “hjemmearbejde”.

Hvorfor det betyder noget

Embeddings ligner meningsløse tal, men store dele af den oprindelige tekst kan genskabes ud fra dem, så de skal beskyttes lige så godt som kildedataene.

Teknisk uddybning

To forskellige ting deler navnet. Inde i enhver sprogmodel findes en token-embedding-tabel, en lært matrix med størrelsen ordforråd gange modeldimension, hvor hvert input-token-ID udvælger én række; disse vektorer er kun udgangspunktet og omdannes lag for lag til kontekstafhængige repræsentationer. Adskilt fra det afbilder embedding-modeller (tekst-encodere) en hel tekstpassage til én vektor af fast længde, typisk fra nogle hundrede til et par tusind dimensioner, ved at pool'e de sidste skjulte tilstande (gennemsnit eller et særligt CLS- eller slut-token). Søgning, klyngedannelse, deduplikering og klassifikation bruger den anden slags.

Slægten går fra word2vec (Mikolov m.fl., 2013), hvis skip-gram- og CBOW-mål gav statiske ordvektorer med de berømte lineære analogier, over kontekstuelle encodere som BERT (2018) til sætnings-encodere trænet kontrastivt: Par af beslægtede tekster (spørgsmål og svar, titel og brødtekst, omskrivninger) trækkes sammen, og andre eksempler i samme batch skubbes væk med et tab i stil med InfoNCE. Sentence-BERT (2019) gjorde denne bi-encoder-opsætning praktisk, og benchmarks som MTEB sammenligner modeller på tværs af søgning, klyngedannelse og lighed. Nogle nyere modeller trænes, så et præfiks af vektoren (fx de første 256 af 1.024 dimensioner) stadig kan bruges, så man kan bytte præcision for lagerplads.

Lighed måles typisk med cosinuslighed eller, for L2-normaliserede vektorer, det tilsvarende prikprodukt. Scorer kan kun sammenlignes inden for samme model: Vektorer fra forskellige modeller, eller fra forskellige versioner af samme model, ligger i urelaterede rum, så et skift af embedding-model betyder, at hele korpusset skal embeddes igen. I stor skala erstattes eksakt søgning af approksimativ nærmeste-nabo-søgning med indeks som HNSW eller IVF med produktkvantisering, der ofrer en smule recall for store hastighedsgevinster. En bi-encoder komprimerer en passage, før den ser forespørgslen, så den overser fine forskelle som nægtelser eller præcise ID'er; derfor tilføjer pipelines nøgleordssøgning (hybrid søgning) og en cross-encoder til genrangering, der læser forespørgsel og passage sammen.

Embeddings er ikke anonymisering. Morris m.fl. (2023) viste, at en iterativ inversionsmetode (vec2text) kunne genskabe 92 % af input på 32 tokens nøjagtigt ud fra deres embeddings, og at personnavne kunne genskabes fra embeddings af kliniske notater. Efter databeskyttelsesforordningen er en embedding af personoplysninger derfor stadig personoplysninger, en vektordatabase kræver samme adgangsstyring, opbevaring og sletning som kildedokumenterne, og et lækket indeks bør behandles som et læk af selve teksten. OWASP's LLM Top 10 fra 2025 dækker beslægtede risici som LLM08 Vector and Embedding Weaknesses.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Neuralt netværk
  2. →Token
  3. →Embedding

Relationer

Kilder og videre læsning

Opslagsværker

  • Mikolov et al. (2013), Efficient Estimation of Word Representations in Vector Space
  • Morris et al. (2023), Text Embeddings Reveal (Almost) As Much As Text

Lærebøger

  • Goodfellow, Bengio & Courville, Deep Learning · MIT Press

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Nævnt i

Test dig selv

Indlæser…

Atlas er i beta.