{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/embedding","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/embedding/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/embedding/"},"term":{"en":"Embedding","da":"Embedding"},"aka":{"en":["vector embedding"],"da":["vektorrepræsentation"]},"domain":["ai"],"cluster":"llm","layer":"model","status":"current","era":2013,"summary":{"en":"A list of numbers that stands for the meaning of a piece of text, so that texts with similar meaning end up with similar numbers.","da":"En liste af tal, der står for betydningen af et stykke tekst, så tekster med lignende betydning ender med lignende tal."},"body":{"formal":{"en":"A fixed-length vector produced by a neural network to represent a token, sentence or document, placed so that items close in meaning lie close together and can be compared by distance.","da":"En vektor af fast længde, som et neuralt netværk laver for at repræsentere et token, en sætning eller et dokument, placeret så ting med nær betydning ligger tæt og kan sammenlignes ud fra afstand."},"plain":{"en":"Like giving every text coordinates on a map of meaning - \"car\" and \"vehicle\" land near each other, \"car\" and \"banana\" far apart.","da":"Som at give hver tekst koordinater på et kort over betydning - \"bil\" og \"køretøj\" lander tæt på hinanden, \"bil\" og \"banan\" langt fra hinanden."},"inPractice":{"en":"A municipality stores embeddings of all its internal policies, so that a staff member's search for “working from home” also finds the policy titled “remote work”.","da":"En kommune gemmer embeddings af alle sine interne retningslinjer, så en sagsbehandlers søgning på “arbejde hjemmefra” også finder retningslinjen med titlen “hjemmearbejde”."},"whyItMatters":{"en":"Embeddings look like meaningless numbers, but much of the original text can be rebuilt from them, so they need the same protection as the source data.","da":"Embeddings ligner meningsløse tal, men store dele af den oprindelige tekst kan genskabes ud fra dem, så de skal beskyttes lige så godt som kildedataene."}},"deepDive":{"en":"Two different things share the name. Inside every language model there is a token-embedding table, a learned matrix of shape vocabulary size by model dimension, from which each input token ID selects one row; these vectors are only the starting point and are transformed layer by layer into contextual representations. Separately, embedding models (text encoders) map a whole passage to one fixed-length vector, typically a few hundred to a few thousand dimensions, by pooling the final hidden states (mean pooling or a dedicated CLS or end-of-sequence token). Retrieval, clustering, deduplication and classification use the second kind.\n\nThe lineage runs from word2vec (Mikolov et al., 2013), whose skip-gram and CBOW objectives produced static word vectors with the famous linear analogies, through contextual encoders such as BERT (2018), to sentence encoders trained contrastively: pairs of related texts (question and answer, title and body, paraphrases) are pulled together and in-batch negatives pushed apart with an InfoNCE-style loss. Sentence-BERT (2019) made this bi-encoder setup practical; benchmarks such as MTEB compare models across retrieval, clustering and similarity tasks. Some newer models are trained so that a prefix of the vector (for example the first 256 of 1,024 dimensions) remains usable, which lets operators trade accuracy for storage.\n\nSimilarity is usually measured by cosine similarity or, for L2-normalised vectors, the equivalent dot product. Scores are only comparable within one model: vectors from different models, or different versions of the same model, live in unrelated spaces, so changing the embedding model means re-embedding the whole corpus. At scale, exact search is replaced by approximate nearest-neighbour indexes such as HNSW or IVF with product quantisation, which trade a little recall for large speed gains. A bi-encoder compresses a passage before seeing the query, so it misses fine distinctions such as negation or exact identifiers; that is why pipelines add keyword search (hybrid search) and a cross-encoder reranker that reads query and passage together.\n\nEmbeddings are not anonymisation. Morris et al. (2023) showed that an iterative inversion method (vec2text) recovered 92% of 32-token inputs exactly from their embeddings, and personal names could be recovered from embeddings of clinical notes. Under GDPR an embedding of personal data therefore remains personal data, a vector store needs the same access control, retention and deletion as the source documents, and a leaked index should be treated like a leak of the text. OWASP's 2025 LLM Top 10 covers related risks as LLM08 Vector and Embedding Weaknesses.","da":"To forskellige ting deler navnet. Inde i enhver sprogmodel findes en token-embedding-tabel, en lært matrix med størrelsen ordforråd gange modeldimension, hvor hvert input-token-ID udvælger én række; disse vektorer er kun udgangspunktet og omdannes lag for lag til kontekstafhængige repræsentationer. Adskilt fra det afbilder embedding-modeller (tekst-encodere) en hel tekstpassage til én vektor af fast længde, typisk fra nogle hundrede til et par tusind dimensioner, ved at pool'e de sidste skjulte tilstande (gennemsnit eller et særligt CLS- eller slut-token). Søgning, klyngedannelse, deduplikering og klassifikation bruger den anden slags.\n\nSlægten går fra word2vec (Mikolov m.fl., 2013), hvis skip-gram- og CBOW-mål gav statiske ordvektorer med de berømte lineære analogier, over kontekstuelle encodere som BERT (2018) til sætnings-encodere trænet kontrastivt: Par af beslægtede tekster (spørgsmål og svar, titel og brødtekst, omskrivninger) trækkes sammen, og andre eksempler i samme batch skubbes væk med et tab i stil med InfoNCE. Sentence-BERT (2019) gjorde denne bi-encoder-opsætning praktisk, og benchmarks som MTEB sammenligner modeller på tværs af søgning, klyngedannelse og lighed. Nogle nyere modeller trænes, så et præfiks af vektoren (fx de første 256 af 1.024 dimensioner) stadig kan bruges, så man kan bytte præcision for lagerplads.\n\nLighed måles typisk med cosinuslighed eller, for L2-normaliserede vektorer, det tilsvarende prikprodukt. Scorer kan kun sammenlignes inden for samme model: Vektorer fra forskellige modeller, eller fra forskellige versioner af samme model, ligger i urelaterede rum, så et skift af embedding-model betyder, at hele korpusset skal embeddes igen. I stor skala erstattes eksakt søgning af approksimativ nærmeste-nabo-søgning med indeks som HNSW eller IVF med produktkvantisering, der ofrer en smule recall for store hastighedsgevinster. En bi-encoder komprimerer en passage, før den ser forespørgslen, så den overser fine forskelle som nægtelser eller præcise ID'er; derfor tilføjer pipelines nøgleordssøgning (hybrid søgning) og en cross-encoder til genrangering, der læser forespørgsel og passage sammen.\n\nEmbeddings er ikke anonymisering. Morris m.fl. (2023) viste, at en iterativ inversionsmetode (vec2text) kunne genskabe 92 % af input på 32 tokens nøjagtigt ud fra deres embeddings, og at personnavne kunne genskabes fra embeddings af kliniske notater. Efter databeskyttelsesforordningen er en embedding af personoplysninger derfor stadig personoplysninger, en vektordatabase kræver samme adgangsstyring, opbevaring og sletning som kildedokumenterne, og et lækket indeks bør behandles som et læk af selve teksten. OWASP's LLM Top 10 fra 2025 dækker beslægtede risici som LLM08 Vector and Embedding Weaknesses."},"edges":[{"type":"requires","to":"ai/neural-network","confidence":"high","strength":"normal"},{"type":"requires","to":"ai/token","confidence":"high","strength":"normal"},{"type":"used-with","to":"ai/transformer","confidence":"high","strength":"normal"},{"type":"used-with","to":"ai/retrieval-augmented-generation","why":{"en":"RAG turns the question and the documents into embeddings to find the passages closest in meaning.","da":"RAG laver spørgsmålet og dokumenterne om til embeddings for at finde de tekststykker, der ligger tættest i betydning."},"confidence":"high","strength":"primary"},{"type":"used-with","to":"ai/tokenizer","why":{"en":"The tokenizer turns text into tokens, and each token is then looked up as an embedding.","da":"Tokenizeren laver tekst om til tokens, og hvert token slås derefter op som en embedding."},"confidence":"medium","strength":"normal"}],"depth":1,"sources":[{"title":"Mikolov et al. (2013), Efficient Estimation of Word Representations in Vector Space","tier":"reference"},{"title":"Goodfellow, Bengio & Courville, Deep Learning","tier":"textbook","publisher":"MIT Press"},{"title":"Morris et al. (2023), Text Embeddings Reveal (Almost) As Much As Text","tier":"reference"}],"draft":true}