Cosinuslighed
En score fra -1 til 1 for, hvor meget to lister af tal peger i samme retning, brugt til at afgøre, hvor ens to embeddings er i betydning.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
Et mål for lighed mellem to embeddings baseret på vinklen mellem dem, uden hensyn til deres længde; 1 betyder samme retning, 0 betyder ingen sammenhæng og -1 betyder modsat.
Forklaret enkelt
Som at sammenligne to pile efter, hvilken vej de peger, ikke hvor lange de er - to personer, der går mod nord, går samme vej, selvom den ene går meget længere.
I praksis
En IT-supporter i en kommune tester den nye hjælpesøgning; embeddingen af “nulstil min adgangskode” scorer 0,86 mod artiklen “glemt dit login” og 0,12 mod “parkering ved rådhuset”.
Hvorfor det betyder noget
Det er den sædvanlige målestok i betydningsbaseret søgning, men en høj score betyder kun “handler om det samme”, ikke “er korrekt” eller “besvarer spørgsmålet”.
Teknisk uddybning
For vektorerne a og b er definitionen cos(a, b) = (a · b) / (‖a‖ ‖b‖) = Σ aᵢbᵢ / (√Σ aᵢ² · √Σ bᵢ²). Den er invariant over for positiv skalering af hver af vektorerne, og derfor blev den standard i vektorrumsmodellen for informationssøgning: Et langt dokument med samme fordeling af termer som et kort får samme score. Med ikke-negative vektorer som TF-IDF-vægte, som i den klassiske fremstilling hos Manning, Raghavan og Schütze, er intervallet 0 til 1; kun tætte embeddings med fortegnsbærende komponenter bruger hele intervallet fra −1 til 1. Pearson-korrelation er cosinus mellem middelværdicentrerede vektorer.
For L2-normaliserede vektorer er cosinuslighed lig med prikproduktet, og den kvadrerede euklidiske afstand er ‖a − b‖² = 2 − 2 cos(a, b), så rangering efter cosinus, indre produkt og euklidisk afstand giver samme rækkefølge. Det udnytter vektordatabaser: Normaliseres vektorerne ved indlæsning, kan de bruge en hurtig kerne til indre produkt. Ækvivalensen bryder sammen, hvis en model er trænet til unormaliseret indre produkt (DPR brugte fx det rå prikprodukt), eller hvis vektorer afkortes, som ved Matryoshka-embeddings, uden at blive normaliseret igen. Cosinusafstand, 1 − cos, bruges bredt som forskellighedsmål, men er ikke en egentlig metrik, fordi den bryder trekantsuligheden; vinkelafstand, arccos(cos)/π, er. Nogle indeksstrukturer forudsætter en metrik, hvilket er én grund til, at søgemaskiner gør afstandsfunktionen til en eksplicit indeksparameter, der skal passe til modellen.
Talværdien siger mindre, end det formelle interval antyder. Mange transformer-embeddings er anisotrope og optager en smal kegle af rummet (Ethayarajh, 2019), så urelaterede tekster kan stadig score 0,6 eller mere, og negative scorer er sjældne. Scorer kan derfor kun sammenlignes inden for samme model og version; en tærskel som "over 0,8 tæller som match" skal kalibreres pr. model på mærkede par og kan ikke overføres, når modellen skiftes. Steck, Ekanadham og Kallus (2024) viste, at cosinuslighed for visse lærte embeddings kan give vilkårlige resultater, fordi træningsmålet lader skaleringen af de enkelte dimensioner være ubestemt, hvilket minder om, at målet arver den geometri, træningen har påført.
Beregningen er d multiplikationer og additioner pr. par, billigt nok til at sammenligne en forespørgsel med titusinder af vektorer ved brute force med SIMD- eller GPU-kerner, men ved millioner af vektorer kræves indeks til approksimativ nærmeste-nabo-søgning. Komprimerede repræsentationer ændrer regnestykket: int8-skalarkvantisering holder cosinusrangeringen tæt på float32, mens binær kvantisering erstatter den med Hamming-afstand på fortegnsbit og normalt efterfølges af genberegning af de øverste kandidater med vektorer i fuld præcision.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Neuralt netværk
- →Token
- →Embedding
- →Cosinuslighed
Relationer
- Forudsætter
- Embedding
- Åbner for
- Semantisk søgning
- Bruges sammen med
- Embedding-modelNærmeste-nabo-søgningKlyngeanalyse (clustering)
Kilder og videre læsning
Lærebøger
- Jurafsky & Martin, Speech and Language Processing (ch. 6, Vector Semantics and Embeddings)
- Manning, Raghavan & Schütze, Introduction to Information Retrieval · Cambridge University Press
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…