Semantisk søgning
At finde tekst ud fra dens betydning frem for dens præcise ord, så et spørgsmål kan ramme et anderledes formuleret afsnit.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En søgemetode, hvor spørgsmålet og de gemte tekster laves om til embeddings, og de tekster, hvis embeddings scorer højest på et nærhedsmål, oftest cosinuslighed, returneres.
Forklaret enkelt
Som at spørge en ven, der har set alle film, om “den, hvor det store skib synker” - vedkommende ved, hvad du mener, selvom du aldrig sagde titlen.
I praksis
En lærer på en folkeskole skriver “må jeg tage min hund med på arbejde?” i personaleportalen, og semantisk søgning finder afsnittet i skolens regler med overskriften “dyr på skolens område”.
Hvorfor det betyder noget
Den finder svar, som ordmatch overser, men kan også returnere afsnit, der føles beslægtede, men siger noget andet, og den er svag til præcise navne og koder.
Teknisk uddybning
I nutidig brug betyder semantisk søgning dense retrieval: En embedding-model afbilder dokumenter (eller stykker) til vektorer ved indeksering, forespørgslen laves om til en embedding med samme model ved søgning, og et indeks til approksimativ nærmeste-nabo-søgning returnerer de k vektorer med højest cosinuslighed eller indre produkt. Idéen om at matche på latent betydning er ældre: Latent semantic indexing (Deerwester m.fl., 1990) anvendte en afkortet singulærværdidekomposition på term-dokument-matricen. Begrebet bruges også løst om funktioner i websøgning bygget på vidensgrafer og om Semantic Webs RDF-baserede forespørgsler, som er andre teknologier.
Det moderne vendepunkt var Dense Passage Retrieval (Karpukhin m.fl., 2020): To BERT-encodere, én til spørgsmål og én til passager, trænet med in-batch negatives, slog en stærk Lucene-BM25-basislinje med 9-19 procentpoint i top-20-nøjagtighed for genfinding af passager på tværs af datasæt til åben spørgsmålsbesvarelse. BEIR-benchmarket (Thakur m.fl., 2021) viste derefter grænsen for resultatet: Evalueret zero-shot på domæner, de ikke var trænet på, faldt flere dense retrievers under BM25, mens leksikalsk matchning holdt robust. Meget af fremskridtet siden, i storskala kontrastiv fortræning af generelle embedding-modeller, har sigtet mod netop det hul uden for domænet.
To designskel betyder noget i praksis. Symmetrisk søgning sammenligner tekster af samme slags (dubletfinding, lignende sager), mens asymmetrisk søgning matcher et kort spørgsmål med en længere passage, der besvarer det; mange embedding-modeller er trænet til det ene eller det andet og forventer præfikser eller instruktioner til forespørgsel og dokument i overensstemmelse med det. Teknikker på forespørgselssiden kan mindske asymmetrien: HyDE (Gao m.fl., 2022) lader en sprogmodel skrive et hypotetisk svar og laver embedding af det i stedet for spørgsmålet. Flersprogede embedding-modeller placerer oversættelser tæt på hinanden, så en dansk forespørgsel kan finde et engelsk dokument, hvilket er nyttigt, men kan overraske brugerne og gøre relevansvurderinger sværere.
De typiske fejl følger af, at teksten presses ned i én vektor. Embeddings er svage på negation og polaritet ("tilladt" og "ikke tilladt" kan score næsten ens), på præcise identifikatorer, tal og datoer og på sjældne egennavne; de måler emnemæssig sammenhæng og ikke, om en passage besvarer spørgsmålet. En dense retriever returnerer også altid k nærmeste naboer, selv når intet relevant findes, så en applikation må afgøre, med en kalibreret tærskel eller en reranker, hvornår svaret skal være "ikke fundet". Disse egenskaber er grunden til, at semantisk søgning som regel kombineres med nøgleordssøgning i hybrid søgning og efterfølges af genrangering, og til at kvaliteten bør måles med recall@k og nDCG på mærkede forespørgsler fra måldomænet.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Neuralt netværk
- →Token
- →Embedding
- →Cosinuslighed
- →Semantisk søgning
Relationer
- Forudsætter
- EmbeddingCosinuslighed
- Åbner for
- Hybrid søgning
- Forveksl ikke med
- Nøgleordssøgning
- Bruges sammen med
- VektordatabaseNærmeste-nabo-søgningGenrangering (reranking)
Kilder og videre læsning
Opslagsværker
- Reimers & Gurevych (2019), Sentence-BERT - Sentence Embeddings using Siamese BERT-Networks
- Karpukhin et al. (2020), Dense Passage Retrieval for Open-Domain Question Answering
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…