Gå til indhold
atlas

Multimodal model

Også kendt som: multimodal AI

En model, der kan tage imod - og nogle gange selv skabe - flere slags indhold, fx tekst, fotos og tale, i den samme samtale.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En grundmodel, der laver forskellige slags input - tekst, billeder, lyd - om til embeddings i ét fælles rum, typisk med en separat encoder for hver slags, så en enkelt transformer kan ræsonnere på tværs af dem samlet.

Forklaret enkelt

Som en kollega, du kan række et foto, afspille en talebesked for og skrive til - alt i én samtale - i stedet for tre hjælpere, der hver kun kan læse, se eller lytte.

I praksis

En byggesagsbehandler i en kommune fotograferer en håndtegnet plantegning, der fulgte med en ansøgning, og beder assistenten om det samlede antal kvadratmeter; modellen aflæser målene på tegningen, og hun tjekker summen.

Hvorfor det betyder noget

Hver ny slags input er en ny vej ind - tekst gemt i et billede kan bære instruktioner, brugeren aldrig ser, så billeder og lyd kræver samme omhu som indtastet tekst.

Teknisk uddybning

Fire arkitekturfamilier er i brug. Dobbelte encodere som CLIP (Radford m.fl., 2021) træner en billedencoder og en tekstencoder med et symmetrisk kontrastivt tab (InfoNCE) på omkring 400 millioner par af billeder og billedtekster, så sammenhørende par får høj cosinuslighed; de genererer ikke tekst, men muliggør zero-shot-klassifikation og søgning på tværs af modaliteter, og SigLIP erstattede senere softmax med et parvist sigmoid-tab. Cross-attention-modeller som Flamingo (2022) beholder en frossen sprogmodel og indsætter gatede cross-attention-lag, der læser de visuelle features. Det nu dominerende late fusion- eller "adapter"-design, som LLaVA (2023) gjorde populært, tager en fortrænet billedencoder, afbilder dens patch-embeddings via en lille projektion ind i sprogmodellens token-embedding-rum og giver dem til decoderen, som om de var almindelige tokens. Early fusion-modeller som Chameleon (2024) tokeniserer billeder til diskrete koder og træner én transformer på sammenflettede sekvenser fra starten.

Billeder bliver til tokens via en Vision Transformer: Et billede på 224 × 224 pixel delt i felter på 14 × 14 pixel giver 16 × 16 = 256 patch-embeddings. Input i høj opløsning håndteres ved opdeling i fliser eller dynamisk opløsning, så ét skærmbillede eller én scannet side kan koste hundreder til tusinder af tokens, hvilket dominerer ventetid og pris ved dokumentopgaver. Lyd kodes typisk med en encoder i Whisper-stil over log-mel-spektrogrammer, og video samples som enkeltbilleder, hvilket hurtigt mangedobler antallet af tokens. På outputsiden sender mange systemer stadig billedgenerering videre til en separat diffusionsmodel, mens "any-to-any"-modeller genererer diskrete billed- eller lydtokens direkte.

De typiske fejlmønstre adskiller sig fra rene tekstmodeller. Objekthallucination (beskrivelse af ting, der ikke er i billedet), fejl i optælling, rumlige forhold, lille tekst og værdier i diagrammer samt for selvsikker aflæsning af håndskrift er veldokumenterede, og derfor kræver en models aflæsning af en plantegning eller faktura en regnekontrol eller et menneskeligt tjek. Typografiske angreb viste tidligt, at CLIP kunne styres af en håndskrevet seddel på en genstand, og OWASP Top 10 for LLM Applications 2025 nævner multimodal injektion, altså instruktioner skjult i billeder eller lyd, under LLM01 Prompt Injection; sådan tekst kan være usynlig for brugeren (lav kontrast, små skrifttyper, steganografi) og alligevel læsbar for modellen.

Set fra et governance-perspektiv rummer billeder og lyd ofte flere personoplysninger, end prompten antyder: ansigter, nummerplader, skærme i baggrunden, stemmer og EXIF-metadata som GPS-koordinater. Efter databeskyttelsesforordningen er et foto af en person en personoplysning, og ansigtsbilleder bliver først biometriske data i særlig kategori efter art. 9, når de behandles med særlige tekniske midler med henblik på entydig identifikation, så formålet med behandlingen har betydning for behandlingsgrundlaget.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Neuralt netværk
  2. →Token
  3. →Embedding
  4. →Attention-mekanisme
  5. →Encoder
  6. →Multimodal model

Relationer

Forudsætter
EmbeddingEncoder

Kilder og videre læsning

Opslagsværker

  • Radford et al. (2021), Learning Transferable Visual Models From Natural Language Supervision (CLIP)
  • OWASP Top 10 for LLM Applications 2025 (LLM01 Prompt Injection - multimodal injection) · OWASP

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.