{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/multimodal-model","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/multimodal-model/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/multimodal-model/"},"term":{"en":"Multimodal model","da":"Multimodal model"},"aka":{"en":["multimodal AI"],"da":["multimodal AI"]},"domain":["ai"],"cluster":"model-architecture","layer":"model","status":"current","summary":{"en":"A model that can take in, and sometimes produce, more than one kind of content - such as text, photos and speech - in one conversation.","da":"En model, der kan tage imod - og nogle gange selv skabe - flere slags indhold, fx tekst, fotos og tale, i den samme samtale."},"body":{"formal":{"en":"A foundation model that turns different kinds of input - text, images, sound - into embeddings in one shared space, usually with a separate encoder for each kind, so a single transformer can reason across them together.","da":"En grundmodel, der laver forskellige slags input - tekst, billeder, lyd - om til embeddings i ét fælles rum, typisk med en separat encoder for hver slags, så en enkelt transformer kan ræsonnere på tværs af dem samlet."},"plain":{"en":"Like a colleague you can hand a photo, play a voice message to and write to, all in one conversation - instead of three helpers who can each only read, look or listen.","da":"Som en kollega, du kan række et foto, afspille en talebesked for og skrive til - alt i én samtale - i stedet for tre hjælpere, der hver kun kan læse, se eller lytte."},"inPractice":{"en":"A building inspector in a municipality photographs a hand-drawn floor plan sent with an application and asks the assistant for the total floor area; the model reads the measurements off the drawing, and she checks the sum.","da":"En byggesagsbehandler i en kommune fotograferer en håndtegnet plantegning, der fulgte med en ansøgning, og beder assistenten om det samlede antal kvadratmeter; modellen aflæser målene på tegningen, og hun tjekker summen."},"whyItMatters":{"en":"Every new kind of input is a new way in - text hidden inside a picture can carry instructions the user never sees, so images and audio need the same care as typed text.","da":"Hver ny slags input er en ny vej ind - tekst gemt i et billede kan bære instruktioner, brugeren aldrig ser, så billeder og lyd kræver samme omhu som indtastet tekst."}},"deepDive":{"en":"Four architectural families are in use. Dual encoders such as CLIP (Radford et al., 2021) train an image encoder and a text encoder with a symmetric contrastive (InfoNCE) loss on about 400 million image-caption pairs, so that matching pairs have high cosine similarity; they do not generate text but enable zero-shot classification and cross-modal search, and SigLIP later replaced the softmax with a pairwise sigmoid loss. Cross-attention models such as Flamingo (2022) keep a frozen language model and insert gated cross-attention layers that read visual features. The now dominant late-fusion or \"adapter\" design, popularised by LLaVA (2023), takes a pretrained vision encoder, maps its patch embeddings through a small projection into the language model's token-embedding space and feeds them to the decoder as if they were ordinary tokens. Early-fusion models such as Chameleon (2024) tokenise images into discrete codes and train one transformer on interleaved sequences from the start.\n\nImages become tokens via a Vision Transformer: a 224 × 224 image cut into 14 × 14-pixel patches yields 16 × 16 = 256 patch embeddings. High-resolution inputs are handled by tiling or dynamic resolution, so one screenshot or scanned page can cost hundreds to thousands of tokens, which dominates latency and price for document workloads. Audio is typically encoded with a Whisper-style encoder over log-mel spectrograms, and video is sampled as frames, which multiplies token counts quickly. On the output side, many systems still route image generation to a separate diffusion model, while \"any-to-any\" models generate discrete image or audio tokens directly.\n\nCharacteristic failure modes differ from text-only models. Object hallucination (describing things not in the image), errors in counting, spatial relations, small text and chart values, and overconfident reading of handwriting are well documented, which is why a model's reading of a floor plan or invoice needs an arithmetic or human check. Typographic attacks showed early on that CLIP could be steered by a handwritten label on an object, and OWASP's Top 10 for LLM Applications 2025 lists multimodal injection, instructions hidden in images or audio, under LLM01 Prompt Injection; such text can be invisible to the user (low contrast, tiny fonts, steganography) yet readable to the model.\n\nFor governance, images and audio often carry more personal data than the prompt suggests: faces, number plates, screens in the background, voices and EXIF metadata such as GPS coordinates. Under the GDPR, a photo of a person is personal data, and facial images become special-category biometric data under Art. 9 only when processed through specific technical means for unique identification, so the purpose of processing matters for the legal basis.","da":"Fire arkitekturfamilier er i brug. Dobbelte encodere som CLIP (Radford m.fl., 2021) træner en billedencoder og en tekstencoder med et symmetrisk kontrastivt tab (InfoNCE) på omkring 400 millioner par af billeder og billedtekster, så sammenhørende par får høj cosinuslighed; de genererer ikke tekst, men muliggør zero-shot-klassifikation og søgning på tværs af modaliteter, og SigLIP erstattede senere softmax med et parvist sigmoid-tab. Cross-attention-modeller som Flamingo (2022) beholder en frossen sprogmodel og indsætter gatede cross-attention-lag, der læser de visuelle features. Det nu dominerende late fusion- eller \"adapter\"-design, som LLaVA (2023) gjorde populært, tager en fortrænet billedencoder, afbilder dens patch-embeddings via en lille projektion ind i sprogmodellens token-embedding-rum og giver dem til decoderen, som om de var almindelige tokens. Early fusion-modeller som Chameleon (2024) tokeniserer billeder til diskrete koder og træner én transformer på sammenflettede sekvenser fra starten.\n\nBilleder bliver til tokens via en Vision Transformer: Et billede på 224 × 224 pixel delt i felter på 14 × 14 pixel giver 16 × 16 = 256 patch-embeddings. Input i høj opløsning håndteres ved opdeling i fliser eller dynamisk opløsning, så ét skærmbillede eller én scannet side kan koste hundreder til tusinder af tokens, hvilket dominerer ventetid og pris ved dokumentopgaver. Lyd kodes typisk med en encoder i Whisper-stil over log-mel-spektrogrammer, og video samples som enkeltbilleder, hvilket hurtigt mangedobler antallet af tokens. På outputsiden sender mange systemer stadig billedgenerering videre til en separat diffusionsmodel, mens \"any-to-any\"-modeller genererer diskrete billed- eller lydtokens direkte.\n\nDe typiske fejlmønstre adskiller sig fra rene tekstmodeller. Objekthallucination (beskrivelse af ting, der ikke er i billedet), fejl i optælling, rumlige forhold, lille tekst og værdier i diagrammer samt for selvsikker aflæsning af håndskrift er veldokumenterede, og derfor kræver en models aflæsning af en plantegning eller faktura en regnekontrol eller et menneskeligt tjek. Typografiske angreb viste tidligt, at CLIP kunne styres af en håndskrevet seddel på en genstand, og OWASP Top 10 for LLM Applications 2025 nævner multimodal injektion, altså instruktioner skjult i billeder eller lyd, under LLM01 Prompt Injection; sådan tekst kan være usynlig for brugeren (lav kontrast, små skrifttyper, steganografi) og alligevel læsbar for modellen.\n\nSet fra et governance-perspektiv rummer billeder og lyd ofte flere personoplysninger, end prompten antyder: ansigter, nummerplader, skærme i baggrunden, stemmer og EXIF-metadata som GPS-koordinater. Efter databeskyttelsesforordningen er et foto af en person en personoplysning, og ansigtsbilleder bliver først biometriske data i særlig kategori efter art. 9, når de behandles med særlige tekniske midler med henblik på entydig identifikation, så formålet med behandlingen har betydning for behandlingsgrundlaget."},"edges":[{"type":"requires","to":"ai/embedding","confidence":"high","strength":"normal"},{"type":"requires","to":"ai/encoder","confidence":"high","strength":"normal"},{"type":"kind-of","to":"ai/foundation-model","confidence":"high","strength":"normal"},{"type":"used-with","to":"ai/prompt-injection","why":{"en":"Instructions can be hidden in an image or audio clip, giving prompt injection a path that text filters do not see.","da":"Instruktioner kan gemmes i et billede eller et lydklip, hvilket giver prompt injection en vej, som tekstfiltre ikke ser."},"confidence":"high","strength":"primary"},{"type":"used-with","to":"ai/prompt","confidence":"high","strength":"normal"},{"type":"used-with","to":"ai/transformer","confidence":"high","strength":"normal"}],"depth":4,"sources":[{"title":"Radford et al. (2021), Learning Transferable Visual Models From Natural Language Supervision (CLIP)","tier":"reference"},{"title":"OWASP Top 10 for LLM Applications 2025 (LLM01 Prompt Injection - multimodal injection)","tier":"reference","publisher":"OWASP"}],"draft":true}