Gå til indhold
atlas

Diffusionsmodel

Også kendt som: støjfjernende diffusionsmodel

Den slags generativ AI bag mange billedgeneratorer, der starter fra tilfældig sne og renser den trin for trin til et billede.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En deep learning-model, der er lært at fortryde en proces, som langsomt lægger tilfældig sne over rigtige eksempler; for at skabe noget nyt starter den med ren sne og fjerner lidt i hvert af mange trin, styret af en prompt.

Forklaret enkelt

Som en billedhugger, der ser en figur i en grov stenblok og hugger lidt væk ad gangen, til kun figuren er tilbage.

I praksis

En historielærer i en folkeskole skriver “et vikingemarked i Ribe set fra oven om vinteren”, og på få sekunder giver en diffusionsmodel hende fire billeder at vælge imellem til undervisningen.

Hvorfor det betyder noget

Den har gjort realistiske billeder og video billige for alle at skabe, hvilket hjælper design og undervisning, men også giver næring til falske beviser og deepfakes.

Teknisk uddybning

En denoising diffusion probabilistic model (DDPM; Ho, Jain og Abbeel, 2020, med afsæt i Sohl-Dickstein m.fl., 2015) definerer en fast fremadrettet Markov-kæde, der lægger gaussisk støj til over T trin: q(x_t | x_{t−1}) = N(√(1 − β_t) x_{t−1}, β_t I). Fordi gaussiske fordelinger kan sammensættes, kan ethvert trin samples direkte som x_t = √ᾱ_t x_0 + √(1 − ᾱ_t) ε, hvor ᾱ_t er det løbende produkt af (1 − β_t), og ε er standardnormalfordelt støj. DDPM-artiklen brugte T = 1000 med β stigende lineært fra 10⁻⁴ til 0,02. Et netværk ε_θ(x_t, t) trænes til at forudsige den tilføjede støj med en simpel kvadratisk fejl, ‖ε − ε_θ(x_t, t)‖², hvilket svarer til en omvægtet variationsgrænse og, som Song m.fl. (2021) viste, til at lære scoren (gradienten af log-tætheden) for de støjede data. Sampling kører kæden baglæns fra ren støj, hvor hvert trin trækker forudsagt støj fra og lægger lidt ny støj til.

Praktiske systemer har ændret næsten alle dele. DDIM (Song, Meng og Ermon, 2020) gav en deterministisk sampler, der springer trin over og skærer 1.000 trin ned til nogle få dusin; senere ODE-løsere og destillation (fx consistency models) når ned på ét til fire trin. Classifier-free guidance (Ho og Salimans) træner netværket både med og uden betingelsen og ekstrapolerer ved sampling, ε̃ = ε(x, ∅) + w · (ε(x, c) − ε(x, ∅)); en guidance-skala w over 1 giver tættere overensstemmelse med prompten på bekostning af variation og ved høje værdier overmættede billeder. Latent diffusion (Rombach m.fl., 2022), grundlaget for Stable Diffusion, kører processen i det latente rum hos en variational autoencoder, der nedsampler billeder med en faktor 8 pr. side, med en U-Net-støjfjerner, der læser tekstprompten via cross-attention til embeddings fra en tekst-encoder; nyere modeller erstatter U-Net med en transformer (DiT) og bruger ofte de nært beslægtede træningsmål flow matching eller rectified flow.

Forskellen fra autoregressive sprogmodeller ligger i, hvordan outputtet dannes: En diffusionsmodel forfiner alle pixels, lydsamples eller videobilleder samlet over mange trin, så prisen følger antallet af støjfjerningstrin frem for outputlængden, og redigering som inpainting følger naturligt af, at en del af inputtet holdes fast. Diffusion er også afprøvet på tekst, men dér dominerer autoregressive decodere stadig.

Kendte problemer er memorering (Carlini m.fl., 2023 udtrak næsten-kopier af træningsbilleder fra Stable Diffusion), svag gengivelse af tekst, antal og rumlige forhold samt nedarvet bias fra træningsdata skrabet fra nettet. Til proveniens kan output mærkes med C2PA-indholdslegitimationer (content credentials) eller usynlige vandmærker, og AI-forordningens art. 50, stk. 2, kræver, at udbydere af systemer, der genererer syntetiske billeder, lyd, video eller tekst, mærker outputtet i et maskinlæsbart og detekterbart format; vandmærker kan dog ofte fjernes ved beskæring, genkodning eller regenerering.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Neuralt netværk
  2. →Deep learning
  3. →Diffusionsmodel

Relationer

En slags
Generativ AI
Forudsætter
Deep learning
Forveksl ikke med
Stor sprogmodel (LLM)

Kilder og videre læsning

Opslagsværker

  • Ho, Jain & Abbeel (2020), Denoising Diffusion Probabilistic Models
  • Sohl-Dickstein et al. (2015), Deep Unsupervised Learning using Nonequilibrium Thermodynamics

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.