Diffusionsmodel
Også kendt som: støjfjernende diffusionsmodel
Den slags generativ AI bag mange billedgeneratorer, der starter fra tilfældig sne og renser den trin for trin til et billede.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En deep learning-model, der er lært at fortryde en proces, som langsomt lægger tilfældig sne over rigtige eksempler; for at skabe noget nyt starter den med ren sne og fjerner lidt i hvert af mange trin, styret af en prompt.
Forklaret enkelt
Som en billedhugger, der ser en figur i en grov stenblok og hugger lidt væk ad gangen, til kun figuren er tilbage.
I praksis
En historielærer i en folkeskole skriver “et vikingemarked i Ribe set fra oven om vinteren”, og på få sekunder giver en diffusionsmodel hende fire billeder at vælge imellem til undervisningen.
Hvorfor det betyder noget
Den har gjort realistiske billeder og video billige for alle at skabe, hvilket hjælper design og undervisning, men også giver næring til falske beviser og deepfakes.
Teknisk uddybning
En denoising diffusion probabilistic model (DDPM; Ho, Jain og Abbeel, 2020, med afsæt i Sohl-Dickstein m.fl., 2015) definerer en fast fremadrettet Markov-kæde, der lægger gaussisk støj til over T trin: q(x_t | x_{t−1}) = N(√(1 − β_t) x_{t−1}, β_t I). Fordi gaussiske fordelinger kan sammensættes, kan ethvert trin samples direkte som x_t = √ᾱ_t x_0 + √(1 − ᾱ_t) ε, hvor ᾱ_t er det løbende produkt af (1 − β_t), og ε er standardnormalfordelt støj. DDPM-artiklen brugte T = 1000 med β stigende lineært fra 10⁻⁴ til 0,02. Et netværk ε_θ(x_t, t) trænes til at forudsige den tilføjede støj med en simpel kvadratisk fejl, ‖ε − ε_θ(x_t, t)‖², hvilket svarer til en omvægtet variationsgrænse og, som Song m.fl. (2021) viste, til at lære scoren (gradienten af log-tætheden) for de støjede data. Sampling kører kæden baglæns fra ren støj, hvor hvert trin trækker forudsagt støj fra og lægger lidt ny støj til.
Praktiske systemer har ændret næsten alle dele. DDIM (Song, Meng og Ermon, 2020) gav en deterministisk sampler, der springer trin over og skærer 1.000 trin ned til nogle få dusin; senere ODE-løsere og destillation (fx consistency models) når ned på ét til fire trin. Classifier-free guidance (Ho og Salimans) træner netværket både med og uden betingelsen og ekstrapolerer ved sampling, ε̃ = ε(x, ∅) + w · (ε(x, c) − ε(x, ∅)); en guidance-skala w over 1 giver tættere overensstemmelse med prompten på bekostning af variation og ved høje værdier overmættede billeder. Latent diffusion (Rombach m.fl., 2022), grundlaget for Stable Diffusion, kører processen i det latente rum hos en variational autoencoder, der nedsampler billeder med en faktor 8 pr. side, med en U-Net-støjfjerner, der læser tekstprompten via cross-attention til embeddings fra en tekst-encoder; nyere modeller erstatter U-Net med en transformer (DiT) og bruger ofte de nært beslægtede træningsmål flow matching eller rectified flow.
Forskellen fra autoregressive sprogmodeller ligger i, hvordan outputtet dannes: En diffusionsmodel forfiner alle pixels, lydsamples eller videobilleder samlet over mange trin, så prisen følger antallet af støjfjerningstrin frem for outputlængden, og redigering som inpainting følger naturligt af, at en del af inputtet holdes fast. Diffusion er også afprøvet på tekst, men dér dominerer autoregressive decodere stadig.
Kendte problemer er memorering (Carlini m.fl., 2023 udtrak næsten-kopier af træningsbilleder fra Stable Diffusion), svag gengivelse af tekst, antal og rumlige forhold samt nedarvet bias fra træningsdata skrabet fra nettet. Til proveniens kan output mærkes med C2PA-indholdslegitimationer (content credentials) eller usynlige vandmærker, og AI-forordningens art. 50, stk. 2, kræver, at udbydere af systemer, der genererer syntetiske billeder, lyd, video eller tekst, mærker outputtet i et maskinlæsbart og detekterbart format; vandmærker kan dog ofte fjernes ved beskæring, genkodning eller regenerering.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Neuralt netværk
- →Deep learning
- →Diffusionsmodel
Relationer
- En slags
- Generativ AI
- Forudsætter
- Deep learning
- Forveksl ikke med
- Stor sprogmodel (LLM)
- Bruges sammen med
- Syntetiske dataPromptGrafikprocessor (GPU)Deepfake
Kilder og videre læsning
Opslagsværker
- Ho, Jain & Abbeel (2020), Denoising Diffusion Probabilistic Models
- Sohl-Dickstein et al. (2015), Deep Unsupervised Learning using Nonequilibrium Thermodynamics
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…