Low-rank adaptation (LoRA)
Også kendt som: LoRA-adapter
En billig måde at finjustere en stor model på - frys de oprindelige vægte og træn kun en lille adapter, der justerer dens adfærd.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En finjusteringsmetode, der holder modelvægtene faste og for udvalgte lag lærer et par små ekstra vægttabeller, hvis produkt lægges til de oprindelige; kun en lille del af modelparametrene trænes, og adapteren kan gemmes og udskiftes for sig.
Forklaret enkelt
Som at klipse en tynd linse på et kamera i stedet for at bygge det om - kameraet er det samme, billederne ændrer sig, og man kan skifte linse på sekunder.
I praksis
En udvikler i et revisionsfirma tilpasser en åben model til firmaets standardrapporter på en enkelt lejet GPU; resultatet er en lille adapterfil, der indlæses oven på den urørte basismodel.
Hvorfor det betyder noget
Det gør finjustering mulig for små teams, men adapterfiler delt online er en ny, let overset ting at tjekke, fordi én lille fil stille og roligt kan ændre, hvordan en betroet model opfører sig.
Teknisk uddybning
For en frossen vægtmatrix W₀ ∈ ℝ^(d×k) lærer LoRA en opdatering ΔW = BA med B ∈ ℝ^(d×r), A ∈ ℝ^(r×k) og rang r ≪ min(d, k), så laget beregner h = W₀x + (α/r)·BAx. A initialiseres tilfældigt og B med nuller, så træningen starter præcis i den fortrænede model. Besparelsen i parametre er stor: for en projektion på 4096 × 4096 giver r = 8 i alt 8 × (4096 + 4096) = 65.536 trænbare værdier i stedet for cirka 16,8 millioner, omtrent 0,4 %. Gradienter og optimeringstilstand er kun nødvendige for A og B, og det er dér, det meste af hukommelsesbesparelsen kommer fra; den frosne basismodel skal stadig ligge i hukommelsen til det forlæns og baglæns pass.
Hu m.fl. (2021) anvendte LoRA på attention-lagenes query- og value-projektioner i GPT-3 175B og rapporterede omkring 10.000 gange færre trænbare parametre og en tredobbelt reduktion i GPU-hukommelse sammenlignet med fuld finjustering, med tilsvarende kvalitet. Fordi BA har samme form som W₀, kan den efter træningen lægges ind i basisvægtene uden ekstra latenstid ved inferens; alternativt holdes adapterne adskilt, så mange opgavespecifikke adaptere kan dele én basismodel, hvilket serving-systemer udnytter ved at batche forespørgsler til forskellige adaptere sammen. Metoden bygger på observationen, at finjusteringsopdateringer har lav indre rang. Nuværende praksis rammer ofte alle lineære lag med rang fra cirka 4 til 64 via biblioteker som Hugging Face PEFT.
QLoRA (Dettmers m.fl., 2023) træner LoRA-adaptere oven på en basismodel kvantiseret til 4-bit NormalFloat og tilføjer dobbelt kvantisering af kvantiseringskonstanterne samt paged optimeringstilstand, hvilket gjorde det muligt at finjustere en model med 65 milliarder parametre på én GPU med 48 GB. Andre varianter er DoRA, der adskiller størrelse og retning i vægtopdateringen, og rank-stabilised LoRA, der skalerer med α/√r i stedet for α/r, så højere rang forbliver effektiv.
LoRA er ikke en gratis erstatning for fuld finjustering. Biderman m.fl. (2024) fandt, at den ved fortsat træning på kode og matematik klarer sig markant dårligere end fuld finjustering, hvis vægtopdateringer havde 10-100 gange højere rang end typiske LoRA-indstillinger, men at den også glemmer mindre af basismodellens øvrige evner. En adapter er bundet til præcis det basis-checkpoint, den er trænet på; indlæses den på en anden version eller kvantisering, ændres adfærden stille. Adaptere er også en del af leverandørkæden: OWASP Top 10 for LLM Applications 2025 (LLM03) advarer om, at en ondsindet LoRA-adapter kan kompromittere integriteten af en betroet basismodel, og forskning har vist, at LoRA-finjustering billigt kan fjerne sikkerhedstræning fra aligned modeller, så adaptere fra tredjepart kræver kontrol af oprindelse og evaluering før brug.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Træningsdata
- →Modeltræning
- →Modelvægte (weights)
- →Low-rank adaptation (LoRA)
Relationer
- En slags
- Finjustering (fine-tuning)
- Forudsætter
- Modelvægte (weights)
- Bruges sammen med
- Kvantisering
Kilder og videre læsning
Opslagsværker
- Hu et al. (2021), LoRA - Low-Rank Adaptation of Large Language Models
- Biderman et al. (2024), LoRA Learns Less and Forgets Less · arXiv
- OWASP Top 10 for LLM Applications 2025 - LLM03:2025 Supply Chain · OWASP
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Nævnt i
Test dig selv
Indlæser…