Mixture of experts (MoE)
Også kendt som: MoE
En måde at bygge en meget stor model på, hvor kun få af dens mange dele arbejder for hvert token, så svar koster langt mindre.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
Et neuralt netværk delt i mange parallelle delnetværk (“eksperter”) plus en lille vælger, der sender hvert token til kun nogle få af dem; idéen er fra 1991, og den moderne storskala-form fra 2017.
Forklaret enkelt
Som et hospital fuldt af specialister, hvor skranken sender hver patient til de to læger, der passer bedst, i stedet for at alle læger ser alle patienter.
I praksis
En IT-arkitekt i et ministerium sammenligner to modeller af samme samlede størrelse; den med mixture of experts svarer flere gange hurtigere, men kræver lige så mange GPU'er, fordi alle eksperter skal ligge i hukommelsen.
Hvorfor det betyder noget
Den lader udviklere tilføje viden, uden at driftsprisen vokser i samme takt, og derfor bruger mange af nutidens største modeller den; regningen for hukommelse forbliver dog stor.
Teknisk uddybning
I et sparse MoE-lag scorer en router, som regel én lineær projektion W_g, hvert tokens skjulte tilstand x mod N eksperter; de k højeste scorer beholdes og normaliseres igen med softmax, og lagets output er y = Σ g_i(x) · E_i(x) over kun de valgte eksperter. I transformer-sprogmodeller er eksperterne kopier af feed-forward-dellaget (MLP), mens attention forbliver tæt og fælles. Routingen afgøres uafhængigt for hvert token og hvert lag, så en enkelt sætning passerer gennem mange forskellige kombinationer af eksperter. Den oprindelige idé (Jacobs, Jordan, Nowlan og Hinton, 1991) brugte et gating-netværk til at blande nogle få hele modeller; Shazeer m.fl. (2017) gjorde det sparsomt og betinget med noisy top-k gating mellem LSTM-lag og nåede 137 milliarder parametre.
Det største ingeniørproblem er lastbalancering. Uden et modtryk kollapser routeren ned på nogle få eksperter, som så får hele træningssignalet. GShard (Lepikhin m.fl., 2020) brugte top-2-routing med et ekstra balanceringstab; Switch Transformer (Fedus, Zoph og Shazeer, 2022) forenklede til top-1-routing, definerede en ekspertkapacitet (tokens pr. ekspert pr. batch, skaleret med en capacity factor), ud over hvilken tokens droppes og kun føres videre via residualforbindelsen, og trænede modeller på op til 1,6 billioner parametre. ST-MoE tilføjede et router z-loss for numerisk stabilitet. Nyere designs bruger mange små, finkornede eksperter plus en eller flere altid aktive fælles eksperter, og DeepSeek-V3 (671 milliarder parametre i alt, omkring 37 milliarder aktiveret pr. token) balancerer lasten med et bias-led pr. ekspert i stedet for et stort ekstra tab.
Regnskabet skelner mellem samlede og aktive parametre. Mixtral 8x7B har 8 eksperter pr. lag med top-2-routing, 46,7 milliarder parametre i alt og 12,9 milliarder brugt pr. token; beregningen pr. token ligner en tæt model på 13 milliarder, men ved 16-bit-præcision kræver alle vægte stadig omkring 94 GB acceleratorhukommelse. Ved små batchstørrelser er decoding begrænset af hukommelsesbåndbredden, og kun de aktive eksperter læses, så MoE er hurtig; ved store batches rammer forskellige tokens forskellige eksperter, de fleste vægte læses alligevel, og fordelen skrumper. På tværs af mange enheder placerer ekspertparallelisme eksperterne på forskellige GPU'er og kræver all-to-all-kommunikation af tokens i hvert MoE-lag, hvilket gør båndbredden i forbindelserne mellem dem til en flaskehals.
En udbredt misforståelse er, at eksperterne er faglige specialister, én til jura og én til medicin. Analyser som Mixtral-artiklen fandt kun ringe specialisering på domæneniveau; routingen hænger mere sammen med tokentyper og syntaks. MoE-modeller er også rapporteret at være sværere at finjustere stabilt og mere tilbøjelige til overfitting på små datasæt end tætte modeller af tilsvarende aktiv størrelse, og routing tilføjer en kilde til ikke-determinisme, når kapacitetsgrænser dropper tokens afhængigt af, hvad der ellers er i batchen.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Træningsdata
- →Maskinlæring
- →Modelparameter
- →Mixture of experts (MoE)
Relationer
- En slags
- Neuralt netværk
- Forudsætter
- Modelparameter
- Bruges sammen med
- TransformerModelservering (model serving)Inferens
Kilder og videre læsning
Opslagsværker
- Jacobs, Jordan, Nowlan & Hinton (1991), Adaptive Mixtures of Local Experts
- Shazeer et al. (2017), Outrageously Large Neural Networks - The Sparsely-Gated Mixture-of-Experts Layer
- Fedus, Zoph & Shazeer (2022), Switch Transformers
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…