Gå til indhold
atlas

Hyperparameter

Også kendt som: træningsindstilling

En indstilling, et menneske vælger, før modeltræningen starter - fx skridtstørrelse eller antal runder - som modellen ikke selv lærer.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En værdi, der former, hvordan modeltræningen kører, eller hvor stor modellen er, og som fastsættes udefra i stedet for at læres fra træningsdata; den justeres ved at prøve værdier og sammenligne resultater på et valideringssæt.

Forklaret enkelt

Som ovnvarmen og bagetiden, du sætter, før kagen kommer ind - kagen vælger dem ikke, men de afgør, hvordan den bliver.

I praksis

En dataanalytiker i en kommune kører tyve korte træningsjob over natten på en model, der skal forudsige behovet for hjemmepleje, med hver sin skridtstørrelse og batchstørrelse, og beholder den kombination, der klarer sig bedst på tilbageholdte sager.

Hvorfor det betyder noget

Samme model og data kan give et stærkt eller ubrugeligt resultat afhængigt af disse indstillinger, og at afsøge dem ganger prisen for træningen op.

Teknisk uddybning

Hyperparametre falder i flere grupper. Optimeringshyperparametre omfatter læringsraten og dens plan (opvarmningslængde, nedtrapningsform), batchstørrelse, antal epoker eller skridt, momentum eller Adams β-værdier, weight decay og tærsklen for klipning af gradienter. Arkitekturhyperparametre fastlægger kapaciteten: antal lag, skjult bredde, attention-hoveder, dropout-rate og kontekstlængde. Valg på datasiden som augmenteringsstyrke eller blandingsvægte for fortræningskilder opfører sig på samme måde, og det gør metodespecifikke indstillinger som LoRA's rang r og skalering α eller KL-koefficienten i RLHF. Dekodningsindstillinger som temperatur og top-p kaldes nogle gange også hyperparametre, selv om de virker ved inferens og ikke ved træning. Grænsen til lærte parametre er et designvalg: en temperatur eller en regulariseringsvægt kan gøres lærbar, og så holder den op med at være en hyperparameter.

Ikke alle hyperparametre betyder lige meget, og læringsraten er som regel den mest følsomme (Goodfellow m.fl., §11.4). Grid search vokser eksponentielt med antallet af dimensioner og spilder forsøg på uvigtige dimensioner; Bergstra og Bengio (2012) viste, at tilfældig søgning netop derfor finder lige så gode eller bedre konfigurationer med langt færre forsøg. Hyperparametre af skala-typen bør afsøges på logaritmisk skala, fx læringsrater fra 10⁻⁵ til 10⁻¹. Bayesiansk optimering tilpasser en surrogatmodel af valideringsscore som funktion af konfigurationen - gaussiske processer (Snoek m.fl., 2012) eller den træstrukturerede Parzen-estimator, som Optuna bruger som standard - og vælger næste forsøg via en acquisition-funktion. Multi-fidelity-metoder som successive halving og Hyperband (Li m.fl., 2018) stopper tidligt de kørsler, der ikke ser lovende ud, og population-based training (Jaderberg m.fl., 2017) muterer hyperparametrene for kørende job.

Store modeller kan ikke tunes med rå kraft, når én kørsel kan koste millioner. Man tuner i stedet små stedfortrædermodeller og ekstrapolerer, enten via empiriske skaleringsfit for læringsrate og batchstørrelse eller via parametriseringer som μP (Yang m.fl., 2022), hvor de optimale hyperparametre forbliver omtrent stabile, når bredden vokser, så man kan "tune småt og overføre til stort".

Hyperparametersøgning er også en kilde til urimelige sammenligninger og skjult overtilpasning. Hver afprøvet konfiguration er et kig på valideringssættet, så den valgte score er for optimistisk, og det endelige tal skal komme fra et urørt testsæt eller fra nested krydsvalidering. Sammenligninger mellem metoder er kun fair ved samme tuningbudget; Melis m.fl. (2018) fandt, at omhyggeligt tunede LSTM-sprogmodeller slog flere nyere arkitekturer, der var blevet tilskrevet forbedringer. Tilfældighedsfrøet (seed) opfører sig som en skjult hyperparameter, så resultater bør rapporteres over flere seeds, og hver kørsels konfiguration bør logges af hensyn til reproducerbarhed.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Træningsdata
  2. →Modeltræning
  3. →Hyperparameter

Relationer

Forudsætter
Modeltræning
Åbner for
Valideringssæt
Forveksl ikke med
Modelparameter

Kilder og videre læsning

Opslagsværker

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Nævnt i

Test dig selv

Indlæser…

Atlas er i beta.