Gå til indhold
atlas

Instruktionstilpasning (instruction tuning)

Også kendt som: instruction tuning, SFT

Ekstra træning på skrevne forespørgsler med gode svar, som gør en basismodel, der blot fortsætter tekst, til en, der følger ordrer.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En form for finjustering, hvor en fortrænet sprogmodel trænes på sæt af instruktioner og eksempelsvar, så den besvarer en forespørgsel i stedet for blot at fortsætte den tekst, den fik.

Forklaret enkelt

Som en ny medarbejder, der har læst meget, men gennem mange eksempler må have vist, hvordan kontoret forventer, at en opgave løses.

I praksis

En kundeservicechef i en dansk webshop tester en åben model med “Skriv et høfligt svar, der afviser at give pengene tilbage”; basisversionen skriver bare flere kundeklager, mens den version, der har fået instruktionstilpasning, skriver svaret.

Hvorfor det betyder noget

Det er det, der gør en rå model brugbar som assistent, og de eksempelsvar, der vælges her, former dens tone, dens afvisninger og meget af dens sikkerhed.

Teknisk uddybning

Mekanisk er instruktionstilpasning superviseret finjustering med samme krydsentropimål for næste token som i fortræningen, anvendt på kuraterede eksempler af formen instruktion (plus eventuelt input) → ønsket svar eller på samtaler over flere ture. Samtaler serialiseres med en chatskabelon, der markerer roller med særlige tokens (ChatML's <|im_start|> og <|im_end|> er et udbredt eksempel), og tabet beregnes som regel kun på assistentens tokens; i Hugging Face-kode får promptpositionerne labelen −100, så de ignoreres. Læringsraterne er langt mindre end i fortræningen, og en til få epoker er typisk. En model skal efterfølgende promptes med præcis den skabelon, den er tilpasset med, fordi en afvigende skabelon målbart forringer output.

Teknikken tog form i 2021. FLAN (Wei m.fl.) tog en fortrænet model med 137 milliarder parametre, omformulerede mere end 60 NLP-datasæt til instruktionsskabeloner i naturligt sprog og viste, at den tilpassede model slog zero-shot GPT-3 175B på 20 af 25 evaluerede datasæt, med gevinster der voksede med modelstørrelsen og antallet af opgaveklynger. T0 (Sanh m.fl., 2021) kom til lignende konklusioner, og Flan-samlingen fra 2022 skalerede op til 1.836 opgaver. InstructGPT (Ouyang m.fl., 2022) brugte omkring 13.000 træningsprompts med menneskeskrevne eksempelsvar som det supervisede trin før RLHF. Billigere opskrifter fulgte: Self-Instruct genererede instruktioner ud fra en models egne output, Stanford Alpaca brugte 52.000 eksempler genereret af en OpenAI-model, og LIMA (Zhou m.fl., 2023) rapporterede stærke resultater med kun 1.000 omhyggeligt udvalgte eksempler, hvilket understøtter synspunktet om, at tilpasningen mest lærer format og stil, mens viden kommer fra fortræningen.

Det synspunkt har praktiske konsekvenser. Instruktionsdata, der lærer modellen fakta, som basismodellen ikke kender, læres langsomt og er blevet forbundet med flere hallucinationer (Gekhman m.fl., 2024), så domæneviden tilføres ofte bedre via fortsat fortræning eller retrieval. Kraftig tilpasning til et snævert domæne giver katastrofal glemsel af generelle evner, hvilket opskrifter modvirker ved at blande generelle instruktionsdata ind. At destillere svar fra en stærkere proprietær model kan være i strid med udbyderens brugsvilkår.

Instruktionstilpasning er også der, hvor meget af sikkerhedsadfærden fastlægges, og den er skrøbelig. Qi m.fl. (2023) viste, at finjustering af en aligned model på så få som ti bevidst designede eksempler i vid udstrækning kunne fjerne dens afvisninger, og at selv harmløse finjusteringsdata svækkede sikkerheden noget. Videre finjustering af en aligned model kræver derfor sin egen sikkerhedsevaluering. I standardforløbet følges instruktionstilpasning af præferenceoptimering som RLHF eller DPO, der bruger sammenligninger mellem svar i stedet for enkelte referencesvar.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Token
  2. →Træningsdata
  3. →Selvsuperviseret læring
  4. →Transformer
  5. →Stor sprogmodel (LLM)
  6. →Fortræning (pretraining)
  7. →Instruktionstilpasning (instruction tuning)

Relationer

Forveksl ikke med
Fortræning (pretraining)

Kilder og videre læsning

Opslagsværker

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.