Gå til indhold
atlas

Benchmark

Også kendt som: benchmark-suite, benchmarkdatasæt

Et fælles, offentligt sæt opgaver med en fast måde at give point på, så forskellige modeller kan sammenlignes på lige vilkår.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En offentliggjort samling opgaver med kendte rigtige svar og en fast pointmetode, som bruges på tværs af laboratorier til at rangere modeller; kendte eksempler tester bred skoleviden eller evnen til at rette rigtige fejl i kode.

Forklaret enkelt

Som en fast forhindringsbane, som alle atleter løber, med de samme forhindringer og det samme ur, så deres tider kan stilles op ved siden af hinanden.

I praksis

En IT-arkitekt i et ministerium sammenligner fem store sprogmodeller ud fra deres offentliggjorte benchmarkresultater, udvælger to og tester dem derefter på 300 rigtige spørgsmål fra ministeriets egne medarbejdere, før der vælges.

Hvorfor det betyder noget

Benchmarks styrer, hvordan modeller sælges og rangeres, men en model kan tunes til spørgsmålene eller have set dem i sine træningsdata, så en høj score beviser ikke, at den klarer sig godt i jeres arbejde.

Teknisk uddybning

Et benchmark fastlægger tre ting: et datasæt af opgaver, en protokol for, hvordan de præsenteres for modellen (promptskabelon, antal few-shot-eksempler, dekodningsindstillinger, tilladte værktøjer), og en scoringsfunktion. Klassiske eksempler viser spændvidden: MMLU (Hendrycks m.fl., 2021) er multiple choice inden for 57 fag og scores med nøjagtighed; HumanEval (Chen m.fl., 2021) har 164 håndskrevne Python-opgaver, der scores med pass@k mod unittests; SWE-bench (Jimenez m.fl., 2023) rummer 2.294 rigtige GitHub-issues fra 12 Python-repositories og bedømmes på, om modellens patch får repositoriets tests til at bestå, og SWE-bench Verified er en delmængde på 500 opgaver, som menneskelige udviklere har gennemgået, fordi nogle af de oprindelige var underspecificerede eller havde urimelige tests. Chatbot Arena rangerer i stedet modeller ud fra crowdsourcede parvise stemmer, der tilpasses med en Bradley-Terry-model.

Protokollen betyder lige så meget som data. Ændrer man promptformatet, antallet af eksempler, om svaret scores på det genererede bogstav eller på log-sandsynligheden for hver mulighed, eller versionen af evalueringsværktøjet, kan scoren flytte sig flere point, så tal fra forskellige modelkort ofte ikke kan sammenlignes. HELM (Liang m.fl., 2022) blev bl.a. lavet for at løse det ved at køre mange modeller under én standardiseret protokol og rapportere flere mål pr. scenarie (nøjagtighed, kalibrering, robusthed, fairness, effektivitet) i stedet for ét tal.

Benchmarks forældes. Mætning opstår, når de bedste modeller nærmer sig loftet, som GLUE gjorde kort efter lanceringen i 2018, hvilket førte til SuperGLUE i 2019. Kontaminering opstår, fordi offentlige testopgaver skrabes med i fortræningsdata; modtræk er n-gram-overlapstjek, unikke canary strings i benchmarkfilerne, så deres tilstedeværelse i et korpus kan opdages og filtreres fra, private tilbageholdte splits og løbende fornyede opgavepuljer. Adaptiv overtilpasning opstår, når et helt forskningsfelt tuner mod det samme offentlige testsæt: Recht m.fl. (2019) genopbyggede testsættene til CIFAR-10 og ImageNet efter de oprindelige procedurer og så fald i nøjagtighed på 3-15 % og 11-14 %, selv om modellernes indbyrdes rangorden stort set holdt. Fejl i labels kommer oveni: Northcutt m.fl. (2021) anslog i gennemsnit mindst 3,3 % forkerte labels på tværs af ti udbredte testsæt.

I praksis er en benchmarkscore et udgangspunkt, ikke en dom. Den indsnævrer feltet, hvorefter en opgavespecifik evaluering på egne data, med organisationens egne prompts, kontekst og fejlomkostninger, afgør valget. Et benchmark adskiller sig fra et privat testsæt ved at være offentligt og fælles, hvilket giver sammenlignelighed på bekostning af lækage, og fra LLM som dommer ved at have referencesvar eller eksekverbare tjek i stedet for en models vurdering.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Træningsdata
  2. →Modeltræning
  3. →Testsæt
  4. →Benchmark

Relationer

Forudsætter
Testsæt
Bruges sammen med
Modelkort (model card)

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.