Benchmark
Også kendt som: benchmark-suite, benchmarkdatasæt
Et fælles, offentligt sæt opgaver med en fast måde at give point på, så forskellige modeller kan sammenlignes på lige vilkår.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En offentliggjort samling opgaver med kendte rigtige svar og en fast pointmetode, som bruges på tværs af laboratorier til at rangere modeller; kendte eksempler tester bred skoleviden eller evnen til at rette rigtige fejl i kode.
Forklaret enkelt
Som en fast forhindringsbane, som alle atleter løber, med de samme forhindringer og det samme ur, så deres tider kan stilles op ved siden af hinanden.
I praksis
En IT-arkitekt i et ministerium sammenligner fem store sprogmodeller ud fra deres offentliggjorte benchmarkresultater, udvælger to og tester dem derefter på 300 rigtige spørgsmål fra ministeriets egne medarbejdere, før der vælges.
Hvorfor det betyder noget
Benchmarks styrer, hvordan modeller sælges og rangeres, men en model kan tunes til spørgsmålene eller have set dem i sine træningsdata, så en høj score beviser ikke, at den klarer sig godt i jeres arbejde.
Teknisk uddybning
Et benchmark fastlægger tre ting: et datasæt af opgaver, en protokol for, hvordan de præsenteres for modellen (promptskabelon, antal few-shot-eksempler, dekodningsindstillinger, tilladte værktøjer), og en scoringsfunktion. Klassiske eksempler viser spændvidden: MMLU (Hendrycks m.fl., 2021) er multiple choice inden for 57 fag og scores med nøjagtighed; HumanEval (Chen m.fl., 2021) har 164 håndskrevne Python-opgaver, der scores med pass@k mod unittests; SWE-bench (Jimenez m.fl., 2023) rummer 2.294 rigtige GitHub-issues fra 12 Python-repositories og bedømmes på, om modellens patch får repositoriets tests til at bestå, og SWE-bench Verified er en delmængde på 500 opgaver, som menneskelige udviklere har gennemgået, fordi nogle af de oprindelige var underspecificerede eller havde urimelige tests. Chatbot Arena rangerer i stedet modeller ud fra crowdsourcede parvise stemmer, der tilpasses med en Bradley-Terry-model.
Protokollen betyder lige så meget som data. Ændrer man promptformatet, antallet af eksempler, om svaret scores på det genererede bogstav eller på log-sandsynligheden for hver mulighed, eller versionen af evalueringsværktøjet, kan scoren flytte sig flere point, så tal fra forskellige modelkort ofte ikke kan sammenlignes. HELM (Liang m.fl., 2022) blev bl.a. lavet for at løse det ved at køre mange modeller under én standardiseret protokol og rapportere flere mål pr. scenarie (nøjagtighed, kalibrering, robusthed, fairness, effektivitet) i stedet for ét tal.
Benchmarks forældes. Mætning opstår, når de bedste modeller nærmer sig loftet, som GLUE gjorde kort efter lanceringen i 2018, hvilket førte til SuperGLUE i 2019. Kontaminering opstår, fordi offentlige testopgaver skrabes med i fortræningsdata; modtræk er n-gram-overlapstjek, unikke canary strings i benchmarkfilerne, så deres tilstedeværelse i et korpus kan opdages og filtreres fra, private tilbageholdte splits og løbende fornyede opgavepuljer. Adaptiv overtilpasning opstår, når et helt forskningsfelt tuner mod det samme offentlige testsæt: Recht m.fl. (2019) genopbyggede testsættene til CIFAR-10 og ImageNet efter de oprindelige procedurer og så fald i nøjagtighed på 3-15 % og 11-14 %, selv om modellernes indbyrdes rangorden stort set holdt. Fejl i labels kommer oveni: Northcutt m.fl. (2021) anslog i gennemsnit mindst 3,3 % forkerte labels på tværs af ti udbredte testsæt.
I praksis er en benchmarkscore et udgangspunkt, ikke en dom. Den indsnævrer feltet, hvorefter en opgavespecifik evaluering på egne data, med organisationens egne prompts, kontekst og fejlomkostninger, afgør valget. Et benchmark adskiller sig fra et privat testsæt ved at være offentligt og fælles, hvilket giver sammenlignelighed på bekostning af lækage, og fra LLM som dommer ved at have referencesvar eller eksekverbare tjek i stedet for en models vurdering.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Træningsdata
- →Modeltræning
- →Testsæt
- →Benchmark
Relationer
- Del af
- Modelevaluering (evals)
- Forudsætter
- Testsæt
- Forveksl ikke med
- LLM som dommer (LLM-as-a-judge)
- Bruges sammen med
- Modelkort (model card)
Kilder og videre læsning
Standarder og officielle tekster
Opslagsværker
- Hendrycks et al. (2021), Measuring Massive Multitask Language Understanding · ICLR 2021
- Liang et al. (2022), Holistic Evaluation of Language Models · Stanford CRFM
- Recht et al. (2019), Do ImageNet Classifiers Generalize to ImageNet? · ICML 2019 (PMLR 97)
- Northcutt, Athalye & Mueller (2021), Pervasive Label Errors in Test Sets Destabilize Machine Learning Benchmarks · NeurIPS 2021 Datasets and Benchmarks
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…