Gå til indhold
atlas

Forveksl ikke disse

Benchmark vs. LLM som dommer (LLM-as-a-judge)

Hvorfor de er forskellige

Et benchmark tjekker svar mod faste rigtige svar; en LLM-dommer bedømmer åbne svar, hvor der ikke findes ét rigtigt.

Benchmark

Evaluering og målinger

Et fælles, offentligt sæt opgaver med en fast måde at give point på, så forskellige modeller kan sammenlignes på lige vilkår.

Formelt

En offentliggjort samling opgaver med kendte rigtige svar og en fast pointmetode, som bruges på tværs af laboratorier til at rangere modeller; kendte eksempler tester bred skoleviden eller evnen til at rette rigtige fejl i kode.

Forklaret enkelt

Som en fast forhindringsbane, som alle atleter løber, med de samme forhindringer og det samme ur, så deres tider kan stilles op ved siden af hinanden.

I praksis

En IT-arkitekt i et ministerium sammenligner fem store sprogmodeller ud fra deres offentliggjorte benchmarkresultater, udvælger to og tester dem derefter på 300 rigtige spørgsmål fra ministeriets egne medarbejdere, før der vælges.

Hvorfor det betyder noget

Benchmarks styrer, hvordan modeller sælges og rangeres, men en model kan tunes til spørgsmålene eller have set dem i sine træningsdata, så en høj score beviser ikke, at den klarer sig godt i jeres arbejde.

LLM som dommer (LLM-as-a-judge)

Evaluering og målinger

At lade én stor sprogmodel bedømme en andens svar efter en skriftlig bedømmelsesguide i stedet for at lade mennesker læse dem alle.

Formelt

En form for modelevaluering, hvor en stor sprogmodel får et spørgsmål, et eller flere svar og bedømmelsesinstruktioner og returnerer en score eller udpeger det bedste svar; den kontrolleres mod menneskelige bedømmelser for enighed.

Forklaret enkelt

Som et talentshow, hvor én erfaren dommer giver point til hvert indslag efter et trykt skema - hurtigt og for det meste retfærdigt, men dommeren har sine egne favoritter.

I praksis

En produktejer i en a-kasse ændrer medlemschattens systemprompt, lader en dommermodel sammenligne 1.000 gamle og nye svar side om side og læser kun selv de tilfælde, hvor dommeren er usikker.

Hvorfor det betyder noget

Det gør det billigt nok at kontrollere åbne svar ved hver ændring, men dommere foretrækker længere svar, det først viste svar og deres egen stil og kan narres af instruktioner skjult i et svar.

Fælles forbindelser

Atlas er i beta.