Evaluering og målinger
Praksis med at kontrollere, hvor godt et AI-system løser sin opgave - med tal, offentlige tests, menneskelig gennemgang og bevidste angreb.
Formelt
Den planlagte måling af en model eller et AI-system op imod mål for kvalitet, sikkerhed og retfærdighed, som kombinerer tal som nøjagtighed og F1-score, benchmarkresultater, menneskelig gennemgang, LLM som dommer og AI red teaming.
Forklaret enkelt
Som en bils prøvekørsler før salg - fartløb på banen, kollisionsforsøg, førernes meninger og folk, der gør alt for at få den til at svigte.
I praksis
Før lejerchatten flyttes til en nyere stor sprogmodel, kører et boligselskabs IT-ansvarlige 500 gemte spørgsmål fra lejere igen, lader medarbejdere bedømme et udvalg af svarene og skifter kun, hvis intet bliver dårligere.
Hvorfor det betyder noget
Uden faste kontroller ved ingen, om en ændring gjorde systemet bedre, dårligere eller usikkert, og EU's AI-forordning kræver dokumenteret test af systemer, der bruges til fx ansættelse, kreditvurdering eller afgørelser om sociale ydelser.