Gå til indhold
atlas

Nøjagtighed (accuracy)

Også kendt som: accuracy, træfsikkerhed

Andelen af alle tilfælde, en model rammer rigtigt - let at læse, men den kan se flot ud, når det, man leder efter, er sjældent.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

I klassifikation antallet af rigtige svar delt med det samlede antal tilfælde; i en forvekslingsmatrix er det summen af de felter, hvor svaret og den sande klasse stemmer overens, delt med summen af alle felter.

Forklaret enkelt

Som en vejrudsigt i ørkenen, der siger “ingen regn” hver eneste dag - rigtig næsten hver gang og ubrugelig den ene dag, det styrter ned.

I praksis

En dataanalytiker i et rederi tester en model, der skal varsle om motorfejl; den får 99,5 % nøjagtighed, men har aldrig givet en eneste advarsel, fordi der kun opstår fejl på én ud af 200 sejladser.

Hvorfor det betyder noget

Det er det tal, de fleste nævner først, så teams må tjekke, om klasserne er i balance, før de stoler på det, og bruge præcision, genkaldelse eller F1-score, når de ikke er.

Teknisk uddybning

For en binær klassifikator er nøjagtighed = (TP + TN) / (TP + TN + FP + FN); med k klasser er det sporet af den k × k store forvekslingsmatrix delt med det samlede antal, altså præcis 1 minus det empiriske 0-1-tab. Varianter ændrer, hvad der tæller som rigtigt: top-k-nøjagtighed (kendt fra ImageNets top-5-mål) godkender svaret, hvis den sande klasse er blandt de k højest scorede, og ved multilabel-klassifikation beregner scikit-learns accuracy_score subset accuracy, hvor et eksempel kun tæller, hvis alle dets labels er rigtige - et langt strengere tal end nøjagtighed pr. label.

Den mest kendte faldgrube er nøjagtighedsparadokset. Med en andel p positive giver en konstant klassifikator, der altid svarer majoritetsklassen, 1 − p, så 99 % nøjagtighed er værdiløs ved 1 % forekomst. Nøjagtighed bør derfor altid rapporteres sammen med majoritetsbaselinen. Mål, der tåler ubalance, er bl.a. balanced accuracy (gennemsnittet af genkaldelsen pr. klasse, (TPR + TNR) / 2 i det binære tilfælde), Cohens kappa, der trækker den tilfældige enighed fra, og Matthews-korrelationskoefficienten (MCC), som bruger alle fire felter og kun bliver høj, når begge klasser forudsiges godt.

Nøjagtighed afhænger også af tærsklen. De fleste modeller giver scorer eller sandsynligheder, og nøjagtigheden måles først efter en beslutningstærskel, ofte 0,5 som biblioteksstandard. Den er ikke en proper scoring rule: den ignorerer, hvor sikker modellen var, så to modeller med samme nøjagtighed kan være meget forskelligt kalibrerede, hvilket log loss eller Brier-score afslører. Den behandler også alle fejl som lige dyre, hvad de sjældent er, når et overset svindelforsøg og en blokeret lovlig betaling koster vidt forskelligt.

Som et estimat fra et endeligt testsæt har tallet stikprøveusikkerhed: standardfejlen er omtrent √(a(1 − a)/n), så 90 % målt på 1.000 tilfælde har et 95 %-interval på cirka ±1,9 procentpoint. Forskelle mellem to modeller på de samme testtilfælde bør afgøres med en parret test som McNemars test og ikke med øjemål. Bemærk navnesammenstødet med metrologien, hvor ISO 5725-1 definerer accuracy som korrekthed (trueness) plus præcision, og med EU's AI-forordning, hvis art. 15 bruger begrebet bredt og kræver, at højrisikosystemers niveauer og "relevante nøjagtighedsmål" angives i brugsanvisningen (art. 15, stk. 3). ISO/IEC TS 4213:2022 beskriver en metode til at vurdere klassifikationsydelse, herunder valget af sådanne mål.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Klassifikation
  2. →Label (mærkat)
  3. →Træningsdata
  4. →Superviseret læring
  5. →Forvekslingsmatrix (confusion matrix)
  6. →Nøjagtighed (accuracy)

Relationer

Forveksl ikke med
F1-score

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Nævnt i

Test dig selv

Indlæser…

Atlas er i beta.