{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/accuracy","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/accuracy/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/accuracy/"},"term":{"en":"Accuracy","da":"Nøjagtighed (accuracy)"},"aka":{"en":["classification accuracy"],"da":["accuracy","træfsikkerhed"]},"domain":["ai"],"cluster":"evaluation","layer":"theory","status":"current","summary":{"en":"The share of all cases a model gets right; simple to read, but it can look excellent when the thing you care about is rare.","da":"Andelen af alle tilfælde, en model rammer rigtigt - let at læse, men den kan se flot ud, når det, man leder efter, er sjældent."},"body":{"formal":{"en":"In classification, the number of correct answers divided by the total number of cases; in a confusion matrix it is the sum of the cells where the answer and the true class agree, divided by the sum of all cells.","da":"I klassifikation antallet af rigtige svar delt med det samlede antal tilfælde; i en forvekslingsmatrix er det summen af de felter, hvor svaret og den sande klasse stemmer overens, delt med summen af alle felter."},"plain":{"en":"Like a weather forecaster in the desert who says “no rain” every single day and is right almost every time, yet useless on the one day it pours.","da":"Som en vejrudsigt i ørkenen, der siger “ingen regn” hver eneste dag - rigtig næsten hver gang og ubrugelig den ene dag, det styrter ned."},"inPractice":{"en":"A data analyst at a shipping company tests a model meant to warn of engine faults; it scores 99.5% accuracy, yet it has never raised a single warning, because faults occur on only one voyage in 200.","da":"En dataanalytiker i et rederi tester en model, der skal varsle om motorfejl; den får 99,5 % nøjagtighed, men har aldrig givet en eneste advarsel, fordi der kun opstår fejl på én ud af 200 sejladser."},"whyItMatters":{"en":"It is the number most people quote first, so teams must check whether the classes are balanced before trusting it, and turn to precision, recall or the F1 score when they are not.","da":"Det er det tal, de fleste nævner først, så teams må tjekke, om klasserne er i balance, før de stoler på det, og bruge præcision, genkaldelse eller F1-score, når de ikke er."}},"deepDive":{"en":"For a binary classifier, accuracy = (TP + TN) / (TP + TN + FP + FN); for k classes it is the trace of the k × k confusion matrix divided by the total count, which makes it exactly 1 minus the empirical 0-1 loss. Variants change what counts as correct: top-k accuracy (popularised by the ImageNet top-5 metric) accepts the true class anywhere among the k highest-scoring predictions, and in multilabel problems scikit-learn's accuracy_score computes subset accuracy, where a sample only counts if every one of its labels is right, a far stricter number than per-label accuracy.\n\nThe best-known failure is the accuracy paradox. With a positive-class prevalence p, a constant classifier that always predicts the majority class scores 1 − p, so 99% accuracy is worthless at 1% prevalence. Accuracy should therefore always be reported next to the majority-class baseline. Alternatives that resist imbalance include balanced accuracy (the mean of per-class recall, (TPR + TNR) / 2 in the binary case), Cohen's kappa, which subtracts the agreement expected by chance, and the Matthews correlation coefficient, which uses all four cells and is only high when both classes are predicted well.\n\nAccuracy is also threshold-dependent. Most models output scores or probabilities, and accuracy is measured after cutting them at a decision threshold, commonly 0.5 by library default. It is not a proper scoring rule: it ignores how confident the model was, so two models with identical accuracy can differ sharply in calibration, which log loss or the Brier score expose. It also treats every error as equally costly, which is rarely true when a missed fraud and a blocked legitimate payment have very different prices.\n\nBeing an estimate from a finite test set, it carries sampling error: the standard error is roughly √(a(1 − a)/n), so 90% measured on 1,000 cases has a 95% interval of about ±1.9 percentage points. Differences between two models on the same test cases should be checked with a paired test such as McNemar's rather than by eye. Note the naming clash with metrology, where ISO 5725-1 defines accuracy as trueness plus precision, and with the EU AI Act, whose Art. 15 uses \"accuracy\" broadly and requires the levels and \"relevant accuracy metrics\" of high-risk systems to be declared in the instructions for use (Art. 15(3)). ISO/IEC TS 4213:2022 gives a methodology for assessing classification performance, including the choice of such metrics.","da":"For en binær klassifikator er nøjagtighed = (TP + TN) / (TP + TN + FP + FN); med k klasser er det sporet af den k × k store forvekslingsmatrix delt med det samlede antal, altså præcis 1 minus det empiriske 0-1-tab. Varianter ændrer, hvad der tæller som rigtigt: top-k-nøjagtighed (kendt fra ImageNets top-5-mål) godkender svaret, hvis den sande klasse er blandt de k højest scorede, og ved multilabel-klassifikation beregner scikit-learns accuracy_score subset accuracy, hvor et eksempel kun tæller, hvis alle dets labels er rigtige - et langt strengere tal end nøjagtighed pr. label.\n\nDen mest kendte faldgrube er nøjagtighedsparadokset. Med en andel p positive giver en konstant klassifikator, der altid svarer majoritetsklassen, 1 − p, så 99 % nøjagtighed er værdiløs ved 1 % forekomst. Nøjagtighed bør derfor altid rapporteres sammen med majoritetsbaselinen. Mål, der tåler ubalance, er bl.a. balanced accuracy (gennemsnittet af genkaldelsen pr. klasse, (TPR + TNR) / 2 i det binære tilfælde), Cohens kappa, der trækker den tilfældige enighed fra, og Matthews-korrelationskoefficienten (MCC), som bruger alle fire felter og kun bliver høj, når begge klasser forudsiges godt.\n\nNøjagtighed afhænger også af tærsklen. De fleste modeller giver scorer eller sandsynligheder, og nøjagtigheden måles først efter en beslutningstærskel, ofte 0,5 som biblioteksstandard. Den er ikke en proper scoring rule: den ignorerer, hvor sikker modellen var, så to modeller med samme nøjagtighed kan være meget forskelligt kalibrerede, hvilket log loss eller Brier-score afslører. Den behandler også alle fejl som lige dyre, hvad de sjældent er, når et overset svindelforsøg og en blokeret lovlig betaling koster vidt forskelligt.\n\nSom et estimat fra et endeligt testsæt har tallet stikprøveusikkerhed: standardfejlen er omtrent √(a(1 − a)/n), så 90 % målt på 1.000 tilfælde har et 95 %-interval på cirka ±1,9 procentpoint. Forskelle mellem to modeller på de samme testtilfælde bør afgøres med en parret test som McNemars test og ikke med øjemål. Bemærk navnesammenstødet med metrologien, hvor ISO 5725-1 definerer accuracy som korrekthed (trueness) plus præcision, og med EU's AI-forordning, hvis art. 15 bruger begrebet bredt og kræver, at højrisikosystemers niveauer og \"relevante nøjagtighedsmål\" angives i brugsanvisningen (art. 15, stk. 3). ISO/IEC TS 4213:2022 beskriver en metode til at vurdere klassifikationsydelse, herunder valget af sådanne mål."},"edges":[{"type":"requires","to":"ai/confusion-matrix","confidence":"high","strength":"normal"},{"type":"requires","to":"ai/classification","confidence":"high","strength":"normal"},{"type":"part-of","to":"ai/model-evaluation","confidence":"high","strength":"normal"},{"type":"contrasts-with","to":"ai/f1-score","why":{"en":"Accuracy counts every correct answer alike, so it hides a rare class that is always missed; the F1 score looks only at that class and exposes the problem.","da":"Nøjagtighed tæller alle rigtige svar ens og skjuler derfor en sjælden klasse, der altid overses; F1-score ser kun på den klasse og afslører problemet."},"confidence":"high","strength":"primary"}],"depth":3,"sources":[{"title":"Goodfellow, Bengio & Courville, Deep Learning (ch. 5.1.2 and 11.1)","url":"https://www.deeplearningbook.org/","tier":"textbook","publisher":"MIT Press"},{"title":"Jurafsky & Martin, Speech and Language Processing, 3rd ed. draft (§4.9, Evaluation: Precision, Recall, F-measure)","url":"https://web.stanford.edu/~jurafsky/slp3/","tier":"textbook"},{"title":"ISO/IEC 22989:2022, Artificial intelligence concepts and terminology","url":"https://www.iso.org/standard/74296.html","tier":"standard","publisher":"ISO/IEC"},{"title":"ISO/IEC TS 4213:2022, Assessment of machine learning classification performance","url":"https://www.iso.org/standard/79799.html","tier":"standard","publisher":"ISO/IEC"},{"title":"scikit-learn User Guide, Metrics and scoring (classification metrics)","url":"https://scikit-learn.org/stable/modules/model_evaluation.html","tier":"official-doc","publisher":"scikit-learn"},{"title":"Regulation (EU) 2024/1689 (Artificial Intelligence Act), Article 15","url":"https://eur-lex.europa.eu/eli/reg/2024/1689/oj","tier":"standard","publisher":"EUR-Lex"}],"draft":true}