Gå til indhold
atlas

Datamærkning (data labeling)

Også kendt som: data labeling, annotering

At lade mennesker (eller værktøjer) sætte det rigtige svar på hvert eksempel - “kat”, “klage”, “vred” - så en model kan lære af det.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

Arbejdet med at tilføje det korrekte output til hvert input i et datasæt, så man får de besvarede eksempler, som superviseret læring kræver som træningsdata, og som man bruger som reference, når modellen skal bedømmes.

Forklaret enkelt

Som at skrive svaret på bagsiden af hvert kort, før en elev begynder at øve sig med bunken.

I praksis

I en region markerer to hospitalslæger svulster på 10.000 scanninger; hvor de er uenige, afgør en tredje, og de markerede scanninger bliver træningsdata til en model, der udpeger mistænkelige tilfælde.

Hvorfor det betyder noget

En model kan kun blive så god som de svar, den lærer af; forhastet, dårligt betalt eller skæv datamærkning går direkte videre i modellens fejl og bias.

Teknisk uddybning

Datamærkning dækker meget forskellige annoteringstyper: klasselabels på dokument- eller billedniveau, bounding boxes, polygoner og pixelmasker til computersyn, annotering af spænd og relationer til named-entity recognition, relevansvurderinger til søgning, transskriptioner til tale og parvise præferencerangeringer til RLHF. Hvert projekt hviler på en skriftlig mærkningsvejledning (en kodebog), der definerer hver label med positive og negative eksempler og eksplicitte regler for grænsetilfælde, og som forfines i pilotrunder, indtil annotatorerne er enige. Kvalitetskontrol i drift bygger på guldeksempler med kendt svar blandet ind i køen, overlap, hvor flere annotatorer mærker samme eksempel, og gennemgang eller afgørelse af uenigheder. Open source-værktøjer som Label Studio og CVAT håndterer køer, overlap og eksportformater.

Enighed mellem annotatorer viser, hvor veldefineret opgaven er. Cohens kappa korrigerer enighed mellem to bedømmere for tilfældighed, Fleiss' kappa udvider det til mange, og Krippendorffs alfa håndterer manglende bedømmelser og ordinale eller intervalskalaer. Lav enighed skyldes som regel en tvetydig vejledning eller en reelt subjektiv opgave snarere end sjuskede annotatorer, og den sætter et loft for, hvor god en model kan måles til at være. Flere labels kan samles ved flertalsafstemning, af en afgører eller med probabilistiske modeller som Dawid og Skenes EM-metode (1979), der estimerer en forvekslingsmatrix pr. annotator; nogle teams beholder fordelingen af labels som et blødt mål i stedet for at tvinge ét svar igennem.

Fordi mærkning er dyr, går meget arbejde ud på at gøre mindre af den. Active learning udvælger de eksempler, den nuværende model er mest usikker på; weak supervision, som i Snorkel (Ratner m.fl., 2017), kombinerer støjfyldte programmatiske mærkningsfunktioner til probabilistiske labels; og modelstøttet formærkning eller labels genereret af en LLM lader mennesker rette i stedet for at skabe. Formærkning gør arbejdet hurtigere, men forankrer annotatorerne i modellens forslag, hvilket kan skjule netop de fejl, projektet skal finde. Fejl i labels er almindelige selv i berømte datasæt: Northcutt m.fl. (2021) anslog i gennemsnit mindst 3,3 % på tværs af ti benchmark-testsæt, og værktøjer til confident learning som cleanlab bruges til at markere sandsynligt fejlmærkede eksempler til gennemsyn.

Datamærkning er også en compliance- og leverandørkædeopgave. Efter EU's AI-forordning skal datastyring for højrisikosystemer omfatte dataforberedende behandlinger som annotering, mærkning og rensning (art. 10, stk. 2, litra c). Når annotatorer ser personoplysninger, er en ekstern mærkningsleverandør databehandler efter databeskyttelsesforordningens art. 28, hvilket kræver en databehandleraftale og, ved arbejde uden for EØS, et overførselsgrundlag efter kapitel V. Arbejdsvilkår er en kendt risiko: i 2023 beskrev TIME, at kenyanske arbejdere, der mærkede giftigt indhold for OpenAI via underleverandøren Sama, fik under to dollars i timen.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Træningsdata
  2. →Datamærkning (data labeling)

Relationer

Forudsætter
Træningsdata
Forårsager
Bias i AI

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.