Gå til indhold
atlas

Træningsdata

Også kendt som: træningssæt

De eksempler, en model lærer af - dens adfærd, dens blinde vinkler og dens fejl kommer alle fra det, der er i dem.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

Samlingen af eksempler, ofte med de rigtige svar tilknyttet, som bruges under modeltræning til at fastsætte modellens interne tal; holdes adskilt fra de data, der senere bruges til at teste den.

Forklaret enkelt

Som de lærebøger og gamle eksamenssæt, en studerende læser på - er de forkerte, skæve eller forældede, bliver det, den studerende lærer, det også.

I praksis

En pensionskasse vil træne en model på ti års mails fra medlemmer og skal først undersøge, hvilke af dem der indeholder persondata, og på hvilket retsgrundlag de må bruges.

Hvorfor det betyder noget

Træningsdata er et aktiv, der skal beskyttes, og en kilde til risiko - de kan lække persondata, bære uretfærdige mønstre eller i det skjulte blive ændret af en angriber.

Teknisk uddybning

Standardpraksis deler de tilgængelige data i tre adskilte sæt: træningssættet, der bruges til at fastsætte vægtene, et valideringssæt til at vælge hyperparametre og stoptidspunkt, og et testsæt, der kun røres én gang til det endelige estimat. Opdelingen skal respektere dataenes struktur: Grupperede opdelinger holder alle poster fra én patient eller kunde på samme side, og tidsbaserede opdelinger træner på fortiden og tester på fremtiden. Brydes det, opstår lækage og for optimistiske resultater. For store sprogmodeller er det tilsvarende problem benchmark-kontaminering, hvor testopgaver optræder i det webbaserede fortræningskorpus, så de rapporterede benchmarkresultater delvis måler udenadslære.

Kvalitetsproblemerne er velbeskrevne. Støj i annotatorernes mærkater estimeres med statistik for enighed mellem annotatorer som Cohens kappa; stikprøveskævhed opstår, når indsamlingen afviger fra driften (en model trænet på ét hospitals scannere); historisk skævhed opstår, når korrekte mærkater afspejler tidligere diskrimination; og klasseubalance betyder, at sjældne, ofte vigtige tilfælde er underrepræsenterede. Deduplikering er afgørende i stor skala: Gentagne sekvenser i webkorpora øger udenadslæren og risikoen for, at en model gengiver personoplysninger ordret.

Træningsdata er en angrebsflade. Dataforgiftning indsætter konstruerede eksempler, så modellen opfører sig forkert generelt eller kun ved en bestemt trigger (en bagdør). Webskrabede korpora er udsatte, fordi en angriber kan styre indholdet på URL'er, der vil blive crawlet. Sporing af oprindelse, hashværdier af datasæt, adgangskontrol på mærkningsprocesser og anomalitjek af nye data er de tilsvarende kontroller, sammen med dokumentation som datasheets for datasets.

Den europæiske retlige ramme er lagdelt. Personoplysninger i et træningssæt kræver et behandlingsgrundlag efter databeskyttelsesforordningens artikel 6 og for særlige kategorier artikel 9; formålsbegrænsning og dataminimering gælder for træning som for al anden behandling. For højrisikosystemer kræver AI-forordningens artikel 10 datastyringspraksis, der dækker designvalg, indsamling, forberedelse og undersøgelse for mulige skævheder, og artikel 10, stk. 3, kræver, at trænings-, validerings- og testdatasæt er relevante, tilstrækkeligt repræsentative og så vidt muligt fejlfri og fuldstændige set i forhold til det tilsigtede formål. Artikel 10, stk. 5, tillader undtagelsesvis behandling af særlige kategorier af personoplysninger udelukkende for at opdage og korrigere skævheder og med garantier. Udbydere af AI-modeller til almen brug skal offentliggøre et tilstrækkeligt detaljeret resumé af træningsindholdet (artikel 53, stk. 1, litra d) og have en politik for overholdelse af EU's ophavsret (artikel 53, stk. 1, litra c), herunder maskinlæsbare forbehold mod tekst- og datamining efter artikel 4, stk. 3, i DSM-direktivet (EU) 2019/790.

Relationer

En slags
Aktiv
Består af
Label (mærkat)
Forårsager
Bias i AI

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Nævnt i

Test dig selv

Indlæser…

Atlas er i beta.