Træningsdata
Også kendt som: træningssæt
De eksempler, en model lærer af - dens adfærd, dens blinde vinkler og dens fejl kommer alle fra det, der er i dem.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
Samlingen af eksempler, ofte med de rigtige svar tilknyttet, som bruges under modeltræning til at fastsætte modellens interne tal; holdes adskilt fra de data, der senere bruges til at teste den.
Forklaret enkelt
Som de lærebøger og gamle eksamenssæt, en studerende læser på - er de forkerte, skæve eller forældede, bliver det, den studerende lærer, det også.
I praksis
En pensionskasse vil træne en model på ti års mails fra medlemmer og skal først undersøge, hvilke af dem der indeholder persondata, og på hvilket retsgrundlag de må bruges.
Teknisk uddybning
Standardpraksis deler de tilgængelige data i tre adskilte sæt: træningssættet, der bruges til at fastsætte vægtene, et valideringssæt til at vælge hyperparametre og stoptidspunkt, og et testsæt, der kun røres én gang til det endelige estimat. Opdelingen skal respektere dataenes struktur: Grupperede opdelinger holder alle poster fra én patient eller kunde på samme side, og tidsbaserede opdelinger træner på fortiden og tester på fremtiden. Brydes det, opstår lækage og for optimistiske resultater. For store sprogmodeller er det tilsvarende problem benchmark-kontaminering, hvor testopgaver optræder i det webbaserede fortræningskorpus, så de rapporterede benchmarkresultater delvis måler udenadslære.
Kvalitetsproblemerne er velbeskrevne. Støj i annotatorernes mærkater estimeres med statistik for enighed mellem annotatorer som Cohens kappa; stikprøveskævhed opstår, når indsamlingen afviger fra driften (en model trænet på ét hospitals scannere); historisk skævhed opstår, når korrekte mærkater afspejler tidligere diskrimination; og klasseubalance betyder, at sjældne, ofte vigtige tilfælde er underrepræsenterede. Deduplikering er afgørende i stor skala: Gentagne sekvenser i webkorpora øger udenadslæren og risikoen for, at en model gengiver personoplysninger ordret.
Træningsdata er en angrebsflade. Dataforgiftning indsætter konstruerede eksempler, så modellen opfører sig forkert generelt eller kun ved en bestemt trigger (en bagdør). Webskrabede korpora er udsatte, fordi en angriber kan styre indholdet på URL'er, der vil blive crawlet. Sporing af oprindelse, hashværdier af datasæt, adgangskontrol på mærkningsprocesser og anomalitjek af nye data er de tilsvarende kontroller, sammen med dokumentation som datasheets for datasets.
Den europæiske retlige ramme er lagdelt. Personoplysninger i et træningssæt kræver et behandlingsgrundlag efter databeskyttelsesforordningens artikel 6 og for særlige kategorier artikel 9; formålsbegrænsning og dataminimering gælder for træning som for al anden behandling. For højrisikosystemer kræver AI-forordningens artikel 10 datastyringspraksis, der dækker designvalg, indsamling, forberedelse og undersøgelse for mulige skævheder, og artikel 10, stk. 3, kræver, at trænings-, validerings- og testdatasæt er relevante, tilstrækkeligt repræsentative og så vidt muligt fejlfri og fuldstændige set i forhold til det tilsigtede formål. Artikel 10, stk. 5, tillader undtagelsesvis behandling af særlige kategorier af personoplysninger udelukkende for at opdage og korrigere skævheder og med garantier. Udbydere af AI-modeller til almen brug skal offentliggøre et tilstrækkeligt detaljeret resumé af træningsindholdet (artikel 53, stk. 1, litra d) og have en politik for overholdelse af EU's ophavsret (artikel 53, stk. 1, litra c), herunder maskinlæsbare forbehold mod tekst- og datamining efter artikel 4, stk. 3, i DSM-direktivet (EU) 2019/790.
Relationer
- En slags
- Aktiv
- Typer
- Syntetiske data
- Består af
- Label (mærkat)
- Åbner for
- Bias i AIKlyngeanalyse (clustering)KrydsvalideringDataskred (data drift)Datamærkning (data labeling)Epoke (epoch)Feature (inputvariabel)Vidensgrænse (knowledge cutoff)MaskinlæringModelkort (model card)ModeltræningOvertilpasning (overfitting)Fortræning (pretraining)Selvsuperviseret læringAfsløring af følsomme oplysningerSuperviseret læringIkke-superviseret læring
- Forveksl ikke med
- ValideringssætKontekstvindueTestsæt
- Udnyttes af
- Dataforgiftning (data poisoning)
- Forårsager
- Bias i AI
- Bruges sammen med
- Finjustering (fine-tuning)DataklassifikationGDPRPersonoplysninger
Kilder og videre læsning
Standarder og officielle tekster
- ISO/IEC 22989:2022, Information technology: Artificial intelligence concepts and terminology · ISO/IEC
- Regulation (EU) 2024/1689 (Artificial Intelligence Act), Article 10 (Data and data governance) and Article 53 · European Union
- NIST AI 100-1 (2023), Artificial Intelligence Risk Management Framework (AI RMF 1.0) · NIST
- Regulation (EU) 2016/679 (GDPR), Articles 6 and 9 · European Union
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Nævnt i
Test dig selv
Indlæser…