Syntetiske data
Også kendt som: kunstige data, genererede data
Opdigtede eksempler, lavet af et program eller en AI-model, så de ligner rigtige data - brugt, hvor ægte eksempler er få eller private.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
Data, der er skabt i stedet for indsamlet, og som er designet til at bevare de nyttige mønstre fra rigtige data; bruges som træningsdata, til test eller til at dele datasæt uden at afsløre personoplysninger.
Forklaret enkelt
Som en flysimulator - stormene og motorsvigtene er ikke ægte, men en pilot kan øve dem sikkert og så tit, det er nødvendigt.
I praksis
En pensionskasse vil lade en leverandør teste sin nye medlemsportal uden at se rigtige medlemsdata, så pensionskassens testansvarlige laver 50.000 opdigtede medlemmer med realistiske aldre, lønninger og indbetalinger.
Hvorfor det betyder noget
Det kan lette problemer med privatliv og datamangel, men dårligt lavede syntetiske data kan stadig lække rigtige personers oplysninger eller bage fejlene fra den model, der lavede dem, ind.
Teknisk uddybning
Syntetiske data skabes af meget forskellige generatorer. Regelbaserede tilgange og simulationer spænder fra testdatabiblioteker, der udfylder skemaer med troværdige værdier, til fysik- og køresimulatorer, der renderer mærkede sensordata. Statistiske tilgange tilpasser en model af den fælles fordeling i en rigtig tabel - bayesianske netværk, copulaer, som i open source-projektet Synthetic Data Vault - og trækker nye rækker. Dybe generative modeller (GAN'er som CTGAN, variational autoencoders, diffusionsmodeller) håndterer billeder og komplekse tabeldata, og store sprogmodeller genererer nu tekst i stor skala: instruktion-svar-par (Self-Instruct, Alpaca), træningskorpusser i lærebogsstil (modellen phi-1 fra Gunasekar m.fl., 2023) og ræsonnementsforløb, der filtreres af automatiske tjek. Man skelner mellem helt syntetiske datasæt og delvist syntetiske, hvor kun følsomme felter erstattes. Oversampling i stil med SMOTE, der interpolerer mellem eksisterende eksempler fra minoritetsklassen, ligger på grænsen til dataaugmentering.
Kvaliteten vurderes på tre akser. Fidelitet sammenligner marginale fordelinger, korrelationer og struktur af højere orden med de rigtige data. Nytte måles som regel med "træn på syntetisk, test på ægte": en model trænet på det syntetiske sæt evalueres på tilbageholdte rigtige data og sammenlignes med en model trænet på rigtige data. Privatliv testes med tjek af afstand til nærmeste rigtige post og med simulerede angreb, der forsøger at afgøre medlemskab eller udlede attributter. Akserne trækker mod hinanden: jo mere tro generatoren er mod data, jo større risiko for at den gengiver enkeltposter.
Syntetiske data afledt af personoplysninger er derfor ikke automatisk anonyme efter databeskyttelsesforordningen. Testen i betragtning 26 er, om identifikation er mulig med midler, der med rimelighed kan tænkes anvendt, og generatorer kan lære og lække afvigende poster. Stadler, Oprisanu og Troncoso (USENIX Security 2022) viste empirisk, at syntetiske data enten ikke forhindrer inferensangreb eller ikke bevarer nytten, og at afvejningen mellem privatliv og nytte er svær at forudsige. Differential privacy er den vigtigste vej til en formel garanti, idet den begrænser hver enkeltpersons indflydelse på generatoren, men den koster nøjagtighed, især for små undergrupper. Brug af syntetiske poster i udviklings- og testmiljøer understøtter princippet om dataminimering (databeskyttelsesforordningens art. 5, stk. 1, litra c), men selve generatoren trænes på personoplysninger og kræver et behandlingsgrundlag.
Ved modeltræning har stor afhængighed af genererede data sin egen risiko. Shumailov m.fl. (2024) viste i Nature, at modeller, der rekursivt trænes på output fra tidligere generationer, mister halerne af den oprindelige fordeling og til sidst kollapser; opfølgende arbejde fandt, at man stort set undgår det ved at ophobe rigtige data sammen med de syntetiske i stedet for at erstatte dem. Syntetiske data arver også og kan forstærke generatorens bias og faktuelle fejl, og output fra proprietære modeller kan være begrænset af udbyderens vilkår, når det bruges til at træne konkurrerende modeller.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Neuralt netværk
- →Deep learning
- →Generativ AI
- →Syntetiske data
Relationer
- En slags
- Træningsdata
- Forudsætter
- Generativ AI
- Afbøder
- Databrud
- Forårsager
- Bias i AI
- Bruges sammen med
- DiffusionsmodelVidensdestillation (distillation)
Kilder og videre læsning
Standarder og officielle tekster
Opslagsværker
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…