{"licence":{"name":"CC BY-SA 4.0","spdx":"CC-BY-SA-4.0","url":"https://creativecommons.org/licenses/by-sa/4.0/","attribution":"Atlas, a bilingual technical dictionary (https://cmaintz.github.io/tech-atlas/)"},"id":"ai/synthetic-data","url":{"en":"https://cmaintz.github.io/tech-atlas/en/terms/ai/synthetic-data/","da":"https://cmaintz.github.io/tech-atlas/da/terms/ai/synthetic-data/"},"term":{"en":"Synthetic data","da":"Syntetiske data"},"aka":{"en":["artificial data","generated data"],"da":["kunstige data","genererede data"]},"domain":["ai"],"cluster":"training","layer":"training","status":"current","summary":{"en":"Made-up examples produced by a program or another AI model to look like real records, used where real examples are scarce or private.","da":"Opdigtede eksempler, lavet af et program eller en AI-model, så de ligner rigtige data - brugt, hvor ægte eksempler er få eller private."},"body":{"formal":{"en":"Data generated rather than collected, designed to keep the useful patterns of real data; used as training data, for testing, or to share data sets without exposing personal data.","da":"Data, der er skabt i stedet for indsamlet, og som er designet til at bevare de nyttige mønstre fra rigtige data; bruges som træningsdata, til test eller til at dele datasæt uden at afsløre personoplysninger."},"plain":{"en":"Like a flight simulator; the storms and engine failures are not real, but a pilot can practise them safely and as often as needed.","da":"Som en flysimulator - stormene og motorsvigtene er ikke ægte, men en pilot kan øve dem sikkert og så tit, det er nødvendigt."},"inPractice":{"en":"A pension fund wants a supplier to test its new member portal without seeing real member data, so the fund's test manager generates 50,000 made-up members with realistic ages, salaries and payments.","da":"En pensionskasse vil lade en leverandør teste sin nye medlemsportal uden at se rigtige medlemsdata, så pensionskassens testansvarlige laver 50.000 opdigtede medlemmer med realistiske aldre, lønninger og indbetalinger."},"whyItMatters":{"en":"It can ease privacy and data shortages, but badly made synthetic data can still leak real people's details or bake in the mistakes of the model that produced it.","da":"Det kan lette problemer med privatliv og datamangel, men dårligt lavede syntetiske data kan stadig lække rigtige personers oplysninger eller bage fejlene fra den model, der lavede dem, ind."}},"deepDive":{"en":"Synthetic data is produced by very different generators. Rule-based and simulation approaches range from test-data libraries that fill schemas with plausible values to physics and driving simulators that render labelled sensor data. Statistical approaches fit a model of the joint distribution of a real table (Bayesian networks or copulas, as in the open-source Synthetic Data Vault) and sample new rows. Deep generative models (GANs such as CTGAN, variational autoencoders, diffusion models) handle images and complex tabular data, and large language models now generate text at scale: instruction and response pairs (Self-Instruct, Alpaca), textbook-style training corpora (the phi-1 model of Gunasekar et al., 2023) and reasoning traces filtered by automatic checkers. A distinction is drawn between fully synthetic data sets and partially synthetic ones in which only sensitive fields are replaced. SMOTE-style oversampling, which interpolates between existing minority-class examples, sits on the boundary with data augmentation.\n\nQuality is assessed on three axes. Fidelity compares marginal distributions, correlations and higher-order structure with the real data. Utility is usually measured by \"train on synthetic, test on real\": a model trained on the synthetic set is evaluated on held-out real data and compared with one trained on real data. Privacy is tested by distance-to-closest-record checks and by simulated membership- and attribute-inference attacks. The axes pull against each other: the more faithfully a generator reproduces the data, the more it risks reproducing individual records.\n\nSynthetic data derived from personal data is therefore not automatically anonymous under the GDPR. The test in Recital 26 is whether identification is possible by means reasonably likely to be used, and generators can memorise and leak outliers. Stadler, Oprisanu and Troncoso (USENIX Security 2022) showed empirically that synthetic data either fails to prevent inference attacks or fails to retain utility, with a trade-off between privacy and utility that is hard to predict. Differential privacy is the main way to obtain a formal guarantee, bounding each individual's influence on the generator, but it costs accuracy, especially for small subgroups. Using synthetic records in development and test environments supports the data minimisation principle (GDPR Art. 5(1)(c)), but the generator itself is trained on personal data and needs a legal basis.\n\nFor model training, heavy reliance on generated data carries its own risk. Shumailov et al. (2024) showed in Nature that models trained recursively on the output of earlier generations lose the tails of the original distribution and eventually collapse; follow-up work found that accumulating real data alongside synthetic data, rather than replacing it, largely avoids this. Synthetic data also inherits and can amplify the biases and factual errors of its generator, and outputs from proprietary models may be restricted by the provider's terms when used to train competing models.","da":"Syntetiske data skabes af meget forskellige generatorer. Regelbaserede tilgange og simulationer spænder fra testdatabiblioteker, der udfylder skemaer med troværdige værdier, til fysik- og køresimulatorer, der renderer mærkede sensordata. Statistiske tilgange tilpasser en model af den fælles fordeling i en rigtig tabel - bayesianske netværk, copulaer, som i open source-projektet Synthetic Data Vault - og trækker nye rækker. Dybe generative modeller (GAN'er som CTGAN, variational autoencoders, diffusionsmodeller) håndterer billeder og komplekse tabeldata, og store sprogmodeller genererer nu tekst i stor skala: instruktion-svar-par (Self-Instruct, Alpaca), træningskorpusser i lærebogsstil (modellen phi-1 fra Gunasekar m.fl., 2023) og ræsonnementsforløb, der filtreres af automatiske tjek. Man skelner mellem helt syntetiske datasæt og delvist syntetiske, hvor kun følsomme felter erstattes. Oversampling i stil med SMOTE, der interpolerer mellem eksisterende eksempler fra minoritetsklassen, ligger på grænsen til dataaugmentering.\n\nKvaliteten vurderes på tre akser. Fidelitet sammenligner marginale fordelinger, korrelationer og struktur af højere orden med de rigtige data. Nytte måles som regel med \"træn på syntetisk, test på ægte\": en model trænet på det syntetiske sæt evalueres på tilbageholdte rigtige data og sammenlignes med en model trænet på rigtige data. Privatliv testes med tjek af afstand til nærmeste rigtige post og med simulerede angreb, der forsøger at afgøre medlemskab eller udlede attributter. Akserne trækker mod hinanden: jo mere tro generatoren er mod data, jo større risiko for at den gengiver enkeltposter.\n\nSyntetiske data afledt af personoplysninger er derfor ikke automatisk anonyme efter databeskyttelsesforordningen. Testen i betragtning 26 er, om identifikation er mulig med midler, der med rimelighed kan tænkes anvendt, og generatorer kan lære og lække afvigende poster. Stadler, Oprisanu og Troncoso (USENIX Security 2022) viste empirisk, at syntetiske data enten ikke forhindrer inferensangreb eller ikke bevarer nytten, og at afvejningen mellem privatliv og nytte er svær at forudsige. Differential privacy er den vigtigste vej til en formel garanti, idet den begrænser hver enkeltpersons indflydelse på generatoren, men den koster nøjagtighed, især for små undergrupper. Brug af syntetiske poster i udviklings- og testmiljøer understøtter princippet om dataminimering (databeskyttelsesforordningens art. 5, stk. 1, litra c), men selve generatoren trænes på personoplysninger og kræver et behandlingsgrundlag.\n\nVed modeltræning har stor afhængighed af genererede data sin egen risiko. Shumailov m.fl. (2024) viste i Nature, at modeller, der rekursivt trænes på output fra tidligere generationer, mister halerne af den oprindelige fordeling og til sidst kollapser; opfølgende arbejde fandt, at man stort set undgår det ved at ophobe rigtige data sammen med de syntetiske i stedet for at erstatte dem. Syntetiske data arver også og kan forstærke generatorens bias og faktuelle fejl, og output fra proprietære modeller kan være begrænset af udbyderens vilkår, når det bruges til at træne konkurrerende modeller."},"edges":[{"type":"requires","to":"ai/generative-ai","confidence":"high","strength":"normal"},{"type":"kind-of","to":"ai/training-data","confidence":"high","strength":"normal"},{"type":"mitigates","to":"security/data-breach","why":{"en":"Working on made-up records instead of real personal data means a leak exposes less, but only if individuals cannot be traced back from it.","da":"At arbejde på opdigtede poster i stedet for rigtige personoplysninger betyder, at et læk afslører mindre - men kun hvis enkeltpersoner ikke kan spores tilbage."},"confidence":"medium","strength":"minor"},{"type":"causes","to":"ai/ai-bias","why":{"en":"Data produced by a model copies that model's blind spots into the next one.","da":"Data lavet af en model kopierer den models blinde vinkler over i den næste."},"confidence":"medium","strength":"minor"}],"depth":3,"sources":[{"title":"ISO/IEC 22989:2022, Artificial intelligence concepts and terminology","url":"https://www.iso.org/standard/74296.html","tier":"standard","publisher":"ISO/IEC"},{"title":"Shumailov et al. (2024), AI models collapse when trained on recursively generated data","url":"https://doi.org/10.1038/s41586-024-07566-y","tier":"reference","publisher":"Nature 631"},{"title":"Stadler, Oprisanu & Troncoso, Synthetic Data: Anonymisation Groundhog Day","url":"https://arxiv.org/abs/2011.07018","tier":"reference","publisher":"USENIX Security 2022"}],"draft":true}