Gå til indhold
atlas

Dataskred (data drift)

Også kendt som: datasætskred

Den langsomme eller pludselige ændring i virkelighedens data, efter en model er sat i drift, så de ikke længere ligner det, den lærte af.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En ændring over tid i de input, en model ser ved inferens, eller i hvordan de input hænger sammen med det rigtige svar, sammenlignet med dens træningsdata; den sænker kvaliteten, uden at selve modellen er ændret.

Forklaret enkelt

Som et gammelt bykort, der var rigtigt, da det blev trykt, men gaderne er bygget om siden, så følger man det trofast i dag, farer man vild.

I praksis

En model, der gættede, hvor mange opkald en supportafdeling ville få, blev trænet, før en ny selvbetjeningsside åbnede; derefter ændrer opkaldene sig i antal og art, og dens gæt bliver stille og roligt forkerte.

Hvorfor det betyder noget

En model, der bestod alle test, kan stadig fejle måneder senere uden nogen fejlmeddelelse, så dens input og resultater i drift skal overvåges, og den skal gentrænes.

Teknisk uddybning

Overbegrebet i litteraturen er dataset shift (Quiñonero-Candela m.fl., red., Dataset Shift in Machine Learning, MIT Press, 2009): Den fælles fordeling P(X, Y) i drift er en anden end under træningen. Det opdeles normalt i covariate shift, hvor P(X) ændrer sig, men P(Y | X) er den samme (et nyt kundesegment kommer til); prior- eller label shift, hvor P(Y) ændrer sig (svindel bliver hyppigere); og concept drift (begrebsskred), hvor P(Y | X) selv ændrer sig, så de samme input nu kræver andre svar (hvad der tæller som spam, udvikler sig). Googles ML-ordliste definerer concept drift som et skift i forholdet mellem features og labelen, der over tid sænker modellens kvalitet. Gama m.fl. (2014) inddeler skred efter tidsforløb i pludseligt, gradvist, trinvist og tilbagevendende (sæsonbestemt) og skelner mellem reelt skred, der flytter beslutningsgrænsen, og virtuelt skred, der kun ændrer inputfordelingen.

Opdagelse sker ved at sammenligne data i drift med et referencevindue, typisk trænings- eller valideringsdata. Almindelige tjek er statistiske test pr. feature (Kolmogorov-Smirnov for numeriske features, chi-i-anden for kategoriske), afstandsmål som population stability index, Jensen-Shannon- eller Wasserstein-afstand, ændringer i fordelingen af modellens output og, hvor labels kommer sent, det faktiske fald i nøjagtighed eller stigning i fejl. Detektorer fra stream learning som DDM og ADWIN følger fejlraten og giver signal, når den ændrer sig markant. Test af mange features hver for sig giver mange falske alarmer, så tærskler justeres eller korrigeres for multiple sammenligninger.

Dataskred er beslægtet med, men forskelligt fra training-serving skew, hvor selve pipelinen producerer forskellige features ved træning og i drift; Googles vejledning om produktions-ML behandler begge som overvågningspunkter og anbefaler at bruge de samme statistiske tjek på trænings- og driftsdata. Modtræk er planlagt eller udløst gentræning på nye data, højere vægt på nye eksempler, online læring og menneskelig vurdering af, om ændringen er reel eller en datakvalitetsfejl som et ødelagt felt længere oppe i kæden.

For generative modeller og sprogmodeller viser samme idé sig som viden, der forælder: Verden bevæger sig forbi vidensgrænsen, brugeradfærd ændrer sig, og prompts glider mod opgaver, der ikke var med i træningen.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Inferens
  2. →Træningsdata
  3. →Dataskred (data drift)

Relationer

Bruges sammen med
Modelevaluering (evals)

Kilder og videre læsning

Officiel dokumentation

Lærebøger

  • Quiñonero-Candela, Sugiyama, Schwaighofer & Lawrence (eds.), Dataset Shift in Machine Learning · MIT Press, 2009

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.