Maskinlæring
Også kendt som: ML, machine learning
At bygge computersystemer, der finder mønstre i eksempler og gætter ud fra dem i stedet for at følge regler skrevet af et menneske.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En gren af AI, hvor et program bliver bedre til en opgave ved at justere sine egne interne tal ud fra træningsdata, så dets adfærd kommer fra data frem for fra håndskrevne instruktioner.
Forklaret enkelt
Som at lære at skelne moden fra umoden frugt ved at håndtere tusindvis af stykker, i stedet for at få udleveret en skreven regelbog.
I praksis
En dansk banks svindelsystem får vist millioner af tidligere kortbetalinger mærket som ægte eller svindel og lærer at markere nye betalinger, der ligner svindel, så en medarbejder kan se på dem.
Hvorfor det betyder noget
Fordi adfærden kommer fra data, har ingen skrevet reglerne ned - så resultatets kvalitet, retfærdighed og sikkerhed afhænger af data og er sværere at kontrollere.
Teknisk uddybning
Arthur Samuel brugte udtrykket i sin artikel fra 1959 om et damprogram, der blev bedre ved at spille mod sig selv. Den mest citerede formelle definition er Tom Mitchells (1997): Et program lærer af erfaring E med hensyn til en klasse af opgaver T og et præstationsmål P, hvis dets præstation på T, målt med P, forbedres med E. I moderne termer er det meste maskinlæring empirisk risikominimering: Man vælger en modelfamilie (lineære modeller, beslutningstræer, neurale netværk), en tabsfunktion, der scorer fejl, og en optimeringsprocedure, der finder de parametre, som minimerer det gennemsnitlige tab over træningsdata, som regel med et regulariseringsled, der straffer kompleksitet.
Målet er ikke lav træningsfejl, men generalisering til usete data. Teorien bag hviler på antagelsen om, at trænings- og fremtidige data trækkes uafhængigt fra samme fordeling (i.i.d.). Valiants PAC-ramme (1984) og senere VC-teorien giver grænser for, hvor mange data en modelklasse kræver for at generalisere. I praksis brydes antagelsen jævnligt af distributionsskift: kovariatskift (sammensætningen af input ændrer sig), label- eller prior-skift (basisrater ændrer sig) og concept drift (selve sammenhængen ændrer sig, fx når svindlere tilpasser sig). Udrullede modeller kræver derfor overvågning og løbende gentræning, ikke en engangsgodkendelse.
Feltet opdeles normalt efter, hvilken feedback der er til rådighed: superviseret læring (mærkede eksempler, som giver klassifikation og regression), ikke-superviseret læring (struktur uden mærkater), selvsuperviseret læring (mærkater udledt af data selv, grundlaget for foundation models) og forstærkningslæring (belønningssignaler fra interaktion). Klassiske metoder som logistisk regression, support vector machines og gradient-boostede træer er stadig det stærkeste valg til mange tabelbaserede forretningsproblemer; deep learning dominerer for billeder, lyd og tekst.
Maskinlæring overlapper kraftigt med statistik, men lægger vægten anderledes: Statistik sigter traditionelt mod fortolkelige parametre og slutninger om en population, mens ML prioriterer forudsigelsesnøjagtighed på tilbageholdte data, målt med en streng opdeling i trænings-, validerings- og testsæt. En hyppig praktisk fejl er datalækage, hvor information, der ikke er tilgængelig på forudsigelsestidspunktet (et fremtidigt tidsstempel, et felt udfyldt efter udfaldet), sniger sig ind i features og puster offline-resultaterne op.
Konsekvenserne for governance følger af mekanismen. Fordi adfærden udledes af data frem for at blive specificeret, skal dokumentationen dække data og træningsprocedure lige så vel som koden: Værktøjer som model cards og datasheets for datasets og krav som artikel 10 (data og datastyring) og artikel 11 (teknisk dokumentation) i AI-forordningen for højrisikosystemer findes netop, fordi reglerne ikke kan læses ud af kildekoden.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
- Træningsdata
- →Maskinlæring
Relationer
- En slags
- Kunstig intelligens (AI)
- Typer
- Deep learningForstærkningslæring (reinforcement learning)Selvsuperviseret læringSuperviseret læringIkke-superviseret læring
- Består af
- InferensModeltræningNeuralt netværk
- Forudsætter
- Træningsdata
- Åbner for
- Adversarielt eksempelBias i AIForklarlighedTabsfunktion (loss function)Modelevaluering (evals)Modelparameter
- Forveksl ikke med
- Kunstig intelligens (AI)
- Bruges sammen med
- Anomalidetektion
Kilder og videre læsning
Standarder og officielle tekster
Opslagsværker
- Samuel (1959), Some Studies in Machine Learning Using the Game of Checkers · IBM Journal of Research and Development
Lærebøger
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Nævnt i
Test dig selv
Indlæser…