Gå til indhold
atlas

Neuralt netværk

Også kendt som: kunstigt neuralt netværk

En model af mange små forbundne enheder, der hver vægter deres input og sender et tal videre, løst inspireret af hjernen.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En matematisk model af forbundne enheder ordnet i lag; hver enhed ganger sine input med lærte vægte, lægger dem sammen og sender resultatet videre, og træningen justerer vægtene.

Forklaret enkelt

Som et kæmpe lydbord med millioner af skydere; træningen skubber langsomt til hver skyder, indtil lyden, der kommer ud, er rigtig.

I praksis

En kommunes mailsystem sender hver indgående besked gennem et neuralt netværk, der giver en score for, hvor sandsynligt det er, at den er phishing, og holder beskeder over en fastsat grænse tilbage.

Hvorfor det betyder noget

Dens viden er spredt ud over millioner af tal i stedet for læsbare regler, så det er svært at se, hvorfor den gav et bestemt svar.

Teknisk uddybning

Hver enhed beregner y = f(w·x + b): en vægtet sum af sine input plus en bias, sendt gennem en ikke-lineær aktiveringsfunktion f. Et lag anvender dette på mange enheder på én gang, hvilket svarer til en matrixmultiplikation efterfulgt af en elementvis ikke-linearitet, og et netværk sammensætter lag. Uden ikke-lineariteten ville enhver stak af lag falde sammen til én lineær afbildning. Gængse aktiveringsfunktioner er sigmoid og tanh (historisk), ReLU, max(0, x), som blev standard i begyndelsen af 2010'erne, fordi den ikke mættes for positive input, og glatte varianter som GELU, der bruges i transformere.

Rosenblatts perceptron (1958) var ét trænbart lag med et tærskel-output. Minsky og Paperts analyse fra 1969 viste, at ét lag ikke kan repræsentere funktioner, der ikke er lineært separable, fx XOR, hvilket dæmpede interessen i mere end et årti. Flerlagsperceptroner med skjulte lag fjerner den begrænsning, og de universelle approksimationssætninger (Cybenko 1989 for sigmoider, Hornik 1991 mere generelt) viser, at ét skjult lag med tilstrækkelig bredde kan approksimere enhver kontinuert funktion på et kompakt domæne med vilkårlig præcision. Sætningen garanterer kun eksistens; den siger intet om, hvor mange enheder der kræves, eller om træningen finder vægtene.

Træning sker med backpropagation, gjort udbredt af Rumelhart, Hinton og Williams i 1986, som bruger kædereglen til at beregne tabets gradient med hensyn til hver eneste vægt i ét baglæns gennemløb, efterfulgt af gradientnedstigning eller en variant som Adam. Praktiske vanskeligheder omfatter forsvindende og eksploderende gradienter i dybe stakke, som håndteres med omhyggelig initialisering (Glorot/Xavier 2010, He 2015), normaliseringslag og residualforbindelser, samt følsomhed over for læringsrate og batchstørrelse.

Arkitekturer specialiserer grundmønstret gennem vægtdeling og forbindelsesmønstre: Konvolutionelle netværk deler filtre på tværs af billedpositioner, rekurrente netværk og LSTM'er (Hochreiter og Schmidhuber 1997) deler vægte på tværs af tidsskridt, og transformere (2017) bruger attention, så hver position kan vægte alle andre. Grafneurale netværk sender beskeder langs kanter. Antallet af parametre spænder fra tusinder i indlejrede klassifikatorer til hundredvis af milliarder i store sprogmodeller.

Hjerneanalogien er løs. Kunstige enheder er differentiabel aritmetik, ikke spikende neuroner, og backpropagation har ingen påvist biologisk modpart. Den praktiske konsekvens for revision er, at den lærte funktion er fordelt over vægtmatricerne; forklaringsmetoder som saliency maps, SHAP eller probing giver delvise, tilnærmede indblik frem for de regler, en revisor måske forventer.

Relationer

Kilder og videre læsning

Opslagsværker

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Nævnt i

Test dig selv

Indlæser…

Atlas er i beta.