Inferens
At bruge en færdigtrænet model til at give et svar på nyt input - det, der sker, hver gang du spørger en chatassistent om noget.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
Det trin, hvor en trænet model med faste vægte køres på nyt input for at give et resultat som en kategori, en score eller genereret tekst; modellen lærer ikke noget af inputtet undervejs.
Forklaret enkelt
Som en uddannet læge, der ser på en ny patient - årene med studier er forbi, nu bliver viden bare brugt.
I praksis
Når en medarbejder i en kommune indsætter en kontrakt i et online AI-værktøj og beder det opsummere den, sendes teksten til udbyderens servere i udlandet, hvor inferensen kører.
Hvorfor det betyder noget
Hvor inferensen kører, afgør, hvor dine data rejser hen, og hvem der kan se dem - en lokal model og en udenlandsk cloudtjeneste har vidt forskellige risici.
Teknisk uddybning
Mekanisk er inferens et forward pass: inputtet kodes (tokeniseres, normaliseres, skaleres), ganges gennem de frosne vægte lag for lag og omsættes til et resultat af et afsluttende lag, fx en softmax over klasser eller over et ordforråd. Der beregnes ingen gradienter, og der gemmes ingen optimeringstilstand, så hukommelsesforbruget pr. forespørgsel domineres af selve vægtene plus aktiveringerne. Derfor kan inferens køre på langt mindre hardware end den klynge, der blev brugt til modeltræning, og derfor er teknikker som kvantisering (vægte gemt i INT8 eller 4-bit-formater) og knowledge distillation rettet netop mod inferens.
Autoregressive sprogmodeller gør inferens til en løkke frem for ét gennemløb. I prefill-fasen behandles hele prompten parallelt, og attention-nøgler og -værdier for hvert token gemmes i en KV-cache; i decode-fasen danner modellen ét token ad gangen, og hvert skridt læser hele cachen. Prefill er begrænset af regnekraft og afgør time-to-first-token; decode er begrænset af hukommelsesbåndbredde og afgør antal tokens pr. sekund. Serving-systemer bruger derfor continuous batching (forespørgsler lægges til og fjernes fra en kørende batch mellem decode-skridt), sideopdelt KV-cache-hukommelse og speculative decoding, hvor en lille udkastmodel foreslår flere tokens, som den store model verificerer i ét gennemløb.
Resultatet er ikke altid deterministisk. Samplingindstillinger som temperatur og top-p tilføjer bevidst tilfældighed, og selv ved temperatur 0 kan flydende-komma-aritmetikkens manglende associativitet på tværs af batchstørrelser og GPU-kerner ændre resultatet. Siden omkring 2024 har ræsonnerende modeller desuden flyttet omkostninger over på inferens: de bruger ekstra tokens på mellemregninger, før de svarer, så prisen for én forespørgsel kan variere med flere størrelsesordener.
En udbredt forveksling er med statistisk inferens, som betyder at drage konklusioner om en population ud fra en stikprøve (konfidensintervaller, hypotesetest). I maskinlæring betyder ordet blot at køre modellen. En anden misforståelse er, at en udrullet model lærer af brugerens input under inferens; det gør den ikke, medmindre udbyderen særskilt indsamler prompterne og bruger dem i en senere træningskørsel, og det er et kontraktligt og databeskyttelsesretligt spørgsmål, ikke en teknisk egenskab ved inferens.
Set fra sikkerhed og compliance er inferens der, hvor data faktisk flyder. Hver prompt og hvert dokument, der sendes til en hostet model, forlader organisationen, så endpointets placering afgør, om databeskyttelsesforordningens kapitel V om overførsel til tredjelande finder anvendelse. Inferens-endpoints er også angrebsfladen for prompt injection, modeludtrækning via gentagne forespørgsler og membership inference-angreb, der tester, om en bestemt post indgik i træningsdata.
Relationer
Kilder og videre læsning
Standarder og officielle tekster
Lærebøger
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Nævnt i
Test dig selv
Indlæser…