Gå til indhold
atlas
← Tilbage til opslaget

Hvad er det?

En stor sprogmodel (LLM) er en deep learning-model, der er trænet på meget store mængder tekst til at gøre én ting: forudsige det næste token (et ord eller en del af et ord) ud fra teksten indtil nu. Gentager man den ene forudsigelse tusindvis af gange i træk, får man afsnit, opsummeringer, oversættelser, kode og svar på spørgsmål. Chatassistenter, skriveassistenter i kontorpakker og mange “AI-funktioner” i forretningssoftware er tynde lag oven på en LLM.

Ideen om statistiske sprogmodeller er gammel, men tre udviklinger gjorde den nuværende generation mulig:

I dag tilbydes LLM’er som cloudtjenester fra store udbydere, som modeller med åbne vægte, som organisationer selv kan køre, og i stigende grad som komponenter inde i andre produkter.

Hvordan virker det?

Træning: at lære, hvordan tekst plejer at fortsætte

Under fortræningen læser modellen enorme tekstsamlinger - hjemmesider, bøger, kode, fora - og justerer milliarder af interne vægte, så dens gæt på det næste token bliver bedre. Intet i processen tjekker, om et udsagn er sandt; modellen lærer, hvordan tekst plejer at se ud. Bagefter former finjustering og feedbackbaseret træning dens adfærd: at svare høfligt, afvise tydeligt skadelige anmodninger og følge et format.

Inferens: ét token ad gangen

Når du sender en prompt, deler modellen den op i tokens, beregner en sandsynlighed for hvert muligt næste token, vælger ét, føjer det til teksten og gentager. Den mængde tekst, den kan tage i betragtning på én gang, er dens kontekstvindue - fra nogle tusind til over en million tokens i nutidens modeller. Alt uden for vinduet, også tidligere samtaler, ser modellen simpelthen ikke, medmindre et system lægger det ind igen.

Hvorfor den hallucinerer

Fordi modellen er optimeret til at skrive sandsynlig tekst frem for efterprøvet tekst, producerer den nogle gange flydende, selvsikre udsagn, der er forkerte: opdigtede kilder, forkerte tal, retsafgørelser, der ikke findes. Det kaldes hallucination, og det er en direkte følge af, hvordan modellen er bygget - ikke en fejl, der bliver rettet med næste opdatering. Teknikker som retrieval-augmented generation (RAG) gør det sjældnere og lettere at opdage, men fjerner det ikke.

Hvad den ikke har

En LLM har ingen indbygget database med fakta, ingen viden om dagens dato, medmindre den får den oplyst, og ingen adskillelse mellem “instruktioner” og “data” - alt er tekst i det samme vindue. Det sidste er roden til prompt injection.

Hvad betyder det for en organisation og en koordinator?

LLM’er kommer ind i organisationer fra to sider: officielt gennem en licenseret assistent eller en funktion i eksisterende software og uofficielt, når medarbejdere indsætter arbejdsmateriale i en gratis chattjeneste (shadow AI). Governance-spørgsmålene er stort set de samme:

Et eksempel fra praksis

Freja er GRC-studerende i praktik hos en dansk boligforening. Medarbejderne er begyndt at bruge en chatassistent bygget på en LLM til at skrive udkast til mails til lejere og opsummere bestyrelsesreferater - præcis den situation, begrebets korte definition beskriver. Hendes leder beder hende skrive en retningslinje for brugen.

Hun starter med en enkel dataklassifikation: offentlig information (offentliggjorte regler, generelle meddelelser) må bruges frit; intern information (referater uden persondata) kun i organisationens licenserede assistent, hvor kontrakten udelukker træning på kundedata; fortrolige data og persondata (klager fra lejere, restancer, helbredsoplysninger) slet ikke uden en konkret vurdering. Hun tjekker, at udbyderen har en databehandleraftale og oplyser, hvor data behandles. Hun tilføjer to regler for output: Et menneske læser altid og står inde for den endelige tekst, og tal eller juridiske udsagn tjekkes mod kilden. Til sidst registrerer hun assistenten som et aktiv i risikoregistret med hallucination og datalæk som navngivne risici og foreslår en kort awareness-session, så medarbejderne forstår, hvorfor reglerne findes.

Typiske misforståelser

Atlas er i beta.