Gå til indhold
atlas

Grundmodel (foundation model)

Også kendt som: foundation model

En stor model, der bygges én gang på enorme mængder bred data og derefter genbruges som udgangspunkt for mange forskellige opgaver.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En deep learning-model, der har fået fortræning på bred data i stor skala, typisk ved selvsuperviseret læring, så den kan tilpasses - med finjustering, prompts eller værktøjer - til en lang række opgaver, den ikke blev bygget til.

Forklaret enkelt

Som en almen uddannelse, der tager år at få, hvorefter en person langt hurtigere kan lære at blive sygeplejerske, jurist eller kok.

I praksis

Den AI-ansvarlige i et forsikringsselskab træner ikke en model fra bunden; hun tager en grundmodel fra en udbyder og tilpasser den både til at besvare kundernes spørgsmål om deres police og til at opsummere skadesager.

Hvorfor det betyder noget

Mange produkter hviler på de samme få grundmodeller, så en fejl, bias eller svaghed i én af dem spreder sig til alle systemer bygget ovenpå.

Teknisk uddybning

Begrebet blev skabt i august 2021 af Bommasani m.fl. ved Stanfords Center for Research on Foundation Models for at navngive et skifte i, hvordan AI-systemer bygges, snarere end en ny arkitektur. Rapporten pegede på to egenskaber: emergens, dvs. at evner, der ikke er trænet eksplicit, opstår, når modellerne skaleres, og homogenisering, dvs. at én basismodel tilpasses til mange anvendelser, så dens styrker og fejl breder sig til dem alle. Teknisk er en grundmodel næsten altid en transformer trænet med et selvsuperviseret mål, fx forudsigelse af næste token, forudsigelse af maskerede tokens eller kontrastiv sammenkobling af billede og tekst, på korpusser i internetskala fra hundreder af milliarder til titusinder af milliarder tokens.

Skaleringsadfærden drev tilgangen. Kaplan m.fl. (2020) rapporterede jævne potenslove mellem tab og parametre, data og regnekraft; Hoffmann m.fl. (2022, "Chinchilla") justerede det regneoptimale forhold til omtrent 20 træningstokens pr. parameter, og mange senere modeller trænes bevidst langt ud over det forhold, fordi en mindre model trænet længere er billigere at drive. Tilpasning sker i flere lag: prompting og in-context learning uden ændring af vægte, retrieval-augmented generation, parametereffektiv finjustering som LoRA, fuld finjustering og eftertræning med instruktionstræning og præferenceoptimering (RLHF, DPO). En udgivet "base"-model og dens "instruct"- eller "chat"-variant er derfor forskellige artefakter med forskellig adfærd og risikoprofil.

I EU-retten er den relevante kategori AI-modellen til almen brug i AI-forordningens art. 3, nr. 63 (forordning (EU) 2024/1689). Betragtning 98 siger, at modeller med mindst en milliard parametre, trænet på store datamængder med selvsupervision i stor skala, bør anses for at have betydelig generalitet, og Kommissionens retningslinjer bruger træningsberegning over 10²³ FLOP sammen med evnen til at generere tekst, lyd, billeder eller video som vejledende kriterium. Art. 51, stk. 2, formoder kapaciteter med stor virkning, og dermed systemisk risiko, over 10²⁵ FLOP samlet træningsberegning. Udbyderforpligtelserne i art. 53 (teknisk dokumentation, oplysninger til downstream-udbydere, en ophavsretspolitik og et offentligt resumé af træningsindholdet) og de ekstra pligter i art. 55 for modeller med systemisk risiko har gældt siden 2. august 2025; art. 53, stk. 2, fritager visse open source-udgivelser for dokumentationspligterne, men ikke hvis modellen har systemisk risiko.

Homogeniseringen er den største driftsmæssige risiko. En sårbarhedsklasse som en jailbreak-teknik, et memoreret datalæk eller en systematisk bias i basismodellen arves af hver finjustering og hvert produkt bygget ovenpå, og når en udbyder udfaser eller i stilhed opdaterer en hostet model, ændres adfærden hos brugerne uden nogen ændring på deres side. Fastlåsning af modelversioner, en evalueringssuite for hver anvendelse og registrering af, hvilken basismodel og version et system afhænger af, er derfor standardkontroller.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Træningsdata
  2. →Selvsuperviseret læring
  3. →Fortræning (pretraining)
  4. →Grundmodel (foundation model)

Relationer

Kilder og videre læsning

Standarder og officielle tekster

  • NIST AI 600-1 - Artificial Intelligence Risk Management Framework - Generative Artificial Intelligence Profile · NIST

Officiel dokumentation

Opslagsværker

  • Bommasani et al. (2021), On the Opportunities and Risks of Foundation Models · Stanford CRFM

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.