Gå til indhold
atlas

Prompt caching

Også kendt som: context caching

En funktion, der gemmer arbejdet med starten af en prompt, så senere forespørgsler, der starter ens, bliver hurtigere og billigere.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

En funktion i modelservering, der i kort tid gemmer KV-cache for den første del af en prompt og genbruger den, når en senere forespørgsel begynder med nøjagtig de samme tokens, så kun den nye rest skal læses; udbydere tager normalt en lavere pris for genbrugte tokens.

Forklaret enkelt

Som en advokat, der allerede har læst den tykke sagsmappe - hvert nyt spørgsmål om den tager minutter, ikke en hel dag med genlæsning.

I praksis

I en dansk webshop lægger udvikleren bag kundechatten de 40 sider med leverings- og returregler først i hver forespørgsel og kundens spørgsmål til sidst; udbyderen genbruger den gemte begyndelse, så chattens månedlige regning falder markant.

Hvorfor det betyder noget

Det betaler sig kun, hvis den faste del kommer først og forbliver ord for ord den samme. Udbydere gemmer arbejdet fra minutter op til et døgn og bør aldrig dele det mellem kunder - hvor det deles, kan svarhastigheden afsløre, hvad andre har sendt.

Teknisk uddybning

Mekanisk er prompt caching bevarelse af KV-cache på tværs af forespørgsler. Efter en forespørgsels prefill gemmer serving-systemet key- og value-tensorerne for et præfiks af prompten, indekseret med en hash af den nøjagtige tokensekvens, ofte i blokke af fast størrelse, så ethvert blokjusteret præfiks kan matches. Når en ny forespørgsel kommer, slår scheduleren det længste gemte præfiks op, springer prefill over for de tokens og beregner kun resten. Da hvert tokens keys og values afhænger af alle foregående tokens, ugyldiggør ét ændret token cachen fra det punkt og frem; identisk indhold på en anden position kan ikke genbruges. Open source-motorer tilbyder samme idé som automatic prefix caching (vLLM) eller RadixAttention (SGLang, der organiserer gemte præfikser i et radix-træ).

Kommercielle API'er implementerer det på to måder, og detaljerne ændrer sig mellem modelgenerationer, så den aktuelle dokumentation er autoritativ. Anthropics API bruger eksplicitte cache_control-breakpoints (op til fire pr. forespørgsel) eller en automatisk tilstand; præfikset hashes i rækkefølgen tools, system, messages; standardlevetiden er fem minutter og forlænges ved hvert hit, med mulighed for en time; i skrivende stund koster skrivning til cachen 1,25 gange basisprisen for input (2 gange for en time) og læsning omkring 0,1 gange, med minimumslængder for præfikset, der afhænger af modellen. OpenAI cacher automatisk, når en prompt overstiger en minimumslængde (1.024 tokens på mange modeller), router forespørgsler efter en hash af de første tokens, som kan styres med en prompt_cache_key, og afregner cachede input-tokens med rabat. Googles Gemini API tilbyder både implicit caching og eksplicitte cached-content-objekter med konfigurerbar TTL.

At få cache-hits er en disciplin i promptdesign. Stabilt indhold skal først (værktøjsdefinitioner, systemprompt, referencedokumenter, few-shot-eksempler) og variabelt indhold sidst; tidsstempler, request-id'er, tilfældig rækkefølge af eksempler eller ikke-deterministisk rækkefølge af JSON-nøgler tidligt i prompten ødelægger stille og roligt hitraten. Ændringer i værktøjslisten eller modelversionen ugyldiggør også præfikset. Teams bør overvåge udbyderens forbrugsfelter for cachede og ikke-cachede input-tokens i stedet for at antage en besparelse, da endpoints med lav trafik kan opleve, at posterne udløber mellem forespørgslerne.

Sikkerhedsvinklen er en timing-sidekanal. Et cache-hit gør tiden til første token målbart kortere, så hvis en cache deles mellem brugere, kan en angriber afprøve, om et givent præfiks for nylig er sendt af en anden. Gu m.fl. (ICML 2025) auditerede kommercielle API'er med statistiske timingtests og påviste global deling af cache mellem alle brugere hos syv udbydere, på undersøgelsestidspunktet også OpenAI. De store udbydere oplyser i dag, at caches er isoleret pr. organisation eller workspace, og selvhostede installationer med flere lejere bør anvende samme isolering. Prompt caching skal også holdes adskilt fra response caching, der gemmer hele svar på identiske eller semantisk lignende forespørgsler og returnerer dem helt uden at køre modellen.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Neuralt netværk
  2. →Token
  3. →Embedding
  4. →Transformer
  5. →Attention-mekanisme
  6. →Stor sprogmodel (LLM)
  7. →KV-cache
  8. →Prompt
  9. →Prompt caching

Relationer

Forudsætter
KV-cachePrompt

Kilder og videre læsning

Officiel dokumentation

  • Anthropic documentation - Prompt caching · Anthropic
  • OpenAI API documentation - Prompt caching · OpenAI

Opslagsværker

  • Gu et al. (2025), Auditing Prompt Caching in Language Model APIs

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.