Prompt caching
Også kendt som: context caching
En funktion, der gemmer arbejdet med starten af en prompt, så senere forespørgsler, der starter ens, bliver hurtigere og billigere.
Kladde - dette opslag er endnu ikke gennemgået.
Formelt
En funktion i modelservering, der i kort tid gemmer KV-cache for den første del af en prompt og genbruger den, når en senere forespørgsel begynder med nøjagtig de samme tokens, så kun den nye rest skal læses; udbydere tager normalt en lavere pris for genbrugte tokens.
Forklaret enkelt
Som en advokat, der allerede har læst den tykke sagsmappe - hvert nyt spørgsmål om den tager minutter, ikke en hel dag med genlæsning.
I praksis
I en dansk webshop lægger udvikleren bag kundechatten de 40 sider med leverings- og returregler først i hver forespørgsel og kundens spørgsmål til sidst; udbyderen genbruger den gemte begyndelse, så chattens månedlige regning falder markant.
Hvorfor det betyder noget
Det betaler sig kun, hvis den faste del kommer først og forbliver ord for ord den samme. Udbydere gemmer arbejdet fra minutter op til et døgn og bør aldrig dele det mellem kunder - hvor det deles, kan svarhastigheden afsløre, hvad andre har sendt.
Teknisk uddybning
Mekanisk er prompt caching bevarelse af KV-cache på tværs af forespørgsler. Efter en forespørgsels prefill gemmer serving-systemet key- og value-tensorerne for et præfiks af prompten, indekseret med en hash af den nøjagtige tokensekvens, ofte i blokke af fast størrelse, så ethvert blokjusteret præfiks kan matches. Når en ny forespørgsel kommer, slår scheduleren det længste gemte præfiks op, springer prefill over for de tokens og beregner kun resten. Da hvert tokens keys og values afhænger af alle foregående tokens, ugyldiggør ét ændret token cachen fra det punkt og frem; identisk indhold på en anden position kan ikke genbruges. Open source-motorer tilbyder samme idé som automatic prefix caching (vLLM) eller RadixAttention (SGLang, der organiserer gemte præfikser i et radix-træ).
Kommercielle API'er implementerer det på to måder, og detaljerne ændrer sig mellem modelgenerationer, så den aktuelle dokumentation er autoritativ. Anthropics API bruger eksplicitte cache_control-breakpoints (op til fire pr. forespørgsel) eller en automatisk tilstand; præfikset hashes i rækkefølgen tools, system, messages; standardlevetiden er fem minutter og forlænges ved hvert hit, med mulighed for en time; i skrivende stund koster skrivning til cachen 1,25 gange basisprisen for input (2 gange for en time) og læsning omkring 0,1 gange, med minimumslængder for præfikset, der afhænger af modellen. OpenAI cacher automatisk, når en prompt overstiger en minimumslængde (1.024 tokens på mange modeller), router forespørgsler efter en hash af de første tokens, som kan styres med en prompt_cache_key, og afregner cachede input-tokens med rabat. Googles Gemini API tilbyder både implicit caching og eksplicitte cached-content-objekter med konfigurerbar TTL.
At få cache-hits er en disciplin i promptdesign. Stabilt indhold skal først (værktøjsdefinitioner, systemprompt, referencedokumenter, few-shot-eksempler) og variabelt indhold sidst; tidsstempler, request-id'er, tilfældig rækkefølge af eksempler eller ikke-deterministisk rækkefølge af JSON-nøgler tidligt i prompten ødelægger stille og roligt hitraten. Ændringer i værktøjslisten eller modelversionen ugyldiggør også præfikset. Teams bør overvåge udbyderens forbrugsfelter for cachede og ikke-cachede input-tokens i stedet for at antage en besparelse, da endpoints med lav trafik kan opleve, at posterne udløber mellem forespørgslerne.
Sikkerhedsvinklen er en timing-sidekanal. Et cache-hit gør tiden til første token målbart kortere, så hvis en cache deles mellem brugere, kan en angriber afprøve, om et givent præfiks for nylig er sendt af en anden. Gu m.fl. (ICML 2025) auditerede kommercielle API'er med statistiske timingtests og påviste global deling af cache mellem alle brugere hos syv udbydere, på undersøgelsestidspunktet også OpenAI. De store udbydere oplyser i dag, at caches er isoleret pr. organisation eller workspace, og selvhostede installationer med flere lejere bør anvende samme isolering. Prompt caching skal også holdes adskilt fra response caching, der gemmer hele svar på identiske eller semantisk lignende forespørgsler og returnerer dem helt uden at køre modellen.
Hvad du bør lære først
Alt det, dette bygger på - grundlaget først.
Relationer
- Bruges sammen med
- Tid til første token (TTFT)Systemprompt
Kilder og videre læsning
Officiel dokumentation
- Anthropic documentation - Prompt caching · Anthropic
- OpenAI API documentation - Prompt caching · OpenAI
Opslagsværker
- Gu et al. (2025), Auditing Prompt Caching in Language Model APIs
Hvor dataene kommer fra
Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.
Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON
Test dig selv
Indlæser…