
Wat is Prompt Caching?
Prompt caching is een inferentie-optimalisatie die de berekende interne status van een herhaald promptprefix opslaat, zodat latere API-aanroepen die dat prefix hergebruiken, het niet opnieuw hoeven te verwerken. Voor agents die bij elke beurt een grote systeemprompt, tooldefinities, en groeiende gespreksgeschiedenis opnieuw versturen, verlaagt het inputkosten dramatisch en verlaagt het time to first token.
De belangrijkste punten
- Caching werkt op exacte prefixen. Alles voor het eerste gewijzigde token kan hergebruikt worden; alles erna wordt opnieuw berekend, dus moet stabiele content eerst komen.
- De besparingen zijn groot en reëel: gecachete inputtokens worden doorgaans gefactureerd tegen een kleine fractie van het normale tarief, vaak rond een tiende, en lange prompts beginnen merkbaar sneller te antwoorden.
- Agent-workloads zijn het ideale geval, want elke beurt verstuurt dezelfde systeemprompt, toolschema's, en eerder transcript opnieuw met maar een beetje nieuw materiaal toegevoegd.
- Cache-items verlopen na minuten inactiviteit bij de meeste aanbieders, dus bevoordeelt de economie actieve sessies en hoogverkeer-prompts, niet incidentele aanroepen.
Hoe het werkt
Voordat het iets genereert, verwerkt een transformer-model de hele inputprompt en bouwt interne attention-status op, opgeslagen in wat de KV-cache heet. Dat prefillwerk schaalt met promptlengte en is een groot aandeel van inferentiekosten. Prompt caching houdt die berekende status op de servers van de aanbieder na afloop van een verzoek. Wanneer het volgende verzoek arriveert met een byte-identiek prefix, laadt de server de opgeslagen status en begint verwerking bij het eerste nieuwe token in plaats van bij token nul. De winst schaalt met prefixlengte: Anthropic meldt besparingen tot 90% op kosten en 85% op latentie voor lange prompts, en in zijn gepubliceerde voorbeeld van 2025 verlaagde chatten met een gecacht document van 100.000 tokens de time to first token van 11,5 seconden naar 2,4 seconden [1].
De exacte-prefix-regel drijft al het praktische engineeringwerk. Aanbieders verschillen in mechaniek: sommige vereisen expliciete cache-breekpunten gemarkeerd in het verzoek, andere cachen automatisch boven een minimale prefixlengte, en cache-levensduren lopen van een paar minuten standaard tot langere vensters tegen extra kosten. Azure OpenAI documenteert bijvoorbeeld een minimum identiek prefix van 1.024 tokens voordat caching aanslaat, met cache-leesbeurten verdisconteerd op inputtokenprijsstelling tot een korting van 100% op Provisioned-implementaties (2026) [2]. In elk geval maakt één gewijzigd teken alles daarna ongeldig. Promptstructuur volgt daarom een stabiliteitsgradiënt: systeemprompt en tooldefinities eerst, dan few-shot-voorbeelden en referentiedocumenten, dan gespreksgeschiedenis, met het vluchtige per-verzoek-materiaal laatst. Een klassieke zelf toegebrachte mislukking is een tijdstempel of verzoek-ID interpoleren nabij de top van de systeemprompt, wat stilletjes caching uitschakelt voor de hele prompt bij elke aanroep.
Multi-turn-agentlussen versterken het voordeel. Het transcript groeit door toevoeging, dus is de prompt van beurt N een prefix van beurt N+1. Elke beurt betaalt de volle prijs alleen voor de nieuwste toolresultaten en berichten terwijl al het eerdere de cache raakt. Dit is een groot deel van waarom lange agentic-coding-sessies met zescijferige tokencontexten economisch überhaupt levensvatbaar zijn.
Voorbeeld
Een team draait een codereview-agent op elke pull request. Elke run verstuurt een prompt van 30.000 tokens: codeerstandaarden, tooldefinities, en repositoryconventies, gevolgd door de diff, die gemiddeld 2.000 tokens is. Zonder caching betaalt elke review voor 32.000 inputtokens prefill. Ze herstructureren de prompt zodat de stabiele 30.000 tokens het prefix vormen en markeren het als cacheable, en houden runs warm tijdens kantooruren door reviews te batchen. Nu betaalt een typische review de volle prijs voor ongeveer 2.000 nieuwe tokens plus het verdisconteerde gecachte tarief op de rest, en reviews beginnen sneller terug te streamen. Hun ene bug onderweg: een "gegenereerd op"-tijdstempel zat in de standaardenheader, wat de cache bij elke individuele run ongeldig maakte tot iemand het naar het einde van de prompt verplaatste.
Veelvoorkomende misvattingen
Het terugkerende misverstand is verwachten dat caching werkt als een webcache met vage of gedeeltelijke matching. Het matcht niet op gelijkenis, en het cachet geen antwoorden. Twee prompts die 99 procent identiek zijn maar verschillen bij token 50 delen alleen de eerste 49 tokens gecacht werk. Niets aan de output van het model wordt opgeslagen of afgespeeld; hetzelfde gecachte prefix kan nog steeds verschillende completions produceren. Prompt caching bespaart herberekening van input, en alleen voor prefixen die exact matchen.
FAQ
Verandert prompt caching de output van het model? Nee. De gecachte status is wiskundig identiek aan wat het prefix herberekenen zou produceren, dus antwoordkwaliteit en variabiliteit blijven onaangetast. Alleen kosten en latentie veranderen.
Is prompt caching hetzelfde als de KV-cache? Ze zijn verwante lagen. De KV-cache is de in-memory-attention-status die elke transformer opbouwt tijdens het verwerken van elk verzoek. Prompt caching is de productfunctie die die status persisteert over aparte API-aanroepen heen en hergebruikte tokens tegen een korting prijst.
Is gecachte promptdata een privacyrisico? Gecachte status leeft serverzijdig bij de aanbieder en is afgebakend zodat andere klanten je cache-items niet kunnen raken; grote aanbieders sleutelen caches per organisatie. Het volgt het normale databewaarbeleid van de aanbieder, maar teams met strikte dataresidentie-eisen zouden moeten verifiëren hoe lang gecachte status persisteert en waar.
Bronnen
- Anthropic. "Kosten- en latentieverlagingen van prompt caching, inclusief het voorbeeld van het document van 100.000 tokens." https://claude.com/blog/prompt-caching. Geraadpleegd augustus 2026.
- Microsoft Learn. "Minimumprefix en cache-leeskortingen van Azure OpenAI prompt caching." https://learn.microsoft.com/en-us/azure/ai-services/openai/how-to/prompt-caching. Geraadpleegd augustus 2026.
Related terms
Ready to build your product?

