Hero Image full

LLM Token

7 min read
Content

Wat is een LLM Token?

Een LLM-token is de eenheid waarin een taalmodel tekst leest en schrijft: een klein stuk tekens, gemiddeld ongeveer driekwart Engels woord. Tokens zijn ook de facturatie-eenheid voor elke model-API, dus bepalen tokenaantallen zowel wat in een verzoek past als wat elk verzoek kost.

De belangrijkste punten

  • Vuistregel voor Engels: 1 token is ruwweg 4 tekens, en 1.000 tokens is ruwweg 750 woorden. Anthropics eigen documentatie stelt het op ongeveer 3,5 Engelse tekens per token voor Claude-modellen, met de exacte verhouding variërend per taal [1]. Code is dichter in tokens vanwege symbolen en witruimte.
  • Elke API-rekening wordt uitgedrukt in tokens, waarbij outputtokens doorgaans meerdere keren duurder geprijsd zijn dan inputtokens. Agent-runs zijn meestal input-zwaar, en daarom doet prompt caching er zoveel toe.
  • De tokenlimiet die je in de praktijk raakt is het contextvenster: het maximale aantal tokens dat een model in één verzoek kan verwerken, de prompt, het gesprek tot nu toe, en het antwoord samen dekkend.
  • Agents verbranden tokens snel. Elk toolresultaat, bestandslezing, en eerdere beurt wordt bij elke stap opnieuw verstuurd, dus kan een enkele codingtaak honderdduizenden inputtokens verbruiken.

Hoe het werkt

Modellen zien nooit ruwe tekst. Voordat een verzoek draait, splitst een tokenizer de input in stukken uit een vast vocabulaire, typisch 50.000 tot 200.000 items geleerd tijdens training, een proces uitgebreider behandeld onder tokenisatie. Gangbare woorden zoals "de" krijgen één token. Zeldzamere strings splitsen in fragmenten: "kubectl" kan worden "ku", "bect", "l". Elk token mapt naar een ID, en die ID's zijn wat het model daadwerkelijk verwerkt. Generatie draait op dezelfde manier omgekeerd, met het model dat één token tegelijk afgeeft tot het klaar is.

Prijsstelling volgt mechaniek. Aanbieders meten inputtokens (alles wat je stuurt) en outputtokens (alles wat het model genereert) tegen aparte tarieven, en die tarieven zijn ingestort: Stanfords AI Index van 2025 vond dat de inferentiekosten van een GPT-3.5-niveau-systeem meer dan 280-voudig daalden per miljoen tokens tussen november 2022 en oktober 2024 [2]. Reasoning-modellen voegen een derde emmer toe, denktokens, waarvoor je betaalt als output ook al verschijnen ze mogelijk nooit in het antwoord. Omdat agentlussen het groeiende transcript bij elke stap opnieuw versturen, groeien totale inputtokens ruwweg kwadratisch met gespreklengte. Dat is de enige grootste hendel op agentkosten, en daarom vatten teams tooloutput samen, snijden transcripten bij, en cachen stabiele promptprefixen.

Voorbeeld

Een engineer vraagt een coding-agent een falende test te herstellen. De systeemprompt en tooldefinities komen op 6.000 tokens. De agent leest drie bronbestanden van elk 4.000 tokens, draait de testsuite twee keer met 2.000 tokens output per run, en werkt door acht redeneerbeurten. Bij de laatste stap draagt elk verzoek het volledige opgestapelde transcript, en de run totaliseert ongeveer 350.000 inputtokens en 9.000 outputtokens. Met prompt caching op het stabiele prefix factureert het meeste van die inputtokens tegen een zware korting, wat de run verlaagt van een paar dollar naar ruim onder één. Niemand typte 350.000 tokens; de lus deed dat.

Veelvoorkomende misvattingen

Mensen behandelen tokens als woorden en schatten kosten uit woordaantallen. De fout stapelt slecht op bij echte workloads. Code, JSON, URL's, en niet-Engelse tekst tokeniseren veel minder efficiënt dan Engels proza, soms met één token per teken. Een Engels document van 2.000 woorden en een equivalent van 2.000 woorden in het Japans of een JSON-payload van vergelijkbare visuele lengte kunnen drie keer of meer verschillen in tokenaantal. Meet met het tokentelling-endpoint van de aanbieder in plaats van lengte te schatten, vooral voordat je een per-verzoek-budget vastlegt.

FAQ

Wat is een tokenlimiet? De tokenlimiet, meestal het contextvenster genoemd, is het maximale aantal tokens dat een model in één verzoek aankan, input en output samen. Huidige productiemodellen bieden gangbaar 200.000 tot meer dan een miljoen tokens. Overschrijd het en de API wijst het verzoek af of de oudste content wordt afgesneden.

Hoeveel tokens is een typisch woord? In het Engels ongeveer 1,3 tokens per woord gemiddeld. Korte gangbare woorden zijn één token; lange, zeldzame, of technische woorden splitsen in verschillende. De verhouding is slechter voor code en voor de meeste talen anders dan Engels.

Waarom factureren aanbieders per token in plaats van per verzoek? Rekenkosten schalen met verwerkte tokens, niet met verzoeken. Een vraag van tien woorden en een document van honderd pagina's zijn wild verschillende workloads, en tokenprijsstelling volgt de daadwerkelijke GPU-tijd die elk verbruikt tijdens AI-inferentie. De betrokken volumes zijn verbluffend: Google meldde meer dan 480 biljoen tokens per maand te verwerken over zijn producten en API's per mei 2025, een stijging van 50x ten opzichte van 9,7 biljoen een jaar eerder [3].

Bronnen

  1. Anthropic. "Claude-woordenlijst: één token benadert 3,5 Engelse tekens." https://platform.claude.com/docs/en/about-claude/glossary. Geraadpleegd augustus 2026.
  2. Stanford HAI. "AI Index Report 2025: inferentiekosten op GPT-3.5-niveau daalden meer dan 280-voudig per miljoen tokens, november 2022 tot oktober 2024." https://hai.stanford.edu/ai-index/2025-ai-index-report. Geraadpleegd augustus 2026.
  3. Google. "I/O 2025-keynote: meer dan 480 biljoen tokens maandelijks verwerkt, een stijging van 50x jaar-op-jaar." https://blog.google/technology/ai/io-2025-keynote/. Geraadpleegd augustus 2026.
Let’s get in touch

Ready to build your product?

Book a consultation call to get a free No-Code assessment and scope estimation for your project.
Book a consultation call to get a free No-Code assessment and scope estimation for your project.