Hero Image full

Tokenization

7 min read
Content

Wat is Tokenization?

Tokenization is het proces van tekst opsplitsen in tokens, de kleine stukken die een taalmodel daadwerkelijk leest, met een vast vocabulaire geleerd uit trainingsdata. Gangbare woorden worden enkele tokens terwijl zeldzame woorden opbreken in fragmenten, en elke model-API meet kosten en contextlimieten in de tokens die dit proces produceert. Als referentiepunt mapt Anthropics tokenizer ruwweg 3,5 Engelse tekens naar één token, met de verhouding variërend per taal [1].

De belangrijkste punten

  • Tokenization gebeurt voordat het model iets ziet. Tekst gaat erin, een reeks vocabulaire-ID's komt eruit, en die ID's zijn het volledige gezichtsveld van het model op je input.
  • Het vocabulaire is geleerd op frequentie, wat waarom Engels proza efficiënt tokeniseert terwijl code, JSON, en niet-Engelse talen twee tot vier keer meer tokens kunnen kosten voor equivalente content.
  • Verschillende modelfamilies gebruiken verschillende tokenizers, dus heeft dezelfde prompt verschillende tokenaantallen, en verschillende kosten, over aanbieders heen.
  • Verschillende klassieke LLM-mislukkingen zijn te herleiden tot tokenization, inclusief zwakke letterherkenning en brozen rekenkunde, want het model ziet stukken in plaats van tekens.

Hoe het werkt

Moderne modellen gebruiken subword-tokenization, meestal byte-pair encoding (BPE) of een nauwe variant. Vocabulaireconstructie begint bij ruwe bytes en voegt herhaaldelijk de meest frequente aangrenzende paren samen gevonden in een trainingscorpus, tot het vocabulaire een doelgrootte bereikt, typisch 50.000 tot 200.000 items. Vocabulairegrootte is een echte efficiëntiehendel: Meta meldde in 2024 dat het vocabulaire van 128K-tokens van Llama 3 tot 15% minder tokens oplevert op dezelfde tekst vergeleken met Llama 2 [2]. Frequente strings zoals "function" of " de" eindigen als enkele items. Zeldzame strings overleven alleen als fragmenten: een verzonnen woord zoals "flimbork" kan tokeniseren als "fl", "imb", "ork". Omdat de basiseenheden bytes zijn, kan elke input getokeniseerd worden, inclusief emoji, typfouten, en binair-ogende strings, zonder onbekend-woord-mislukkingen.

Op verzoekmoment matcht de tokenizer gulzig je tekst tegen dit vocabulaire en geeft het model een lijst integer-ID's. Binnen het model wordt elk ID gemapt naar een vector-embedding voordat de transformer-lagen het verwerken. Generatie keert de pipeline om: het model kiest een token-ID, de tokenizer decodeert het terug naar tekst, en streaming-API's sturen die gedecodeerde fragmenten naar je terminal zodra ze arriveren.

De engineeringgevolgen zijn vooral economisch. Tokenaantal, niet tekenaantal, beslist wat past in een contextvenster en wat een verzoek kost. Witruimte-afhandeling doet er ook toe: diep ingesprongen code, mooi geformatteerde JSON, en lange UUID's zijn allemaal token-duur, wat waarom payloads minifiëren en inspringing normaliseren echte kostenoptimalisaties zijn in agentpipelines.

Voorbeeld

Een team bouwt een agent die API-antwoorden reviewt op anomalieën en geeft aanvankelijk mooi geformatteerde JSON door in de prompt. Een typische payload van 80 KB komt op ongeveer 30.000 tokens. Een engineer wijzigt de pipeline om witruimte te strippen, herhaalde sleutels te verkorten, en velden te laten vallen die de reviewer nooit gebruikt. Dezelfde payload tokeniseert nu op ongeveer 9.000 tokens. Over een paar duizend runs per dag verlaagt die ene wijziging inputuitgave met ruwweg tweederde en laat het speelruimte in het contextvenster voor langere gespreksgeschiedenis, zonder enige model- of promptwijziging.

Veelvoorkomende misvattingen

De klassieke misvatting is dat modellen tekens of hele woorden lezen. Ze lezen tokens, en dat verklaart een familie anders raadselachtige mislukkingen. Vraag een model hoe vaak de letter "r" voorkomt in "strawberry" en het kan verkeerd tellen, want het neemt het woord waar als twee of drie ondoorzichtige stukken, geen elf letters. Hetzelfde geldt voor strings omkeren, precieze tekenoffsets, en rekenkunde op cijferniveau. Wanneer een agent teken-exacte operaties nodig heeft, is het betrouwbare patroon hem een tool te laten aanroepen of code te laten schrijven voor de operatie in plaats van te antwoorden vanuit perceptie.

FAQ

Is tokenization hetzelfde als embedding? Nee, het zijn opeenvolgende stappen. Tokenization splitst tekst in vocabulaire-ID's. Embedding mapt dan elk ID naar een numerieke vector waarmee het netwerk kan rekenen. Tokenization is lossless en omkeerbaar; embeddings zijn geleerde representaties van betekenis.

Waarom kosten dezelfde woorden verschillende bedragen op verschillende modellen? Elke aanbieder traint zijn eigen tokenizer op zijn eigen corpus, dus verschillen vocabulaires. Een prompt die 1.000 tokens is op het ene model kan 1.150 zijn op een ander. Vergelijk bij het vergelijken van modelprijsstelling de kosten voor je daadwerkelijke workload, niet de per-token-sticker-prijs.

Kan ik tokens tellen voordat ik een verzoek verstuur? Ja. Aanbieders leveren tokenizer-libraries en tokentelling-endpoints die exacte aantallen teruggeven voor een gegeven model. Gebruik ze om budgetten af te dwingen, chunks voor retrieval te formaten, en kosten te voorspellen, in plaats van te schatten uit woordaantallen.

Bronnen

  1. Anthropic. "Claude-woordenlijst: één token benadert 3,5 Engelse tekens." https://platform.claude.com/docs/en/about-claude/glossary. Geraadpleegd augustus 2026.
  2. Meta AI. "Introductie van Meta Llama 3: vocabulaire van 128K tokens met tot 15% minder tokens dan Llama 2." https://ai.meta.com/blog/meta-llama-3/. Geraadpleegd augustus 2026.
Let’s get in touch

Ready to build your product?

Book a consultation call to get a free No-Code assessment and scope estimation for your project.
Book a consultation call to get a free No-Code assessment and scope estimation for your project.