
Wat is een Transformer Model?
Een transformer model is de neurale-netwerkarchitectuur achter moderne large language models. Zijn bepalende kenmerk is attention: lagen die elk token in een sequentie direct laten wegen tegen elk ander token bij het berekenen van wat volgt. Geïntroduceerd door Google-onderzoekers in 2017, verving het sequentiële architecturen omdat het efficiënt parallel traint op GPU's. Het originele model kondigde zichzelf aan met resultaten: 28,4 BLEU op WMT 2014 Engels-naar-Duits-vertaling, en versloeg het vorige beste, ensembles inbegrepen, met meer dan 2 BLEU [1].
De belangrijkste punten
- Bijna elk model dat een engineer in 2026 aanraakt, van GPT en Claude tot Gemini, Llama, en codegerichte modellen, is een transformer of een nauwe variant.
- De superkracht van de architectuur is parallelle training: alle tokens in een sequentie worden tegelijk verwerkt, wat biljoen-token-pretraining-runs economisch haalbaar maakte. Dat recept schalen produceerde de 175 miljard parameters van GPT-3 in 2020, tien keer meer dan enig eerder niet-sparse taalmodel [2].
- Zijn belangrijkste kosten zitten in het attention-mechanisme, wier werk kwadratisch groeit met sequentielengte. Contextvensterlimieten, long-prompt-prijsstelling, en de KV-cache zijn allemaal hierop terug te voeren.
- Varianten zoals mixture of experts veranderen hoeveel van het netwerk activeert per token, wat inferentiekosten verlaagt terwijl dezelfde basisarchitectuur behouden blijft.
Hoe het werkt
Een transformer is een stapel identieke blokken, elk met twee hoofddelen. De attention-lagen laten elk token informatie verzamelen van de rest van de sequentie, zodat het token voor "het" context kan trekken van het zelfstandig naamwoord waarnaar het veertig woorden eerder verwijst. De feed-forward-lagen transformeren dan de representatie van elk token onafhankelijk, en hier wordt gedacht dat veel van de feitelijke kennis van het model resideert. Stapel een paar dozijn tot meer dan honderd van deze blokken, voeg een embedding-laag onderaan toe om token-ID's om te zetten naar vectoren en een projectie bovenaan om het volgende token te scoren, en je hebt de machinerie achter elke moderne LLM.
Tekstgeneratie draait de stapel eenmaal per outputtoken. Tijdens training verwerkt het model echter hele sequenties parallel, en berekent het gelijktijdig een next-token-voorspelling op elke positie. Die parallelliteit is de historische reden dat transformers wonnen: eerdere recurrente netwerken moesten tekst één stap tegelijk lezen, wat training op internetschaal onpraktisch maakte. Het verschil toonde zich onmiddellijk, want de auteurs van 2017 trainden hun model naar state-of-the-art-vertaalkwaliteit in 3,5 dagen op acht GPU's, een fractie van de trainingskosten van eerdere architecturen [3].
Voor practitioners verklaart de architectuur de beperkingen die je via een API voelt. Attention vergelijkt elk tokenpaar, dus verviervoudigt het verdubbelen van promptlengte ruwweg attention-rekenkracht, wat waarom lange contexten meer kosten en waarom aanbieders eromheen engineerden met sliding-window-attention en andere sparse varianten. De per-token-status die attention nodig heeft wordt opgeslagen in de KV-cache, en hem hergebruiken is wat prompt caching zo'n grote korting maakt op herhaalde prefixen.
Voorbeeld
Een engineer merkt dat hun coding-agent scherpere antwoorden krijgt wanneer de falende test direct naast de geteste functie in de prompt verschijnt, in plaats van gescheiden door 30.000 tokens directorylijsten. Dat is transformer-gedrag dat doorschijnt. Attention kan in principe elke twee posities verbinden, maar retrievalkwaliteit verslechtert in het midden van zeer lange contexten. Het team herschrijft hun contextsamenstelling om verwant bewijs te co-lokaliseren en de ruis ertussen samen te vatten, en het fixpercentage van de agent op hun evalsuite verbetert meetbaar zonder enige modelwijziging.
Veelvoorkomende misvattingen
De gangbare misvatting is dat een transformer tekst sequentieel verwerkt, van links naar rechts leest zoals een mens dat doet. Binnen één forward pass wordt elk token gelijktijdig verwerkt, en volgorde wordt geleverd als positionele informatie in plaats van door de mechanica van lezen. Het sequentiële deel is generatie, dat één token tegelijk toevoegt. Dit onderscheid doet er praktisch toe: prompts worden parallel en snel opgenomen, terwijl output token voor token ontstaat, wat precies waarom time to first token en generatiesnelheid zich gedragen als twee aparte prestatiecijfers tijdens AI-inferentie.
FAQ
Waar komt de naam "transformer" vandaan? Van het paper "Attention Is All You Need" uit 2017, dat een architectuur introduceerde die de ene sequentie transformeert naar een andere met alleen attention, en de recurrentie en convoluties liet vallen waar eerdere modellen op leunden. De naam bleef hangen terwijl de architectuur zich ver voorbij vertaling verspreidde.
Worden transformers alleen voor taal gebruikt? Nee. Vision transformers behandelen beelden, en dezelfde architectuur onderbouwt audiomodellen, eiwitstructuurmodellen, en de multimodale AI-systemen die tekst met beelden mengen. Alles uitdrukbaar als een sequentie tokens is eerlijk spel.
Zal iets de transformer vervangen? Alternatieven zoals state-space-modellen verwerken lange sequenties met betere schaling en verschijnen in hybride ontwerpen. Per 2026 blijven frontier-productiemodellen transformer-gebaseerd, met innovatie die binnen het recept gebeurt, in attention-varianten, expert-routering, en trainingsmethoden, in plaats van door volledige vervanging.
Bronnen
- Vaswani et al. "Attention Is All You Need: 28,4 BLEU op WMT 2014 Engels-naar-Duits, meer dan 2 BLEU boven het vorige beste." https://arxiv.org/abs/1706.03762. Geraadpleegd augustus 2026.
- OpenAI. "Language Models are Few-Shot Learners: GPT-3 getraind met 175 miljard parameters." https://arxiv.org/abs/2005.14165. Geraadpleegd augustus 2026.
- Vaswani et al. "Attention Is All You Need: state-of-the-art-vertaalkwaliteit na 3,5 dagen training op acht GPU's." https://arxiv.org/abs/1706.03762. Geraadpleegd augustus 2026.
Related terms
Ready to build your product?

