
Wat is Chain-of-Thought Prompting?
Chain-of-thought prompting is de techniek van een taalmodel instrueren om stap voor stap door een probleem te werken voordat het zijn eindantwoord geeft, in plaats van meteen te antwoorden. De tussenliggende redenering expliciet maken verbetert meetbaar de nauwkeurigheid bij wiskunde, logica, planning, en meerstaps taken, en het laat een zichtbaar spoor achter dat je kunt inspecteren wanneer het antwoord fout is. In het originele paper van 2022 door Wei et al. bij Google bereikte een model met 540B parameters, geprompt met slechts acht chain-of-thought-voorbeelden, state-of-the-art-nauwkeurigheid op de GSM8K-wiskundebenchmark, en versloeg het zelfs een fine-getuned GPT-3 met een verifier [1].
De belangrijkste punten
- De winst komt uit generatievolgorde. Eerst redeneringstokens produceren geeft het model berekende tussenresultaten om op te conditioneren wanneer het zich vastlegt op een antwoord.
- Het helpt het meest bij meerstaps problemen: rekenkunde, logica, planning, debuggen. Bij simpele opzoekingen en classificatie voegt het tokens toe zonder nauwkeurigheid toe te voegen.
- Het zichtbare spoor is een debugtool. Wanneer het antwoord fout is, toont de redenering meestal welke stap brak, wat een kaal antwoord nooit onthult.
- Reasoning-modellen hebben de techniek in training geabsorbeerd. Ze genereren standaard interne chains of thought, dus doet er expliciet om vragen minder toe bij die modellen dan in de begindagen.
Hoe het werkt
Taalmodellen genereren één token tegelijk, elk geconditioneerd op alles ervoor. Wanneer een model een meerstaps vraag direct beantwoordt, moet het in een handvol tokens bij de conclusie landen, zonder ruimte om de tussenstappen te berekenen. Chain-of-thought prompting verandert de vorm van de output: het model schrijft eerst de substappen uit, en elke geschreven stap wordt context voor de volgende. Tegen de tijd dat het eindantwoord arriveert, is het geconditioneerd op een uitgewerkte oplossing in plaats van een vermoeden. In effect besteedt het model meer rekenkracht aan het probleem door meer tokens te schrijven.
Het triggeren is simpel. Zero-shot chain-of-thought voegt een instructie toe zoals "denk stap voor stap na voordat je antwoordt." Die zin alleen al draagt verrassend gewicht: Kojima et al. vonden in 2022 dat het toevoegen van "Let's think step by step" de zero-shot-nauwkeurigheid van InstructGPT tilde van 17,7% naar 78,7% op MultiArith en van 10,4% naar 40,7% op GSM8K [2]. Few-shot-promptingversies bevatten uitgewerkte voorbeelden die de redeneerstijl demonstreren, wat het model ook leert hoe granulair de stappen moeten zijn. Gestructureerde varianten vragen om redenering binnen dedicated tags of een scratchpad-veld, en laten dan code die sectie strippen en alleen het antwoord houden. Sampling helpt ook: self-consistency, dat verschillende chains of thought genereert en het meerderheidsantwoord neemt, verhoogde chain-of-thought-prestaties met 17,9 punten op GSM8K, 11,0 op SVAMP, en 12,2 op AQuA in Wang et al.'s studie van 2022 [3].
De techniek bleek belangrijk genoeg om van prompting naar training te verhuizen. Een reasoning-model is getraind om lange interne chains of thought te produceren voordat het antwoordt, en besteedt variabele hoeveelheden rekenkracht afhankelijk van moeilijkheid. Voor die modellen is een expliciete "denk stap voor stap" grotendeels overbodig, hoewel vragen om hun redenering te tonen of structureren nog steeds waarde heeft voor auditeerbaarheid.
Voorbeeld
Een platformteam gebruikt een model om productie-incidenten te triageren. Direct gevraagd "welke service veroorzaakte deze uitval?" met een bundel logs, neigt het model de service te noemen die het vaakst in de foutmeldingen verschijnt, wat meestal een slachtoffer is, geen oorzaak. Ze herschrijven de prompt om een keten te forceren: som de waargenomen symptomen op in tijdstempelvolgorde, identificeer welke service de vroegste anomalie logde, traceer welke upstream-afhankelijkheid die anomalie kon produceren, en noem pas dan een root-cause-kandidaat met het onderbouwende bewijs. Nauwkeurigheid op hun afgespeelde incidentset verbetert merkbaar, en wanneer het model er nog één fout krijgt, kan de dienstdoende engineer precies zien welke inferentiestap ontspoorde en het corrigeren.
Veelvoorkomende misvattingen
De grote misvatting is de chain of thought lezen als een getrouw transcript van de berekening van het model. Dat is het niet. Modellen produceren soms een aannemelijk ogende redenering en een antwoord dat er niet daadwerkelijk uit volgt, of bereiken een antwoord om redenen die de geschreven keten nooit noemt. Behandel de keten als een kwaliteitsverbeterende steiger en een nuttig debugsignaal, nooit als bewijs van correctheid. Verificatie moet nog steeds komen van tests, checks, of review buiten het model.
FAQ
Is chain of thought hetzelfde als een reasoning-model? Nee. Chain of thought is een promptingtechniek die elk model op inferentiemoment kan volgen. Een reasoning-model heeft dat gedrag getraind en wijst zijn eigen denkbudget toe. De techniek kwam eerst; de modellen productiseerden het.
Doet chain-of-thought prompting er in 2026 nog toe? Ja, met smaller bereik. Bij reasoning-modellen voegt de generieke "denk stap voor stap" weinig toe, maar domeinspecifieke redeneerstructuur, zoals de geordende triagestappen in het voorbeeld hierboven, stuurt modellen nog steeds naar de juiste procedure. Bij snelle non-reasoning-modellen gebruikt om kostenredenen blijft klassieke chain of thought een van de goedkoopste beschikbare nauwkeurigheidsupgrades.
Moet ik de redenering aan eindgebruikers tonen? Meestal niet. Ketens zijn omslachtig, af en toe fout op gênante manieren, en niet geschreven voor leesbaarheid. Het gangbare patroon is redenering genereren in een gestructureerd veld, het loggen voor debugging en evals, en alleen het eindantwoord tonen.
Bronnen
- Wei et al. (Google), arXiv (Chain-of-Thought Prompting). "Model met 540B parameters met acht chain-of-thought-voorbeelden behaalde state-of-the-art GSM8K-nauwkeurigheid, en overtrof fine-getuned GPT-3 met een verifier." https://arxiv.org/abs/2201.11903. Geraadpleegd augustus 2026.
- Kojima et al., arXiv (Large Language Models are Zero-Shot Reasoners). "'Let's think step by step' tilde de zero-shot-nauwkeurigheid van InstructGPT van 17,7% naar 78,7% op MultiArith en 10,4% naar 40,7% op GSM8K." https://arxiv.org/abs/2205.11916. Geraadpleegd augustus 2026.
- Wang et al. (Google), arXiv (Self-Consistency). "Self-consistency verhoogde chain-of-thought-prestaties met +17,9% op GSM8K, +11,0% op SVAMP, en +12,2% op AQuA." https://arxiv.org/abs/2203.11171. Geraadpleegd augustus 2026.
Related terms
Ready to build your product?

