Hero Image full

ReAct-agent

7 min read
Content

Wat is een ReAct-agent?

Een ReAct-agent is een AI-agent gebouwd op het Reasoning-and-Acting-patroon: het model schrijft een gedachte over wat vervolgens te doen, onderneemt één actie zoals een tool-aanroep, observeert het resultaat, en herhaalt de cyclus tot de taak klaar is. Expliciete redenering met acties interleaven aardt elke beslissing in echte observaties.

De belangrijkste punten

  • De lus is gedachte, actie, observatie, herhaald. Redeneren voor elke actie en het resultaat erna lezen is wat ReAct onderscheidt van plan-alles-vooraf-ontwerpen.
  • Grounding is het punt. Omdat de agent echte tooloutput tussen stappen observeert, corrigeert hij koers wanneer de realiteit zijn aannames tegenspreekt in plaats van vooruit te hallucineren.
  • ReAct komt uit een onderzoekspaper van 2022 door Yao en collega's, en werd het standaardskelet voor tool-gebruikende agents. Het originele paper versloeg imitatie- en reinforcement-learning-baselines met 34% en 10% absoluut slagingspercentage op ALFWorld en WebShop met slechts één of twee in-context-voorbeelden [1]. Moderne native tool-calling-lussen zijn zijn directe afstammelingen.
  • Elke iteratie kost tokens en wall-clock-tijd, dus hebben productie-ReAct-agents staplimieten, lusdetectie, en een duidelijke stopconditie nodig.

Hoe het werkt

De agent ontvangt een taak en een beschrijving van beschikbare tools. Bij elke beurt produceert het model een redeneerspoor, in de geest van chain-of-thought-prompting, dat de situatie beoordeelt: wat is bekend, wat ontbreekt, welke tool zou helpen. Hij geeft dan één actie af, een gestructureerde tool-aanroep met argumenten. De runtime voert de actie uit en voegt de observatie, de daadwerkelijke output van de tool, toe aan het transcript. Het model leest het bijgewerkte transcript en redeneert opnieuw. Wanneer hij oordeelt dat de taak klaar is, geeft hij een eindantwoord af in plaats van nog een actie. De lus koppelen aan expliciete redenering helpt ook bij kennistaken: Google Research meldde dat het combineren van ReAct met chain-of-thought 35,1 exact match bereikte op HotpotQA tegenover 28,7 voor standaardprompting [2].

Het originele paper implementeerde dit met gewone tekstprompting, en parste regels gelabeld Thought en Action uit de output van het model. Zelfs in die simpele vorm haalde two-shot-ReAct een slagingspercentage van 71% op ALFWorld tegenover 45% voor act-only-prompting en 37% voor imitatie-learning-baselines [3]. Moderne stacks bereiken dezelfde lus via native tool-calling-API's, waar het model gestructureerde functieaanroepen afgeeft en redenering kan gebeuren in dedicated denktokens in plaats van zichtbaar proza. Het patroon overleeft omdat het een robuuste controlelus is, ongeacht het transport. Wat veranderd is, is dat een reasoning-model nu veel van het overwegen intern behandelt, dus zijn de omslachtige gesteigerde prompts van vroege ReAct-implementaties grotendeels achterhaald.

De faalpatronen zijn net zo karakteristiek als de sterktes. Agents kunnen lussen, en een falende tool met kleine variaties opnieuw proberen, of afdrijven wanneer een misleidende observatie de redenering een verkeerd pad op stuurt. Productie-implementaties begrenzen de lus met een maximaal stapaantal, detecteren herhaalde identieke acties, en valideren tool-argumenten voor uitvoering.

Voorbeeld

Een dienstdoende engineer vraagt een diagnostiek-agent waarom checkout-latentie piekte om 14:00. De agent redeneert dat hij eerst deploygeschiedenis moet controleren, roept de deployment-API aan, en observeert een payments-service-release om 13:52. Hij redeneert dat de release een verdachte is maar wil bevestiging, dus bevraagt hij de metrics-store voor p99-latentie per service en observeert dat alleen de payments-service verslechterde. Volgende gedachte: controleer de release-diff. Hij haalt de changelog op, ziet een wijziging in connection-pool-configuratie, en bevraagt huidige poolverzadiging, die 100 procent leest. Nadat hij de wijziging aan het symptoom heeft gekoppeld via vier geaarde stappen, stopt hij en rapporteert: de release van 13:52 verkleinde de pool, verzadiging zit vast, en rollback of een poolgrootte-terugdraai zijn de directe opties. Elke stap hing af van de vorige observatie, wat geen vooraf geschreven plan had kunnen voorzien.

Veelvoorkomende misvattingen

Een verrassend gangbare verwarring, eerst het vermelden waard: een ReAct-agent heeft niets te maken met React, de JavaScript-UI-library. De naam staat voor Reasoning and Acting. De diepere technische fout is het redeneerspoor behandelen als ceremonie en het bijsnijden om tokens te besparen, of het laten verslechteren tot boilerplate. De gedachtestap is het foutcorrectiemechanisme van de agent; wanneer het een leeg ritueel wordt, stopt de agent met bijwerken op observaties en ploegt door op zijn initiële aanname. Als sporen als vulling lezen, is de fix de prompt en de outputkwaliteit van de tools verfijnen, want de lus is maar zo goed als waar het model over redeneert.

FAQ

Is ReAct nog relevant nu modellen native tool calling hebben? De prompt-parsing-implementatie is grotendeels historisch, maar het patroon leeft meer dan ooit: elke mainstream-agentlus, van codingassistenten tot computer-use-agents, interleaved redenering, actie, en observatie. ReAct begrijpen is begrijpen waarom die lussen werken en hoe ze falen.

Hoe verschilt een ReAct-agent van plan-and-execute-agents? Plan-and-execute ontleedt de hele taak vooraf en draait dan de stappen, wat goedkoper en voorspelbaarder is wanneer het pad bekend is. ReAct beslist één stap tegelijk, wat wint wanneer de uitkomst van elke stap de volgende zou moeten vormen, zoals bij debuggen of onderzoek. Veel systemen combineren ze: plan de fasen, draai elke fase als een ReAct-lus.

Waar hebben ReAct-agents moeite mee? Lange taken die het transcript laten overlopen, want elke gedachte en observatie stapelt zich op in het contextvenster, en taken met misleidende tussensignalen die redenering doen afdwalen. Subtaken delegeren aan een verse subagent en tooloutput beknopt houden zijn de standaardmitigaties.

Bronnen

  1. Yao et al. (arXiv). "ReAct verslaat imitatie- en reinforcement-learning-baselines met 34% en 10% absoluut slagingspercentage op ALFWorld en WebShop." https://arxiv.org/abs/2210.03629. Geraadpleegd augustus 2026.
  2. Google Research. "ReAct plus chain-of-thought bereikt 35,1 exact match op HotpotQA tegenover 28,7 voor standaardprompting." https://research.google/blog/react-synergizing-reasoning-and-acting-in-language-models/. Geraadpleegd augustus 2026.
  3. Google Research. "Two-shot ReAct bereikt 71% succes op ALFWorld tegenover 45% act-only en 37% imitatie-learning." https://research.google/blog/react-synergizing-reasoning-and-acting-in-language-models/. Geraadpleegd augustus 2026.
Let’s get in touch

Ready to build your product?

Book a consultation call to get a free No-Code assessment and scope estimation for your project.
Book a consultation call to get a free No-Code assessment and scope estimation for your project.