Hero Image full

Agentic RAG

7 min read
Content

Wat is Agentic RAG?

Agentic RAG is retrieval-augmented generation waarbij een AI-agent het retrievalproces bestuurt. In plaats van één vaste zoekopdracht te draaien voor het antwoorden, beslist de agent of er überhaupt opgehaald moet worden, kiest tussen bronnen, herformuleert queries, beoordeelt wat er terugkomt, en zoekt opnieuw tot hij genoeg bewijs heeft om goed te antwoorden.

De belangrijkste punten

  • Klassieke RAG is een pipeline; agentic RAG is een lus. De agent kan opnieuw proberen, herformuleren en van bron wisselen wanneer de eerste retrieval mist, en daar zitten de meeste kwaliteitsproblemen van pipeline-RAG.
  • De agent beoordeelt zijn eigen bewijs. Een beoordelingsstap die vraagt "beantwoordt dit daadwerkelijk de vraag?" voordat er gegenereerd wordt, is de grootste kwaliteitshefboom.
  • Meerdere bronnen worden tools. Vectorzoeken, keyword-zoeken, SQL, websearch en API's zitten achter tool calling, en de agent routeert elke vraag naar de juiste.
  • Elke extra retrievalronde voegt latentie en kosten toe, dus productiesystemen begrenzen iteraties en reserveren de volledige lus voor vragen die het nodig hebben.

Hoe het werkt

Traditionele retrieval-augmented generation embedt de vraag van de gebruiker, haalt de top-k chunks uit een vectordatabase, stopt ze in de prompt en genereert. Dat werkt wanneer vragen goed gevormd zijn en het antwoord op één plek staat. Het faalt bij vage vragen, multi-hop-vragen waarvan het antwoord over documenten is verspreid, en vragen die totaal anders zijn geformuleerd dan de brontekst. Zelfs de gewone pipeline heeft nog ruimte voordat er ook maar één agent bij komt kijken: Anthropic ontdekte in 2024 dat contextual retrieval, het vooraf toevoegen van chunk-specifieke context voor het embedden, het faalpercentage van top-20-chunk-retrieval met 49% verlaagde, van 5,7% naar 2,9% [1].

Agentic RAG verpakt retrieval in een agentlus, meestal in de vorm van een ReAct-agent. De agent beslist eerst of retrieval überhaupt nodig is, want sommige vragen zijn direct te beantwoorden en sommige hebben eerder een rekenmachine dan een corpus nodig. Het model die beslissing geven loont: in de experimenten van Google Research tilde ReAct met chain-of-thought die een Wikipedia-API doorzocht de exact match op HotpotQA naar 35,1 tegenover 28,7 voor standaardprompting [2]. Wanneer hij wel ophaalt, schrijft hij zijn eigen zoekqueries, vaak door een complexe vraag op te delen in verschillende gerichte vragen. Na elke retrieval beoordeelt hij de resultaten op relevantie en toereikendheid. Zwakke resultaten triggeren een herschrijving met andere bewoordingen, een filterwijziging, of een volledige wisseling van bron, bijvoorbeeld van semantisch zoeken naar keyword-zoeken voor een exacte foutcode, of naar websearch voor iets recents. Pas wanneer het bewijs zijn eigen lat haalt, genereert de agent, doorgaans met citaties terug naar de opgehaalde passages, wat AI-hallucinatie ook minder ruimte geeft omdat claims worden getoetst aan verzameld bewijs.

De architectuur loopt uiteen van één agent met verschillende retrievaltools tot een klein multi-agentsysteem met een router voor per-bron-specialisten. De single-agent-versie dekt de meeste echte workloads en is veel makkelijker te debuggen.

Voorbeeld

Een enterprise-supportassistent beantwoordt "Waarom zouden SSO-logins beginnen te falen na onze upgrade naar versie 12.4?" Pipeline-RAG embedt de hele zin, haalt generieke SSO-troubleshootingchunks op en produceert een standaardantwoord. De agentic versie ontleedt de vraag: hij bevraagt de release-notes-index op "12.4 SSO-wijzigingen" en vindt dat de afhandeling van SAML-certificaten is veranderd, zoekt dan in de supportkennisbank naar het specifieke foutpatroon, beoordeelt de eerste batch als te generiek, en draait opnieuw met de exacte configuratiesleutelnaam uit de release note. Hij haalt ook het abonnement van de klant op via een API-tool om te bevestigen dat de functie van toepassing is. Het uiteindelijke antwoord citeert de release note, noemt de configuratiewijziging, en linkt naar de migratiegids. Drie retrievals en één API-aanroep, elk gevormd door wat de vorige stap opleverde.

Veelvoorkomende misvattingen

Teams grijpen naar agentic RAG om een slechte kennisbank te redden, en dat kan het niet. Als documenten verouderd, slecht opgedeeld of afwezig zijn, zal een agent gewoon vaker in de rommel zoeken, tegen hogere kosten en latentie, en dan genereren uit hetzelfde zwakke bewijs. Retrievalkwaliteit begint bij de basis: schone en actuele content, verstandige chunking, goede embeddings en solide ranking. Die basisprincipes verschuiven de cijfers al een heel eind op zichzelf; Anthropic mat dat contextual retrieval gecombineerd met reranking het retrievalfaalpercentage met 67% verlaagde, van 5,7% naar 1,9% [3]. De agentlaag vermenigvuldigt de waarde van een retrievalsysteem dat al werkt; hij kan geen inhoud leveren die het corpus niet bevat.

FAQ

Wanneer is agentic RAG de extra kosten waard boven standaard-RAG? Wanneer vragen complex zijn, multi-hop, of over heterogene bronnen lopen, en wanneer antwoordkwaliteit belangrijker is dan een seconde of twee extra latentie. Voor hoogvolume eenvoudige lookups blijft pipeline-RAG de juiste standaard, en veel systemen routeren tussen de twee op basis van vraagcomplexiteit.

Is agentic RAG hetzelfde als een agent met een zoektool? Bijna. Agentic RAG benoemt de discipline rond die opzet: opgehaald bewijs beoordelen, mislukte queries herschrijven, over bronnen routeren, en het uiteindelijke antwoord verankeren in citaties. Een agent met een zoektool en geen bewijsdiscipline geeft je de kosten van de lus zonder de kwaliteitswinst.

Hoe evalueer je een agentic-RAG-systeem? In twee lagen. Retrieval-evals meten of de juiste passages worden gevonden; end-to-end-evals meten of eindantwoorden getrouw, volledig en correct geciteerd zijn, vaak beoordeeld door een LLM als judge tegen een samengestelde vragenset. Traceren welke retrievals elk antwoord voedden, maakt fouten diagnosticeerbaar.

Bronnen

  1. Anthropic. "Contextual retrieval verlaagt het faalpercentage van top-20-chunk-retrieval met 49%, van 5,7% naar 2,9%." https://www.anthropic.com/news/contextual-retrieval. Geraadpleegd augustus 2026.
  2. Google Research. "ReAct plus chain-of-thought over een Wikipedia-API tilt de exact match op HotpotQA naar 35,1 tegenover 28,7 voor standaardprompting." https://research.google/blog/react-synergizing-reasoning-and-acting-in-language-models/. Geraadpleegd augustus 2026.
  3. Anthropic. "Contextual retrieval plus reranking verlaagt het retrievalfaalpercentage met 67%, van 5,7% naar 1,9%." https://www.anthropic.com/news/contextual-retrieval. Geraadpleegd augustus 2026.
Let’s get in touch

Ready to build your product?

Book a consultation call to get a free No-Code assessment and scope estimation for your project.
Book a consultation call to get a free No-Code assessment and scope estimation for your project.