
Wat is Retrieval-Augmented Generation (RAG)?
Retrieval-augmented generation (RAG) is een architectuur die op verzoekmoment een kennisbron doorzoekt naar documenten relevant voor een query en ze in de prompt van het model invoegt, zodat het antwoord geaard is in opgehaald bewijs in plaats van alleen in wat het model tijdens training onthield. Het geeft modellen toegang tot private, actuele, en verifieerbare informatie. De naam komt van Lewis et al.'s NeurIPS-paper van 2020 bij Meta AI, dat de state of the art zette op drie open-domain-vraagbeantwoordingstaken en taal produceerde die de auteurs specifieker, diverser, en feitelijker maten dan een puur-parametrische baseline [1].
De belangrijkste punten
- RAG scheidt kennis van het model. Het corpus kan bijgewerkt, geauditeerd, en rechten-afgebakend worden zonder het model aan te raken, wat trainingsmoment-kennis nooit toelaat.
- Antwoordkwaliteit wordt geplafonneerd door retrievalkwaliteit. Als de juiste passage de prompt nooit bereikt, herstelt geen hoeveelheid modelcapaciteit het.
- Antwoorden aarden in opgehaalde tekst verlaagt hallucinatie en maakt citaten mogelijk, maar elimineert geen fouten: modellen kunnen nog steeds hun bronnen verkeerd lezen of overschrijden.
- Het patroon uit het 2026-tijdperk is steeds meer agentic RAG, waar het model zoeken iteratief stuurt met tools in plaats van één vaste batch chunks te ontvangen.
Hoe het werkt
Een RAG-systeem heeft een offline helft en een online helft. Offline worden documenten opgesplitst in chunks, wordt elke chunk omgezet naar een vector-embedding die zijn betekenis codeert, en gaan de vectoren in een vectordatabase samen met de tekst. Online wordt een binnenkomende query op dezelfde manier embedded, geeft de database de chunks terug wier vectoren het dichtst bij die van de query zitten, en worden die chunks in de prompt gepakt met instructies om te antwoorden vanuit het aangeleverde materiaal. Dit is semantisch zoeken dat het ophalen doet en het taalmodel dat het lezen en schrijven doet.
Productiesystemen lagen verfijningen bovenop dat skelet. Hybride retrieval combineert vectorgelijkenis met klassieke keyword-scoring, want exacte identifiers en zeldzame termen verslaan pure embeddings. Een reranker herscoort de topkandidaten met een duurder model voor de definitieve selectie. Query-herschrijving breidt beknopte vragen uit, metadatafilters handhaven documentrechten per gebruiker, en chunkingstrategie, groottes, overlappingen, en respect voor documentstructuur bepalen stilletjes veel van het plafond. Antwoorden citeren typisch welke chunks ze gebruikten, wat gebruikers een pad geeft om te verifiëren, wat de AI-grounding-eigenschap is die RAG aantrekkelijk maakt voor alles klantgericht. Die aantrekkingskracht toont in adoptiedata: Menlo Ventures' onderzoek van 2024 onder 600 Amerikaanse enterprise-IT-beslissers vond RAG in 51% van enterprise-LLM-architecturen, een stijging van 31% het jaar ervoor [2].
De bewegende grens is wie retrieval bestuurt. Klassieke RAG haalt één keer op, voor generatie, met vaste parameters. Agentic RAG geeft het model een zoektool en laat het herhaaldelijk queryen, herformuleren, referenties volgen, en beslissen wanneer het genoeg bewijs heeft. Lange contextvensters hebben geen van beide overbodig gemaakt: corpora gemeten in gigabytes kunnen nog steeds niet ingelijnd worden, en retrieval blijft het kosten- en relevantiefilter dat beslist wat die contexttokens verdient.
Voorbeeld
Een B2B-softwarebedrijf bouwt een supportassistent over 4.000 helpcenterartikelen, releasenotes, en interne runbooks. De pipeline knipt documenten per sectie, embedt ze, en slaat ze op met productversie-metadata. Wanneer een klant vraagt "waarom stopte SSO met werken na de update van maart," embedt het systeem de vraag, filtert op de productversie van de klant, haalt de top acht chunks op, herrankt naar drie, en promt het model om alleen vanuit die passages te antwoorden met gelinkte citaten. Het model brengt een breaking change uit de releasenotes naar boven plus de migratiestappen uit een runbook. Wanneer het team fixes uitlevert, herindexeren ze die nacht de gewijzigde artikelen, en is de assistent de volgende ochtend actueel, zonder modelwijzigingen erbij.
Veelvoorkomende misvattingen
De hardnekkige fout is RAG behandelen als verzekering tegen hallucinatie. Retrieval versmalt de ruimte voor verzinsel maar het model kan opgehaalde feiten nog steeds foutief mengen, antwoorden voorbij wat de bronnen ondersteunen, of leunen op parametrisch geheugen wanneer retrieval mager terugkomt. Erger nog, zwakke retrieval produceert zelfverzekerd geciteerde onzin, want de citaten wijzen naar chunks die de bewering nooit bevatten. Betrouwbare RAG vereist evals op beide helften: retrievalmetrieken voor of het juiste bewijs arriveerde, en groundedness-checks voor of het antwoord daar daadwerkelijk binnen bleef.
FAQ
Wat betekent RAG in de context van een LLM? Een "rag llm"-opzet is gewoon een taalmodel bedraad aan een retrievalstap: zoeken draait eerst, de resultaten gaan de prompt in, en het model antwoordt ervanuit. Het model zelf is ongewijzigd; RAG beschrijft de omringende architectuur, geen speciaal soort model.
Is RAG beter dan fine-tuning? Ze lossen verschillende problemen op. Retrieval-augmented generation is de juiste tool voor feiten injecteren, vooral feiten die veranderen, per klant verschillen, of citaten nodig hebben. Fine-tuning is de juiste tool voor gedrag, stijl, of taakformaten aanleren. Volwassen systemen gebruiken vaak beide: een fine-getuned model dat opgehaalde context leest.
Maken lange contextvensters RAG overbodig? Nee. Zelfs vensters van een miljoen tokens kunnen geen serieus corpus bevatten, aandacht verslechtert over zeer lange inputs, en betalen voor een compleet corpus bij elk verzoek is economisch absurd. Lange context veranderde het retrievalbudget, en laat systemen grotere en minder chunks doorgeven, in plaats van de behoefte aan retrieval te verwijderen.
Bronnen
- Lewis et al., Meta AI. "Resultaten van het originele RAG-paper op open-domain-vraagbeantwoording." https://arxiv.org/abs/2005.11401. Geraadpleegd augustus 2026.
- Menlo Ventures. "RAG-adoptie in enterprise-LLM-architecturen, 2024 versus 2023." https://menlovc.com/2024-the-state-of-generative-ai-in-the-enterprise/. Geraadpleegd augustus 2026.
Related terms
Ready to build your product?

