Hero Image full

AI-grounding

7 min read
Content

Wat is AI-grounding?

AI-grounding is de praktijk van de output van een model verankeren aan verifieerbare bronnen zoals opgehaalde documenten, databaserecords, of toolresultaten, zodat elke bewering te traceren en te controleren is. Een geaard antwoord citeert waar zijn feiten vandaan kwamen; een niet-geaard antwoord vertrouwt alleen op wat het model tijdens training heeft opgenomen.

De belangrijkste punten

  • Grounding is de belangrijkste verdediging tegen AI-hallucinatie: het model antwoordt vanuit aangeleverd bewijs in plaats van feiten uit trainingsdata te reconstrueren.
  • Retrieval-augmented generation is het meest gangbare grondingpatroon, maar tool-aanroepen, databasequery's, en live API-resultaten aarden output net zo goed.
  • Grounding is maar zo goed als de retrieval die het voedt. Als het verkeerde document terugkomt, produceert het model een zelfverzekerd, goed-geciteerd, fout antwoord.
  • Je kunt het meten. Groundedness-checks in je LLM-evals verifiëren dat elke bewering in de output daadwerkelijk wordt ondersteund door de aangeleverde bronnen.

Hoe het werkt

Een geaard systeem splitst de klus in twee. Eerst verzamelt het bewijs: een retrievalstap haalt relevante passages op uit een kennisbank, of de agent roept een tool aan die verse data teruggeeft, zoals een query tegen de productiedatabase of een lezing van het daadwerkelijke bronbestand. Dan wordt het model geïnstrueerd te antwoorden met dat bewijs, meestal met een prompt die zegt te vertrouwen op het aangeleverde materiaal en te zeggen wanneer het materiaal de vraag niet dekt.

De tweede helft is attributie. Productiesystemen vragen het model om te citeren welke passage elke bewering ondersteunt, en sommige draaien een aparte verificatiedoorgang waarbij een controlemodel elke zin van het antwoord vergelijkt met de bronnen. Beweringen zonder ondersteunende passage worden gemarkeerd of verwijderd. Dit verandert correctheid van een gevoel in iets auditeerbaars, wat ertoe doet wanneer de output een klant of een complianceproces voedt. Groundedness wordt nu direct benchmarkt: Google DeepMinds FACTS Grounding-benchmark test of antwoorden binnen aangeleverde documenten van tot 32.000 tokens blijven over 1.719 voorbeelden, en het beste model bij de lancering in december 2024, Gemini 2.0 Flash Experimental, scoorde 83,6% [1].

Voor agentic systemen gebeurt grounding vaak via actie in plaats van retrieval. Een coding-agent die beweert dat een functie bestaat, zou het bestand in dezelfde sessie moeten hebben gelezen. Een agent die testresultaten rapporteert, zou de tests moeten hebben gedraaid. Het transcript van tool-aanroepen wordt het bewijsspoor, en een reviewer die human-in-the-loop-toezicht toepast, kan het afspelen om te bevestigen dat de agent zag wat hij beweert te hebben gezien.

Voorbeeld

Een fintech-team levert een interne supportagent uit die vragen over accountlimieten beantwoordt. Versie één antwoordde vanuit de algemene kennis van het model en citeerde zelfverzekerd overschrijvingslimieten uit een beleid dat sinds de trainingsafkap van het model twee keer was gewijzigd. Versie twee haalt de huidige beleidspagina's op uit de bedrijfswiki, geeft ze door in de prompt, en vereist een citaat per bewering. Een nachtelijke eval speelt 200 bekende vragen af en laat de build falen als een antwoord een cijfer bevat dat niet in de opgehaalde tekst staat. Foute-limiet-antwoorden daalden van een terugkerende incidentcategorie naar effectief nul, en de overgebleven mislukkingen zijn retrieval-missers die het team kan zien en herstellen.

Veelvoorkomende misvattingen

De grote misvatting is dat grounding hallucinatie elimineert. Het versmalt het probleem maar sluit het niet. Modellen kunnen nog steeds een bron verkeerd lezen, twee passages samenvoegen tot een bewering die geen van beide maakt, of het bewijs volledig negeren wanneer de vraag zelfverzekerd geformuleerd is. De restfout is meetbaar: op Vectara's hallucinatie-ranglijst, gebouwd door meer dan 7.700 artikelen samen te vatten, hallucineert het beste model per mei 2026 nog steeds in 1,8% van de samenvattingen, met de topmodellen van OpenAI en Google op 3,1% en 3,3% [2]. Grounding maakt fouten detecteerbaar, omdat je het antwoord tegen de bronnen kunt vergelijken. Zonder verificatiestap heb je citaten die betrouwbaar ogen bovenop dezelfde faalpatronen.

FAQ

Is grounding hetzelfde als RAG? RAG is één manier om te aarden. Retrieval-augmented generation levert documenten op query-tijd, maar grounding is het bredere doel: elk mechanisme dat output verankert aan controleerbaar bewijs telt mee, inclusief functieaanroepen, SQL-resultaten, en bestandslezingen door een agent.

Hoe test je of output geaard is? Draai groundedness-evals. Neem het antwoord van het model, breek het op in beweringen, en toets elke bewering tegen de aangeleverde bronnen, hetzij met een LLM als judge, hetzij met menselijke steekproeven. Volg de score over tijd zoals elke andere regressiemetriek.

Vertraagt grounding het systeem? Het voegt een retrieval- of tool-aanroepstap toe voor generatie, doorgaans tientallen tot een paar honderd milliseconden. Voor de meeste producten is die latentie een eerlijke ruil voor antwoorden die je kunt verdedigen, en prompt caching wint een groot deel van de kosten terug wanneer dezelfde bronnen over beurten heen worden hergebruikt.

Bronnen

  1. Google DeepMind. "Ontwerp en lanceringsscores van de FACTS Grounding-benchmark." https://deepmind.google/discover/blog/facts-grounding-a-new-benchmark-for-evaluating-the-factuality-of-large-language-models/. Geraadpleegd augustus 2026.
  2. Vectara. "Percentages op de hallucinatie-ranglijst voor geaarde samenvatting." https://github.com/vectara/hallucination-leaderboard. Geraadpleegd augustus 2026.
Let’s get in touch

Ready to build your product?

Book a consultation call to get a free No-Code assessment and scope estimation for your project.
Book a consultation call to get a free No-Code assessment and scope estimation for your project.