Hero Image full

KI-Grounding

7 min read
Content

Was ist KI-Grounding?

KI-Grounding ist die Praxis, den Output eines Modells an überprüfbare Quellen zu binden — etwa abgerufene Dokumente, Datenbankeinträge oder Tool-Ergebnisse —, sodass jede Behauptung nachverfolgt und geprüft werden kann. Eine geerdete Antwort zitiert, woher ihre Fakten stammen; eine ungeerdete Antwort verlässt sich nur darauf, was das Modell während des Trainings aufgenommen hat.

Die wichtigsten Punkte

  • Grounding ist die wichtigste Verteidigung gegen KI-Halluzination: Das Modell antwortet aus bereitgestellter Evidenz, statt Fakten aus Trainingsdaten zu rekonstruieren.
  • Retrieval-Augmented Generation ist das gängigste Grounding-Muster, aber Tool-Aufrufe, Datenbankabfragen und Live-API-Ergebnisse erden Output genauso gut.
  • Grounding ist nur so gut wie der Abruf, der es speist. Kommt das falsche Dokument zurück, produziert das Modell eine selbstbewusste, gut zitierte, falsche Antwort.
  • Man kann es messen. Groundedness-Prüfungen in Ihren LLM Evals verifizieren, dass jede Behauptung im Output tatsächlich von den bereitgestellten Quellen gestützt wird.

So funktioniert es

Ein geerdetes System teilt die Aufgabe in zwei. Zuerst sammelt es Evidenz: Ein Retrieval-Schritt zieht relevante Passagen aus einer Wissensbasis, oder der Agent ruft ein Tool auf, das frische Daten liefert, etwa eine Abfrage gegen die Produktionsdatenbank oder das Lesen der tatsächlichen Quelldatei. Dann wird das Modell angewiesen, mit dieser Evidenz zu antworten, meist mit einem Prompt, der sagt, sich auf das bereitgestellte Material zu verlassen und es zu sagen, wenn das Material die Frage nicht abdeckt.

Die zweite Hälfte ist Attribution. Produktionssysteme bitten das Modell, zu zitieren, welche Passage welche Behauptung stützt, und manche führen einen separaten Verifikationsdurchgang aus, bei dem ein Prüfmodell jeden Satz der Antwort mit den Quellen abgleicht. Behauptungen ohne stützende Passage werden markiert oder entfernt. Das macht Korrektheit von einem Bauchgefühl zu etwas Auditierbarem, was zählt, wenn der Output in einen Kunden- oder Compliance-Prozess einfließt. Groundedness wird inzwischen direkt benchmarkt: Google DeepMinds FACTS-Grounding-Benchmark testet, ob Antworten innerhalb bereitgestellter Dokumente von bis zu 32.000 Tokens über 1.719 Beispiele bleiben, und das beste Modell beim Start im Dezember 2024, Gemini 2.0 Flash Experimental, erreichte 83,6 % [1].

Bei agentischen Systemen geschieht Grounding oft durch Handlung statt durch Retrieval. Ein Coding-Agent, der behauptet, eine Funktion existiere, sollte die Datei in derselben Sitzung gelesen haben. Ein Agent, der Testergebnisse meldet, sollte die Tests ausgeführt haben. Das Transkript der Tool-Aufrufe wird zur Beweisspur, und eine Person, die Human-in-the-Loop-Aufsicht praktiziert, kann es abspielen, um zu bestätigen, dass der Agent sah, was er zu sehen behauptet.

Beispiel

Ein Fintech-Team liefert einen internen Support-Agenten aus, der Fragen zu Kontolimits beantwortet. Version eins antwortete aus dem allgemeinen Wissen des Modells und zitierte selbstbewusst Überweisungslimits aus einer Richtlinie, die sich seit dem Trainings-Cutoff des Modells zweimal geändert hatte. Version zwei ruft die aktuellen Richtlinienseiten aus dem Firmen-Wiki ab, gibt sie in den Prompt und verlangt ein Zitat pro Behauptung. Ein nächtlicher Eval spielt 200 bekannte Fragen ab und lässt den Build scheitern, wenn eine Antwort eine Zahl enthält, die nicht im abgerufenen Text steht. Antworten mit falschen Limits sanken von einer wiederkehrenden Incident-Kategorie auf praktisch null, und die verbleibenden Fehler sind Retrieval-Lücken, die das Team sehen und beheben kann.

Häufige Missverständnisse

Das große Missverständnis ist, dass Grounding Halluzination beseitigt. Es verengt das Problem, schließt es aber nicht. Modelle können eine Quelle immer noch falsch lesen, zwei Passagen zu einer Behauptung verschmelzen, die keine von beiden macht, oder die Evidenz ganz ignorieren, wenn die Frage selbstbewusst formuliert ist. Der Restfehler ist messbar: Auf Vectaras Halluzinations-Leaderboard, aufgebaut aus der Zusammenfassung von mehr als 7.700 Artikeln, halluziniert das beste Modell Stand Mai 2026 immer noch in 1,8 % der Zusammenfassungen, bei den Top-Modellen von OpenAI und Google sind es 3,1 % und 3,3 % [2]. Grounding macht Fehler erkennbar, weil man die Antwort mit den Quellen vergleichen kann. Ohne Verifikationsschritt hat man Zitate, die vertrauenswürdig aussehen und über denselben Fehlermodi sitzen.

FAQ

Ist Grounding dasselbe wie RAG? RAG ist eine Art zu erden. Retrieval-Augmented Generation liefert Dokumente zum Zeitpunkt der Anfrage, aber Grounding ist das breitere Ziel: Jeder Mechanismus, der Output an überprüfbarer Evidenz verankert, zählt, einschließlich Funktionsaufrufen, SQL-Ergebnissen und Dateizugriffen durch einen Agenten.

Wie testet man, ob Output geerdet ist? Groundedness-Evals ausführen. Die Antwort des Modells nehmen, in Behauptungen zerlegen und jede Behauptung gegen die gelieferten Quellen prüfen, entweder mit einem LLM as a Judge oder mit manuellen Stichproben. Den Wert über die Zeit verfolgen wie jede andere Regressionsmetrik.

Verlangsamt Grounding das System? Es fügt vor der Generierung einen Retrieval- oder Tool-Call-Schritt hinzu, typischerweise zehn bis ein paar hundert Millisekunden. Für die meisten Produkte ist diese Latenz ein fairer Tausch gegen Antworten, die man verteidigen kann, und Prompt Caching holt einen Großteil der Kosten zurück, wenn dieselben Quellen über mehrere Runden hinweg wiederverwendet werden.

Quellen

  1. Google DeepMind. "Design und Startwerte des FACTS-Grounding-Benchmarks." https://deepmind.google/discover/blog/facts-grounding-a-new-benchmark-for-evaluating-the-factuality-of-large-language-models/. Abgerufen im August 2026.
  2. Vectara. "Halluzinations-Leaderboard-Werte für geerdete Zusammenfassung." https://github.com/vectara/hallucination-leaderboard. Abgerufen im August 2026.
Let’s get in touch

Ready to build your product?

Book a consultation call to get a free No-Code assessment and scope estimation for your project.
Book a consultation call to get a free No-Code assessment and scope estimation for your project.