
Was ist Tool Calling?
Tool Calling ist die Fähigkeit eines Sprachmodells, externe Funktionen aufzurufen, etwa einen Befehl auszuführen, eine API abzufragen, oder eine Datei zu lesen, statt nur Text zu generieren. Das Modell gibt eine strukturierte Anfrage aus, die ein Tool und seine Argumente benennt, die Host-Anwendung führt sie aus, und das Ergebnis fließt zurück in den nächsten Schritt des Modells.
Die wichtigsten Punkte
- Das Modell führt nie selbst etwas aus. Es produziert eine strukturierte Absicht, typischerweise JSON, das eine Funktion und Argumente benennt, und die umgebende Anwendung führt den eigentlichen Aufruf durch.
- Tool Calling ist der Mechanismus, der ein Sprachmodell zu einem Agenten macht. Die Schleife aus Aufrufen, Ergebnis beobachten, nächste Aktion entscheiden ist der Motor unter jedem agentischen System. Die Adoption spiegelt diesen Wandel: LangChains LangSmith-Plattformdaten zeigten, dass 21,9 % der LLM-Traces 2024 Tool-Aufrufe beinhalteten, gegenüber durchschnittlich 0,5 % 2023 [1].
- Tools werden durch Schemas plus Beschreibungen definiert, und die Beschreibungen werden vom Modell gelesen, sodass sie zu schreiben genauso Prompt Engineering ist wie API-Design.
- Jedes Tool ist Angriffsfläche. Was auch immer ein Tool tun kann, kann ein manipuliertes Modell tun, weshalb Berechtigungen und Sandboxing in Produktionssystemen neben Tool Calling stehen.
So funktioniert es
Die Anwendung deklariert verfügbare Tools in der Anfrage, jedes mit einem Namen, einer Beschreibung in natürlicher Sprache, und einem Parameter-Schema, meist JSON Schema. Während der Generierung kann sich das Modell entscheiden, mit einem Tool-Aufruf statt mit Prosa zu antworten: ein strukturierter Block, der das Tool benennt und Argumente liefert, die dem Schema entsprechen. Anbieter trainieren Modelle speziell dafür, sodass das Ausgeben wohlgeformter Aufrufe 2026 eine native Fähigkeit jeder großen Modelllinie ist, unter den austauschbaren Namen Tool Use und Function Calling. Die Fähigkeit wird eigens benchmarkt: UC Berkeleys Function Calling Leaderboard evaluiert Modelle anhand von 2.000 Frage-Funktion-Antwort-Paaren über Python, Java, SQL, REST-APIs, und JavaScript hinweg, in neun Kategorien [2].
Ausführung gehört dem Host. Die Anwendung erhält den Aufruf, führt die echte Funktion aus, und hängt das Ergebnis als Tool-Result-Nachricht an die Konversation an. Das Modell liest es und macht weiter: antwortet der nutzenden Person, ruft ein weiteres Tool auf, oder verkettet mehrere Aufrufe in Sequenz. Moderne Modelle handhaben parallele Aufrufe, das Anfragen mehrerer unabhängiger Tools gleichzeitig, und mehrstufige Sequenzen, bei denen jeder Aufruf vom vorherigen Ergebnis abhängt. Diese Schleife, reasonen dann handeln dann beobachten, ist das Muster, das von ReAct-Agenten formalisiert wurde und von jedem Coding-Agenten seither geerbt wird.
Zwei Schichten sitzen üblicherweise darauf. Model Context Protocol standardisiert, woher Tool-Definitionen kommen, und lässt Drittanbieter-Server Tools zur Laufzeit liefern, statt sie fest in die Anwendung zu kodieren. Und weil Argument-Generierung nur eingeschränkte Textgenerierung ist, unterstützen Anbieter sie zunehmend mit strikter Schema-Erzwingung, derselben Maschinerie hinter Structured Outputs, sodass Aufrufe zuverlässig parsen, statt an fehlerhaftem JSON zu scheitern.
Beispiel
Eine nutzende Person fragt einen Engineering-Assistenten: "Warum stieg die Checkout-Latenz um 14 Uhr sprunghaft an?" Die Anwendung hat dem Modell drei Tools gegeben: query_metrics, search_logs, und list_deploys. Das Modell ruft zuerst list_deploys mit dem Servicenamen und einem Zeitraum auf, sieht ein Deploy um 13:52, ruft dann query_metrics auf, um zu bestätigen, dass der Anstieg Minuten später begann, ruft dann search_logs gefiltert auf das neue Release auf und findet Connection-Pool-Erschöpfungsfehler. Erst nach drei Aufruf-und-Beobachten-Runden produziert es Prosa: Das Deploy verkleinerte die Pool-Größe, hier ist die schuldige Config-Änderung. Keine einzelne Vervollständigung hätte das beantworten können; die Tool-Schleife tat es.
Häufige Missverständnisse
Das anhaltende Missverständnis ist, dass das Modell die Tools ausführt, was Menschen dazu bringt, entweder das Risiko des Modells selbst zu überschätzen oder die Verantwortung der Anwendung zu unterschätzen. Das Modell gibt immer nur eine Anfrage aus. Ihr Code entscheidet, ob er sie ausführt, mit welchen Zugangsdaten, in welcher Umgebung, und mit welcher menschlichen Freigabe. Genau dort wird KI-Agenten-Sicherheit durchgesetzt: Validierung von Argumenten, Least-Privilege-Zugangsdaten, und Bestätigungs-Gates für destruktive Aktionen leben alle in der dünnen Schicht zwischen der Anfrage des Modells und der echten Funktion.
FAQ
Ist Function Calling dasselbe wie Tool Calling? Ja. Function Calling war OpenAIs ursprünglicher Name für das Feature 2023, und Tool Calling wurde der breitere Branchenbegriff, während sich die Fähigkeiten über einfache Funktionen hinaus erweiterten. Dokumentation nutzt die Begriffe austauschbar.
Wie verhält sich LLM Tool Use zu MCP? Tool Use ist die Fähigkeit auf Modellebene; das Model Context Protocol ist ein Verteilungsstandard für Tools. MCP-Server annoncieren Tool-Schemas an die Anwendung, die sie wie jede andere Tool-Definition an das Modell weitergibt. Das Modell kann nicht unterscheiden zwischen einem eingebauten Tool und einem MCP-bereitgestellten.
Wie viele Tools kann ein Modell handhaben? Es gibt keine harte Grenze, aber die Auswahlgenauigkeit verschlechtert sich, während Tool-Zahlen wachsen, da jede Definition Kontext verbraucht und ähnliche Tools verschwimmen. Produktionssysteme kuratieren kleine, gut beschriebene Tool-Sets pro Aufgabe, oder durchsuchen einen größeren Katalog und laden nur relevante Definitionen bei Bedarf.
Quellen
- LangChain. "State of AI 2024 Report, Anteil der LLM-Traces mit Tool-Aufrufen auf LangSmith." https://www.langchain.com/blog/langchain-state-of-ai-2024. Abgerufen im August 2026.
- Berkeley-Gorilla-Team, UC Berkeley. "Zusammensetzung und Bewertungskategorien des Berkeley Function Calling Leaderboard." https://gorilla.cs.berkeley.edu/blogs/8_berkeley_function_calling_leaderboard.html. Abgerufen im August 2026.
Related terms
Ready to build your product?

