Blank white background with no objects or features visible.

Wir stellen Ihnen den vollständigen Gartner Hype Cycle für KI-Governance 2026 kostenlos zur Verfügung. Hier Exemplar sichern →

KI-Agenten-Leitplanken: Überprüfung jedes Werkzeugaufrufs und Modellschritts

von Ashish Dubey

Published: October 6, 2026

⚡ TL;DR

AI agent guardrails inspect what flows through an agent — the prompts, the model outputs, and every MCP tool call — and block or rewrite anything unsafe before it acts. Identity decides whether a call is allowed; guardrails decide what the call is allowed to contain. On TrueFoundry, guardrails run at the AI Gateway on four hooks (LLM input, LLM output, MCP pre-tool, MCP post-tool), so the same policy covers every agent with no per-agent code. This guide walks through where guardrails run, which risks they stop, and how to roll them out.

A chatbot with a bad response embarrasses you. An agent with a bad response acts on it. That single difference is why AI agent guardrails have become a production requirement rather than a nice-to-have. The moment a model can call tools — query a database, hit an internal API, run code, post to Slack — a hallucinated argument or an injected instruction stops being a wording problem and becomes an action your systems execute.

The 2025 Comet browser incident is the canonical example: a webpage carried hidden instructions written for the agent summarizing it, and the agent followed them. That is indirect prompt injection — untrusted content turning into unauthorized actions. No amount of identity or access control stops it, because the credential presented was perfectly valid. What stops it is a content check at each hop. This guide covers what agent guardrails are, where they run on the AI Gateway, which risks each one addresses, and how to enforce them without rewriting a single agent.

Was sind KI-Agenten-Guardrails?

KI-Agenten-Guardrails sind Kontrollmechanismen zur Inhaltsprüfung, die den tatsächlichen Payload jeder Agenteninteraktion untersuchen – den Benutzer-Prompt, die Antwort des Modells sowie die Argumente und Ergebnisse jedes Tool-Aufrufs – und basierend auf Richtlinien Maßnahmen ergreifen (zulassen, blockieren oder umschreiben).

Es hilft, zwei Fragen zu unterscheiden, die jeder kontrollierte Agentenaufruf beantworten muss:

  • Ob der Aufruf zulässig ist – geregelt durch Identitäts- und Zugriffssteuerung (welcher Agent ist das, was darf er tun).
  • Was der Aufruf enthält – geregelt durch Guardrails (enthält dieses Tool-Ergebnis eine Injection, ein Geheimnis in dieser Ausgabe oder ein DROP TABLE in diesen Argumenten).

Die Zugriffskontrolle ist der Türsteher; Guardrails sind der Metalldetektor. Sie brauchen beides. Ein Agent kann vollständig autorisiert sein, Ihren Postgres-MCP-Server aufzurufen, und dennoch dazu verleitet werden, eine destruktive Abfrage zu senden – der Zugriff hat zugestimmt, und nur ein Guardrail für die Tool-Argumente erkennt, was die Abfrage tatsächlich bewirkt.

Warum Agenten das Risiko erhöhen

Guardrails sind für LLM-Anwendungen nicht neu, aber Agenten verändern das Problem in drei konkreten Punkten:

  • Nicht vertrauenswürdige Inhalte fließen kontinuierlich ein. Jedes Tool-Ergebnis – eine Webseite, ein Support-Ticket, eine Datenbankzeile – gelangt im nächsten Schritt erneut in den Kontext des Modells. Da jeder dieser Inhalte eine Injection enthalten kann, müssen Eingaben geprüft werden, selbst wenn der Benutzer vertrauenswürdig ist.
  • Ausgaben werden zu Aktionen. Ein halluzinierter Shell-Befehl oder eine zu weit gefasste SQL-Anweisung liest sich nicht nur schlecht; sie wird ausgeführt. Tool-Argumente müssen geprüft werden, bevor das Tool ausgeführt wird.
  • Ketten vervielfachen das Risiko. Eine Kette mit fünf Werkzeugen bedeutet fünf Gelegenheiten, ein Geheimnis preiszugeben oder PII zu exfiltrieren. Effektive Leitplanken laufen bei jedem Werkzeugaufruf separat, sodass jeder Schritt seine eigenen Prüfungen erhält.

Wo KI-Agenten-Leitplanken laufen: Die vier Hooks

Auf TrueFoundry werden Leitplanken am Gateway auf dem agentischen Aufrufpfad durchgesetzt – der Kette von Benutzer → App → Agent → Sub-Agent → MCP-Werkzeugaufrufen. Jeder kontrollierte Schritt passiert einen Abfangpunkt mit einem Vor- und Nach- Hook.

‍

How TrueFoundry runs guardrails on each hook of the agentic call path

Produktscreenshot – TrueFoundry-Dokumentation: Leitplanken werden bei LLM-Ein- und -Ausgaben sowie bei MCP-Pre-/Post-Tool-Hooks ausgeführt.

‍

Try now.

One gateway for all your models, MCP servers, and agents.
No credit card needed.

Melde dich an
Inhaltsverzeichniss

Steuern, implementieren und verfolgen Sie KI in Ihrer eigenen Infrastruktur

Buchen Sie eine 30-minütige Fahrt mit unserem KI-Experte

Eine Demo buchen

Der schnellste Weg, deine KI zu entwickeln, zu steuern und zu skalieren

Demo buchen
Summarize with
ChatGPT logo by OpenAI
Perplexity AI logo
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.

Entdecke mehr

Keine Artikel gefunden.
October 9, 2026
|
Lesedauer: 5 Minuten

Claude Haiku 5.5 Is Now Live on TrueFoundry AI Gateway

Keine Artikel gefunden.
October 9, 2026
|
Lesedauer: 5 Minuten

SGLang vs. vLLM vs. TensorRT-LLM: Die Wahl der richtigen Inferenz-Engine

Keine Artikel gefunden.
October 9, 2026
|
Lesedauer: 5 Minuten

OpenRouter BYOK erklärt: günstiger, oft schneller und im Wandel

Keine Artikel gefunden.
October 9, 2026
|
Lesedauer: 5 Minuten

Kostenlose OpenRouter-Modelle: Was wirklich kostenlos ist und was es Sie kostet

Keine Artikel gefunden.
Keine Artikel gefunden.

Aktuelle Blogs

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.
Machen Sie eine kurze Produkttour
Produkttour starten
Produkttour