Blank white background with no objects or features visible.

Estamos disponibilizando acesso gratuito ao Gartner Hype Cycle for AI Governance 2026 completo. Obtenha sua cópia →

Guardrails para Agentes de IA: Inspecionando Cada Chamada de Ferramenta e Etapa do Modelo

By Ashish Dubey

Published: October 7, 2026

⚡ TL;DR

AI agent guardrails inspect what flows through an agent — the prompts, the model outputs, and every MCP tool call — and block or rewrite anything unsafe before it acts. Identity decides whether a call is allowed; guardrails decide what the call is allowed to contain. On TrueFoundry, guardrails run at the AI Gateway on four hooks (LLM input, LLM output, MCP pre-tool, MCP post-tool), so the same policy covers every agent with no per-agent code. This guide walks through where guardrails run, which risks they stop, and how to roll them out.

A chatbot with a bad response embarrasses you. An agent with a bad response acts on it. That single difference is why AI agent guardrails have become a production requirement rather than a nice-to-have. The moment a model can call tools — query a database, hit an internal API, run code, post to Slack — a hallucinated argument or an injected instruction stops being a wording problem and becomes an action your systems execute.

The 2025 Comet browser incident is the canonical example: a webpage carried hidden instructions written for the agent summarizing it, and the agent followed them. That is indirect prompt injection — untrusted content turning into unauthorized actions. No amount of identity or access control stops it, because the credential presented was perfectly valid. What stops it is a content check at each hop. This guide covers what agent guardrails are, where they run on the AI Gateway, which risks each one addresses, and how to enforce them without rewriting a single agent.

O que são Guardrails para Agentes de IA?

Guardrails para agentes de IA são controles de inspeção de conteúdo que examinam o payload real de cada interação do agente — o prompt do usuário, a resposta do modelo e os argumentos e resultados de cada chamada de ferramenta — e tomam medidas (permitir, bloquear ou reescrever) com base na política.

Ajuda separar duas perguntas que toda chamada de agente governada precisa responder:

  • Se a chamada é permitida — gerenciado por identidade e controle de acesso (qual é este agente, o que ele tem permissão para fazer).
  • O que a chamada contém — gerenciado por guardrails (há uma injeção neste resultado de ferramenta, um segredo nesta saída, um DROP TABLE nestes argumentos).

O controle de acesso é o segurança na porta; as guardrails são o detector de metais. Você precisa de ambos. Um agente pode estar totalmente autorizado a chamar seu servidor MCP Postgres e ainda ser enganado para enviar uma consulta destrutiva — o acesso disse sim, e apenas uma guardrail nos argumentos da ferramenta detecta o que a consulta realmente é.

Por que os agentes aumentam os riscos

Guardrails não são novidade para aplicativos de LLM, mas os agentes mudam o problema de três maneiras concretas:

  • Conteúdo não confiável flui continuamente. Cada resultado de ferramenta — uma página da web, um ticket de suporte, uma linha de banco de dados — reentra no contexto do modelo na próxima rodada. Qualquer um deles pode conter uma injeção, portanto, as entradas precisam ser verificadas mesmo quando o usuário é confiável.
  • As saídas tornam-se ações. Um comando de shell alucinado ou uma instrução SQL excessivamente ampla não apenas parece ruim; ele é executado. Os argumentos da ferramenta precisam ser verificados antes que a ferramenta seja executada.
  • Cadeias multiplicam a exposição. Uma cadeia de cinco ferramentas representa cinco chances de vazar um segredo ou exfiltrar PII. Guardrails eficazes operam em cada chamada de ferramenta separadamente, para que cada etapa tenha suas próprias verificações.

Onde os Guardrails de Agentes de IA são executados: Os Quatro Ganchos

No TrueFoundry, os guardrails são aplicados no gateway durante o caminho de chamada do agente — a cadeia de usuário → aplicativo → agente → subagente → chamadas de ferramenta MCP. Cada etapa governada passa por um ponto de intercepção com um anteseapós de cada gancho.

‍

How TrueFoundry runs guardrails on each hook of the agentic call path

Captura de tela do produto — documentação do TrueFoundry: os guardrails são executados na entrada/saída do LLM e nos ganchos pré/pós-ferramenta MCP.

‍

Try now.

One gateway for all your models, MCP servers, and agents.
No credit card needed.

Start free
Table of Contents

One Gateway for Every LLM, Agent and MCP Server

Book a 30-min with our AI expert

Book a Demo

The fastest way to build, govern and scale your AI

Book Demo
Summarize with
ChatGPT logo by OpenAI
Perplexity AI logo
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.

Discover More

No items found.
October 9, 2026
|
5 min read

Claude Haiku 5.5 Is Now Live on TrueFoundry AI Gateway

No items found.
October 9, 2026
|
5 min read

O que significa BYOK em um AI Gateway

No items found.
October 9, 2026
|
5 min read

SGLang vs vLLM vs TensorRT-LLM: Escolhendo um mecanismo de inferência

No items found.
October 9, 2026
|
5 min read

Latência do OpenRouter na Anthropic: por que trazer sua própria chave é mais rápido

No items found.
No items found.

Recent Blogs

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.
Take a quick product tour
Start Product Tour
Product Tour