Blank white background with no objects or features visible.

Te ofrecemos acceso gratuito al informe completo Gartner Hype Cycle for AI Governance 2026. Consigue tu copia →

Guardrails para agentes de IA: inspección de cada llamada a herramientas y salto de modelo

Por Ashish Dubey

Published: October 7, 2026

⚡ TL;DR

AI agent guardrails inspect what flows through an agent — the prompts, the model outputs, and every MCP tool call — and block or rewrite anything unsafe before it acts. Identity decides whether a call is allowed; guardrails decide what the call is allowed to contain. On TrueFoundry, guardrails run at the AI Gateway on four hooks (LLM input, LLM output, MCP pre-tool, MCP post-tool), so the same policy covers every agent with no per-agent code. This guide walks through where guardrails run, which risks they stop, and how to roll them out.

A chatbot with a bad response embarrasses you. An agent with a bad response acts on it. That single difference is why AI agent guardrails have become a production requirement rather than a nice-to-have. The moment a model can call tools — query a database, hit an internal API, run code, post to Slack — a hallucinated argument or an injected instruction stops being a wording problem and becomes an action your systems execute.

The 2025 Comet browser incident is the canonical example: a webpage carried hidden instructions written for the agent summarizing it, and the agent followed them. That is indirect prompt injection — untrusted content turning into unauthorized actions. No amount of identity or access control stops it, because the credential presented was perfectly valid. What stops it is a content check at each hop. This guide covers what agent guardrails are, where they run on the AI Gateway, which risks each one addresses, and how to enforce them without rewriting a single agent.

¿Qué son los guardrails para agentes de IA?

Los guardrails para agentes de IA son controles de inspección de contenido que examinan la carga útil real de cada interacción del agente (el prompt del usuario, la respuesta del modelo y los argumentos y resultados de cada llamada a herramientas) y toman medidas (permitir, bloquear o reescribir) según la política establecida.

Resulta útil separar dos preguntas que toda llamada de agente gobernada debe responder:

  • Si la llamada está permitida — gestionado por el control de acceso e identidad (qué agente es este, qué tiene permitido hacer).
  • Qué contiene la llamada — gestionado por los guardrails (¿hay una inyección en este resultado de herramienta, un secreto en esta salida, un DROP TABLE en estos argumentos?).

El control de acceso es el portero en la entrada; los guardrails son el detector de metales. Necesita ambos. Un agente puede estar totalmente autorizado para llamar a su servidor MCP de Postgres y aun así ser engañado para enviar una consulta destructiva: el acceso dijo que sí, y solo un guardrail en los argumentos de la herramienta detecta cuál es realmente la consulta.

Por qué los agentes aumentan los riesgos

Los guardrails no son nuevos en las aplicaciones de LLM, pero los agentes cambian el problema de tres formas concretas:

  • El contenido no confiable fluye continuamente. Cada resultado de una herramienta (una página web, un ticket de soporte, una fila de base de datos) vuelve a entrar en el contexto del modelo en el siguiente turno. Cualquiera de ellos puede contener una inyección, por lo que las entradas deben verificarse incluso cuando el usuario es de confianza.
  • Las salidas se convierten en acciones. Un comando de shell alucinado o una sentencia SQL demasiado amplia no solo se lee mal; se ejecuta. Los argumentos de las herramientas deben verificarse antes la herramienta se ejecute.
  • Las cadenas multiplican la exposición. Una cadena de cinco herramientas supone cinco oportunidades para filtrar un secreto o exfiltrar información de identificación personal (PII). Unas barreras de seguridad eficaces se ejecutan en cada llamada a herramienta por separado, por lo que cada salto cuenta con sus propias comprobaciones.

Dónde se ejecutan las barreras de seguridad de los agentes de IA: los cuatro puntos de enganche

En TrueFoundry, las barreras de seguridad se aplican en la pasarela durante la ruta de llamada del agente : la cadena de usuario → aplicación → agente → subagente → llamadas a herramientas MCP. Cada salto supervisado pasa por un punto de interceptación con un antesydespués de que de cada punto de enganche.

How TrueFoundry runs guardrails on each hook of the agentic call path
Captura de pantalla del producto — Documentación de TrueFoundry: las barreras de seguridad se ejecutan en las entradas/salidas de LLM y en los puntos de enganche previos y posteriores a las herramientas MCP.
Surface Hook Runs Typical checks for agents
LLM call Input Before the prompt reaches the model PII masking, prompt-injection detection (incl. injected tool results), content moderation
LLM call Output After the model responds Secrets detection, unsafe-code detection, content filtering
MCP tool call Pre-tool Before the tool executes SQL sanitizer, code-safety linter, parameter validation, Cedar/OPA policy checks
MCP tool call Post-tool After the tool returns Secrets and PII redaction from results, code safety on returned content

El orden es importante para el coste y el radio de impacto. Un fallo previo a la herramienta significa que la herramienta nunca llega a ejecutarse, lo que supone el fallo más económico posible. Un fallo en la entrada del LLM cancela la solicitud al modelo en curso antes de que tengas que pagar por ella. Dado que cada salto se comprueba de forma independiente, un resultado comprometido en el tercer salto se detecta en ese mismo momento, y no después de que se haya propagado a tres llamadas más.

Cómo asociar riesgos a barreras de seguridad

La ventaja de ejecutar barreras de seguridad en la MCP Gateway es que cada riesgo real del agente se asigna a un control específico e integrado. Las barreras de seguridad integradas de TrueFoundry se ejecutan en la infraestructura gestionada por TrueFoundry, sin necesidad de configurar claves API de terceros.

Risk Guardrail Hook
Indirect prompt injection via tool results or documents Prompt injection detection (Azure Prompt Shield under the hood) LLM input
PII reaching an external model or leaking in results PII / PHI detection and redaction (Azure AI Language) LLM input, post-tool
Credentials leaking through model output or tool results Secrets detection LLM output, post-tool
Destructive database operations (DROP, DELETE without WHERE) SQL sanitizer Pre-tool
Dangerous shell commands or unsafe code Code safety linter Pre-tool, LLM output
Tool calls that violate fine-grained policy Cedar / OPA policy guardrails Pre-tool
Requests missing required context (environment, cost center) Metadata validation LLM input

Más allá de las funciones integradas, la pasarela se conecta con proveedores externos (Palo Alto Prisma AIRS, CrowdStrike AIDR, Cisco AI Defense, AWS Bedrock Guardrails, Google Model Armor, NVIDIA NeMo Guardrails, Guardrails AI, entre otros) y admite barreras de seguridad totalmente personalizadas cuando necesitas una lógica específica para tu dominio.

La barrera de seguridad contra inyección de prompts es la que se ha diseñado específicamente para el problema de los agentes: analiza el prompt del usuario y y cualquier documento o contenido contextual por separado, de modo que una inyección oculta dentro de una página web o un ticket devuelto se detecta incluso cuando el mensaje original del usuario es seguro.

Ship agents that can't act on a bad instruction.

TrueFoundry enforces prompt-injection, PII, secrets, and unsafe-tool-call checks on every agent hop — inside your own VPC.

Cómo implementar barreras de seguridad para agentes de IA

La aplicación de barreras de seguridad al tráfico de los agentes sigue un flujo de tres pasos y, fundamentalmente, nada de esto reside en el código de su agente.

Paso 1: Registrar las barreras de seguridad

EnAI Gateway → Guardrails, cree un grupo de barreras de seguridad y añada las integraciones que necesite: integradas, de proveedores externos o personalizadas. Un grupo es también la unidad de control de acceso: un gestor puede añadir, editar y eliminar barreras de seguridad; un usuario solo puede aplicarlas. Un patrón común es tener un grupo para toda la organización gestionado por el equipo de plataforma, además de grupos por equipo para comprobaciones específicas de producto.

Registering a guardrails group in the TrueFoundry AI Gateway
Captura de pantalla del producto: documentación de TrueFoundry: AI Gateway → Guardrails.

Paso 2: Crear políticas que vinculen las barreras de seguridad por objetivo

EnAI Gateway → Policies → Guardrails, cree reglas que decidan cuándo se ejecuta cada barrera de seguridad. Esto es lo que permite que el modelo escale a flotas de agentes: las reglas se basan en el objetivo (los modelos, servidores MCP e incluso herramientas específicas que se están llamando) y el sujeto (usuarios, equipos o cuentas virtuales). Dado que una regla cubre a cada llamante de un servidor MCP o modelo determinado, protege a todos los agentes que acceden a ese objetivo, sin necesidad de configuración por agente.

‍

Cada regla combina:

‍

  • Objetivos : modelos (IN / NOT IN) y servidores MCP, opcionalmente restringidos a herramientas específicas (por ejemplo, solo la herramienta run_query de un servidor de base de datos).
  • Sujetos — Filtros IN / NOT IN para usuarios, equipos o cuentas virtuales.
  • Metadatos — coincidencia con pares clave-valor X-TFY-METADATA, de modo que una regla pueda aplicarse solo a environment: production.
  • Hooks — asocia las barreras de seguridad registradas a la entrada del LLM, la salida del LLM, o a la pre-invocación o post-invocación de herramientas MCP.

‍

Configuring a guardrail policy rule by target, subject, and hook

Captura de pantalla del producto — Documentación de TrueFoundry: editor de reglas de políticas de barreras de seguridad.

‍

Todas las reglas que coinciden se evalúan y sus barreras de seguridad se combinan por hook. Si la Regla A aplica detección de PII en la entrada del LLM y la Regla B aplica detección de inyección de prompts en la entrada del LLM, ambas se ejecutan. Una regla sin condiciones de destino o sujeto se convierte en una línea base que se aplica a todo el tráfico; es útil para realizar una comprobación de inyección de prompts a nivel de toda la empresa por encima de todo lo demás.

‍

Para pruebas rápidas o llamadas puntuales, también puede pasar barreras de seguridad por solicitud con la cabecera X-TFY-GUARDRAILS, lo que omite las políticas por completo:

‍

curl https://<your-gateway>/api/llm/chat/completions \

  -H "Authorization: Bearer $TFY_API_KEY" \

  -H 'X-TFY-METADATA: {"environment":"production","agent":"research-agent"}' \

  -H 'X-TFY-GUARDRAILS: {"llm_input":["global/prompt-injection","global/pii-detection"]}' \

-H "Content-Type: application/json" \

-d '{

"model": "openai-main/gpt-4o",

        "messages": [{"role":"user","content":"Summarize ticket #4521 and email the customer"}]

}'

Paso 3 — Verificar en los seguimientos

Cada solicitud se rastrea junto con las barreras de seguridad que se ejecutaron y sus veredictos, para que pueda confirmar la cobertura antes de confiar en ella. Aquí es también donde se ajustan los falsos positivos, que son más importantes para los agentes que para los chatbots: un salto bloqueado puede hacer fallar toda una cadena.

‍

Verifying which guardrails ran on a request in the trace view

Captura de pantalla del producto — Documentación de TrueFoundry: resultados de las barreras de seguridad en un seguimiento de solicitud.

‍

Antes de publicar, utiliza el Playground para realizar pruebas de prompts y llamadas a herramientas en los cuatro hooks y observar qué es lo que se detecta.

‍

Testing guardrails on each hook in the AI Gateway Playground

Captura de pantalla del producto: documentación de TrueFoundry: AI Gateway Playground.

‍

Modos de aplicación: validar, mutar y nivel de bloqueo

Dos ajustes controlan el comportamiento de cada guardrail.

‍

Modo de operación:

‍

  • Validar — inspeccionar y bloquear (por ejemplo, la detección de inyección de prompts, que solo detecta y bloquea).
  • Mutar — reescribir el contenido y, opcionalmente, bloquear (por ejemplo, la detección de PII que redacta un correo electrónico antes de que el prompt llegue al modelo).

‍

Estrategia de aplicación:

‍

  • Aplicar (Enforce) — bloquear ante una infracción y si el propio guardrail genera un error. Úsalo para comprobaciones de cumplimiento estricto, como PII.
  • Aplicar pero ignorar errores (Enforce But Ignore On Error) — bloquear ante una infracción, pero permitir el tráfico si el proveedor del guardrail sufre una interrupción. Es la opción pragmática por defecto para la mayoría del tráfico de agentes.
  • Auditoría — solo registrar, no bloquear nada.

‍

Para lógica personalizada, despliegas un guardrail como servicio HTTP y la pasarela lee su contrato de respuesta: un HTTP 2xx significa que el guardrail se ejecutó, y el cuerpo JSON contiene el resultado — verdict: false para denegar, o un cuerpo de resultado mutado para reescribir:

‍

Try now.

One gateway for all your models, MCP servers, and agents.
No credit card needed.

Inscríbase
Tabla de contenido

Controle, implemente y rastree la IA en su propia infraestructura

Reserva 30 minutos con nuestro Experto en IA

Reserve una demostración

La forma más rápida de crear, gobernar y escalar su IA

Demo del libro
Summarize with
ChatGPT logo by OpenAI
Perplexity AI logo
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.

Descubra más

No se ha encontrado ningún artículo.
October 9, 2026
|
5 minutos de lectura

Claude Haiku 5.5 Is Now Live on TrueFoundry AI Gateway

No se ha encontrado ningún artículo.
October 9, 2026
|
5 minutos de lectura

Qué significa BYOK en una AI Gateway

No se ha encontrado ningún artículo.
October 9, 2026
|
5 minutos de lectura

SGLang frente a vLLM frente a TensorRT-LLM: Cómo elegir un motor de inferencia

No se ha encontrado ningún artículo.
October 9, 2026
|
5 minutos de lectura

OpenRouter BYOK explicado: más barato, a menudo más rápido y en constante cambio

No se ha encontrado ningún artículo.
No se ha encontrado ningún artículo.

Blogs recientes

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.
Realice un recorrido rápido por el producto
Comience el recorrido por el producto
Visita guiada por el producto