Seguimiento de pasarela y registros de solicitudes: depure cada llamada a LLM
.png)
Diseñado para la velocidad: ~ 10 ms de latencia, incluso bajo carga
¡Una forma increíblemente rápida de crear, rastrear e implementar sus modelos!
- Gestiona más de 350 RPS en solo 1 vCPU, sin necesidad de ajustes
- Listo para la producción con soporte empresarial completo
Por qué necesita seguimiento en el gateway
Cuando una llamada a un LLM es lenta, costosa o incorrecta, necesita ver qué sucedió realmente. ¿Una barrera de seguridad redactó el prompt? ¿Cuánto tiempo tomó el modelo frente a la red? ¿Qué envió el gateway al proveedor? El registro de solicitudes y el seguimiento en el puerta de enlace de IA (AI Gateway) responden a estas preguntas para cada llamada.
Dado que cada solicitud ya fluye a través del gateway, obtiene esta visibilidad sin necesidad de instrumentar cada aplicación manualmente.
Control de lo que se registra
Eldocumentación sobre el registro de solicitudes le permiten controlar qué solicitudes se registran. El control más sencillo es por solicitud, utilizando la cabecera X-TFY-LOGGING-CONFIG con un valor JSON convertido a cadena. Establezca enabled en true para registrar la solicitud o en false para omitirla.
Un detalle importante a tener en cuenta: el valor de esa cabecera es un JSON convertido a cadena, no un objeto JSON sin procesar, ya que la mayoría de los SDK serializan las cabeceras como cadenas. Los modos de registro global anteriores están siendo reemplazados por una configuración de registrobasada en reglas, que le permite controlar el registro por sujeto, modelo o metadatos, y redactar valores confidenciales.
Visualización de registros de solicitudes
Para ver las solicitudes registradas en la interfaz, vaya a AI Gateway, luego a Monitor y, finalmente, a Requests. Esto le mostrará la lista de todas las llamadas registradas, que puede abrir para inspeccionar una solicitud individual en detalle.

Seguimientos e intervalos (spans), explicados
Eldocumentación sobre seguimiento describe un seguimiento como el ciclo de vida completo de una solicitud a medida que fluye a través de los servicios que interactúan con el LLM. Por lo general, un seguimiento corresponde a una única llamada API de una aplicación.
Un intervalo (span) es una unidad de trabajo individual dentro de ese seguimiento, como una llamada a una función, una solicitud HTTP o una inferencia de modelo. Un seguimiento es un árbol de intervalos con relaciones de padre e hijo, donde un intervalo hijo suele ser provocado por su padre. TrueFoundry proporciona un backend de recopilación OpenTelemetry que almacena estos seguimientos y una interfaz para consultarlos y analizarlos, y puede recibir seguimientos de cualquier SDK compatible con OpenTelemetry.

Lectura de un único seguimiento
Eldocumentación de inspección de seguimientos analicemos un ejemplo real: una finalización de chat con una barrera de protección para la redacción de PII, capturada como cinco tramos que forman una jerarquía.
- Tramo ChatCompletion (raíz) representa el ciclo de vida completo de la solicitud desde la perspectiva del cliente. En el ejemplo, dura unos 7 segundos y contiene métricas de tokens, coste, entrada y salida.
- Tramo de barrera de protección (Guardrail) es un elemento secundario de la raíz y representa el procesamiento de redacción de PII, con una duración inferior a medio segundo.
- Tramo de llamada de red de la barrera de protección es la llamada HTTP real al servicio de barrera de protección, con el método HTTP y el código de estado.
- Tramo del modelo es un elemento hermano del tramo de la barrera de protección y representa la inferencia del modelo, ocupando la mayor parte del tiempo de la solicitud.
- Tramo de llamada de red del modelo es la llamada HTTP real al proveedor, por ejemplo, un POST al punto de conexión de finalizaciones de chat del proveedor.
En ese mismo ejemplo, la entrada aparece redactada, sustituyendo un nombre por un marcador de posición, lo que demuestra que la barrera de protección de PII funciona de principio a fin dentro del seguimiento.

Un seguimiento de finalización de chat que muestra los tramos de la barrera de protección, el modelo y la red de salida.
De un único seguimiento a métricas de toda la flota
Los seguimientos individuales sirven para depurar. Para ver tendencias, el panel de análisis agrega los mismos datos. Las pestañas cubren Información general, Métricas del modelo, Métricas de MCP, Métricas de barreras de protección, Métricas de enrutamiento y Métricas de caché.
Las métricas del modelo pueden agruparse por modelos, modelos virtuales, usuarios, cuentas virtuales, equipos o metadatos, y las vistas de latencia desglosan la latencia de la solicitud, el tiempo hasta el primer token, la latencia entre tokens y el tiempo por token de salida. Junto con los seguimientos por solicitud, esto le proporciona tanto el microscopio como el panel de control.

Métricas de modelos en el panel de análisis, agrupables por equipo, usuario, modelo y más.
TrueFoundry AI Gateway ofrece una latencia de entre 3 y 4 ms, gestiona más de 350 RPS en una vCPU, se escala horizontalmente con facilidad y está listo para la producción, mientras que LitellM presenta una latencia alta, tiene dificultades para superar un RPS moderado, carece de escalado integrado y es ideal para cargas de trabajo ligeras o de prototipos.



Controle, implemente y rastree la IA en su propia infraestructura
Blogs recientes
Preguntas frecuentes
How do I turn logging on or off for a request?
Send the X-TFY-LOGGING-CONFIG header with a stringified JSON value and set enabled to true or false. Remember that the value is stringified JSON, not a raw object, because most SDKs serialize headers as strings.
Where do I view logs and traces?
Logged requests appear under AI Gateway, then Monitor, then Requests. Opening a request shows its trace, which is the tree of spans covering guardrails, the model, and the outbound provider calls.
What is the difference between a trace and a span?
A trace is the full lifecycle of a single request. A span is one unit of work inside that trace, such as a guardrail check or a model inference. Spans form a parent and child tree within the trace
Can I use my own OpenTelemetry SDK?
Yes. TrueFoundry runs an OpenTelemetry collector backend and can receive traces from any OpenTelemetry compatible SDK. For LLM use cases the docs recommend an LLM focused SDK that captures model specific traces and metrics.









.png)
.png)

.png)
.png)





.png)



.png)





