Blank white background with no objects or features visible.

Estamos disponibilizando acesso gratuito ao Gartner Hype Cycle for AI Governance 2026 completo. Obtenha sua cópia →

Rastreamento de Gateway e Logs de Requisição: Depure cada chamada de LLM

By Ashish Dubey

Published: October 9, 2026

Por que você precisa de rastreamento no gateway

Quando uma chamada de LLM está lenta, cara ou incorreta, você precisa ver o que realmente aconteceu. Um guardrail editou o prompt? Quanto tempo o modelo levou em comparação com a rede? O que o gateway enviou para o provedor? O log e o rastreamento de requisições no Gateway de IA respondem a essas perguntas para cada chamada.

Como toda requisição já passa pelo gateway, você obtém essa visibilidade sem precisar instrumentar cada aplicação manualmente.

Controlando o que é registrado

Odocumentação de log de requisições permite que você controle quais requisições são registradas. O controle mais simples é por requisição, usando o cabeçalho X-TFY-LOGGING-CONFIG com um valor JSON em formato de string. Defina enabled como true para registrar a requisição ou false para ignorá-la.

Um detalhe importante: o valor desse cabeçalho é um JSON em formato de string, não um objeto JSON bruto, porque a maioria dos SDKs serializa cabeçalhos como strings. Os modos de log globais mais antigos estão sendo substituídos por configuração de logbaseada em regras, que permite controlar o log por assunto, modelo ou metadados e ocultar valores sensíveis.

Visualizando logs de requisição

Para ver as requisições registradas na interface, vá para AI Gateway, depois Monitor e, em seguida, Requests. Isso exibe a lista de todas as chamadas registradas, que você pode abrir para inspecionar uma requisição específica em detalhes.

Logs de requisição na seção Monitor do AI Gateway.

Rastreamentos e spans, explicados

Odocumentação de rastreamento descreve um rastreamento como o ciclo de vida completo de uma requisição à medida que ela flui pelos serviços que interagem com a LLM. Geralmente, um rastreamento corresponde a uma única chamada de API de uma aplicação.

Um span é uma unidade individual de trabalho dentro desse rastreamento, como uma chamada de função, uma requisição HTTP ou uma inferência de modelo. Um rastreamento é uma árvore de spans com relações de pai e filho, onde um span filho geralmente é causado pelo seu pai. A TrueFoundry fornece um backend de coletor OpenTelemetry que armazena esses rastreamentos e uma interface para consultá-los e analisá-los, podendo receber rastreamentos de qualquer SDK compatível com OpenTelemetry.

Um rastreamento é uma árvore de spans com relações de pai e filho.
Can you explain why your last slow request was slow?
We will open a live trace on your traffic and walk the span tree with you.

Lendo um único rastreamento

‍

Odocumentação de inspeção de rastreamento vamos analisar um exemplo real: uma conclusão de chat com um guardrail de mascaramento de PII, capturado como cinco spans que formam uma hierarquia.

‍

  • Span de ChatCompletion (raiz) representa todo o ciclo de vida da solicitação sob a perspectiva do cliente. No exemplo, ele dura cerca de 7 segundos e contém métricas de tokens, custo, entrada e saída.
  • Span de Guardrail é um filho da raiz e representa o processamento de mascaramento de PII, durando menos de meio segundo.
  • Span de chamada de rede do Guardrail é a chamada HTTP real para o serviço de guardrail, com o método HTTP e o código de status.
  • Span de Modelo é um irmão do span de guardrail e representa a inferência do modelo, ocupando a maior parte do tempo da solicitação.
  • Span de chamada de rede do Modelo é a chamada HTTP real para o provedor, por exemplo, um POST para o endpoint de conclusões de chat do provedor.

‍

Nesse mesmo exemplo, a entrada é visivelmente mascarada de um nome para um espaço reservado, o que mostra o guardrail de PII funcionando de ponta a ponta dentro do rastreamento.

‍

Um rastreamento de conclusão de chat mostrando os spans de guardrail, modelo e rede de saída.

‍

De um único rastreamento a métricas de toda a frota

‍

Rastreamentos individuais servem para depuração. Para tendências, o painel de análise agrega os mesmos dados. As abas cobrem Visão Geral, Métricas de Modelo, Métricas de MCP, Métricas de Guardrail, Métricas de Roteamento e Métricas de Cache.

‍

As métricas de modelo podem ser agrupadas por modelos, modelos virtuais, usuários, contas virtuais, equipes ou metadados, e as visualizações de latência detalham a latência da solicitação, tempo até o primeiro token, latência entre tokens e tempo por token de saída. Juntamente com os rastreamentos por solicitação, isso oferece tanto o microscópio quanto o painel de controle.

‍

Métricas de modelo no painel de análise, agrupáveis por equipe, usuário, modelo e muito mais.

‍

Try now.

One gateway for all your models, MCP servers, and agents.
No credit card needed.

Start free
Table of Contents

One Gateway for Every LLM, Agent and MCP Server

Book a 30-min with our AI expert

Book a Demo

The fastest way to build, govern and scale your AI

Book Demo
Summarize with
ChatGPT logo by OpenAI
Perplexity AI logo
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.

Discover More

No items found.
October 9, 2026
|
5 min read

O que significa BYOK em um AI Gateway

No items found.
October 9, 2026
|
5 min read

SGLang vs vLLM vs TensorRT-LLM: Escolhendo um mecanismo de inferência

No items found.
October 9, 2026
|
5 min read

Latência do OpenRouter na Anthropic: por que trazer sua própria chave é mais rápido

No items found.
October 9, 2026
|
5 min read

BYOK do OpenRouter explicado: mais barato, geralmente mais rápido e em constante mudança

No items found.
No items found.

Recent Blogs

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.

Frequently asked questions

How do I turn logging on or off for a request?

Send the X-TFY-LOGGING-CONFIG header with a stringified JSON value and set enabled to true or false. Remember that the value is stringified JSON, not a raw object, because most SDKs serialize headers as strings.

Where do I view logs and traces?

Logged requests appear under AI Gateway, then Monitor, then Requests. Opening a request shows its trace, which is the tree of spans covering guardrails, the model, and the outbound provider calls.

‍

What is the difference between a trace and a span?

A trace is the full lifecycle of a single request. A span is one unit of work inside that trace, such as a guardrail check or a model inference. Spans form a parent and child tree within the trace

Can I use my own OpenTelemetry SDK?

Yes. TrueFoundry runs an OpenTelemetry collector backend and can receive traces from any OpenTelemetry compatible SDK. For LLM use cases the docs recommend an LLM focused SDK that captures model specific traces and metrics.

Take a quick product tour
Start Product Tour
Product Tour