Rastreamento de Gateway e Logs de Requisição: Depure cada chamada de LLM
.png)
Built for Speed: ~10ms Latency, Even Under Load
Blazingly fast way to build, track and deploy your models!
- Handles 350+ RPS on just 1 vCPU — no tuning needed
- Production-ready with full enterprise support
Por que você precisa de rastreamento no gateway
Quando uma chamada de LLM está lenta, cara ou incorreta, você precisa ver o que realmente aconteceu. Um guardrail editou o prompt? Quanto tempo o modelo levou em comparação com a rede? O que o gateway enviou para o provedor? O log e o rastreamento de requisições no Gateway de IA respondem a essas perguntas para cada chamada.
Como toda requisição já passa pelo gateway, você obtém essa visibilidade sem precisar instrumentar cada aplicação manualmente.
Controlando o que é registrado
Odocumentação de log de requisições permite que você controle quais requisições são registradas. O controle mais simples é por requisição, usando o cabeçalho X-TFY-LOGGING-CONFIG com um valor JSON em formato de string. Defina enabled como true para registrar a requisição ou false para ignorá-la.
Um detalhe importante: o valor desse cabeçalho é um JSON em formato de string, não um objeto JSON bruto, porque a maioria dos SDKs serializa cabeçalhos como strings. Os modos de log globais mais antigos estão sendo substituídos por configuração de logbaseada em regras, que permite controlar o log por assunto, modelo ou metadados e ocultar valores sensíveis.
Visualizando logs de requisição
Para ver as requisições registradas na interface, vá para AI Gateway, depois Monitor e, em seguida, Requests. Isso exibe a lista de todas as chamadas registradas, que você pode abrir para inspecionar uma requisição específica em detalhes.

Rastreamentos e spans, explicados
Odocumentação de rastreamento descreve um rastreamento como o ciclo de vida completo de uma requisição à medida que ela flui pelos serviços que interagem com a LLM. Geralmente, um rastreamento corresponde a uma única chamada de API de uma aplicação.
Um span é uma unidade individual de trabalho dentro desse rastreamento, como uma chamada de função, uma requisição HTTP ou uma inferência de modelo. Um rastreamento é uma árvore de spans com relações de pai e filho, onde um span filho geralmente é causado pelo seu pai. A TrueFoundry fornece um backend de coletor OpenTelemetry que armazena esses rastreamentos e uma interface para consultá-los e analisá-los, podendo receber rastreamentos de qualquer SDK compatível com OpenTelemetry.

Lendo um único rastreamento
Odocumentação de inspeção de rastreamento vamos analisar um exemplo real: uma conclusão de chat com um guardrail de mascaramento de PII, capturado como cinco spans que formam uma hierarquia.
- Span de ChatCompletion (raiz) representa todo o ciclo de vida da solicitação sob a perspectiva do cliente. No exemplo, ele dura cerca de 7 segundos e contém métricas de tokens, custo, entrada e saída.
- Span de Guardrail é um filho da raiz e representa o processamento de mascaramento de PII, durando menos de meio segundo.
- Span de chamada de rede do Guardrail é a chamada HTTP real para o serviço de guardrail, com o método HTTP e o código de status.
- Span de Modelo é um irmão do span de guardrail e representa a inferência do modelo, ocupando a maior parte do tempo da solicitação.
- Span de chamada de rede do Modelo é a chamada HTTP real para o provedor, por exemplo, um POST para o endpoint de conclusões de chat do provedor.
Nesse mesmo exemplo, a entrada é visivelmente mascarada de um nome para um espaço reservado, o que mostra o guardrail de PII funcionando de ponta a ponta dentro do rastreamento.

Um rastreamento de conclusão de chat mostrando os spans de guardrail, modelo e rede de saída.
De um único rastreamento a métricas de toda a frota
Rastreamentos individuais servem para depuração. Para tendências, o painel de análise agrega os mesmos dados. As abas cobrem Visão Geral, Métricas de Modelo, Métricas de MCP, Métricas de Guardrail, Métricas de Roteamento e Métricas de Cache.
As métricas de modelo podem ser agrupadas por modelos, modelos virtuais, usuários, contas virtuais, equipes ou metadados, e as visualizações de latência detalham a latência da solicitação, tempo até o primeiro token, latência entre tokens e tempo por token de saída. Juntamente com os rastreamentos por solicitação, isso oferece tanto o microscópio quanto o painel de controle.

Métricas de modelo no painel de análise, agrupáveis por equipe, usuário, modelo e muito mais.
TrueFoundry AI Gateway delivers ~3–4 ms latency, handles 350+ RPS on 1 vCPU, scales horizontally with ease, and is production-ready, while LiteLLM suffers from high latency, struggles beyond moderate RPS, lacks built-in scaling, and is best for light or prototype workloads.


Recent Blogs
Frequently asked questions
How do I turn logging on or off for a request?
Send the X-TFY-LOGGING-CONFIG header with a stringified JSON value and set enabled to true or false. Remember that the value is stringified JSON, not a raw object, because most SDKs serialize headers as strings.
Where do I view logs and traces?
Logged requests appear under AI Gateway, then Monitor, then Requests. Opening a request shows its trace, which is the tree of spans covering guardrails, the model, and the outbound provider calls.
What is the difference between a trace and a span?
A trace is the full lifecycle of a single request. A span is one unit of work inside that trace, such as a guardrail check or a model inference. Spans form a parent and child tree within the trace
Can I use my own OpenTelemetry SDK?
Yes. TrueFoundry runs an OpenTelemetry collector backend and can receive traces from any OpenTelemetry compatible SDK. For LLM use cases the docs recommend an LLM focused SDK that captures model specific traces and metrics.










.png)
.png)


.png)
.png)




.png)



.png)





