Gateway-Tracing und Anfrageprotokolle: Debuggen Sie jeden LLM-Aufruf
.png)
Auf Geschwindigkeit ausgelegt: ~ 10 ms Latenz, auch unter Last
Unglaublich schnelle Methode zum Erstellen, Verfolgen und Bereitstellen Ihrer Modelle!
- Verarbeitet mehr als 350 RPS auf nur 1 vCPU — kein Tuning erforderlich
- Produktionsbereit mit vollem Unternehmenssupport
Warum Sie Tracing auf dem Gateway benötigen
Wenn ein LLM-Aufruf langsam, teuer oder fehlerhaft ist, müssen Sie nachvollziehen können, was tatsächlich passiert ist. Hat ein Guardrail den Prompt redigiert? Wie lange hat das Modell im Vergleich zum Netzwerk benötigt? Was hat das Gateway an den Provider gesendet? Request-Logging und Tracing auf dem AI Gateway beantworten diese Fragen für jeden Aufruf.
Da jeder Request ohnehin über das Gateway läuft, erhalten Sie diese Transparenz, ohne jede Anwendung manuell instrumentieren zu müssen.
Steuerung der Protokollierung
DieDokumentation zum Request-Logging ermöglicht es Ihnen zu steuern, welche Requests protokolliert werden. Die einfachste Methode ist die Steuerung pro Request über den Header X-TFY-LOGGING-CONFIG mit einem stringifizierten JSON-Wert. Setzen Sie „enabled“ auf „true“, um den Request zu protokollieren, oder auf „false“, um ihn zu überspringen.
Ein wichtiger Hinweis: Der Wert dieses Headers ist ein stringifiziertes JSON und kein rohes JSON-Objekt, da die meisten SDKs Header als Strings serialisieren. Die älteren globalen Logging-Modi werden durch eine regelbasierte Logging-Konfigurationersetzt, mit der Sie das Logging pro Subjekt, Modell oder Metadaten steuern und sensible Werte redigieren können.
Request-Logs anzeigen
Um protokollierte Requests in der Benutzeroberfläche zu sehen, gehen Sie zu „AI Gateway“, dann zu „Monitor“ und schließlich zu „Requests“. Dort finden Sie eine Liste aller protokollierten Aufrufe, die Sie öffnen können, um einen einzelnen Request im Detail zu untersuchen.

Traces und Spans erklärt
DieTracing-Dokumentation beschreibt ein Trace als den vollständigen Lebenszyklus eines Requests, während er die Dienste durchläuft, die mit dem LLM interagieren. Normalerweise entspricht ein Trace einem einzelnen API-Aufruf einer Anwendung.
Ein Span ist eine einzelne Arbeitseinheit innerhalb dieses Traces, wie etwa ein Funktionsaufruf, ein HTTP-Request oder eine Modell-Inferenz. Ein Trace ist ein Baum aus Spans mit Eltern-Kind-Beziehungen, wobei ein Kind-Span normalerweise durch seinen Eltern-Span ausgelöst wird. TrueFoundry stellt ein OpenTelemetry-Collector-Backend bereit, das diese Traces speichert, sowie eine Benutzeroberfläche zum Abfragen und Analysieren. Es kann Traces von jedem OpenTelemetry-kompatiblen SDK empfangen.

Einen einzelnen Trace lesen
DieDokumentation zur Trace-Inspektion Gehen wir ein reales Beispiel durch: eine Chat-Vervollständigung mit einem Guardrail zur PII-Schwärzung, erfasst als fünf Spans, die eine Hierarchie bilden.
- ChatCompletion-Span (Wurzel) repräsentiert den gesamten Lebenszyklus der Anfrage aus Sicht des Clients. Im Beispiel dauert dies etwa 7 Sekunden und enthält Token-Metriken, Kosten sowie Ein- und Ausgabedaten.
- Guardrail-Span ist ein Kindelement der Wurzel und repräsentiert die Verarbeitung der PII-Schwärzung, die weniger als eine halbe Sekunde dauert.
- Guardrail-Netzwerkaufruf-Span ist der eigentliche HTTP-Aufruf an den Guardrail-Dienst, inklusive HTTP-Methode und Statuscode.
- Modell-Span ist ein Geschwisterelement des Guardrail-Spans und repräsentiert die Modellinferenz, die den Großteil der Anfragedauer in Anspruch nimmt.
- Modell-Netzwerkaufruf-Span ist der eigentliche HTTP-Aufruf an den Anbieter, zum Beispiel ein POST-Request an den Chat-Completions-Endpunkt des Anbieters.
Im selben Beispiel ist die Eingabe sichtbar von einem Namen in einen Platzhalter geschwärzt, was zeigt, dass der PII-Guardrail innerhalb des Traces durchgängig funktioniert.

Ein Chat-Completions-Trace, der die Guardrail-, Modell- und ausgehenden Netzwerk-Spans zeigt.
Vom einzelnen Trace zu flottenweiten Metriken
Einzelne Traces dienen dem Debugging. Für Trends aggregiert das Analytics-Dashboard dieselben Daten. Die Reiter umfassen Übersicht, Modell-Metriken, MCP-Metriken, Guardrail-Metriken, Routing-Metriken und Cache-Metriken.
Modellmetriken können nach Modellen, virtuellen Modellen, Benutzern, virtuellen Konten, Teams oder Metadaten gruppiert werden. Die Latenzansichten schlüsseln die Anfragelatenz, die Zeit bis zum ersten Token, die Latenz zwischen den Token sowie die Zeit pro ausgegebenem Token auf. Zusammen mit den Traces pro Anfrage erhalten Sie so sowohl das Mikroskop als auch das Dashboard.

Modellmetriken im Analytics-Dashboard, gruppierbar nach Team, Benutzer, Modell und mehr.
TrueFoundry AI Gateway bietet eine Latenz von ~3—4 ms, verarbeitet mehr als 350 RPS auf einer vCPU, skaliert problemlos horizontal und ist produktionsbereit, während LiteLM unter einer hohen Latenz leidet, mit moderaten RPS zu kämpfen hat, keine integrierte Skalierung hat und sich am besten für leichte Workloads oder Prototyp-Workloads eignet.



Steuern, implementieren und verfolgen Sie KI in Ihrer eigenen Infrastruktur
Aktuelle Blogs
Häufig gestellte Fragen
How do I turn logging on or off for a request?
Send the X-TFY-LOGGING-CONFIG header with a stringified JSON value and set enabled to true or false. Remember that the value is stringified JSON, not a raw object, because most SDKs serialize headers as strings.
Where do I view logs and traces?
Logged requests appear under AI Gateway, then Monitor, then Requests. Opening a request shows its trace, which is the tree of spans covering guardrails, the model, and the outbound provider calls.
What is the difference between a trace and a span?
A trace is the full lifecycle of a single request. A span is one unit of work inside that trace, such as a guardrail check or a model inference. Spans form a parent and child tree within the trace
Can I use my own OpenTelemetry SDK?
Yes. TrueFoundry runs an OpenTelemetry collector backend and can receive traces from any OpenTelemetry compatible SDK. For LLM use cases the docs recommend an LLM focused SDK that captures model specific traces and metrics.









.png)


.png)
.png)
.png)




.png)



.png)





