Blank white background with no objects or features visible.

Werden Sie Teil unseres VAR- und VAD-Ökosystems – und ermöglichen Sie die Governance von Unternehmens-KI über LLMs, MCPs und Agents hinweg. Read →

Benchmarking des TrueFoundry LLM Gateways: Es ist unglaublich schnell ⚡

von Srihari Radhakrishna

Aktualisiert: November 12, 2024

Fassen Sie zusammen mit
Metallic silver knot design with interlocking loops and circular shape forming a decorative pattern.
Blurry black butterfly or moth icon with outstretched wings on white background.
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.
  • TrueFoundry LLM Gateway bietet eine einheitliche OpenAI-kompatible Schnittstelle zu verschiedenen LLM-Anbietern wie Anthropic, OpenAI, Bedrock, Gemini und vielen anderen
  • TrueFoundry LLM Gateway lässt sich problemlos auf 350 RPS auf einem einzigen Replikat einer CPU-Einheit skalieren und nutzt dabei 270 MB Arbeitsspeicher. Wir haben einen Vergleich mit einem anderen Gateway-Produkt, LitelLM, mit einem ähnlichen Setup durchgeführt, und LiteLLM konnte nicht über 50 RPS skaliert werden
  • TrueFoundry LLM Gateway fügt nur eine zusätzliche Latenz von 3 bis 5 ms hinzu, während LiteLLM zwischen 15 und 30 ms pro Anfrage hinzufügt.

Warum benötigt Ihre Organisation ein LLM Gateway?

Ein LLM Gateway bietet eine einheitliche Oberfläche zur Verwaltung der LLM-Nutzung Ihres Unternehmens:

  • Vereinheitlichte API: Greifen Sie über einen einzigen auf mehrere LLM-Anbieter zu OpenAI-kompatibel Schnittstelle, keine Codeänderungen erforderlich
  • API-Schlüsselsicherheit: Sichere, zentrale Verwaltung von Anmeldeinformationen
  • Führung und Kontrolle: Legen Sie Grenzwerte, Zugriffskontrollen und Inhaltsfilterung fest
  • Ratenbegrenzung: Vermeiden Sie Missbrauch und sorgen Sie für eine faire Nutzung
  • Beobachtbarkeit: Verfolgen Sie Nutzung, Kosten, Latenz und Leistung
  • Lastenausgleich: Anfragen automatisch anbieterübergreifend weiterleiten
  • Kostenmanagement: Überwachen Sie die Ausgaben und richten Sie Budgetwarnungen ein
  • Prüfprotokolle: Alle LLM-Interaktionen zur Einhaltung der Vorschriften protokollieren

Wie schnell ist TrueFoundry LLM Gateway?

Test-Setup laden

Für unser Lasttest-Experiment haben wir ein bereitgestelltes eingerichtet gefälschter OpenAI-Endpunktdienst mit TrueFoundry. Der Dienst würde das OpenAI-Anfrage- und Antwortformat simulieren, ohne tatsächlich Token zu erzeugen.

Wir haben auch das TrueFoundry LLM Gateway und den LiteLM Proxy Server bereitgestellt, die beide auf einem einzigen Replikat mit einer CPU-Einheit und 1 GB Speicher laufen.

Wir haben unseren gefälschten OpenAI-Anbieter sowohl zu TrueFoundry- als auch zu LitelLM-Gateways hinzugefügt. Während des Lasttests haben wir auf drei verschiedene Arten Anfragen an den gefälschten OpenAI-Server gestellt:

  • Setup 1: Direkt ohne Verwendung eines Proxys oder Gateways
  • Setup 2: Über das TrueFoundry LLM Gateway, das auf einer CPU-Einheit und 1 GB Arbeitsspeicher bereitgestellt wird
  • Setup 3: Über den LitelM Proxy Server, der auf einer CPU-Einheit und 1 GB Arbeitsspeicher bereitgestellt wird
RPS 10 RPS 50 RPS 200 RPS 300 RPS
OpenAI direct (Setup 1) 73 ms 73 ms 73 ms 73 ms
TrueFoundry LLM Gateway (Setup 2) 76 ms (+3 ms) 76 ms (+3 ms) 76 ms (+3 ms) 77 ms (+4 ms)
LiteLLM Proxy (Setup 3) 88 ms (+15 ms) 99 ms (+26 ms) Could not scale to 200 RPS Could not scale to 300 RPS

Beobachtungen

  1. TrueFoundry Gateway fügt nur zusätzliche 3 ms Latenz hinzu, bis zu 250 RPS und 4 ms bei RPS > 300
  2. TrueFoundry LLM Gateway konnte ohne Leistungseinbußen skalieren, bis etwa 350 RPS (1 vCPU, 1 GB-Maschine), bevor die CPU-Auslastung 100% erreichte und die Latenzen begannen beeinträchtigt zu werden. Mit mehr CPU oder mehr Replikaten kann das LLM Gateway auf Zehntausende von Anfragen pro Sekunde skaliert werden.
  3. LiteLLM auf demselben Computer konnte nicht über 40-50 RPS skalieren, bevor das CPU-Limit erreicht wurde

Mehr Metriken

Setup 1: Direkter OpenAI-Endpunktaufruf

Statistiken bei 200 RPS
Statistiken bei 300 RPS
Reaktionszeit im Vergleich zu RPS

Einrichtung 2: TrueFoundry LLM Gateway

Statistiken bei 200 RPS
Statistiken bei 300 RPS
Reaktionszeit im Vergleich zu RPS

Einrichtung 3: LiteLLM

Statistiken @ ~58 RPS
Reaktionszeiten im Vergleich zu RPS

Geschwindigkeitsfunktionen von LLM Gateway

  • Nahezu kein Overhead: Nur 3—5 ms Latenz hinzugefügt
  • Optimiertes Backend: Mit dem performanten Node.js Framework gebaut
  • Zwischenspeichern von Konfigurationen: Die Konfiguration wird zum schnellen Nachschlagen im Speicher gespeichert
  • Intelligentes Routing: Minimaler Verarbeitungsaufwand
  • Bereit für Edge: Stellen Sie es in der Nähe Ihrer Apps bereit
  • hohe Kapazität: EIN t2.2x groß Der AWS-Instance-Computer (43$ pro Monat vor Ort) kann problemlos auf bis zu ~3000 RPS skaliert werden.
Edge-Bereitstellung von TrueFoundry LLM Gateway

Unterstützte Anbieter

Im Folgenden finden Sie eine umfassende Liste beliebter LLM-Anbieter, die von TrueFoundry LLM Gateway unterstützt werden:

Provider Streaming Supported
GCP
AWS
Azure OpenAI
Self Hosted Models on TrueFoundry
OpenAI
Cohere
AI21
Anthropic
Anyscale
Together AI
DeepInfra
Ollama
Palm
Perplexity AI
Mistral AI
Groq
Nomic

Der schnellste Weg, deine KI zu entwickeln, zu steuern und zu skalieren

Melde dich an
Inhaltsverzeichniss

Steuern, implementieren und verfolgen Sie KI in Ihrer eigenen Infrastruktur

Buchen Sie eine 30-minütige Fahrt mit unserem KI-Experte

Eine Demo buchen

Der schnellste Weg, deine KI zu entwickeln, zu steuern und zu skalieren

Demo buchen

Entdecke mehr

July 20, 2023
|
Lesedauer: 5 Minuten

LLMops CoE: Die nächste Grenze in der MLOps-Landschaft

April 16, 2024
|
Lesedauer: 5 Minuten

Cognita: Entwicklung modularer Open-Source-RAG-Anwendungen für die Produktion

May 25, 2023
|
Lesedauer: 5 Minuten

Open-Source-LLMs: Umarmen oder untergehen

August 27, 2025
|
Lesedauer: 5 Minuten

Kartierung des KI-Marktes vor Ort: Von Chips bis zu Steuerflugzeugen

May 16, 2026
|
Lesedauer: 5 Minuten

The Agent Sprawl Problem: Why Enterprises Need Control Before Autonomy

Keine Artikel gefunden.
May 15, 2026
|
Lesedauer: 5 Minuten

Introducing Skills Registry: Reusable Agent Skills for Production AI Systems

Keine Artikel gefunden.
Types of AI agents governed by TrueFoundry enterprise control plane
May 15, 2026
|
Lesedauer: 5 Minuten

Types of AI Agents: Definitions, Roles, and What They Mean for Enterprise Deployment

Keine Artikel gefunden.
May 15, 2026
|
Lesedauer: 5 Minuten

OAuth at the MCP Layer: How We Solved Enterprise Token Management for AI Agents

Keine Artikel gefunden.
Keine Artikel gefunden.

Aktuelle Blogs

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.
Machen Sie eine kurze Produkttour
Produkttour starten
Produkttour