Blank white background with no objects or features visible.

Wir stellen Ihnen den vollständigen Gartner Hype Cycle für KI-Governance 2026 kostenlos zur Verfügung. Hier Exemplar sichern →

97.8M
AI requests routed through the Gateway in July 2026
99.995%
model request success rate in production

Staffbase ist die erste KI-native Plattform für Mitarbeitererfahrung. Sie vereint Kommunikation, IT und Personalwesen, um jeden Mitarbeiter zu erreichen – auch die oft schwer erreichbare Frontline-Belegschaft. Dies geschieht über eine gebrandete Mitarbeiter-App, Intranet, E-Mail, SMS, Digital Signage, Microsoft 365-Integrationen sowie neue agentenbasierte Funktionen wie personalisierte Podcasts und einen KI-Assistenten. Mehr als 1.500 Unternehmenskunden, darunter Adidas, Alaska Airlines, DHL, MAN Truck & Bus und Whataburger, nutzen Staffbase, um ihre Belegschaft zu erreichen. Das Unternehmen wurde im dritten Jahr in Folge als Leader im Gartner® Magic Quadrant™ für Intranet Packaged Solutions 2025 ausgezeichnet, von G2 als Leader für Mitarbeiter-Intranets geführt und hat seinen Hauptsitz in New York City und Chemnitz.

KI-nativ zu sein bedeutet, dass KI bei Staffbase kein nachträglich hinzugefügtes Feature ist, sondern das Fundament, auf dem das Produkt aufbaut. Jede neue Funktion, von der semantischen Suche im Intranet über den KI-Assistenten bis hin zu personalisierten Podcasts, hängt davon ab, dass Sprachmodelle und Embedding-Inferenz zuverlässig, global und in Unternehmensgröße ausgeführt werden. Diese Fallstudie zeigt, wie Staffbase das TrueFoundry AI Gateway nutzte, um diese Inferenz über eine weit verzweigte Multi-Region-Cloud-Infrastruktur zu vereinheitlichen und in eine einzige, verlässliche Plattform zu verwandeln.

Die Herausforderung: KI in Unternehmensgröße über eine weit verzweigte Cloud-Infrastruktur

Als Staffbase die KI zum Kern seiner Plattform machte, bestand die größte Schwierigkeit nicht darin, ein Modell aufzurufen, sondern die Inferenz zuverlässig in dem Umfang und über die geografische Reichweite hinweg zu betreiben, die eine Plattform für Mitarbeitererfahrung erfordert.

Drei Herausforderungen stachen besonders hervor. Erstens: massive Skalierung: Eine KI-native Plattform, die über 1.500 Unternehmenskunden bedient, erzeugt ein enormes, kontinuierliches Inferenzvolumen, das vor allem durch Embedding-Aufrufe für die Suche und den Abruf von Inhalten über alle Kunden hinweg dominiert wird. Zweitens: eine fragmentierte Anbieter- und Regionenlandschaft: Die Kapazitäten waren über mehrere Azure-Abonnements und Cognitive Accounts verteilt – separate Deployments in Regionen wie Schweden und Frankreich, jeweils mit eigenen API-Schlüsseln, Kontingenten und Ratenbegrenzungen – sowie AWS Bedrock. Den Datenverkehr manuell über all diese Instanzen auszubalancieren und dabei die Ratenbegrenzungen jedes Kontos einzuhalten, wäre unmöglich gewesen. Drittens: Datenresidenz und Zuverlässigkeit: Mit einem europäischen Hauptsitz und globalen Kunden musste Staffbase sicherstellen, dass die Inferenz über die richtigen Regionen geleitet wird. Da Mitarbeiterkommunikation geschäftskritisch ist, war eine nachweisbare Verfügbarkeit unerlässlich.

"Managing AI resources across multiple regions and subscriptions had become too complex to handle manually. We didn't want our engineers thinking about which cognitive account had quota left, or which region a request should land in — we needed one endpoint that just handled it. We were able to manage that with TrueFoundry."

Stefan Staude, Senior Site Reliability Engineer

Die Lösung: Ein Gateway für alle Abonnements, Regionen und Modelle

Staffbase hat das TrueFoundry AI Gateway als zentrale Steuerungsebene für den gesamten KI-Datenverkehr standardisiert. Hinter einem einzigen Endpunkt bündelt das Gateway nun ein bewusst komplexes Backend und verbirgt diese Komplexität vor allen Teams, die darauf aufbauen. 

1. Ein vereinheitlichter Proxy für 141 Deployments und 19 Modelle

Das Gateway bietet Staffbase eine einheitliche Schnittstelle zu einem Backend, das 5 Azure-Abonnements plus AWS Bedrock, 28 Azure Cognitive Accounts und 141 individuelle Modell-Deployments über 9 Regionen umfasst. Teams rufen eine einzige API auf und erhalten Zugriff auf 19 Modelle – von den neuesten Spitzenmodellen bis hin zu spezialisierten Embedding- und Reranking-Modellen –, ohne selbst Anbieter-SDKs, Schlüssel oder Endpunkte konfigurieren zu müssen. 

Gateway Azure subs Cognitive accounts Regions Routing targets Models
de1 / prod 1 6 4 32 18
us1 / prod 1 5 3 27 18
au1 / prod 1 6 5 23 17
de1 / stage 1 6 4 31 18
de1 / dev 1 + AWS 5 + Bedrock 3 + 1 28 19
Total 5 Azure + 1 AWS 28 Azure accounts 9 regions 141 —

Verfügbare Modelle (19): gpt-5.6-luna, gpt-5.6-sol, gpt-5.6-terra, gpt-5.5, gpt-5.4, gpt-5.1, gpt-5-mini, gpt-5-nano, gpt-4.1, gpt-4.1-mini, gpt-4.1-nano, gpt-4o, claude-sonnet-5, claude-sonnet-4-6, claude-haiku-4-5, Mistral-Large-3, text-embedding-3-large, text-embedding-3-small, cohere-rerank-v3-5.

2. Intelligenter Lastausgleich über Abonnements und Regionen hinweg

Hier beweist das Gateway seinen wahren Wert. Die Azure-Kapazität von Staffbase ist auf verschiedene Cognitive Accounts verteilt – Schweden und Frankreich befinden sich beispielsweise im selben Abonnement, verfügen jedoch über eigene API-Schlüssel, Kontingente und Ratenbegrenzungen. Das Gateway bündelt alle 141 Bereitstellungsziele zu einer logischen Kapazität und leitet jede Anfrage an eine Bereitstellung mit freier Kapazität weiter. So werden Ratenbegrenzungen pro Konto automatisch umgangen und bei einer Überlastung eines Endpunkts ein Failover durchgeführt. Allein das Produktions-Gateway de1 verteilt die Last auf 32 Routing-Ziele; über alle Umgebungen hinweg verwaltet das Gateway 141. Was früher ein manuelles Kapazitätsplanungsproblem war, ist heute für die Ingenieure kein Thema mehr.

“The routing and load balancing across our Azure accounts is the single biggest thing the Gateway does for us. Sweden, France, every deployment gets pooled into one endpoint, and traffic just flows to wherever there’s quota. We prevented hitting rate limits and stopped babysitting capacity.”

Stefan Staude, Senior Site Reliability Engineer

3. Multi-Region-Routing für Datenresidenz und Latenz

Die Produktion läuft über separate regionale Gateways – prod-de1 (Europa), prod-us1 (USA) und prod-au1 (Australien) –, sodass Anfragen aus der jeweils richtigen geografischen Region bedient werden, um sowohl Datenresidenz als auch Latenz zu optimieren. Für eine Plattform mit europäischem Hauptsitz und Unternehmenskunden auf der ganzen Welt sorgt das Routing von Inferenzanfragen über regionsspezifische Gateways dafür, dass Daten dort bleiben, wo sie hingehören, während jede Region ihren eigenen, zuverlässigen Kapazitätspool erhält.

4. Embeddings in massivem Umfang

Der Traffic-Mix verdeutlicht den Charakter eines KI-nativen Produkts: Embeddings machen über 97 % des gesamten Gateway-Trafficsaus und bilden die Grundlage für das Retrieval und die semantische Suche hinter den KI-Funktionen von Staffbase. Seit dem Go-Live im Februar hat das Gateway rund 108,2 Millionen Anfragen an text-embedding-3-small und 29,3 Millionen an text-embedding-3-large verarbeitet, dazu kommen 2,5 Millionen Generierungsanfragen an gpt-5-mini sowie ein wachsendes Volumen bei den Frontier-Modellen.

Model (since Feb, ~177 days) Total requests
text-embedding-3-small ~108.2M
text-embedding-3-large ~29.3M
gpt-5-mini ~2.5M

5. Messbare Zuverlässigkeit

Da Ausfallzeiten bei der Mitarbeiterkommunikation nicht tragbar sind, überwacht Staffbase das Gateway anhand formaler SLOs. Über einen rollierenden 28-Tage-Zeitraum liegt die Verfügbarkeit in allen Produktionsumgebungen bei bis zu 99,99998 % – also deutlich über den „fünf Neunen“. Die Erfolgsrate bei Modellanfragen liegt bei 99,99 % und mehr, sobald erwartete Einrichtungsfehler (Ratenbegrenzungs- und Authentifizierungsantworten) herausgerechnet werden.

Environment Availability (28d) Success rate (30d)
prod-de1 99.99998% 99.995%
prod-us1 99.99987% 99.995%
prod-au1 99.99674% 99.990%
dev 99.99981% 99.990%
stage-de1 99.99976% 99.984%

6. Kostentransparenz pro Funktion und Team

Rund 22 verschiedene Produktfunktionen und Teams leiten ihren Traffic heute über das Gateway, und jede der 12 Funktionen, die Staffbase zwischen Februar und Mai 2026 veröffentlicht hat, ist davon abhängig. Da der gesamte Traffic über eine zentrale, kontrollierte Schnittstelle fließt, erhält Staffbase einen einheitlichen, zuordenbaren Überblick über Nutzung und Ausgaben – und das zu einem Bruchteil der Kosten, die das Volumen vermuten ließe. 

Support, der mit einer schnelllebigen Roadmap Schritt hält

Die Einführung einer solchen Plattform ist nur dann sinnvoll, wenn der Anbieter genauso schnell agiert wie das Team. Staffbase hob die Reaktionsfähigkeit von TrueFoundry – insbesondere die Geschwindigkeit bei der Umsetzung von Funktionsanfragen – als echten Vorteil bei der Skalierung der KI-Nutzung hervor.

Ergebnisse: Über 140 Mio. verwaltete Anfragen bei 99,99 %+ Zuverlässigkeit

Durch die Zentralisierung auf TrueFoundry hat Staffbase eine fragmentierte KI-Infrastruktur mit mehreren Abonnements und Regionen in eine einzige, kontrollierte Plattform verwandelt, auf der die Teams reibungslos arbeiten können.

Seit dem Start im Februar hat das Gateway mehr als 141 Millionen Anfragen – mittlerweile rund 97,8 Millionen in einem typischen Monat – gesteuert und 29,2 Milliarden Token (27,3 Mrd. Input und 1,9 Mrd. Output) verarbeitet. Es erreichte eine Verfügbarkeit von bis zu 99,99998 % und Erfolgsraten von über 99,99 %, während es die Last auf 141 Deployments in 9 Regionen über einen einzigen Endpunkt verteilte. Etwa 22 Funktionen und Teams nutzen das System, und jedes KI-Feature, das Staffbase im Jahr 2026 veröffentlicht hat, basiert darauf.

“The Gateway became the layer every AI feature is built on. It gave us one place to run inference at scale, across every region and provider, with the reliability our customers expect — and it did it without our teams having to become infrastructure experts.”

Luca Ghersi, Director of Engineering @ Staffbase

Wichtige Erkenntnisse für Teams, die ein KI-Gateway einführen

  • Bündeln Sie Ihre Kapazitäten, statt sie manuell zu verwalten. Wenn Inferenz auf viele Abonnements, Konten und Regionen verteilt ist, eliminiert ein Gateway, das diese zu einer logischen Kapazität zusammenfasst und Ratenbegrenzungen umgeht, eine ganze Kategorie operativer Arbeit.
  • Richten Sie sich nach der tatsächlichen Arbeitslast. Bei einem KI-nativen Produkt können Embeddings den Datenverkehr dominieren – hier sind es über 97 %. Ein Gateway, das hochvolumige, kostengünstige Aufrufe effizient weiterleitet, hält die Ausgaben weit unter dem, was die reine Anzahl der Anfragen vermuten ließe.
  • Machen Sie Zuverlässigkeit messbar. Die Überwachung des Gateways anhand formaler SLOs machte aus der Hoffnung auf Verfügbarkeit eine Kennzahl, für die Staffbase bei geschäftskritischer Kommunikation einstehen kann.
  • Erst zentralisieren, dann zuordnen. Ein einziger gesteuerter Endpunkt für ca. 22 Funktionen verschaffte Staffbase einen einheitlichen Überblick über Nutzung und Kosten, die sich den jeweiligen Funktionen und Teams zuordnen lassen, anstatt Ausgaben mühsam über verschiedene Anbieter hinweg abzugleichen.

Fazit

Die Erfahrung von Staffbase zeigt, dass KI-Native-Produkte im Unternehmensmaßstab keine eigene Inferenz-Infrastruktur von Grund auf erfordern. Durch die Standardisierung auf das KI-Gateway von TrueFoundry für einheitliche Inferenz, intelligentes Multi-Region-Load-Balancing und Kostentransparenz – über 5 Azure-Abonnements, AWS Bedrock, 28 Cognitive-Konten und 141 Deployments hinweg – konnte Staffbase auf über 140 Millionen gesteuerte Anfragen bei einer Zuverlässigkeit von 99,999 % skalieren und gleichzeitig jedem Team eine verlässliche Basis für die nächste Generation von Mitarbeitererlebnissen bieten.

Der schnellste Weg, deine KI zu entwickeln, zu steuern und zu skalieren

Betreiben Sie Ihre ML-Pipeline ab Tag 0

Rohrleitung