Blank white background with no objects or features visible.

Nous vous offrons un accès gratuit à l'intégralité du Gartner Hype Cycle for AI Governance 2026. Obtenez votre exemplaire →

97.8M
AI requests routed through the Gateway in July 2026
99.995%
model request success rate in production

Staffbase est la première plateforme d'expérience employé nativement conçue pour l'IA. Elle réunit la communication, l'informatique et les RH pour atteindre chaque collaborateur — y compris les travailleurs de terrain, souvent les plus difficiles à joindre — via une application employé personnalisée, un intranet, l'e-mail, les SMS, l'affichage numérique, les intégrations Microsoft 365 et de nouvelles expériences basées sur des agents, comme des podcasts personnalisés et un assistant conversationnel. Plus de 1 500 entreprises clientes, dont Adidas, Alaska Airlines, DHL, MAN Truck & Bus et Whataburger, utilisent Staffbase pour communiquer avec leurs équipes. Nommée leader dans le Gartner® Magic Quadrant™ 2025 pour les solutions intranet packagées pour la troisième année consécutive et reconnue par G2 comme leader des intranets pour employés, l'entreprise a son siège à New York et à Chemnitz, en Allemagne.

Être « AI-native » signifie que l'IA n'est pas une simple option ajoutée chez Staffbase, mais le socle même sur lequel repose le produit. Chaque nouvelle expérience, de la recherche sémantique sur l'intranet à l'assistant conversationnel en passant par les podcasts personnalisés, dépend de l'exécution fiable, mondiale et à grande échelle de modèles de langage et d'inférence d'embeddings. Cette étude de cas examine comment Staffbase a utilisé la passerelle IA de TrueFoundry pour unifier cette inférence au sein d'une infrastructure cloud multi-régions complexe et en faire une plateforme unique et fiable.

Le défi : une IA à l'échelle de l'entreprise sur une infrastructure cloud étendue

Alors que Staffbase intégrait l'IA au cœur de sa plateforme, le véritable défi n'était pas d'appeler un modèle, mais d'exécuter l'inférence de manière fiable, à l'échelle et sur la zone géographique exigée par une plateforme d'expérience employé d'entreprise.

Trois pressions majeures se sont distinguées. Premièrement, le volume brut: une plateforme nativement IA au service de plus de 1 500 entreprises génère un volume d'inférence continu et massif, dominé par les appels d'embeddings qui alimentent la recherche et la récupération de contenu pour chaque client. Deuxièmement, une fragmentation des fournisseurs et des régions: la capacité était répartie entre plusieurs abonnements Azure et comptes cognitifs — des déploiements distincts dans des régions comme la Suède et la France, chacun avec ses propres clés API, quotas et limites de débit — auxquels s'ajoutait AWS Bedrock. Équilibrer manuellement le trafic entre tous ces éléments tout en respectant les limites de débit de chaque compte aurait été intenable. Troisièmement, la résidence des données et la fiabilité: avec un siège européen et des clients mondiaux, Staffbase devait acheminer l'inférence via les régions appropriées et, les communications internes étant critiques, garantir une disponibilité prouvable.

"Managing AI resources across multiple regions and subscriptions had become too complex to handle manually. We didn't want our engineers thinking about which cognitive account had quota left, or which region a request should land in — we needed one endpoint that just handled it. We were able to manage that with TrueFoundry."

Stefan Staude, Senior Site Reliability Engineer

La solution : une passerelle unique pour tous les abonnements, régions et modèles

Staffbase a standardisé son infrastructure sur la passerelle IA de TrueFoundry, utilisée comme plan de contrôle unique pour tout son trafic IA. Derrière un point de terminaison unique, la passerelle centralise désormais un backend délibérément complexe, tout en masquant cette complexité à toutes les équipes qui l'utilisent. 

1. Un proxy unifié pour 141 déploiements et 19 modèles

La passerelle offre à Staffbase une interface unique vers un backend qui couvre 5 abonnements Azure et AWS Bedrock, 28 comptes cognitifs Azure et 141 déploiements de modèles individuels répartis sur 9 régions. Les équipes appellent une API unique et accèdent à 19 modèles — des modèles de pointe les plus récents aux modèles spécialisés d'embedding et de reranking — sans avoir à configurer eux-mêmes les SDK, les clés ou les points de terminaison des fournisseurs. 

Gateway Azure subs Cognitive accounts Regions Routing targets Models
de1 / prod 1 6 4 32 18
us1 / prod 1 5 3 27 18
au1 / prod 1 6 5 23 17
de1 / stage 1 6 4 31 18
de1 / dev 1 + AWS 5 + Bedrock 3 + 1 28 19
Total 5 Azure + 1 AWS 28 Azure accounts 9 regions 141 —

Modèles disponibles (19) : gpt-5.6-luna, gpt-5.6-sol, gpt-5.6-terra, gpt-5.5, gpt-5.4, gpt-5.1, gpt-5-mini, gpt-5-nano, gpt-4.1, gpt-4.1-mini, gpt-4.1-nano, gpt-4o, claude-sonnet-5, claude-sonnet-4-6, claude-haiku-4-5, Mistral-Large-3, text-embedding-3-large, text-embedding-3-small, cohere-rerank-v3-5.

2. Équilibrage de charge intelligent entre les abonnements et les régions

C'est ici que la passerelle démontre toute sa valeur. La capacité Azure de Staffbase est répartie entre différents comptes cognitifs — la Suède et la France, par exemple, se trouvent dans le même abonnement mais disposent de leurs propres clés API, quotas et limites de débit. La passerelle regroupe les 141 cibles de déploiement en une capacité logique unique et achemine chaque requête vers un déploiement disposant de marge de manœuvre, contournant automatiquement les limites de débit par compte et basculant vers un autre point de terminaison en cas de saturation. La passerelle de production de1 équilibre à elle seule la charge entre 32 cibles de routage; au total, la passerelle gère 141 cibles sur l'ensemble des environnements. Ce qui relevait autrefois d'une planification manuelle de la capacité est désormais une préoccupation dont les ingénieurs n'ont plus à se soucier.

“The routing and load balancing across our Azure accounts is the single biggest thing the Gateway does for us. Sweden, France, every deployment gets pooled into one endpoint, and traffic just flows to wherever there’s quota. We prevented hitting rate limits and stopped babysitting capacity.”

Stefan Staude, Senior Site Reliability Engineer

3. Routage multi-région pour la résidence des données et la latence

La production fonctionne via des passerelles régionales distinctes — prod-de1 (Europe), prod-us1 (États-Unis) et prod-au1 (Australie) — afin que les requêtes soient traitées depuis la zone géographique appropriée, tant pour la résidence des données que pour la latence. Pour une plateforme dont le siège est en Europe et qui compte des clients entreprises dans le monde entier, le routage des inférences via des passerelles spécifiques à chaque région permet de maintenir les données là où elles doivent être, tout en offrant à chaque région son propre pool de capacité fiable.

4. Embeddings à très grande échelle

La composition du trafic témoigne d'un produit nativement conçu pour l'IA : les embeddings représentent plus de 97 % de tout le trafic de la passerelle, alimentant la récupération et la recherche sémantique derrière les expériences IA de Staffbase. Depuis son lancement en février, la passerelle a traité environ 108,2 millions de requêtes vers text-embedding-3-small et 29,3 millions vers text-embedding-3-large, ainsi que 2,5 millions de requêtes de génération vers gpt-5-mini, avec un volume croissant sur les modèles de pointe.

Model (since Feb, ~177 days) Total requests
text-embedding-3-small ~108.2M
text-embedding-3-large ~29.3M
gpt-5-mini ~2.5M

5. Une fiabilité mesurable

Parce que les communications internes ne peuvent se permettre aucune interruption, Staffbase suit la passerelle par rapport à des SLO formels. Sur une fenêtre glissante de 28 jours, la disponibilité atteint jusqu'à 99,99998 % — dépassant largement les « cinq neuf » — sur tous les environnements de production, et les taux de succès des requêtes de modèles se maintiennent à 99,99 % et plus, une fois exclues les erreurs de configuration attendues (réponses de limitation de débit et d'authentification).

Environment Availability (28d) Success rate (30d)
prod-de1 99.99998% 99.995%
prod-us1 99.99987% 99.995%
prod-au1 99.99674% 99.990%
dev 99.99981% 99.990%
stage-de1 99.99976% 99.984%

6. Visibilité des coûts par fonctionnalité et par équipe

Environ 22 fonctionnalités produit et équipes distinctes acheminent aujourd'hui leur trafic via la passerelle, et chacune des 12 fonctionnalités lancées par Staffbase entre février et mai 2026 en dépend. Comme tout ce trafic transite par une surface gouvernée unique, Staffbase bénéficie d'une vue unifiée et attribuable de l'utilisation et des dépenses — pour une fraction du coût que le volume pourrait laisser supposer. 

Un support au rythme d'une feuille de route dynamique

L'adoption d'une plateforme aussi structurante ne fonctionne que si le fournisseur avance à la vitesse des équipes. Staffbase a souligné la réactivité de TrueFoundry — en particulier la rapidité avec laquelle les demandes de fonctionnalités sont traitées — comme un avantage réel dans la mise à l'échelle de son adoption de l'IA.

Résultats : plus de 140 millions de requêtes gouvernées avec une fiabilité de 99,99 % et plus

En centralisant ses opérations sur TrueFoundry, Staffbase a transformé une empreinte IA fragmentée, multi-abonnement et multi-région en une plateforme gouvernée unique sur laquelle ses équipes peuvent bâtir sans friction.

Depuis son lancement en février, la passerelle a géré plus de 141 millions de requêtes — soit environ 97,8 millions par mois en moyenne — et a traité 29,2 milliards de jetons (27,3 milliards en entrée et 1,9 milliard en sortie). Elle a maintenu une disponibilité atteignant 99,99998 % et des taux de réussite supérieurs à 99,99 %, tout en assurant l'équilibrage de charge sur 141 déploiements répartis dans 9 régions, le tout via un point de terminaison unique. Environ 22 fonctionnalités et équipes s'appuient sur cette solution, et chaque fonctionnalité d'IA déployée par Staffbase en 2026 repose sur elle.

“The Gateway became the layer every AI feature is built on. It gave us one place to run inference at scale, across every region and provider, with the reliability our customers expect — and it did it without our teams having to become infrastructure experts.”

Luca Ghersi, Director of Engineering @ Staffbase

Points clés pour les équipes adoptant une passerelle d'IA

  • Mutualisez votre capacité, ne la gérez pas manuellement. Lorsque l'inférence est répartie sur de nombreux abonnements, comptes et régions, une passerelle qui les regroupe en une capacité logique unique et contourne les limites de débit élimine une charge opérationnelle considérable.
  • Concevez pour la charge de travail réelle. Pour un produit natif IA, les embeddings peuvent dominer le trafic — plus de 97 % dans notre cas. Une passerelle qui achemine efficacement les appels à haut volume et à faible coût permet de maintenir les dépenses bien en dessous de ce que suggère le nombre brut de requêtes.
  • Rendez la fiabilité mesurable. Le suivi de la passerelle par rapport à des SLO formels a transformé la disponibilité : d'un simple espoir, elle est devenue un indicateur chiffré sur lequel Staffbase peut s'engager pour ses communications critiques.
  • Centralisez d'abord, attribuez ensuite. Un point de terminaison unique et gouverné pour environ 22 fonctionnalités a offert à Staffbase une vision centralisée de l'utilisation et des coûts, ventilée par fonctionnalité et par équipe, évitant ainsi de devoir réconcilier les dépenses entre différents fournisseurs.

Conclusion

L'expérience de Staffbase démontre qu'être natif IA à l'échelle de l'entreprise ne nécessite pas de construire une infrastructure d'inférence à partir de zéro. En standardisant sur l'AI Gateway de TrueFoundry pour une inférence unifiée, un équilibrage de charge multi-région intelligent et une visibilité sur les coûts — à travers 5 abonnements Azure, AWS Bedrock, 28 comptes cognitifs et 141 déploiements — Staffbase a atteint plus de 140 millions de requêtes gouvernées avec une fiabilité de 99,999 %, tout en offrant à chaque équipe un point d'accès fiable pour concevoir la prochaine génération d'expériences collaborateur.

Le moyen le plus rapide de créer, de gérer et de faire évoluer votre IA

Exploitez votre pipeline ML dès le premier jour

gazoduc