Blank white background with no objects or features visible.

Te ofrecemos acceso gratuito al informe completo Gartner Hype Cycle for AI Governance 2026. Consigue tu copia →

97.8M
AI requests routed through the Gateway in July 2026
99.995%
model request success rate in production

Staffbase es la primera plataforma de experiencia del empleado nativa en IA. Integra comunicaciones, TI y RR. HH. para llegar a cada empleado —incluidos los trabajadores de primera línea, a menudo los más difíciles de conectar— a través de una aplicación corporativa, intranet, correo electrónico, SMS, señalización digital, integraciones con Microsoft 365 y nuevas experiencias basadas en agentes, como podcasts personalizados y un asistente conversacional. Más de 1.500 clientes empresariales, entre ellos Adidas, Alaska Airlines, DHL, MAN Truck & Bus y Whataburger, utilizan Staffbase para conectar con su personal. Nombrada líder en el Cuadrante Mágico™ de Gartner® 2025 para soluciones de intranet empaquetadas por tercer año consecutivo y reconocida por G2 como líder en intranets para empleados, la empresa tiene su sede en Nueva York y Chemnitz, Alemania.

Ser nativo en IA significa que la IA no es un complemento en Staffbase, sino el cimiento sobre el que se construye el producto. Cada nueva experiencia, desde la búsqueda semántica en la intranet hasta el asistente conversacional y los podcasts personalizados, depende de ejecutar la inferencia de modelos de lenguaje y embeddings de forma fiable, global y a escala empresarial. Este caso de estudio analiza cómo Staffbase utilizó la pasarela de IA de TrueFoundry para unificar dicha inferencia en una amplia infraestructura en la nube multirregional y convertirla en una plataforma única y fiable.

El desafío: IA a escala empresarial en una infraestructura en la nube dispersa

A medida que Staffbase integraba la IA en el núcleo de su plataforma, el verdadero reto no era invocar un modelo, sino ejecutar la inferencia de forma fiable a la escala y con la cobertura geográfica que exige una plataforma de experiencia del empleado para grandes empresas.

Destacaron tres presiones. Primero, escala bruta: una plataforma nativa en IA que sirve a más de 1.500 clientes empresariales genera un volumen de inferencia enorme y continuo, dominado por las llamadas de embedding que impulsan la búsqueda y recuperación en todo el contenido de los clientes. Segundo, una infraestructura fragmentada de proveedores y regiones: la capacidad estaba repartida entre múltiples suscripciones y cuentas cognitivas de Azure —despliegues independientes en regiones como Suecia y Francia, cada uno con sus propias claves de API, cuotas y límites de tasa— además de AWS Bedrock. Equilibrar el tráfico manualmente entre todos ellos y mantenerse dentro de los límites de tasa de cada cuenta habría sido insostenible. Tercero, residencia de datos y fiabilidad: con sede central en Europa y clientes globales, Staffbase necesitaba que la inferencia se enrutara a través de las regiones adecuadas y, dado que las comunicaciones de los empleados son críticas, necesitaba una disponibilidad demostrable.

"Managing AI resources across multiple regions and subscriptions had become too complex to handle manually. We didn't want our engineers thinking about which cognitive account had quota left, or which region a request should land in — we needed one endpoint that just handled it. We were able to manage that with TrueFoundry."

Stefan Staude, Senior Site Reliability Engineer

La solución: una pasarela única para todas las suscripciones, regiones y modelos

Staffbase estandarizó la pasarela de IA de TrueFoundry como el plano de control único para todo su tráfico de IA. Detrás de un punto de conexión, la pasarela gestiona ahora un backend deliberadamente complejo, ocultando dicha complejidad a todos los equipos que desarrollan sobre ella. 

1. Un proxy unificado para 141 despliegues y 19 modelos

La pasarela ofrece a Staffbase una interfaz única para un backend que abarca 5 suscripciones de Azure más AWS Bedrock, 28 cuentas cognitivas de Azure y 141 despliegues de modelos individuales en 9 regiones. Los equipos llaman a una única API y obtienen acceso a 19 modelos —desde los modelos de vanguardia más recientes hasta modelos especializados de embedding y reranking— sin tener que configurar ellos mismos los SDK, claves o puntos de conexión de los proveedores. 

Gateway Azure subs Cognitive accounts Regions Routing targets Models
de1 / prod 1 6 4 32 18
us1 / prod 1 5 3 27 18
au1 / prod 1 6 5 23 17
de1 / stage 1 6 4 31 18
de1 / dev 1 + AWS 5 + Bedrock 3 + 1 28 19
Total 5 Azure + 1 AWS 28 Azure accounts 9 regions 141 —

Modelos disponibles (19): gpt-5.6-luna, gpt-5.6-sol, gpt-5.6-terra, gpt-5.5, gpt-5.4, gpt-5.1, gpt-5-mini, gpt-5-nano, gpt-4.1, gpt-4.1-mini, gpt-4.1-nano, gpt-4o, claude-sonnet-5, claude-sonnet-4-6, claude-haiku-4-5, Mistral-Large-3, text-embedding-3-large, text-embedding-3-small, cohere-rerank-v3-5.

2. Balanceo de carga inteligente entre suscripciones y regiones

Aquí es donde el Gateway demuestra su valor. La capacidad de Azure de Staffbase se divide en cuentas cognitivas independientes; por ejemplo, Suecia y Francia están en la misma suscripción, pero tienen sus propias claves de API, cuotas y límites de tasa. El Gateway agrupa los 141 destinos de despliegue en una capacidad lógica única y dirige cada solicitud al despliegue con mayor disponibilidad, sorteando automáticamente los límites de tasa por cuenta y realizando conmutaciones por error cuando un punto de conexión se satura. Solo el gateway de producción de de1 equilibra entre 32 destinos de enrutamiento; en todos los entornos, el Gateway gestiona 141. Lo que antes era un problema de planificación de capacidad manual, ahora es algo en lo que los ingenieros nunca tienen que pensar.

“The routing and load balancing across our Azure accounts is the single biggest thing the Gateway does for us. Sweden, France, every deployment gets pooled into one endpoint, and traffic just flows to wherever there’s quota. We prevented hitting rate limits and stopped babysitting capacity.”

Stefan Staude, Senior Site Reliability Engineer

3. Enrutamiento multirregional para la residencia de datos y la latencia

La producción se ejecuta como gateways regionales distintos (prod-de1 para Europa, prod-us1 para EE. UU. y prod-au1 para Australia), por lo que las solicitudes se atienden desde la ubicación geográfica adecuada tanto por motivos de residencia de datos como de latencia. Para una plataforma con sede en Europa y clientes empresariales en todo el mundo, dirigir la inferencia a través de gateways específicos por región mantiene los datos donde deben estar, al tiempo que proporciona a cada región su propio grupo de capacidad fiable.

4. Embeddings a gran escala

La combinación de tráfico cuenta la historia de un producto nativo de IA: los embeddings representan más del 97% de todo el tráfico del Gateway, impulsando la recuperación y la búsqueda semántica detrás de las experiencias de IA de Staffbase. Desde su lanzamiento en febrero, el Gateway ha procesado aproximadamente 108,2 millones de solicitudes a text-embedding-3-small y 29,3 millones a text-embedding-3-large, además de 2,5 millones de solicitudes de generación a gpt-5-mini, con un volumen creciente en los modelos de vanguardia.

Model (since Feb, ~177 days) Total requests
text-embedding-3-small ~108.2M
text-embedding-3-large ~29.3M
gpt-5-mini ~2.5M

5. Fiabilidad que se puede medir

Dado que las comunicaciones de los empleados no pueden permitirse tiempos de inactividad, Staffbase supervisa el Gateway mediante SLO formales. En una ventana móvil de 28 días, la disponibilidad se sitúa en hasta un 99,99998% (superando cómodamente los cinco nueves) en todos los entornos de producción, y las tasas de éxito de las solicitudes de modelos se mantienen en un 99,99% o más una vez que se excluyen los errores de configuración esperados (respuestas de límite de tasa y autenticación).

Environment Availability (28d) Success rate (30d)
prod-de1 99.99998% 99.995%
prod-us1 99.99987% 99.995%
prod-au1 99.99674% 99.990%
dev 99.99981% 99.990%
stage-de1 99.99976% 99.984%

6. Visibilidad de costes por función y por equipo

Alrededor de 22 funciones de producto y equipos distintos dirigen su tráfico a través del Gateway hoy en día, y cada una de las 12 funciones que Staffbase lanzó entre febrero y mayo de 2026 depende de él. Debido a que todo ese tráfico fluye a través de una superficie gobernada, Staffbase obtiene una visión única y atribuible del uso y el gasto, por una fracción de lo que sugiere el volumen. 

Soporte que sigue el ritmo de una hoja de ruta en constante evolución

Adoptar una plataforma tan profundamente solo funciona si el proveedor se mueve a la velocidad del equipo. Staffbase destacó la capacidad de respuesta de TrueFoundry, especialmente la rapidez con la que se atienden las solicitudes de nuevas funciones, como una ventaja real a medida que escala su adopción de IA.

Resultados: más de 140 millones de solicitudes gobernadas con una fiabilidad del 99,99%+

Al centralizarse en TrueFoundry, Staffbase convirtió una infraestructura de IA fragmentada, multisuscripción y multirregional en una plataforma única y gobernada sobre la que sus equipos pueden construir sin fricciones.

Desde su lanzamiento en febrero, el Gateway ha gestionado más de 141 millones de solicitudes — actualmente alrededor de 97,8 millones al mes — y ha procesado 29 200 millones de tokens (27 300 millones de entrada y 1900 millones de salida). Ha mantenido una disponibilidad de hasta el 99,99998 % y tasas de éxito superiores al 99,99 %, equilibrando la carga entre 141 implementaciones en 9 regiones, todo bajo un único punto de acceso. Aproximadamente 22 funciones y equipos dependen de él, y todas las funciones de IA que Staffbase lanzó en 2026 se ejecutan sobre esta plataforma.

“The Gateway became the layer every AI feature is built on. It gave us one place to run inference at scale, across every region and provider, with the reliability our customers expect — and it did it without our teams having to become infrastructure experts.”

Luca Ghersi, Director of Engineering @ Staffbase

Conclusiones clave para los equipos que adoptan un gateway de IA

  • Centralice su capacidad, no la gestione manualmente. Cuando la inferencia se distribuye entre múltiples suscripciones, cuentas y regiones, un gateway que las agrupa en una capacidad lógica única y evita los límites de tasa elimina una gran carga de trabajo operativo.
  • Diseñe para la carga de trabajo real. En un producto nativo de IA, los embeddings pueden dominar el tráfico (más del 97 % en este caso). Un gateway que enruta de forma eficiente las llamadas de alto volumen y bajo coste mantiene el gasto muy por debajo de lo que sugeriría el número total de solicitudes.
  • Haga que la fiabilidad sea medible. El seguimiento del gateway frente a SLO formales convirtió el tiempo de actividad de una simple expectativa en una cifra que Staffbase puede garantizar para comunicaciones críticas.
  • Centralice primero, atribuya después. Un punto de acceso único y gobernado para unas 22 funciones permitió a Staffbase obtener una visión unificada del uso y los costes, atribuibles por función y equipo, en lugar de tener que conciliar gastos entre distintos proveedores.

Conclusión

La experiencia de Staffbase demuestra que ser nativo de IA a escala empresarial no requiere construir una infraestructura de inferencia desde cero. Al estandarizar el uso del AI Gateway de TrueFoundry para la inferencia unificada, el equilibrio de carga inteligente entre regiones y la visibilidad de costes —a través de 5 suscripciones de Azure, AWS Bedrock, 28 cuentas cognitivas y 141 implementaciones—, Staffbase escaló a más de 140 millones de solicitudes gestionadas con una fiabilidad de cinco nueves, ofreciendo a cada equipo un lugar fiable donde construir la próxima generación de experiencias para empleados.

La forma más rápida de crear, gobernar y escalar su IA

Opere su oleoducto ML desde el día 0

conducto