Construyendo la capa de infraestructura que le faltaba a la IA empresarial
.webp)
Diseñado para la velocidad: ~ 10 ms de latencia, incluso bajo carga
¡Una forma increíblemente rápida de crear, rastrear e implementar sus modelos!
- Gestiona más de 350 RPS en solo 1 vCPU, sin necesidad de ajustes
- Listo para la producción con soporte empresarial completo
En 2022, antes de que ChatGPT entrara en el vocabulario cultural, nuestros fundadores Nikunj Bajaj, Abhishek y Anuraag ya estaban construyendo. No reaccionaban a una tendencia ni perseguían un momento, sino que construían desde la convicción de que el mundo empresarial estaba a punto de alcanzar un punto de inflexión para el que no estaba preparado.
Esa convicción venía de dentro. Antes de fundar TrueFoundry, Nikunj había trabajado en Meta, donde la experiencia de trabajar con infraestructura de aprendizaje automático a escala cambió fundamentalmente su forma de concebir el problema.
"La forma en que se construyen modelos de aprendizaje automático en Meta es fundamentalmente diferente de cómo se hace utilizando el ecosistema de la nube pública externa", compartió Nikunj en el podcast Code Story. "Meta concibe el aprendizaje automático como un caso especial de la ingeniería de software y la IA generativa como un caso especial del aprendizaje automático".
Ese modelo mental —software en la base, ML en el medio, GenAI en la cima, todo funcionando a través de una interfaz unificada en infraestructura compartida— no es como operan la mayoría de las empresas. La mayoría de las organizaciones ejecutan dos, a veces tres, pilas paralelas: una para software, otra para ML y, ahora, cada vez más, una separada para GenAI. El resultado es fragmentación, redundancia y un sistema que colapsa bajo su propio peso a medida que escala.
TrueFoundry fue fundada para solucionar precisamente eso.
La apuesta que tardó un año en construirse
Cuando la gente habla de MVPs, suelen referirse a algo rudimentario, un prototipo rápido para probar una hipótesis. La versión de TrueFoundry de eso era muy diferente.
"Pasamos más de un año dedicados por completo al desarrollo de la plataforma", explicó Nikunj. "Estábamos construyendo la infraestructura central sobre la cual las empresas pueden empezar a construir sus aplicaciones de aprendizaje automático e IA generativa y lanzarlas a producción".
La apuesta técnica central de ese trabajo fue Kubernetes. El equipo creía que, así como las cargas de trabajo de software habían convergido en Kubernetes para la orquestación, las cargas de trabajo de ML seguirían el mismo camino. En ese momento, Kubeflow era la herramienta dominante que ayudaba a las organizaciones a ejecutar ML en Kubernetes, pero sus contribuciones estaban disminuyendo a medida que Google desplazaba su inversión hacia Vertex. El equipo de TrueFoundry vio esa brecha y la ocupó deliberadamente, construyendo toda su pila de ML y GenAI para ejecutarse de forma nativa en Kubernetes. Esa decisión les dio algo invaluable: una infraestructura que podía ejecutarse en cualquier lugar —AWS, GCP, Azure o en local— sin estar atada a ningún proveedor de nube único.
Fue un comienzo paciente y basado en principios. Y sentó las bases para todo lo que siguió.
Adaptándose a un mundo que no dejaba de moverse
Una de las cosas más llamativas de la trayectoria del producto de TrueFoundry es la constancia con la que el mundo a su alrededor cambiaba y la deliberación con la que ellos se adaptaban.
En 2022, los grandes modelos de lenguaje se volvieron genuinamente útiles por primera vez. En 2023, las empresas descubrieron que las respuestas útiles requerían basarse en sus propios datos, y RAG (Generación Aumentada por Recuperación) se convirtió en el paradigma dominante. Para 2024, los agentes se estaban volviendo una realidad, y las organizaciones comenzaron a pensar seriamente en integrar la IA en los flujos de trabajo de producción. En 2025, MCP (Protocolo de Contexto de Modelo) y la comunicación entre agentes surgieron como la nueva frontera.
Cada año, el modelo operativo cambiaba. Y el enfoque de TrueFoundry fue mantener constante la arquitectura fundamental mientras adaptaba la capa que se encuentra por encima: la experiencia del desarrollador, las interfaces, el tejido conectivo entre componentes.
"Nos adaptamos al modus operandi", dijo Nikunj. "Construimos la capa de UX a su alrededor, pero siempre volvemos al mismo principio fundamental sobre cómo ejecutar estas cargas de trabajo en la misma infraestructura subyacente".
El producto actual refleja esa filosofía. El AI Gateway de TrueFoundry se sitúa en el centro de cada llamada a la API que una empresa realiza a sus LLM y agentes. Abarca una pasarela LLM, una pasarela MCP y una pasarela de agentes, un plano de control unificado para la observabilidad, la gobernanza, la gestión de costes y el cumplimiento en toda la pila de agentes. Junto a él, el producto AI Deployments permite a las empresas ejecutar modelos personalizados, alojar servidores MCP y orquestar agentes en su propia computación, todo a través de una interfaz nativa de Kubernetes.
El error del que están dispuestos a hablar
No todo salió según lo previsto. En 2024, TrueFoundry, como la mayor parte de la industria, creía que la capa de proxy de LLM que las empresas estaban construyendo internamente se mantendría delgada. La lógica tenía sentido en ese momento: las API de los modelos eran en gran medida consistentes, la capa era ligera y los equipos se sentían cómodos construyéndola ellos mismos.
"Creíamos que esta era una capa que se construiría más internamente", admitió Nikunj. "Ese error nos hizo perder parte del desarrollo que podríamos haber logrado en el año entre 2024 y 2025".
Lo que cambió fue la complejidad. Las firmas de las API de los modelos comenzaron a divergir. Surgieron nuevos protocolos como MCP. Las aplicaciones con agentes pasaron a producción, lo que significaba que el tiempo de actividad era crucial. Y lo que había comenzado como una delgada capa de proxy de repente necesitaba convertirse en un plano de control de nivel empresarial con salvaguardas, reglas de cumplimiento, seguimiento de costos y observabilidad centralizada en cada agente de la organización.
Cuando TrueFoundry vio que se producía ese cambio, actuaron rápidamente. En seis meses, reconstruyeron y expandieron su pasarela de IA hasta convertirla en uno de los productos más capaces del mercado. Hoy, la pasarela opera en 17 regiones a nivel mundial, logra más de cuatro nueves de tiempo de actividad, introduce menos de cinco milisegundos de latencia y maneja decenas de miles de solicitudes por segundo para aplicaciones empresariales críticas para la producción.
La velocidad de respuesta convirtió una oportunidad perdida en una posición de liderazgo en el mercado.
El equipo detrás de todo
Pregúntale a Nikunj de qué está más orgulloso en TrueFoundry, y no mencionará las métricas del producto ni la lista de clientes. Habla del equipo.
La empresa comenzó con tres cofundadores que habían crecido juntos: Nikunj, Anurag y Abhishek, cuyas trayectorias complementarias en ML, infraestructura y estrategia dieron a la empresa la forma adecuada desde el primer día. Abhishek había dirigido la organización de infraestructura de video de Meta. Anurag había utilizado el aprendizaje automático para construir estrategias de trading en WorldQuant y había liderado expansiones geográficas para la firma. Juntos, aportaron la profundidad técnica y el alcance operativo que exige la construcción de infraestructura empresarial.
Ahora, con cerca de 90 a 100 personas, TrueFoundry todavía exige que cada nueva contratación pase por una entrevista con un fundador. Los criterios no han cambiado: habilidades técnicas, sí, pero lo que es más importante, una verdadera alineación con la misión y el tipo de mentalidad de propiedad que hace que las empresas en etapa inicial funcionen.
"Creemos que ese es el mayor valor que un fundador puede crear en una empresa", dijo Nikunj.
Hacia dónde va todo esto
El desafío a corto plazo que Nikunj ve para la industria es pasar de cientos de agentes de IA pequeños y de bajo riesgo, herramientas de productividad personal y experimentos funcionales a agentes que se encuentran en la ruta crítica de las operaciones comerciales reales. Esa transición requiere un nivel de control, fiabilidad y gobernanza que la mayoría de las empresas aún no han desarrollado.
La ambición a largo plazo de TrueFoundry es aún mayor. La analogía a la que recurre Nikunj es Databricks o Snowflake, empresas que desbloquean valor al centralizar los datos de una organización. TrueFoundry quiere hacer lo mismo para la computación. Una única plataforma donde los agentes se desarrollan, implementan y orquestan. Un plano de control central para toda la computación que fluye a través de los sistemas de IA de una empresa.
Es una gran visión. Pero es una que se definió claramente en 2022 y solo ha cobrado más relevancia desde entonces.
Escuche la conversación completa con Nikunj Bajaj en el podcast Code Story, Temporada 12, Episodio 16, disponible en Spotify y Apple Podcast.
TrueFoundry AI Gateway ofrece una latencia de entre 3 y 4 ms, gestiona más de 350 RPS en una vCPU, se escala horizontalmente con facilidad y está listo para la producción, mientras que LitellM presenta una latencia alta, tiene dificultades para superar un RPS moderado, carece de escalado integrado y es ideal para cargas de trabajo ligeras o de prototipos.













.webp)
.webp)



.webp)
.webp)
.webp)

.png)
.png)
.png)
.png)
.png)
.png)
.png)





