Aufbau der Infrastrukturschicht, die der Unternehmens-KI bisher fehlte
.webp)
Auf Geschwindigkeit ausgelegt: ~ 10 ms Latenz, auch unter Last
Unglaublich schnelle Methode zum Erstellen, Verfolgen und Bereitstellen Ihrer Modelle!
- Verarbeitet mehr als 350 RPS auf nur 1 vCPU — kein Tuning erforderlich
- Produktionsbereit mit vollem Unternehmenssupport
Im Jahr 2022, noch bevor ChatGPT in den allgemeinen Sprachgebrauch übergegangen war, begannen unsere Gründer Nikunj Bajaj, Abhishek und Anuraag bereits mit der Entwicklung. Sie reagierten nicht auf einen Trend, jagten keinem Hype hinterher, sondern bauten aus der Überzeugung heraus, dass die Unternehmenswelt kurz vor einem Wendepunkt stand, auf den sie nicht vorbereitet war.
Diese Überzeugung kam von innen. Bevor er TrueFoundry gründete, war Nikunj bei Meta tätig gewesen, wo die Erfahrung mit der Arbeit an Machine-Learning-Infrastruktur im großen Maßstab seine Sichtweise auf das Problem grundlegend veränderte.
„Die Art und Weise, wie man bei Meta Machine-Learning-Modelle entwickelt, unterscheidet sich grundlegend von der Vorgehensweise im öffentlichen Cloud-Ökosystem außerhalb“, erklärte Nikunj im Code Story Podcast. „Meta betrachtet Machine Learning als einen Spezialfall des Software-Engineerings und generative KI als einen Spezialfall des Machine Learnings.“ [SEG 6] Dieses mentale Modell – Software an der Basis, ML in der Mitte, GenAI an der Spitze, alles über eine einheitliche Schnittstelle auf einer gemeinsamen Infrastruktur laufend – entspricht nicht der Arbeitsweise der meisten Unternehmen. Die meisten Organisationen betreiben zwei, manchmal sogar drei parallele Stacks: einen für Software, einen für ML und neuerdings immer häufiger einen separaten für GenAI. Das Ergebnis sind Fragmentierung, Redundanz und ein System, das unter seinem eigenen Gewicht zusammenbricht, wenn es skaliert.
TrueFoundry wurde gegründet, um genau das zu beheben.
Das Wagnis, dessen Aufbau ein Jahr dauerte
Wenn Leute von MVPs sprechen, meinen sie meist etwas Provisorisches – einen schnellen Prototyp, um eine Hypothese zu testen. TrueFoundrys Version davon sah ganz anders aus.
„Wir haben über ein Jahr lang intensiv an der Entwicklung der Plattform gearbeitet“, erklärte Nikunj. „Wir bauten die Kerninfrastruktur auf, auf der Unternehmen ihre Machine-Learning- und generativen KI-Anwendungen entwickeln und in Produktion nehmen können.“
Die technische Wette, die dieser Arbeit zugrunde lag, war Kubernetes. Das Team glaubte, dass, so wie sich Software-Workloads für die Orchestrierung auf Kubernetes konzentriert hatten, ML-Workloads folgen würden. Zu dieser Zeit war Kubeflow das dominierende Tool, das Organisationen half, ML auf Kubernetes auszuführen, aber seine Beiträge nahmen ab, da Google seine Investitionen in Richtung Vertex verlagerte. Das TrueFoundry-Team erkannte diese Lücke und nutzte sie bewusst, indem es seinen gesamten ML- und GenAI-Stack so aufbaute, dass er nativ auf Kubernetes lief. Diese Entscheidung verschaffte ihnen etwas Unschätzbares: eine Infrastruktur, die überall laufen konnte – AWS, GCP, Azure oder On-Premise –, ohne an einen einzigen Cloud-Anbieter gebunden zu sein.
Es war ein geduldiger, prinzipientreuer Start. Und es legte den Grundstein für alles, was folgte.
Anpassung an eine Welt, die nicht stillstand
Eines der bemerkenswertesten Dinge an TrueFoundrys Produktentwicklung ist, wie beständig sich die Welt um sie herum veränderte und wie bewusst sie sich anpassten.
Im Jahr 2022 wurden große Sprachmodelle zum ersten Mal wirklich nützlich. Im Jahr 2023 entdeckten Unternehmen, dass nützliche Antworten eine Verankerung in ihren eigenen Daten erforderten, und RAG (Retrieval Augmented Generation) wurde zum dominierenden Paradigma. Bis 2024 wurden Agenten real, und Organisationen begannen ernsthaft darüber nachzudenken, KI in Produktions-Workflows zu integrieren. Im Jahr 2025 entwickelten sich MCP (Model Context Protocol) und die Agent-zu-Agent-Kommunikation zur neuen Grenze.
Jedes Jahr änderte sich das Betriebsmodell. Und TrueFoundrys Ansatz war es, die grundlegende Architektur konstant zu halten, während die darüber liegende Schicht angepasst wurde – die Entwicklererfahrung, die Schnittstellen, das Bindegewebe zwischen den Komponenten.
„Wir passen uns dem Modus Operandi an“, sagte Nikunj. „Wir bauen die UX-Schicht darum herum auf, aber wir führen alles auf dasselbe grundlegende Prinzip zurück, wie man diese Workloads auf derselben zugrunde liegenden Infrastruktur ausführt.“
Das heutige Produkt spiegelt diese Philosophie wider. TrueFoundrys AI Gateway sitzt in der Mitte jedes API-Aufrufs, den ein Unternehmen an seine LLMs und Agenten sendet. Es umfasst ein LLM-Gateway, ein MCP-Gateway und ein Agenten-Gateway – eine einheitliche Steuerungsebene für Beobachtbarkeit, Governance, Kostenmanagement und Compliance über den gesamten Agenten-Stack hinweg. Daneben ermöglicht das Produkt AI Deployments Unternehmen, benutzerdefinierte Modelle auszuführen, MCP-Server zu hosten und Agenten auf ihrer eigenen Recheninfrastruktur zu orchestrieren – alles über eine Kubernetes-native Schnittstelle.
Der Fehler, über den sie bereit sind zu sprechen
Nicht alles lief nach Plan. Im Jahr 2024 glaubte TrueFoundry, wie der Großteil der Branche, dass die LLM-Proxy-Schicht, die Unternehmen intern aufbauten, dünn bleiben würde. Die Logik war damals nachvollziehbar: Modell-APIs waren weitgehend konsistent, die Schicht war leichtgewichtig, und Teams waren es gewohnt, sie selbst zu bauen.
„Wir glaubten, dass dies eine Schicht ist, die eher intern entwickelt wird“, gab Nikunj zu. „Dieser Fehler kostete uns einen Teil der Entwicklung, die wir im Zeitraum 2024 bis 2025 hätten vorantreiben können.“
Was sich änderte, war die Komplexität. Die Signaturen der Modell-APIs entwickelten sich auseinander. Neue Protokolle wie MCP kamen auf. Agenten-Anwendungen gingen in den Produktivbetrieb, was die Verfügbarkeit zu einem kritischen Faktor machte. Und was als dünne Proxy-Schicht begonnen hatte, musste plötzlich zu einer unternehmensweiten Steuerungsebene mit Schutzmechanismen, Compliance-Regeln, Kostenverfolgung und zentralisierter Beobachtbarkeit für jeden Agenten im Unternehmen werden.
Als TrueFoundry diese Entwicklung erkannte, handelten sie schnell. Innerhalb von sechs Monaten bauten sie ihr KI-Gateway um und erweiterten es zu einem der leistungsfähigsten Produkte auf dem Markt. Heute läuft das Gateway in 17 Regionen weltweit, erreicht eine Verfügbarkeit von über vier Neunen, verursacht weniger als fünf Millisekunden Latenz und verarbeitet Zehntausende von Anfragen pro Sekunde für produktionskritische Unternehmensanwendungen.
Die schnelle Reaktion machte aus einem verpassten Zeitfenster eine marktführende Position.
Das Team dahinter
Fragt man Nikunj, worauf er bei TrueFoundry am stolzesten ist, erwähnt er weder die Produktkennzahlen noch die Kundenliste. Er spricht über das Team.
Das Unternehmen wurde von drei Mitgründern ins Leben gerufen, die zusammen aufgewachsen waren – Nikunj, Anurag und Abhishek. Ihre sich ergänzenden Hintergründe in ML, Infrastruktur und Strategie gaben dem Unternehmen vom ersten Tag an die richtige Ausrichtung. Abhishek hatte Metas Videoinfrastruktur-Organisation geleitet. Anurag hatte maschinelles Lernen eingesetzt, um Handelsstrategien bei WorldQuant zu entwickeln, und leitete die geografische Expansion des Unternehmens. Zusammen brachten sie die technische Tiefe und operative Bandbreite mit, die der Aufbau von Unternehmensinfrastruktur erfordert.
Mit mittlerweile 90 bis 100 Mitarbeitern verlangt TrueFoundry immer noch von jeder Neueinstellung ein Gründerinterview. Die Kriterien haben sich nicht geändert: Fachliche Fähigkeiten, ja, aber noch wichtiger ist eine echte Übereinstimmung mit der Mission und die Art von Eigenverantwortung, die Start-ups erfolgreich macht.
„Wir glauben, das ist der höchste Wert, den ein Gründer in einem Unternehmen schaffen kann“, sagte Nikunj.
Wohin die Reise geht
Die kurzfristige Herausforderung, die Nikunj für die Branche sieht, ist der Übergang von Hunderten kleiner, risikoarmer KI-Agenten, persönlichen Produktivitätstools und funktionalen Experimenten zu Agenten, die im kritischen Pfad realer Geschäftsabläufe angesiedelt sind. Dieser Übergang erfordert ein Maß an Kontrolle, Zuverlässigkeit und Governance, das die meisten Unternehmen noch nicht aufgebaut haben.
TrueFoundrys langfristiges Ziel ist noch größer. Die Analogie, die Nikunj heranzieht, sind Databricks oder Snowflake – Unternehmen, die Wert schaffen, indem sie die Daten einer Organisation zentralisieren. TrueFoundry möchte dasselbe für Compute leisten. Eine einzige Plattform, auf der Agenten entwickelt, bereitgestellt und orchestriert werden. Eine zentrale Steuerungsebene für die gesamte Rechenleistung, die durch die KI-Systeme eines Unternehmens fließt.
Es ist eine große Vision. Aber es ist eine, die 2022 klar definiert wurde und seitdem nur noch relevanter geworden ist.
Hören Sie das vollständige Gespräch mit Nikunj Bajaj im Code Story Podcast, Staffel 12, Episode 16, verfügbar auf Spotify und Apple Podcast.
TrueFoundry AI Gateway bietet eine Latenz von ~3—4 ms, verarbeitet mehr als 350 RPS auf einer vCPU, skaliert problemlos horizontal und ist produktionsbereit, während LiteLM unter einer hohen Latenz leidet, mit moderaten RPS zu kämpfen hat, keine integrierte Skalierung hat und sich am besten für leichte Workloads oder Prototyp-Workloads eignet.













.webp)
.webp)



.webp)
.webp)
.webp)

.png)
.png)
.png)
.png)
.png)
.png)
.png)





