TrueFoundryのAIゲートウェイ向けロギングアーキテクチャ

Built for Speed: ~10ms Latency, Even Under Load
Blazingly fast way to build, track and deploy your models!
- Handles 350+ RPS on just 1 vCPU — no tuning needed
- Production-ready with full enterprise support
はじめに:分析の隠れたコスト
市場に出回るすべてのAIゲートウェイは、ログと分析機能を提供しています。一見すると、これらは標準的な機能のように思えます。しかし、舞台裏で行われるアーキテクチャの選択は、信頼性、セキュリティ、そして最終的な収益に計り知れない隠れた影響を及ぼします。その 方法 は、真にエンタープライズグレードのプラットフォームとリスクの高い提案を分ける、極めて重要な詳細です。
お客様に高速でスケーラブルな分析機能を提供しようと初めて取り組んだ際、私たちはまさにこの課題に直面しました。目標は明確でした。お客様のプラットフォームチームにとって運用上の悪夢を生み出すことなく、当社のAIゲートウェイ層を通じて強力なインサイトを提供することです。
エンタープライズのお客様にふさわしいソリューションを構築するには、業界標準のアプローチを超えて革新する必要があると、私たちは早い段階で認識しました。この記事では、強力だが問題の多いClickHouseから、メンテナンス不要なS3ネイティブアーキテクチャへの私たちの道のりを詳しく説明します。これは、お客様に強力で持続的な競争優位性をもたらすシステムです。
問題点:ClickHouseの導入がリスクの高いビジネスである理由
業界の多くの企業と同様に、当初私たちが選んだのはClickHouseでした。これは、分析クエリにおける驚異的な速度で知られる、驚くべきオープンソース技術です。しかし、その強力さには高い運用コストが伴います。
核となる問題は次のとおりです。 お客様のクラウド環境内でClickHouseのようなステートフルでミッションクリティカルなデータベースを管理することは、運用上の地雷原です。 正しく行うには、以下を処理する必要があります。
- 高可用性(HA): ClickHouseがダウンした場合、どうなりますか?シームレスなフェイルオーバー計画はありますか?
- ディザスタリカバリ(DR): 定期的で検証済みのバックアップを実行していますか?壊滅的な問題が発生した場合の目標復旧時間(RTO)はどのくらいですか?
- メンテナンス: バージョンアップグレード、セキュリティパッチ適用、パフォーマンスチューニングの責任者は誰ですか?
これは単なる理論上の話ではありません。単純な、誤った kubectl delete pv コマンドは、顧客の永続ボリュームを誤って消去してしまう可能性があり、 彼らの過去のログとメトリクスデータをすべて永久に消し去ってしまいます。 どの企業にとっても、このレベルのリスクは到底受け入れられません。私たちは事実上、マネージドClickHouseプロバイダーになりつつあり、それが私たちの本来の使命から逸脱していました。
私たちは競合他社の状況を調査しました。
調査したところ、LLMゲートウェイ分野のほとんどのプラットフォームは、3つの欠陥のある妥協策のいずれかに落ち着いていることがわかりました。
- 「ブラックボックス」アプローチ: 彼らは、管理上の問題を解決するために、ClickHouseデータベースを彼らの 独自の クラウドサービスで稼働させています。
妥協点: 顧客は データ主権を失います。プラットフォームを使用するには、個人を特定できる情報(PII)や企業秘密情報を含む可能性のあるログデータやメトリクスを、安全なクラウド環境の外に送信せざるを得ません。エンタープライズ顧客と話す中で、私たちは、彼らのデータが安全であり、AIゲートウェイのコントロールプレーン内ではなく、彼らのクラウドまたはエアギャップ環境内に留まることが最も重要であると判断しました。
- 「DIY」アプローチ: 一部のプラットフォームはHelmチャートやテンプレートを提供し、顧客に独自のClickHouseインスタンスの運用を完全に任せています。
妥協点: 複雑な運用上の負担全体が、顧客の多忙なプラットフォームチームに直接転嫁されます。彼らは高可用性、バックアップ、メンテナンスを自力で解決しなければなりません。
- 「限定的なスケーラビリティ」アプローチ: 本格的な分析ワークロードにはスケールしない標準的なトランザクションデータベース(Postgresなど)を使うか、煩雑なサードパーティ製エクスポーターの寄せ集めに頼るかのどちらかです。
妥協案: これでは、慢性的なパフォーマンスの低下、分断されたユーザーエクスペリエンス、そして深く統合されたインサイトを提供できないという結果を招きます。
私たちはこれら3つの選択肢をすべて却下しました。パフォーマンスとセキュリティを両立させる方法があるはずだと考えたのです。 と 運用負担ゼロを実現する。だから、私たちはそれを自ら構築したのです。
私たちのアーキテクチャ
私たちの指針はシンプルでありながらも強力でした。 ストレージとコンピューティングの分離データは、お客様自身のオブジェクトストレージ(S3など)に安全かつ永続的に保存され、ステートレスでスケーラブルなエンジンがクエリを処理するというものです。

ストレージ層:お客様のS3 + Delta Lake
データベースサーバーを完全に排除し、お客様のS3バケットを唯一の信頼できる情報源としました。
- なぜS3なのか? これにより、HA、DR、バックアップの問題が即座に解決されます。AWS、GCP、Azureは、オブジェクトストレージサービスを非常に堅牢で可用性の高いものにするために、何十億ドルもの投資を行ってきました。お客様のデータは、お客様自身の環境内で自動的に保護されます。
- なぜDelta Lakeなのか? これが私たちのエンジニアリングにおける秘伝のタレです。S3は単なるキーバリューストアであり、データベーストランザクションを本質的に理解していません。ここでDelta Lakeの出番です。これは、ACIDトランザクション(従来のデータベースのアトミック性と一貫性)をお客様のS3データレイクにもたらすオープンソースのストレージフレームワークです。インジェスターがデータを破損することなく同時に書き込めるようにする「魔法」なのです。
- なぜParquet形式なのか? すべてのデータはApache Parquet形式で保存されます。これは、分析における業界標準である、非常に効率的なカラム型ストレージ形式です。これにより、お客様は データを完全に所有し、自由にアクセスできます Spark、DuckDB、Polarsライブラリなど、お好みのあらゆるツールでアクセスできます。これにより、ベンダーロックインが完全に解消されます。
クエリエンジン:Apache DataFusion
当社が利用しているのは DataFusion、Apacheプロジェクトのクエリエンジンです。これは、S3からParquetファイルを直接読み込む、最新のステートレスなエンジンです。S3固有のネットワーク遅延を克服するため、当社は高度な多層キャッシュレイヤー(インメモリおよびオンディスク)を構築しました。これにより、頻繁にアクセスされるデータがクエリにすぐに利用できるようになり、高速で応答性の高いUIエクスペリエンスを提供します。
メリット
当社のアーキテクチャは、お客様のビジネスに直接影響を与える、明確で説得力のある価値をもたらします。
- 運用オーバーヘッドゼロ: ログやメトリクスのデータベースの管理、パッチ適用、スケーリング、バックアップについて考える必要は一切ありません。ただ機能するだけで、プラットフォームチームの膨大な時間を節約できます。
- 完全なデータ主権: お客様のログとメトリクスは お客様のクラウドアカウント外に出ることはありません。お客様は完全な所有権と管理権を保持し、最も厳格な企業セキュリティおよびコンプライアンス要件を満たします。
- 総所有コスト(TCO)の削減: S3ストレージは、高性能データベースに必要なプロビジョニングされたSSDよりも劇的に安価です。当社のステートレスで最適化されたコンピューティングフットプリントは、クラウド費用をさらに削減します。
- 比類のない可観測性とオープンスタンダード: 当社はインジェストパイプラインを OpenTelemetry (OTel) 標準に基づいて構築しました。これにより、Guardrailチェックの正確なレイテンシーとLLM呼び出し自体のレイテンシーを比較するといった、非常にきめ細かなトレースレベルのインサイトを提供できます。さらに、この標準化されたデータをDatadogのような他の可観測性プラットフォームに簡単に転送する自由も得られます。

TrueFoundryのAI Gatewayでエンタープライズ可観測性の水準を引き上げる
当社のAI Gatewayでエンタープライズ対応のアナリティクスを提供する道のりは、魅力的な近道や安易な妥協で溢れていました。当社は重大な運用上の課題に直面し、業界の標準的なソリューションを拒否し、基本原則から優れたアーキテクチャを設計しました。 真にメンテナンス不要でセキュア、そしてサブミリ秒のレイテンシーを実現するAIゲートウェイがどのようなものか、ぜひご覧になりませんか? 今すぐデモをご予約ください.
TrueFoundry AI Gateway delivers ~3–4 ms latency, handles 350+ RPS on 1 vCPU, scales horizontally with ease, and is production-ready, while LiteLLM suffers from high latency, struggles beyond moderate RPS, lacks built-in scaling, and is best for light or prototype workloads.


















.webp)
.webp)


.png)

.png)














