Databricks Mosaic AI Gatewayの料金体系を解説 (2026年)
.webp)
Built for Speed: ~10ms Latency, Even Under Load
Blazingly fast way to build, track and deploy your models!
- Handles 350+ RPS on just 1 vCPU — no tuning needed
- Production-ready with full enterprise support
Databricks Mosaic AI Gatewayは、Databricksエコシステム内でAIモデルの使用状況を管理、保護、監視するための統合インターフェースとして位置づけられています。ETLやデータエンジニアリングにDatabricksをすでに活用している組織にとって、Mosaic AIの統合は統合されたガバナンス層を提供します。
しかし、Mosaic AI Gatewayの料金は単純なアドオンではありません。コストは根本的にDatabricksユニット(DBU)モデル、特定のコンピューティングティアの選択、そしてUnity Catalogのようなプラットフォームレベルの依存関係に紐付いています。
この分析では、Databricks AIの料金体系を解説し、大規模なエンジニアリングチームがより明確なユニットエコノミクスとアーキテクチャの独立性を実現するために、TrueFoundryのようなアンバンドルされた代替案を検討することが多い理由を説明します。
.webp)
Databricks Mosaic AI Gatewayとは?
Databricks Mosaic AI Gatewayは、AIモデルのリクエストのルーティング、監視、ガバナンスのための中央制御プレーンとして機能します。これは、アプリケーションロジックとモデルエンドポイント間のプロキシとして機能し、モデルが外部(例:OpenAI経由のGPT-4o)であるか、Mosaic AI Model Servingを介して内部でホストされているかに関わらず適用されます。
アーキテクチャ的には、このゲートウェイはプロンプトと応答のロギング、レイテンシー追跡、使用状況の帰属に必要な可観測性フックを提供します。これは独立したバイナリではなく、Databricks Model Servingインフラストラクチャに統合された機能セットです。その結果、その運用上の可用性は、基盤となるDatabricksワークスペースとUnity Catalogガバナンス層の信頼性およびスケーリング特性に紐付いています。
「DBU」という通貨:Databricksの実際の請求方法
Databricksは、従来のSaaSのようにAPIリクエストごとに課金するわけではありません。その代わりに、消費量は Databricksユニット(DBU)に正規化されます。2026年初頭現在、AIワークロードのDBU料金は通常、 1 DBUあたり0.07ドル 基盤モデルの提供の場合で、 1 DBUあたり0.70ドル ログ分析に使用されるサーバーレスSQL操作の場合には、それを超えることがあります。
DBUとは?
DBUは、1時間あたりの処理能力を表す独自の指標です。プラットフォームチームにとっての課題は、Databricks AIの料金予測にあります。なぜなら、1つのAIリクエストが、ゲートウェイルーティング、ガードレール実行、Delta Tablesへのログ取り込みなど、複数のDBU消費イベントを伴う可能性があるためです。DBUのコストは、プラン(Standard、Premium、Enterprise)およびクラウドプロバイダーによって異なります。
統合コンピューティングのエコノミクス
標準的なデプロイメントでは、組織は2つのコストフローを管理します。生のVMインスタンスに対するクラウドプロバイダー(AWS/Azure/GCP)への支払いと、DBU管理手数料に対するDatabricksへの支払い、です。Databricks Serverlessは、これらのコストを単一の料金にバンドルします。これにより請求は簡素化されますが、バンドルされた料金には通常、プラットフォームの管理とオーケストレーションをカバーするための、生のインフラストラクチャコストに対するプレミアムが含まれています。
Mosaic AI GatewayのDatabricks価格体系における位置づけ
Mosaic AI Gatewayのコストは、リクエスト処理に必要なコンピューティングリソースを通じて発生します。ゲートウェイを通過するすべてのリクエストは、Model Servingエンドポイント上でコンピューティング時間を消費します。
Databricks AIの価格設定における主なコスト要因は以下の通りです。
- リクエスト処理: ゲートウェイのルーティングおよびロードバランシングロジックに関連するDBU消費。
- 可観測性のオーバーヘッド: リクエスト/レスポンスのペイロードをInference Tablesに書き込む際のコンピューティングおよびストレージコスト。
- ガバナンスチェックポイント: すべてのモデル呼び出しにおけるUnity Catalogのパーミッションチェックによって追加されるレイテンシーとコンピューティングコスト。
.webp)
Mosaic AI Gatewayの料金内訳
Databricks AI Gatewayの使用による経済的影響は、トラフィックが外部プロバイダーにルーティングされるか、内部ホスト型モデルにルーティングされるかによって異なります。
外部モデルルーティング
ゲートウェイがOpenAIやAnthropicのような外部プロバイダーにトラフィックをルーティングする場合、組織はプロバイダーのトークン料金を直接支払います。さらに、Databricks AIの価格設定では、ゲートウェイ機能(ルーティング、追跡、ロギング)に対してDBUを通じて課金されます。
- コスト要因: ゲートウェイによって処理されるトラフィックには、スループットに基づいてDBU消費が発生します。
- インフラ要件: 外部ルーティングの場合でも、サービングエンドポイントは「アクティブ」である必要があります。高並行性環境では、これにより完全なスケール・トゥ・ゼロを妨げるプロビジョニングされたキャパシティが必要となる場合があります。
内部モデルサービング(Mosaic AIモデルサービング)
Databricks内でホストされるモデルの場合、コストは通常、2つのモードに分かれます。
- トークンごとの支払い: 開発テストや断続的なワークロードで頻繁に使用されます。プロプライエタリモデルは、100万トークンあたりの特定のDBUレートで課金されます(例: 特定のハイティアモデルでは100万トークンあたり約94ドル)。
- プロビジョンドスループット: 本番環境のパフォーマンスの標準です。このモードでは、最小限の同時実行コミットメントが必要で、多くの場合、以下から始まります。 DBUあたり0.07ドル、24時間365日予約容量に対して料金を支払います。このモデルは可用性を保証しますが、トラフィックが大幅に変動するとアイドル容量のコストが発生する可能性があります。
関連するエコシステムコスト
Databricks Mosaic AI Gateway自体は、総所有コストの一部です。サポートインフラストラクチャが、Databricksの月額コストの大部分を占めることがよくあります。
Unity Catalogへの依存
Mosaic AI Gatewayは、ガバナンスのためにUnity Catalogに依存しています。推論ログはDelta Tableに保存され、以下のコストが発生します。
- ストレージコスト: 標準的なクラウドオブジェクトストレージ料金。
- 推論テーブル処理: ゲートウェイからログを取り込むバックグラウンドジョブのコンピューティングコスト。
- 分析コスト: 監査や請求のためにこれらのログをクエリするには、Databricks SQLが必要です。 DBUあたり0.70ドル のServerless SQLの場合、頻繁な可観測性クエリを実行すると、プラットフォーム全体の費用が増加します。
ガードレールとデータスキャナー
PIIマスキングや有害性フィルターなどのAIガードレールを有効にするには、追加のコンピューティングが必要です。各ガードレールは、リクエスト/レスポンスペイロードに対してモデルまたは正規表現スキャナーを実行します。
- レイテンシーへの影響: 内部ベンチマークによると、P95レイテンシは最大 50msから200ms ガードレールの複雑さによって増加する可能性があります。
- コンピューティングへの影響: ガードレールの実行はモデルサービングのコンピューティングを利用し、標準レートでDBUを消費します。
Databricks AIの料金体系でチームが直面する一般的なコスト課題
- 可変DBU消費量: オートスケーリングのトリガーはリアクティブです。急激なトラフィックの増加により追加のコンピューティングノードがプロビジョニングされることがあり、それらは最小期間アクティブなままになるため、短期間の急増時にコスト効率に影響を与えます。
- 帰属の複雑さ: DBUは多くの場合、ワークスペースレベルで集計されます。より広範なデータエンジニアリングワークロードから特定のMosaic AI Gatewayのコストを分離するには、通常、カスタムタグ付けとシステムテーブルの分析が必要です。
- エコシステムへの依存: ゲートウェイを利用すると、ロギングとガバナンスがDatabricksアーキテクチャ(Unity Catalog、Delta Tables)に結びつきます。後で別の推論スタックに移行する場合、これらのガバナンスレイヤーを再実装する必要があります。
.webp)
一部のチームがDatabricks Mosaic AI Gateway以外を検討する理由
AIデプロイが概念実証から大規模な本番環境へと移行するにつれて、トークンごとのDBUベースのDatabricks AI料金モデルはユニットエコノミクスに影響を与える可能性があります。エンジニアリングチームはしばしば、Databricksプラットフォームの包括的な性質が、データウェアハウジングには効果的である一方で、シンプルなアプリケーション側のAIルーティングにはアーキテクチャ上の負担を増やすと認識しています。
さらに、Databricksコントロールプレーン内で運用する必要があるため、TCOを削減できる特殊なハードウェア(例:AWS Trainium/Inferentia)や代替のデプロイ戦略(例:オンプレミスKubernetes)の採用が制限される可能性があります。
TrueFoundryのAIインフラストラクチャへのアプローチ
TrueFoundryは、Databricks AIの料金体系の複雑さよりもコストの透明性とインフラストラクチャの制御を優先するエンジニアリングチーム向けに設計された代替アーキテクチャを提供します。
- Kubernetesネイティブ: TrueFoundryは、顧客のクラウドアカウント(AWS、Azure、GCP)に直接デプロイされます。生のインスタンスコストに加えて「管理DBU」は発生しません。
- ダイレクトルーティング: プラットフォームにバンドルされたゲートウェイとは異なり、TrueFoundryは外部ルーティングに対してトークンごとのマークアップを請求しません。
- インフラストラクチャの最適化: このプラットフォームは、推論用のスポットインスタンスときめ細かなスケール・トゥ・ゼロ構成をサポートしています。多くの本番環境シナリオにおいて、このアプローチはプロビジョニングされたスループットモデルと比較して、アイドル状態のコンピューティングコストを削減します。
表1: Databricks Mosaic AI Gateway vs TrueFoundry: コスト構造の比較
図1: アーキテクチャとコストフローの比較
.webp)
AIスタックをアンバンドルする準備はできていますか?
Databricks Mosaic AI Gatewayは、既にレイクハウスに組み込まれているチームに統合のメリットを提供しますが、DBUベースのDatabricks AI料金モデルは、スケール時に変動コストにつながる可能性があります。TrueFoundryは、エンジニアがプラットフォームのプレミアムなしで自身のインフラストラクチャを所有できる、高性能でコストが透明な代替手段を提供します。
個人を特定できる情報やクレジットカード番号などの機密情報を管理するチームにとって、TrueFoundryはAIゲートウェイデータがお客様の管理下に留まることを保証しつつ、コスト管理を最適化します。機械学習の支出に合わせて調整されたAIゲートウェイダッシュボードの例で、節約額を確認できます。
アーキテクチャの独立性を実現し、DBUマークアップを排除する方法については、 デモを予約する 本日、弊社のチームと。
よくある質問
Databricksの月額費用はいくらですか?
月額費用は変動が大きく、消費量に依存します。小規模チームの初期使用量は通常わずかですが、継続的な可用性要件と広範なガバナンスロギングによって推進されるエンタープライズ規模のプロダクションワークロードでは、DBU消費量がスループットに比例して増加するため、莫大な月間運用費用につながる可能性があります。
Databricks Mosaic AIの料金体系はどのようになっていますか?
Databricks Unit (DBU) モデルを介した消費ベースです。モデルサービングエンドポイントのコンピューティング時間、Delta Tablesへの推論ログの保存、およびDatabricks SQLを介してそれらのログを分析するために必要なコンピューティングリソースに対して課金されます。
TrueFoundryはDatabricks Mosaic AIよりもどのように費用対効果が高いですか?
TrueFoundryはBYOC (Bring-Your-Own-Cloud) モデルで運用されており、バンドルされたプラットフォームに見られるDBU管理プレミアムを排除します。Kubernetesクラスターに直接デプロイし、スポットインスタンスやきめ細かなスケール・トゥ・ゼロなどの積極的な最適化戦略を可能にすることで、サービスコストを生のインフラストラクチャ価格に直接合わせます。
TrueFoundry AI Gateway delivers ~3–4 ms latency, handles 350+ RPS on 1 vCPU, scales horizontally with ease, and is production-ready, while LiteLLM suffers from high latency, struggles beyond moderate RPS, lacks built-in scaling, and is best for light or prototype workloads.














.webp)
.webp)


.png)

.png)














