Cloudflare AI Gatewayの料金 [完全な内訳]

Built for Speed: ~10ms Latency, Even Under Load
Blazingly fast way to build, track and deploy your models!
- Handles 350+ RPS on just 1 vCPU — no tuning needed
- Production-ready with full enterprise support
Cloudflare AI Gatewayは、一元化されたプロキシを通じてLLMトラフィックを管理、監視、ルーティングしたいチームにとって、急速に人気を集める選択肢となっています。業界全体でLLMの導入が加速するにつれて、チームはアプリケーションとサードパーティモデルの間に可観測性、セキュリティ、制御を追加するために、AIゲートウェイを導入するケースが増えています。
しかし、AIの利用が拡大するにつれて、料金の明確さが重要な要素となります。チームは、呼び出しごとのコストだけでなく、長期的な支出に影響を与えるインフラストラクチャや運用パターンも理解する必要があります。
一見すると、 Cloudflare AI Gatewayの料金体系 はシンプルに見えますが、特に主要機能への無料アクセスがあるためです。しかし、実際の利用では、ロギング、データ保持、スケーリング制限に関連する隠れたコストが明らかになることがよくあります。
このブログでは、以下の点を詳しく解説します。
- Cloudflare AI Gatewayを使用する際に、具体的に何に対して料金が発生するのか
- チームが見落としがちな間接的なコスト
- 成長企業が、より高い制御性を求めてTrueFoundryのようなVPC内代替ソリューションに最終的に移行する理由
Cloudflare AI Gatewayとは?
を説明する前に、 Cloudflare AI Gatewayのコスト、それが何をするものなのか、そしてAIスタックのどこに位置するのかを理解することが重要です。
Cloudflare AI Gatewayは、サードパーティのLLMプロバイダーに依存するAIアプリケーションをデプロイするチームにとって、一元化されたレイヤーとして機能します。これにより、チームは以下のことが可能になります。
- AIトラフィックを安全にルーティングする アプリケーションと、OpenAI、Anthropic、Hugging Faceなどの複数の基盤モデルプロバイダーの間で。
- 可視性を得る プロンプト、応答、レイテンシ、使用状況メトリクスに関する可視性を得て、可観測性と監視に役立てる。
- 直接連携 Cloudflareのより広範なAIスタック(Workers AI、キャッシング、レート制限、グローバルエッジインフラストラクチャなど)と。
Cloudflare AI Gatewayのコストに影響を与える機能
Cloudflare AI Gatewayはトークンごとの課金ではありませんが、利用規模が拡大するにつれて、いくつかの機能が総所有コスト(TCO)に間接的に影響します。
- リクエストルーティングとレート制限: トラフィックフローの制御に役立ちますが、AIの利用が増加するにつれて、ログに記録されるイベント数が増加します。大量の実行にはCloudflare Workersの有料プランが必要です。
- プロンプトとレスポンスのキャッシング: アップストリームモデルへの繰り返しの呼び出しを削減し(トークン料金の節約になります)、効率はトラフィックパターンとキャッシュヒット率に依存します。
- 利用状況分析とトークン追跡: 永続的なロギングが必要となり、追加のストレージおよび保持関連コストが発生する可能性があります。
- 複数のAIプロバイダーとの統合: 柔軟性を高めますが、プロバイダー間の帰属や予測といったAIコストの可視性要因をより複雑にします。
- 統合請求(2026年より新規): Cloudflareは、サードパーティモデルの利用(OpenAIなど)料金をCloudflareの請求書を通じて直接支払うことを可能にし、少額の取引手数料が追加されます。
- Logpush連携: ログを外部のS3バケットまたはSIEMツールにストリーミングすることは、追加費用が発生する有料機能です(有料プランでは月間1,000万レコードを超えると100万レコードあたり0.05ドル)。

Cloudflare AI Gatewayの料金ティア
Cloudflareは「フリーミアム」モデルを採用しており、ゲートウェイ自体はすべてのユーザーが利用できますが、アプリケーションをスケールアップするには、通常、無料ティアからWorkers有料ティアへの移行が必要です。
CloudflareのAI Gatewayは、すべてのCloudflare料金プランで利用可能であり、コア機能は無料で利用できます。Cloudflareプラン以外に、呼び出しごとのゲートウェイ料金は発生しません。ゲートウェイを追加してトラフィックを送信するだけです。
デフォルトで、Cloudflareには無料の分析/ダッシュボード、キャッシング、レート制限、ロギングレイヤーが含まれているため、多くのチームは追加費用なしでこれを立ち上げることができます。
ただし、無料プランにはいくつかの制限があります。例えば、Cloudflareの無料(Workers Free)ティアでは、AI Gatewayのログが月間合計10万件(すべてのゲートウェイを合わせて)まで含まれ、それを超えるとログ記録が停止します。
制限を増やすには、Workers有料プランにアップグレードする必要があります。このプランでは合計100万件のログが提供されます。特筆すべきは、Cloudflareは無料または有料ティアでログごとに課金しないことです。含まれるログの範囲内で利用するか、アップグレードするかのどちらかです。
無料 vs. 有料 Cloudflare AI 料金プラン
Cloudflare AI GatewayはWorkers上に構築されているため、ゲートウェイを大量に使用すると、Workersの課金が発生する可能性があります。
Cloudflareの Workers有料 プランは 月額5ドルのサブスクリプション (https://developers.cloudflare.com/workers/platform/pricing/)で、大きな使用許容量が含まれています。例えば、Standard(有料)Workersには、月間1,000万リクエストと3,000万CPUミリ秒の実行が含まれます。
それを超えると、Cloudflareは課金します 追加の100万リクエストごとに0.30ドル および 追加の100万CPUミリ秒ごとに0.02ドル。
実際には、1,500万リクエスト(平均的なCPU使用量)を処理するゲートウェイは、月額合計約8ドルかかります。対照的に、Cloudflare AIの無料プランでは、1日あたり10万リクエストと最小限のCPU使用量しか含まれていません。これらを超えると、Workersは単に実行を停止します(予期せぬ課金はありませんが、サービス停止となります)。
💡 まとめ: 軽度なAIアプリはCloudflareの無料ティアで利用できるかもしれませんが、本番環境のワークロードでは、信頼性の高いスケーリングのためにWorkers有料プラン(月額5ドル+使用量)が必要となることがよくあります。
リクエスト量とログ記録の費用
Workers有料プランでは、Cloudflare AI Gatewayには引き続き利用ガイドラインが適用されます。Workers有料プランには、月間最大100万件のAI Gatewayログ(すべてのゲートウェイを合計)が含まれます。
その上限を超えてログをプッシュした場合、超過料金を支払うことはできません。古いログを削除するか、プランをEnterpriseにアップグレードする必要があります。ログストレージには上限があり、デフォルトでは各ゲートウェイが約1,000万件のログを保持できます(独自の制限を設定可能)。満杯になると、新しいログは保存されません。
したがって、ログ記録は「含まれている」ものの、保持できる履歴の量には実質的な制限があります。
Cloudflareはまた、 Logpush連携 (https://developers.cloudflare.com/logs/logpush/)を利用してログをストレージにストリーミングすることもできますが、これは有料プランのみです。月間1,000万リクエスト分のLogpushは無料で利用でき、それ以降は 追加100万件あたり0.05ドルです。
要するに、Cloudflare AI Gateway自体にはリクエストごとの料金はかかりませんが、大量のログ記録をサポートするには隠れたコストが発生します。(無料枠を超えて)より多くのログを保持すると、外部システムへのストレージを余儀なくされたり、より積極的なログ削除が必要になったりする可能性があります。また、自動ログ転送(SIEMやコンプライアンスのため)が必要な場合、その機能は利用料金が発生する有料プランでのみ提供されます。
これらの要因すべてが、Cloudflareのゲートウェイコストが利用状況に応じて間接的に増加する可能性があることを意味します。つまり、Workersプランに加えて、基本を超えるログ記録やストレージに対して料金が発生します。
間接的な利用コスト
AI Gatewayサービス以外に、ゲートウェイが処理するすべてのリクエストは、依然として基盤となるモデルプロバイダーを呼び出すことを忘れないでください。Cloudflareはモデルを置き換えるものではなく、OpenAIなどへの呼び出しをプロキシするだけなので、モデルのトークン料金は別途支払う必要があります。
💡 つまり: Cloudflareはネットワーク層の予測不可能性を取り除きますが、OpenAI/Anthropicなどからのトークンごとの料金をなくすものではありません。
さらに、Workersを多用する(例えば、複雑なリクエストロジックやキャッシュ)と、上記のようにコンピューティング料金が発生します。基本的に、Cloudflare AI Gatewayの利用には、Workersプランとログ記録の上限という基本コストに加え、実際のモデルを呼び出すために費やす費用がかかります。
隠れたコスト:Cloudflare AI Gatewayの料金に含まれないもの
公開されている料金以外にも、CloudflareのAI Gatewayには考慮すべきいくつかの隠れたコストとリスクがあります。
1. ログ保持期間の制限
基本的なロギングは無料ですが、Cloudflareは厳格な保持制限を設けています。アプリが月に10万件(無料)または100万件(有料)を超えるログを保持する必要がある場合、ログを追加購入することはできず、ストレージは停止してしまいます。
長期間の履歴を保持するには、古いエントリを手動で削除するか、アップグレード(場合によってはエンタープライズプランへ)する必要があります。デバッグや監査のためにログに依存している場合、これは予期せぬ予算問題となる可能性があります。
2. プライバシーとデータ主権
デフォルトでは、Cloudflareのゲートウェイは、すべてのリクエストおよびレスポンスデータ(プロンプト、モデルの応答、トークンなどを含む)を独自のインフラストラクチャで取得します。Cloudflareはプライバシーコンプライアンスのためにロギングを無効にすることを許可していますが、オプトアウトすると可視性が失われます。
そうしないと、機密性の高いデータ(ユーザーのクエリ、出力、場合によってはPII)をCloudflareのクラウドに送信することになります。多くのベンダーはこれを「ブラックボックス」アプローチと呼んでいます。ログとメトリクスがあなたの管理外に置かれるためです。
ある分析が指摘するように、これは「顧客のデータ(PIIや専有情報を含む)を安全な環境から強制的に外部に出す」ことになりかねません。要するに、厳格なデータガバナンスやエアギャップコンプライアンスが必要な場合、生のプロンプトや応答をCloudflareに渡すことは容認できないかもしれません。
3. ブラックボックスルーティング
関連して、Cloudflareの動的ルーティングとフォールバックロジックは不透明です。内部的には、ゲートウェイがどのプロバイダーエンドポイントまたはキャッシュされた応答を使用するかを決定します。顧客は詳細なルーティングやパフォーマンスのヒューリスティクスを見ることはできません。
この「クローズド」なコントロールプレーンは、詳細な洞察なしに、モデル選択、キャッシング、フェイルオーバーに関するCloudflareのアルゴリズムを信頼しなければならないことを意味します。一部の組織(厳格な監査を受けている組織など)にとって、この透明性の欠如は隠れたコストとなります。ゲートウェイ内で何が起こったかを完全に証明できないためです。
4. リソース制限とスケーリング
無料プランの厳格な制限(1日のリクエスト上限、ログ上限)は、成長中のアプリにとって突然のスロットリングや障害を引き起こす可能性があります。従量課金制のクラウドとは異なり、Cloudflareの無料ティアは単に停止するだけで、課金はされません。
有料プランへの移行には、アーキテクチャの変更が必要になる場合があります。例えば、気づかないうちに1日10万件のログに達すると、ロギングが予期せず停止します。これらの運用上の制約は「隠れた」生産性コストにつながります。削除されたログの処理や、途中でアップグレードするために追加のDevOps作業が必要になる場合があります。
💡 まとめ: CloudflareのAI Gatewayの料金は「無料」に見えるかもしれませんが、実用的なデプロイメントでは、Workersの使用料、ログ/ストレージの要件、データガバナンスの問題を考慮する必要があります。チームは、Workersの使用状況の監視、ログの転送またはストレージの可能性、およびCloudflareの制限内で運用するための潜在的なエンジニアリング作業について予算を組むべきです。
Cloudflare AI Gatewayの料金が理にかなう場合
Cloudflare AI Gatewayは特定のシナリオで真価を発揮します。例えば、 エッジセントリックな、または軽量なAI機能の場合、迅速な導入を可能にします。すでにCloudflareのCDN/Workersを使用している場合、最小限の変更(APIエンドポイントを交換するだけ)でAI呼び出しを追加できます。
これは、DevOpsのオーバーヘッドなしに即座にエッジデプロイされたゲートウェイを求める小規模チームやスタートアップに最適です。初期段階のプロジェクトでは、Cloudflareの無料料金プランを活用して、グローバルなAI搭載エクスペリエンスのプロトタイプを作成し、人気のある応答をキャッシュして速度を向上させることができます。
また、次のようなユースケースにも適しています。 グローバルな分散が重要。例えば、Cloudflareのネットワーク上で直接動作するチャットボットや推論は、Cloudflareの250以上のPoPと組み込みのDDoS保護の恩恵を受けることができます。Cloudflareを介したシンプルなレート制限やリトライ機能も、基本的な回復力が必要なアプリケーションにとって魅力的です。
要するに、Cloudflare AI Gatewayの料金体系は、統合の速さとCloudflareネットワークの広範さを重視し、かつ、利用量が無料プランの範囲内(またはわずかに超える程度)に収まる場合に、理にかなっています。
しかし、大量のワークロードや厳しく規制されたワークロードを持つ大規模組織にとっては、これらの利点は、Cloudflare AIの隠れたコストによって相殺される可能性があります。きめ細かな制御の欠如や固定された利用割り当ては、予算編成やコンプライアンスを妨げる可能性があります。
なぜ一部のチームはCloudflare AI Gatewayの先を見るのか
AIシステムが成熟するにつれて、優先順位は迅速なセットアップから、コスト予測可能性、セキュリティ、所有権へと移行します。チームは以下の理由により、Cloudflare AI Gatewayでは対応しきれなくなってきています。
- AI利用の増加: モデルの利用規模が拡大するにつれて、トークン量が増加し、インフラに合わせた料金体系の必要性が喫緊の課題となります。Cloudflareの抽象化は、予測を困難にする可能性があります。
- コンプライアンスとデータレジデンシー要件: 規制対象業界では、プロンプトと完了がどこで処理されるかについて、完全な制御が必要となることがよくあります。CloudflareのSaaSモデルは、データレジデンシーのコンプライアンスに関して、法的および監査上の複雑さを引き起こします。
- エージェントワークフローとRAGパイプライン: 多段階推論や検索拡張生成のワークロードは、厳密な制御、より詳細なログ、そして時にはローカルでのモデルホスティングを要求しますが、これらはいずれもCloudflareのブラックボックス型インフラでは制限されます。
TrueFoundryのAI Gateway料金体系への異なるアプローチ
AI Gatewayの利点が必要でありながら、セキュリティ、可観測性、インフラ制御で妥協できない場合、TrueFoundryは根本的に異なるアプローチを提供します。
TrueFoundryはAI Gatewayをデプロイします お客様自身のクラウドアカウント(AWS、GCP、Azure)またはサーバー内に直接。 コントロールプレーン(設定や構成を管理する部分)はTrueFoundryが運用しますが、実際のプロンプトと応答が処理されるデータプレーンは、 お客様のVPC内に完全に留まります。
お客様が明示的に移動を選択しない限り、データがお客様のインフラから離れることはありません。これは実質的に、次のことを意味します。
- お客様は自身のインフラストラクチャ上でゲートウェイサービスをホストし、すべてのLLMトラフィックを自身のネットワーク経由でルーティングします。
- ログ、リクエスト、レスポンスは、外部エクスポートを設定しない限り、お客様のクラウド アカウントから出ることはありません。
- 可観測性はネイティブに統合されており、ログはS3バケット、データベース、または社内分析ツールに送られ、完全なデータ主権が維持されます。
- お客様は、自身のインフラストラクチャとセキュリティプロトコルを使用して、バックアップ、リソース割り当て、暗号化ポリシー、スケーリングを制御します。
これにより、CloudflareのようなSaaSファーストプラットフォームに見られる「ブラックボックス」の妥協点が解消されます。TrueFoundry AI Gatewayを使用することで、透明性の高いパフォーマンス、コストの可視性、そして完全な所有権が得られます。
TrueFoundryの料金
エンタープライズプランでセルフホストする場合、唯一の限界費用はインフラストラクチャです(規模に応じて通常月額約600~1,000ドル)。SaaS版であっても、TrueFoundryは選択したストレージまたはクラウドの使用量を超えるホスティング料金を請求しません。
これにより、非常に予測可能なコスト構造が実現されます。チームは成長を予測し、段階的にティアをアップグレードし、常にインフラレベルの制御を維持できます。
TrueFoundryなら、次のことが可能です。
- きめ細かな予算管理を実現: チームごとに使用量の上限を設定します。例:「エンジニアリング部門は500ドル、マーケティング部門は200ドル」とし、使用状況をリアルタイムで監視します。
- オープンルーティングを実装: 商用API (OpenAI、Anthropic) に接続するか、またはEC2、GKE、スポットインスタンスで実行されている独自のファインチューニングモデルにトラフィックをルーティングします。
- エンタープライズグレードの分離を実現: IAM、プライベートネットワーキング、データローカリティの要件に完全に準拠します。
Cloudflare AI Gateway vs TrueFoundry: 詳細比較
AIゲートウェイを検討している企業は、Cloudflareのようなマネージドサービスと、TrueFoundryのようなセルフホスト型プラットフォームを比較検討することがよくあります。以下に主要な要素の比較を示します。
予期せぬ料金なしでAIを構築する準備はできていますか?
AIゲートウェイの選択は、単なる初期費用の問題ではなく、長期的なインフラストラクチャの決定です。 Cloudflare AI Gateway 軽量でエッジに特化したAIワークロードや初期段階の実験に適しています。
しかし、システムが本番環境の規模に移行するにつれて、コスト管理、可観測性、コンプライアンス、柔軟性が重視されるようになります。
のようなプラットフォーム TrueFoundry は、インフラの所有権、データプライバシー、利用状況に応じた予算編成が非常に重要となる、本番環境でAIをスケールさせるチームのために構築されています。
ある成長中のスタートアップ企業は、予測不能なロギングコストがコンピューティング予算を超え始めたため、CloudflareからTrueFoundryに移行しました。AWS VPC内のセルフホスト型ゲートウェイに切り替えることで、彼らは 35%のコスト削減、S3へのロギングの一元化、OpenAIとプライベートなMistralモデルの組み合わせへのトラフィックルーティングを実現しました。これらすべてを、チームごとの明確な予算管理のもとで実現しました。
あなたの組織でも同様の結果を得ることができます。 デモを予約する を予約して、TrueFoundryがどのようにAIコストの予測可能性と管理をあなたのチームにもたらすかをご覧ください。
よくある質問
Cloudflare AI Gatewayは無料ですか?
はい、Cloudflareは標準およびWorkers有料ティアでAI Gateway機能への無料アクセスを提供しています。しかし、利用制限、ログ保持ポリシー、および基盤となるコンピューティング(例:Workers CPU時間)は、規模が拡大するにつれて隠れたコストを発生させる可能性があります。
Cloudflare AIの費用はどのくらいですか?
Cloudflare AI Gateway自体には、リクエストごとの料金はかかりません。費用は以下に基づいて発生します。
- ログの量と保持期間(例:無料ティアで10万ログ、Workers有料ティアで100万ログ)。
- リクエスト処理とルーティングのためのWorkerの使用量。
- Cloudflareのプランレベル(例:StandardとEnterprise)。
カスタムプランや外部のログ管理がない場合、大量の利用では料金が予測不能になる可能性があります。
TrueFoundryはCloudflare AIよりもどのように費用対効果が高いですか?
TrueFoundryは完全に自社のクラウド(AWS、GCP、Azure)内で動作するため、データ転送コストやSaaSのマージンが発生しません。割り当てたコンピューティングとストレージに対してのみ料金が発生し、完全なルーティングの柔軟性、透明性の高いログ、そしてベンダーロックインなしで利用できます。チームはプライベートモデルへのルーティングや、スポットインスタンスを利用して、マネージドAPIと比較してコストを60~70%削減することも可能です。
TrueFoundry AI Gateway delivers ~3–4 ms latency, handles 350+ RPS on 1 vCPU, scales horizontally with ease, and is production-ready, while LiteLLM suffers from high latency, struggles beyond moderate RPS, lacks built-in scaling, and is best for light or prototype workloads.














.webp)
.webp)


.png)

.png)














