Blank white background with no objects or features visible.

Ask TFY:AIゲートウェイ内のあらゆる事象をデバッグ、分析、実行 詳細はこちら

TrueFoundryはSeldon AIの買収を発表し、エンタープライズAI向けコントロールプレーンを拡張します。プレスリリース全文はこちら→

AWSにFalcon-40Bをデプロイ:Sagemakerより40%安価

By Abhishek Choudhary

Published: July 6, 2026

本記事では、ご自身のクラウドにFalconモデルをデプロイする方法について説明します。

アブダビのTechnology Innovation Instituteは、革新的な言語モデルシリーズであるFalconを開発しました。これらのモデルはApache 2.0ライセンスの下でリリースされており、この分野における大きな進歩を意味します。特筆すべきは、 Falcon-40B が真にオープンなモデルとして際立っており、その能力において数多くのクローズドソースモデルを凌駕しています。この開発は、プロフェッショナル、愛好家、そして業界に計り知れない機会をもたらし、さまざまな魅力的なアプリケーションへの道を開きます。

このブログ記事では、 LLMOps プロセスをSageMakerで、つまりご自身のAWSクラウドアカウントでFalconモデルをホストすること、および利用可能なさまざまなオプションについて説明します。さらに、将来的には他のクラウドでFalconを実行することに焦点を当てた別のブログ記事を公開する予定です。

ご自身のクラウドにLlama 2をデプロイすることに関する別のブログ記事も書きました。以下をご覧ください:

さて、Falconファミリーには2つのベースモデルがあります。 Falcon-40B と  Falcon-7Bです。40Bパラメータモデルは現在、 Open LLM Leaderboardのチャートのトップに立っており、7Bモデルはそのウェイトクラスで最高です。本記事では、Falcon 40Bモデルのデプロイオプションについて説明します。

Falcon-40Bには約90GBのGPUメモリが必要なため、80GBのRAMを搭載した単一のA100インスタンスには収まりません。 AWSで動作するインスタンスタイプはg5.12xlargeです。 (https://aws.amazon.com/ec2/instance-types/g5/)。モデルは、リアルタイム推論用のAPIエンドポイントとしてデプロイすることも、バッチ推論のユースケースのためにコード自体にロードすることも可能です。  

モデルをロードし、テキスト生成タスクを実行するコードは以下の通りです。

# pip install "transformers[tokenizers]>=4.29.2,<5.0.0" # "sentencepiece==0.1.99" "accelerate>=0.19.0,<1.0.0" # "safetensors>=0.3.1,<0.4.0"

import torch
from transformers import pipeline

generator = pipeline(
   "text-generation",
   model="tiiuae/falcon-40b-instruct",
   tokenizer="tiiuae/falcon-40b-instruct",
   torch_dtype=torch.bfloat16,
   device_map="balanced_low_0",
)
output = generator(
   "Explain to me the difference between nuclear fission and fusion.",
   min_new_tokens=30,
   max_new_tokens=50
)
print(output)

ノートブックでFalcon40BをロードするためのPythonコード

モデルをAPIとしてデプロイする

モデルは、AWS Sagemaker、EKSクラスター、または通常のEC2マシン上のエンドポイントとしてデプロイできます。Sagemakerにモデルをデプロイするには、以下のチュートリアルを参照してください。 https://aws.amazon.com/blogs/machine-learning/deploy-falcon-40b-with-large-model-inference-dlcs-on-amazon-sagemaker/.

Model Catalogue - Falcon models
Falconモデルを含むモデルカタログ

EKSにモデルをデプロイするには、EKSクラスターを立ち上げ、その上にGPUノードプールとGPUオペレーターを設定し、APIエンドポイントにアクセスするためのイングレスレイヤーを構築する必要があります。 TrueFoundry は、モデルのデプロイをワンクリックプロセスにすることで、このプロセス全体をはるかに簡素化できます。

deploying Falcon 40B
Falcon 40Bの様々なデプロイモード

コスト分析

ご自身のAWSアカウントでFalcon LLMを実行するコストについて詳しく見ていきましょう。SagemakerとTrueFoundryで実行する場合のコストを比較します。

Sagemakerのコスト

Sagemakerインスタンス (ml.g5.12xlarge) の1時間あたりのコスト (us-east-1): $7.09

AWS JumpstartでFalconモデルのリクエストスループットとレイテンシを計算するために、簡単なベンチマークを実行しました。正確な数値はプロンプトの長さやリクエストの同時実行数によって異なりますが、これによりおおよその目安が得られるはずです。

上記のグラフからわかるように、p50レイテンシは約5.7秒、p90は約9.4秒です。1秒あたり約6〜7リクエストのスループットが得られます。

TrueFoundryを使用してEKSにモデルをデプロイする

TrueFoundryはEKSにモデルをデプロイし、スポットインスタンスとオンデマンドインスタンスを利用してコストを大幅に削減できます。時間あたりのオンデマンド、スポット、リザーブドの料金を比較してみましょう。 g5.12xlarge us-east-1リージョンのマシン。

オンデマンド: $5.672 (20% Sagemakerより安い)
スポット: $2.076 (70% Sagemakerより安い)
1年リザーブド: $3.573 (50% Sagemakerより安い)
3年リザーブド: $2.450 (65% Sagemakerより安い)

TrueFoundryを使用してEKSにデプロイされたモデルのスループットとレイテンシーを比較してみましょう。

リクエストレイテンシーとスループットの統計
TrueFoundry上のモデルの統計

上記の統計からわかるように、p50レイテンシーは5.8秒、p90は9.5秒です。スループットは毎秒6〜7リクエスト程度です。上記のとおり、

料金計算ツール

実際のライブトラフィックのあるユースケースでFalconモデルをホスティングするコストを試算してみましょう。1日あたり10万リクエストがあり、すべてのリクエストでFalconモデルにアクセスすると仮定します。このトラフィックを処理するには、g5.2xlargeインスタンス1台で十分なはずです。各インスタンスは毎秒6リクエストを処理でき、1日10万リクエストは毎秒1リクエストに相当するためです。ただし、信頼性の理由から、少なくとも2つのインスタンスを実行したいと考えます。2つのインスタンスを実行するコストを比較してみましょう。

Sagemaker: $7.1 * 2 (1時間あたりのドル) = 月額$10000
EKS:
スポットインスタンスの利用: 2ドル * 2 (1時間あたり) = 月額2880ドル
オンデマンドインスタンスの利用: = 月額8000ドル

スポットインスタンス1つとオンデマンドインスタンス1つを組み合わせることで、コストを約40%削減し、高い信頼性も実現できます。

チャットでご相談ください

LLMプロジェクトからのリターンを最大化し、AIを適切に活用してビジネスを強化したいとお考えでしたら、ぜひお話しし、意見交換をさせていただければ幸いです。

Try now.

One gateway for all your models, MCP servers, and agents.
No credit card needed.

Start free
Table of Contents

One Gateway for Every LLM, Agent and MCP Server

Book a 30-min with our AI expert

Book a Demo

The fastest way to build, govern and scale your AI

Book Demo
Summarize with
ChatGPT logo by OpenAI
Perplexity AI logo
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.

Discover More

July 20, 2023
|
5 min read

LLMOps CoE: MLOpsランドスケープにおける次のフロンティア

May 25, 2023
|
5 min read

オープンソースLLM:受け入れるか、滅びるか

August 27, 2025
|
5 min read

オンプレミスAI市場のマッピング:チップからコントロールプレーンまで

September 28, 2023
|
5 min read

LoRAファインチューニングとは?決定版ガイド

August 17, 2026
|
5 min read

Sandboxed Code Agents: Let Models Execute Without Letting Them Roam

No items found.
Portkey AI Gateway Pricing
August 15, 2026
|
5 min read

2026年版 Portkey AI Gateway 料金:完全ガイドと比較

No items found.
MCP registry connecting agents to governed MCP servers
August 15, 2026
|
5 min read

2026年版 最高のMCPレジストリ:開発者と企業向け比較

No items found.
TrueFoundry AI gateway powers enterprise AI platform engineering at scale
August 15, 2026
|
5 min read

AIプラットフォームエンジニアリングとは?エンタープライズチームのための実践ガイド

No items found.
No items found.

Recent Blogs

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.
Take a quick product tour
Start Product Tour
Product Tour