AWSにFalcon-40Bをデプロイ:Sagemakerより40%安価

Built for Speed: ~10ms Latency, Even Under Load
Blazingly fast way to build, track and deploy your models!
- Handles 350+ RPS on just 1 vCPU — no tuning needed
- Production-ready with full enterprise support
本記事では、ご自身のクラウドにFalconモデルをデプロイする方法について説明します。
アブダビのTechnology Innovation Instituteは、革新的な言語モデルシリーズであるFalconを開発しました。これらのモデルはApache 2.0ライセンスの下でリリースされており、この分野における大きな進歩を意味します。特筆すべきは、 Falcon-40B が真にオープンなモデルとして際立っており、その能力において数多くのクローズドソースモデルを凌駕しています。この開発は、プロフェッショナル、愛好家、そして業界に計り知れない機会をもたらし、さまざまな魅力的なアプリケーションへの道を開きます。
このブログ記事では、 LLMOps プロセスをSageMakerで、つまりご自身のAWSクラウドアカウントでFalconモデルをホストすること、および利用可能なさまざまなオプションについて説明します。さらに、将来的には他のクラウドでFalconを実行することに焦点を当てた別のブログ記事を公開する予定です。
ご自身のクラウドにLlama 2をデプロイすることに関する別のブログ記事も書きました。以下をご覧ください:
さて、Falconファミリーには2つのベースモデルがあります。 Falcon-40B と Falcon-7Bです。40Bパラメータモデルは現在、 Open LLM Leaderboardのチャートのトップに立っており、7Bモデルはそのウェイトクラスで最高です。本記事では、Falcon 40Bモデルのデプロイオプションについて説明します。
Falcon-40Bには約90GBのGPUメモリが必要なため、80GBのRAMを搭載した単一のA100インスタンスには収まりません。 AWSで動作するインスタンスタイプはg5.12xlargeです。 (https://aws.amazon.com/ec2/instance-types/g5/)。モデルは、リアルタイム推論用のAPIエンドポイントとしてデプロイすることも、バッチ推論のユースケースのためにコード自体にロードすることも可能です。
モデルをロードし、テキスト生成タスクを実行するコードは以下の通りです。
# pip install "transformers[tokenizers]>=4.29.2,<5.0.0" # "sentencepiece==0.1.99" "accelerate>=0.19.0,<1.0.0" # "safetensors>=0.3.1,<0.4.0"
import torch
from transformers import pipeline
generator = pipeline(
"text-generation",
model="tiiuae/falcon-40b-instruct",
tokenizer="tiiuae/falcon-40b-instruct",
torch_dtype=torch.bfloat16,
device_map="balanced_low_0",
)
output = generator(
"Explain to me the difference between nuclear fission and fusion.",
min_new_tokens=30,
max_new_tokens=50
)
print(output)
ノートブックでFalcon40BをロードするためのPythonコード
モデルをAPIとしてデプロイする
モデルは、AWS Sagemaker、EKSクラスター、または通常のEC2マシン上のエンドポイントとしてデプロイできます。Sagemakerにモデルをデプロイするには、以下のチュートリアルを参照してください。 https://aws.amazon.com/blogs/machine-learning/deploy-falcon-40b-with-large-model-inference-dlcs-on-amazon-sagemaker/.

EKSにモデルをデプロイするには、EKSクラスターを立ち上げ、その上にGPUノードプールとGPUオペレーターを設定し、APIエンドポイントにアクセスするためのイングレスレイヤーを構築する必要があります。 TrueFoundry は、モデルのデプロイをワンクリックプロセスにすることで、このプロセス全体をはるかに簡素化できます。

コスト分析
ご自身のAWSアカウントでFalcon LLMを実行するコストについて詳しく見ていきましょう。SagemakerとTrueFoundryで実行する場合のコストを比較します。
Sagemakerのコスト
Sagemakerインスタンス (ml.g5.12xlarge) の1時間あたりのコスト (us-east-1): $7.09
AWS JumpstartでFalconモデルのリクエストスループットとレイテンシを計算するために、簡単なベンチマークを実行しました。正確な数値はプロンプトの長さやリクエストの同時実行数によって異なりますが、これによりおおよその目安が得られるはずです。


上記のグラフからわかるように、p50レイテンシは約5.7秒、p90は約9.4秒です。1秒あたり約6〜7リクエストのスループットが得られます。
TrueFoundryを使用してEKSにモデルをデプロイする
TrueFoundryはEKSにモデルをデプロイし、スポットインスタンスとオンデマンドインスタンスを利用してコストを大幅に削減できます。時間あたりのオンデマンド、スポット、リザーブドの料金を比較してみましょう。 g5.12xlarge us-east-1リージョンのマシン。
オンデマンド: $5.672 (20% Sagemakerより安い)
スポット: $2.076 (70% Sagemakerより安い)
1年リザーブド: $3.573 (50% Sagemakerより安い)
3年リザーブド: $2.450 (65% Sagemakerより安い)
TrueFoundryを使用してEKSにデプロイされたモデルのスループットとレイテンシーを比較してみましょう。


上記の統計からわかるように、p50レイテンシーは5.8秒、p90は9.5秒です。スループットは毎秒6〜7リクエスト程度です。上記のとおり、
料金計算ツール
実際のライブトラフィックのあるユースケースでFalconモデルをホスティングするコストを試算してみましょう。1日あたり10万リクエストがあり、すべてのリクエストでFalconモデルにアクセスすると仮定します。このトラフィックを処理するには、g5.2xlargeインスタンス1台で十分なはずです。各インスタンスは毎秒6リクエストを処理でき、1日10万リクエストは毎秒1リクエストに相当するためです。ただし、信頼性の理由から、少なくとも2つのインスタンスを実行したいと考えます。2つのインスタンスを実行するコストを比較してみましょう。
Sagemaker: $7.1 * 2 (1時間あたりのドル) = 月額$10000
EKS:
スポットインスタンスの利用: 2ドル * 2 (1時間あたり) = 月額2880ドル
オンデマンドインスタンスの利用: = 月額8000ドル
スポットインスタンス1つとオンデマンドインスタンス1つを組み合わせることで、コストを約40%削減し、高い信頼性も実現できます。
チャットでご相談ください
LLMプロジェクトからのリターンを最大化し、AIを適切に活用してビジネスを強化したいとお考えでしたら、ぜひお話しし、意見交換をさせていただければ幸いです。
TrueFoundry AI Gateway delivers ~3–4 ms latency, handles 350+ RPS on 1 vCPU, scales horizontally with ease, and is production-ready, while LiteLLM suffers from high latency, struggles beyond moderate RPS, lacks built-in scaling, and is best for light or prototype workloads.


















.webp)
.webp)


.png)

.png)














