Llama 2 LLM: あなたのクラウドでデプロイとファインチューニング

Built for Speed: ~10ms Latency, Even Under Load
Blazingly fast way to build, track and deploy your models!
- Handles 350+ RPS on just 1 vCPU — no tuning needed
- Production-ready with full enterprise support
オープンソース界のChatGPTの瞬間が到来しました。Metaは、最新のオープンソース大規模言語モデルセットをリリースしました。その名は、 Llama 2 — 70億から700億パラメータの規模にわたる、事前学習済みでファインチューニングされた生成テキストモデルのコレクションです。
Llama 2に関する豆知識と記憶術
- Llama 2は、公開されているオンラインデータで学習されており、そのデータ量はおよそ 2兆トークンに及びます。これは英語のWikipedia全体の300倍以上です。
- Llama 2は100万件の人間によるアノテーションで学習されています。これを DatabricksのDollyの1万5千件のラベル付きデータセットと比較してみてください。
- 7B、13B、70Bの各バリアントの学習時間は、A100-80GB GPUでそれぞれ18万4千、36万8千、170万GPU時間と報告されています。これは興味深いことに、10億パラメータあたり約1000GPU週に相当します。つまり、70Bモデルに1000台のGPUを並列で使用した場合、70週間の学習期間となります。
- これらのモデルを学習させるためのGPUコストは、それぞれおよそ80万ドル、150万ドル、800万ドルになります。最終的な実行には、合計1000万ドル相当のGPUが必要になります! :)
- 事前学習データは静的で、2022年9月までのものですが、2023年7月までの最新データでファインチューニングされています。
- コンテキストウィンドウは、7B、10B、70Bの3つのバリアントで4kです。
なぜ注目すべきなのでしょうか?
- まず第一に、これは研究目的および商用目的で無料で利用できます。ChatGPTのような品質を持ち、大手テクノロジー企業に支えられ、今日からデプロイおよびファインチューニングが可能な、この種では初のモデルです。(ただし、前暦月に 月間アクティブユーザーが7億人以上 いる場合は、Metaからライセンスを取得する必要があります!)
- ファインチューニングされたLlama-2-Chatは、対話型ユースケース向けに最適化されています。Llama-2-Chatモデルは、ほとんどのベンチマークでオープンソースのチャットモデルを上回り、有用性と安全性に関する人間による評価では、ChatGPTやPaLMのような人気のあるクローズドソースモデルと同等の性能を発揮します。
- OpenAIのような商用クローズドソースサービスの使用における法的・コンプライアンス上の承認を待っていた方々、そしてこれまでのオープンソースLLMの応答品質に物足りなさを感じていた方々へ、その答えがここにあります。さらに重要なのは、オープンソースLLMが今後も存在し続け、進化していくことを裏付けるものです。
Llama 2の品質ベンチマーク
Llama 2は様々なLLMベンチマークにおいて目覚ましい性能を発揮しています。LlamaとChatGPTモデルの比較を以下に示します。

Llama-2-70b-chat-hf モデルは、複数のベンチマークにおいて、GPT-3.5(オリジナルのChatGPTモデル)の性能に匹敵するか、あるいはそれを上回っています。詳細はこちらで確認できます こちら。データセットとタスクの詳細は付録セクションに記載されています。
サンプルタスクにおけるLlama 2の使用コスト
OpenAIベースのアプリケーションを本番環境に導入している多くの人々は、費用と、それらのアプリケーションをいかに持続的にスケールアップできるかについて懸念を抱いています。Llama 2を実行するために何が必要か、そしてOpenAIモデルの一部と比較してどうかについて、比較を行いました。
サンプルタスク:例えば、英語版Wikipedia(600万記事、各1000トークン)をLLMを使って半分のサイズに要約したいとします。詳細な計算は、こちらの ブログ。ここで、様々なモデルを使ったこのタスクの費用に関するいくつか興味深い点があります。
- GPT-4でこれを行うと、約36万ドルかかります。
- 同じタスクをGPT-3 Davinciバリアント(1750億パラメータ)で行うと約18万ドルかかり、Davinciのファインチューニングされたバリアントを使用した場合、100万ドル以上かかるでしょう。
- 代わりに、Curieモデル(約70億パラメータ)を使用した場合、費用は1万8千ドル、ファインチューニングされた場合の費用は約12万5千ドルになります。
- 同等のサイズのモデルであるLlama 2(70億パラメータ版)と比較してみてください。費用は約2千ドル、ファインチューニングされたバージョンでは約3千ドルになります。これは、同等のモデルにおいて、事前学習済みバージョンとファインチューニング済みバージョンでそれぞれ約9倍、40倍のコスト差があることを意味します。
Llama-2-13b-chatモデルのデプロイ
このモデルは、〜を通じて利用可能です。 Microsoft Azure、 AWS および Huggingface。Llama-2モデルは、 TrueFoundry を介して最小限のステップでデプロイすることも可能です。
TrueFoundryにデプロイするには、Huggingface上のLlama-2モデルへのアクセスが必要です。詳細については こちらをご覧ください。 TrueFoundryモデルカタログ は、最新かつ最高のオープンソースLLMで更新されています。モデルカタログを使用すると、モデルのデプロイに必要なすべてが事前に設定されており、ワンクリックで独自のクラウドインフラにデプロイできます。Llama-2モデルは、まもなくモデルカタログでワンクリックデプロイ可能になります。しかし、それまでの間、TrueFoundryユーザーは以下の説明に従ってLlama-2モデルをデプロイできます。
- デプロイページから、
新規デプロイをクリックし、サービスを選択します。

2. このモデルをデプロイするには、HuggingfaceのText Generation Interfaceライブラリを使用できます。text-generation-inferenceイメージ(ghcr.io/huggingface/text-generation-inference:0.9)既存のコマンドを上書きし、必要なモデルを起動するコマンドを設定します (text-generation-launcher --model-id meta-llama/Llama-2-13b-chat-hf):

3. 次に、モデルのエンドポイントを設定しましょう。モデルはポート80で提供されるため、そのポートを公開します。

4. Llama-2モデルは承認されたアカウントからのみ利用可能であるため、Huggingface APIキーを環境変数として設定する必要があります。キーは HUGGING_FACE_HUB_TOKENです。
なお、画像では、Huggingface APIキーを間接的に使用するために、 TrueFoundryでシークレットを作成しています。値を直接貼り付けることもできますが、それは推奨しません。

5. 最後に、このモデルに必要なリソースを割り当てる必要があります。私はA100 40GBを搭載したノードに13b-chatモデルバージョンをデプロイすることを選択しました。他の値は次のように設定できます。

6. 送信 をクリックすると、モデルがデプロイされ、設定したエンドポイントで利用可能になります。
デプロイされたモデルを使用した推論
デプロイしたモデルを使用して推論を取得するには、 generate エンドポイントを呼び出すことができます。また、Pythonコードでデプロイされたモデルを使用できるPythonライブラリ text-generation もあります。
HTTPリクエストの利用:

Pythonクライアントの利用:

各クライアントに関する詳細情報は こちら.
TrueFoundry LLM Playground
TrueFoundry LLM Playgroundは、TrueFoundryにデプロイしたモデルやChatGPTのような他のモデルをプロンプトし、比較するために使用できます。Llama-2モデルがデプロイされたら、TrueFoundry LLM Playgroundを通じてテストすることも可能です。

チャットしましょう
このトピックについては、私たちも他の皆さんと同様に、まだ学習中です。もし貴社で大規模言語モデルの活用を検討されているようでしたら、ぜひお話しして情報交換をさせていただければ幸いです。
お茶でもしながらお話ししましょう
付録:タスクとメトリクスに関する詳細
MMLU の略です Multi-task Multi-Lingual Language Understandingこれは、質問応答、自然言語推論、要約など、さまざまなタスクにおける言語モデルの性能を測定するベンチマークです。MMLUの根底にある考え方は、言語モデルが多様な方法で情報を理解し処理できるべきであり、それを複数の言語で行えるべきであるというものです。
TriviaQA は、事実に関する質問と回答のデータセットです。これは、言語モデルが事実に基づいた知識を必要とする質問に答える能力を測定するために使用されます。TriviaQAの根底にある考え方は、言語モデルが事実に関する質問に答えるために、Wikipediaのような外部ソースから情報にアクセスし、処理できるべきであるというものです。
Natural Questions は、人間が実世界の情報について尋ねる質問のデータセットです。自然言語の質問を理解し、回答する言語モデルの能力を測定するために使用されます。Natural Questionsの根底にある考え方は、言語モデルが人間の言語のニュアンスを理解し、関連性のある有益な応答を生成できるべきだというものです。
GSM8k は、Google検索クエリから生成された8,000の質問のデータセットです。人々がGoogle検索で尋ねる質問に似た質問を理解し、回答する言語モデルの能力を測定するために使用されます。GSM8kの根底にある考え方は、言語モデルが人間のクエリの意図を理解し、関連性のある有益な応答を生成できるべきだというものです。
HumanEval は、人間にモデルの出力を評価してもらうことで、様々なタスクにおける言語モデルの性能を測定するベンチマークです。HumanEvalの根底にある考え方は、人間の評価が言語モデルの性能を評価する上で不可欠な部分であり、モデルがまだ苦戦している領域を特定するのに役立つというものです。
AGIEval は、人工汎用知能に通常関連付けられるタスクを実行する言語モデルの能力を測定するベンチマークです。AGIEvalの根底にある考え方は、言語モデルが人間と同じように世界を理解し、推論できるべきだというものです。
BoolQ は、ブール論理を用いて回答する必要がある質問のデータセットです。論理的な記述を理解し、推論する言語モデルの能力を測定するために使用されます。BoolQの根底にある考え方は、言語モデルが論理的な記述の意味を理解し、それらの記述と矛盾しない応答を生成できるべきだというものです。
HellaSwag は、ソーシャルメディアでよく使われる非公式な言語の一種である「swag」スタイルで書かれた質問のデータセットです。様々なスタイルで自然言語を理解し、生成する言語モデルの能力を測定するために使用されます。HellaSwagの根底にある考え方は、言語モデルが使用される文脈に適した自然言語を理解し、生成できるべきだというものです。
OpenBookQA は、大規模なテキストコーパスを参照することで回答できる質問のデータセットです。外部ソースから情報にアクセスし、処理する言語モデルの能力を測定するために使用されます。OpenBookQAの根底にある考え方は、言語モデルが質問に答えるために様々なソースから情報にアクセスし、処理できるべきだというものです。
QuAC は、会話について尋ねられる質問のデータセットです。会話の文脈を理解し、追跡する言語モデルの能力を測定するために使用されます。QuACの根底にある考え方は、言語モデルが会話の文脈を理解し、会話に関連する応答を生成できるべきだというものです。
Winogrande は、言語モデルにとって回答が難しい質問のデータセットです。複雑な質問を理解し、回答する言語モデルの能力を測定するために使用されます。Winograndeの根底にある考え方は、言語モデルが世界に対する深い理解を必要とする複雑な質問を理解し、回答できるべきだというものです。
TrueFoundry AI Gateway delivers ~3–4 ms latency, handles 350+ RPS on 1 vCPU, scales horizontally with ease, and is production-ready, while LiteLLM suffers from high latency, struggles beyond moderate RPS, lacks built-in scaling, and is best for light or prototype workloads.


















.webp)
.webp)


.png)

.png)














