Blank white background with no objects or features visible.

Ask TFY:AIゲートウェイ内のあらゆる事象をデバッグ、分析、実行 詳細はこちら

TrueFoundryはSeldon AIの買収を発表し、エンタープライズAI向けコントロールプレーンを拡張します。プレスリリース全文はこちら→

Llama 2 LLM: あなたのクラウドでデプロイとファインチューニング

オープンソース界のChatGPTの瞬間が到来しました。Metaは、最新のオープンソース大規模言語モデルセットをリリースしました。その名は、 Llama 2 — 70億から700億パラメータの規模にわたる、事前学習済みでファインチューニングされた生成テキストモデルのコレクションです。

Llama 2に関する豆知識と記憶術

  1. Llama 2は、公開されているオンラインデータで学習されており、そのデータ量はおよそ 2兆トークンに及びます。これは英語のWikipedia全体の300倍以上です。
  2. Llama 2は100万件の人間によるアノテーションで学習されています。これを DatabricksのDollyの1万5千件のラベル付きデータセットと比較してみてください。
  3. 7B、13B、70Bの各バリアントの学習時間は、A100-80GB GPUでそれぞれ18万4千、36万8千、170万GPU時間と報告されています。これは興味深いことに、10億パラメータあたり約1000GPU週に相当します。つまり、70Bモデルに1000台のGPUを並列で使用した場合、70週間の学習期間となります。  
  4. これらのモデルを学習させるためのGPUコストは、それぞれおよそ80万ドル、150万ドル、800万ドルになります。最終的な実行には、合計1000万ドル相当のGPUが必要になります! :)
  5. 事前学習データは静的で、2022年9月までのものですが、2023年7月までの最新データでファインチューニングされています。
  6. コンテキストウィンドウは、7B、10B、70Bの3つのバリアントで4kです。

なぜ注目すべきなのでしょうか?

  1. まず第一に、これは研究目的および商用目的で無料で利用できます。ChatGPTのような品質を持ち、大手テクノロジー企業に支えられ、今日からデプロイおよびファインチューニングが可能な、この種では初のモデルです。(ただし、前暦月に 月間アクティブユーザーが7億人以上 いる場合は、Metaからライセンスを取得する必要があります!)  
  2. ファインチューニングされたLlama-2-Chatは、対話型ユースケース向けに最適化されています。Llama-2-Chatモデルは、ほとんどのベンチマークでオープンソースのチャットモデルを上回り、有用性と安全性に関する人間による評価では、ChatGPTやPaLMのような人気のあるクローズドソースモデルと同等の性能を発揮します。
  3. OpenAIのような商用クローズドソースサービスの使用における法的・コンプライアンス上の承認を待っていた方々、そしてこれまでのオープンソースLLMの応答品質に物足りなさを感じていた方々へ、その答えがここにあります。さらに重要なのは、オープンソースLLMが今後も存在し続け、進化していくことを裏付けるものです。

Llama 2の品質ベンチマーク

Llama 2は様々なLLMベンチマークにおいて目覚ましい性能を発揮しています。LlamaとChatGPTモデルの比較を以下に示します。

Llama vs ChatGPT
Llama 対 ChatGPT

Llama-2-70b-chat-hf モデルは、複数のベンチマークにおいて、GPT-3.5(オリジナルのChatGPTモデル)の性能に匹敵するか、あるいはそれを上回っています。詳細はこちらで確認できます こちら。データセットとタスクの詳細は付録セクションに記載されています。

サンプルタスクにおけるLlama 2の使用コスト

OpenAIベースのアプリケーションを本番環境に導入している多くの人々は、費用と、それらのアプリケーションをいかに持続的にスケールアップできるかについて懸念を抱いています。Llama 2を実行するために何が必要か、そしてOpenAIモデルの一部と比較してどうかについて、比較を行いました。

サンプルタスク:例えば、英語版Wikipedia(600万記事、各1000トークン)をLLMを使って半分のサイズに要約したいとします。詳細な計算は、こちらの ブログ。ここで、様々なモデルを使ったこのタスクの費用に関するいくつか興味深い点があります。

  1. GPT-4でこれを行うと、約36万ドルかかります。
  2. 同じタスクをGPT-3 Davinciバリアント(1750億パラメータ)で行うと約18万ドルかかり、Davinciのファインチューニングされたバリアントを使用した場合、100万ドル以上かかるでしょう。
  3. 代わりに、Curieモデル(約70億パラメータ)を使用した場合、費用は1万8千ドル、ファインチューニングされた場合の費用は約12万5千ドルになります。
  4. 同等のサイズのモデルであるLlama 2(70億パラメータ版)と比較してみてください。費用は約2千ドル、ファインチューニングされたバージョンでは約3千ドルになります。これは、同等のモデルにおいて、事前学習済みバージョンとファインチューニング済みバージョンでそれぞれ約9倍、40倍のコスト差があることを意味します。

Llama-2-13b-chatモデルのデプロイ

このモデルは、〜を通じて利用可能です。 Microsoft AzureAWS および Huggingface。Llama-2モデルは、 TrueFoundry を介して最小限のステップでデプロイすることも可能です。

TrueFoundryにデプロイするには、Huggingface上のLlama-2モデルへのアクセスが必要です。詳細については こちらをご覧ください。 TrueFoundryモデルカタログ は、最新かつ最高のオープンソースLLMで更新されています。モデルカタログを使用すると、モデルのデプロイに必要なすべてが事前に設定されており、ワンクリックで独自のクラウドインフラにデプロイできます。Llama-2モデルは、まもなくモデルカタログでワンクリックデプロイ可能になります。しかし、それまでの間、TrueFoundryユーザーは以下の説明に従ってLlama-2モデルをデプロイできます。

  1. デプロイページから、 新規デプロイ をクリックし、 サービスを選択します。
Llama 2 Deployment

2. このモデルをデプロイするには、HuggingfaceのText Generation Interfaceライブラリを使用できます。text-generation-inferenceイメージ(ghcr.io/huggingface/text-generation-inference:0.9)既存のコマンドを上書きし、必要なモデルを起動するコマンドを設定します (text-generation-launcher --model-id meta-llama/Llama-2-13b-chat-hf):

Llama 2 Deployment

3. 次に、モデルのエンドポイントを設定しましょう。モデルはポート80で提供されるため、そのポートを公開します。

Deploying Llama 2

4. Llama-2モデルは承認されたアカウントからのみ利用可能であるため、Huggingface APIキーを環境変数として設定する必要があります。キーは HUGGING_FACE_HUB_TOKENです。

なお、画像では、Huggingface APIキーを間接的に使用するために、 TrueFoundryでシークレットを作成しています。値を直接貼り付けることもできますが、それは推奨しません。

Deploying Llama 2

5. 最後に、このモデルに必要なリソースを割り当てる必要があります。私はA100 40GBを搭載したノードに13b-chatモデルバージョンをデプロイすることを選択しました。他の値は次のように設定できます。

Llama 2 Deployment

6. 送信 をクリックすると、モデルがデプロイされ、設定したエンドポイントで利用可能になります。

デプロイされたモデルを使用した推論

デプロイしたモデルを使用して推論を取得するには、 generate エンドポイントを呼び出すことができます。また、Pythonコードでデプロイされたモデルを使用できるPythonライブラリ text-generation もあります。

HTTPリクエストの利用:

Llama 2 Deployment

Pythonクライアントの利用:

Using Llama 2 deployed model

各クライアントに関する詳細情報は こちら.

TrueFoundry LLM Playground

TrueFoundry LLM Playgroundは、TrueFoundryにデプロイしたモデルやChatGPTのような他のモデルをプロンプトし、比較するために使用できます。Llama-2モデルがデプロイされたら、TrueFoundry LLM Playgroundを通じてテストすることも可能です。

TrueFoundry's LLM Playground
TrueFoundryのLLM Playground

チャットしましょう

このトピックについては、私たちも他の皆さんと同様に、まだ学習中です。もし貴社で大規模言語モデルの活用を検討されているようでしたら、ぜひお話しして情報交換をさせていただければ幸いです。

お茶でもしながらお話ししましょう

付録:タスクとメトリクスに関する詳細

MMLU の略です Multi-task Multi-Lingual Language Understandingこれは、質問応答、自然言語推論、要約など、さまざまなタスクにおける言語モデルの性能を測定するベンチマークです。MMLUの根底にある考え方は、言語モデルが多様な方法で情報を理解し処理できるべきであり、それを複数の言語で行えるべきであるというものです。

TriviaQA は、事実に関する質問と回答のデータセットです。これは、言語モデルが事実に基づいた知識を必要とする質問に答える能力を測定するために使用されます。TriviaQAの根底にある考え方は、言語モデルが事実に関する質問に答えるために、Wikipediaのような外部ソースから情報にアクセスし、処理できるべきであるというものです。

Natural Questions は、人間が実世界の情報について尋ねる質問のデータセットです。自然言語の質問を理解し、回答する言語モデルの能力を測定するために使用されます。Natural Questionsの根底にある考え方は、言語モデルが人間の言語のニュアンスを理解し、関連性のある有益な応答を生成できるべきだというものです。

GSM8k は、Google検索クエリから生成された8,000の質問のデータセットです。人々がGoogle検索で尋ねる質問に似た質問を理解し、回答する言語モデルの能力を測定するために使用されます。GSM8kの根底にある考え方は、言語モデルが人間のクエリの意図を理解し、関連性のある有益な応答を生成できるべきだというものです。

HumanEval は、人間にモデルの出力を評価してもらうことで、様々なタスクにおける言語モデルの性能を測定するベンチマークです。HumanEvalの根底にある考え方は、人間の評価が言語モデルの性能を評価する上で不可欠な部分であり、モデルがまだ苦戦している領域を特定するのに役立つというものです。

AGIEval は、人工汎用知能に通常関連付けられるタスクを実行する言語モデルの能力を測定するベンチマークです。AGIEvalの根底にある考え方は、言語モデルが人間と同じように世界を理解し、推論できるべきだというものです。

BoolQ は、ブール論理を用いて回答する必要がある質問のデータセットです。論理的な記述を理解し、推論する言語モデルの能力を測定するために使用されます。BoolQの根底にある考え方は、言語モデルが論理的な記述の意味を理解し、それらの記述と矛盾しない応答を生成できるべきだというものです。

HellaSwag は、ソーシャルメディアでよく使われる非公式な言語の一種である「swag」スタイルで書かれた質問のデータセットです。様々なスタイルで自然言語を理解し、生成する言語モデルの能力を測定するために使用されます。HellaSwagの根底にある考え方は、言語モデルが使用される文脈に適した自然言語を理解し、生成できるべきだというものです。

OpenBookQA は、大規模なテキストコーパスを参照することで回答できる質問のデータセットです。外部ソースから情報にアクセスし、処理する言語モデルの能力を測定するために使用されます。OpenBookQAの根底にある考え方は、言語モデルが質問に答えるために様々なソースから情報にアクセスし、処理できるべきだというものです。

QuAC は、会話について尋ねられる質問のデータセットです。会話の文脈を理解し、追跡する言語モデルの能力を測定するために使用されます。QuACの根底にある考え方は、言語モデルが会話の文脈を理解し、会話に関連する応答を生成できるべきだというものです。

Winogrande は、言語モデルにとって回答が難しい質問のデータセットです。複雑な質問を理解し、回答する言語モデルの能力を測定するために使用されます。Winograndeの根底にある考え方は、言語モデルが世界に対する深い理解を必要とする複雑な質問を理解し、回答できるべきだというものです。

Try now.

One gateway for all your models, MCP servers, and agents.
No credit card needed.

Start free
Table of Contents

One Gateway for Every LLM, Agent and MCP Server

Book a 30-min with our AI expert

Book a Demo

The fastest way to build, govern and scale your AI

Book Demo
Summarize with
ChatGPT logo by OpenAI
Perplexity AI logo
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.

Discover More

November 5, 2025
|
5 min read

エージェンティックAI時代におけるデータレジデンシー:AIゲートウェイはいかに主権的規模とコンプライアンスを実現するか

October 5, 2023
|
5 min read

<Webinar> 企業向け生成AIショーケース

Best Fine Tuning Tools for Model Training
May 3, 2024
|
5 min read

モデルトレーニング向けファインチューニングツール主要6選:2026年版

July 20, 2023
|
5 min read

LLMOps CoE: MLOpsランドスケープにおける次のフロンティア

August 17, 2026
|
5 min read

Sandboxed Code Agents: Let Models Execute Without Letting Them Roam

No items found.
Portkey AI Gateway Pricing
August 15, 2026
|
5 min read

2026年版 Portkey AI Gateway 料金:完全ガイドと比較

No items found.
MCP registry connecting agents to governed MCP servers
August 15, 2026
|
5 min read

2026年版 最高のMCPレジストリ:開発者と企業向け比較

No items found.
TrueFoundry AI gateway powers enterprise AI platform engineering at scale
August 15, 2026
|
5 min read

AIプラットフォームエンジニアリングとは?エンタープライズチームのための実践ガイド

No items found.
No items found.

Recent Blogs

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.
Take a quick product tour
Start Product Tour
Product Tour