True ML Talks #10 - Metaのエンジニアリングディレクターと語るLLMとGenAI

Built for Speed: ~10ms Latency, Even Under Load
Blazingly fast way to build, track and deploy your models!
- Handles 350+ RPS on just 1 vCPU — no tuning needed
- Production-ready with full enterprise support
True ML Talksの新しいエピソードをお届けします。今回は、LLMと生成AIについて深く掘り下げ、お話しいただくのは Anant。
Anant氏はエンジニアリングリーダーです。現在、Metaでエンジニアリングディレクターを務め、スマートグラスの製品体験開発に携わっています。オープンソースコントリビューターとしてキャリアをスタートさせ、スタートアップと大手テクノロジー企業の両方で重要な役割を担ってきました。Mozillaでは、WebRTCをはじめとするブラウザ技術の定義と実装に貢献しました。また、初期のFirebaseエンジニアであり、Ozloの最初のエンジニアでもありました。
📌
Anant氏との対談では、以下の点について取り上げます。
- Stable Diffusionのファインチューニング
- Hacker News向け埋め込みの構築
- 長期的な持続可能性に関する議論
- LLMOpsにおける実験追跡の改善とアクセスしやすいドキュメントの必要性
- OpenAIプラグインの力と可能性
- リカバリーフローとプラグイン適応における言語モデルの力
Anant氏は個人的な見解としてお話しくださいました。その見解は、所属する組織(Meta)の公式なものではありません。
全エピソードは以下でご覧いただけます。
Anant氏の実験からの主な考察:
LoRA:大規模言語モデルのファインチューニングにおける興味深い手法。
- LoRAのアクセシビリティ: Dreamboothのような他の手法と比較して、LoRAはよりアクセスしやすく、事前学習済みモデルの重みを変更することなく、いくつかのレイヤーを追加するだけで済みます。
- 費用対効果とシンプルさ: LoRAは費用対効果が高く、Google Colabのようなプラットフォームを通じて非技術者でも利用できます。そのシンプルさにより、迅速な反復と実験が可能です。
- テキストと画像における可能性: 当初は画像に適用されていましたが、LoRAのテキスト関連タスクにおける可能性が探求されています。
- ファインチューニングの未来: LoRAは、その費用対効果の高さ、アクセシビリティ、および古いグラフィックカードとの互換性から、従来の技術よりも好まれています。
Hacker News向け埋め込みの構築:課題とモデル選択
- 基本を理解する: プロジェクトの規模と要件に基づいて、適切なソリューションを選択します。
- 埋め込みを把握する: 埋め込みは浮動小数点数の集合であり、SQLiteデータベースに保存することが効果的であることが証明されました。
- モデル選択: クラウドプロバイダーよりもオープンソースの埋め込みライブラリが好まれました。Hugging FaceのMTEBを使用したベンチマークとプロトタイピングに基づいて、Instructorラージモデルが選択されました。
- 基本原則から始める: 選択したソリューションを深く理解し、誇大広告ではなくプロジェクトの要件に焦点を当てます。
- 明確な必要性に応じたスケールアップ: スケールアップは、明確な要件と合致する場合に行うべきです。
長期的な持続可能性に関する議論:大規模モデル vs. 小規模ファインチューニングモデル
MLOpsエコシステムにおける重要な議論の一つは、特定のデータセットやユースケースに合わせて調整された、より小規模なファインチューニングモデルと、大規模な汎用モデルの長期的な持続可能性を巡るものです。この議論は、大規模言語モデル(LLM)のコモディティ化の可能性を示唆するリークされたメモから洞察を得ています。
リークされたメモは、公式な見解ではないものの、LLMがよりアクセスしやすく、複製可能になるという見方が広まっていることを示しています。この進展は、特にオープンソースのバックグラウンドを持つ人々の間で、コミュニティ内に興奮を巻き起こしました。最近の進歩により、LLMの複製が容易になり、データ取得とモデルトレーニングのコストに関する以前の懸念が解消されました。
RunwayMLや拡散モデルのようなプロジェクトは、オープンソースムーブメントに貢献し、GitHubのようなプラットフォームでのモデル公開を可能にしました。これにより、LLMへのアクセスが民主化され、愛好家やハッカーが自由に探索・実験できるようになっています。すべてのLLMがオープンソースであるわけではありませんが、ライセンスされたオープンソースの選択肢も存在し、多様な貢献者を育成しています。
オープンな開発と広範な参加の利点は、権力が少数の組織に集中するのを防ぐため、強調されています。さらに、オープンな開発は透明性とセキュリティを提供し、グローバルな要因や国家からの潜在的な関心も考慮に入れています。
LLMのコモディティ化を予測し、クラウドコンピューティングの状況との類似性が指摘されています。ユーザーは、AWS、Azure、Google Computeのようなクラウドサービスと同様に、異なるプロバイダーの中から柔軟に選択できるようになるでしょう。これにより、エコシステム内での健全な競争とイノベーションが促進されます。
議論では、大規模モデルとより小型のオンデバイスモデルとの相互作用も考慮されています。どちらのタイプもMLOpsエコシステムにおいてそれぞれの役割を持ち、計算は複数のレイヤーで実行されます。より単純なタスクはデバイス上で効率的に実行できますが、よりリソースを消費するタスクはサーバーにオフロードできます。デプロイの選択は特定のユースケースに依存し、どちらか一方を優先するのではなく、ハイブリッドアプローチが推奨されています。
長期的な持続可能性を追求する上で、MLOpsコミュニティは、大規模モデルとファインチューニングされたモデルの実用性と利点を慎重に検討する必要があります。それぞれのアプローチの強みを活かし、バランスを取ることが、AIモデルの開発とデプロイの未来を形作り、この分野での継続的な進歩を確実にするでしょう。
📌
性能比較:大規模言語モデル vs. 小型バージョン
MLOpsコミュニティ内で議論されているもう一つの側面は、大規模言語モデルとそれより小型のモデルとの性能比較です。大規模モデルは、ブログや詩の生成といったタスクで優れた能力を発揮し、その目覚ましい性能を示します。しかし、小型モデルは、特に小規模なデータセットを扱う場合、その性能に匹敵するのが難しいことがよくあります。
正確な比較を確実にするためには、そのような主張を裏付ける評価方法やテストを精査することが重要です。異なるユースケースや評価アプローチが存在する可能性を認めつつも、大規模モデルと小型モデルの間の限界と性能差を徹底的に理解することが不可欠です。
LLMOpsにおける実験追跡の改善とアクセスしやすいドキュメントの必要性
機械学習の分野が進歩するにつれて、MLOpsフレームワークを含む堅牢なツール群の重要性が明らかになっています。しかし、LLMOps(大規模言語モデル運用)の台頭に伴い、LLMを扱う開発者をサポートするための専用ツールの必要性が高まっています。この議論では、LLMOpsにおける実験追跡とアクセスしやすいドキュメントに関する教訓と推奨事項に焦点を当てます。
学習の過程を振り返ると、適切な実験ドキュメントが不可欠であることが明らかになります。当初は、トレーニング日誌や構造化された追跡システムの維持が重視されていなかったため、実験中に課題が生じました。特にLoRAのファインチューニングプロジェクトでは、多数のハイパーパラメータを、その値と対応する出力を追跡する体系的なアプローチなしに管理することが困難になりました。
徹底したドキュメントの価値を認識すると、信頼できるトレーニング日誌や統合された追跡システムの必要性が明らかになります。残念ながら、すぐに利用できるソリューションは少なく、適切なツールを見つけるのが困難でした。しかし、実験追跡および可視化ツールを提供するスタートアップであるWeights & Biases (wandb.ai) の発見は有益でした。これらのツールを他者に推奨するにあたり、プロセスのできるだけ早い段階でこれらを導入していれば、実験管理が改善されたであろうと認識しています。
さらに、機械学習コミュニティ内でのアクセスしやすいドキュメントの重要性が強調されています。ハイパーパラメータとその効果に関する情報が不足していたため、理解が妨げられ、実験の最適化が阻害されました。
MLOpsにおけるデータセキュリティの懸念への対応:プライバシーと信頼の確保
データセキュリティはMLOpsの領域において最重要課題であり、コミュニティ内で疑問を提起し、議論を促しています。この重要な問題を探るにあたり、OpenAIが取っているアプローチと、データプライバシーを取り巻くより広範な視点について掘り下げてみましょう。
OpenAIのデータプライバシーに関する姿勢は、特にChatGPTのようなサービスを利用する消費者にとっては合理的であると見なされています。ChatGPTが無料製品として提供されていることを考えると、ユーザーはそのプラットフォームに価値を見出し、モデルを強化するために自身のデータを提供することを正当化しています。これは公正なトレードオフと見なされており、ユーザーは、そのようなプラットフォームを運用するのにリソースが大量に必要であることを考慮し、サービス改善のために自らの会話を喜んで提供しています。
月額料金を支払うChatGPT Plusの購読者には、データ利用をオプトアウトする選択肢が提供されています。しかし、この選択をすると会話履歴が失われるという結果が伴います。それでも、手頃な購読料とサービスから得られる計り知れない価値を考慮すると、ユーザーはこのトレードオフを概ね合理的だと認識しています。彼らは、自身のデータがモデルの改善に貢献し、同時にコストを補助していることを理解し、この取り決めに満足を表明しています。
特定のユースケースでAIモデルを活用しようとする企業は、データセキュリティに関して独自の要件を持っています。OpenAIは、Microsoft AzureのSecure Enclaveのようなパートナーシップを通じて、これらの懸念に対処するための措置をすでに講じています。これらの協力関係は、データが企業の管理下に置かれる安全な環境を提供します。さらに、AnthropicとAWS Bedrockの統合のようなパートナーシップは、クラウドモデルを実行するためのセキュアエンクレーブを提供し、データが社外に出ることへの懸念を和らげます。これらの業界の動きは、データセキュリティを重視する企業に適したソリューションを提供する態勢を整えています。
データプライバシーとセキュリティの問題を解決するには、OpenAI、Azure、その他の主要企業のような企業の協力が必要です。例えば、Googleは自社の内部能力により、これらの懸念に効果的に対処できる立場にあります。データプライバシーについてはバランスの取れた視点を持つことが重要であり、信頼できる企業は顧客との信頼関係を築くことができ、顧客はAIサービスによって提供される価値のために、ある程度のプライバシーを交換することを受け入れる可能性があることを認識すべきです。
OpenAIプラグインの力と可能性
OpenAIプラグインは、AI言語モデルの真の力と可能性を示す画期的な進歩です。プラグインの概念を深く掘り下げると、コードを書くことなくモデルとの対話を可能にする点で、いかに優れているかが明らかになります。その代わりに、モデルに効果的に指示を与えるために、英語のコミュニケーションスキルを活用することに焦点が移ります。この認識は、開発者にとっても非技術者にとっても、驚くべき発見となるでしょう。
プラグインは、特にAPIの説明とトリガーに関して、AIモデルに英語で指示を与えることを中心としています。APIスキーマと仕様を詳述した1ページのドキュメントを作成することで、ユーザーはいつ、どのようにプラグインをトリガーするかを効果的に伝えることができます。これは、ChatGPTの機能を活用する上で、強力な英語スキルがいかに重要であるかを強調しています。
この革新的なアプローチは、Toolformer論文のような先行研究との比較につながり、同様の問題が過去にも探求されてきたことを示しています。しかし、OpenAIの言語モデル、特にChatGPTは、既存のオープンソースモデルと比較して、品質とパフォーマンスにおいて著しい進歩を示しています。
品質の差は主に、コアとなる言語モデルのコーディング関連タスクにおける能力に起因します。ChatGPTはコード関連の指示の処理に優れており、それがプラグインを効率的にディスパッチし、利用する能力につながっています。これは、プラグインを効果的に実装する上で、基盤となるモデルのコーディングタスクにおける熟練度が極めて重要であることを示しています。
OpenAIは現在、品質面で大きなリードを保っていますが、オープンソースモデルが追いつくための時間を与えることが不可欠です。オープンソースコミュニティは、そのギャップを埋め、モデルの能力を向上させるために継続的に努力しています。OpenAIがオープンソースモデルの可能性を認識し、マルチモーダル機能のような道を模索しているという事実は、心強いものです。サム・アルトマン氏のレックス・フリードマン氏との最近のインタビューは、OpenAIの視点を浮き彫りにしており、焦点がパラメータ競争から差別化要因へと移行していることを示唆しています。
オープンソースモデルが進化し、GPT-3.5や4のレベルに達するにつれて、オープンソースフレームワークでもプラグイン機能が利用可能になることが期待されます。この分野の進歩は将来に希望をもたらし、オープンソースモデルとプラグインが、開発者がAIシステムと対話する方法を革新する可能性があります。
リカバリーフローとプラグイン適応における言語モデルの力
OpenAIのGPTのような言語モデルの台頭は、多くの点で英語を新しいプログラミング言語として前面に押し出しました。AIモデルに指示を与え、プラグインをトリガーするために英語を活用することは、開発者に新たな可能性を切り開きました。
プラグインに関して言えば、その使用を細かく管理することではなく、むしろ効果的な使用方法を指示することに焦点が当てられています。プラグインの利用方法に関する指示を提供することで、開発者はAIモデルがプラグインをトリガーする適切なタイミングを判断できるようにします。ただし、現在の実装には、一度に3つのプラグインしか有効にできないことや、プラグインのトリガーに時折誤りがあることなどの制限があることに注意することが重要です。
それにもかかわらず、言語モデルの力はそのリカバリーフローにあります。モデルが最初にプラグインを正しく理解したりトリガーしたりしなくても、ユーザーエクスペリエンスは良好なままであるのです。明示的で正確なコマンドが必要とされるAlexaのような従来の音声アシスタントとは対照的に、ChatGPTのような言語モデルは異なる体験を提供します。
ChatGPTでは、モデルが的外れな応答をした場合でも、ユーザーは自信を持って、間違いを修正するための明確な追加指示を与えることができます。モデルの理解力と応答性は、信頼と協力の感覚を生み出します。ユーザーは自分の指示が認識され、実行されると感じるのです。言語モデルのリカバリー能力は、しばしば不満や失望につながった旧世代のアシスタントと比較して、画期的なものです。
言語モデルの力、特にプラグインと組み合わせた場合、その力はエラーからシームレスに回復する能力にあります。ユーザーは、モデルが混乱を認め、丁寧な謝罪をし、間違いを修正しようとする意欲を高く評価します。このレベルのリカバリーと適応性は、マルチターン対話システムの進歩があったとしても、これまでのアシスタント技術には見られなかったものです。
言語モデルのアーキテクチャは、驚異的なレベルのリカバリーを可能にし、これにより、プラグイン統合のための理想的なプラットフォームとなっています。開発者とモデル間のシームレスな統合と連携は、全体的なユーザーエクスペリエンスを向上させます。開発者がこのアーキテクチャ内でプラグインの可能性を探求するにつれて、動的で適応性の高いAIシステムを構築する可能性は広大です。
言語モデルがAI駆動型インタラクションの基盤となることで、リカバリーフローとプラグイン適応は、高度でユーザーフレンドリーなシステムを構築する上で不可欠な要素となります。自然言語理解と応答性の組み合わせは、MLOpsの分野において言語モデルを変革的なツールとして位置づけています。
📌
MLOpsのためのGPU購入:課題と衝動買い
クラウドプロバイダーを介した高性能GPUへのアクセスは、趣味で利用する人にとっては不満が募ります。企業の優先順位付けや長期契約が課題となります。
短時間のGPU利用を必要とする趣味のユーザーにとって、クラウドベースのGPUアクセスは時間がかかります。個人用GPUのセットアップは、手動での設定や依存関係の管理を含め、困難が伴います。
事前設定されたクラウドGPUイメージの利便性にもかかわらず、アナントは自身の個人用GPUの制御性と信頼性を重視しています。課題を克服し、専用GPUを購入するという彼の決断は、MLOpsにとって有益であることが証明されました。
情報収集:アナント・ナラヤナン氏の最新動向を把握するためのアプローチ
- Twitter:AI関連の最新情報の知識ハブとしてTwitterを活用しましょう。AIコミュニティの専門家や組織をフォローし、新しい動向を素早く把握し、情報収集に役立てましょう。
- ポッドキャスト:業界のポッドキャストを聴いて、貴重な洞察を得ましょう。おすすめのポッドキャストは、ベン・トンプソン氏の「Stratechery」や、ベン・トンプソン氏とジョン・グルーバー氏が共同ホストを務める「Dithering」です。これらのポッドキャストは、AIの進歩を含む幅広いテクノロジー関連のトピックを扱っています。
- オフラインでの交流:対面イベントや集会に参加して、貴重な洞察や視点を得ましょう。cerebralvalley.aiのようなプラットフォームで、包括的なイベントリストを探しましょう。対面での交流、ハッカソンへの参加、他のプロフェッショナルとの意見交換を通じて、知識を広げ、有意義なつながりを築きましょう。
True ML Talksシリーズの過去のブログ記事を読む:
TrueMLの視聴を続けましょう YouTubeシリーズ とTrueMLの読書を続けましょう ブログシリーズ。
TrueFoundry は、Kubernetes上で動作するMLデプロイメントPaaSであり、開発者のワークフローを加速させ、モデルのテストとデプロイにおいて完全な柔軟性を提供しつつ、インフラチームには完全なセキュリティと制御を保証します。当社のプラットフォームを通じて、機械学習チームは デプロイと監視 を15分で、100%の信頼性、スケーラビリティ、そして数秒でのロールバック機能を提供します。これにより、コストを削減し、モデルをより迅速に本番環境にリリースできるようになり、真のビジネス価値の実現を可能にします。
TrueFoundry AI Gateway delivers ~3–4 ms latency, handles 350+ RPS on 1 vCPU, scales horizontally with ease, and is production-ready, while LiteLLM suffers from high latency, struggles beyond moderate RPS, lacks built-in scaling, and is best for light or prototype workloads.















.webp)
.webp)


.png)

.png)














