True MLトーク #11 - LLM、LLMops、GenAI Greenhouse CTO

Built for Speed: ~10ms Latency, Even Under Load
Blazingly fast way to build, track and deploy your models!
- Handles 350+ RPS on just 1 vCPU — no tuning needed
- Production-ready with full enterprise support
「True ML Talks」の新しいエピソードをお届けします。今回もLLM、LLMops、生成AIについて深く掘り下げ、お話を伺うのは マイケル・ブーフォード.
マイケルはGreenhouseのCTOです。約11年前に最初の従業員として入社し、最初のコードを書き、今日の会社を築き上げました。
📌
マイクとの対談では、以下の内容についてお話しします。
- GreenhouseにおけるMLチームの組織構造
- GreenhouseでのLLMおよび生成AIモデルの活用方法
- 大規模言語モデルの活用術
- プロンプトエンジニアリングの理解
- LLMOpsとLLMに不可欠なツール
全編はこちらからご覧ください:
Greenhouseにおけるデータサイエンスおよび機械学習チームの組織構造
Greenhouseのデータサイエンスおよび機械学習チームは、会社の成長とともに進化し、ジェネラリストから専門的な役割へと移行してきました。その組織構造の主な特徴は以下の通りです。
- データエンジニアリングとプラットフォーム:専任チームがデータエンジニアリング、データウェアハウジング、機械学習の機能開発を管理しています。彼らはマーケティング活動を支援し、コードとモデルのデプロイと運用を担当しています。
- プロダクトデータサイエンス:このチームは、革新的なプロジェクト、データ分析、プロダクト開発を推進するインサイトを通じて、プロダクトの意思決定を支援することに注力しています。
- MLエンジニアリング:Greenhouseには、様々なプロダクトのユースケースに対応する、スケーラブルで信頼性の高い本番環境対応モデルの構築に特化したMLエンジニアリングチームがあります。
さらに、 ビジネスアナリストチーム がビジネス関連の質問に対応し、洞察を提供します。
インフラストラクチャの管理は、別の インフラストラクチャチームが担当し、KubernetesやAWSなどのコンポーネントを監督しています。データストアには、管理専門のチームがあります。
GreenhouseにおけるLLMと生成AIモデルの活用方法
Greenhouseの業務において、これらのモデルが活用されているいくつかのユースケースを以下に示します。
- 求人情報の類似性とデータ処理: Greenhouseでは、BardやGPT-2を含むLLMを活用し、求人関連データの様々な側面を分析・処理しています。これらのモデルは、異なる求人情報の類似性を判断するだけでなく、生の履歴書データを解析・処理するのにも役立っています。その焦点は、求人情報に関連する効率的なデータ処理とラベリング作業にあります。
- RAGアーキテクチャによる迅速な回答: Greenhouseは最近、革新的なユースケースのためにGPT-4の利用を模索しています。その一つは、RAG(Retrieval-Augmented Generation)アーキテクチャを実装し、ユーザーのクエリに迅速な応答を提供することです。生成モデルを活用することで、Greenhouseは、これまで手動でのレポート作成が必要だった複雑な質問に対する回答をユーザーが取得できるようにすることを目指しています。生成モデルは翻訳者の役割を果たし、英語のクエリをデータストアと連携するクエリ言語に変換し、その応答をユーザーが利用できるように再度翻訳します。
- レポート作成およびビジネスインテリジェンス(BI): 求人情報や履歴書といった膨大なテキストデータにアクセスできるGreenhouseは、レポート作成やBIの目的でLLMや生成モデルを活用するのに適した立場にあります。Greenhouseはすでに、事前構築済みレポート、カスタムレポートビルダー、およびデータレイク製品を提供しています。同社は、LLMを活用して、ソーシングパフォーマンス、面接プロセス、採用状況、予算分析など、採用に関連する幅広いレポート作成の質問に答えることを構想しています。
大規模言語モデルの活用:課題への対処とセルフホスティングの導入
大規模言語モデルの課題
GPT-4のようなモデルを搭載したChatGPTは目覚ましい結果をもたらしますが、その利用にはいくつかの課題と懸念が残されています。以下に、ChatGPTで発生するいくつかの問題点を示します。
- 信頼性: GPT-4はまだ比較的新しく、本番環境へのデプロイにおいて完全に信頼できるとは限りません。そのため、一貫したパフォーマンスと信頼性を必要とする重要なシステムにおいて、GPT-4のみに依存することは推奨されません。
- 利用規約とデータプライバシー: どのAIモデルにも言えることですが、データの取り扱い方や、それが学習目的で使用されるかどうかについて懸念があります。データが安全に処理され、漏洩したり悪用されたりしないと信頼することは、特に個人識別情報(PII)のような機密データを扱う場合、重要な問題となり得ます。
- セルフホスト型モデル: 小規模なセルフホスト型モデルを使用することで、信頼性、コスト、パフォーマンスの面で利点が得られます。モデルを自社のインフラ内でホストすることで、入出力パラメータ、監視、セキュリティ設定をより詳細に制御できます。このアプローチにより、外部サービスへの依存に伴うリスクを軽減できます。
- 人材とインフラ: 小規模な言語モデルをホストする場合でも、専門的なスキルとインフラが必要です。これらのモデルを効果的に管理・活用するためには、社内で必要な専門知識とリソースを構築する必要があるかもしれません。Azure、Google、Amazonなどのクラウドベンダーは独自のLLM(大規模言語モデル)を開発していますが、信頼できない入力の処理や、それに伴う特定の課題に関する豊富な経験を持っていない可能性があります。
- データセキュリティ: 機密データの保護は、特にPIIを処理する際に非常に重要です。一つのアプローチとして、生データを直接公開せずにモデルをトレーニングする方法があります。例えば、実際のデータの代わりに値のロスレスハッシュを使用することで、意味のある関係性を捉えつつプライバシーを維持できます。さまざまなアプローチを試行し、データセキュリティを確保することが不可欠です。
セルフホスト型モデルの利点
- モデルパフォーマンスの向上: 小規模なモデルは、質問応答においてパフォーマンスを向上させることができます。
- コスト削減: 小規模なモデルを使用する場合、サードパーティの追加オーバーヘッドなしで計算コストを抑えることができます。
- 制御と説明責任: モデルをセルフホストすることで、自社のインフラ内で実行されるため、より詳細な制御と説明責任が可能になります。
- データセキュリティとプライバシー: セルフホストは、データ漏洩のリスクを軽減し、入出力パラメータに対するより良い制御を保証します。
- 監視とセキュリティ: セルフホスト型モデルは、より優れた監視と、ニーズに応じたセキュリティ設定の構築を可能にします。
- エンタープライズSaaSアプリケーションに最適: セルフホスト型モデルで提供可能であり、必要なパフォーマンス基準を満たす機能については、セルフホストを選択することが望ましいです。
- GPT-4の導入の可否: GPT-4の信頼性、データセキュリティ、データプライバシーの側面はまだ評価中であり、本番システムへの導入を検討する前にさらなる検証が必要です。
評価と意思決定
自社ホスト型モデルへの投資か、大規模商用言語モデルへの依存かを検討する際、リーダーは以下の要素を慎重に評価する必要があります。
- ユースケース: 現在の課題が、コスト効率と計算効率の観点から、より小規模なモデルで効果的に解決できるかどうかを評価します。
- 長期的なコストへの影響: 費用対効果が薄れる可能性のある非常に大規模なモデルを利用する場合と比較して、自社でモデルをホストすることによる潜在的なコスト削減を検討します。
- 制御と自律性: モデルのインフラと方向性に対するより大きな制御と自律性、そして特定のユースケースに合わせてモデルをカスタマイズし特化させる能力の利点を比較検討します。
- 投資と学習の機会: より小規模なモデルの構築とトレーニングには、チームのリソース、実験、ファインチューニングの面で初期投資が必要となる可能性があることを認識してください。しかし、この投資は特定のユースケースに合わせた最適化されたモデルにつながり、チームの知識と理解を深めることができます。
プロンプトエンジニアリングの理解
プロンプトエンジニアリングは、大規模言語モデル(LLM)の分野で議論の的となっています。これは、モデルから望ましい応答を引き出すために効果的なプロンプトを作成することを含みます。この概念とその影響を理解するためのいくつかの重要なポイントを以下に示します。
- プロンプトエンジニアリングという独自の役割: 専門家がプロンプトを最適化し、ニューラルネットワークを効果的に操作するにつれて、プロンプトエンジニアリングは、この分野において認知された職種または専門的な役割となる可能性があります。
- プロンプトへの工学的アプローチ: プロンプトエンジニアリングは、望ましい結果を達成するためにプロンプトを微調整し洗練させることで、予測可能な出力を生成するために科学的手法を適用することを含みます。
- 安易なプロンプト利用との区別: より深い理解や修正なしに単にプロンプトをコピー&ペーストするだけでは、プロンプトエンジニアリングとは言えません。
- プロンプトエンジニアリングの多面的な性質: プロンプトエンジニアリングには、言語スキルを超えて、プロンプトがニューラルネットワークにどのように影響し、どのような特定の情報を捉えるかについての包括的な理解が求められます。
- 決定論的プログラミングの欠如: LLMは、モデル、学習データ、および変化する振る舞いの多様性により複雑さをもたらし、プロンプトエンジニアリングを困難にしています。
- 効率性と予測可能性の潜在的な向上: LLMへの理解を深めることで、ニューラルネットワークの各部分がより効率的に活性化され、その結果、より予測可能で一貫性のある結果が得られる可能性があります。
- 階層的なエンコーディングの可視化: LLMにおけるTransformerアーキテクチャは、CNNが画像を処理する方法と同様に、異なる層で情報をエンコードします。プロンプトエンジニアは、特定の層を活性化することで、生成される出力に影響を与える方法を探求できます。
- ツール環境とLLMOps: LLMを取り巻くツール環境、すなわちLLMOps(開発、デプロイ、管理の実践を含む)に注目が集まっています。この用語はまだ進化の途上にあります。
LLMOpsとLLMのための重要なツール群
LLMOpsと大規模言語モデル(LLM)を取り巻くツール環境が注目を集めています。
プロンプト管理、迅速なデータ処理、フィードバックのラベリング、その他の重要なタスクに関して言えば、LLMの利用が拡大するにつれて、特定のツールが重要な役割を果たすと期待されています。いくつかの重要な考慮事項は以下の通りです:
- ファクターデータベース: Mineconのような検索可能なデータベースは、ニューラルネットワークにフィードバックするための関連コンテキストを取得する上で不可欠となるでしょう。関連情報にアクセスすることで、プロンプトエンジニアリングと最適化が強化されます。
- プロジェクトフレームワーク: LangChainのようなプロジェクトは、幅広い機能を実装しやすくするコーディングフレームワークを提供し、効率的なLLMの利用に貢献します。
- 統合とインフラストラクチャ: LLMは通常、より広範なプログラムの一部であり、様々なコンポーネントの効果的な統合と管理が不可欠です。望ましい結果を達成するために異なる部分を連携させることは極めて重要であり、インフラストラクチャとメモリ管理に関する専門知識が必要となる場合があります。
- モニタリングとメンテナンス: 回帰の監視、パフォーマンス評価、インフラストラクチャのキャパシティ評価といった従来の機械学習プラクティスは、LLMの文脈においても依然として重要です。最適なパフォーマンスのためには、適切なインフラストラクチャとキャパシティのサポートを確保することが不可欠です。
- プロンプトの保存: 将来の使用のためにプロンプトを保存するには、慎重な検討が必要です。データベース、キャッシング、ファイルストレージなど、様々なオプションでテキストやパラメータ化可能なテキストを保存できますが、プロンプトを意味のある方法で保存するための設計は、現在も探求が続けられている分野です。
- メモリ最適化: 大規模モデルのメモリ要件に対処することは困難な場合があります。特にメモリ要件を大幅に増加させるモデルのファインチューニング時には、GPU RAMの使用状況の管理が重要となります。特定のGPUタイプやレイテンシ要件に合わせてモデルを最適化するには、専門知識とツールサポートが必要です。
- インフラ管理ツール: 組織が自社のクラウドインフラストラクチャでLLMを運用するにつれて、インフラストラクチャの管理に関して新たな課題が生じます。GPUの自動スケーリング、稼働時間の確保、コストの最適化、特定のビジネス要件に合致するスケーラブルなシステムの構築といったタスクには、ツールサポートが必要となります。
- 開発者ワークフロー: LLMを扱う開発者ワークフローを強化するツールは不可欠です。複雑なプロセスを簡素化し、直感的なインターフェースを提供することで、導入を加速し、より幅広いユーザーがLLMを利用しやすくなります。
- コミュニティへの啓蒙: LLM分野がまだ探索段階にある中で、 TrueFoundry のような企業は、利用可能なツール、ベストプラクティス、一般的な課題への解決策についてコミュニティを教育し、導く機会があります。
📌
大規模ドメインモデルの評価
評価における人間の関与という文脈では、LLMの重要なユースケースでは「ヒューマン・イン・ザ・ループ」アプローチが一般的に採用されています。モデルのパフォーマンスを評価し、その出力を検証するためには、人間の検証が不可欠です。GPTモデルのファインチューニングプロセスにおいても、人間の関与は重要な役割を果たしました。
ある程度の誤差が許容される、重要度の低いユースケースでは、より大きなモデルを使用して、小さなモデルの応答を評価する費用対効果の高いアプローチがあります。小さなモデルによって生成された複数の応答を、より大きなモデルが比較・評価できるため、パフォーマンスを測定するための指標を確立できます。このアプローチにはある程度のコストがかかるものの、人間の労力のみに頼るよりも一般的に経済的です。
絶えず進化する世界で最新情報を把握する
LLMと機械学習の絶え間なく進化する世界で最新情報を把握し続けることは、時に困難です。ここでは、情報を入手し、知識を深めるための効果的なアプローチをいくつかご紹介します。
- AI解説動画: YouTubeのようなプラットフォームでAI解説動画を視聴することは、論文を深く読み込むことなく、主要な発見や結果を把握するのに便利な方法です。これらの動画は複雑な概念を要約し、時間と労力を節約します。
- オンラインコミュニティ: Hacker Newsや機械学習関連のサブレディットなどのオンラインコミュニティに参加することで、この分野における新たなトレンドや技術に関する洞察、議論、最新情報を得ることができます。
- 実践的な経験: LLMの実践的な応用へ積極的に参加することは、その可能性と限界をより深く理解するために不可欠です。実験し、その能力を探求することで、知識を深めることができます。
- APIのアクセシビリティ: 過去には機械学習に複雑な数学の概念を再学習する必要がありましたが、今日の状況はよりAPI主導です。構築済みのAPIとライブラリにより、開発者は高度な数学を再学習することなく、実験を開始し、アプリケーションを構築できます。
- プログラミングスキル: 特定のライブラリメソッドを学習し、環境問題を解決することは、LLMを効果的に実装するための貴重なスキルです。
True ML Talksシリーズの以前のブログもぜひお読みください。
TrueMLの YouTubeシリーズ を引き続きご覧になり、TrueMLの ブログシリーズ。
TrueFoundry Kubernetes上で動作するMLデプロイメントPaaSです。開発者のワークフローを加速させ、モデルのテストとデプロイにおいて完全な柔軟性を提供しつつ、インフラチームには完全なセキュリティと制御を保証します。当社のプラットフォームを通じて、機械学習チームは デプロイおよび監視を 15分で、100%の信頼性、スケーラビリティ、そして数秒でのロールバック機能を備え、コストを削減し、モデルをより迅速に本番環境にリリースすることを可能にし、真のビジネス価値の実現を促進します。
TrueFoundry AI Gateway delivers ~3–4 ms latency, handles 350+ RPS on 1 vCPU, scales horizontally with ease, and is production-ready, while LiteLLM suffers from high latency, struggles beyond moderate RPS, lacks built-in scaling, and is best for light or prototype workloads.















.webp)
.webp)


.png)

.png)














