True ML Talks #7 - エッジにおける機械学習プラットフォーム

Built for Speed: ~10ms Latency, Even Under Load
Blazingly fast way to build, track and deploy your models!
- Handles 350+ RPS on just 1 vCPU — no tuning needed
- Production-ready with full enterprise support
True ML Talksの新しいエピソードをお届けします。今回は、深く掘り下げていきます Edge MLプラットフォームについて、お話を伺います ラフル・クルハリ氏。
Edgeの共同創設者でありデータサイエンス責任者であるラフル・クルハリ氏をご紹介します。AIと機械学習における確かな経歴を持つラフル氏は、同社のビジョンを実行し、AI戦略を構築する責任を担っています。彼は、Edgeの人材獲得、人材流動性、社内人材マーケットプレイス製品を支える最先端のAIシステムを開発する専門家チームを率いています。彼の専門知識と経験は、業界にとって貴重な財産であり、データサイエンスとAIの最新動向に関心のあるすべての人にとって優れた情報源となるでしょう。
📌
Liming氏との対談では、以下の側面について取り上げます。
- EdgeにおけるMLのユースケース
- Edgeの機械学習チーム
- 機械学習スタックにおけるイノベーション
- 量子化 VS 蒸留
- 機械学習の運用における課題
- MLOpsツールの選択
全編はこちらからご覧ください:
EdgeにおけるMLのユースケース
- 自然言語処理(NLP): Edgeが、求人情報や履歴書をより深く理解し、適切な候補者や潜在的な候補者を求人に対して推薦するために使用しています。
- ナレッジグラフ: Edgeが、社内従業員向けのパーソナライズされた求人情報と、求人に対する適切な候補者を見つけるための検索・レコメンデーションシステムを提供するために活用されています。
- 強化学習: Edgeが将来的に活用できる可能性のあるユースケースです。ユーザーが今日の行動と業界で起きている変革に基づいて意思決定できるようになり、業界のトレンドや時間の経過による変化を考慮した、よりダイナミックなアプローチへと移行します。
Edgeの機械学習チーム
Edgeのチーム体制は5つのサブカテゴリに分かれています。各部門は、AI製品開発ライフサイクルの特定の側面を担当しています。これら5つの部門は以下の通りです。
- 応用科学者/研究科学者/ギガ科学者: このサブカテゴリは、問題提起を理解し、実験、データクレンジング、データ処理、デプロイメントを含む完全なエンドツーエンドソリューションを構築する責任を負います。彼らは他のチームメンバーと密接に連携し、機械学習モデルの開発とデプロイを行います。
- データアナリスト: この部門は、大規模で複雑なデータセットの収集、分析、解釈を担当します。彼らはデータサイエンティストと密接に連携し、使用されるデータが高品質であり、解決しようとしている問題に関連していることを保証します。
- 機械学習エンジニア: 機械学習エンジニアは、トレーニング、実験、デプロイメント、モニタリングの一部としてツールを導入することで、機械学習パイプラインの一環としてデータサイエンティストを支援します。彼らは応用科学者と密接に連携し、モデルを本番環境にデプロイします。
- AIプロダクトマネージャー: AIプロダクトマネージャーは、AI製品の強化と構築を担当します。彼らは、チーム内のステークホルダーからの問題提起をデータサイエンティストや他のチームメンバーに伝えます。また、他のチームメンバーと密接に連携し、AI製品が会社のニーズを満たし、会社の目標に沿っていることを保証します。
- ドメインエキスパート: この部門には、人事、財務、営業などの特定のドメインの専門知識を持つ人々が含まれます。彼らはデータサイエンティストや機械学習エンジニアと密接に連携し、AI製品が特定のドメインに関連しており、会社に価値を提供していることを保証します。
📌
AIプロダクトマネージャーの役割:
AIプロダクトマネージャーは、製品チームやカスタマーサクセスチームと連携してビジネス目標を理解することで、データサイエンスチームとMLエンジニアリングチーム間のビジネス上のギャップを埋めます。彼らは、データサイエンティスト、研究科学者、MLエンジニアリングチームが参加する議論を組織し、各チームメンバーに必要な貢献を特定します。AIプロダクトマネージャーは、各チームの貢献に対するニーズとガイドラインを伝え、全員が連携していることを確認します。彼らはプロジェクト全体を通して関与し続け、ビジネス目標が達成され、全員が同じ目標に向かって取り組んでいることを保証します。
機械学習スタックにおけるイノベーション
EdgeのMLチームは、機械学習ワークフローにおけるデータ不足という大きな課題を認識しています。これに対処するため、彼らはデータ拡張のための様々なツール、プロセス、アルゴリズムを導入しました。彼らは、これらのツールやアルゴリズムを使用して作成されたノイズの多いデータでモデルをトレーニングし、その後大量のラベル付きデータでファインチューニングすることを可能にする、教師・生徒アルゴリズムなどの機能を開発しました。
データ拡張に利用する重要なツールの一つがEvidently AIです。これは、データドリフトやターゲットドリフトを特定し、生成されたノイズの多いデータがラベル付けされたデータや目標データと一致するようにするのに役立ちます。このツールにより、カテゴリカル特徴量と連続特徴量が整合し、正確なモデルの作成に役立つことを保証できます。
チームは機械学習パイプラインにおいても革新を遂げてきました。時間の経過とともに成熟してきましたが、構築当初は、エンドツーエンドのタスクすべてを解決できる単一のツールや製品はなく、それらを相互に統合することが課題であると認識しました。彼らは、モデルのレジストリと管理のために、Neptune、Comet、MLflowなどのさまざまなツールを活用しています。
デプロイの観点からは、スケーラビリティ、レイテンシ、コストに焦点を当ててきました。Kubernetesデプロイポッドへのデプロイには、TF servingや量子化のためのOnyxなどのツールを使用しています。彼らは機械学習パイプライン全体で複数のツールを使用しており、これをイノベーションと見なしています。最先端の作業を構築しながらも財政を管理できており、より高価になる可能性のある新しいツールに移行する必要性を感じていません。しかし、将来役立つ可能性のある新しいテクノロジーやツールに常に目を光らせるよう、チームを奨励しています。
量子化は蒸留よりも効果的:モデルレイテンシの最適化
モデルレイテンシの最適化は機械学習分野における重要な課題であり、これを解決するために量子化、モデルプルーニング、蒸留などの手法が検討されてきました。Edgeのチームによる最近のレポートによると、モデルレイテンシの削減においては、量子化が蒸留よりも効果的であるとされています。
チームはDistilBERT、RoBERTa、ALBERTなどの異なるモデルで実験を行い、最終的に求人情報と履歴書の解釈においてより優れたパフォーマンスを発揮したALBERTを選択しました。彼らはALBERTとRoBERTaの両方で蒸留も実施しました。
彼らの実験から、量子化が目覚ましい結果をもたらし、CPU上でのモデルレイテンシを約1.2秒から約200ミリ秒に削減したことがわかりました。チームは、GPUのみでトレーニングしたモデルにOnyxとHugging Faceの量子化を利用しました。
適切なモデルを選択する際、チームはレイテンシ、モデルサイズ、同時実行性、CPU使用率、メモリ使用率など、さまざまな要素を考慮しました。彼らはデータサイエンティストと協力し、量子化プロセスのフレームワークを提供してもらい、機械学習エンジニアリングチームが実験を実施し、結果に基づいて最適な選択肢を選びました。
量子化は精度に1%の影響を与えましたが、再現率には影響しませんでした。チームは、モデルレイテンシを削減するためのシンプルかつ効果的な手法であるため、誰もが量子化を試すべきだと強調しています。
データ取得にかかる時間は、量子化前のモデルでは約1200ミリ秒でした。しかし、量子化を行うと、それが約200ミリ秒に短縮されました。
機械学習の運用化における課題
課題:
- トレーニングに利用できるデータが限られている: 検索、レコメンデーションエンジン、分類問題、目的志向型または目標志向型機械学習といったユースケースでは、利用可能なデータが少ないため、作業が困難になることがあります。少ないデータを管理しつつ、最良の結果を達成する方法を見つけることが不可欠です。
- MLツールの導入: MLflowのようなツールの導入は、研究科学者やデータ科学者がそのツールの重要性や、それがどのように役立つかを理解していない可能性があるため、困難です。MLチームは、彼らを教育し、そのようなツールを使用することの利点について認識を高める努力をすべきです。
解決策:
- 記述的または処方的インサイトの開発: MLチームは、意思決定に役立つ記述的または処方的インサイトを提供するツールの開発に注力すべきです。これにより、時間とコストがかかる研究科学者の専門知識への依存を減らすことができます。
- データ、アルゴリズム、人間の専門知識の連携: 最高の成果を達成し、適切な戦略を策定するためには、データ、アルゴリズム、人間の専門知識を組み合わせて活用する必要があります。
- 実行すべき最も重要な実験を見極める: 限られたインフラでは、機械学習には多くのハイパーパラメータが存在するため、実行すべき最適な実験を特定することが不可欠です。MLチームは、最高の成果を達成するために、実行すべき最も重要な実験を特定し、ハイパーパラメータを最適化するプロセスを開発することに注力すべきです。
MLOpsツール:全行程を網羅するための主要ツール
MLOpsのトレーニングとデプロイメントのためのインフラツール
MLOpsにおいて、インフラは重要な要素です。機械学習のトレーニングとデプロイメントに必要な処理能力をサポートするためには、信頼性の高いインフラが不可欠です。E2E NetworksのようなGPUプロバイダーを利用することで、インドで手頃な価格のGPUを利用できます。
MLOpsのためのモデルトレーニングおよび構築ツール
モデルのトレーニングと構築には、Gitと統合されたNeptune、Comet ML、TrueFoundryなどのツールを使用することで、再現性と規制遵守を確保できます。Hugging Face、TensorFlow、PyTorchもモデル構築に推奨されます。CatBoostは、回帰問題や決定木に適した選択肢です。
MLOpsのためのデプロイメントツール
デプロイメントに関しては、ONNXが推奨ツールであり、Max.io、Banana.dev、Infrrdを使用してサーバーレスアプローチを取ることも可能です。開発段階では、Great Expectations、可視化のためのStreamlit、データドリフトと分析のためのAlibi DetectやEvidently AIなどのカスタムツールまたはサードパーティツールを通じてデータ品質を確保できます。ただし、本番環境では、データ品質、リネージ、その他の種類の分析のために追加のツールが必要になる場合があります。
TrueMLシリーズの以前のブログを読む
TrueMLを視聴し続けてください YouTubeシリーズ そしてすべてのTrueML ブログシリーズ。
TrueFoundry は、Kubernetes上のMLデプロイメントPaaSであり、開発者のワークフローを加速させるとともに、モデルのテストとデプロイにおいて完全な柔軟性を与え、インフラチームには完全なセキュリティと制御を保証します。当社のプラットフォームを通じて、機械学習チームは デプロイと監視 モデルを15分でデプロイし、100%の信頼性、スケーラビリティ、数秒でのロールバック機能を備えることで、コストを削減し、モデルをより迅速に本番環境にリリースできるようになり、真のビジネス価値の実現を可能にします。
TrueFoundry AI Gateway delivers ~3–4 ms latency, handles 350+ RPS on 1 vCPU, scales horizontally with ease, and is production-ready, while LiteLLM suffers from high latency, struggles beyond moderate RPS, lacks built-in scaling, and is best for light or prototype workloads.















.webp)
.webp)


.png)

.png)














