True ML Talks #6 - 機械学習プラットフォーム @ °Nomad Health

Built for Speed: ~10ms Latency, Even Under Load
Blazingly fast way to build, track and deploy your models!
- Handles 350+ RPS on just 1 vCPU — no tuning needed
- Production-ready with full enterprise support
True ML Talksの新しいエピソードをお届けします。今回は、深く掘り下げていきます。 °Nomad Healthの MLプラットフォームについて、お話を伺います。 Liming Zhao氏。
Liming Zhao氏は、ヘルスケア人材派遣業界に革命を起こしているテクノロジー企業である°Nomad HealthのCTOです。特にパンデミックに直面し、臨床医が不足している状況において、°Nomad Healthは、医療従事者が最も緊急かつ魅力的な患者ケアのニーズを満たすための一時的な職務を見つけられるマーケットプレイスを提供することを目指しています。
📌
Liming氏との対談では、以下の点について触れます。
- °Nomad HealthにおけるMLのユースケース
- °Nomad Healthの機械学習チーム
- 機械学習モデルのデプロイ
- カスタムFeature Storeソリューションの構築
- MLOpsツールの選択
- クラウドコストの管理
全エピソードはこちらからご覧ください。
°Nomad HealthにおけるMLのユースケース
- 予測モデリング: °Nomad Healthは、AIとMLを業務に、特に予測モデリングの分野に組み込んでいます。これは、臨床医が最も希少なリソースであることを踏まえ、業務の優先順位付けに役立っています。°Nomad Healthはこれに多大な投資を行い、機械学習の重要な機能と位置付けています。
- レコメンデーションシステム: °Nomad Healthは、グラフベースのモデリングを使用して、臨床医に魅力的な求人を推薦しています。これをランキングやアウトリーチメールに組み込むことで、臨床医が利用可能なすべての求人を探す時間がなくても、最も適切な求人が提示されるようにしています。
- 大規模言語モデル: °Nomad Healthは、GPT-3のようなLLM(大規模言語モデル)を使用して求人情報を抽出し、補強しています。このモデルを使って求人要件を標準化し、詳細度や明確さが異なる可能性のあるテキストの塊から意味のある情報を抽出しています。°Nomad Healthは履歴書にLLMを使用することも検討していますが、臨床スタッフの履歴書の完成度が様々であるため、これは困難な分野です。
📌
臨床スタッフの履歴書におけるLLM:
°Nomad Healthは、求人情報と履歴書に大規模言語モデル(LLM)を使用することを検討しています。同社はGPT-3のような堅牢なモデルでより大きな成功を収めています。しかし、臨床スタッフの履歴書にLLMを使用することは、特定の資格や免許が必要なため課題があります。°Nomad Healthは、プラットフォームを使用して包括的なデジタル履歴書資格セットの構築に取り組んでおり、臨床医と医療施設の両方にとってプロセスを簡素化することを目指しています。
°Nomad Healthの機械学習チーム
°Nomad Healthのデータサイエンスチームは比較的小規模で、マネージャー、データサイエンティスト、データアナリスト、データエンジニアを含む9名のチームメンバーで構成されています。残りの5名は機械学習エンジニアで、そのうち2名はインフラ開発とMLOpsに注力し、残りの3名はモデルの構築、テスト、デプロイに注力しています。
彼らは他の業界や参照問題から既製のソリューションを活用し、特定のユースケースに適応させ、データの収集、解析、標準化に多大な投資をしています。°Nomadのチーム構造と協力体制により、全員が協力して問題解決に取り組むことで、迅速かつ効率的に業務を進めることができます。データ駆動型のアプローチと、才能豊かで多様なチームのおかげで、彼らはニーズとボトルネックから学び、MLOpsで大きな成功を収めています。
機械学習モデルのデプロイ
°Nomad Healthは、技術インフラの大部分がGoogle Cloud Platform (GCP)にあったため、Vertex AIに多大な投資をしましたが、より複雑なビジネスニーズと高いデプロイ頻度に直面するにつれて、本番サービスのエンドポイントをVertex AIからGoogle Kubernetes Engine (GKE)クラスターに移行し始めました。これにより、チームはデプロイとCI/CDパイプラインに対して、より高い柔軟性、制御性、スケーラビリティを持つことができました。
°Nomad Healthの機械学習チームは、モデルトレーニングにVertex AIを使用しており、Vertex AIの豊富なライブラリ、インターフェース、ツールを活用して、物事を迅速に試行し、成功を監視し、有望なシグナルを理解しています。チームはML Flowも評価中ですが、現在スタックにDataBricksは使用していません。
全体として、°Nomad Healthのデプロイ戦略の進化は、実用的な複雑さの認識と、隣接するエンジニアリングチームのGKEでのデプロイ成功から生まれました。この戦略により、機械学習チームは既存のプラクティスとインフラを活用しつつ、デプロイに対する制御を維持することができました。
カスタム特徴量ストアソリューションの構築
°Nomad Healthは、大規模なデータセットを処理し、より一貫性のある特徴量ストアを構築するために、カスタムの特徴量エンジニアリングソリューションを構築しました。同社は、異なる機械学習プロジェクトが、臨床医の求人閲覧履歴、応募結果、資格や好みに関する情報を含む、同じデータセットを共有する必要があることに気づきました。彼らは特徴量ストアを正式化し、生データを取り込み、基本的な変換を行い、ビジネスに合わせた形でデータを格納するチームを編成しました。迅速な可視化への移行を可能にするため、BI部門は変換されたデータを使用できました。データサイエンスチームも、特徴量のサブセットを迅速に抽出し、特徴量ストアに呼び出すことができました。
°Nomad Healthは、オープンソースソリューションのFeastを使用して、異なるモデルの特徴量を抽出し保存しており、モデリングからのフィードバックは特徴量ストアに戻されます。同社はモデリングにはVertex AIを活用し、デプロイには別のパイプラインを使用しています。MLプラットフォーム全体の状況において最も革新的なソリューションの1つは、生データを一貫したエンティティ、イベント、ディメンションに変換することであり、これによりBIチームとデータサイエンスチームはそれぞれデータ分析と予測分析に利用できます。この生データの変換により、°Nomad Healthは、応募や施設からのオファーの提示と強く相関する信頼性の高いシグナルを作成することができました。
当初はVertex AIインフラストラクチャから始めましたが、最終的には自社でオープンソースを実装した特徴量ストアに移行しました。独自のデータ、つまり独自の形式とデータセットを取得することが、実は鍵となります。
MLOpsツールの選択
早期の段階では、企業はVertex AIやSageMakerのように、必要な機能のほとんどを提供するツールやプラットフォームに投資すべきです。そうすることで、まずビジネス価値の実現に集中できます。企業が堅牢なエンジニアリングチームやデータサイエンスチームを構築したら、プラットフォームから本番デプロイメントを切り離し、隣接するサービスを追加できます。企業がたどる道のりは、ツールのフルセットを推奨することよりも重要であり、現時点で合理的に機能するものを選び、そこから反復していくのが常に最善です。
データサイエンスチームがたった2人でスタートし、最初に独自のインフラをすべて構築するとしたら、それは何のためでしょうか?その立派なエンジンと超強力なインフラが実際に何をもたらすのか、何を証明できたというのでしょうか?
クラウドコストの管理
- 監視・アラートツールへの投資: TrueFoundryなどのツールを使用してインフラのパフォーマンスを監視し、コスト変動の原因となるインスタンスを特定することを検討してください。これらのツールは、問題を早期に検出し、迅速に是正措置を講じるのに役立ちます。
- 手動での運用に頼る: Colabノートブックにパイプされたログやシグナルを監視するなど、手動での運用によってコスト変動の原因となるインスタンスを特定します。これらのインスタンスを週ごとまたは隔週で調査し、必要に応じて特定のトレーニングモデルを再起動または終了させます。
- 予算を設定し、リアルタイムレポートを受け取る: クラウドコストの予算を設定し、クラウドプロバイダーからリアルタイムレポートを受け取ることで、予算を超過しないようにします。これにより、コストを管理し、予期せぬ出費を防ぐことができます。
- より高度なソリューションを導入する: インフラが拡大するにつれて、コストを効果的に管理するために、より高度なソリューションの導入を検討してください。これには、自動化ツールの使用や、クラウドコストを管理するための専任担当者の雇用が含まれる場合があります。
- コストとパフォーマンスのバランスを取る: 望ましい結果を達成するためには、コストとパフォーマンスのバランスを取ることが不可欠です。機械学習ワークロードを最適化し、パフォーマンス要件を満たしつつ、費用対効果が高いことを確認することを検討してください。
Liming Zhao氏からの追加考察
MLOps:自社開発か購入か
- MLOpsの実装において、マネージドサービスと自社インフラのどちらを選択するかは極めて重要です。組織が成熟するにつれて、ハイブリッドアプローチが推奨されます。
- コストとリソースの評価には、長期的な成果とコスト間のトレードオフを考慮する必要があります。コストを注意深く監視し、安定した製品のために、高性能なコンポーネントを独自のインフラに移行してください。
- 信頼性の低いモデルについては、コスト変動を許容しつつ、コスト帰属のためにタグを使用し、効果的なコスト最適化のために価格変動を監視してください。
変化するビジネスニーズへの適応の重要性
パンデミック中、°Nomad Healthは殺到する求人応募に対応するため、最も可能性の高いオファーを優先して提示する必要がありました。しかし、人々が求人応募に躊躇するようになったため、候補者により多くの選択肢を示すようにレコメンデーションエンジンを調整する必要がありました。
振り返ってみると、°Nomad Healthが当初、不確実なビジネスニーズを持つ小規模チームにとって、スピードと自律性に焦点を当てたのは正しい判断でした。しかし、チームとビジネスニーズが進化するにつれて、同社は精度と効率性に焦点を移す必要がありました。
この取り組みは、機械学習の意思決定において、変化するビジネス状況を考慮することの重要性を示しています。俊敏性を持ち、適応することで、企業は変化するビジネス環境に合わせて進化できる、情報に基づいた意思決定を下すことができます。
このブログをお楽しみいただけたなら、TrueMLシリーズのこれまでのブログもぜひご覧ください。
TrueMLの YouTubeシリーズ を視聴し、TrueMLの ブログシリーズを読み続けてください。
TrueFoundry は、Kubernetes上で動作するMLデプロイメントPaaSです。開発者のワークフローを加速させ、モデルのテストとデプロイにおいて完全な柔軟性を提供するとともに、インフラチームには完全なセキュリティと制御を保証します。当社のプラットフォームを通じて、機械学習チームは モデルをデプロイし、監視する ことを、15分で、100%の信頼性、スケーラビリティ、数秒でのロールバック機能とともに実現します。これにより、コストを削減し、モデルをより迅速に本番環境にリリースできるようになり、真のビジネス価値の実現を可能にします。
TrueFoundry AI Gateway delivers ~3–4 ms latency, handles 350+ RPS on 1 vCPU, scales horizontally with ease, and is production-ready, while LiteLLM suffers from high latency, struggles beyond moderate RPS, lacks built-in scaling, and is best for light or prototype workloads.















.webp)
.webp)


.png)

.png)














