ドリフトトラッキングのガイド

Built for Speed: ~10ms Latency, Even Under Load
Blazingly fast way to build, track and deploy your models!
- Handles 350+ RPS on just 1 vCPU — no tuning needed
- Production-ready with full enterprise support
機械学習は、ビジネスのほぼすべての側面に大きな影響を与えています。しかし、多くの場合、デプロイされたモデルの精度は時間とともに低下し始め、顧客体験を損ない、ビジネスに悪影響を及ぼします。では、なぜこのモデルの精度は低下するのでしょうか?それには複数の理由が考えられます。例えば、
- スパム検出モデルは、しばらくするとスパムメールを正確に検出できなくなります。これは、「スパマー」がモデルにとって「未知」の単語やメールパターンを更新するためです。
- ショッピングのレコメンデーションモデルは、新型コロナウイルス感染症の発生のような主要な世界的イベントによって大きく影響を受ける可能性があります。これにより顧客の嗜好が変化するためです。
- 顧客離反予測モデルは、顧客の行動や消費パターンが時間とともにゆっくりと変化するため、時間とともに劣化します。

では、モデルのパフォーマンスが時間とともに低下しないようにするにはどうすればよいでしょうか?精度低下を避けるために、いつモデルを再学習させるべきかを知るにはどうすればよいでしょうか?
その答えは「ドリフト」です。「ドリフト」をタイムリーかつ「正確に」検出し、それに応じて適切な措置を講じる必要があります。
モデルドリフトとは?
モデルドリフトとは、時間の経過とともにデータの分布が変化することを指します。機械学習の文脈では、通常、特定のベースラインからのモデルの特徴量、予測、または実測値におけるドリフトを指します。
ドリフト追跡には、コルモゴロフ-スミルノフ統計量、ワッサースタイン距離、カルバック・ライブラー情報量など、いくつかの手法が用いられます。これらの指標は、ターゲットシステムが継続的に進化し、モデルが精度を維持するためにリアルタイムで適応する必要があるオンライン学習のシナリオでよく使用されます。例えば、映画のレコメンデーションモデルは、顧客の行動が時間とともに変化するにつれてドリフトする可能性があり、顧客離反予測モデルは、経済状況の変化とともにドリフトする可能性があります。
モデルドリフトの種類:
- データドリフト: これは、時間の経過とともに異なる特徴量の分布が変化したり、異なる特徴量間の関係が変化したりすることを指します。これは、入力自体が変化することによって発生する可能性があります。例えば、1年間のデータで学習された信用度を判断するモデルの場合、経済の変化や景気後退により平均所得がドリフトする可能性があります。
- コンセプトドリフトコンセプトドリフトとは、モデルの正解値におけるドリフトを指します。これは、モデルが使用されている実際の値の分布に変化があることを示します。コンセプトドリフトはモデル自体には依存せず、正解値のみに依存します。実際の値のドリフトは、特徴量と実際の値の関係に変化がある可能性を示しており(トレーニングデータセットや以前の期間と比較した場合)、モデルの再学習の必要性を示唆しています。
- 予測ドリフト予測ドリフトとは、トレーニングデータの予測値や過去の期間のデータと比較した場合の、予測値の分布におけるドリフトを指します。予測はモデルと特徴量の関数であり、モデルが変更されていないため、予測ドリフトは通常、根底にあるデータドリフトを示します。予測ドリフトは、データドリフトとモデル精度の低下を検出するのに役立ちます。

ドリフト監視のさまざまな方法
統計的手法
統計的手法は、与えられた分布と参照分布との間の差異を測定するために使用されます。特徴量または実際の値におけるドリフトを計算するために、距離ベースの指標やダイバージェンスがよく用いられます。統計的手法は、外れ値や入力分布の変化を検出するのに優れており、計算や解釈が非常に簡単です。これらは異なる特徴量間の相関の変化を考慮しないため、入力特徴量が独立している場合にのみ、ドリフトの全体像を説明できます。
ドリフト計算によく用いられる距離ベースの指標をいくつかご紹介します。
- コルモゴロフ-スミルノフ統計量:
これは、2つの累積分布関数間の最大差を測定します。データに特定の分布を仮定しないノンパラメトリック検定です。データの分布の変化を検出する能力があるため、ドリフト検出で広く使用されています。 - ワッサースタイン距離:
これはアースムーバー距離(EMD)としても知られています。ある分布を別の分布に変換するために必要な「作業量」を測定します。他の距離指標では捉えられないような、データの分布における微妙な変化を捉える能力があります。
ワッサースタイン距離は、高次元データやノイズの多いデータを扱える能力があるため、近年人気を集めています。 - カルバック・ライブラー情報量:
これは2つの確率分布間の差異を測る指標であり、相対エントロピーまたは情報ダイバージェンスとも呼ばれます。非対称な指標であり、分布Aから分布BへのKL情報量と、分布Bから分布AへのKL情報量は等しくないことを意味します。
これはドリフト追跡で最も広く使用されている指標の1つですが、追跡対象となる特徴量や予測のカーディナリティは非常に高くあるべきではありません。 - PSI(Population Stability Index:個体群安定性指標):
PSIは、ある集団が時間とともに、または集団の2つの異なるサンプル間で、どの程度変化したかを単一の数値で測定します。これは、2つの分布をバケットに分け、各バケット内の項目の割合を比較することで行われ、その結果として、集団がどの程度異なるかを理解するために使用できる単一の数値が得られます。PSIの結果の一般的な解釈は次のとおりです。
- PSI < 0.1: 顕著な集団変化なし
- PSI < 0.2: 中程度の集団変化
- PSI >= 0.2: 顕著な集団変化
したがって、モデルの精度に影響を与える特徴量のドリフト値にモニターを設定し、それに基づいて適切なアクションを取ることができます。
モデルレベルのドリフト(多変量ドリフト検出)
- 多変量ドリフト検出は、複数の変数や特徴量における変化やドリフトをまとめて検出するのに役立ちます。単一の変数における変化の検出のみに焦点を当てる単変量ドリフト検出とは異なり、多変量ドリフト検出は、複数の特徴量間の関係を考慮し、すべての特徴量が互いに独立しているとは仮定しません。
- このように、多変量ドリフト検出手法は、データの分布の変化、変数間の関係性の変化、および変数間の機能的関係性の変化を検出できます。これらの手法は、ある変数の変化が他の変数の挙動に大きな影響を与える可能性がある複雑なシステムにおいて特に有用です。
そのため、多変量ドリフトは、推論データの変化をユーザーがより深く理解するのに役立ちます。また、個々の特徴量を個別に追跡するのと比較して、追跡する必要があるメトリクスが1つだけで済むため、監視も容易です。しかし同時に、計算負荷が高く、より単純なシステムには過剰な場合もあります。 - 多変量ドリフト検出アルゴリズムは通常、ドリフトを計算するために機械学習モデルに依存します。そのため、これらのアルゴリズムは次のように分類できます。
教師あり手法:
これらは通常、データポイントがベースラインデータフレームからのものかどうかを推測するために、二値分類モデルを訓練することに依存します。モデルの精度が高いほど、ドリフトが大きいことを示します。
どの特徴量がドリフトしたかを特定するには、この二値分類モデルの特徴量重要度が使用されます。
教師なし学習手法:
主な手法は以下の通りです。
クラスタリング:K平均法、DBSCAN、またはその他のクラスタリングアルゴリズムを使用して、参照データセットと現在のデータセット内のクラスターを見つけ、その後、クラスター間の違いを見つけて、データがドリフトしたかどうかを判断します。
ガウス混合モデル(GMM):GMMは、データをガウス分布の混合として表現します。GMMは、現在のデータセットのガウス分布のパラメータを参照データセットと比較することで、多変量ドリフトを検出するために使用できます。
主成分分析(PCA):PCAを使用してデータセットの次元を削減し、その後、各主成分を独立した特徴量と見なし、通常の一変量ドリフト検出アルゴリズムを適用します。
まとめると、多変量ドリフト検出は複雑なシステムで役立ち、監視すべきKPIが1つだけで済むため、監視も容易です。

結論:
本番環境にデプロイされたモデルのパフォーマンスは、最終的に低下します。この低下にかかる時間は、ユースケースによって異なります。場合によっては、モデルが1年間ドリフトしないこともあれば、1時間ごとに再訓練が必要なモデルもあります。そのため、この劣化の原因を理解し、それを検出することが極めて重要になります。ここで、「ドリフトの早期検出」が役立ちます。
結論として、機械学習モデルから最高の価値を生み出すためには、本番環境のモデルには、適切なドリフト追跡またはドリフト監視メカニズムと再訓練パイプラインが設定されているべきです!
TrueFoundry は、Kubernetes上で動作するMLデプロイメントPaaSであり、開発者のワークフローを加速させるとともに、モデルのテストとデプロイにおいて完全な柔軟性を提供し、インフラチームには完全なセキュリティと制御を保証します。当社のプラットフォームを通じて、機械学習チームは デプロイおよび監視 モデルを15分で、100%の信頼性、スケーラビリティ、そして数秒でのロールバック機能とともに実現します。これにより、コストを削減し、モデルをより迅速に本番環境にリリースできるようになり、真のビジネス価値の実現を可能にします。
TrueFoundry AI Gateway delivers ~3–4 ms latency, handles 350+ RPS on 1 vCPU, scales horizontally with ease, and is production-ready, while LiteLLM suffers from high latency, struggles beyond moderate RPS, lacks built-in scaling, and is best for light or prototype workloads.


















.webp)
.webp)


.png)

.png)














