マハラノビス距離は、ある点と別の点の間の距離を表す尺度である。確率分布1936 年にP. C. Mahalanobisによって導入されました。[ 1 ] Mahalanobis 距離の数学的な詳細は、1936 年にJournal of The Asiatic Society of Bengalに初めて掲載されました。 [ 2 ] Mahalanobis の定義は、測定に基づいて頭蓋骨の類似性を特定する問題によって促されました(頭蓋骨の類似性に関する最も初期の研究は 1922 年に行われ、その後の研究は 1927 年に行われました)。[ 3 ] [ 4 ] RC Bose は後に、均等分散の仮定の下で Mahalanobis 距離の標本分布を取得しました。[ 5 ]
これは標準スコアの二乗の多変量一般化である。標準偏差何つ分離れていますかは平均からこの距離はゼロです平均でそして成長するにつれて各主成分軸に沿って平均値から離れていきます。これらの軸をそれぞれ単位分散になるように再スケーリングし、無相関になるように白色化すると、マハラノビス距離は変換された空間における標準ユークリッド距離に相当します。したがって、マハラノビス距離は無次元でスケール不変であり、データセットの相関関係を考慮に入れています。
確率分布が与えられた場合の上平均および正半定値共分散行列点のマハラノビス距離から[ 6 ]2つの点が与えられた場合そしてで、それら間のマハラノビス距離ははつまり。
以来は正半定値なので、したがって、平方根は常に定義される。
多変量観測の外れ値となる理由を説明するのに役立つ、二乗マハラノビス距離の有用な分解を見つけることができ、外れ値を特定するためのグラフィカルツールも提供できます。[ 7 ]
スペクトル定理により、分解すると次のようになる本当の行列。1 つの選択肢は、の対称平方根です。これは標準偏差行列です。これにより、同等の定義が得られます。どこはユークリッドノルムです。つまり、マハラノビス距離は、ホワイトニング変換後のユークリッド距離です。
の存在スペクトル定理によって保証されているが、一意ではない。異なる選択肢には、理論的および実際的な利点が異なる。[ 8 ]
実際には、分布は通常、未知の基礎分布からのIIDサンプルのセットからのサンプル分布なので、は標本平均であり、これはサンプルの共分散行列です。
サンプルのアフィン空間が全体ではない場合共分散行列は正定値行列ではないため、上記の定義は機能しません。ただし、一般に、マハラノビス距離は、サンプルのアフィンスパンの任意のフルランクアフィン変換の下で保存されます。したがって、アフィンスパンがサンプルの全体ではない場合サンプルはまず直交投影され、、 どこはサンプルのアフィンスパンの次元であり、その後、マハラノビス距離は通常どおり計算できます。
N次元ユークリッド空間におけるテスト点が、ある集合に属する確率を推定する問題を考えてみましょう。ここで、サンプル点はすでにその集合に属していることが分かっています。まず、サンプル点の重心、つまり質量中心を求めます。直感的に、問題の点がこの質量中心に近いほど、その点が集合に属する可能性が高くなります。
しかし、集合が広い範囲に分布しているのか狭い範囲に分布しているのかを知る必要もあります。そうすることで、中心からの特定の距離が注目に値するかどうかを判断できるからです。最も単純な方法は、サンプル点と重心との距離の標準偏差を推定することです。テスト点と重心との距離が1標準偏差未満であれば、テスト点が集合に属する可能性が非常に高いと結論づけることができます。距離が遠くなるほど、テスト点が集合に属すると分類されるべきではない可能性が高くなります。
この直感的なアプローチは、テストポイントとセット間の正規化された距離を定義することによって定量化できます。そこにはこう書かれている。これを正規分布に代入することで、テストポイントが集合に属する確率を導き出すことができます。
上記のアプローチの欠点は、サンプル点が重心を中心に球状に分布していると仮定していた点である。もし分布が明らかに非球形、例えば楕円形であれば、テスト点が集合に属する確率は、重心からの距離だけでなく、方向にも依存すると予想される。楕円体の軸が短い方向ではテスト点は重心に近い位置にあり、軸が長い方向ではテスト点は重心から遠い位置にある可能性がある。
これを数学的に説明すると、サンプルの共分散行列を作成することで、集合の確率分布を最もよく表す楕円体を推定できます。マハラノビス距離は、テスト点から重心までの距離を、テスト点の方向における楕円体の幅で割った値です。
任意の次元の正規分布の場合、観測値の確率密度はマハラノビス距離によって一意に決定される:
具体的には、カイ二乗分布に従う自由度、は正規分布の次元数です。たとえば、次元数が 2 の場合、特定の確率は計算されます。ある閾値よりも小さいは特定の確率を達成するための閾値を決定するには、、 使用 2次元の場合。次元数が2以外の場合は、累積カイ二乗分布を参照する必要があります。
正規分布では、マハラノビス距離が1未満となる領域(つまり、距離1の楕円体の内側の領域)は、確率分布が凹型となる領域と正確に一致する。
正規分布の場合、マハラノビス距離は負の対数尤度の平方根に比例します(最小値がゼロになるように定数を加えた後)。

標本平均と共分散行列は外れ値に非常に敏感であるため、マハラノビス距離を計算する際には、データの多変量位置と散布を計算する他のアプローチも一般的に使用されます。最小共分散行列式アプローチは、サブセット番号から多変量位置と散布を推定します。最小分散共分散行列式を持つデータポイント。[ 9 ] 最小体積楕円体アプローチは、最小共分散行列式アプローチと同様に、サイズのサブセットで機能します。データポイントですが、最小体積楕円体は、最小体積楕円体から多変量位置と散乱を推定します。データポイント。[ 10 ] 各手法はデータの分布の定義が異なるため、異なるマハラノビス距離を生成します。最小共分散行列式と最小体積楕円体アプローチは外れ値を含むサンプルに対してより頑健ですが、サンプル平均と共分散行列は、小さく偏ったデータセットに対してより信頼性が高い傾向があります。[ 11 ]
一般に、正規(ガウス)確率変数が与えられた場合分散付きそして意味する、その他の正規確率変数(平均)および分散) は、方程式により逆に、正規分布に従う任意の確率変数から正規分布に従う確率変数を復元するには、通常、次の式を解けばよい。両辺を二乗して平方根を取ると、マハラノビス距離によく似た指標の式が得られます。
結果として得られる大きさは常に非負であり、データが平均値からどれだけ離れているかに応じて変化する。これらの特性は、データのモデルを定義しようとする際に都合が良い。
マハラノビス距離はレバレッジ統計量と密接に関連している。しかし、スケールが異なります。
マハラノビス距離は、クラスター分析や分類手法で広く用いられています。多変量統計検定に用いられるホテリングのT二乗分布や、教師あり分類に用いられるフィッシャーの線形判別分析と密接に関連しています。[ 12 ]
マハラノビス距離を用いてテストポイントをN個のクラスのいずれかに分類するには、まず各クラスの共分散行列を推定します。これは通常、各クラスに属することが分かっているサンプルに基づいて行われます。次に、テストサンプルに対して各クラスとのマハラノビス距離を計算し、マハラノビス距離が最小となるクラスにテストポイントを分類します。
マハラノビス距離とレバレッジは、特に線形回帰モデルの開発において、外れ値を検出するためによく用いられます。サンプル集団の他の点群からマハラノビス距離が大きい点は、回帰方程式の傾きや係数に大きな影響を与えるため、レバレッジが高いと言えます。マハラノビス距離は、多変量外れ値の判定にも用いられます。回帰分析手法を用いることで、2つ以上の変数スコアの組み合わせによって、サンプル集団内の特定のケースが外れ値であるかどうかを判定できます。正規分布の場合でも、ある変数がどの変数に対しても単変量外れ値でなくても、多変量外れ値となる可能性があります(直線に沿って集中した確率密度を考えてみてください)。例えば)、マハラノビス距離は、次元を個別にチェックするよりも感度の高い尺度となる。
マハラノビス距離は生態学的ニッチモデリングにも使用されており、[ 13 ] [ 14 ]距離の凸楕円形が基本ニッチの概念とよく関連している。
もう1つの使用例は金融分野で、マハラノビス距離は「乱流指数」と呼ばれる指標を計算するために使用されており[ 15 ] 、これは金融市場の異常な行動の統計的尺度である。