
統計学において、外れ値とは、他の観測値と著しく異なるデータ点のことです。 [ 1 ] [ 2 ]外れ値は、測定のばらつき、新しいデータの兆候、または実験誤差の結果である可能性があります。後者はデータセットから除外されることがあります。[ 3 ] [ 4 ] 外れ値は興味深い可能性を示すこともありますが、統計分析において深刻な問題を引き起こす可能性もあります。
外れ値は、どの分布でも偶然発生する可能性がありますが、データセット内の新しい挙動や構造、測定誤差、または母集団が裾の重い分布を持っていることを示している可能性があります。測定誤差の場合は、外れ値を無視するか、外れ値に対して頑健な統計量を使用することが望ましいですが、裾の重い分布の場合は、分布の歪度が高いことを示しており、正規分布を仮定するツールや直感を使用する際には非常に注意する必要があります。外れ値の一般的な原因は、2 つの分布の混合であり、これは 2 つの異なるサブ母集団である場合もあれば、「正しい試行」と「測定誤差」を示している場合もあります。これは混合モデルによってモデル化されます。
大規模なデータサンプルでは、一部のデータポイントがサンプル平均から妥当と考えられる範囲を超えて離れることがあります。これは、偶発的な系統誤差や、想定される確率分布の族を生成した理論の欠陥による場合もあれば、一部の観測値がデータの中心から大きく離れている場合もあります。したがって、外れ値は、データの欠陥、手順の誤り、または特定の理論が有効でない可能性のある領域を示している可能性があります。ただし、大規模なサンプルでは、少数の外れ値が存在することは想定内であり(異常な状況によるものではありません)、これは当然のことです。
外れ値とは、最も極端な観測値であり、極端に高いか低いかによって、標本最大値、標本最小値、あるいはその両方が含まれる場合があります。ただし、標本最大値と標本最小値は、他の観測値から異常に離れていない場合もあるため、必ずしも外れ値とは限りません。
外れ値を含むデータセットから得られた統計値を単純に解釈すると、誤解を招く可能性があります。例えば、部屋にある10個の物体の平均温度を計算し、そのうち9個が20℃から25 ℃の間である一方、オーブンが175 ℃に設定されている場合、データのメジアン は20℃から25 ℃の間になりますが、平均温度は35.5℃から40 ℃の間になります。この場合、メジアンは平均よりも、ランダムに抽出された物体の温度(部屋全体の温度ではなく)をよりよく反映しています。メジアンを「典型的なサンプル」と単純に解釈し、メジアンと同等とみなすのは誤りです。この例で示されているように、外れ値は、サンプルセットの残りの部分とは異なる母集団に属するデータポイントを示している可能性があります。
外れ値に対処できる推定量は頑健であると言われている。中央値は中心傾向の頑健な統計量であるが、平均値はそうではない。[ 5 ]

正規分布データの場合、 3シグマルールは、約22個の観測値の1つが平均から標準偏差の2倍以上離れ、370個に1つが標準偏差の3倍以上離れることを意味します。 [ 6 ] 1000個の観測値のサンプルでは、平均から標準偏差の3倍以上離れる観測値が最大5個存在しても、期待される数の2倍未満であり、したがって期待される数の1標準偏差以内であるため、異常を示すものではありません(ポアソン分布を参照)。ただし、サンプルサイズが100しかない場合、そのような外れ値が3つあるだけでも、期待される数の11倍以上であるため、すでに懸念すべき理由となります。
一般に、母集団分布の性質が事前にわかっている場合、外れ値の数が期待値から大きく逸脱しているかどうかをテストできます。特定の分布の特定のカットオフ(サンプルが確率pでカットオフを超える)に対して、外れ値の数はパラメータpの二項分布に従います。これは一般的にλ = pnのポアソン分布でよく近似できます。したがって、平均から 3 標準偏差をカットオフとする正規分布を取ると、pは約 0.3% となり、1000 回の試行で、偏差が 3 シグマを超えるサンプルの数を λ = 3 のポアソン分布で近似できます。
外れ値には、さまざまな異常な原因が考えられます。測定を行う物理的な装置が一時的に誤作動を起こした可能性があります。データの送信や転記にエラーがあった可能性もあります。外れ値は、システム動作の変化、不正行為、人的ミス、機器のエラー、あるいは単に母集団の自然な変動によって発生します。サンプルが、調査対象の母集団外の要素で汚染された可能性もあります。あるいは、外れ値は想定された理論の欠陥の結果である可能性があり、研究者によるさらなる調査が必要となります。さらに、特定の形式の外れ値がさまざまなデータセットで異常な形で現れることは、極端な場合、データの原因メカニズムが異なる可能性があることを示唆しています(キング効果)。
外れ値を構成するものについての厳密な数学的定義はありません。観測値が外れ値であるかどうかを判断することは、最終的には主観的な作業です。[ 7 ]
外れ値検出にはさまざまな方法があり、その中には異常検出と同義とみなされるものもあります。[ 3 ] [ 8 ] [ 9 ] [ 10 ] [ 11 ]正規確率プロットなどのグラフィカルな方法もあれば、モデルベースの方法もあります。ボックスプロットはハイブリッドです。
識別によく用いられるモデルベースの手法は、データが正規分布に従うことを前提とし、平均値と標準偏差に基づいて「可能性が低い」と判断される観測値を特定する。
一連の決定を行うことが提案されている観測誤差の限界、これを超えると、これほど大きな誤差を含むすべての観測は棄却される可能性があるが、観測数が十分であれば、このような観測。この問題を解決するために提案されている原理は、提案された観測を保持することによって得られる誤差系の確率が、それらを拒否することによって得られる誤差系の確率に、その数以上の異常な観測を行う確率を掛けたものよりも小さい場合に、提案された観測を拒否すべきであるというものである。(ショーヴネ著『天文学マニュアル』 2:558より、ピアース(1982年版)の516ページの編集者注に引用。) [ 13 ] [ 14 ] [ 15 ] [ 16 ]
他の方法では、四分位範囲などの指標に基づいて観測値にフラグを付けます。たとえば、そしてそれぞれが下位四分位数と上位四分位数である場合、外れ値は範囲外の観測値として定義できる。
ある非負定数に対してジョン・テューキーはこのテストを提案した。 「外れ値」を示し、「かけ離れた」データを示します。[ 17 ]
統計、信号処理、金融、計量経済学、製造、ネットワーク、データマイニングなど、さまざまな分野で、異常検出のタスクは他のアプローチを取る場合があります。これらのアプローチには、距離ベース[ 18 ] [ 19 ]や、ローカル外れ値係数(LOF) [ 20 ]などの密度ベースのものがあります。一部のアプローチでは、k 近傍までの距離を使用して、観測値を外れ値または非外れ値としてラベル付けする場合があります。[ 21 ]
修正トンプソン・タウ検定は、データセットに外れ値が存在するかどうかを判断するために使用される方法です。[ 22 ]この方法の強みは、データセットの標準偏差と平均を考慮し、統計的に決定された棄却域を提供する点にあります。これにより、データポイントが外れ値であるかどうかを客観的に判断する方法が提供されます。[ 23 ] 仕組み:まず、データセットの平均が決定されます。次に、各データポイントと平均との間の絶対偏差が決定されます。最後に、次の式を使用して棄却域が決定されます。
どこは、自由度n - 2 のスチューデントt分布からの臨界値です。nはサンプルサイズ、s はサンプル標準偏差です。値が外れ値かどうかを判断するには、以下を計算します。δ > 棄却域の場合、データ点は外れ値です。δ ≤ 棄却域の場合、データ点は外れ値ではありません。
修正トンプソン・タウ検定は、外れ値を一度に1つずつ検出するために使用されます(外れ値である場合は、 δの最大値が削除されます)。つまり、データポイントが外れ値であると判断された場合、そのデータポイントはデータセットから削除され、新しい平均値と棄却域を使用して再度検定が適用されます。このプロセスは、データセットに外れ値がなくなるまで続けられます。
名義データ(またはカテゴリデータ)の外れ値についても調査した研究がある。データセット内の例(またはインスタンス)のセットのコンテキストでは、インスタンスハードネスはインスタンスが誤分類される確率を測定する(ここで、yは割り当てられたクラスラベルであり、x はトレーニング セットt内のインスタンスの入力属性値を表します。[ 24 ]理想的には、インスタンスの難易度は、考えられるすべての仮説Hのセットを合計することによって計算されます。
実際には、 Hは潜在的に無限であり、計算が困難であるため、この定式化は実現不可能である。多くのアルゴリズムでは、これは未知である。したがって、インスタンスの困難性は、多様なサブセットを使用して近似することができる。:
どこ学習アルゴリズムによって誘導される仮説はハイパーパラメータを用いてトレーニングセットtで学習させた。インスタンスのハードネスは、インスタンスが外れ値インスタンスであるかどうかを判断するための連続値を提供する。
外れ値への対処方法は、その原因によって決めるべきである。共分散行列の推定など、外れ値に非常に敏感な推定方法もある。
正規分布モデルが分析対象のデータに適している場合でも、サンプルサイズが大きい場合は外れ値が発生することが予想され、外れ値が発生した場合でも自動的に破棄すべきではありません。[ 25 ] 代わりに、外れ値に対して頑健な方法を使用して、自然に発生する外れ値を含むデータをモデル化または分析する必要があります。[ 25 ]
外れ値を除去するかどうかを決定する際には、その原因を考慮する必要があります。前述のように、外れ値の原因が実験誤差によるものである場合、または外れ値のデータポイントが誤りであると判断できる場合は、一般的にそれを除去することが推奨されます。[ 25 ] [ 26 ]ただし、可能であれば、誤った値を修正する方が望ましいです。
一方、外れ値であるという理由だけでデータポイントを削除することは、統計結果を無効にすることが多いため、多くの科学者や科学教師からしばしば非難される、議論の多い行為です。[ 25 ] [ 26 ]数学的基準は、データの棄却のための客観的かつ定量的な方法を提供しますが、特に小さなセットや正規分布を仮定できない場合は、その行為をより科学的または方法論的に健全なものにするものではありません。外れ値の棄却は、測定対象プロセスの基礎となるモデルと測定誤差の通常の分布が確実にわかっている実践分野では、より受け入れられやすいです。
外れ値を除外する一般的な方法は、切り捨て(またはトリミング)とウィンザー化の2 つです。トリミングは外れ値を破棄しますが、ウィンザー化は外れ値を最も近い「疑わしくない」データで置き換えます。[ 27 ]除外は、実験がそのような極端な値を完全に測定できない場合など、測定プロセスの結果である場合もあります。その結果、打ち切りデータが発生します。[ 28 ]
回帰問題では、クックの距離などの尺度を使用して、推定係数に大きな影響を与える点のみを除外するという別のアプローチが考えられます。[ 29 ]
データ分析から除外されたデータポイント(または複数のデータポイント)がある場合は、その後の報告書にその旨を明確に記載する必要があります。
データの基礎となる分布が正規分布に近似せず、「裾が厚い」可能性を考慮する必要があります。たとえば、コーシー分布からサンプリングする場合、[ 30 ]サンプル分散はサンプルサイズとともに増加し、サンプル平均はサンプルサイズの増加に伴って収束せず、外れ値は正規分布の場合よりもはるかに高い割合で発生することが予想されます。裾の厚さのわずかな違いでも、極値の期待値に大きな違いが生じる可能性があります。
集合メンバーシップアプローチでは、未知のランダムベクトルxのi番目の測定に対応する不確実性は、(確率密度関数ではなく)集合X iで表されます。外れ値が発生しない場合、 x はすべてのX iの共通部分に属するはずです。外れ値が発生すると、この共通部分は空になる可能性があり、矛盾を避けるために、集合X iの少数(できるだけ少ない数)を緩和する必要があります。 [ 31 ]これは、 q緩和された共通部分の概念を使用して行うことができます。図に示すように、q緩和された共通部分は、 q 個を除くすべての集合に属するすべてのxの集合に対応します。q 緩和された共通部分と交差しない集合X i は、 外れ値である可能性があります。

外れ値の原因がわかっている場合は、階層ベイズモデルや混合モデルなどを使用して、この効果をモデル構造に組み込むことができる可能性があります。[ 32 ] [ 33 ]
クラスター分析において、外れ値は結果を大きく歪める可能性がある。そのため、外れ値の扱い方は長年にわたり議論の的となってきた。
クラスター分析は距離尺度に大きく依存する。マンハッタン距離は、不均衡に大きな差の値を二乗しないため、ユークリッド距離よりも外れ値をうまく処理できる可能性が高いと示唆されている。[ 34 ]
外れ値、または「外れ値」とは、それが含まれる標本の他のメンバーから著しく逸脱しているように見えるもののことです。
外れ値とは、他の観測値から大きくかけ離れた観測値のことです。
{{cite journal}}: CS1メンテナンス: DOIは2025年7月現在非アクティブです(リンク)