ロバスト統計とは、基礎となる分布仮定が誤っている場合でもその特性を維持する統計のことです。ロバスト統計手法は、位置、尺度、回帰パラメータの推定など、多くの一般的な問題に対して開発されてきました。その動機の一つは、外れ値によって過度に影響を受けない統計手法を生み出すことです。もう一つの動機は、パラメトリック分布からのわずかなずれがある場合に優れた性能を発揮する手法を提供することです。例えば、ロバスト手法は、標準偏差が異なる2つの正規分布の混合に対してうまく機能します。このモデルでは、 t検定のような非ロバスト手法はうまく機能しません。[ 1 ] [ 2 ]
頑健な統計学は、一般的な統計的手法を模倣しつつ、外れ値やモデルの仮定からのわずかな逸脱によって過度に影響を受けない手法を提供することを目指しています。統計学において、古典的な推定手法は、実際には満たされない仮定に大きく依存しています。特に、データの誤差は少なくとも近似的に正規分布に従う、あるいは中心極限定理によって正規分布に従う推定値が得られると仮定されることがよくあります。残念ながら、データに外れ値が存在する場合、古典的な推定量は、後述するブレークダウンポイントと影響関数を用いて評価すると、しばしば非常に低い性能しか示しません。
影響関数に見られる問題の実際的な影響は、混合モデルの下で提案された推定量の標本分布を調べることによって経験的に研究できます。この混合モデルでは、少量の(1~5%で十分な場合が多い)汚染を混ぜ込みます。例えば、95%が正規分布、残りの5%が平均値は同じだが標準偏差が著しく高い正規分布(外れ値を表す)の混合分布を用いることができます。
頑健なパラメトリック統計は、次の2つの方法で進めることができます。
以下の問題について、頑健な推定値が研究されてきた。
「ロバスト統計量」にはさまざまな定義があります。厳密に言えば、ロバスト統計量は、仮定[ 3 ] (例えば正規性)からの逸脱によって生じる結果の誤差に対して耐性があります。これは、仮定が近似的にしか満たされていない場合でも、ロバスト推定量は依然として妥当な効率と妥当に小さなバイアスを持ち、漸近的に不偏であることを意味します。つまり、サンプルサイズが無限大に近づくにつれてバイアスが0に近づくということです。
通常、最も重要なケースは分布の頑健性、つまりデータの基礎となる分布に関する仮定が破られた場合の頑健性です。[ 3 ]古典的な統計的手法は、一般的に「裾の長い分布」(例えば、データの分布が仮定された正規分布よりも裾が長い場合)に敏感です。これは、データに外れ値が存在すると統計的手法が強く影響を受け、外れ値がデータに含まれていない場合と比較して、データに極端な外れ値がある場合、統計的手法によって得られる推定値が大きく歪む可能性があることを意味します。
対照的に、ロングテールなどの分布の歪みにそれほど敏感ではない、より頑健な推定量は、外れ値の存在にも耐性があります。したがって、頑健統計の文脈では、分布的に頑健であることと外れ値に耐性があることは実質的に同義です。[ 3 ] 2000 年までの頑健統計の研究に関する一つの視点については、Portnoy & He (2000)を参照してください。
分布の頑健性を表す用語として「耐性統計」という用語を好んで用いる専門家もおり、「頑健性」という用語は分布に基づかない頑健性、例えば確率モデルや推定量に関する仮定の違反に対する頑健性などに限定して用いる場合もあるが、これは少数派の用法である。「頑健性」を単に「分布の頑健性」という意味で用いるのが一般的である。
推定量が外れ値の存在に対してどの程度頑健であるかを検討する際には、極端な外れ値をデータセットに追加した場合に何が起こるかをテストし、また、極端な外れ値が既存のデータポイントの1つを置き換えた場合に何が起こるかをテストし、さらに、複数の追加または置き換えの影響を検討することが有効です。
平均値は、中心傾向の確実な指標とは言えません。例えば、データセットが{2,3,5,6,9}という値で構成されている場合、そこに-1000または+1000の値を持つデータポイントを追加すると、結果として得られる平均値は元のデータの平均とは大きく異なります。同様に、いずれかの値を-1000または+1000の値を持つデータポイントに置き換えた場合も、結果として得られる平均値は元のデータの平均とは大きく異なります。
中央値は、中心傾向を示す堅牢な指標です。同じデータセット {2,3,5,6,9} を例にとると、-1000 または +1000 の値を持つデータポイントを追加すると、中央値はわずかに変化しますが、元のデータの中央値とほぼ同じ値になります。また、いずれかの値を -1000 または +1000 の値を持つデータポイントに置き換えても、結果として得られる中央値は元のデータの中央値とほぼ同じ値になります。
ブレークダウンポイントという観点から説明すると、中央値のブレークダウンポイントは50%であり、これは中央値が外れ値でない範囲から外れるためには、データの半分が外れ値でなければならないことを意味します。一方、平均値のブレークダウンポイントは0であり、1つの大きな観測値によって平均値が狂ってしまう可能性があります。
中央絶対偏差と四分位範囲は統計的ばらつきの確実な指標であるが、標準偏差と範囲はそうではない。
トリミング推定量とウィンザー化推定量は、統計の頑健性を高めるための一般的な手法です。L推定量は、頑健性が高いことが多い単純な統計量の一般的なクラスであり、M推定量は頑健な統計量の一般的なクラスであり、計算がかなり複雑になる場合もありますが、現在では好ましい解決策となっています。
Gelmanらは著書『Bayesian Data Analysis』(2004年)の中で、サイモン・ニューカムが行った光速測定に関するデータセットを取り上げています。この書籍のデータセットは「Classic data sets」ページから入手でき、書籍のウェブサイトにはデータに関する詳細情報が掲載されています。
データの大部分はほぼ正規分布に従っているように見えるが、明らかに外れ値が2つ存在する。これらの外れ値は平均値に大きな影響を与え、平均値を外れ値に向かって、そしてデータの中心から遠ざける。したがって、平均値がデータの中心位置を示す指標として用いられる場合、外れ値が存在すると、ある意味で偏りが生じることになる。
また、平均値の分布は中心極限定理により漸近的に正規分布になることが知られています。しかし、外れ値が存在すると、かなり大きなデータセットであっても平均値の分布は非正規分布になる可能性があります。このような非正規性に加えて、平均値は外れ値が存在する場合には非効率的であり、より変動の少ない位置尺度が利用可能です。
下の図は、光速データの密度プロットとラグプロット(パネル(a))を示しています。また、通常のQ-Qプロット(パネル(b))も示しています。これらのプロットには外れ値が明確に示されています。
図のパネル(c)と(d)は、平均値(c)と10%トリミング平均値(d)のブートストラップ分布を示しています。トリミング平均値は、データの両端から一定割合(ここでは10%)の観測値を削除し、通常の方法で平均値を計算する、シンプルで頑健な位置推定値です。解析はRで行われ、生の平均値とトリミング平均値それぞれについて10,000個のブートストラップサンプルが使用されました。
平均値の分布は、10%トリム平均の分布よりも明らかに広くなっています(グラフは同じスケールです)。また、トリム平均の分布は正規分布に近いように見えますが、生の平均値の分布は左に大きく偏っています。したがって、この66個の観測値のサンプルでは、外れ値が2つあるため、中心極限定理は適用できません。

頑健な統計的手法(トリム平均はその簡単な例である)は、外れ値が存在する場合、あるいはより一般的には、基礎となるパラメトリックな仮定が必ずしも正しくない場合に、古典的な統計的手法よりも優れた性能を発揮することを目指している。
この例では、トリミング平均は平均値と比較して良好な結果を示していますが、より頑健な推定値も存在します。実際、平均値、中央値、トリミング平均はすべてM推定量の特殊なケースです。詳細は以下のセクションをご覧ください。
光速データにおける外れ値は、平均値に悪影響を与えるだけでなく、それ以上の影響を及ぼします。通常、尺度の推定値として用いられる標準偏差は、平均値からの偏差の二乗が計算に含まれるため、外れ値の影響をさらに大きく受けます。つまり、外れ値の影響が増幅されるのです。
以下の図は、標準偏差、中央絶対偏差(MAD)、および Rousseeuw–Croux (Qn)スケール推定量のブートストラップ分布を示しています。[ 4 ]これらの図は、各推定量について 10,000 個のブートストラップサンプルに基づいており、再サンプリングされたデータにガウスノイズが追加されています (平滑化ブートストラップ)。パネル (a) は標準偏差の分布、(b) は MAD の分布、(c) は Qn の分布を示しています。

標準偏差の分布は外れ値の影響で不規則かつ広範囲に及んでいます。MADはMADよりも安定した挙動を示し、QnはMADよりもわずかに効率的です。この簡単な例から、外れ値が存在する場合、標準偏差を尺度の推定値として推奨できないことがわかります。
従来、統計学者は手作業でデータから外れ値を選別し、それらを除去し、通常はデータの出所を調べて外れ値が誤って記録されたかどうかを確認していました。実際、上記の光速の例では、さらなる分析に進む前に2つの外れ値を見つけて除去することは容易です。しかし、現代では、データセットは多数の実験単位で測定された多数の変数から構成されることが多く、そのため、外れ値を手作業で選別することは非現実的な場合が多いのです。
外れ値は互いに影響し合い、互いを覆い隠してしまうことがよくあります。簡単な例として、小さな単変量データセットに、中程度の外れ値と大きな外れ値がそれぞれ1つずつ含まれている場合を考えてみましょう。推定標準偏差は、大きな外れ値によって著しく膨らまされます。その結果、中程度の外れ値は比較的正常に見えます。大きな外れ値が除去されると、推定標準偏差は縮小し、今度は中程度の外れ値が異常に見えます。
データの複雑さが増すにつれて、このマスキングの問題は悪化します。例えば、回帰分析では、外れ値を特定するために診断プロットが使用されます。しかし、いくつかの外れ値を除去すると、他の外れ値が目立つようになることがよくあります。この問題は、高次元になるとさらに深刻になります。
堅牢な手法は、外れ値を自動的に検出、重み付けを下げる(または除去する)、およびフラグ付けする方法を提供し、手動によるスクリーニングの必要性を大幅に排除します。注意が必要です。南極上空にオゾンホールが最初に現れたことを示す初期データは、非人間によるスクリーニングによって外れ値として却下されました。[ 5 ]
本稿では単変量統計手法の一般原則について述べるが、回帰問題、一般化線形モデル、および様々な分布のパラメータ推定についても、より堅牢な手法が存在する。
堅牢性を記述および測定するために使用される基本的なツールは、ブレークダウンポイント、影響関数、および感度曲線です。
直感的に言えば、推定量の破綻点とは、推定量が誤った(例えば、任意に大きい)結果を出す前に処理できる誤った観測値(例えば、任意に大きい観測値)の割合のことです。通常、漸近的(無限標本)限界が破綻点として引用されますが、有限標本破綻点の方がより有用な場合もあります。[ 6 ]例えば、独立な確率変数そしてそれに対応する実現我々は、平均を推定する。このような推定量のブレークダウンポイントは 0 (または有限標本ブレークダウンポイントはなぜなら私たちは任意の値を大きくする。
推定量のブレークダウンポイントが高いほど、その推定量はより頑健になります。直感的に、観測値の半分以上が汚染されている場合、基礎となる分布と汚染された分布を区別することができないため、ブレークダウンポイントは 50% を超えることはできないと理解できます( Rousseeuw & Leroy (1987))。したがって、最大ブレークダウンポイントは 0.5 であり、そのようなブレークダウンポイントを達成する推定量があります。たとえば、中央値のブレークダウンポイントは 0.5 です。X% トリム平均のブレークダウンポイントは、選択された X のレベルに対して X% です。Huber (1981)およびMaronna et al. (2019)には、より詳細な情報が記載されています。検定のレベルと検出力のブレークダウンポイントについては、He, Simpson & Portnoy (1990)で調査されています。
ブレークダウンポイントが高い統計は、耐性統計と呼ばれることがある。[ 7 ]
光速の例では、最も低い2つの観測値を除去すると、平均値は26.2から27.75に変化し、変化量は1.55となります。Qn法によって得られたスケールの推定値は6.3です。これを標本サイズの平方根で割ると、頑健な標準誤差が得られます。この値は0.78です。したがって、2つの外れ値を除去することによって生じる平均値の変化は、頑健な標準誤差の約2倍に相当します。
光速データの10%トリム平均は27.43です。最も低い2つの観測値を除外して再計算すると、27.67となります。トリム平均は外れ値の影響を受けにくく、ブレークダウンポイントも高くなっています。
最小の観測値である-44を-1000に置き換えると、平均値は11.73になりますが、10%トリム平均は依然として27.43です。応用統計学の多くの分野では、データをほぼ対称にするために対数変換することが一般的です。非常に小さな値は対数変換すると大きな負の値になり、ゼロは負の無限大になります。したがって、この例は実用上興味深いものです。
経験的影響関数は、推定量が標本中のいずれかの点の値にどの程度依存しているかを示す尺度です。これは、異なる標本を用いて推定量を再度計算するだけで済むという意味で、モデルに依存しない尺度です。右側に示されているのは、テューキーのバイウェイト関数です。これは、後述するように、「良い」(定義は後述します)経験的影響関数がどのようなものであるべきかを示す一例です。
数学的に言えば、影響関数は推定量の空間におけるベクトルとして定義され、推定量は母集団の部分集合である標本に対して定義される。
例えば、
経験的影響関数は次のように定義される。
させてそしてはiidであり、これは、これらの変数からのサンプルです。は推定量である。経験的影響関数観察時定義は以下のとおりです。
これはつまり、サンプル中のi番目の値を任意の値に置き換えて、推定量の出力を調べているということです。あるいは、EIF は、n ではなく n+1 でスケーリングした、点を追加したときの推定量への影響として定義されます。サンプルへ。

データだけに頼るのではなく、確率変数の分布を利用することもできます。このアプローチは前の段落とはかなり異なります。ここで私たちがしようとしているのは、データの分布を少し変更したときに推定量がどうなるかを確認することです。推定量は分布を仮定し、この分布の変化に対する感度を測定します。対照的に、経験的影響はサンプルセットを仮定し、サンプルの変化に対する感度を測定します。[ 8 ]
させて上のすべての有限符号付き測度の集合の凸部分集合である。パラメータを推定したい分布ので関数をある推定量列の漸近値とするこの関数はフィッシャー整合的であると仮定します。これは、モデルにおいて推定器のシーケンスは漸近的に正しい量を測定する。
させて何らかの分布があるデータがモデルに従わない場合はどうなるのか?まさにその通りだが、少し異なる「向かっている」?
私たちは以下の点を検討しています。
させて。は、質量 1 を与える確率測度です。私たちは選びます影響関数は次のように定義されます。
これは、その地点での微小汚染の影響を説明しています。我々が求めている推定値について、質量で標準化汚染(観測値の汚染によって生じる漸近的なバイアス)について。ロバストな推定量の場合、影響関数は有界である必要があり、つまり、x が任意に大きくなっても無限大にならない関数が必要です。
経験的影響関数は経験分布関数を使用する分布関数の代わりにドロップインの原則を利用して。
影響関数が望ましい性能を発揮するために必要な特性は以下のとおりです。
この値は、リプシッツ定数によく似ており、観測値をわずかにずらしたときの効果を表しています。隣の地点へつまり、観測値を追加するそして1つ取り除く。
(この段落の数学的背景については、経験的影響関数に関するセクションで説明しています。)
歴史的に、頑健な推定には、R推定量やL推定量など、いくつかの手法が提案されてきました。しかし、現在では、M推定量がその汎用性、高いブレークダウンポイントの可能性、そして比較的高い効率性から、この分野を支配しているようです。Huber (1981)を参照してください。
M推定量は本質的に頑健ではありません。しかし、頑健性を含む好ましい特性を実現するように設計することができます。M推定量は、最大尤度推定量(MLE)の一般化であり、最大化によって決定されます。または同等に、最小化する1964年、フーバーはこれを最小化に一般化することを提案した。、 どこは何らかの関数です。したがって、最尤推定量はM推定量の特殊なケースです(そのため、「M最尤型」推定量と呼ばれます)。
最小化多くの場合、微分することで実行できますそして解決する、 どこ(もし派生形を持つ)。
いくつかの選択肢そして提案されている。下の2つの図は4つを示している。関数とその対応する機能。

二乗誤差の場合、絶対誤差の場合は、加速的に増加しますが、絶対誤差の場合は一定の割合で増加します。ウィンザー化を使用すると、これら 2 つの効果が混在します。x の値が小さい場合、増加率は二乗に比例して増加しますが、選択した閾値(この例では1.5)に達すると、増加率は一定になります。このウィンザー化推定量は、フーバー損失関数とも呼ばれます。
テューキーのバイウェイト(バイスクエアとも呼ばれる)関数は、最初は二乗誤差関数と同様の挙動を示すが、誤差が大きくなるにつれて、その関数は徐々に減少していく。

M推定量は必ずしも確率密度関数と関連しているわけではありません。したがって、尤度理論から派生した既成の推論手法は、一般的には使用できません。
M推定量は漸近的に正規分布に従うことが示されており、標準誤差が計算できる限り、近似的な推論手法が利用可能である。
M推定量は漸近的にのみ正規分布に従うため、サンプルサイズが小さい場合は、ブートストラップなどの別の推論手法を用いるのが適切かもしれません。しかし、M推定量は必ずしも一意ではありません(つまり、方程式を満たす解が複数存在する可能性があります)。また、特定のブートストラップサンプルには、推定量のブレークダウンポイントよりも多くの外れ値が含まれる可能性もあります。したがって、ブートストラップ手法を設計する際には、注意が必要です。
もちろん、光速の例で見たように、平均値は漸近的に正規分布に従うだけであり、外れ値が存在する場合は、かなり大きなサンプルであっても近似精度が非常に悪くなる可能性があります。しかし、平均値に基づく検定を含む古典的な統計的検定は、通常、検定の公称サイズによって上限が定められています。M推定量の場合はそうではなく、第一種過誤率は公称レベルを大幅に上回る可能性があります。
これらの考察は、M推定をいかなる意味でも「無効にする」ものではありません。単に、他のあらゆる推定方法と同様に、M推定を用いる際には注意が必要であることを明確にしているにすぎません。
M推定量の影響関数は、に比例する[ 9 ]これは、推定量の特性(棄却点、大誤差感度、局所シフト感度など)は、その推定量が分かっている場合に導出できることを意味します。関数。
と共に提供元:
多くの実際的な状況では、関数は、良好で頑健な推定値を得る上で重要ではなく、多くの選択肢が同様の結果をもたらし、外れ値が存在する場合の従来の推定値よりも効率とバイアスの点で大幅な改善をもたらします。[ 10 ]
理論的には、関数が推奨され、Tukeyのバイウェイト(バイスクエアとも呼ばれる)関数が一般的な選択肢です。Maronnaら[ 11 ]は、正規分布での効率を85%に設定したバイウェイト関数を推奨しています。
M推定量は必ずしも密度関数と関連しているわけではないため、完全なパラメトリックではありません。ロバストなモデリングと推論に対する完全なパラメトリックなアプローチ(ベイズアプローチと尤度アプローチの両方)は、通常、スチューデントのt分布のような裾の重い分布を扱います。
t分布の場合自由度については、以下が示せる。
のためにt分布はコーシー分布と等価です。自由度は尖度パラメータと呼ばれることもあります。これは裾の重さを制御するパラメータです。原則として、は、他のパラメータと同様の方法でデータから推定できます。実際には、次のような場合に複数の局所最大値が存在することがよくあります。変動が許容される。そのため、固定するのが一般的である。4または6付近の値で、下の図は-4つの異なる値に対する関数。

光速データの場合、尖度パラメータを変化させ、尤度を最大化すると、次のようになります。
修正そして、可能性を最大化すると
重要な量とは、基礎となる母集団分布がパラメトリック族に属し、かつパラメータの値に依存しないデータの関数です。補助統計量とは、そのような関数であり、かつ統計量でもあるもので、データのみに基づいて計算されます。このような関数は、パラメータの値に依存しないという意味でパラメータに対して頑健ですが、基礎となるモデル(パラメトリック族)を仮定しているという意味でモデルに対して頑健ではありません。実際、このような関数は、モデルの仮定の違反に対して非常に敏感な場合が多いのです。したがって、パラメータに関する仮定に影響されないように、これらの関数を用いて構築されることが多い検定統計量も、モデルの仮定に対しては依然として非常に敏感です。
欠損データの補完は、代入と呼ばれます。欠損点が比較的少ない場合は、欠損値をデータの平均値または中央値で置き換えるなど、系列を完成させる値を推定するために使用できるモデルがいくつかあります。単純な線形回帰も欠損値の推定に使用できます。[ 12 ]さらに、外れ値は、トリミング平均、標準偏差以外の他の尺度推定値(MADなど)、およびウィンザー化を使用してデータに対処できる場合があります。[ 13 ]トリミング平均の計算では、順序付けられたデータの両端から一定の割合のデータが削除され、外れ値が除去されます。その後、残りのデータを使用して平均が計算されます。ウィンザー化は、外れ値を適切な次の最大値または次の最小値で置き換えることによって対処します。[ 14 ]
しかし、このようなモデルを使用して長い時系列の欠損値や外れ値を予測することは困難であり、特に埋めるべき値の数がレコード全体の長さに比べて比較的多い場合は、信頼性が低いことが多い。推定の精度は、モデルがどれだけ優れていて代表的であるか、および欠損値の期間がどれだけ長いかに依存する。[ 15 ]系列で動的な変化が想定される場合、欠損データポイントの問題は、(欠損値や外れ値を推定する従来の方法のほとんどが単変量アプローチであるのとは異なり)多変量解析の問題となる。このような場合、欠損値を予測するには、単変量モデルよりも多変量モデルの方が代表的である。コホーネン自己組織化マップ(KSOM)は、データ分析のためのシンプルで堅牢な多変量モデルを提供し、データレコード内の他の関連変数との関係や相関を考慮して欠損値を推定する優れた可能性を提供する。[ 14 ]
標準的なカルマンフィルターは外れ値に対して頑健ではありません。そこで、Ting、Theodorou 、 Schaal(2007)は最近、 Masreliezの定理の修正版が外れ値に対処できることを示しました。
データ分析で外れ値を処理する一般的なアプローチの 1 つは、まず外れ値検出を行い、次に効率的な推定方法 (最小二乗法など) を実行することです。このアプローチは多くの場合有用ですが、2 つの課題に留意する必要があります。1 つ目は、頑健でない初期適合に依存する外れ値検出方法はマスキング効果の影響を受ける可能性があり、つまり、外れ値のグループが互いにマスキングして検出を免れる可能性があります。[ 16 ] 2 つ目は、外れ値検出に高ブレークダウンの初期適合を使用する場合、後続の分析が初期推定器の非効率性を引き継ぐ可能性があるということです。[ 17 ]
影響関数は統計学において長い歴史を持つものの、いくつかの課題から機械学習では広く利用されてこなかった。主な障害の一つは、従来の影響関数が高コストな2階微分計算に依存し、モデルの微分可能性と凸性を前提としている点である。これらの前提は、特に現代の機械学習においては制約となる。現代の機械学習では、モデルはしばしば微分不可能で非凸であり、高次元空間で動作するからである。
Koh & Liang (2017)は、 Pearlmutter (1994)、Martens (2010)、Agarwal、Bullins & Hazan (2017)らが開発したような二次最適化手法を用いて影響関数を効率的に近似する方法を導入することで、これらの課題に対処しました。彼らのアプローチは、微分可能性と凸性の仮定が崩れた場合でも有効であり、非凸深層学習モデルのコンテキストで影響関数を使用できるようにします。彼らは、影響関数が機械学習におけるさまざまなタスクに適用できる強力で汎用性の高いツールであることを示しました。
Koh氏とLiang氏の貢献により、影響関数が機械学習の様々な分野、例えば解釈可能性からセキュリティに至るまで、幅広い用途で使用される道が開かれ、その適用範囲において大きな進歩がもたらされた。