ノンパラメトリック統計は、研究対象データの基礎となる分布について最小限の仮定しか行わない統計分析の一種です。多くの場合、これらのモデルは、パラメトリック統計のように有限次元ではなく、無限次元です。[ 1 ]ノンパラメトリック統計は、記述統計や統計的推論に使用できます。ノンパラメトリック検定は、パラメトリック検定の仮定が明らかに満たされない場合によく使用されます。[ 2 ]
「ノンパラメトリック統計」という用語は、とりわけ以下の2つの方法で曖昧に定義されてきた。
ノンパラメトリックの第一の意味は、特定のパラメトリックな確率分布族に属するデータに依存しない手法を指します。これには、とりわけ以下のものが含まれます。
一例として、観測値の順序付けに基づく順序統計量が挙げられる。
以下の議論は、ケンドールの『統計学の高度な理論』[ 3 ]から引用したものです。
統計的仮説は、観測可能な確率変数の挙動に関するものです。例えば、(a) 正規分布には特定の平均と分散があるという仮説は統計的であり、(b) 正規分布には与えられた平均があるが分散は指定されていないという仮説も統計的であり、(c) 分布が平均と分散の両方が指定されていない正規形であるという仮説も統計的であり、最後に、(d) 指定されていない 2 つの連続分布が同一であるという仮説も統計的です。
例(a)と(b)では、観測値の基となる分布はある特定の形式(正規分布)であると仮定され、仮説はパラメータの一方または両方の値のみに関係していたことに気づかれたことでしょう。このような仮説は、明白な理由から、パラメトリック仮説と呼ばれます。
仮説(c)は性質が異なり、仮説の記述にはパラメータ値が指定されていないため、このような仮説は非パラメトリックと呼ぶのが妥当でしょう。仮説(d)も非パラメトリックですが、さらに分布の基礎となる形式も指定されていないため、分布に依存しない仮説と呼ぶのが妥当です。これらの違いにもかかわらず、統計学の文献では現在、私たちが先ほど「分布に依存しない」と呼んだ検定手順に「非パラメトリック」というラベルを一般的に適用しており、有用な分類が失われています。
ノンパラメトリックの2つ目の意味は、モデルの構造が固定されていると仮定しない手法を指します。通常、モデルの規模はデータの複雑さに対応するために大きくなります。これらの手法では、個々の変数は通常パラメトリック分布に従うと仮定され、変数間の関連性の種類についても仮定がなされます。これらの手法には、とりわけ以下のものが含まれます。
ノンパラメトリック法は、順位付けされた母集団(例えば、1つ星から5つ星までの映画レビューなど)を研究する際に広く用いられています。データに順位付けはあるものの、明確な数値的解釈ができない場合(例えば、嗜好を評価する場合など)には、ノンパラメトリック法の使用が必要となることがあります。測定尺度の観点から見ると、ノンパラメトリック法は順序尺度データをもたらします。
ノンパラメトリック法は仮定が少ないため、対応するパラメトリック法よりも適用範囲がはるかに広い。特に、対象となるアプリケーションに関する情報が少ない状況でも適用できる。また、仮定が少ないため、ノンパラメトリック法はより頑健である。
非パラメトリック法は、パラメトリック法の前提条件が満たされている場合でも、パラメトリック法よりも使いやすく、頑健であると考えられることがあります。これは、非パラメトリック法の方がより一般的な性質を持つため、誤用や誤解が生じにくいからです。非パラメトリック法は、前提条件が満たされない場合でも機能するため、保守的な選択肢と言えます。一方、パラメトリック法は、前提条件が満たされない場合に誤解を招く結果を生み出す可能性があります。
ノンパラメトリック検定は適用範囲が広く、頑健性も高い反面、代償も伴います。パラメトリック検定の前提条件が満たされる場合、ノンパラメトリック検定の統計的検出力は低くなります。つまり、同じ信頼度で結論を導き出すには、より大きなサンプルサイズが必要になる可能性があるということです。
ノンパラメトリックモデルは、モデル構造が事前に指定されるのではなく、データに基づいて決定されるという点で、パラメトリックモデルとは異なります。ノンパラメトリックという用語は、そのようなモデルにパラメータが全く存在しないことを意味するのではなく、パラメータの数と性質が柔軟であり、事前に固定されていないことを意味します。
ノンパラメトリック(または分布によらない)推論統計手法は、統計的仮説検定のための数学的手順であり、パラメトリック統計とは異なり、評価対象となる変数の確率分布について仮定を置きません。最もよく使用される検定には、
数理統計学において、ノンパラメトリックモデルとは、未知のデータ分布(密度推定問題の場合)または回帰関数(回帰問題の場合)のパラメトリックな仮定に依存しないモデルとみなされます。一方、あらゆるパラメトリックモデルの目的は、有限個のパラメータを推定することです。非パラメトリックモデルは、データの分布/回帰関数を直接推定することを目的としています。[ 5 ] [ 6 ]
しかし、数学的分析においては、パラメトリックアプローチとノンパラメトリックアプローチは同じ枠組みに収まります。推定される関数(データ分布または回帰関数)が、ある一連のパラメータによってパラメータ化された関数の集合に属すると仮定します。(測定可能な)関数を探すこれはデータポイントに基づいて「真の」パラメータを推定するものです。パラメトリックアプローチとノンパラメトリックアプローチの主な違いは、前者では一部の人にとって後者では通常は、可能なターゲット関数の集合自体であり、たとえば、連続関数または微分可能な関数の集合です。
この分野における関連する問題は、妥当な推定量の構築、一致性、収束率とその最適性、および適応推定に関するものである。[ 7 ]
パラメトリック統計学と同様に、推定量にとって望ましい特性それは、目標関数に収束するということです。サンプルサイズとしてが無限大に近づく、つまり近似誤差がゼロに収束する。通常、近似は の観点から測定される。-ノルム距離間のそして推定量はランダムに抽出されたデータの関数であるため近似値もまた確率変数であるため、収束の2つの異なるモードを区別します。
一貫性が低い:。
高い一貫性:ほぼ間違いなく。
推定量がすべての二乗可積分に対して一致性を持つ場合そうすれば、普遍的に一貫性があると言われる。[ 8 ]
多くの一般的なノンパラメトリック推定量は、モデルのハイパーパラメータを適切に選択すれば、弱普遍的に一致します。例えば、Nadarya-Watson推定量、kNN、および特定の局所多項式推定量などです。[ 9 ]
ノンパラメトリック推定量の統計分析における中心的なテーマは、真の目標関数への収束速度である。そして、速度が最適かどうか、つまり収束が可能な限り速いかどうか。推定量の収束速度を測定する最も一般的な方法は、最悪のシナリオにおける推定量の期待損失を考慮するミニマックス収束率です。滑らかさに関する特定の仮定の下で、推定器が下回ることができない最小収束率が存在することを示すことができ、したがって、この最小収束率を達成する推定器は最適であると呼ばれる。
数学的に言えば、目的関数何らかの関数クラスに属すると想定される仮説クラスと呼ばれる分布を誘導するの上推定量の近似精度何らかの関数によって測定されるミニマックス収束率シーケンス実数のうち、それが成り立つものどこランダム変数データポイントを描画する分布は。
仮説クラスの推定値の普遍的な下限シーケンス保持するここで、下限値は考えられるすべての推定値について取られる。(つまり、測定可能な関数)観察結果。
ノンパラメトリック推定量の詳細な分析は、確率密度関数と回帰関数の推定に分けられる。
密度推定の設定では、通常、関数のノルム空間が用いられます。密度関数のサブセットおよび独立した確率変数密度の尺度に従って分布データを生成するもの。
ミニマックス下限は、さまざまな関数クラスのペアについて知られています。比較指標一般的な選択肢は:
実際、ヘルダー空間とソボレフ空間は、いくつかのベゾフ空間の特殊なケースである。のためにそして[ 10 ]したがって、ベゾフ平滑性の仮定の下で下限を導出すれば十分な場合が多い。
一般的な選択肢は:
シェッフェの定理によれば、全変動距離はは-距離そして。
MISEの下限は、パラメトリック統計学におけるクラメール・ラオ下限と比較されることがある。クラメール・ラオ下限は、パラメータの通常の不偏推定量の平均二乗誤差の下限である。:どこはパラメトリックモデルのフィッシャー情報であり、は定数である。したがって、非パラメトリックな速度はパラメトリックな速度よりも遅い。特に大きな次元では、密度の滑らかさが無限大に近づくにつれて、パラメトリックレートに近づきます。
例えば、カーネル密度推定器は、適切な帯域幅の選択の下でソボレフ仮説クラスの下でMISEに関して下限を達成し、したがってミニマックス最適である。[ 14 ]さらに最近では、スコアベースの生成モデルも、全変動とワッサースタイン-1距離でミニマックス収束率を達成することが示されている。-滑らかな分布、、それらはゼロから下方向に離れている。[ 15 ]
回帰分析の設定では、データはペアで発生します。データが独立かつ同一の分布に従うと仮定すると、いつでも書くことができるとは推定される回帰関数であり、 はノイズ変数である。充実感そして一般的に、独立変数は単位立方体内の値を持つと想定されるそして、グリッド上の決定論的な点(決定論的設計)または一様に分布した点(ランダム設計)のいずれかである。したがって、。
上記の設定は二値分類にも適用されます。その場合、観測値は0と1の2つの値のみを取り、推定器が与えられた場合の分類器は次の形式であると仮定する。つまり、推定確率がより大きい(それ以外の場合は 0 )。実際、多くの分類手法はこの形式であり、例えばロジスティック回帰、線形判別分析、二次判別分析、k 近傍法、サポートベクターマシンなどがあります。
統計分析の場合、仮説クラスは次の形式になります。あるノルム化された関数空間に対してそして期待の同時分布に関してそして(または単に)もし決定論的である)。
ノンパラメトリック回帰では、仮説クラスは回帰関数に関する強い仮定を必ず必要とします。そうでない場合、ミニマックス下限は任意に遅くなる可能性があります。たとえば、すなわち、有界関数の集合の場合、任意の推定器に対しておよび任意の零系列存在する[ 16 ]
したがって、一般的な選択肢はは:
一般的な選択肢は:
特定の技術的仮定の下では、以下の下限値が既知である。
一部の局所多項式推定器はMSEに関してミニマックス最適であり、そして下任意の帯域幅がオーダーの場合[ 21 ] kNNはMSEに関してもミニマックス最適である。そして、下考慮される近隣の数がオーダーの場合そしてそれぞれ。[ 22 ]
最適な収束率を達成するために必要なモデルのハイパーパラメータ(例えば、カーネル法の帯域幅やkNNの近傍数など)の選択は、通常、未知の目的関数の平滑性パラメータに依存します。つまり、実際には、ハイパーパラメータを適切に推定しないと、上記の方法は実際には最適ではないということです。
その代わりに、特定の平滑化パラメータだけでなく、異なる値に対してもミニマックス最適収束率を達成する手法に関心がある。仮説クラスを次の形式とする。(例えばまたは)そして最適な収束率すると、推定量のファミリーが定数が存在する場合、ミニマックスの意味で適応的であると呼ばれる。のみに依存するそのため[ 23 ]
言い換えれば、すべての仮説クラスにおいてミニマックス収束率を達成するには、適応型推定器が必要である。ただし、未知のパラメータは考慮しない。引数として。適応型推定器は、仮説クラスのファミリーに対してミニマックス最適となる推定器を採用し、交差検証などの高レベルの手順、または複雑性ペナルティによってハイパーパラメータを推定することによって実現されることが多い。[ 24 ]
初期のノンパラメトリック統計には、中央値(13世紀以前、1599年にエドワード・ライトが推定に使用。中央値§ 歴史を参照)と、ジョン・アーバスノット(1710)による出生時の人間の性比の分析における符号検定(符号検定§歴史を参照)が含まれる。[ 25 ] [ 26 ]