カーネル密度推定は、統計学における基本的な問題の 1 つである密度推定、つまり確率密度関数の推定のための ノンパラメトリック手法です。これは、統計特性が改善されたヒストグラム密度推定の一般化と見ることができます。ヒストグラムの他に、他の種類の密度推定には、パラメトリック、スプライン、ウェーブレット、フーリエ級数などがあります。カーネル密度推定は、1950 年代と 1960 年代に単変量データに関する科学文献で初めて導入され[1] [2]、その後広く採用されました。多変量データに対する類似の推定が多変量統計学への重要な追加となることがすぐに認識されました。1990 年代と 2000 年代に行われた研究に基づいて、多変量カーネル密度推定は、単変量カーネル密度推定に匹敵する成熟度に達しています。[3] [4] [5]
モチベーション
ヒストグラムの構築方法を説明するために、50 点の合成 二変量データセットを例に挙げます。このためには、アンカー ポイント (ヒストグラム グリッドの左下隅) を選択する必要があります。左側のヒストグラムでは (-1.5, -1.5) を選択し、右側のヒストグラムでは、アンカー ポイントを両方向に 0.125 ずつシフトして (-1.625, -1.625) にします。両方のヒストグラムのビン幅は 0.5 なので、違いはアンカー ポイントの変更によるものだけです。色分けは、ビンに含まれるデータ ポイントの数を示します。0 = 白、1 = 淡黄色、2 = 明るい黄色、3 = オレンジ、4 = 赤です。左側のヒストグラムでは、上半分の密度が下半分よりも高いように見えますが、右側のヒストグラムではその逆であり、ヒストグラムがアンカー ポイントの配置に非常に敏感であることが確認できます。[6]

このアンカー ポイント配置の問題に対する 1 つの解決策は、ヒストグラムのビニング グリッドを完全に削除することです。下の図の左側では、カーネル (灰色の線で表示) が上記の 50 個のデータ ポイントのそれぞれを中心としています。これらのカーネルを合計した結果が右側の図に示されており、これがカーネル密度推定値です。カーネル密度推定値とヒストグラムの最も顕著な違いは、前者にはビニング グリッドによって誘発される人工物が含まれていないため、解釈が容易なことです。色付きの等高線は、それぞれの確率質量を含む最小の領域に対応しています。赤 = 25%、オレンジ + 赤 = 50%、黄色 + オレンジ + 赤 = 75% であり、単一の中央領域に最も高い密度が含まれていることを示しています。

密度推定の目的は、有限のデータ サンプルを取得し、データが観測されていない場所も含め、あらゆる場所で基礎となる確率密度関数について推論することです。カーネル密度推定では、各データ ポイントの寄与は、単一のポイントからそれを囲む空間領域に平滑化されます。個別に平滑化された寄与を集計すると、データの構造とその密度関数の全体像が得られます。以下では、このアプローチによって基礎となる密度関数の妥当な推定値が得られることを説明します。
意味
前の図はカーネル密度推定のグラフ表現であり、ここではこれを正確に定義する。x 1、x 2、 ...、x n を密度関数ƒで記述される共通分布から抽出されたd変量ランダムベクトルのサンプルとする。カーネル密度推定は次のように定義される。
どこ
- x = ( x 1 , x 2 , …, x d ) T、 x i = ( x i 1 , x i 2 , …, x id ) T、i = 1, 2, …, nはdベクトルです
- Hは対称かつ正定値の帯域幅(または平滑化)d×d行列です。
- K は対称多変量密度であるカーネル関数です。
- 。
カーネル関数Kの選択はカーネル密度推定量の精度には重要ではないので、全体を通して標準の多変量正規カーネルを使用します。 、ここで H は共分散行列の役割を果たします。一方、帯域幅行列Hの選択は、誘導される平滑化の量と方向を制御するため、精度に影響を与える最も重要な要素です。[3] : 36–39 帯域幅行列も方向を誘導するという点は、1D カーネルでは方向が定義されていないため、多変量カーネル密度推定と単変量類似体との基本的な違いです。これにより、この帯域幅行列のパラメーター化が選択されます。3 つの主なパラメーター化クラス (複雑さの昇順) は、正のスカラーと単位行列の積のクラスS、主対角線上に正のエントリを持つ対角行列D 、対称正定値行列Fです。 Sクラスカーネルはすべての座標方向に同じ量のスムージングを適用し、Dカーネルは各座標で異なる量のスムージングを許可し、Fカーネルは任意の量と方向のスムージングを許可します。歴史的には、計算上の理由からSカーネルとDカーネルが最も普及していますが、研究によると、より一般的なFクラスカーネルを使用すると精度が大幅に向上することが示されています。[7] [8]

最適な帯域幅マトリックスの選択
帯域幅行列を選択するための最も一般的に使用される最適基準は、MISEまたは平均積分二乗誤差である。
これは一般に閉じた形式の表現を持たないので、その漸近近似(AMISE)を代理として使うのが普通である。
どこ
- 、Kが正規核のとき、R ( K ) = (4 π ) −d /2である。
- 、
- ここで、I d はd × dの 単位行列であり、正規カーネルではm 2 = 1である。
- D 2 ƒ は、 ƒの2次偏微分のd × dヘッセ行列である。
- は、 ƒの4次偏微分を積分したd 2 × d 2行列である。
- vecは行列の列を1つのベクトルに積み重ねるベクトル演算子です。例:
MISE [3] : 97 に対するAMISE近似の品質は次のように与えられる。
ここで、o は通常の小文字の o 表記を示します。経験的に、この記述は、サンプル サイズn → ∞ として AMISE が MISE の「良い」近似値であることを意味します。
任意の適切な帯域幅セレクタH は、要素ごとに大きな O 表記を適用してH = O ( n −2/( d +4) )であることが示されます。これを MISE 式に代入すると、最適な MISE はO ( n −4/( d +4) ) になります。[3] : 99–100 したがって、 n → ∞ では、MISE → 0、つまりカーネル密度推定値は平均二乗収束し、したがって確率的にも真の密度fに収束します。これらの収束モードは、カーネル法が適切な密度推定値につながるという動機のセクションでの記述を裏付けています。理想的な最適な帯域幅セレクタは
この理想的なセレクターには未知の密度関数ƒが含まれているため、直接使用することはできません。AMISE のさまざまな推定値から、さまざまなデータ ベースの帯域幅セレクターが生まれます。ここでは、実際に最も広く適用できることがわかっている 2 つのクラスのセレクター、つまり平滑化クロス検証セレクターとプラグイン セレクターに焦点を当てます。
プラグイン
AMISEのプラグイン(PI)推定値は、Ψ 4をその推定値に置き換えることによって形成される。
ここで である。したがって はプラグインセレクタである。[9] [10]これらの参考文献には、パイロット帯域幅行列Gの最適推定アルゴリズムも含まれており、確率的にH AMISEに収束することが示されている。
平滑化されたクロス検証
平滑化クロスバリデーション(SCV)は、クロスバリデーション技術のより大きなクラスのサブセットです。SCV推定量は、プラグイン推定量と2番目の項で異なります。
これがSCVセレクタです。[10] [11] これらの参考文献には、パイロット帯域幅行列Gの最適推定アルゴリズムも含まれており、確率的にH AMISEに収束することを確立しています。
経験則
シルバーマンの経験則では、 を使用することが推奨されています。ここで、 は i 番目の変数の標準偏差、は次元数、 です。スコットの規則は です。
漸近解析
最適帯域幅選択のセクションでは、MISEを導入しました。その構成は、密度推定量の期待値と分散に依存しています[3] :97
ここで、*は2つの関数間の畳み込み演算子であり、
これら2つの式が明確に定義されるためには、Hのすべての要素が0に近づくことと、nが無限大に近づくにつれてn −1 | H | −1/2が0に近づくことが必要である。これら2つの条件を仮定すると、期待値は真の密度fに近づく、つまりカーネル密度推定量は漸近的に不偏であり、分散は0に近づくことがわかる。標準的な平均二乗値分解を使用すると、
MSE は 0 に近づくことがわかり、これはカーネル密度推定量が (平均二乗) 整合しており、したがって確率的に真の密度fに収束することを意味します。MSE の 0 への収束率は、前述の MISE 率O ( n −4/(d+4) ) と必然的に同じであるため、密度推定量のfへの収束率はO p (n −2/( d +4) )です 。ここでO p は確率の順序を表します。これにより、点ごとの収束が確立されます。関数の収束は、MISE の挙動を考慮し、十分な規則性があれば積分が収束率に影響を与えないことに注目することで同様に確立されます。
検討したデータに基づく帯域幅セレクタの場合、ターゲットはAMISE帯域幅マトリックスです。データに基づくセレクタは、相対速度O p ( n − α )、α > 0 でAMISEセレクタに収束すると言います。
プラグインセレクタと平滑化クロスバリデーションセレクタ(単一のパイロット帯域幅Gが与えられた場合)は両方とも相対速度Op(n −2/(d +6))で収束することが確立されている[10] [12]つまり、これらのデータベースセレクタは両方とも一貫した推定値です。
全帯域幅行列による密度推定

Rのksパッケージ[13]は、プラグインと平滑化クロスバリデーションセレクター(その他)を実装しています。このデータセット(Rの基本配布に含まれています)には、米国イエローストーン国立公園のオールドフェイスフルガイザーの噴火継続時間(分)と次の噴火までの待ち時間(分)の2つの測定値を含む272のレコードが含まれています。
コード フラグメントは、プラグイン バンド幅マトリックスを使用してカーネル密度推定値を計算します。ここでも、色付きの等高線は、それぞれの確率質量を含む最小領域に対応します。赤 = 25%、オレンジ + 赤 = 50%、黄色 + オレンジ + 赤 = 75%。SCV セレクターを計算するには、を に置き換えます。これは、この例のプラグイン推定値とほぼ同じであるため、ここでは表示されません。
HpiHscv
ライブラリ( ks )
データ(忠実)
H <- Hpi ( x =忠実) fhat <- kde ( x =忠実、H = H )プロット( fhat 、display = "filled.contour" 、drawpoints = TRUE 、cex = 0.5 、pch = 16 、col.pt = 1 )
対角帯域幅行列による密度推定

ランダムに生成された500個の点から、ガウス混合分布 (4π ) −1exp ( −1⁄2 ( x12 + x22 ) ) +( 4π ) −1exp (−1⁄2 ( ( x1-3.5 ) 2 + x22 ) )の密度を推定することを検討する。2次元データにはMatlabルーチンを使用する。このルーチンは、2次ガウスカーネル用に特別に設計された自動帯域幅選択法である。[ 14 ]図 は、自動的に選択された帯域幅を使用した結果の結合密度推定値を示している。
例の Matlab スクリプト
関数 kde2d.m を現在のディレクトリにダウンロードして保存した後、Matlab で次のコマンドを入力します。
すべてクリア% 合成データを生成するdata =[ randn ( 500 , 2 ); randn ( 500 , 1 ) + 3.5 , randn ( 500 , 1 );]; % 現在のディレクトリに保存されているルーチンを呼び出す[帯域幅,密度, X , Y ]= kde2d ( data ); % データと密度推定値をプロットするcontour3 ( X , Y ,密度, 50 )、ホールドオンplot ( data (:, 1 ), data (:, 2 ), 'r.' , 'MarkerSize' , 5 )
代替最適基準
MISEは、密度推定値と真の密度関数fとの間の期待される積分L 2距離である。これは、扱いやすさとほとんどのソフトウェアがMISEベースの帯域幅セレクタを実装していることから、最も広く使用されている。MISEが適切な尺度ではない場合をカバーする代替の最適性基準がある。[4] :34–37、78 同等のL 1尺度である平均積分絶対誤差は、
その数学的解析はMISEのものよりかなり難しい。実際には、その利得は重要ではないようだ。[15] L∞ノルムは平均一様絶対誤差である 。
尤度誤差基準は、平均カルバック・ライブラー距離に基づくものを含む。
平均ヘリンガー距離
KLはクロスバリデーション法を用いて推定することができるが、KLクロスバリデーションセレクターは、たとえ有界密度関数に対して一貫性を保っていたとしても、最適ではない可能性がある。 [17] MHセレクターは文献で簡単に検討されている。[18]
これらの最適性基準はすべて距離に基づいた尺度であり、必ずしもより直感的な近さの概念に対応するわけではないため、この懸念に応じてより視覚的な基準が開発されてきました。[19]
客観的かつデータに基づいたカーネル選択

最近の研究では、カーネルとその帯域幅は、分布の形について何の仮定もせずに、入力データ自体から最適かつ客観的に選択できることが示されています。[20] 結果として得られるカーネル密度推定値は、サンプルが追加されるにつれて、真の確率分布に急速に収束します。これは、パラメトリック推定値に期待される速度に近いものです。[20] [21] [22] このカーネル推定値は、単変量サンプルでも多変量サンプルでも同様に機能します。最適なカーネルは、フーリエ空間で、データのフーリエ変換、経験的特性関数の観点から、最適な減衰関数(カーネルのフーリエ変換)として定義されます(カーネル密度推定を参照)。
[22]
ここで、Nはデータ ポイントの数、dは次元 (変数) の数、は「受け入れられる頻度」の場合は 1、それ以外の場合は 0 に等しいフィルターです。このフィルター関数を定義する方法はさまざまですが、単変量または多変量サンプルに機能する単純な方法は「最低連続ハイパーボリューム フィルター」と呼ばれ、受け入れられる頻度が原点を囲む連続した周波数のサブセットのみになるように選択されます(このフィルター関数と他のフィルター関数については [22]を参照してください)。
経験的特性関数(ECF)の直接計算は、本質的にデータサンプルの直接フーリエ変換を伴うため、遅いことに注意してください。しかし、ECFは非均一高速フーリエ変換(nuFFT)法を使用して正確に近似できることがわかっています。 [21] [22]これにより、計算速度が数桁向上します(問題の次元によって異なります)。この客観的KDE法とnuFFTベースのECF近似の組み合わせは、文献ではfastKDEと呼ばれています。 [22]

参照
- カーネル密度推定 – 単変量カーネル密度推定。
- 可変カーネル密度推定 – 可変帯域幅のカーネルを使用した多変量密度の推定
参考文献
- ^ Rosenblatt, M. (1956). 「密度関数のノンパラメトリック推定に関する考察」Annals of Mathematical Statistics . 27 (3): 832–837. doi : 10.1214/aoms/1177728190 .
- ^ Parzen, E. (1962). 「確率密度関数とモードの推定について」Annals of Mathematical Statistics . 33 (3): 1065–1076. doi : 10.1214/aoms/1177704472 .
- ^ abcde Wand, MP; Jones, MC (1995).カーネルスムージング. ロンドン: Chapman & Hall/CRC. ISBN 9780412552700。
- ^ ab Simonoff, JS (1996).統計におけるスムージング法. Springer. ISBN 9780387947167。
- ^ Chacón, JE および Duong, T. (2018)。多変量カーネルスムージングとその応用。Chapman & Hall/ CRC。ISBN 9781498763011。
{{cite book}}: CS1 maint: multiple names: authors list (link) - ^ Silverman, BW (1986).統計とデータ分析のための密度推定. Chapman & Hall/CRC. pp. 7–11. ISBN 9780412246203。
- ^ Wand, MP; Jones, MC (1993). 「二変量カーネル密度推定における平滑化パラメータ化の比較」アメリカ統計学会誌. 88 (422): 520–528. doi :10.1080/01621459.1993.10476303. JSTOR 2290332.
- ^ Duong, T.; Hazelton, ML (2003). 「二変量カーネル密度推定のためのプラグイン帯域幅行列」.ノンパラメトリック統計ジャーナル. 15 : 17–30. doi :10.1080/10485250306039.
- ^ Wand, MP; Jones, MC (1994). 「多変量プラグイン帯域幅選択」.計算統計. 9 : 97–177.
- ^ abc Duong, T.; Hazelton, ML (2005). 「多変量カーネル密度推定のためのクロス検証帯域幅行列」. Scandinavian Journal of Statistics . 32 (3): 485–506. doi :10.1111/j.1467-9469.2005.00445.x.
- ^ Hall, P.; Marron, J.; Park, B. (1992). 「平滑化クロスバリデーション」.確率論と関連分野. 92 : 1–20. doi : 10.1007/BF01205233 .
- ^ Duong, T.; Hazelton, ML (2005). 「多変量カーネル密度推定における制約のない帯域幅マトリックスセレクタの収束率」. Journal of Multivariate Analysis . 93 (2): 417–433. doi : 10.1016/j.jmva.2004.04.004 .
- ^ Duong, T. (2007). 「ks: Rにおけるカーネル密度推定とカーネル判別分析」.統計ソフトウェアジャーナル. 21 (7). doi : 10.18637/jss.v021.i07 .
- ^ Botev, ZI; Grotowski, JF; Kroese, DP (2010). 「拡散によるカーネル密度推定」Annals of Statistics . 38 (5): 2916–2957. arXiv : 1011.2602 . doi :10.1214/10-AOS799.
- ^ Hall, P.; Wand, MP (1988). 「ノンパラメトリック密度推定におけるL1距離の最小化」. Journal of Multivariate Analysis . 26 :59–88. doi : 10.1016/0047-259X(88)90073-5 .
- ^ Cao, R.; Cuevas, A.; Manteiga, WG (1994). 「密度推定におけるいくつかの平滑化方法の比較研究」.計算統計とデータ分析. 17 (2): 153–176. doi :10.1016/0167-9473(92)00066-Z.
- ^ Hall, P. (1989). 「Kullback-Leibler損失と密度推定について」Annals of Statistics . 15 (4): 589–605. doi : 10.1214/aos/1176350606 .
- ^ Ahmad, IA; Mugdadi, AR (2006). 「カーネル推定における帯域幅選択の誤差基準としての加重ヘリンガー距離」.ノンパラメトリック統計ジャーナル. 18 (2): 215–226. doi :10.1080/10485250600712008.
- ^ Marron, JS; Tsybakov, A. (1996). 「定性的スムージングのための視覚的誤差基準」.アメリカ統計学会誌. 90 (430): 499–507. doi :10.2307/2291060. JSTOR 2291060.
- ^ ab Bernacchia, Alberto; Pigolotti, Simone (2011-06-01). 「密度推定のための自己整合的方法」. Journal of the Royal Statistical Society, Series B . 73 (3): 407–422. arXiv : 0908.3856 . doi :10.1111/j.1467-9868.2011.00772.x. ISSN 1467-9868.
- ^ ab O'Brien, Travis A.; Collins, William D.; Rauscher, Sara A.; Ringler, Todd D. (2014-11-01). 「nuFFT を使用した ECF の計算コストの削減: 高速かつ客観的な確率密度推定法」.計算統計とデータ分析. 79 : 222–234. doi : 10.1016/j.csda.2014.06.002 .
- ^ abcde O'Brien, Travis A.; Kashinath, Karthik; Cavanaugh, Nicholas R.; Collins, William D.; O'Brien, John P. (2016). 「高速かつ客観的な多次元カーネル密度推定法: fastKDE」(PDF) .計算統計とデータ分析. 101 : 148–160. doi : 10.1016/j.csda.2016.02.014 .
外部リンク
- 「Multivariate Kernel Smoothing and Its Applications」は、密度推定を含むカーネルスムージングの多くのトピックを網羅した包括的な書籍です。R の ks パッケージ コード スニペットが含まれています。
- kde2d.m 二変量カーネル密度推定のためのMatlab関数。
- libagf多変量、可変帯域幅カーネル密度推定用のC++ライブラリ。
- akde.m多変量、可変帯域幅カーネル密度推定用のMatlab m ファイル。
- PyQt-Fit パッケージの helit および pyqt_fit.kde モジュールは、多変量カーネル密度推定用のPythonライブラリです。
