統計学において、適応型または「可変帯域幅」カーネル密度推定は、推定に使用されるカーネルのサイズがサンプルの位置またはテストポイントの位置に応じて変化するカーネル密度推定の一形式です。これは、サンプル空間が多次元である場合に特に効果的な手法です。 [1]
根拠
サンプルのセット が与えられた場合、テストポイント における密度 を推定します。
ここで、nはサンプル数、Kは 「カーネル」、hはその幅、D はの次元数です。カーネルは単純な線形フィルタと考えることができます。
固定フィルタ幅を使用すると、低密度領域ではすべてのサンプルが非常に低い重みでフィルタの末端に収まる一方で、高密度領域では中央領域に重みが 1 に近い過剰な数のサンプルが見つかる可能性があります。この問題を解決するには、サンプル空間のさまざまな領域でカーネルの幅を変更します。これを行うには、バルーン推定とポイントワイズ推定の 2 つの方法があります。バルーン推定では、カーネル幅はテスト ポイントの位置に応じて変化します。ポイントワイズ推定では、カーネル幅はサンプルの位置に応じて変化します。[1]
多変量推定量の場合、パラメータhは、カーネルのサイズだけでなく形状も変化させるように一般化できます。このより複雑なアプローチについては、ここでは説明しません。
バルーン見積もり
カーネル幅を変える一般的な方法は、テスト ポイントの密度に反比例させることです。
ここでkは定数である。推定されたPDFを逆置換し、ガウスカーネル関数を仮定すると、 Wが定数であることがわかる。 [2]
同様の導出は、正規化関数がh D のオーダーである任意のカーネルに対しても成立しますが、 (2 π) D/2項の代わりに異なる定数係数が使用されます。これにより、 k近傍法アルゴリズムの一般化が生成されます。つまり、均一なカーネル関数はKNN 手法を返します。[2]
誤差には分散項とバイアス項の2つの要素があります。分散項は次のように表されます: [1]
- 。
バイアス項は、カーネル幅がサンプル間隔よりもはるかに大きくなる限界で近似関数を評価することによって求められます。実関数にテイラー展開を使用すると、バイアス項は削除されます。
したがって、各推定値の誤差を最小限に抑える最適なカーネル幅を導き出すことができます。
統計分類に使用する
この方法は、統計的分類に適用すると特に効果的です。2つの方法があります。1つ目は、異なる帯域幅パラメータを使用して各クラスのPDFを個別に計算し、テイラーのように比較することです。[3] あるいは、各サンプルのクラスに基づいて合計を分割することもできます。
ここで、c i はi番目のサンプルのクラスです。テスト ポイントのクラスは、最大尤度によって推定できます。
外部リンク
- akde1d.m - 1 次元適応カーネル密度推定用のMatlab m ファイル。
- libAGF -多変量適応カーネル密度推定用のC++ライブラリ。
- akde.m -多変量 (高次元) 変数カーネル密度推定のためのMatlab関数。
参考文献
- ^ abc DG Terrell; DW Scott (1992). 「可変カーネル密度推定」Annals of Statistics 20 ( 3): 1236–1265. doi : 10.1214/aos/1176348768 .
- ^ ab Mills, Peter (2011). 「衛星測定の効率的な統計分類」. International Journal of Remote Sensing . 32 (21): 6109–6132. arXiv : 1202.2194 . Bibcode :2011IJRS...32.6109M. doi :10.1080/01431161.2010.507795. S2CID 88518570.
- ^ Taylor, Charles (1997). 「分類とカーネル密度推定」. Vistas in Astronomy . 41 (3): 411–417. Bibcode :1997VA.....41..411T. doi :10.1016/s0083-6656(97)00046-9.
