意味 させてx = ( x 1 、 x 2 、 x 3 、 。 。 。 ) {\displaystyle \mathbf {x} =\left(x_{1},x_{2},x_{3},...\right)} は、任意の点xにおける未知の 密度 f を持つ単変量分布から抽出された、独立同分布の サンプルである。我々は、この関数f の形状を推定することに関心がある。そのカーネル密度推定量は 次の通りである。 f ^ h ( x ) = 1 n ∑ 私 = 1 n K h ( x − x 私 ) = 1 n h ∑ 私 = 1 n K ( x − x 私 h ) 、 {\displaystyle {\hat {f}}_{h}(x)={\frac {1}{n}}\sum _{i=1}^{n}K_{h}(x-x_{i})={\frac {1}{nh}}\sum _{i=1}^{n}K{\left({\frac {x-x_{i}}{h}}\right)},} ここで、K はカーネル (非負関数) であり、h > 0は帯域 幅または単に幅と呼ばれる平滑化 パラメータです。 [ 3 ] 添え字h が付いたカーネルはスケーリングされたカーネル と呼ばれ、 K h ( x ) = 1 / h K ( x / h ) と定義されます。直感的には、データ が許す限り h を 小さくしたいのですが、推定量のバイアスと分散の間には常にトレードオフがあります。帯域幅の選択については、以下でさらに詳しく説明します。
カーネル関数 には、一様カーネル、三角カーネル、バイウェイトカーネル、トライウェイトカーネル、エパネチニコフカーネル (放物線カーネル)、正規カーネルなど、さまざまな種類が一般的に使用されています。エパネチニコフカーネルは平均二乗誤差の意味で最適ですが[ 4 ] 、前述のカーネルでは効率の低下は小さいです[ 5 ] 。正規カーネルは数学的に扱いやすいためよく使用され、K ( x ) = ϕ ( x ) となります。ここでϕは 標準正規 密度関数です。カーネル密度推定器は次のようになります。 f ^ h ( x ) = 1 n ∑ 私 = 1 n 1 h 2 π exp ( − ( x − x 私 ) 2 2 h 2 ) 、 {\displaystyle {\hat {f}}_{h}(x)={\frac {1}{n}}\sum _{i=1}^{n}{\frac {1}{h{\sqrt {2\pi }}}}\exp \left({\frac {-(x-x_{i})^{2}}{2h^{2}}}\right),} どこh {\displaystyle h} はサンプルの標準偏差ですx {\displaystyle \mathbf {x} } 。
カーネル密度推定の構築は、密度推定以外の分野でも解釈が見出される。[ 6 ] 例えば、熱力学では、これは各データ点位置 x i に熱カーネル( 熱方程式 の基本解)を配置したときに発生する熱量に相当する。同様の手法は、多様体学習 (拡散マップ など)のために点群上の離散ラプラス演算子 を構築するためにも使用される。
例 カーネル密度推定はヒストグラム と密接に関連していますが、適切なカーネルを用いることで、滑らかさや連続性といった特性を持たせることができます。以下の図は、これら6つのデータポイントに基づいて、この関係性を示しています。
ヒストグラムを作成する場合、まず水平軸をデータの範囲をカバーする小区間(ビン)に分割します。この場合、幅2のビンが6つあります。データ点がこの区間内に含まれる場合、高さ1/12のボックスが配置されます。同じビン内に複数のデータ点が含まれる場合は、ボックスが積み重ねられます。
カーネル密度推定では、標準偏差が 1.5 の正規カーネル (赤い破線で示されている) を各データ点x i に配置します。カーネルを合計してカーネル密度推定 (青い実線) を作成します。カーネル密度推定の滑らかさ (ヒストグラムの離散性と比較して) は、カーネル密度推定が連続確率変数の真の基礎となる密度に速く収束することを示しています。[ 7 ]
同じデータを用いて作成したヒストグラム(左)とカーネル密度推定値(右)の比較。6つの個々のカーネルは赤い破線で示され、カーネル密度推定値は青い曲線で示されている。データ点は横軸のラグプロットである。
帯域幅の選択 標準正規分布からランダムに抽出した 100 点のサンプルに対する、異なる帯域幅でのカーネル密度推定 (KDE)。灰色: 真の密度 (標準正規分布)。赤: h=0.05 の KDE。黒: h=0.337 の KDE。緑: h=2 の KDE。 カーネルの帯域幅は自由パラメータであり、結果 として 得られる推定値に大きな影響を与えます。その影響を説明するために、標準正規分布からシミュレーションされた ランダムサンプルを取得します( ラグプロット の横軸の青いスパイクでプロットされています)。灰色の曲線は真の密度(平均0、分散1の正規密度)です。これに対し、赤い曲線は、帯域幅h = 0.05を使用しているために生じる偽のデータアーティファクトが多すぎるため、平滑化が不十分です。緑の曲線は、帯域幅 h = 2 を使用しているため、基となる構造の多くが不明瞭になっているため、平滑化が過剰です。帯域幅 h = 0.337の黒い曲線は、密度推定値が真の密度に近いため、最適に平滑化されていると考えられます。極限では極端な状況が発生します。h → 0 {\displaystyle h\to 0} (平滑化なし)推定値は、分析対象サンプルの座標を中心とするn個の デルタ関数 の合計である。もう一方の極端な極限ではh → ∞ {\displaystyle h\to \infty } 推定値は、サンプルの平均値を中心とした、使用されたカーネルの形状を保持します(完全に滑らかです)。
このパラメータを 選択するために最も一般的に使用される最適性基準は、期待L2 リスク関数 、または平均積分二乗誤差 と呼ばれるものです。
ミーズ ( h ) = E [ ∫ ( f ^ h ( x ) − f ( x ) ) 2 d x ] {\displaystyle \operatorname {MISE} (h)=\operatorname {E} \!\left[\int \!{\left({\hat {f}}\!_{h}(x)-f(x)\right)}^{2}dx\right]}
f とK に関する弱い仮定の下で( f は一般に未知の実密度関数)、[ 1 ] [ 2 ]
ミーズ ( h ) = アミセ ( h ) + o ( ( n h ) − 1 + h 4 ) {\displaystyle \operatorname {MISE} (h)=\operatorname {AMISE} (h)+{\mathcal {o}}{\left((nh)^{-1}+h^{4}\right)}}
ここで、o は小文字の o 表記 、n は サンプルサイズ (上記参照) です。AMISE は漸近 MISE、つまり、 上位 2 つの項です。
アミセ ( h ) = R ( K ) n h + 1 4 m 2 ( K ) 2 h 4 R ( f 」 ) {\displaystyle \operatorname {AMISE} (h)={\frac {R(K)}{nh}}+{\frac {1}{4}}m_{2}(K)^{2}h^{4}R(f'')}
どこR ( g ) = ∫ g ( x ) 2 d x {\textstyle R(g)=\int g(x)^{2}\,dx} 関数g の場合、m 2 ( K ) = ∫ x 2 K ( x ) d x {\textstyle m_{2}(K)=\int x^{2}K(x)\,dx} そしてf 」 {\displaystyle f''} は、f {\displaystyle f} そしてK {\displaystyle K} はカーネルである。この AMISE の最小値は、この微分方程式の解である。
∂ ∂ h アミセ ( h ) = − R ( K ) n h 2 + m 2 ( K ) 2 h 3 R ( f 」 ) = 0 {\displaystyle {\frac {\partial }{\partial h}}\operatorname {AMISE} (h)=-{\frac {R(K)}{nh^{2}}}+m_{2}(K)^{2}h^{3}R(f'')=0}
または
h アミセ = R ( K ) 1 / 5 m 2 ( K ) 2 / 5 R ( f 」 ) 1 / 5 n − 1 / 5 = C n − 1 / 5 {\displaystyle h_{\operatorname {AMISE} }={\frac {R(K)^{1/5}}{m_{2}(K)^{2/5}R(f'')^{1/5}}}n^{-1/5}=Cn^{-1/5}}
AMISE式もh AMISE 式も、未知の密度関数を含むため、直接使用することはできません。f {\displaystyle f} またはその2階微分f 」 {\displaystyle f''} その困難を克服するために、帯域幅を選択するためのさまざまな自動データベース手法が開発されてきました。それらの有効性を比較するためにいくつかのレビュー研究が行われ、[ 8 ] [ 9 ] [ 10 ] [ 11 ] [ 12 ] [ 13 ] [ 14 ] プラグインセレクタ[ 6 ] [ 15 ] [ 16 ] とクロスバリデーション セレクタ[ 17 ] [ 18 ] [ 19 ] が幅広いデータセットで最も有用であるという一般的な合意が得られています。
AMISE と 同じ漸近次数n −1/5を持つ 任意 の帯域幅h をAMISE に代入すると、 AMISE( h ) = O ( n −4/5 ) となります。ここでO はビッグ O 表記 です。弱い仮定の下では、カーネル推定器よりも速い速度で収束するノンパラメトリック推定器は存在しないことが示されます。[ 20 ] n −4/5 の収束速度は、パラメトリック法の典型的な n −1 の 収束速度よりも遅いことに注意してください。
帯域幅を固定せず、推定値の位置(バルーン推定器)またはサンプルの位置(ポイントワイズ推定器)に応じて変化させると、適応型または可変帯域幅カーネル密度推定 と呼ばれる特に強力な手法が得られます。
裾の重い分布のカーネル密度推定における帯域幅の選択は比較的難しい。[ 21 ]
経験則に基づく帯域幅推定器 ガウス基底関数を使用して単変量データを近似し、推定される基礎となる密度がガウスである場合、 h の最適な選択(つまり、平均積分二乗誤差 を最小化する帯域幅) は次のとおりです。[ 22 ]
h = ( 4 σ ^ 5 3 n ) 1 / 5 ≈ 1.06 σ ^ n − 1 / 5 、 {\displaystyle h={\left({\frac {4{\hat {\sigma }}^{5}}{3n}}\right)}^{1/5}\approx 1.06\,{\hat {\sigma }}\,n^{-1/5},}
1h {\displaystyle h} の値は、裾の長い歪んだ分布や二峰性混合分布への適合性を向上させる場合に、より頑健であると考えられています。これは多くの場合、標準偏差を置き換えることによって経験的に行われます。 σ ^ {\displaystyle {\hat {\sigma }}} パラメータによってA {\displaystyle A} 下に:
A = ミニ ( σ ^ 、 私 Q R 1.34 ) {\displaystyle A=\min \left({\hat {\sigma }},{\frac {\mathrm {IQR} }{1.34}}\right)} ここで、IQR は四分位範囲を表す。
経験則に基づく帯域幅と、方程式を解くことに基づく帯域幅の比較。 モデルを改善するもう一つの方法は、係数を1.06から0.9に減らすことです。そうすると、最終的な式は次のようになります。
h = 0.9 ミニ ( σ ^ 、 私 Q R 1.34 ) n − 1 / 5 {\displaystyle h=0.9\,\min \left({\hat {\sigma }},{\frac {\mathrm {IQR} }{1.34}}\right)\,n^{-1/5}} どこn {\displaystyle n} はサンプルサイズです。
この近似は、正規分布近似 、ガウス近似、またはシルバーマン の経験則 と呼ばれます。[ 22 ] この経験則は計算が容易ですが、密度が正規分布に近くない場合、大きく不正確な推定値が得られる可能性があるため、注意して使用する必要があります。たとえば、二峰性ガウス混合モデルを推定する場合などです。 1 2 2 π e − 1 2 ( x − 10 ) 2 + 1 2 2 π e − 1 2 ( x + 10 ) 2 {\displaystyle {\frac {1}{2{\sqrt {2\pi }}}}e^{-{\frac {1}{2}}(x-10)^{2}}+{\frac {1}{2{\sqrt {2\pi }}}}e^{-{\frac {1}{2}}(x+10)^{2}}} 200 点のサンプルから、右の図は真の密度と 2 つのカーネル密度推定値を示しています。1 つは経験則帯域幅を使用し、もう 1 つは方程式を解く帯域幅を使用しています。[ 6 ] [ 16 ] 経験則帯域幅に基づく推定値は著しく過剰平滑化されています。
特性関数密度推定器との関係 サンプル( x 1 , x 2 , ..., x n )が与えられた場合、 特性関数 φ ( t ) = E[ e itX ] を次のように 推定するのが自然である。φ ^ ( t ) = 1 n ∑ j = 1 n e 私 t x j {\displaystyle {\hat {\varphi }}(t)={\frac {1}{n}}\sum _{j=1}^{n}e^{itx_{j}}} 特性関数が分かれば、フーリエ変換の 公式 を用いて対応する確率密度関数を求めることができる。この逆変換公式を適用する際の難点は、推定値が発散積分につながることである。φ ^ ( t ) {\displaystyle {\hat {\varphi }}(t)} t が大きい場合、信頼性が低い。この問題を回避するために、推定器はφ ^ ( t ) {\displaystyle {\hat {\varphi }}(t)} は減衰関数ψ h ( t ) = ψ ( ht ) で乗算されます。この減衰関数は原点で 1 であり、無限遠で 0 になります。「帯域幅パラメータ」h は、 関数をどれだけ速く減衰させようとするかを制御します。φ ^ ( t ) {\displaystyle {\hat {\varphi }}(t)} 特にh が小さい場合、ψh ( t )は t の広い範囲でほぼ1となり、これは次のことを意味します。φ ^ ( t ) {\displaystyle {\hat {\varphi }}(t)} t の最も重要な領域では、実質的に変化していない。
関数ψ の最も一般的な選択肢は、一様関数ψ ( t ) = 1 {−1 ≤ t ≤ 1} (これは実質的に逆変換式の積分区間を[ −1/ h , 1/ h ] に切り捨てることを意味します)またはガウス関数 ψ ( t ) = e −πt 2 のいずれかです。関数ψ が選択されると、逆変換式を適用でき、密度推定値は次のようになります。 f ^ ( x ) = 1 2 π ∫ − ∞ + ∞ φ ^ ( t ) ψ h ( t ) e − 私 t x d t = 1 2 π ∫ − ∞ + ∞ 1 n ∑ j = 1 n e 私 t ( x j − x ) ψ ( h t ) d t = 1 n h ∑ j = 1 n 1 2 π ∫ − ∞ + ∞ e − 私 ( h t ) x − x j h ψ ( h t ) d ( h t ) = 1 n h ∑ j = 1 n K ( x − x j h ) 、 {\displaystyle {\begin{aligned}{\hat {f}}(x)&={\frac {1}{2\pi }}\int _{-\infty }^{+\infty }{\hat {\varphi }}(t)\psi _{h}(t)e^{-itx}\,dt\\[1ex]&={\frac {1}{2\pi }}\int _{-\infty }^{+\infty }{\frac {1}{n}}\sum _{j=1}^{n}e^{it(x_{j}-x)}\psi (ht)\,dt\\[1ex]&={\frac {1}{nh}}\sum _{j=1}^{n}{\frac {1}{2\pi }}\int _{-\infty }^{+\infty }e^{-i(ht){\frac {x-x_{j}}{h}}}\psi (ht)\,d(ht)\\[1ex]&={\frac {1}{nh}}\sum _{j=1}^{n}K{\left({\frac {x-x_{j}}{h}}\right)},\end{aligned}}}
ここで、K は減衰関数ψ のフーリエ変換 である。したがって、カーネル密度推定量は特性関数密度推定量と一致する。
カーネル量子状態推定 カーネル密度推定は、繰り返しホモダイン測定によって回転場直交位相のサンプルを生成する 連続変数 量子状態トモグラフィー に適用されてきた。実際の測定パラメータの場合( μ 、 ν ) {\displaystyle (\mu ,\nu )} 、求積法の観測量は
X μ 、 ν = μ q + ν p 。 {\displaystyle X_{\mu ,\nu }=\mu q+\nu p.} その測定結果は通常の確率密度に従う。W ( x ∣ μ 、 ν ) {\displaystyle {\mathcal {W}}(x\mid \mu ,\nu )} これはシンプレクティックトモグラム として知られています。異なる測定設定でのトモグラムの集合は情報的に完全であり、したがって量子状態の別の表現を提供します。[ 23 ]
独立した直交測定の場合X 1 、 μ 、 ν 、 … 、 X n 、 μ 、 ν {\displaystyle X_{1,\mu ,\nu },\ldots ,X_{n,\mu ,\nu }} 固定設定で得られた断層像は、次のように推定できる。
W ^ n 、 h ( x ∣ μ 、 ν ) = 1 n h ∑ j = 1 n K μ 、 ν ( x − X j 、 μ 、 ν h ) 、 {\displaystyle {\widehat {\mathcal {W}}}_{n,h}(x\mid \mu ,\nu )={\frac {1}{nh}}\sum _{j=1}^{n}K_{\mu ,\nu }\left({\frac {x-X_{j,\mu ,\nu }}{h}}\right),} どこK μ 、 ν \displaystyle K_{\mu ,\nu }} カーネルであり、h {\displaystyle h} は帯域幅です。この処理では、直交密度があらかじめ定められたパラメータ族に属する必要がないため、多峰性および非ガウス型の測定分布に対応できます。
断層撮影像の特性関数 はフーリエ変換であり、
ϕ ( t ; μ 、 ν ) = ∫ − ∞ ∞ W ( x ∣ μ 、 ν ) e 私 t x 、 d x 。 {\displaystyle \phi (t;\mu ,\nu )=\int _{-\infty }^{\infty }{\mathcal {W}}(x\mid \mu ,\nu )e^{itx},dx.} 固定値ごとに( μ 、 ν ) {\displaystyle (\mu ,\nu )} これは、測定された確率変数の特性関数です。X μ 、 ν {\displaystyle X_{\mu ,\nu }} それは常に存在し、標準条件を満たします。ϕ ( 0 ; μ 、 ν ) = 1 {\displaystyle \phi (0;\mu ,\nu )=1} 、| ϕ ( t ; μ 、 ν ) | ≤ 1 {\displaystyle |\phi (t;\mu ,\nu )|\leq 1} 、 そしてϕ ( − t ; μ 、 ν ) = ϕ ( t ; μ 、 ν ) * {\displaystyle \phi (-t;\mu ,\nu )=\phi (t;\mu ,\nu )^{*}} 断層画像では、値はϕ ( 1 ; μ 、 ν ) {\displaystyle \phi (1;\mu ,\nu )} 位相空間全体にわたって、採用された慣例に従う限り、状態のウィグナー表現に関連付けられた特性関数とも一致する。[ 23 ]
カーネル密度推定量のフーリエ変換を行うと、特性関数のカーネル推定量が得られる。
ϕ ^ n 、 h ( t ; μ 、 ν ) = ϕ ^ X 、 n ( t ; μ 、 ν ) ϕ K ( t h ; μ 、 ν ) 、 {\displaystyle {\widehat {\phi }}_{n,h}(t;\mu ,\nu )={\widehat {\phi }}_{X,n}(t;\mu ,\nu )\phi _{K}(th;\mu ,\nu ),} どこ
ϕ ^ X 、 n ( t ; μ 、 ν ) = 1 n ∑ j = 1 n e 私 t X j 、 μ 、 ν {\displaystyle {\widehat {\phi }}_{X,n}(t;\mu ,\nu )={\frac {1}{n}}\sum _{j=1}^{n}e^{itX_{j,\mu ,\nu }}} は経験的特性関数であり、
ϕ K ( t h ; μ 、 ν ) = ∫ − ∞ ∞ K μ 、 ν ( z ) e 私 t h z 、 d z {\displaystyle \phi _{K}(th;\mu ,\nu )=\int _{-\infty }^{\infty }K_{\mu ,\nu }(z)e^{ithz},dz} は、リスケールされたカーネルの既知の特性関数です。したがって、推定量は、データに依存する経験的因子と、カーネルと帯域幅によって制御される決定論的な平滑化因子に分離されます。カーネル因子は高周波成分を抑制し、経験的特性関数の正則化バージョンを提供します。
特性関数表現は量子状態の再構成に直接使用できます。たとえば、座標基底の密度行列は、
ρ ( y 、 y ′ ) = 1 2 π ∫ − ∞ ∞ ϕ ( 1 ; μ 、 y − y ′ ) exp [ − 私 μ ( y + y ′ ) 2 ] 、 d μ 。 {\displaystyle \rho (y,y')={\frac {1}{2\pi }}\int _{-\infty }^{\infty }\phi (1;\mu ,y-y')\exp \left[-{\frac {i\mu (y+y')}{2}}\right],d\mu .} また、位相空間準確率分布を最初に再構築することなく、微量量を計算するためにも使用できます。特に、2つの密度演算子はパーセバル型の関係を満たします。
tr ( ρ 1 ρ 2 ) = 1 2 π ∬ R 2 ϕ 1 ( 1 ; μ 、 ν ) ϕ 2 ( 1 ; μ 、 ν ) * 、 d μ 、 d ν 。 {\displaystyle \operatorname {tr} (\rho _{1}\rho _{2})={\frac {1}{2\pi }}\iint _{\mathbb {R} ^{2}}\phi _{1}(1;\mu ,\nu )\phi _{2}(1;\mu ,\nu )^{*},d\mu ,d\nu .} 2つの状態が同一である場合、この式は純度を表します tr ( ρ 2 ) {\displaystyle \operatorname {tr} (\rho ^{2})} 異なる状態については、ヒルベルト・シュミットの重なりを与えます。関連する積分表現は、高次のトレース、状態距離、位相空間準確率分布について構築できます。[ 23 ]
特性関数定式化では、一部の測定ノイズモデルに対する補正も可能です。観測された直交位相が次のようにモデル化されている場合Z = κ X + ( 1 − κ ) Y {\displaystyle Z=\kappa X+(1-\kappa )Y} 、 どこY {\displaystyle Y} が既知の非零特性関数を持つ独立ノイズである場合、信号特性関数は逆畳み込みによって得られる。
ϕ X ( t ) = ϕ Z ( t / κ ) ϕ Y ( ( 1 − κ ) t / κ ) 。 {\displaystyle \phi _{X}(t)={\frac {\phi _{Z}(t/\kappa )}{\phi _{Y}((1-\kappa )t/\kappa )}}.} その後、カーネル係数を導入することで、得られた推定値を正則化することができる。この補正を行うには、ノイズ特性関数が再構成に使用される周波数においてゼロにならないことが必要となる。
KCFEのバイアスと分散は
バイアス [ ϕ ^ n 、 h ( t ; μ 、 ν ) ] = [ ϕ K ( t h ; μ 、 ν ) − 1 ] ϕ ( t ; μ 、 ν ) {\displaystyle \operatorname {Bias} \!\left[{\widehat {\phi }}_{n,h}(t;\mu ,\nu )\right]=\left[\phi _{K}(th;\mu ,\nu )-1\right]\phi (t;\mu ,\nu )} そして
バラ [ ϕ ^ n 、 h ( t ; μ 、 ν ) ] = | ϕ K ( t h ; μ 、 ν ) | 2 n [ 1 − | ϕ ( t ; μ 、 ν ) | 2 ] 。 {\displaystyle \operatorname {Var} \!\left[{\widehat {\phi }}_{n,h}(t;\mu ,\nu )\right]={\frac {|\phi _{K}(th;\mu ,\nu )|^{2}}{n}}\left[1-|\phi (t;\mu ,\nu )|^{2}\right].} したがって、その点ごとの平均二乗誤差は
MSE [ ϕ ^ n 、 h ( t ; μ 、 ν ) ] = | ϕ K ( t h ; μ 、 ν ) − 1 | 2 | ϕ ( t ; μ 、 ν ) | 2 + | ϕ K ( t h ; μ 、 ν ) | 2 n [ 1 − | ϕ ( t ; μ 、 ν ) | 2 ] 。 {\displaystyle {\begin{aligned}\operatorname {MSE} \!\left[{\widehat {\phi }}_{n,h}(t;\mu ,\nu )\right]={}&|\phi _{K}(th;\mu ,\nu )-1|^{2}|\phi (t;\mu ,\nu )|^{2}\\&+{\frac {|\phi _{K}(th;\mu ,\nu )|^{2}}{n}}\left[1-|\phi (t;\mu ,\nu )|^{2}\right].\end{aligned}}} ガウスカーネルの場合
ϕ K ( t h ; μ 、 ν ) = exp [ − t 2 h 2 ( μ 2 + ν 2 ) 4 ] 。 {\displaystyle \phi _{K}(th;\mu ,\nu )=\exp \left[-{\frac {t^{2}h^{2}(\mu ^{2}+\nu ^{2})}{4}}\right].} 結果として生じるエラーは
MSE [ ϕ ^ n 、 h G ( t ; μ 、 ν ) ] = ( exp [ − t 2 h 2 ( μ 2 + ν 2 ) 4 ] − 1 ) 2 | ϕ ( t ; μ 、 ν ) | 2 + 1 n exp [ − t 2 h 2 ( μ 2 + ν 2 ) 4 ] [ 1 − | ϕ ( t ; μ 、 ν ) | 2 ] 。 {\displaystyle {\begin{aligned}\operatorname {MSE} \!\left[{\widehat {\phi }}_{n,h}^{\,G}(t;\mu ,\nu )\right]={}&\left(\exp \left[-{\frac {t^{2}h^{2}(\mu ^{2}+\nu ^{2})}{4}}\right]-1\right)^{2}|\phi (t;\mu ,\nu )|^{2}\\&+{\frac {1}{n}}\exp \left[-{\frac {t^{2}h^{2}(\mu ^{2}+\nu ^{2})}{4}}\right]\left[1-|\phi (t;\mu ,\nu )|^{2}\right].\end{aligned}}} のために0 < | ϕ ( t ; μ 、 ν ) | < 1 {\displaystyle 0<|\phi (t;\mu ,\nu )|<1} この式を最小化すると、特性関数の帯域幅はオーダーになります。
h ϕ = O ( n − 1 / 2 ) 、 {\displaystyle h_{\phi }=O(n^{-1/2}),} 最小化された誤差は以下を満たす。
MSE [ ϕ ^ n 、 h ϕ G ( t ; μ 、 ν ) ] = 1 − | ϕ ( t ; μ 、 ν ) | 2 n − [ 1 − | ϕ ( t ; μ 、 ν ) | 2 ] 2 4 n 2 | ϕ ( t ; μ 、 ν ) | 2 = O ( n − 1 ) 。 {\displaystyle \operatorname {MSE} \!\left[{\widehat {\phi }}_{n,h_{\phi }}^{\,G}(t;\mu ,\nu )\right]={\frac {1-|\phi (t;\mu ,\nu )|^{2}}{n}}-{\frac {\left[1-|\phi (t;\mu ,\nu )|^{2}\right]^{2}}{4n^{2}|\phi (t;\mu ,\nu )|^{2}}}=O(n^{-1}).} したがって、特性関数推定量はパラメトリックな点で点ごとに収束する。n − 1 {\displaystyle n^{-1}} 基礎となる断層像はノンパラメトリックに推定されるが、平均二乗誤差率は… [ 23 ]
複数の測定設定における特性関数推定値の集合が、カーネル量子状態推定 手順への入力となる 。n {\displaystyle n} 各設定で測定が行われ、 N μ = N ν = ( ログ n ) 2 {\displaystyle N_{\mu }=N_{\nu }=(\log n)^{2}} 密度行列と2次元トレース推定に使用される状態準備の数は
T μ = n N μ 、 T μ 、 ν = n N μ N ν 。 {\displaystyle T_{\mu }=nN_{\mu },\qquad T_{\mu ,\nu }=nN_{\mu }N_{\nu }.} 座標空間密度行列の場合、報告された均一な点ごとのリスクは
すする y 、 y ′ E [ | ρ ^ ( y 、 y ′ ) − ρ ( y 、 y ′ ) | 2 ] = O ~ ( T μ − 1 ) 。 {\displaystyle \sup _{y,y'}\mathbb {E} \left[\left|{\widehat {\rho }}(y,y')-\rho (y,y')\right|^{2}\right]={\widetilde {O}}\!\left(T_{\mu }^{-1}\right).} 2つの量子状態の重なりについて報告されている平均二乗誤差は
E [ | tr ( ρ 1 ρ 2 ) ^ − tr ( ρ 1 ρ 2 ) | 2 ] = O ~ ( T μ 、 ν − 1 ) 、 {\displaystyle \mathbb {E} \left[\left|{\widehat {\operatorname {tr} (\rho _{1}\rho _{2})}}-\operatorname {tr} (\rho _{1}\rho _{2})\right|^{2}\right]={\widetilde {O}}\!\left(T_{\mu ,\nu }^{-1}\right),} どこO ~ {\displaystyle {\widetilde {O}}} 測定設定の数から生じる対数係数を抑制する。[ 23 ]
統計的実装 カーネル密度推定器のソフトウェア実装の例をいくつか挙げると、以下のようになる(ただし、これらに限定されない)。
Analytica リリース 4.4では、PDF 結果の平滑化 オプションに KDE が使用され、式からは組み込み関数を介して利用できますPdf。C / C++ において、FIGTreeは正規カーネルを用いてカーネル密度推定値を計算できるライブラリです。MATLABインターフェースも利用可能です。C++ では、libagfは可変カーネル密度推定 のためのライブラリです。C++ において、mlpackはさまざまなカーネルを使用して KDE を 計算できるライブラリです。計算速度を向上させるために、エラー許容値を設定できます。PythonおよびR インターフェースも利用可能です。C# およびF# において、Math.NET Numerics は カーネル密度推定を含む数値計算のためのオープンソースライブラリです。CrimeStat では、カーネル密度推定は、正規分布、一様分布、四次分布、負の指数分布、三角分布の5種類のカーネル関数を用いて実装されています。単一カーネル密度推定ルーチンと二重カーネル密度推定ルーチンの両方が利用可能です。カーネル密度推定は、Head Bangルーチンの補間、2次元の犯罪現場までの道のり密度関数の推定、および3次元のベイズ犯罪現場までの道のり推定にも使用されます。ELKI では、カーネル密度関数はパッケージに含まれています。de.lmu.ifi.dbs.elki.math.statistics.kernelfunctionsESRI 製品では、カーネル密度マッピングはSpatial Analystツールボックスで管理され、Quartic(biweight)カーネルが使用されます。Excel では、英国王立化学会が、分析方法委員会技術概要4に基づいてカーネル密度推定を実行するアドインを作成しました。gnuplot では、カーネル密度推定はオプションによって実装されsmooth kdensity、データファイルには各ポイントの重みと帯域幅を含めることができ、帯域幅は「シルバーマンの経験則」(上記参照)に従って自動的に設定できます[ 29 ] 。 Haskell では、カーネル密度はstatisticsパッケージに実装されています。IGOR Pro では、カーネル密度推定は (Igor Pro 7.00 で追加) 演算によって実装されています。帯域幅はユーザーが指定することも、Silverman、Scott、または Bowmann とAzzalini StatsKDEによって推定することもできます。カーネルの種類は、Epanechnikov、Bi-weight、Tri-weight、Triangular、Gaussian、Rectangular です。Java では、Weka 機械学習パッケージには、 weka.estimators.KernelEstimatorなどが含まれています。JavaScript では、可視化パッケージであるD3.jsが 、science.statsパッケージの中にKDEパッケージを提供しています。JMP のグラフビルダープラットフォームでは、カーネル密度推定を利用して、二変量密度の等高線図と高密度領域 (HDR) を、一変量密度のバイオリンプロットと HDR を提供します。スライダーを使用して帯域幅を調整できます。二変量および一変量のカーネル密度推定は、それぞれ Fit Y by X プラットフォームと Distribution プラットフォームでも提供されます。Julia では、カーネル密度推定はKernelDensity.jlパッケージに実装されています。KNIME では、 Vernalis コミュニティが提供するノード(例:1D Kernel Density Plotなど)を使用して、1Dおよび2Dカーネル密度分布を生成およびプロットできます。基盤となる実装はJava で記述されています。MATLAB では、カーネル密度推定はksdensity関数(Statistics Toolbox)によって実装されています。MATLABの2018aリリース以降では、帯域幅とカーネルスムーザーの両方を指定でき、カーネル密度の範囲を指定するなどの他のオプションも利用できます。[ 30 ] また、自動帯域幅選択方法を実装した無料のMATLABソフトウェアパッケージ[ 6 ] がMATLAB Central File Exchangeから入手可能です。 1次元データ 2次元データ n次元データ2017年2月9日にWayback Machine に アーカイブされました。カーネル回帰、カーネル密度推定、ハザード関数のカーネル推定などの実装を含む無料のMATLABツールボックスがこれらのページで入手できます(このツールボックスは書籍[ 31 ] の一部です)。 Mathematica では、数値カーネル密度推定は関数SmoothKernelDistribution[ 32 ] によって実装され、記号推定は関数KernelMixtureDistribution[ 33 ] を使用して実装され、どちらもデータ駆動型の帯域幅を提供します。Minitab では、英国王立化学会が分析方法委員会技術概要4に基づいてカーネル密度推定を実行するマクロを作成しました。[ 34 ] NAGライブラリ では、カーネル密度推定はルーチンを介して実装されています(ライブラリのFortran [ 35 ] とC [ 36 ] g10baバージョンの両方で利用可能です)。Nukleiでは、C++ カーネル密度法は特殊ユークリッド群のデータに焦点を当てています。 S E ( 3 ) {\displaystyle SE(3)} 。 Octave では、カーネル密度推定はkernel_densityオプション(econometricsパッケージ)によって実装されます。Origin では、2Dカーネル密度プロットをユーザーインターフェースから作成でき、1D用のKsdensityと2D用のKs2densityという2つの関数をLabTalk Archived 2014-10-19 at the Wayback Machine 、Python 、またはC コードから使用できます。Perl では、 Statistics-KernelEstimationモジュールに実装例があります。PHP では、 MathPHPライブラリに実装例があります。Python には多くの実装が存在します。PyQt -Fitパッケージのpyqt_fit.kdeモジュール、SciPy ()、Statsmodels(および)、scikit-learn ()(比較[ 37 ] を参照)。KDEpyは重み付きデータをサポートしており、そのFFT実装は他の実装よりも桁違いに高速です。一般的に使用されているpandasライブラリscipy.stats.gaussian_kdeKDEUnivariateKDEMultivariateKernelDensity plot メソッドを介して kde プロットのサポートを提供します (df.plot(kind='kde'))重み付きおよび相関のある MCMC サンプル用のgetdistパッケージは、1D および 2D 分布の最適化された帯域幅、境界補正、および高次メソッドをサポートしています。カーネル密度推定に新たに使用されるパッケージの 1 つは seaborn ( import seaborn as sns、sns.kdeplot()) です。[ 38 ] KDE の GPU 実装も存在します。[ 39 ] R では、density基本分布で実装されており、bw.nrd0関数は stats パッケージで使用されています。この関数は Silverman の本の最適化された式を使用しています。KernSmoothライブラリbkde、DataVisualizations ライブラリ(パレート分布 密度推定用)、ks ライブラリ、evmixライブラリ(境界補正カーネル密度推定用)、npライブラリ(数値データおよびカテゴリデータ )、sm ライブラリで使用されています。パッケージやライブラリのインストールを必要としない関数の実装については、 kde.Rを参照してください。都市分析専用のbtb ライブラリは、カーネル密度推定を で実装しています。ParetoDensityEstimationkdedkdendbckdennpudenssm.densitykde.Rkernel_smoothingSAS では、proc kde単変量および二変量のカーネル密度を推定するために使用できます。Apache Spark では、KernelDensity()クラス[ 40 ] Stata では、例えば[ 41 ] kdensityのように実装されています。あるいは、ユーザーが1Dまたは2D密度関数を推定できる無料のStataモジュールKDENS [ 42 ]も利用可能です。 histogram x, kdensitySwift では、SwiftStats.KernelDensityEstimationオープンソースの統計ライブラリであるSwiftStatsを通じて実装されています。
さらに読む ハードル、ヴォルフガング。ミュラー、マレーネ。シュパーリッヒ、ステファン。ウェルワッツ、アクセル (2004)。ノンパラメトリック モデルとセミパラメトリック モデル 。統計学のシュプリンガー シリーズ。ベルリン ハイデルベルク: Springer-Verlag。39 ~ 83ページ。ISBN 978-3-540-20722-1 。
参考文献 1 2 Rosenblatt, M. (1956). "密度関数のいくつかのノンパラメトリック推定に関する考察" . The Annals of Mathematical Statistics . 27 (3): 832– 837. doi : 10.1214/aoms/1177728190 . 1 2 Parzen, E. (1962). "確率密度関数とモードの推定について" . The Annals of Mathematical Statistics . 33 (3): 1065– 1076. doi : 10.1214/aoms/1177704472 . JSTOR 2237880 . 1 2 Hastie, Trevor ; Tibshirani, Robert ; Friedman, Jerome H. (2001). 統計的学習の要素 :データマイニング、推論、予測 :200点のフルカラー図版付き 。ニューヨーク: Springer。ISBN 0-387-95284-5 OCLC 46809224。 ↑ Epanechnikov, VA (1969). "多変量確率密度のノンパラメトリック推定". Theory of Probability and Its Applications . 14 : 153– 158. doi : 10.1137/1114019 . ↑ Wand, MP; Jones, MC (1995). Kernel Smoothing . London: Chapman & Hall/CRC. ISBN 978-0-412-55270-0 。1 2 3 4 Botev, Zdravko (2007). 拡散混合によるノンパラメトリック密度推定 (技術報告書)。クイーンズランド大学。 ↑ Scott, D. (1979). "On optimal and data-based histograms". Biometrika . 66 (3): 605–610 . doi : 10.1093/biomet/66.3.605 . ↑ Park, BU; Marron, JS (1990). "データ駆動型帯域幅セレクタの比較". Journal of the American Statistical Association . 85 (409): 66–72 . Bibcode : 1990JASA...85...66P . CiteSeerX 10.1.1.154.7321 . doi : 10.1080/01621459.1990.10475307 . JSTOR 2289526 . ↑ Park, BU; Turlach, BA (1992). "いくつかのデータ駆動型帯域幅セレクタの実際的な性能(議論付き)" . Computational Statistics . 7 : 251– 270. ↑ Cao, R.; Cuevas, A.; Manteiga, WG (1994). "密度推定におけるいくつかの平滑化手法の比較研究". Computational Statistics and Data Analysis . 17 (2): 153– 176. doi : 10.1016/0167-9473(92)00066-Z . ↑ Jones, MC; Marron, JS; Sheather, SJ (1996). "密度推定のための帯域幅選択に関する簡単な調査". Journal of the American Statistical Association . 91 (433): 401– 407. doi : 10.2307/2291420 . JSTOR 2291420 . ↑ Sheather, SJ (1992). 「実際のデータセットにおける6つの一般的な帯域幅選択方法の性能(議論付き)」. Computational Statistics . 7 : 225–250 , 271–281 . ↑ Agarwal, N.; Aluru, NR (2010). "MEMSにおける不確実性定量化のためのデータ駆動型確率的コロケーションアプローチ" (PDF) . International Journal for Numerical Methods in Engineering . 83 (5): 575– 597. Bibcode : 2010IJNME..83..575A . doi : 10.1002/nme.2844 . S2CID 84834908 . ↑ Xu, X.; Yan, Z.; Xu, S. (2015). "拡散ベースのカーネル密度法による風速確率分布の推定". Electric Power Systems Research . 121 : 28– 37. Bibcode : 2015EPSR..121...28X . doi : 10.1016/j.epsr.2014.11.029 . ↑ Botev, ZI; Grotowski, JF; Kroese, DP (2010). "拡散によるカーネル密度推定". Annals of Statistics . 38 (5): 2916–2957 . arXiv : 1011.2602 . Bibcode : 2010AnSta..38OS799B . doi : 10.1214/10-AOS799 . S2CID 41350591 . 1 2 Sheather, SJ; Jones, MC (1991). "カーネル密度推定のための信頼性の高いデータに基づく帯域幅選択法". Journal of the Royal Statistical Society, Series B . 53 (3): 683– 690. doi : 10.1111/j.2517-6161.1991.tb01857.x . JSTOR 2345597 . ↑ Rudemo, M. (1982). "ヒストグラムとカーネル密度推定値の経験的選択". Scandinavian Journal of Statistics . 9 (2): 65–78 . JSTOR 4615859 . ↑ Bowman, AW (1984). 「密度推定値の平滑化のための交差検証の代替方法」. Biometrika . 71 (2): 353–360 . doi : 10.1093/biomet/71.2.353 . ↑ Hall, P.; Marron, JS; Park, BU (1992). "平滑化交差検証" . Probability Theory and Related Fields . 92 : 1– 20. doi : 10.1007/BF01205233 . S2CID 121181481 . ↑ Wahba, G. (1975). "密度推定のための可変ノット法、カーネル法、直交級数法の最適収束特性" . Annals of Statistics . 3 (1): 15– 29. doi : 10.1214/aos/1176342997 . ↑ Buch-Larsen, TINE (2005). "Champernowne変換を用いた裾の重い分布のカーネル密度推定". Statistics . 39 (6): 503–518 . CiteSeerX 10.1.1.457.1544 . doi : 10.1080/02331880500439782 . S2CID 219697435 . 1 2 Silverman, BW (1986). Density Estimation for Statistics and Data Analysis . London: Chapman & Hall/CRC. p. 45. ISBN 978-0-412-24620-3 。1 2 3 4 5 Markovich, Liubov A.; Liu, Xiaoyu; Tura, Jordi (2026-07-07). "連続変数システムの非ガウス型量子状態のノンパラメトリック学習". Physical Review Letters . 137 (2): 020201. arXiv : 2508.06431 . doi : 10.1103/xdcg-6df5 . ↑ Chen, Yen-Chi; Genovese, Christopher R.; Wasserman, Larry (2016). "モードクラスタリングへの包括的なアプローチ" . Electronic Journal of Statistics . 10 (1): 210– 241. arXiv : 1406.1780 . doi : 10.1214/15-ejs1102 . ISSN 1935-7524 . ↑ Chazal, Frédéric; Fasy, Brittany Terese ; Lecci, Fabrizio; Rinaldo, Alessandro; Wasserman, Larry (2014). "Stochastic Convergence of Persistence Landscapes and Silhouettes" . Proceedings of the thirtieth annual symposium on Computational geometry . Vol. 6. New York, New York, USA: ACM Press. pp. 474–483 . arXiv : 1312.0308 . doi : 10.1145 /2582112.2582128 . ISBN 978-1-4503-2594-3 . S2CID 6029340 . ↑ Fukunaga, K.; Hostetler, L. (1975 年 1 月). "密度関数の勾配の推定、パターン認識への応用". IEEE Transactions on Information Theory . 21 (1): 32–40 . Bibcode : 1975ITIT...21...32F . doi : 10.1109/tit.1975.1055330 . ISSN 0018-9448 . ↑ Yizong Cheng (1995). "平均シフト、モード探索、クラスタリング". IEEE Transactions on Pattern Analysis and Machine Intelligence . 17 (8): 790–799 . Bibcode : 1995ITPAM..17..790Y . CiteSeerX 10.1.1.510.1222 . doi : 10.1109/34.400568 . ISSN 0162-8828 . ↑ Comaniciu, D.; Meer, P. (2002 年 5 月). "平均シフト: 特徴空間分析に対する堅牢なアプローチ". IEEE Transactions on Pattern Analysis and Machine Intelligence . 24 (5): 603–619 . Bibcode : 2002ITPAM..24..603C . doi : 10.1109/34.1000236 . ISSN 0162-8828 . S2CID 691081 . ↑ Janert, Philipp K (2009). Gnuplot in action : understanding data with graphs . Connecticut, USA: Manning Publications. ISBN 978-1-933988-39-9 。カーネル密度推定 というタイトルのセクション 13.2.2 を参照してください。↑ 「単変量および二変量データに対するカーネル平滑化関数の推定 – MATLAB ksdensity」 。www.mathworks.com 。 2020年11月5日 取得 。 ↑ ホロヴァ、I.コラチェク、J.ゼリンカ、J. (2012)。 MATLAB でのカーネル スムージング: カーネル スムージングの理論と実践 。シンガポール: World Scientific Publishing。 ISBN 978-981-4405-48-5 。↑ 「SmoothKernelDistribution—Wolfram言語ドキュメント」 。reference.wolfram.com 。 2020年11月5日 取得 。 ↑ 「KernelMixtureDistribution—Wolfram言語ドキュメント」 。reference.wolfram.com 。 2020年11月5日 取得 。 ↑ 「カーネル密度を計算するためのソフトウェア」 。www.rsc.org 。 2020年11月5 日 取得 。 ↑ 数値アルゴリズムグループ。 「NAG ライブラリ ルーチン ドキュメント: nagf_smooth_kerndens_gauss (g10baf)」 (PDF) 。 NAG ライブラリマニュアル、マーク 23 。 2012 年 2 月 16 日 に取得 。 ↑ 数値アルゴリズムグループ。 「NAG ライブラリ ルーチン ドキュメント: nag_kernel_density_estim (g10bac)」 (PDF) 。 NAG ライブラリマニュアル、マーク 9 。 2011 年 11 月 24 日に オリジナル (PDF) からアーカイブされました 。 2012 年 2 月 16 日 に取得 。 ↑ Vanderplas, Jake (2013-12-01). "Python でのカーネル密度推定" . 2014-03-12 に取得。 ↑ "seaborn.kdeplot — seaborn 0.10.1 documentation" . seaborn.pydata.org . 2020年5月12日 取得 . ↑ "Kde-gpu: cuPy を介して cuda を使用して、ナダラヤ ワストン カーネル密度とカーネル条件付き確率推定器を実装しました。これは CPU バージョンよりもはるかに高速ですが、大容量メモリを搭載した GPU が必要です。" 。 ↑ 「基本統計 – RDD ベースの API – Spark 3.0.1 ドキュメント」 . spark.apache.org . 2020-11-05 取得 。 ↑ 「kdensity — 単変量カーネル密度推定」 (PDF) 。Stata 15 マニュアル 。 ↑ Jann, Ben (2008-05-26)、 「KDENS: 単変量カーネル密度推定のためのStataモジュール」 、 統計ソフトウェアコンポーネント 、ボストンカレッジ経済学部 、 2022-10-15に取得
外部リンク カーネル密度推定入門カーネル密度推定器がヒストグラムよりも優れている理由を説明する短いチュートリアル。 カーネル帯域幅最適化:最適化されたカーネル密度推定値を生成する無料のオンラインツール。 無料オンラインソフトウェア(計算機)は、ガウス、エパネチニコフ、矩形、三角形、バイウェイト、コサイン、オプトコサインといったカーネルに基づいて、データ系列のカーネル密度推定値を計算します。 カーネル密度推定アプレット カーネル密度推定のオンライン対話型サンプル。.NET 3.0以降が必要です。