カーネル密度推定 を用いた密度推定のデモンストレーション:真の密度は、0と3を中心とする2つのガウス分布の混合であり、実線の青い曲線で示されています。各フレームでは、分布から100個のサンプルが生成され、赤色で示されています。各サンプルを中心として、ガウスカーネルが灰色で描画されます。ガウス分布を平均すると、破線の黒い曲線で示される密度推定値が得られます。統計学 において、確率密度推定 、あるいは単に密度推定とは、観測 データ に基づいて、観測不可能な基礎となる確率密度関数の 推定値 を構築することである。観測不可能な密度関数は、大規模な母集団が分布する密度と考えられ、データは通常、その母集団からのランダムサンプルと考えられている。[ 1 ]
密度推定には、パーゼン窓や ベクトル量子化 を含むさまざまなデータクラスタリング 手法など、多様なアプローチが用いられています。最も基本的な密度推定方法は、リスケールされたヒストグラム です。
例 p (glu | diabetes=1) (赤)、p (glu | diabetes=0) (青)、およびp (glu) (黒)の推定密度p (糖尿病=1 | グルコース)の推定確率p (糖尿病=1 | グルコース)の推定確率糖尿病 の発症率に関する記録を検討します。以下はデータセットの 説明からそのまま引用したものです。
アリゾナ州フェニックス近郊に住む、ピマ族 インディアンの血を引く21歳以上の女性を対象に、世界保健機関の 基準に従って糖尿病 の検査を実施した。データは米国国立糖尿病・消化器・腎臓病研究所によって収集された。我々は532件の完全な記録を使用した。[ 2 ] [ 3 ] この例では、「glu」(血漿 グルコース 濃度)の密度推定値を3つ作成します。1つ目は糖尿病の有無を条件 とした推定値、2つ目は糖尿病の有無を条件とした推定値、3つ目は糖尿病の有無を条件としない推定値です。これらの条件付き密度推定値を用いて、「glu」を条件とした糖尿病の確率を算出します。
「glu」データは、 Rプログラミング言語 のMASSパッケージ[ 4 ] から取得しました。R内では、データのより詳細な説明が提供されています。?Pima.tr?Pima.te
糖尿病患者における「glu」の平均値 は143.1、標準偏差は31.26です。非糖尿病患者における「glu」の平均値は110.0、標準偏差は24.29です。このことから、このデータセットでは、糖尿病患者は「glu」の値が高い傾向にあることがわかります。推定密度関数のグラフを見ると、このことがより明確になります。
最初の図は、 p (glu | diabetes=1)、p (glu | diabetes=0)、およびp (glu) の密度推定値を示しています。これらの密度推定値は、ガウスカーネルを用いたカーネル密度推定値です。つまり、各データポイントにガウス密度関数を配置し、データの範囲にわたって密度関数の合計を計算します。
糖尿病を条件とした「glu」の密度から、ベイズの定理 を用いて「glu」を条件とした糖尿病の確率を求めることができます。簡潔にするため、この式では「糖尿病」を「db」と略記します。
p ( 糖尿病 = 1 | 接着剤 ) = p ( 接着剤 | db。 = 1 ) p ( db。 = 1 ) p ( 接着剤 | db。 = 1 ) p ( db。 = 1 ) + p ( 接着剤 | db。 = 0 ) p ( db。 = 0 ) {\displaystyle p({\mbox{diabetes}}=1|{\mbox{glu}})={\frac {p({\mbox{glu}}|{\mbox{db.}}=1)\,p({\mbox{db.}}=1)}{p({\mbox{glu}}|{\mbox{db.}}=1)\,p({\mbox{db.}}=1)+p({\mbox{glu}}|{\mbox{db.}}=0)\,p({\mbox{db.}}=0)}}} 2番目の図は、推定事後確率p (糖尿病=1|グルコース)を示しています。これらのデータから、「グルコース」レベルの上昇は糖尿病と関連しているように見えます。
用途と目的 密度推定の非常に自然な用途は、与えられたデータセットの特性を非公式に調査することです。密度推定は、データの歪度や多峰性などの特徴について貴重な情報を提供できます。場合によっては、自明の真理とみなされる結論が得られることもありますが、他の場合には、さらなる分析やデータ収集への道筋を示すだけとなることもあります。[ 5 ]
ガンベル分布のヒストグラムと密度関数[ 6 ] 統計学の重要な側面の一つは、他の方法で得られた可能性のある結論を説明・例示するために、データをクライアントに提示することです。密度推定は、数学の専門家でない人にも比較的容易に理解できるため、この目的に最適です。
探索的およびプレゼンテーション目的での密度推定値の使用例をさらに示します。これには、重要な二変量データのケースも含まれます。[ 7 ]
密度推定は異常検出 や新規性検出 にも頻繁に使用されます。[ 8 ] 観測が非常に低密度の領域にある場合、それは異常または新規性である可能性が高いです。
水文学 では、降雨量と河川流量データのヒストグラムと推定密度関数を確率分布で分析し、 それら の挙動と発生頻度についての洞察を得るために使用されます。[ 9 ] 青色の図に例を示します。
参考文献 ↑ Alberto Bernacchia、Simone Pigolotti、「密度推定のための自己整合的方法」、Journal of the Royal Statistical Society Series B: Statistical Methodology、第73巻、第3号、2011年6月、407~422ページ、 https://doi.org/10.1111/j.1467-9868.2011.00772.x ↑ 「ピマ族インディアン女性の糖尿病 - Rドキュメント」。 ↑ Smith, JW、Everhart, JE、Dickson, WC、Knowler, WC、Johannes, RS (1988)。RA Greenes (編)。 「ADAP学習アルゴリズムを 用い た糖尿病発症予測」 。 医療におけるコンピュータ応用に関するシンポジウム議事録(ワシントン、1988年) 。 カリフォルニア州ロスアラミトス: 261–265。PMC 2245318 。 {{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク)↑ 「VenablesとRipleyのMASSのサポート関数とデータセット」 。 ↑ Silverman, BW (1986). Density Estimation for Statistics and Data Analysis . Chapman and Hall. ISBN 978-0412246203 。↑ 確率分布と密度関数を計算する計算機 ↑ Geof H., Givens (2013). 計算統計学. Wiley. p. 330. ISBN 978-0-470-53331-4 。 ↑ ピメンテル、マルコAF;デビッド・A・クリフトン;レイ・クリフトン。タラセンコ、ライオネル(2014年1月2日)。 「新規性検出のレビュー」。 信号処理 。 99 (2014 年 6 月): 215–249 。 土井 : 10.1016/j.sigpro.2013.12.026 。 ↑ ヒストグラムと確率密度関数の図解 ↑ Rosenblatt, M. (1956). "密度関数のいくつかのノンパラメトリック推定に関する考察" . The Annals of Mathematical Statistics . 27 (3): 832– 837. doi : 10.1214/aoms/1177728190 . ↑ Parzen, E. (1962). "確率密度関数とモードの推定について" . The Annals of Mathematical Statistics . 33 (3): 1065– 1076. doi : 10.1214/aoms/1177704472 . JSTOR 2237880 . ↑ Hastie, Trevor ; Tibshirani, Robert ; Friedman, Jerome H. (2001). The Elements of Statistical Learning : Data Mining, Inference, and Prediction : with 200 full-color illustrations . New York: Springer. ISBN 0-387-95284-5 OCLC 46809224。 情報源
ブライアン・D・リプリー(1996)。パターン認識とニューラルネットワーク 。ケンブリッジ:ケンブリッジ大学出版局。ISBN 978-0521460866 。 トレバー・ハスティ 、ロバート・ティビシラニ 、ジェローム・フリードマン。『統計的学習の要素 』ニューヨーク:スプリンガー、2001年。ISBN 0-387-95284-5 (第6章を参照 。 )Qi Li および Jeffrey S. Racine。『ノンパラメトリック計量経済学:理論と実践 』プリンストン大学出版局、2007年、ISBN 0-691-12161-3 (第1章を参照 。 ) DW スコット著『多変量密度推定:理論、実践、および可視化 』ニューヨーク:ワイリー、1992年。 BW シルバーマン 。『密度推定 』ロンドン:チャップマン・アンド・ホール、1986年。ISBN 978-0-412-24620-3
外部リンク CREEM: 生態学的および環境モデリング研究センター無料の密度推定ソフトウェアパッケージDistance 4 (野生生物個体群評価研究ユニット「RUWPA」より) およびWiSP を ダウンロードできます。 UCI機械学習リポジトリのコンテンツ概要(元のデータセット(732件の記録)および追加の注記については、「ピマ族インディアン糖尿病データベース」を参照してください。) 一次元 および 二次元密度推定のためのMATLABコード libAGFは、可変カーネル密度推定 のためのC++ソフトウェアです。