空間記述統計学は、空間統計学と記述統計学の交点であり、これらの手法は地理学、特に地理情報システム(GIS)を用いた定量的データ分析において、さまざまな目的で使用されています。
空間データの最も単純な形式は、グリッドデータと点集合です。グリッドデータでは、規則的なグリッド上の各点についてスカラー量が測定されます。点集合では、座標の集合(例えば平面上の点の集合)が観測されます。グリッドデータの例としては、グリッド上にデジタル化された森林密度の衛星画像が挙げられます。点集合の例としては、特定の土地にあるすべてのニレの木の緯度経度座標が挙げられます。より複雑な形式のデータには、マークされた点集合や空間時系列などがあります。
点集合の座標ごとの平均は重心であり、これは平面(またはより高次元のユークリッド空間)において、実数直線上でよく知られている平均が解くのと同じ変分問題を解きます。つまり、重心は集合内のすべての点に対する平均二乗距離が最小となる値です。
分散とは、点集合内の点が互いにどの程度離れているかを示す指標です。ほとんどの用途において、空間分散は回転や鏡映に対して不変な方法で定量化する必要があります。点集合の空間分散の簡単な尺度は、点の座標の共分散行列を用いて定義できます。共分散行列のトレース、行列式、および最大固有値は、空間分散の尺度として使用できます。
共分散行列に基づかない空間分散の尺度としては、最近傍間の平均距離がある。[ 1 ]
平面上の均質な点の集合とは、与えられた領域の任意の円形領域内にほぼ同数の点が存在するように分布している点の集合のことである。均質性を持たない点の集合は、特定の空間スケールで空間的にクラスター化している可能性がある。空間的に均質な点の単純な確率モデルは、一定の強度関数を持つ平面上のポアソン過程である。
ブライアン・D・リプリー[ 2 ]によって導入されたリプリーのK関数とL関数は、空間的均質性からの逸脱を検出するための密接に関連した記述統計量である。K関数(厳密にはその標本に基づく推定値)は次のように定義される。
ここで、d ijはn個の点からなるデータセットにおけるi番目の点とj番目の点の間のユークリッド距離、t は検索半径、λ は点の平均密度 (一般的にはn / Aと推定され、Aはすべての点を含む領域の面積)、Iは指示関数(オペランドが真の場合は 1、それ以外の場合は 0)です。 [ 3 ] 2 次元では、点がほぼ均質である場合、π t 2とほぼ等しくなるはずです。
データ分析では、一般的にL関数と呼ばれる分散安定化リプリーK関数が使用されます。L関数のサンプルバージョンは次のように定義されます。
ほぼ均質なデータの場合、L関数の期待値はtであり、その分散はtに関してほぼ一定です。一般的なグラフは、tに対して、データが均質なポアソン過程に従う場合、ほぼ一定の分散で水平なゼロ軸に沿って推移します。
リプリーのK関数を使用すると、特定のスケールで点がランダム、分散、またはクラスター分布パターンを持っているかどうかを判断できます。[ 4 ]