Loading article…
ホプキンス統計量(ブライアン・ホプキンスとジョン・ゴードン・スケラムが提唱)は、データセットのクラスター傾向を測定する方法です。 [1]これは、スパースサンプリング検定の一種です。これは、帰無仮説がデータがポアソン点過程によって生成され、一様ランダムに分布しているという統計的仮説検定として機能します。[ 2 ]個体が集約されている場合、その値は0に近づき、個体がランダムに分布している場合は、値が0.5に近づきます。[3]
予選
ホプキンス統計の典型的な定式化は以下の通りである。[2]
- をデータポイントの集合とします。
- から置換なしでサンプリングされたデータ ポイントのランダム サンプルを生成します。
- 均一にランダムに分布したデータ ポイントのセットを生成します。
- 2つの距離尺度を定義する。
- の最も近い近傍までの最小距離(適切な距離が与えられた場合)、および
- 最も近い隣接点までの最小距離
意味
上記の表記法では、データが次元化されている場合、ホプキンス統計量は次のように定義されます。[4]
帰無仮説の下では、この統計量はBeta(m,m)分布に従います。
注釈と参考文献
- ^ ホプキンス、ビッグDランディ; スケラム、ハリー・キンメルIゴードン(1954)。「植物個体の分布タイプを決定するための新しい方法」。Annals of Botany。18(2)。Annals Botany Co:213–227。doi : 10.1093 / oxfordjournals.aob.a083391。
- ^ ab Banerjee, A. (2004). 「ホプキンス統計を用いたクラスターの検証」2004 IEEE 国際ファジーシステム会議 (IEEE Cat. No.04CH37542)。 第 1 巻。 pp. 149–153。doi :10.1109/FUZZY.2004.1375706。ISBN 0-7803-8353-2. S2CID 36701919。
- ^ Aggarwal, Charu C. (2015). データマイニング. チャム: Springer International Publishing. p. 158. doi :10.1007/978-3-319-14142-8. ISBN 978-3-319-14141-1. S2CID 13595565。
- ^ Cross, GR; Jain, AK (1982). 「クラスタリング傾向の測定」デジタル制御の理論と応用: 315-320. doi :10.1016/B978-0-08-027618-2.50054-1.
外部リンク
- http://www.sthda.com/english/wiki/assessing-clustering-tendency-a-vital-issue-unsupervised-machine-learning
