統計学において、単連結クラスタリングは階層的クラスタリングのいくつかの手法の 1 つです。これは、ボトムアップ方式 (凝集型クラスタリング) でクラスターをグループ化することに基づいており、各ステップで、まだ同じクラスターに属していない最も近い要素のペアを含む 2 つのクラスターを結合します。
この方法では、同じクラスター内の近くの要素間の距離が短い細長いクラスターが生成される傾向がありますが、クラスターの反対側の端にある要素は、他のクラスターの2つの要素よりも互いにはるかに離れている可能性があります。一部のデータクラスでは、これにより、データを有効に細分化できるクラスを定義することが困難になる可能性があります。[1]ただし、この方法は、長い物質のひもを含むことが多い銀河団の分析に天文学でよく使用されています。この用途では、フレンズオブフレンズアルゴリズムとしても知られています。[2]
凝集型クラスタリング手法の概要
凝集型クラスタリング プロセスの開始時には、各要素は独自のクラスターに存在します。その後、クラスターは順次結合されてより大きなクラスターになり、最終的にすべての要素が同じクラスターになります。各ステップで、最短距離で分離された 2 つのクラスターが結合されます。2 つのクラスター間の距離を決定するために使用される関数 (リンク関数)が、凝集型クラスタリング メソッドを区別するものです。
シングルリンククラスタリングでは、2 つのクラスター間の距離は、1 組の要素、つまり互いに最も近い 2 つの要素 (各クラスターに 1 つずつ) によって決定されます。どのステップでも残っているこれらのペアワイズ距離のうち最短のものによって、その要素を含む 2 つのクラスターがマージされます。この方法は、最近傍クラスタリングとも呼ばれます。クラスタリングの結果は、クラスターがマージされた順序と、各マージが行われた距離を示すデンドログラムとして視覚化できます。 [3]
数学的には、リンク関数(クラスターXとYの間の距離D(X、Y ))は、次の式で表されます。
ここで、XとYはクラスターとして考えられる任意の2つの要素セットであり、d ( x , y )は2つの要素xとy間の距離を表します。
単純なアルゴリズム
次のアルゴリズムは、古いクラスターが新しいクラスターにマージされるときに、近接行列の行と列を消去する凝集方式です。近接行列には、すべての距離が含まれます。クラスタリングにはシーケンス番号が割り当てられ、は- 番目のクラスタリングのレベルです。シーケンス番号mのクラスターは( m )で示され、クラスターとクラスター間の近接性はで示されます。
シングルリンクアルゴリズムは、次の手順で構成されます。
- レベルとシーケンス番号を持つ分離クラスタリングから始めます 。
- 現在のクラスタリング内のすべてのクラスターのペアの中で最小値となる場所に従って、現在のクラスタリングで最も類似したクラスターのペア (ペア とします) を検索します。
- シーケンス番号を増分します: 。クラスタとを1つのクラスタにマージして次のクラスタリングを形成します。このクラスタリングのレベルを に設定します。
- クラスター および に対応する行と列を削除し、新しく形成されたクラスター に対応する行と列を追加して、近接行列 を更新します。 で示される新しいクラスターと古いクラスター間の近接性は と定義されます。
- すべてのオブジェクトが 1 つのクラスター内にある場合は停止します。それ以外の場合は手順 2 に進みます。
動作例
この実例は、5種類の細菌(枯草菌()、バチルス・ステアロサーモフィルス()、ラクトバチルス・ビリデセンス( ) 、アコレプラズマ・モディカム()、およびミクロコッカス・ルテウス())の5SリボソームRNA配列アライメントから計算されたJC69遺伝距離行列に基づいています。 [4] [5]
最初のステップ
- 最初のクラスタリング
5 つの要素と、それらの間のペアワイズ距離の次の行列があると仮定します。
この例では、は の最低値なので、要素aとb をクラスタ化します。
- 最初の枝の長さの推定
u は、現在aとbが接続されているノードを表します。設定 により、要素aとb はuから等距離になります。これは、超距離性仮説の期待値に対応します。aとb をuに接続する枝の長さは (最終的な樹形図を参照) になります。
- 最初の距離行列の更新
次に、初期の近接行列を新しい近接行列(下記参照) に更新します。この行列は、 aとbがクラスタリングされているため、サイズが 1 行 1 列縮小されます。 の太字の値は、最初のクラスターの各要素と残りの各要素 間の最小距離を維持して計算された新しい距離に対応します。
斜体で示された値は、最初のクラスターに含まれない要素間の距離に対応するため、マトリックスの更新による影響を受けません。
第二段階
- 2番目のクラスタリング
新しい距離行列から始めて、前の 3 つのアクションを繰り返します 。
ここで、 および は の最小値であるため、クラスターを要素cと要素eに結合します。
- 2番目の枝の長さの推定
v は、現在、、c、e が接続されているノードを表します。超距離制約により、aまたはb をvに、cをvに、eをvに接続するブランチは等しく、合計の長さは次のようになります。
欠けている枝の長さを推測します。
- (最終的な樹形図を参照)
- 2回目の距離行列更新
次に、行列を新しい距離行列(下記参照)に更新します。この行列は、 cとeのクラスタリングにより、サイズが 2 行 2 列縮小されます 。
最終ステップ
最終的なマトリックスは次のようになります。
そこで、クラスターとを結合します。
とが現在接続されている(ルート) ノードを とします。とを接続するブランチの長さは次のようになります。
残りの枝の長さを推定します。
単連鎖樹状図

これで樹形図が完成しました。すべての先端 ( 、、、、および)が から等距離にあるため、樹形図は超距離です 。
したがって、樹形図は、最も深いノードである によってルート化されます。
その他のリンク
単一リンク クラスタリングの単純なアルゴリズムは、基本的に最小全域木のクラスカルのアルゴリズムと同じです。ただし、単一リンク クラスタリングでは、クラスターが形成される順序が重要ですが、最小全域木では、アルゴリズムによって選択された距離を形成するポイントのペアのセットが重要です。
代替のリンケージ スキームには、完全リンケージ クラスタリング、平均リンケージ クラスタリング ( UPGMAおよびWPGMA )、およびWard 法があります。凝集型クラスタリングの単純なアルゴリズムでは、異なるリンケージ スキームを実装するには、アルゴリズムでクラスター間距離を計算するために異なる式を使用するだけで済みます。調整する必要がある式は、上記のアルゴリズムの説明で太字で強調表示されています。ただし、以下で説明するようなより効率的なアルゴリズムは、すべてのリンケージ スキームに同じように一般化されるわけではありません。
より高速なアルゴリズム
単一リンク クラスタリングの単純なアルゴリズムは理解しやすいですが、時間の計算量が で遅くなります。[6] 1973 年に、R. Sibson は、時間の計算量と空間の計算量(どちらも最適) を持つ SLINK と呼ばれるアルゴリズムを提案しました。SLINK アルゴリズムは、番号付きアイテムのセットに対するクラスタリングを2 つの関数で表します。これらの関数は両方とも、アイテム と少なくとも 1 つの大きな番号のアイテムの両方を含む最小のクラスターを見つけることによって決定されます。最初の関数 は、アイテム を クラスター 内で最も番号の大きいアイテムにマップします。2 番目の関数 は、アイテム を クラスター の作成に関連付けられた距離にマップします。各アイテム番号をその関数値にマップする 2 つの配列にこれらの関数を格納するには スペースが必要であり、この情報でクラスタリング自体を決定するのに十分です。Sibson が示すように、アイテムのセットに新しいアイテムが追加されると、同じ方法で表される、追加セットの新しい単一リンク クラスタリングを表す更新された関数を、時間 で古いクラスタリングから構築できます。 SLINKアルゴリズムは項目を1つずつループし、クラスタリングの表現に追加します。[7] [8]
同じ最適な時間と空間の境界で実行される代替アルゴリズムは、最小全域木に対する単純なアルゴリズムとクラスカルのアルゴリズムの等価性に基づいています。クラスカルのアルゴリズムを使用する代わりに、与えられたアイテムと距離の最小全域木(クラスタリングではない)を構築するのに時間と空間を要するバイナリヒープのないバリエーションのプリムのアルゴリズムを使用できます。次に、最小全域木のエッジによって形成されたスパースグラフにクラスカルのアルゴリズムを適用すると、追加の時間と空間でクラスタリング自体が生成されます。[9]
参照
参考文献
- ^ Everitt B (2011).クラスター分析. チチェスター、ウェストサセックス、イギリス: Wiley. ISBN 9780470749913。
- ^ Feigelson, Eric (2012). 「天文学における分類: 過去と現在」。Way, Michael J.、Scargle, Jeffrey D.、Ali, Kamal M.、Srivastava, Ashok N. (編)。天文学における機械学習とデータマイニングの進歩。Chapman and Hall/CRC。pp. 3–10。Bibcode :2012amld.book....3F。doi :10.1201/b11822-7。
- ^ Legendre P, Legendre L (1998).数値生態学. 環境モデリングの発展. 第20巻(第2英語版). アムステルダム: Elsevier.
- ^ Erdmann VA、 Wolters J (1986)。「公開された 5S、5.8S 、および 4.5S リボソーム RNA 配列のコレクション」。核酸研究。14 補足 (補足): r1-59。doi :10.1093/ nar /14.suppl.r1。PMC 341310。PMID 2422630。
- ^ Olsen GJ (1988)。「リボソームRNAを用いた系統発生解析」Noller HF Jr、Moldave K (編)。リボソーム。酵素学の方法。第164巻。pp. 793–812。doi : 10.1016/s0076-6879(88) 64084-5。ISBN 978-0-12-182065-7. PMID 3241556。
- ^ Murtagh F、 Contreras P (2012)。「階層的クラスタリングのためのアルゴリズム:概要」。Wiley Interdisciplinary Reviews:データマイニングと知識発見。2 (1)。Wileyオンラインライブラリ:86–97。doi :10.1002/widm.53。
- ^ Sibson R (1973). 「SLINK: シングルリンク クラスター法のための最適効率アルゴリズム」(PDF) . The Computer Journal . 16 (1). British Computer Society: 30–34. doi : 10.1093/comjnl/16.1.30 .
- ^ Gan G (2007).データクラスタリング: 理論、アルゴリズム、およびアプリケーション。フィラデルフィア、ペンシルバニア州。アレクサンドリア、バージニア州: SIAM、アメリカ統計協会産業応用数学協会。ISBN 9780898716238。
- ^ Gower JC、Ross GJ (1969)。「最小スパニングツリーと単一リンククラスター分析」。Journal of the Royal Statistical Society、シリーズC。18 ( 1 ): 54–64。doi : 10.2307 /2346439。JSTOR 2346439。MR 0242315 。。
外部リンク
- Matlab で使用されるリンク
