多様性指数とは、データセット(例えば、生物群集)に含まれる異なる種類(例えば、種)の数を測定する方法です。多様性指数は、生物多様性のさまざまな側面(例えば、種の豊富さ、均等度、優占度)を統計的に表現したものであり、異なる生物群集や場所を比較する際に便利な簡略化手法となります。
生態学で多様性指数を使用する場合、関心のあるタイプは通常種ですが、属、科、機能型、ハプロタイプなどの他のカテゴリの場合もあります。関心のあるエンティティは通常、個々の生物(植物や動物など)であり、豊富さの尺度は、たとえば、個体数、バイオマス、または被覆率です。人口統計学では、関心のあるエンティティは人であり、関心のあるタイプはさまざまな人口統計グループです。情報科学では、エンティティは文字とアルファベットのさまざまな文字のタイプです。最も一般的に使用される多様性指数は、実効タイプの数(「真の多様性」とも呼ばれる)の単純な変換ですが、各多様性指数は、実際の現象に対応する尺度として独自に解釈することもできます(ただし、多様性指数ごとに異なる現象です)。[ 1 ] [ 2 ] [ 3 ] [ 4 ]
多くの指標は、対象や実体間のカテゴリー的多様性のみを考慮しています。しかし、そのような指標では、対象や実体間に存在しうる全体的な変動(多様性)を考慮することができません。全体的な変動(多様性)は、カテゴリー的多様性と質的多様性の両方を計算した場合にのみ生じるものです。
本稿で説明する多様性指標には、以下のものが含まれます。
より高度な指標の中には、タイプ間の系統発生的な関連性も考慮に入れているものがある。これらは系統分岐指数と呼ばれ、この記事ではまだ説明されていない。 [ 5 ]
真の多様性、または有効なタイプの数とは、対象となるデータセットで観察されたタイプの平均的な相対存在量と等しくなるために必要な、均等に存在するタイプの数を指します(すべてのタイプが均等に存在するとは限りません)。データセットの真の多様性は、まずデータセット内のタイプの相対存在量の加重一般化平均M q −1を取り、次にその逆数を取ることによって計算されます。式は次のとおりです。[ 3 ] [ 4 ]
分母M q −1は 、指数q − 1の加重一般化平均で計算されたデータセット内のタイプの平均相対存在量に等しい。式において、Rは多様性(データセット内のタイプの総数)であり、i番目のタイプの相対存在量はp iである。相対存在量自体が名目上の重みとして使用される。 これらは次数qのヒル数 または有効種数と呼ばれます。[ 6 ]
q = 1の場合、上記の式は定義されません。しかし、q が1 に近づくときの数学的な極限は明確に定義されており、対応する多様性は次の式で計算されます。
これは、自然対数を用いて計算されたシャノンエントロピーの指数関数です(上記参照)。他の分野では、この統計量はパープレキシティとしても知られています。
多様性の一般方程式はしばしば次の形式で記述される[ 1 ] [ 2 ]
括弧内の項は基本和と呼ばれます。いくつかの一般的な多様性指数は、qの異なる値で計算された基本和に対応しています。[ 2 ]
qの値は、しばしば多様性の次数と呼ばれます。これは、種の相対存在量の加重平均の計算方法を変更することによって、真の多様性が希少種と豊富種に対してどの程度敏感であるかを定義します。パラメータqのいくつかの値では、一般化平均M q −1の値は、特殊なケースとして、よく知られた種類の加重平均を仮定します。特に、
一般的に、 qの値を大きくすると、最も個体数の多い種に与えられる実効的な重みが大きくなります。その結果、qが増加するにつれて、 M q −1 の値は大きくなり、真の多様性 ( q D ) の値は小さくなります。
q = 1の場合、 p i値の加重幾何平均が使用され、各種は比例存在量で正確に重み付けされます (加重幾何平均では、重みは指数です)。q > 1の場合、豊富に存在する種に与えられる重みが誇張され、q < 1の場合、希少種に与えられる重みが誇張されます。q = 0 の場合、種の重みは種の比例存在量と完全に相殺されるため、すべての種が均等に豊富ではない場合でも、 p i値の加重平均は1 / Rに等しくなります。q = 0の場合、有効種の数0 Dは、実際の種の数Rに等しくなります。多様性の文脈では、qは一般的に非負の値に制限されます。これは、qの負の値が希少種に豊富に存在する種よりもはるかに大きな重みを与えるため、q D がR を超えるためです。[ 3 ] [ 4 ]
多様性R は、対象となるデータセットに含まれる異なるタイプの数を単純に定量化したものです。たとえば、種の豊富さ (通常Sと表記) は、特定の場所における種の数です。豊富さは単純な尺度であるため、生態学では、個体数データが入手できないことが多いため、多様性の指標としてよく用いられています。[ 8 ]真の多様性をq = 0で計算すると、有効なタイプの数 ( 0 D ) は実際のタイプの数と等しくなり、これは豊富さ ( R ) と同一になります。[ 2 ] [ 4 ]
シャノン指数は生態学文献でよく使われる多様性指数で、シャノンの多様性指数、シャノン・ウィーナー指数、そして(誤って)シャノン・ウィーバー指数とも呼ばれています。[ 9 ]この尺度はもともと、テキスト文字列のエントロピー(したがってシャノンエントロピー、シャノン情報量に関連)を定量化するために、1948年にクロード・シャノンによって提案されました。 [ 10 ]文字数が多く、対象となる文字列における文字の出現頻度が近いほど、文字列の次の文字を正しく予測することが難しくなるという考え方です。シャノンエントロピーは、この予測に関連する不確実性(エントロピーまたは驚きの度合い)を定量化します。これは通常、次のように計算されます。
ここで、 p iは対象となる文字列中のi番目の文字の種類に属する文字の割合です。生態学では、 p iは対象となるデータセット中のi番目の種に属する個体の割合であることが多いです。そして、シャノンエントロピーは、データセットからランダムに抽出された個体の種を特定する際の不確実性を定量化します。
この式は自然対数で記述されていますが、シャノンエントロピーを計算する際に使用する対数の底は自由に選択できます。シャノン自身は対数の底として2、10、eについて議論しており、これらはその後、シャノンエントロピーを使用するアプリケーションで最も一般的な底となっています。各対数の底は異なる測定単位に対応しており、底が2、10、eの場合はそれぞれ2進数(ビット)、10進数(デシット)、自然数(ナット)と呼ばれています。元々異なる対数の底で計算されたシャノンエントロピー値を比較するには、それらを同じ対数の底に変換する必要があります。底aから底bへの変換は、 log b (a)を乗じることで得られます。[ 10 ]
シャノン指数(H' )は、タイプの相対存在量の加重幾何平均に関連しています。具体的には、 q = 1で計算された真の多様性の対数に等しくなります。 [ 3 ]
これは次のように書くこともできます
定義によりp i値の合計は1 に等しいので、分母はp i値の加重幾何平均に等しくなり、 p i値自体が重み (式の指数) として使用されます。したがって、括弧内の項は真の多様性1 Dに等しく、H' はln( 1 D )に等しくなります。[ 1 ] [ 3 ] [ 4 ]
対象となるデータセット内のすべてのタイプが均等に存在する場合、すべてのp i値は1 / Rに等しくなり、したがってシャノン指数はln( R ) の値をとります。タイプの存在量の不均等性が大きいほど、p i値の加重幾何平均は大きくなり、対応するシャノンエントロピーは小さくなります。存在量のほぼすべてが 1 つのタイプに集中し、他のタイプが非常にまれである場合 (たとえ多数存在しても)、シャノンエントロピーはゼロに近づきます。データセットに 1 つのタイプしかない場合、シャノンエントロピーは正確にゼロになります (次にランダムに選択されたエンティティのタイプを予測する際に不確実性はありません)。
機械学習において、シャノン指数は情報利得とも呼ばれます。
レニーエントロピーは、シャノンエントロピーをqが1以外の値に一般化したものです。それは次のように表すことができます。
これは等しい
これは、任意のqの値に基づいて真の多様性の対数を取ると、同じqの値に対応するレニーエントロピーが得られることを意味します。
シンプソン指数は、個体をタイプに分類したときの集中度を測定するために、 1949 年にエドワード H. シンプソンによって導入されました。 [ 11 ]同じ指数は、1950 年にオリス C. ハーフィンダールによって再発見されました。 [ 12 ]この指数の平方根は、すでに 1945 年に経済学者のアルバート O. ハーシュマンによって導入されていました。[ 13 ]そのため、同じ尺度は、生態学では通常シンプソン指数として、経済学ではハーフィンダール指数またはハーフィンダール・ハーシュマン指数 (HHI) として知られています。
この尺度は、対象となるデータセットから無作為に抽出された2つのエンティティが同じタイプを表す確率に等しい。[ 11 ]これは次の式で表される。
ここで、Rは豊富度 (データセット内のタイプの総数) です。この式は、対象となるタイプの相対存在量p iの加重算術平均にも等しく、相対存在量自体が重みとして使用されます。 [ 1 ]相対存在量は定義上、0 から 1 の間の値に制限されますが、これは加重算術平均であるため、λ ≥ 1/ Rとなり、すべてのタイプが均等に存在する場合に達成されます。
λを計算するために使用した式と真の多様性を計算するために使用した式を比較すると、1/λは2Dに等しいことがわかります。つまり、 q = 2で計算された真の多様性です。したがって、元のシンプソン指数は対応する基本和に等しくなります。[ 2 ]
λを、対象となるデータセットから無作為に抽出した2つのエンティティが同じタイプである確率と解釈する場合、エンティティは復元抽出されることを前提としています。データセットが非常に大きい場合、非復元抽出でもほぼ同じ結果が得られますが、データセットが小さい場合は、その差は大きくなる可能性があります。データセットが小さく、非復元抽出を前提とした場合、2回の無作為抽出で同じタイプが得られる確率は次のようになります。
ここで、n iはi番目のタイプに属するエンティティの数であり、 Nはデータセット内のエンティティの総数です。[ 11 ]この形式のシンプソン指数は、微生物学ではハンター・ガストン指数としても知られています。[ 14 ]
タイプの平均相対存在量はタイプの数の減少と最も豊富なタイプの存在量の増加に伴って増加するため、λ は多様性の高いデータセットでは小さな値を取り、多様性の低いデータセットでは大きな値を取ります。これは多様性指数としては直感に反する挙動であるため、多くの場合、多様性の増加とともに増加するような λ の変換が代わりに使用されてきました。そのような指数の中で最もよく知られているのは、逆シンプソン指数 (1/λ) とジニ・シンプソン指数 (1 − λ) です。[ 1 ] [ 2 ]これらはどちらも生態学文献ではシンプソン指数とも呼ばれているため、異なる指数を誤って同じものとして比較しないように注意が必要です。
逆シンプソン指数は次のように表されます。
これは単純に2次の真の多様性、つまり、対象となるデータセットにおけるタイプの平均的な相対存在量を定量化するために加重算術平均を使用した場合に得られるタイプの有効数に等しい。
この指標は、政党の実効数を測る指標としても用いられる。
機械学習の分野では、ジニ・シンプソン指数はジニ不純度、またはジニの多様性指数[ 15 ]とも呼ばれます。元のシンプソン指数λは、対象となるデータセットから無作為に抽出された2つのエンティティ(復元抽出)が同じタイプを表す確率に等しくなります。したがって、その変換1 − λは、2つのエンティティが異なるタイプを表す確率に等しくなります。この尺度は、生態学では種間遭遇確率(PIE)[ 16 ]およびジニ・シンプソン指数[ 2 ]としても知られています。これは、2次の真の多様性の変換として表現できます。
社会学、心理学、経営学の研究におけるギブス・マーティン指数[ 17 ](ブラウ指数とも呼ばれる)は、ジニ・シンプソン指数と同じ尺度である。
この量は、集団遺伝学においては期待ヘテロ接合度とも呼ばれる。
ウォルフガング・H・ベルガーとフランシス・ローレンス・パーカーにちなんで名付けられたベルガー・パーカー指数[ 18 ]は、データセット内の最大p i値、つまり最も豊富なタイプの相対的な存在量に等しい。これは、 qが無限大に近づくときのp i値の加重一般化平均に対応し、したがって無限大の真の多様性の逆数( 1/ ∞D )に等しい。