A diversity index is a method of measuring how many different types (e.g. species) there are in a dataset (e.g. a community). Diversity indices are statistical representations of different aspects of biodiversity (e.g. richness, evenness, and dominance), which are useful simplifications for comparing different communities or sites.
When diversity indices are used in ecology, the types of interest are usually species, but they can also be other categories, such as genera, families, functional types, or haplotypes. The entities of interest are usually individual organisms (e.g. plants or animals), and the measure of abundance can be, for example, number of individuals, biomass or coverage. In demography, the entities of interest can be people, and the types of interest various demographic groups. In information science, the entities can be characters and the types of the different letters of the alphabet. The most commonly used diversity indices are simple transformations of the effective number of types (also known as 'true diversity'), but each diversity index can also be interpreted in its own right as a measure corresponding to some real phenomenon (but a different one for each diversity index).[1][2][3][4]
Many indices only account for categorical diversity between subjects or entities. Such indices, however do not account for the total variation (diversity) that can be held between subjects or entities which occurs only when both categorical and qualitative diversity are calculated.
Diversity indices described in this article include:
Some more sophisticated indices also account for the phylogenetic relatedness among the types. These are called phylo-divergence indices, and are not yet described in this article.[5]
真の多様性、または有効なタイプの数とは、対象となるデータセットで観察されたタイプの平均的な相対存在量と等しくなるために必要な、均等に存在するタイプの数を指します(すべてのタイプが均等に存在するとは限りません)。データセットの真の多様性は、まずデータセット内のタイプの相対存在量の加重一般化平均M q −1を取り、次にその逆数を取ることによって計算されます。式は次のとおりです。[ 3 ] [ 4 ]
分母M q −1は 、指数q − 1の加重一般化平均で計算されたデータセット内のタイプの平均相対存在量に等しい。式において、Rは多様性(データセット内のタイプの総数)であり、i番目のタイプの相対存在量はp iである。相対存在量自体が名目上の重みとして使用される。 これらは次数qのヒル数 または有効種数と呼ばれます。[ 6 ]
q = 1の場合、上記の式は定義されません。しかし、q が1 に近づくときの数学的な極限は明確に定義されており、対応する多様性は次の式で計算されます。
これは、自然対数を用いて計算されたシャノンエントロピーの指数関数です(上記参照)。他の分野では、この統計量はパープレキシティとしても知られています。
多様性の一般方程式はしばしば次の形式で記述される[ 1 ] [ 2 ]
括弧内の項は基本和と呼ばれます。いくつかの一般的な多様性指数は、qの異なる値で計算された基本和に対応しています。[ 2 ]
qの値は、しばしば多様性の次数と呼ばれます。これは、種の相対存在量の加重平均の計算方法を変更することによって、真の多様性が希少種と豊富種に対してどの程度敏感であるかを定義します。パラメータqのいくつかの値では、一般化平均M q −1の値は、特殊なケースとして、よく知られた種類の加重平均を仮定します。特に、
一般的に、 qの値を大きくすると、最も個体数の多い種に与えられる実効的な重みが大きくなります。その結果、qが増加するにつれて、 M q −1 の値は大きくなり、真の多様性 ( q D ) の値は小さくなります。
q = 1の場合、 p i値の加重幾何平均が使用され、各種は比例存在量で正確に重み付けされます (加重幾何平均では、重みは指数です)。q > 1の場合、豊富に存在する種に与えられる重みが誇張され、q < 1の場合、希少種に与えられる重みが誇張されます。q = 0 の場合、種の重みは種の比例存在量と完全に相殺されるため、すべての種が均等に豊富ではない場合でも、 p i値の加重平均は1 / Rに等しくなります。q = 0の場合、有効種の数0 Dは、実際の種の数Rに等しくなります。多様性の文脈では、qは一般的に非負の値に制限されます。これは、qの負の値が希少種に豊富に存在する種よりもはるかに大きな重みを与えるため、q D がR を超えるためです。[ 3 ] [ 4 ]
多様性R は、対象となるデータセットに含まれる異なるタイプの数を単純に定量化したものです。たとえば、種の豊富さ (通常Sと表記) は、特定の場所における種の数です。豊富さは単純な尺度であるため、生態学では、個体数データが入手できないことが多いため、多様性の指標としてよく用いられています。[ 8 ]真の多様性をq = 0で計算すると、有効なタイプの数 ( 0 D ) は実際のタイプの数と等しくなり、これは豊富さ ( R ) と同一になります。[ 2 ] [ 4 ]
シャノン指数は生態学文献でよく使われる多様性指数で、シャノンの多様性指数、シャノン・ウィーナー指数、そして(誤って)シャノン・ウィーバー指数とも呼ばれています。[ 9 ]この尺度はもともと、テキスト文字列のエントロピー(したがってシャノンエントロピー、シャノン情報量に関連)を定量化するために、1948年にクロード・シャノンによって提案されました。 [ 10 ]文字数が多く、対象となる文字列における文字の出現頻度が近いほど、文字列の次の文字を正しく予測することが難しくなるという考え方です。シャノンエントロピーは、この予測に関連する不確実性(エントロピーまたは驚きの度合い)を定量化します。これは通常、次のように計算されます。
ここで、 p iは対象となる文字列中のi番目の文字の種類に属する文字の割合です。生態学では、 p iは対象となるデータセット中のi番目の種に属する個体の割合であることが多いです。そして、シャノンエントロピーは、データセットからランダムに抽出された個体の種を特定する際の不確実性を定量化します。
この式は自然対数で記述されていますが、シャノンエントロピーを計算する際に使用する対数の底は自由に選択できます。シャノン自身は対数の底として2、10、eについて議論しており、これらはその後、シャノンエントロピーを使用するアプリケーションで最も一般的な底となっています。各対数の底は異なる測定単位に対応しており、底が2、10、eの場合はそれぞれ2進数(ビット)、10進数(デシット)、自然数(ナット)と呼ばれています。元々異なる対数の底で計算されたシャノンエントロピー値を比較するには、それらを同じ対数の底に変換する必要があります。底aから底bへの変換は、 log b (a)を乗じることで得られます。[ 10 ]
シャノン指数(H' )は、タイプの相対存在量の加重幾何平均に関連しています。具体的には、 q = 1で計算された真の多様性の対数に等しくなります。 [ 3 ]
これは次のように書くこともできます
定義によりp i値の合計は1 に等しいので、分母はp i値の加重幾何平均に等しくなり、 p i値自体が重み (式の指数) として使用されます。したがって、括弧内の項は真の多様性1 Dに等しく、H' はln( 1 D )に等しくなります。[ 1 ] [ 3 ] [ 4 ]
対象となるデータセット内のすべてのタイプが均等に存在する場合、すべてのp i値は1 / Rに等しくなり、したがってシャノン指数はln( R ) の値をとります。タイプの存在量の不均等性が大きいほど、p i値の加重幾何平均は大きくなり、対応するシャノンエントロピーは小さくなります。存在量のほぼすべてが 1 つのタイプに集中し、他のタイプが非常にまれである場合 (たとえ多数存在しても)、シャノンエントロピーはゼロに近づきます。データセットに 1 つのタイプしかない場合、シャノンエントロピーは正確にゼロになります (次にランダムに選択されたエンティティのタイプを予測する際に不確実性はありません)。
機械学習において、シャノン指数は情報利得とも呼ばれます。
レニーエントロピーは、シャノンエントロピーをqが1以外の値に一般化したものです。それは次のように表すことができます。
これは等しい
これは、任意のqの値に基づいて真の多様性の対数を取ると、同じqの値に対応するレニーエントロピーが得られることを意味します。
シンプソン指数は、個体をタイプに分類したときの集中度を測定するために、 1949 年にエドワード H. シンプソンによって導入されました。 [ 11 ]同じ指数は、1950 年にオリス C. ハーフィンダールによって再発見されました。 [ 12 ]この指数の平方根は、すでに 1945 年に経済学者のアルバート O. ハーシュマンによって導入されていました。[ 13 ]そのため、同じ尺度は、生態学では通常シンプソン指数として、経済学ではハーフィンダール指数またはハーフィンダール・ハーシュマン指数 (HHI) として知られています。
この尺度は、対象となるデータセットから無作為に抽出された2つのエンティティが同じタイプを表す確率に等しい。[ 11 ]これは次の式で表される。
ここで、Rは豊富度 (データセット内のタイプの総数) です。この式は、対象となるタイプの相対存在量p iの加重算術平均にも等しく、相対存在量自体が重みとして使用されます。 [ 1 ]相対存在量は定義上、0 から 1 の間の値に制限されますが、これは加重算術平均であるため、λ ≥ 1/ Rとなり、すべてのタイプが均等に存在する場合に達成されます。
λを計算するために使用した式と真の多様性を計算するために使用した式を比較すると、1/λは2Dに等しいことがわかります。つまり、 q = 2で計算された真の多様性です。したがって、元のシンプソン指数は対応する基本和に等しくなります。[ 2 ]
λを、対象となるデータセットから無作為に抽出した2つのエンティティが同じタイプである確率と解釈する場合、エンティティは復元抽出されることを前提としています。データセットが非常に大きい場合、非復元抽出でもほぼ同じ結果が得られますが、データセットが小さい場合は、その差は大きくなる可能性があります。データセットが小さく、非復元抽出を前提とした場合、2回の無作為抽出で同じタイプが得られる確率は次のようになります。
ここで、n iはi番目のタイプに属するエンティティの数であり、 Nはデータセット内のエンティティの総数です。[ 11 ]この形式のシンプソン指数は、微生物学ではハンター・ガストン指数としても知られています。[ 14 ]
タイプの平均相対存在量はタイプの数の減少と最も豊富なタイプの存在量の増加に伴って増加するため、λ は多様性の高いデータセットでは小さな値を取り、多様性の低いデータセットでは大きな値を取ります。これは多様性指数としては直感に反する挙動であるため、多くの場合、多様性の増加とともに増加するような λ の変換が代わりに使用されてきました。そのような指数の中で最もよく知られているのは、逆シンプソン指数 (1/λ) とジニ・シンプソン指数 (1 − λ) です。[ 1 ] [ 2 ]これらはどちらも生態学文献ではシンプソン指数とも呼ばれているため、異なる指数を誤って同じものとして比較しないように注意が必要です。
逆シンプソン指数は次のように表されます。
これは単純に2次の真の多様性、つまり、対象となるデータセットにおけるタイプの平均的な相対存在量を定量化するために加重算術平均を使用した場合に得られるタイプの有効数に等しい。
この指標は、政党の実効数を測る指標としても用いられる。
機械学習の分野では、ジニ・シンプソン指数はジニ不純度、またはジニの多様性指数[ 15 ]とも呼ばれます。元のシンプソン指数λは、対象となるデータセットから無作為に抽出された2つのエンティティ(復元抽出)が同じタイプを表す確率に等しくなります。したがって、その変換1 − λは、2つのエンティティが異なるタイプを表す確率に等しくなります。この尺度は、生態学では種間遭遇確率(PIE)[ 16 ]およびジニ・シンプソン指数[ 2 ]としても知られています。これは、2次の真の多様性の変換として表現できます。
社会学、心理学、経営学の研究におけるギブス・マーティン指数[ 17 ](ブラウ指数とも呼ばれる)は、ジニ・シンプソン指数と同じ尺度である。
この量は、集団遺伝学においては期待ヘテロ接合度とも呼ばれる。
ウォルフガング・H・ベルガーとフランシス・ローレンス・パーカーにちなんで名付けられたベルガー・パーカー指数[ 18 ]は、データセット内の最大p i値、つまり最も豊富なタイプの相対的な存在量に等しい。これは、 qが無限大に近づくときのp i値の加重一般化平均に対応し、したがって無限大の真の多様性の逆数( 1/ ∞D )に等しい。