確率論と統計学において、分散指数[1]、 分散指数、 分散 係数、相対分散、または分散平均比(VMR)は、変動係数と同様に、確率分布の分散の正規化された尺度であり、標準的な統計モデルと比較して、観測された一連の発生が密集しているか分散しているかを定量化するために使用される尺度です。
これはファノ係数とも呼ばれますが、この用語はウィンドウ化されたデータ(平均と分散がサブ母集団にわたって計算される)に使われることもあります。この場合、分散のインデックスは、ウィンドウが無限である特殊なケースで使用されます。データのウィンドウ化は頻繁に行われ、VMR は、時間のさまざまな間隔または空間の小さな領域(「ウィンドウ」と呼ばれることもあります)にわたって頻繁に計算され、結果として得られる統計はファノ係数と呼ばれます。
これは平均がゼロでない場合にのみ定義され、通常はカウント データやイベント間の時間などの正の統計、または基礎となる分布が指数分布またはポアソン分布であると想定される場合にのみ使用されます。
用語
この文脈では、観測データセットは、特定の地域で特定のマグニチュードを超える地震が発生した時間や、特定の種の植物の地理的空間における位置など、事前に定義されたイベントの発生時刻で構成される場合があります。このような発生の詳細は、まず、等しいサイズの時間領域または空間領域のセットのそれぞれにおけるイベントまたは発生の数のカウントに変換されます。
上記は、カウントの分散指数を定義しています。[2]間隔の分散指数には別の定義が適用されます。[3]ここで扱われる量は、イベント間の時間間隔の長さです。一般的な用法では、「分散指数」はカウントの分散指数を意味します。
解釈
いくつかの分布、特にポアソン分布は、分散と平均が等しいため、VMR = 1 になります。幾何分布と負の二項分布では VMR > 1 ですが、二項分布では VMR < 1、定数ランダム変数では VMR = 0 になります。これにより、次の表が生成されます。
これは、離心率による円錐曲線の分類に類似していると考えられます。詳細については、 特定の確率分布のキュムラントを参照してください。
分散係数の重要性は、区間内の発生数の確率分布がポアソン分布である場合に値が 1 になることです。したがって、この指標は、観測されたデータをポアソン過程を使用してモデル化できるかどうかを評価するために使用できます。分散係数が 1 未満の場合は、データセットが「分散不足」であると言われます。この状態は、ポアソン過程に関連するランダム性よりも規則的な発生パターンに関連している可能性があります。たとえば、規則的で周期的なイベントは分散不足になります。分散係数が 1 より大きい場合は、データセットが分散過剰であると言われます。
分散指数のサンプルベースの推定値は、一連のカウントがポアソン分布に従うというモデルの妥当性に関する正式な統計的仮説検定を構築するために使用できます。 [4] [5]区間カウントに関して、過剰分散は、ポアソン分布と比較して、カウントの低い区間とカウントの高い区間が多くあることに対応します。対照的に、過小分散は、ポアソン分布と比較して、平均カウントに近いカウントを持つ区間が多いことが特徴です。
VMR は、特定の現象のランダム性の度合いを測定するのにも適しています。たとえば、この手法は通貨管理でよく使用されます。
例
ランダムに拡散する粒子(ブラウン運動)の場合、与えられた体積内の粒子数の分布はポアソン分布、つまり VMR=1 です。したがって、与えられた空間パターン(それを測定する方法があると仮定)が純粋に拡散によるものか、あるいは何らかの粒子間相互作用が関与しているのかを評価するには、空間をパッチ、四角形、またはサンプル単位(SU)に分割し、各パッチまたは SU 内の個体数を数えて VMR を計算します。VMR が 1 より大幅に高い場合は、ランダム ウォークでは粒子間の引力ポテンシャルを抑えるのに十分ではないクラスター分布を示します。
歴史
ポアソン分布または二項分布からの偏差を検出するテストの使用について最初に議論したのは、1877 年の Lexis だったようです。彼が開発したテストの 1 つがLexis 比です。
この索引は 1936 年にClaphamによって植物学で初めて使用されました。
ホーエルは分布の最初の4つのモーメントを研究した。[6]彼は、 μ > 5の場合、χ2統計への近似が妥当であることを発見した。
歪んだ分布
非常に偏った分布の場合、2次関数ではなく線形損失関数を使用する方が適切である可能性があります。この場合の類似の分散係数は、データの中央値からの平均絶対偏差と中央値の比であり、[7]または記号で表すと次のようになります。
ここで、nはサンプルサイズ、mはサンプル中央値、そしてサンプル全体の合計です。 アイオワ州、ニューヨーク州、サウスダコタ州では、この線形分散係数を使用して会費税を推定しています。[8] [9] [10]
標本サイズが大きい2標本検定では、両方の標本の中央値は同じで、その周りの分散が異なる場合、線形分散係数の信頼区間は下方に次の式で制限されます。
ここでtjはj番目のサンプルの平均絶対偏差であり、zαは信頼度αの正規分布の信頼区間の長さである(例えば、α = 0.05の場合、zα = 1.96)。[7]
参照
同様の比率
注記
- ^ コックス&ルイス(1966)
- ^ コックス&ルイス(1966)、p72
- ^ コックス&ルイス(1966)、p71
- ^ コックス&ルイス(1966)、p158
- ^ Upton & Cook(2006)、分散指数
- ^ Hoel, PG (1943). 「分散の指標について」. Annals of Mathematical Statistics . 14 (2): 155–162. doi : 10.1214/aoms/1177731457 . JSTOR 2235818.
- ^ ab Bonett, DG; Seier, E (2006). 「非正規分布における分散係数の信頼区間」.バイオメトリカルジャーナル. 48 (1): 144–148. doi :10.1002/bimj.200410148. PMID 16544819. S2CID 33665632.
- ^ 「大量鑑定の統計計算定義」(PDF)。Iowa.gov。2010年 11 月 11 日のオリジナル(PDF)からアーカイブ。
中央値比率: 不動産のクラスの個々の比率を昇順または降順に並べた場合、最高比率と最低比率の中間に位置する比率。中央値は、特定の不動産クラスの評価レベルを決定するために最も頻繁に使用されます。
- ^ 「ニューヨークにおける評価公平性:2010年市場価値調査の結果」。2012年11月6日時点のオリジナルよりアーカイブ。
- ^ 「評価プロセスの概要」(PDF)。state.sd.us 。サウスダコタ州歳入局 - 財産/特別税課。2009年5月10日時点のオリジナル(PDF)からアーカイブ。
参考文献
- コックス、DR; ルイス、PAW (1966)。『一連の出来事の統計分析』ロンドン:メシューエン。
- Upton, G.; Cook, I. (2006). Oxford Dictionary of Statistics (第 2 版). Oxford University Press. ISBN 978-0-19-954145-4。
