統計学において、層化抽出法とは、母集団を部分母集団に分割できる場合に、そこから標本を抽出する方法である。
統計調査において、全体集団内の下位集団にばらつきがある場合、各下位集団(層)を独立してサンプリングすることが有利となる場合がある。
層化とは、標本抽出を行う前に、母集団を均質なサブグループに分割するプロセスです。層は母集団の分割を定義するものでなければなりません。つまり、網羅的かつ相互排他的である必要があります。母集団のすべての要素は、必ず1つの層に割り当てられなければなりません。その後、各層で標本抽出が行われます。例えば、単純無作為抽出などが用いられます。目的は、標本誤差を減らすことで標本の精度を向上させることです。これにより、母集団の単純無作為標本の算術平均よりも変動の少ない加重平均が得られます。
計算統計学において、層化サンプリングは、モンテカルロ法を用いて既知の母集団から母集団統計量を推定する際の分散低減法である。 [ 1 ]
層化抽出法の実際の例としては、政治調査が挙げられます。回答者が人口の多様性を反映する必要がある場合、研究者は、前述のように、人種や宗教などのさまざまな少数派グループの参加者を、総人口に対する割合に基づいて意図的に含めるようにします。このように、層化抽出法を用いた調査は、単純無作為抽出法や系統抽出法を用いた調査よりも、人口をより代表していると主張できます。層化抽出法を用いることで、平均値と分散の両方について、不均衡なサンプリングコストを補正することができます。
選挙における各候補者の平均得票数を推定する必要があると仮定します。ある国に3つの町があるとします。町Aには100万人の工場労働者、町Bには200万人の事務員、町Cには300万人の退職者がいます。全人口から60のランダムサンプルを取得することもできますが、結果として得られるランダムサンプルはこれらの町間でバランスが悪く、偏りが生じ、推定に大きな誤差が生じる可能性があります(関心のある結果が、関心のあるパラメータに関して、町間で異なる分布を持つ場合)。代わりに、町A、B、Cからそれぞれ10、20、30のランダムサンプルを取得することを選択すると、同じ総サンプルサイズで推定の誤差を小さくすることができます。この方法は、一般的に、母集団が均質でない場合に使用されます。
単純無作為抽出ではなく層化抽出を使用する理由には、次のものが含まれます[ 2 ]
地域内の人口密度が大きく異なる場合、層化抽出法を用いることで、地域内の異なる場所で同等の精度で推定値を得ることができ、また、地域間の比較を同等の統計的検出力で行うことができるようになります。例えば、オンタリオ州では、州全体で実施する調査において、人口密度の低い北部でより大きな標本抽出率を用いる場合があります。これは、北部と南部の人口格差が非常に大きいため、州全体の標本抽出率に基づく抽出率では、北部から得られるデータがごくわずかになってしまう可能性があるためです。
サブグループのサンプルサイズを、サブグループから得られるデータの量に比例させるのではなく、サブグループのサイズ(または、F 検定などを使用して、有意に変動することがわかっている場合はその分散)に比例させるようにすることは、この手法の誤った適用です。サブグループ間の変動が疑われる場合、層化サンプリングが正当化されるのであれば、各サブグループを表すデータは同等に重要であるとみなされます。サブグループの分散が有意に異なり、データを分散で層化する必要がある場合、各サブグループのサンプルサイズを、母集団全体のサブグループのサイズに同時に比例させることはできません。平均、分散、およびコストが異なるグループ間でサンプリング リソースを効率的に分割する方法については、「最適割り当て」を参照してください。クラス事前分布(母集団全体におけるサブ集団の比率)が不明な場合の層化サンプリングの問題は、データセットに対するあらゆる分析(分類など)のパフォーマンスに悪影響を及ぼす可能性があります。[ 3 ]その点において、ミニマックスサンプリング比を用いることで、基礎となるデータ生成過程の不確実性に対してデータセットを頑健にすることができる。[ 3 ]
十分な数を確保するためにサブ層を組み合わせると、シンプソンのパラドックスが発生する可能性がある。これは、異なるデータグループに存在する傾向が、グループを組み合わせると消滅したり、場合によっては逆転したりする現象である。
層化無作為抽出の平均と分散は次のように与えられます。[ 2 ]
どこ
用語に注意してくださいこれは、有限人口補正であり、は「サンプル単位」で表す必要がある。有限母集団補正を省略すると、次のようになる。
どこで層の人口重みは。
比例配分戦略では、各層のサンプルサイズは層のサイズに比例して取られます。ある会社には次のようなスタッフがいるとします。[ 4 ]
そして、上記のカテゴリーに従って層別化された40名のスタッフをサンプルとして抽出するよう求められています。
最初のステップは、各グループが全体に占める割合を計算することです。
これは、40のサンプルのうち、
パーセンテージを計算する必要のないもう一つの簡単な方法は、各グループのサイズにサンプルサイズを掛け、それを総人口サイズ(全スタッフのサイズ)で割ることです。
{{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク)