サンプルサイズの決定または推定とは、統計的サンプルに含める観測数または反復数を選択する行為です。サンプルサイズは、サンプルから母集団について推論を行うことを目的とするあらゆる実証研究において重要な要素です。実際には、研究で使用されるサンプルサイズは通常、データの収集にかかる費用、時間、利便性、および十分な統計的検出力を確保する必要性に基づいて決定されます。複雑な研究では、層別調査や複数の処置群を持つ実験計画など、異なるサンプルサイズが割り当てられる場合があります。国勢調査では、母集団全体のデータが求められるため、意図するサンプルサイズは母集団に等しくなります。研究が異なる処置群に分割される実験計画では、各群ごとに異なるサンプルサイズが設定される場合があります。
サンプルサイズは、いくつかの方法で選択できます。
サンプルサイズの決定は、研究方法論において極めて重要な側面であり、研究結果の信頼性と妥当性を確保する上で大きな役割を果たします。推定値の精度、統計的検定の検出力、そして研究結果の全体的な堅牢性に影響を与えるためには、研究に含める参加者数またはデータポイント数を慎重に選択する必要があります。
新製品に対する顧客の平均満足度を調べるための調査を実施する場合を考えてみましょう。適切なサンプルサイズを決定するには、必要な信頼水準、誤差範囲、回答のばらつきなどの要素を考慮する必要があります。例えば、信頼水準を95%に設定するとします。これは、真の平均満足度が計算された範囲内に収まる確率が95%であることを意味します。また、誤差範囲を±3%と設定します。これは、サンプル推定値と真の母集団パラメータとの許容差範囲を示します。さらに、過去のデータや仮定に基づいて、満足度のばらつきについてある程度の見当をつけることもできます。
一般的に、サンプルサイズが大きいほど、未知のパラメータを推定する際の精度は向上します。例えば、特定の魚種における病原体感染の蔓延率を正確に判断するには、100匹の魚を調査するよりも200匹の魚を調査する方が望ましいでしょう。この現象は、大数の法則や中心極限定理など、数理統計学のいくつかの基本的な事実によって説明されます。
状況によっては、サンプルサイズを大きくしても精度の向上はごくわずか、あるいは全く見られない場合があります。これは、データに系統誤差や強い依存性がある場合、データが裾の重い分布に従う場合、あるいはデータが強い依存性や偏りを持っている場合などに起こり得ます。
サンプルサイズは、得られる推定値の質に基づいて以下のように評価できます。通常、データ収集のコスト、時間、利便性、および十分な統計的検出力の必要性に基づいて決定されます。たとえば、割合を推定する場合、95%信頼区間の幅が0.06単位未満になるようにしたい場合があります。あるいは、サンプルサイズは仮説検定の検出力に基づいて評価することもできます。たとえば、ある政治候補者に対する女性の支持率と男性の支持率を比較する場合、支持率の差が0.04単位である場合に80%の検出力が必要になる場合があります。
比較的単純な例として、割合の推定が挙げられます。これは統計分析の基本的な側面であり、特に集団内における特定の特性の出現頻度を測定する際に重要となります。例えば、ある地域に住む住民のうち、65歳以上の人の割合を推定したい場合などが考えられます。
割合の推定値はここで、Xは「陽性」のインスタンスの数(例えば、n 人のサンプル対象者のうち、65 歳以上の人の数)です。観測値が独立している場合、この推定量は(スケーリングされた)二項分布に従います(また、ベルヌーイ分布からのデータの標本平均でもあります)。この分布の最大分散は0.25 であり、これは真のパラメータがp = 0.5 の場合に発生します。実際の応用では、真のパラメータpが不明な場合、最大分散がサンプルサイズ評価によく用いられます。p の妥当な推定値がわかっている場合、その量は0.25の代わりに使用できます。
サンプルサイズnが十分に大きくなると、正規分布によって近似されます。[ 1 ]これと二項分布に対するワルド法を用いると、信頼区間が得られます。ここで、Zは目的の信頼水準(例えば、95%信頼区間の場合は1.96)の標準Zスコアを表します。形式は次のとおりです。
比率を推定するための適切なサンプルサイズnを決定するには、以下の式を解くことができます。ここで、W は信頼区間の希望する幅を表します。得られたサンプルサイズ式は、多くの場合、 pの保守的な推定値(例: 0.5)とともに適用されます。
nの場合、サンプルサイズが得られます。
割合の最も保守的な推定値として0.5を使用する場合。(注:W/2 =誤差範囲。)
そうでなければ、式は次のようになります。これにより

右側の図では、異なる信頼水準と誤差範囲に応じて、二項比率のサンプルサイズがどのように変化するかが観察できます。
例えば、95%信頼区間の幅が2パーセントポイント(0.02)である大統領候補を支持する米国人口の割合を推定する場合、この場合の誤差範囲が1パーセントポイントであるため、(1.96) 2 / (0.02 2 ) = 9604のサンプルサイズが必要となります。大統領選はしばしば50/50に近い結果となるため、この場合pの推定値として0.5を使用するのが妥当であり、また保守的な推定値を使用するのも賢明です。この場合の誤差範囲は1パーセントポイント(0.02の半分)です。
実際には、その式は次のようになります 。真の割合の95%信頼区間を求めるためによく用いられる式です。nについて解くことができ、必要な誤差範囲Wを満たすために必要な最小サンプル サイズが得られます。上記は一般的に次のように簡略化されます。[ 2 ] [ 3 ] n = 4/ W 2 = 1/ B 2ここで、Bは推定値の誤差範囲、つまり、推定値は通常± B の範囲内として与えられます。B = 10%の場合、 n = 100 が必要であり、B = 5% の場合はn = 400 が必要であり、B = 3% の場合はn = 1000に近似し、 B = 1%の場合はn = 10000のサンプル サイズが必要です。これらの数値は、世論調査やその他のサンプル調査のニュース報道でよく引用されます。ただし、数値は切り上げられることが多いため、報告される結果は正確な値ではない可能性があります。n の値が、必要な結果を得るために必要な最小サンプル ポイント数であることを知っていれば、回答者の数は最小値以上でなければなりません。
簡単に言うと、都市部で人々が通勤するのにかかる平均時間を推定しようとする場合、全人口を調査する代わりに、100人の無作為標本を抽出し、それぞれの通勤時間を記録し、その標本の平均通勤時間を計算すればよいのです。例えば、1人目は25分、2人目は30分、…、100人目は20分かかるとします。これらの通勤時間をすべて合計し、標本中の人数(この場合は100人)で割ります。その結果が、全人口の平均通勤時間の推定値となります。この方法は、全人口を測定することが現実的でない場合に実用的であり、代表的な標本に基づいた妥当な近似値を提供します。
厳密に数学的に言うと、サイズnの独立同分布 (iid) 標本を用いて母平均を推定する場合、各データ値の分散はσ²であり、標本平均の標準誤差は次のようになります。
この式は、サンプルサイズが増加するにつれて推定値の精度がどのように向上するかを定量的に表しています。中心極限定理を用いて標本平均を正規分布で近似することを正当化すると、次の形式の信頼区間が得られます。
幅Wの信頼区間に必要なサンプルサイズnを決定するには、サンプル平均の両側の誤差範囲をW/2とすると、次の式が成り立つ。
。
例えば、血圧に対する薬剤の効果を95%信頼区間の幅が6単位であると推定する場合、母集団における血圧の既知の標準偏差が15である場合、必要なサンプルサイズはサンプルサイズは整数でなければならず、計算された最小値以上でなければならないため、97に切り上げられます。これらの計算を理解することは、研究者が望ましい信頼水準内で母集団平均を正確に推定するための研究を設計する上で不可欠です。
統計学者が直面する一般的な課題の1つは、仮説検定における有意水準を示す、あらかじめ定められた第一種過誤率αを維持しながら、検定に必要な統計的検出力を得るために必要なサンプルサイズを計算することです。これは、あらかじめ定められた値に基づいて、検定の検出力を決定します。以下のように、特定の値に対するあらかじめ定められた表、数式、シミュレーション、ミードのリソース方程式、または累積分布関数によって推定できます。
右に示す表は、2標本t検定において、実験群と対照群の標本サイズが等しい場合(つまり、試験における個体の総数が与えられた数の2倍であり、望ましい有意水準が0.05である場合)の標本サイズを推定するために使用できます。[ 4 ]使用されるパラメータは次のとおりです。
必要なサンプルサイズを計算することは、関心のある対立仮説の下での検定統計量の分布を扱うのが難しいため、多くの場合容易ではありません。特定の問題に対する近似サンプルサイズ式が利用可能です。一般的な参考文献としては、 [ 5 ] および [ 6 ]があります。
QuickSizeアルゴリズム [ 7 ] は、非常に汎用的なアプローチであり、使い方は簡単でありながら、幅広い問題に対して正確な解を与えるのに十分な汎用性を備えています。これは、シミュレーションと探索アルゴリズムを組み合わせて使用します。
ミードの資源方程式は、実験動物のサンプルサイズを推定する際によく用いられるほか、他の多くの実験でも用いられています。サンプルサイズを推定する際、他の方法ほど正確ではないかもしれませんが、期待される標準偏差やグループ間の値の期待される差などのパラメータが不明または推定が非常に困難な場合に、適切なサンプルサイズが何であるかのヒントを与えてくれます。[ 8 ]
方程式中のすべてのパラメータは、実際にはそれらの概念の数の自由度であり、したがって、方程式に挿入する前にそれらの数から1が引かれます。
方程式は次のとおりです。[ 8 ]
どこ:
例えば、実験動物を用いた研究を、4つの治療群(T = 3)で計画し、各群に8匹の動物、合計32匹の動物(N = 31)を使用し、それ以上の層別化(B = 0)を行わない場合、Eは28となり、カットオフ値20を超えているため、サンプルサイズがやや大きすぎる可能性があり、各群に6匹の動物の方が適切かもしれない。[ 9 ]
X i、i = 1, 2, ..., nを、未知の平均 μ と既知の分散 σ 2を持つ正規分布から抽出された独立な観測値とする。2 つの仮説、帰無仮説を考える。
そして、もう一つの仮説:
ある「最小有意差」μ * > 0 に対して。これは、差を観測することに関心がある最小値です。さて、(1) H a が真である場合に 少なくとも 1 − βの確率でH 0を棄却し (つまり、 1 − βのパワー)、(2) H 0 が真である場合に確率 α で H 0 を棄却するには、次のことが必要です。z αが標準正規分布の上限 α パーセント点である場合、
など
は、(2)を満たす決定ルールです。(これは片側検定です。)このようなシナリオでは、対立仮説H a が 真である場合に、少なくとも 1−β の確率でこれを達成することが不可欠になります。ここで、標本平均は平均μ *の正規分布から得られます。したがって、要件は次のように表されます。
慎重な操作により、これは(統計的検出力の例を参照)次のような場合に起こることが示される。
どこは正規累積分布関数です。
層化抽出法のようなより複雑なサンプリング手法では、サンプルをサブサンプルに分割できる場合が多い。通常、H個のサブサンプル(H個の異なる層から抽出)がある場合、それぞれのサブサンプルのサイズはn h(h = 1, 2, ..., H )となる。これらのn hは、 n 1 + n 2 + ... + n H = n (つまり、総サンプルサイズはサブサンプルサイズの合計)という規則に従わなければならない。これらのn hを最適に選択する方法は様々あり、例えばネイマンの最適配分法などが挙げられる。
層化サンプリングを使用する理由は数多くあります。[ 10 ]サンプル推定値の分散を減らすため、部分的に非ランダムな方法を使用するため、または層を個別に調査するためです。有用な部分的に非ランダムな方法は、容易にアクセスできる場合は個人をサンプリングし、アクセスできない場合はクラスターをサンプリングして移動コストを節約することです。[ 11 ]
一般的に、H層の場合、加重標本平均は
と
重さ、は、多くの場合、ただし常にではないが、層内の人口要素の割合を表し、固定サンプルサイズの場合、、
各層内のサンプリング率を各層内の標準偏差に比例させれば、これを最小化することができる。、 どこそしては定数で、。
層内のサンプリング率が層内の標準偏差に正比例し、層内の要素あたりのサンプリングコストの平方根に反比例する場合、「最適な配分」が達成される。:
どこは定数で、または、より一般的には、
質的研究では、量的研究とは異なる独特の方法論でサンプルサイズの決定を行います。あらかじめ決められた公式や統計計算に頼るのではなく、研究プロセス全体を通して主観的かつ反復的な判断を行います。質的研究では、研究者はしばしば主観的な立場を取り、研究の進行に合わせて決定を下します。質的研究におけるサンプルサイズの決定は、異なるアプローチをとります。それは一般的に、研究の進行に合わせて行われる主観的な判断です。[ 16 ]一般的なアプローチの 1 つは、「飽和」に達するまで参加者や資料を継続的に追加することです。飽和とは、新しい参加者やデータが新たな洞察を提供しなくなったときに発生し、研究が選択されたサンプル飽和内の視点や経験の多様性を十分に捉えたことを示しています。[ 17 ]飽和に達するために必要な数は経験的に調査されています。[ 18 ] [ 19 ] [ 20 ] [ 21 ]
定量的研究とは異なり、質的研究では、研究開始前にサンプルサイズを推定するための信頼できるガイダンスが不足しています。がん生存者への詳細なインタビューを実施する場合、質的研究者はデータ飽和を使用して適切なサンプルサイズを決定することができます。複数のインタビューで新しいテーマや洞察が現れない場合、飽和に達したことになり、それ以上のインタビューを行っても生存者の経験に関する知識はあまり増えない可能性があります。したがって、あらかじめ設定された統計式に従うのではなく、飽和を達成するという概念は、質的研究におけるサンプルサイズを決定するための動的なガイドとして機能します。研究開始前にサンプルサイズを推定するための信頼できるガイダンスは不足しており、さまざまな提案がなされています。[ 19 ] [ 22 ] [ 23 ] [ 24 ]質的研究におけるサンプルサイズ決定プロセスに何らかの構造を導入する試みとして、定量的検出力計算に類似したツールが提案されています。このツールは負の二項分布に基づいており、特にテーマ分析に適しています。[ 25 ] [ 24 ]