統計学、品質保証、調査方法論において、サンプリングとは、統計的母集団の中から個体のサブセットを選択し、母集団全体の特性を推定することです。このサブセットは統計的標本(または略して標本)と呼ばれ、母集団全体を反映することを目的としており、統計学者は母集団を代表する標本を収集しようと努めます。
標本調査は、全人口からデータを記録する国勢調査に比べて、コストが低く、データ収集も迅速です(宇宙のすべての星の大きさを把握するなど、全人口のデータを収集することは多くの場合不可能です)。そのため、全人口を測定することが現実的でない場合に、標本調査は有益な知見を提供することができます。
各観測では、独立したオブジェクトまたは個体の 1 つ以上の特性 (重量、位置、色、質量など) を測定します。調査サンプリングでは、特に層化サンプリングにおいて、サンプル設計を調整するためにデータに重みを適用できます。[ 1 ]確率論と統計理論の結果が、実践の指針として使用されます。ビジネスおよび医学研究では、サンプリングは母集団に関する情報を収集するために広く使用されています。[ 2 ]受入サンプリングは、材料の生産ロットが規定の仕様を満たしているかどうかを判断するために使用されます。
くじを使った無作為抽出は古い考え方で、聖書にも何度か登場します。1786年、ピエール・シモン・ラプラスは標本と比率推定器を用いてフランスの人口を推定しました。彼はまた、誤差の確率的推定値も計算しました。これらは現代の信頼区間として表現されたのではなく、確率1000/1001で標本誤差の特定の上限を達成するために必要な標本サイズとして表現されました。彼の推定では、一様事前確率を用いたベイズの定理を使用し、標本が無作為であると仮定しました。アレクサンドル・イヴァノヴィチ・チュプロフは1870年代に帝政ロシアに標本調査を導入しました。 [ 3 ]
米国では、1936年のリテラリー・ダイジェスト誌による共和党の大統領選挙勝利予測は、深刻な偏向報道のために大きく外れた。200万人以上が雑誌の購読者リストや電話帳から入手した名前で調査に回答した。これらのリストが共和党に大きく偏っていることは認識されておらず、結果として得られたサンプルは非常に大きいものの、深刻な欠陥があった。[ 4 ] [ 5 ]
シンガポールの選挙では、 2015年の選挙以来、サンプルカウントとも呼ばれるこの方法を採用している。一方、同国の選挙管理委員会である選挙管理局(ELD)によると、サンプルカウントは憶測や誤報を減らすのに役立ち、選挙管理官がその選挙区の選挙結果と照合するのに役立つ。報告されたサンプルカウントは、95%信頼区間で4%の誤差範囲でかなり正確な指標結果をもたらすが、ELDはサンプルカウントは公式結果とは別であり、投票集計が完了した後に公式結果を発表するのは選挙管理官のみであることを国民に改めて注意喚起した。 [ 6 ] [ 7 ]
統計的手法を成功させるには、問題を明確に定義することが重要です。サンプリングにおいては、標本を抽出する「母集団」を定義する必要があります。母集団とは、理解したい特性を持つすべての人や物を含むものと定義できます。母集団のすべての人や物から情報を収集するのに十分な時間や資金があることは非常に稀であるため、目標は母集団を代表する標本(または部分集合)を見つけることとなります。
母集団を定義するものが明白な場合もある。例えば、製造業者は、生産された材料のバッチが顧客に出荷できるほど十分な品質であるか、それとも品質不良のため廃棄または再加工すべきかを判断する必要がある。この場合、バッチが母集団となる。
調査対象となる集団は多くの場合、物理的な物体で構成されるが、時間、空間、あるいはこれらの次元の組み合わせにわたってサンプリングを行う必要がある場合もある。例えば、スーパーマーケットの従業員配置に関する調査では、様々な時間帯におけるレジの行列の長さを調べたり、絶滅危惧種のペンギンに関する研究では、ペンギンが様々な狩猟地を時間経過とともにどのように利用しているかを把握しようとしたりするだろう。時間軸に関しては、一定期間や特定の時点に焦点を当てる場合がある。
場合によっては、調査対象の「母集団」はさらに捉えどころのないものであることもあります。例えば、ジョセフ・ジャガーはモンテカルロのカジノでルーレットのホイールの挙動を研究し、偏りのあるホイールを特定しました。この場合、ジャガーが調査したかった「母集団」はホイール全体の挙動(つまり、無限回の試行における結果の確率分布)であり、彼の「サンプル」はそのホイールから得られた観測結果から構成されていました。銅の電気伝導率など、材料の特性を繰り返し測定する場合にも、同様の考察が必要となります。
このような状況は、観察対象集団が結果である原因システムに関する知識を求める際によく発生します。このような場合、標本抽出理論では、観察対象集団をより大きな「超母集団」からの標本として扱うことがあります。例えば、ある研究者が、100人の被験者からなる試験グループで新しい禁煙プログラムの成功率を調査し、そのプログラムが全国的に利用可能になった場合の効果を予測しようとする場合などが考えられます。この場合の超母集団は「この治療を受けられる国内のすべての人々」ですが、プログラムがまだすべての人に利用可能になっていないため、この集団はまだ存在しません。
サンプルが抽出される母集団は、情報が必要な母集団と同一ではない場合があります。多くの場合、フレームの問題などにより、これら2つのグループの間には大きな重複がありますが、完全に重複しているわけではありません(下記参照)。場合によっては、両者は完全に別個のものとなることもあります。例えば、人間の健康状態をより深く理解するためにラットを研究したり、2008年に生まれた人々の記録を研究して2009年に生まれた人々のことを予測したりする場合があります。
標本抽出対象集団と対象集団を正確に定義するために費やす時間は、多くの場合、有益な時間となる。なぜなら、そうすることで、この段階で見落とされがちな多くの問題点、曖昧さ、疑問点が明らかになるからである。
最も単純なケース、例えば生産ロットから材料をサンプリングする場合(ロットごとの受入サンプリング)では、母集団のすべての項目を識別して測定し、そのいずれかをサンプルに含めることが最も望ましいでしょう。しかし、より一般的なケースでは、これは通常不可能または非現実的です。すべてのネズミの集合からすべてのネズミを識別する方法はありません。投票が義務付けられていない場合、次の選挙で誰が投票するかを(選挙前に)特定する方法はありません。これらの不正確な母集団は、以下に示すような方法でサンプリングしたり、統計理論を適用したりすることには適していません。
解決策として、すべての要素を識別し、サンプルにすべて含めることができる特性を持つサンプリングフレームを求めます。 [ 8 ] [ 9 ] [ 10 ] [ 11 ]最も単純なタイプのフレームは、適切な連絡先情報を持つ母集団の要素のリスト(できれば母集団全体)です。たとえば、世論調査では、考えられるサンプリングフレームには、選挙人名簿と電話帳が含まれます。
確率標本とは、母集団のすべての要素が標本に選ばれる可能性(ゼロより大きい確率)を持ち、かつその確率を正確に決定できる標本のことです。これらの特性を組み合わせることで、標本に選ばれた要素をその選択確率に応じて重み付けすることにより、母集団全体の偏りのない推定値を得ることが可能になります。
例:ある通りに住む成人の総収入を推定したいとします。その通りの各世帯を訪問し、そこに住む成人全員を特定し、各世帯から無作為に1人を選びます。(例えば、 0から1までの均一分布から生成された乱数を各人に割り当て、各世帯で最も高い乱数を持つ人を選ぶことができます。)次に、選ばれた人にインタビューを行い、収入を調べます。
一人暮らしの人は必ず選ばれるため、単純にその人の収入を合計額の見積もりに加算します。しかし、大人二人で暮らす世帯の人は、選ばれる確率が2分の1しかありません。これを反映するため、そのような世帯の場合、選ばれた人の収入を合計額に2回加算します。(その世帯から選ばれた人は、選ばれなかった人も代表していると考えることができます。)
上記の例では、全員が同じ確率で選ばれるわけではありません。これが確率標本である理由は、各個人の確率が既知であるからです。母集団のすべての要素が同じ確率で選ばれる場合、これは「等確率選択」(EPS)設計と呼ばれます。このような設計は、すべての標本単位に同じ重みが与えられるため、「自己重み付け」とも呼ばれます。
確率サンプリングには、単純無作為抽出、系統抽出、層化抽出、規模比例確率抽出、クラスター抽出または多段階抽出が含まれます。これらのさまざまな確率サンプリング方法には、次の2つの共通点があります。
非確率サンプリングとは、母集団の一部の要素が選択される可能性がない(これらは「網羅外」または「網羅不足」と呼ばれることもある)、あるいは選択確率を正確に決定できないサンプリング方法を指します。これは、対象となる母集団に関する仮定に基づいて要素を選択するものであり、この仮定が選択基準となります。したがって、要素の選択は非ランダムであるため、非確率サンプリングではサンプリング誤差を推定することはできません。これらの条件は除外バイアスを生じさせ、標本が母集団について提供できる情報量に限界をもたらします。標本と母集団の関係に関する情報が限られているため、標本から母集団への外挿は困難です。
例:ある通りにあるすべての世帯を訪問し、最初にドアを開けた人にインタビューします。複数の人が住んでいる世帯では、これは非確率標本となります。なぜなら、ドアを開ける可能性が高い人(例えば、ほとんどの時間を自宅で過ごす失業者は、インタビュー担当者が訪問したときに仕事に出ている可能性のある同居人よりもドアを開ける可能性が高い)がいて、これらの確率を計算するのは現実的ではないからです。
非確率サンプリング法には、便宜サンプリング、割当サンプリング、スノーボールサンプリング、目的サンプリングなどがあります。さらに、無回答の影響は、無回答の特性を十分に理解していない場合、あらゆる確率設計を非確率設計に変えてしまう可能性があります。なぜなら、無回答は各要素のサンプリング確率を実質的に変化させるからです。
上記で挙げたどのタイプのフレームにおいても、様々なサンプリング方法を個別に、あるいは組み合わせて使用することができます。これらの設計の選択に影響を与える一般的な要因には、以下のようなものがあります。
特定のサイズの単純無作為標本(SRS)では、標本抽出枠のすべての部分集合が等しい確率で選択されます。したがって、抽出枠の各要素は等しい確率で選択されます。抽出枠は細分化も分割もされません。さらに、任意の要素のペアは、他の任意のペアと同様に選択される可能性があります(3つ組なども同様です)。これにより、バイアスが最小限に抑えられ、結果の分析が簡素化されます。特に、標本内の個々の結果間の分散は、母集団全体の分散の良い指標となるため、結果の精度を比較的容易に推定できます。
単純無作為抽出法は、選択のランダム性によって母集団の構成を反映しない標本が得られる可能性があるため、標本誤差が生じやすい。例えば、ある国から10人を単純無作為抽出した場合、平均的には男性5人、女性5人となるが、個々の抽出では一方の性別が過剰に代表され、他方の性別が過少に代表される可能性が高い。系統抽出法や層化抽出法は、「母集団に関する情報」を利用して、より「代表的」な標本を選択することで、この問題を克服しようとする。
また、対象集団が大きい場合、単純無作為抽出法は煩雑で手間がかかることがあります。研究者は、対象集団のサブグループに特有の研究課題に関心を持つ場合もあります。例えば、認知能力が仕事のパフォーマンスを予測する指標として、人種グループ間で同様に適用できるかどうかを検証したいと考える研究者もいるでしょう。単純無作為抽出法では対象集団のサブサンプルが得られないため、このような状況における研究者のニーズを満たすことはできません。そのため、層化抽出法などの他のサンプリング手法を用いる必要があります。
系統抽出法(間隔抽出法とも呼ばれる)は、調査対象集団を何らかの順序付けに従って並べ、その順序付けされたリストから一定間隔で要素を選択する方法である。系統抽出法では、ランダムに開始し、その後はk番目ごとの要素を選択していく。この場合、k = (母集団サイズ/サンプルサイズ)となる。開始点が自動的にリストの最初の要素になるのではなく、リストの最初の要素からk番目の要素までの中からランダムに選択されることが重要である。簡単な例としては、電話帳から10番目ごとの名前を選択する方法がある(「10番目ごとの」サンプル、または「10をスキップしたサンプリング」とも呼ばれる)。
開始点がランダム化されている限り、系統抽出法は確率抽出法の一種です。実装が容易であり、リストの順序付けに用いる変数が対象変数と相関している場合、それによって生じる層別化によって効率を高めることができます。「10個ごとに」抽出する方法は、データベースからの効率的なサンプリングに特に有効です。
例えば、貧困地区(1番地)から始まり、高級住宅街(1000番地)で終わる長い通りから人々を抽出したいとします。この通りから単純に住所を無作為に選ぶと、高級住宅街の住所が多すぎたり、高級住宅街の住所が少なすぎたり(あるいはその逆)、代表性のないサンプルになってしまう可能性があります。例えば、通り沿いの10番地ごとに住所を選ぶことで、サンプルが通りの長さに沿って均等に分布し、すべての地区を代表するようになります。(常に1番地から始めて991番地で終わる場合、サンプルはやや高級住宅街に偏りますが、1番地から10番地の間でランダムに開始地点を選択することで、この偏りは解消されます。)
しかし、系統抽出法は、リスト内の周期性に対して特に脆弱である。周期性が存在し、その周期が使用する間隔の倍数または因数である場合、サンプルは母集団全体を代表していない可能性が高く、単純無作為抽出法よりも精度が低くなる。
例えば、奇数番地の家がすべて道路の北側(高価な側)にあり、偶数番地の家がすべて南側(安価な側)にある通りを考えてみましょう。上記のサンプリング方式では、代表的なサンプルを得ることは不可能です。サンプリングされる家はすべて奇数番地の高価な側から、またはすべて偶数番地の安価な側からサンプリングされることになります。研究者がこの偏りを事前に知っていて、両側を飛び越えるスキップ(任意の奇数番地のスキップ)を使用することでそれを回避しない限り、この偏りは解消されません。
系統抽出法のもう一つの欠点は、単純無作為抽出法(SRS)よりも精度が高い場合でも、その理論的な特性上、精度を定量化することが難しい点である。(上記の2つの系統抽出法の例では、潜在的な標本誤差の大部分は隣接する家屋間のばらつきによるものだが、この方法では隣接する2軒の家屋を選択することはないため、標本からはそのようなばらつきに関する情報は得られない。)
前述のとおり、系統抽出法はEPS法です。なぜなら、すべての要素が同じ確率で選択されるからです(上記の例では10分の1)。これは「単純無作為抽出法」ではありません。同じサイズの異なる部分集合でも選択確率が異なるためです。例えば、集合{4,14,24,...,994}は10分の1の確率で選択されますが、集合{4,13,24,34,...}は選択確率がゼロです。
系統的サンプリングは、EPS以外の手法にも適用できます。例として、下記のPPSサンプルに関する説明を参照してください。
母集団が複数の異なるカテゴリーに分かれている場合、これらのカテゴリーによってフレームを個別の「層」に整理することができます。各層は独立したサブ母集団としてサンプリングされ、そこから個々の要素をランダムに選択できます。[ 8 ]このランダムな選択(またはサンプル)のサイズと母集団のサイズの比率は、サンプリング率と呼ばれます。[ 12 ]層化サンプリングにはいくつかの潜在的な利点があります。[ 12 ]
まず、人口を明確で独立した層に分割することで、研究者は、より一般的な無作為抽出サンプルでは見落とされがちな特定のサブグループについて推論を導き出すことができる。
第二に、層化抽出法を用いることで、より効率的な統計的推定値が得られる可能性がある(ただし、層はサンプルの入手可能性ではなく、対象となる基準との関連性に基づいて選択される必要がある)。層化抽出法が統計的効率の向上につながらない場合でも、各層が母集団における当該グループの大きさに比例していれば、単純無作為抽出法よりも効率が低下することはない。
第三に、人口全体よりも、人口内の個々の既存の層に関するデータの方が容易に入手できる場合がある。このような場合、層別抽出法を用いる方が、グループ間でデータを集計するよりも便利かもしれない(ただし、これは、先に述べた基準に関連する層を利用することの重要性と矛盾する可能性がある)。
最後に、各層は独立した母集団として扱われるため、異なる層に対して異なるサンプリング手法を適用することができ、研究者は母集団内の特定された各サブグループに最適な(あるいは最も費用対効果の高い)手法を用いることができるようになる可能性がある。
しかしながら、層化サンプリングにはいくつかの潜在的な欠点があります。第一に、層を特定し、そのようなアプローチを実施すると、サンプル選択のコストと複雑さが増し、母集団推定の複雑さも増す可能性があります。第二に、複数の基準を検討する場合、層化変数は一部の基準とは関連があるものの、他の基準とは関連がない場合があり、設計がさらに複雑化し、層の有用性が低下する可能性があります。最後に、場合によっては(多数の層を持つ設計や、グループごとに最小サンプルサイズが指定されている設計など)、層化サンプリングでは、他の方法よりも大きなサンプルが必要になる可能性があります(ただし、ほとんどの場合、必要なサンプルサイズは単純無作為抽出に必要なサンプルサイズを超えることはありません)。
層化は、サンプリング段階の後に「事後層化」と呼ばれるプロセスで導入されることがあります。[ 8 ]このアプローチは、適切な層化変数に関する事前の知識がない場合、または実験者がサンプリング段階で層化変数を作成するために必要な情報を持っていない場合に実施されるのが一般的です。この方法は事後アプローチの落とし穴に陥りやすいものの、適切な状況ではいくつかの利点をもたらすことができます。実施は通常、単純無作為抽出の後に行われます。補助変数による層化を可能にすることに加えて、事後層化は重み付けを実施するために使用でき、これによりサンプルの推定値の精度を向上させることができます。[ 8 ]
選択ベースサンプリングまたはオーバーサンプリングは、層化サンプリング戦略の 1 つです。選択ベースサンプリングでは、[ 13 ]データは対象に基づいて層化され、各層からサンプルが抽出されるため、よりまれな対象クラスがサンプルに多く含まれるようになります。モデルは、この偏ったサンプルに基づいて構築されます。ランダムサンプルと比較して、全体のサンプルサイズが小さい場合でも、選択ベースサンプルを使用すると、入力変数が対象に及ぼす影響をより正確に推定できることがよくあります。結果は通常、オーバーサンプリングを補正するために調整する必要があります。
場合によっては、標本設計者は、母集団の各要素について、対象となる変数と相関関係にあると考えられる「補助変数」または「サイズ指標」を利用できることがあります。これらのデータは、標本設計の精度向上に利用できます。前述のように、補助変数を層別化の基礎として使用する方法もあります。
もう一つの選択肢は、サイズに比例した確率サンプリング(PPSサンプリング)です。これは、各要素の選択確率をそのサイズに比例させ、最大で1までとする方法です。単純なPPS設計では、これらの選択確率をポアソンサンプリングの基礎として使用できます。しかし、この方法にはサンプルサイズが変動するという欠点があり、選択の偶然の変動により、母集団の異なる部分が過剰または過少に代表される可能性があります。
系統抽出法を用いると、規模に比例した確率標本を作成できます。これは、規模変数内の各カウントを単一の標本抽出単位として扱うことで実現されます。標本は、規模変数内のこれらのカウントの中から等間隔で選択することによって特定されます。この方法は、監査やフォレンジックサンプリングの場合、PPS逐次抽出法または貨幣単位抽出法と呼ばれることがあります。
例: 生徒数がそれぞれ 150、180、200、220、260、490 人 (合計 1500 人) の 6 つの学校があり、生徒数を基準としてサイズ 3 の PPS サンプルを作成したいとします。これを行うには、最初の学校に 1 ~ 150、2 番目の学校に 151 ~ 330 (= 150 + 180)、3 番目の学校に 331 ~ 530、といったように最後の学校 (1011 ~ 1500) まで番号を割り当てます。次に、1 ~ 500 (1500/3 に等しい) の間のランダムな開始値を生成し 、500 の倍数で学校の生徒数を数えます。ランダムな開始値が 137 だった場合、番号 137、637、1137 が割り当てられている学校、 つまり最初の学校、4 番目の学校、6 番目の学校を選択します。
PPSアプローチは、母集団推定に最も大きな影響を与える大きな要素にサンプルを集中させることで、与えられたサンプルサイズでの精度を向上させることができます。PPSサンプリングは、要素のサイズが大きく異なり、補助情報が利用可能なことが多い企業調査でよく使用されます 。たとえば、ホテルでの宿泊日数を測定しようとする調査では、各ホテルの部屋数を補助変数として使用できます。場合によっては、より最新の推定値を生成しようとする場合、関心のある変数の古い測定値を補助変数として使用できます。[ 14 ]
回答者をグループ(「クラスター」)で選択する方が費用対効果が高い場合もあります。サンプリングは、地理的または時間的範囲でクラスター化されることがよくあります(ほぼすべてのサンプルは、何らかの意味で時間的に「クラスター化」されていますが、分析においてこの点が考慮されることはほとんどありません)。たとえば、都市内の世帯を調査する場合、100の街区を選択し、選択した街区内のすべての世帯にインタビューを行うといった方法が考えられます。
クラスター化によって、移動費や管理費を削減できます。上記の例では、調査員は各世帯ごとに異なるブロックまで車で移動する必要がなく、1つのブロック内の複数の世帯を1回の訪問で済ませることができます。
これはまた、対象集団のすべての要素を列挙した標本抽出枠が不要であることを意味します。代わりに、クラスターレベルのフレームからクラスターを選択し、選択されたクラスターに対してのみ要素レベルのフレームを作成します。上記の例では、標本抽出には、最初の選択のために街区レベルの都市地図のみが必要であり、その後、選択された100の街区の世帯レベルの地図が必要となり、都市全体の世帯レベルの地図は必要ありません。
クラスターサンプリング(クラスター化サンプリングとも呼ばれる)は、一般的に、クラスター間の差異とクラスター内の差異の程度に応じて、単純無作為抽出よりも標本推定値のばらつきが大きくなります。このため、クラスターサンプリングでは、同じ精度を達成するために単純無作為抽出よりも大きな標本が必要となりますが、クラスタリングによるコスト削減効果により、より安価な選択肢となる場合もあります。
クラスターサンプリングは、一般的に多段階サンプリングとして実施されます。これは、2つ以上のレベルの単位が互いに埋め込まれている複雑なクラスターサンプリングの形式です。最初の段階では、サンプリングに使用するクラスターを構築します。2番目の段階では、各クラスターから主要な単位のサンプルがランダムに選択されます(選択されたすべてのクラスターに含まれるすべての単位を使用するのではなく)。次の段階では、選択された各クラスターで追加の単位サンプルが選択され、これを繰り返します。この手順の最後のステップで選択されたすべての最終単位(たとえば個人)が調査されます。したがって、この手法は、本質的には、先行するランダムサンプルからランダムなサブサンプルを取得するプロセスです。
多段階サンプリングでは、サンプリングコストを大幅に削減できます。これは、他のサンプリング方法を適用する前に、完全な母集団リストを作成する必要があるためです。選択されないクラスターの説明に伴う作業を排除することで、多段階サンプリングは、従来のクラスターサンプリングに伴う大きなコストを削減できます。[ 14 ]ただし、各サンプルは母集団全体を完全に代表するものではありません。
割当サンプリングでは、層化サンプリングと同様に、まず母集団を互いに排他的なサブグループに分割します。次に、指定された割合に基づいて、各セグメントから対象者または単位を選択するために判断が用いられます。例えば、面接担当者は、45歳から60歳までの女性200人と男性300人をサンプリングするように指示される場合があります。
この2番目のステップこそが、この手法を非確率サンプリングの一種たらしめているのです。割当サンプリングでは、サンプルの選択はランダムではありません。例えば、面接官は最も協力的と思われる人を面接したくなるかもしれません。問題は、すべての人に選ばれる機会が与えられないため、これらのサンプルが偏る可能性があることです。このランダムな要素こそが最大の弱点であり、割当サンプリングと確率サンプリングのどちらが優れているかは、長年にわたり議論の的となってきました。
不均衡なデータセットでは、サンプリング比率が母集団統計に従わない場合、ミニマックスサンプリングと呼ばれる保守的な方法でデータセットを再サンプリングできます。ミニマックスサンプリングは、アンダーソンのミニマックス比率に由来し、その値は0.5であることが証明されています。バイナリ分類では、クラスのサンプルサイズは等しく選択する必要があります。この比率は、ガウス分布を持つLDA分類器の仮定の下でのみミニマックス比率であることが証明できます。ミニマックスサンプリングの概念は、最近、クラス別スマート分類器と呼ばれる一般的な分類ルールのクラス向けに開発されました。この場合、クラスのサンプリング比率は、クラスの事前確率のすべての可能な母集団統計に対する最悪のケースの分類器エラーが最良になるように選択されます。[ 12 ]
偶発的サンプリング(グラブサンプリング、コンビニエンスサンプリング、オポチュニティサンプリングとも呼ばれる)は、非確率サンプリングの一種で、身近な母集団からサンプルを抽出するものです。つまり、容易に入手可能で都合の良い母集団が選択されます。これは、対象者と直接会うことによって、あるいは出会った対象者をサンプルに含めることによって、またはインターネットや電話などの技術的な手段によって対象者を見つけることによって行われる場合があります。このようなサンプルを使用する研究者は、サンプルが十分な代表性を持たないため、このサンプルから母集団全体について科学的に一般化することはできません。たとえば、調査員が特定の日の早朝にショッピングセンターでこのような調査を実施した場合、インタビューできる人はその時点でそこにいる人に限られます。調査を異なる時間帯や週に数回実施した場合、このサンプルは、その地域の他の社会構成員の意見を代表するものではありません。このタイプのサンプリングは、パイロットテストに最も適しています。コンビニエンスサンプルを使用する研究者にとって重要な考慮事項には、次のものがあります。
社会科学研究におけるスノーボールサンプリングは、既存の研究対象者を利用してサンプルに新たな対象者を募る、類似の手法である。回答者主導型サンプリングなど、スノーボールサンプリングのいくつかの変種では、選択確率の計算が可能であり、特定の条件下では確率サンプリング法となる。
任意抽出法は、非確率抽出法の一種です。回答者は自らの意思でアンケートに回答します。
ボランティアはソーシャルメディアの広告を通じて募集されることがあります。[ 15 ]広告の対象となる人口は、ソーシャルメディアが提供するツールを使用して、場所、年齢、性別、収入、職業、教育、興味などの特性に基づいて選択できます。広告には、研究に関するメッセージとアンケートへのリンクが含まれる場合があります。ボランティアはリンクをクリックしてアンケートを完了すると、サンプル人口に含めるためのデータを提出します。この方法は世界中の人々にリーチできますが、キャンペーン予算によって制限されます。招待された人口以外のボランティアもサンプルに含まれる場合があります。
このサンプルは母集団全体を代表しているとは限らないため、そこから一般化することは困難です。多くの場合、ボランティアは調査の主要テーマに強い関心を持っています。
線分交差サンプリングとは、ある領域内の要素をサンプリングする方法の一つで、選択された線分(「横断線」と呼ばれる)が対象要素と交差する場合に、その要素がサンプリングされるというものである。
パネルサンプリングは、まず無作為抽出法によって参加者のグループを選択し、次に一定期間にわたってそのグループに(同じ可能性のある)情報を複数回尋ねる方法です。したがって、各参加者は2つ以上の時点でインタビューを受け、データ収集の各期間は「波」と呼ばれます。この方法は、1938年に社会学者のポール・ラザースフェルドによって政治キャンペーンを研究する手段として開発されました。[ 16 ]この縦断的サンプリング方法により、たとえば慢性疾患から仕事のストレス、週ごとの食費に至るまで、人口の変化を推定できます。パネルサンプリングは、年齢による個人内の健康の変化を研究者に知らせたり、配偶者との相互作用などの連続従属変数の変化を説明するのに役立てたりするためにも使用できます。[ 17 ]パネルデータを分析するためのいくつかの方法が提案されており、MANOVA、成長曲線、ラグ効果を伴う構造方程式モデリングなどがあります。
スノーボールサンプリングとは、少数の初期回答者を見つけ出し、彼らを利用してさらに多くの回答者を募る手法です。母集団が隠れていたり、数えるのが難しい場合に特に有効です。
理論的サンプリング[ 18 ]は、その分野に対するより深い理解を深めたり、理論を構築したりすることを目的として、これまでに収集されたデータの結果に基づいてサンプルを選択する場合に行われます。まず、一般的な傾向を調査することを目的として、最初の一般的なサンプルが収集され、その後、現象が実際に観察される可能性を最大化するために、極端なケースや非常に具体的なケースを選択するなど、さらなるサンプリングが行われる場合があります。
アクティブサンプリングでは、機械学習アルゴリズムのトレーニングに使用されるサンプルが積極的に選択されます。アクティブラーニング(機械学習)と比較してください。
判断サンプリング(専門家サンプリングまたは目的サンプリングとも呼ばれる)は、非ランダムサンプリングの一種であり、専門家の意見に基づいてサンプルが選択されます。専門家は、参加者が提供する情報の価値に基づいて参加者を選択することができます。
無作為抽出とは、人間の判断を用いてランダム性をシミュレートするという考え方を指します。サンプルは手作業で選ばれますが、その目的はサンプルの選択に意識的な偏りが存在しないことを確認することですが、選択バイアスのために失敗することがよくあります。[ 19 ]無作為抽出は、他のサンプリング方法を実行するためのツールや能力がない場合に、その利便性から一般的に選択されます。
このようなサンプルの主な弱点は、多くの場合、母集団全体の特性を代表しておらず、母集団の一部しか代表していないことです。このような不均衡な代表性のため、無作為抽出による結果はしばしば偏っています。[ 20 ]
サンプリング方法は、非復元抽出(「WOR」 :同一サンプル内で同じ要素を複数回選択できない)と復元抽出(「WR」 :同一サンプル内で同じ要素が複数回出現する可能性がある)の2種類があります。例えば、魚を捕獲し、計測した後、すぐに水に戻してからサンプリングを続ける場合、同じ魚を複数回捕獲して計測する可能性があるため、これはWR方式となります。しかし、捕獲した魚を水に戻さず、タグを付けて放流する場合は、WOR方式となります。
数式、表、およびべき関数グラフは、サンプルサイズを決定するためのよく知られた手法である。
サンプルサイズ表を使用する手順:
適切なデータ収集には以下が含まれます。
サンプリングにより、より大きなデータセットの中から適切なデータポイントを選択して、母集団全体の特性を推定することができます。たとえば、毎日約6億件のツイートが生成されます。その日のうちに議論されているトピックを特定するためにすべてのツイートを見る必要はありませんし、各トピックに対する感情を特定するためにすべてのツイートを見る必要もありません。Twitterデータのサンプリングに関する理論的な定式化が開発されています。[ 22 ]
製造業では、音響、振動、圧力、電流、電圧、制御データなど、さまざまな種類のセンサーデータが短時間間隔で取得されます。ダウンタイムを予測するには、すべてのデータを確認する必要はなく、サンプルデータで十分な場合もあります。
調査結果には通常、何らかの誤差が含まれる。総誤差は、標本誤差と非標本誤差に分類できる。ここでいう「誤差」には、系統誤差とランダム誤差の両方が含まれる。
標本設計によって生じる標本誤差とバイアスには、以下のようなものがあります。
非標本誤差とは、データ収集、処理、または標本設計上の問題によって生じる、最終的な調査結果に影響を与える可能性のあるその他の誤差のことです。このような誤差には、以下のようなものがあります。
サンプリング後、意図した手順ではなく、実際にサンプリングで実行された手順を検証し、差異がその後の分析に及ぼす影響を検討する。
特に問題となるのは無反応です。無反応には大きく分けて2種類あります。[ 23 ] [ 24 ]
調査サンプリングでは、サンプルの一部として特定された個人の多くが参加を望まなかったり、参加する時間がない(機会費用)[ 25 ] 、または調査管理者が連絡を取ることができなかったりする可能性があります。この場合、回答者と非回答者の間に差異が生じるリスクがあり、母集団パラメータの推定値に偏りが生じます。これは、調査設計の改善、インセンティブの提供、および応答のない人に繰り返し連絡を取り、フレームの残りの人との類似点と相違点を特徴付けるフォローアップ調査の実施によって対処されることがよくあります。[ 26 ]また、データに重み付けをする(母集団ベンチマークが利用可能な場合)か、他の質問への回答に基づいてデータを補完することによって、その影響を軽減することもできます。無回答は、特にインターネットサンプリングで問題となります。この問題の原因としては、不適切な設計の調査[ 24 ] 、過剰な調査(または調査疲れ)[ 17 ] [ 27 ] 、潜在的な参加者が複数の電子メールアドレスを持っているが、それらをもう使用していないか、定期的にチェックしていないことなどが挙げられる。
多くの場合、標本抽出率は層によって異なり、母集団を正しく代表するためにはデータに重み付けを行う必要があります。例えば、英国における単純無作為抽出では、スコットランドの離島など、抽出コストが非常に高額になる地域の人々が含まれていない可能性があります。より安価な方法としては、都市部と農村部を層別化した層化抽出法が挙げられます。農村部の標本は過小評価される可能性がありますが、分析において適切な重み付けを行うことで補正できます。
より一般的に言えば、標本設計によって各個人が均等に選ばれる機会が得られない場合、データに重み付けを行うべきである。例えば、世帯の選択確率が均等であっても、各世帯から1人だけがインタビューを受ける場合、大家族ほどインタビューを受ける機会が少なくなる。これは調査重みを用いることで調整できる。同様に、電話回線が複数ある世帯は、ランダムダイヤル方式の標本抽出において選ばれる可能性が高くなるが、重み付けによってこれを調整できる。
重み付けは、無反応を補正するなど、他の目的にも役立つ。
Grovesらによる教科書は、調査方法論の概要を提供しており、認知心理学に基づいた質問票開発に関する最新の文献も含まれている 。
その他の書籍は、調査サンプリングの統計理論に焦点を当てており、以下の教科書で解説されているような基本的な統計学の知識が必要となります。
シェーファーらによる初等教育用の教科書では、高校代数で習う二次方程式が用いられている。
Lohr、Särndal 他、Cochran については、さらに数学的統計学が必要である。[ 28 ]
デミングとキッシュによる歴史的に重要な著作は、社会科学者(特に米国国勢調査とミシガン大学社会研究所について)にとって、今なお貴重な洞察を与えてくれる。