統計学 において、標本調査 とは、調査を実施するために対象母集団 から要素の標本を選択するプロセスを指します。「調査 」という用語は、さまざまな種類や観察手法を指す場合があります。標本調査では、多くの場合、人々の特性や態度を測定するために使用される質問票が含まれます。標本が選択された後に、標本のメンバーに連絡を取るさまざまな方法が、調査データ収集の対象となります。 標本抽出 の目的は、対象母集団全体を調査するのにかかる費用や作業量を削減することです。対象母集団全体を測定する調査は、国勢調査と呼ばれます。 標本とは、情報を取得する母集団 のグループまたはセクションを指します。
調査サンプルは大きく分けて確率サンプルとスーパーサンプルの2種類に分類できます。確率ベースのサンプルは、特定の確率(場合によっては適応的手順によって指定された適応確率)を用いたサンプリング計画を実行します。確率ベースのサンプリングでは、対象集団に関する設計に基づく推論が可能になります。この推論は、調査プロトコルで指定された既知の客観的な確率分布 に基づいています。ただし、確率ベースの調査から得られる推論には、依然として多くの種類のバイアスが生じる可能性があります。
確率標本抽出に基づかない調査では、バイアスや標本誤差 を測定することがより困難になります。[ 1 ] 非確率標本抽出に基づく調査では、対象集団の人々を適切に代表できないことがよくあります。[ 2 ]
学術研究や政府調査において、確率標本抽出は標準的な手順である。米国では、行政管理予算局 の「統計調査の基準一覧」において、連邦政府の資金援助を受けた調査は以下の手順で実施されなければならないと規定されている。
一般的に認められている統計的手法(例えば、標本誤差の推定値を提供できる確率的手法)を用いて標本を選択する。非確率的標本抽出法(例えば、カットオフ標本やモデルベース標本)を使用する場合は、統計的に正当化され、推定誤差を測定できる必要がある。[ 3 ]
ランダムサンプリングとデザインベースの推論は、モデル支援サンプリング[ 4 ] [ 5 ] やモデルベースサンプリング [ 6 ] などの他の統計的手法によって補完されます。
例えば、多くの調査では相当量の無回答が見られます。調査対象は既知の確率で選ばれているにもかかわらず、無回答のメカニズムは不明です。無回答が多い調査については、統計学者がデータセットを分析するための統計モデルを提案しています。
調査サンプリングに関連する問題については、Salant and Dillman (1994) を含むいくつかの文献で議論されている。[ 7 ]
確率サンプリング 確率標本(「科学的」標本または「ランダム」標本とも呼ばれる)では、対象母集団の各メンバーは、標本に含まれる既知の非ゼロの確率を持つ。[ 8 ] 確率標本に基づく調査は、理論的には、標本平均の期待値が母集団平均に等しいため、E(ȳ)=μ となる対象母集団の統計的測定値を偏りなく生成するか、 信頼区間 または誤差範囲 として表現できる測定可能な標本誤差を持つかのいずれかである。[ 9 ] [ 10 ]
確率に基づく調査サンプルは、標本抽出枠 と呼ばれる対象母集団のリスト、標本抽出枠から単位を選択するランダムなプロセス(選択手順)、および選択された単位に連絡して調査を完了させる方法(データ収集方法またはモード)を作成することによって作成されます。[ 11 ] 対象母集団によっては、このプロセスは容易な場合があります。たとえば、給与リストを使用して会社の従業員をサンプリングする場合などです。しかし、大規模で組織化されていない母集団では、適切な標本抽出枠を作成するだけでも、多くの場合、複雑で費用のかかる作業となります。
米国における世帯人口の確率標本抽出の一般的な方法としては、地域確率標本抽出、ランダム数字ダイヤル電話標本抽出、そして最近では住所ベース標本抽出などがある。[ 12 ]
確率標本抽出法の中には、層化標本抽出法 やクラスター標本抽出法 といった特殊な手法があり、確率標本抽出法の基本原理を変えることなく、標本抽出プロセスの精度や効率を向上させることができる。
層化とは、標本抽出を行う前に、各標本単位に関する補助情報に基づいて、母集団を均質なサブグループに分割するプロセスです。各層は相互に排他的である必要があり、母集団のすべての要素は必ずいずれか1つの層にのみ割り当てられます。また、各層は網羅的である必要があり、母集団のどの要素も除外されてはなりません。その後、各層内で単純無作為抽出法 や系統抽出法 などの手法を適用できます。層化は、標本誤差を低減することで、標本の代表性を向上させる効果があります。
確率標本抽出における非標本誤差 調査におけるバイアスは望ましくないものの、多くの場合避けられない。標本誤差(母集団の量と標本における適切に推定された相当量との差)は適切な統計的手法を用いて定量化できるが、その他の誤差要因を評価することはより困難である。
無回答バイアス :調査サンプルで選ばれた個人または世帯が調査を完了できない、または完了しない場合、この無回答によってバイアスが生じる可能性があります。無回答バイアスは、回答者と非回答者の違いにより、観測値が母集団パラメータから逸脱する場合に発生します。[ 13 ] 測定誤差 :調査依頼の処理における認知的困難による関心のある測定値の不正確な報告(例:「過去12か月間に家電製品を購入しましたか?」という質問に対する回答が、イベントを要求された想起期間内または期間外に位置づけるのが難しいなど)、回答カテゴリのラベル付けの不明瞭さ(「どのくらいの頻度でアルコールを摂取しますか?まったくない、めったにない、頻繁にある」)、社会的望ましさバイアス(社会的に烙印を押される行動や結果(例:薬物使用)の過少報告、称賛される行動(例:投票)の過剰報告)。選択バイアス:選択バイアスは、調査対象者によって選択確率が異なるにもかかわらず、調査者がその確率を考慮していない場合に発生します。例えば、複数の電話番号を持つ世帯は、電話番号が1つしかない世帯よりも電話調査で選ばれる可能性が高くなります。このような選択バイアスは、各世帯に[1/(電話番号の数)]に等しい調査ウェイトを 適用することで補正できます。 自己選択バイアス :個人が自発的にグループを選択することで、そのグループの反応に偏りが生じる可能性があるバイアスの一種。参加バイアス :調査や世論調査への参加を選択した人々の特性によって生じるバイアス。カバレッジバイアス:カバレッジバイアスは、母集団の構成員が標本フレームに含まれていない場合(カバレッジ不足)に発生します。カバレッジバイアスは、対象と対象外の単位間の差異により、観測値が母集団パラメータから乖離する場合に発生します。電話調査は、電話を持たない世帯やホームレスの人々を含めることができないため、よく知られたカバレッジバイアスの原因となります。 表現誤差と測定誤差の両方は、総調査誤差 のパラダイム内で分析される[ 14 ] 。
非確率サンプリング 多くの調査は確率標本に基づいているのではなく、調査を完了するのに適した回答者の集団を見つけることに基づいています。非確率標本の一般的な例は次のとおりです。[ 15 ]
判断サンプル:研究者は、自身の判断に基づいて、サンプルに含める母集団のメンバーを決定します。研究者は、サンプルの代表性について何らかの代替的な正当化を提供する場合があります。根底にある仮定は、研究者が母集団の特徴を示す単位を選択するということです。この方法は、研究者の偏見や認識の影響を受ける可能性があります。[ 16 ] スノーボールサンプリング:対象集団が希少な場合によく用いられる手法。対象集団のメンバーが、調査のために他のメンバーを勧誘する。 割当標本 :この標本は、特定の特性を持つ人々を一定数含めるように設計されています。例えば、コーヒーを飲む人100人などです。このタイプの標本抽出は、非確率的市場調査でよく用いられます。便宜的サンプル :サンプルは、アンケートに回答してもらうのに最も容易な人々で構成されます。非確率標本では、対象母集団と調査標本との関係は測定不可能であり、潜在的なバイアスも不明である。非確率標本調査を巧みに利用する者は、調査を母集団測定のためのツールとしてではなく、実験条件として捉え、結果に内部的に一貫性のある関係性があるかどうかを検証する傾向がある。
参考文献 ↑ 「非確率サンプリング - AAPOR」。www.aapor.org 。2020年5月24日 取得 。 ↑ Weisberg, Herbert F. (2005), The Total Survey Error Approach, University of Chicago Press: Chicago. p.231. ↑ 「アーカイブされたコピー」 (PDF) 。 行政管理予算局 。 2009年6月17日に 国立 公文書館 経由で取得 。 ↑ ブリュワー、ケン(2002)。 複合調査サンプリング推論:バスの象の重み付け 。ホッダー教育出版社 。ISBN 978-0340692295 。↑ ザーンダル、カール・エリック。ベングト・スウェンソン。レットマン、1 月 (1992 年)。 モデル支援調査サンプリング 。スプリンガー。 ISBN 978-0387975283 。↑ Richard Valliant、Alan H. Dorfman、Richard M. Royall (2000)『有限母集団サンプリングと推論:予測アプローチ』Wiley、ニューヨーク、p. 19 ↑ サラン、プリシラ、I. ディルマン、A. ドン。「自分で調査を実施する方法」。No. 300.723 S3。1994年。 ↑ キッシュ、L. (1965)、調査サンプリング、ニューヨーク:ワイリー、p. 20 ↑ キッシュ、L. (1965)、調査サンプリング、ニューヨーク:ワイリー、p.59 ↑ 「サンプリングが有効な理由 - AAPOR 」 ↑ Groves et al., Survey Methodology, Wiley: New York. ↑ Michael W. Link、Michael P. Battaglia、Martin R. Frankel、Larry Osborn、および Ali H. Mokdad、「一般人口調査における住所ベースサンプリング(ABS)とランダム数字ダイヤル(RDD)の比較」、Public Opinion Q、2008 年春号、72: 6 - 27。 ↑ 「用語集 - NCES 統計基準」 。nces.ed.gov 。 ↑ Groves, Robert M.; Lyberg, Lars (2010). "Total Survey Error: Past, Present, and Future" . Public Opinion Quarterly . 74 (5). American Association for Public Opinion Research: 849–879 . doi : 10.1093/poq/nfq065 . 2024-04-01 に取得。 ↑ 「調査サンプリング方法 」 。www.statpac.com 。 ↑ カナダ政府、カナダ統計局; カナダ政府、カナダ統計局 (2009 年 1 月 28 日)。 「 学習リソース: 統計: データからの力! 非確率サンプリング」 。www150.statcan.gc.ca 。
さらに読む Grovesらによる教科書は、調査方法論の概要を提供しており、認知心理学 に基づいた質問票開発に関する最新の文献も含まれている 。
その他の書籍は、調査サンプリングの統計理論 に焦点を当てており、以下の教科書で解説されているような基本的な統計学の知識が必要となります。
シェーファーらによる初等教育用の教科書では、高校代数で習う二次方程式が用いられている。
シェーファー、リチャード・L、ウィリアム・メンデンホール、R・ライマン・オット。『初等調査サンプリング 』第5版。ベルモント:ダックスベリー・プレス、1996年。 Lohr、Särndalら、そしてCochran(古典的)については、より高度な数理統計学の知識が必要である。
コックラン、ウィリアム・G. (1977).サンプリング技法 (第3 版). ワイリー. ISBN 0-471-16240-X 。ローア、シャロン L. (1999).サンプリング:設計と分析 . ダックスベリー. ISBN 0-534-35361-4 。カール・エリック・サーンダル;ベングト・スウェンソン。レットマン、1 月 (1992 年)。モデル支援調査サンプリング 。スプリンガー・フェルラーク。ISBN 0-387-40620-4 。 デミングとキッシュによる歴史的に重要な著作は、社会科学者(特に米国国勢調査とミシガン大学 社会研究所 について)にとって、今なお貴重な洞察を与えてくれる。
外部リンク CRANタスクビュー調査方法論 調査とは何か?(全米世論調査センターおよび米国統計協会発行の小冊子) 情報技術学習とパフォーマンスに関するジャーナル記事 「組織研究:調査研究におけるサンプルサイズの決定」標本設計と信頼区間 調査サンプリング方法 非確率サンプリング