
カバレッジ誤差は、標本抽出の対象となる母集団と標本抽出枠との間に一対一の対応関係がない場合に発生する非標本誤差の一種です。 [ 1 ] [ 2 ] これは、調査データを使用して計算された推定値に偏りを生じさせる可能性があります。[ 3 ] 例えば、研究者が電話帳(標本抽出枠)に記載されている住所に電話をかけることで、登録有権者(対象母集団)の意見を調査したいとします。すべての有権者が電話帳に記載されているわけではない場合、カバレッジ不足が発生する可能性があります。一部の有権者が複数の電話番号を登録している場合、カバレッジ過剰が発生する可能性があります。また、電話帳に記載されている電話番号の一部が登録有権者のものではない場合、偏りが生じる可能性があります。[ 4 ] この例では、カバレッジ不足、カバレッジ過剰、および標本抽出枠に未登録有権者が含まれていることによる偏りは、カバレッジ誤差の例です。
カバレッジ誤差は、調査サンプリングで発生する可能性のある総調査誤差の一種です。調査サンプリングでは、標本抽出枠とは、対象母集団の標本が抽出される標本抽出単位のリストです。[ 3 ] カバレッジ誤差は、対象母集団と標本抽出枠の間に差異がある場合に発生します。[ 5 ]
例えば、ある研究者がTwitterを使って、米国大統領が最近行った行動に対する米国有権者の意見を調べているとします。研究者の対象集団は米国有権者ですが、サンプリングフレームとしてTwitterユーザーのリストを使用しています。すべての有権者がTwitterユーザーであるとは限らず、すべてのTwitterユーザーが有権者であるとは限らないため、対象集団とサンプリングフレームの間にはずれが生じ、Twitterを使用している有権者の人口統計や意見が対象集団の有権者を代表していない可能性があるため、調査結果に偏りが生じる可能性があります。[ 4 ]
サンプリングフレームに対象集団のすべてのメンバーが含まれていない場合、カバレッジ不足が発生します。前の例では、すべての有権者がTwitterユーザーではないため、有権者はカバレッジ不足です。一方、サンプリングフレームに対象集団の一部のメンバーが過剰に含まれている場合、カバレッジ過剰が発生します。前の例では、一部のユーザーが複数のTwitterアカウントを持っている可能性があり、アカウントが1つしかないTwitterユーザーよりもアンケートに含まれる可能性が高くなります。[ 4 ]
縦断研究は、縦断調査で研究される集団が時間とともに変化する可能性があるため、特に対象範囲が狭くなりやすい。[ 6 ] 例えば、ある研究者が、特定の学区の3年生が受けた成績と、これらの子供たちが大人になったときに稼ぐ賃金との関係を研究したいと考えるかもしれない。この場合、研究者は、成長して大人になる学区のすべての3年生(対象集団)に関心がある。彼女の標本抽出枠は、学区の3年生のリスト(標本抽出枠)かもしれない。時間が経つにつれて、研究者は元の研究で使用した子供たちの一部を追跡できなくなる可能性が高く、その結果、彼女の大人の標本抽出枠は、研究で使用した子供の標本抽出枠と一致しなくなる。
調査範囲の誤差を定量化して補正するために、さまざまな方法が用いられてきました。多くの場合、採用される方法は特定の機関や組織に固有のものです。たとえば、米国国勢調査局は、米国郵政公社の配達順序ファイル、IRS 1040 住所データ、市販の差し押さえ件数、その他のデータを使用して、国勢調査ブロックごとの過少カウントを予測できるモデルを開発しました。国勢調査局は、このようなモデルをゼロ膨張負二項分布またはゼロ膨張ポアソン (ZIP) 分布に適合させることに一定の成功を収めたと報告しています。[ 7 ]
カバレッジ誤差を定量化するもう1つの方法は、マークアンドリキャプチャー法を用いるものです。[ 8 ]マークアンドリキャプチャー法では、母集団から直接サンプルを採取し、マークを付けて母集団に戻します。後日、母集団から別のサンプルを採取し(再捕獲)、以前にマークされたサンプルの割合を使用して実際の母集団サイズを推定します。この方法は、対象母集団から直接サンプルを採取し、次にデータフレームから別のサンプルを採取してカバレッジ不足を推定することにより、サンプリングフレームの妥当性を判断するために拡張できます。[ 9 ] 例えば、国勢調査が実施されたとします。国勢調査の完了後、フレームからランダムサンプルを抽出して再度カウントすることができます。[ 8 ]
カバレッジエラーを減らす方法の一つは、標本枠を作成するか情報を収集するために複数の情報源を利用することです。これは混合モードアプローチと呼ばれます。例えば、ワシントン州立大学の学生は、住所と電子メールアドレスの両方を使用して標本枠を作成することで、学生調査体験調査を実施しました。[ 5 ]
混合モードアプローチの別の例として、2010年の米国国勢調査では、主に住宅郵送による回答に頼り、回答しなかった人にはフィールド調査員を派遣してインタビューを行った。こうすることで、フィールド調査員は、特定の住所がまだ存在するか、まだ人が住んでいるかを判断できた。このアプローチには、大多数の人が郵送で回答し、現地訪問が不要だったため、コスト削減という利点もあった。[ 8 ] [ 5 ]
米国国勢調査局は、米国10年ごとの国勢調査やその他の調査の標本抽出枠として使用する約1億4490万件の住所を含むマスター住所ファイルを作成および維持しています。約111,105人の現場担当者の努力と約5億ドルの支出にもかかわらず、国勢調査局はマスター住所ファイルに登録されていない相当数の住所を発見しました。[ 7 ]
カバレッジフォローアップ(CFU)とフィールド検証(FV)は、2000年の国勢調査データを基に2010年の国勢調査を改善するために国勢調査局が実施した業務です。これらの業務は、次のようなカバレッジエラーに対処することを目的としていました。カウントされるべき人をカウントしない、カウントされるべきでない人をカウントする、カウントされるべきだが場所が誤っている人をカウントする。米国国勢調査におけるカバレッジエラーは、政府による特定の集団の代表性の低下につながる可能性があります。特に懸念されるのは、対象となる人口集団の過小評価である「差異的過小カウント」です。CFUとFVの取り組みにより2010年の国勢調査の精度は向上しましたが、差異的過小カウントの問題に対処するためにさらなる研究が推奨されました。[ 10 ]
{{cite book}}: CS1メンテナンス: 場所の発行元が見つかりません (リンク){{cite book}}: CS1メンテナンス: 場所の発行元が見つかりません (リンク)