統計学では、母集団の統計的特性をその母集団の部分集合、つまり標本から推定する場合に、標本誤差が発生します。標本には母集団のすべてのメンバーが含まれていないため、平均や四分位数などの標本の統計量(推定値と呼ばれることが多い)は、一般的に母集団全体の統計量(パラメータと呼ばれる)とは異なります。標本統計量と母集団パラメータの差は、標本誤差と呼ばれます。[ 1 ]例えば、100万人の母集団から1000人の身長を測定した場合、その1000人の平均身長は通常、その国の100万人全員の平均身長とは異なります。
サンプリングはほとんどの場合、未知の母集団パラメータを推定するために行われるため、定義上、サンプリング誤差を正確に測定することは通常不可能です。しかし、ブートストラップ法などの一般的な方法、または真の母集団分布とそのパラメータに関するいくつかの仮定(または推測)を取り入れた特定の方法によって、サンプリング誤差を推定することはしばしば可能です。
標本誤差とは、母集団全体ではなく標本を観察することによって生じる誤差のことです。 [ 1 ]標本誤差とは、母集団パラメータを推定するために使用される標本統計量と、パラメータの実際の未知の値との差のことです。[ 2 ]
統計学において、真にランダムな標本とは、母集団から等しい確率で個体を選択することを意味します。言い換えれば、偏りなく集団から個体を選択することです。これを正しく行わないと、標本バイアスが生じ、標本誤差が体系的に大幅に増加する可能性があります。例えば、地球上の全人類の平均身長を測定しようとして、ある1つの国からのみ標本を測定すると、過大評価または過小評価が大きくなる可能性があります。実際には、多くのパラメータ(この例では、国、年齢、性別など)が推定値に強いバイアスを与える可能性があるため、偏りのない標本を得ることは困難であり、これらの要因が選択プロセスに影響を与えないようにする必要があります。
完全に偏りのないサンプルであっても、残りの統計的要素のためにサンプル誤差は依然として存在します。例えば、2人か3人の個人だけを測定して平均を取ると、毎回大きく異なる結果が得られることを考えてみてください。サンプルサイズを大きくすることで、サンプリング誤差の大きさを一般的に小さくすることができます。[ 3 ]
サンプルサイズを増やすコストは、実際には非常に高額になる場合がある。サンプル誤差はサンプルサイズの関数として事前に推定できることが多いため、推定量の予測精度と、より大きなサンプルを取得する際の予測コストを比較検討するために、さまざまなサンプルサイズ決定方法が用いられる。
前述のとおり、平均値やパーセンテージなどの標本統計量は、一般的に標本ごとに変動します。[ 1 ]多くの標本を比較したり、より大きな標本をより小さな標本に分割したり(重複する場合もある)、結果として得られる標本統計量のばらつきを使用して、標本の標準誤差を推定することができます。
「サンプリング誤差」という用語は、遺伝学の分野でも関連しているが根本的に異なる意味で使用されています。たとえば、ボトルネック効果や創始者効果では、自然災害や移住によって集団の規模が劇的に縮小し、元の集団を公平に代表しているかどうかわからない小さな集団が生じます。これは遺伝的浮動の原因であり、特定の対立遺伝子がより一般的になったり、より少なくなったりするため、統計的な意味での「誤差」ではないにもかかわらず、「サンプリング誤差」と呼ばれてきました[ 4 ]。