人口の割合を表すパラメータ(通常はパーセンテージ)
統計学において、人口割合は一般にまたはギリシャ文字で表され、[1]人口に関連するパーセンテージ値を表すパラメータです。人口パラメータの実際の値を決定するために国勢調査を実施することができますが、国勢調査はコストと時間の消費のために現実的ではないことがよくあります。たとえば、2010 年の米国国勢調査では、アメリカ人の 83.7% がヒスパニックまたはラテン系ではないことが示されました。0.837 という値は人口割合です。一般に、人口割合やその他の人口パラメータは不明です。

母集団の割合は通常、観察研究や実験から得られる不偏標本統計量を通じて推定され、標本割合 が算出されます。標本割合 は一般に で表され、教科書によっては と表記されます。[2] [3]
たとえば、全米技術リテラシー会議は、成人のうち経済的に読み書きができない人の割合を調べるために、2,000人の成人を対象に全国調査を実施しました。この調査では、サンプルとして抽出された2,000人のうち1,440人が国内総生産とは何かを理解していないことが示されました。[4] 72% (または1440/2000) という値が標本割合です。


数学的な定義
集合とその部分集合のベン図の図。 が にどれだけ含まれるかを測定することで、割合を計算できます。


比率は、部分集合内の要素の数(可算な量)と集合の大きさの比として数学的に定義されます。



ここで、は母集団内の成功数、 は母集団のサイズです。


この数学的定義を一般化して、サンプル比率の定義を提供することができます。

ここで、はサンプル内の成功数、は母集団から得られたサンプルのサイズです。[5] [2]
推定
推論統計学の研究の主な焦点の 1 つは、パラメータの「真の」値を決定することです。通常、研究対象集団の国勢調査を実施しない限り、パラメータの実際の値は見つかりません。ただし、パラメータの妥当な推定値を得るために使用できる統計的手法があります。これらの手法には、信頼区間と仮説検定が含まれます。
人口比率の値を推定することは、農業、ビジネス、経済、教育、工学、環境研究、医学、法律、政治学、心理学、社会学の分野で大きな意味を持ちます。
母集団の割合は、Z 区間の 1 サンプル割合と呼ばれる信頼区間を使用して推定できます。その式は次のとおりです。

ここで、は標本比率、は標本サイズ、は信頼水準における標準正規分布 の上限臨界値である 。[6]



証拠
Z区間における1標本比率の式を導くには、標本比率の標本分布を考慮する必要がある。標本比率の標本分布の平均は通常次のように表され、その標準偏差は次のように表される。[2]

の値は不明なので、 には不偏統計量が使用されます。平均と標準偏差はそれぞれ次のように書き直されます。



そして
中心極限定理を適用すると、標本が適度に大きく、偏りがなければ、
標本比率の標本分布はほぼ正規分布になります。
次の確率が計算されるとします。
、
ここで、およびは標準臨界値です。


標本比率の標本分布は、中心極限定理の要件を満たす場合、ほぼ正規分布になります。
不平等

代数的に書き直すと次のようになります。

上記の代数計算から、次の値の間にある可能性がある
確実性のレベルが明らかです。

。
推論の条件
一般に、母集団の割合を推定するために使用される式では、既知の数値を代入する必要があります。ただし、統計的推論では未知のパラメータの推定が正当であることが求められるため、これらの数値を「盲目的に」式に代入することはできません。パラメータの推定が正当であるためには、検証する必要がある 3 つの条件があります。
- データの個々の観察は、関心対象の母集団の単純ランダムサンプルから取得する必要があります。
- データの個々の観測値は正規性を示す必要があります。これは次の定義で数学的に想定できます。
- 与えられたランダム標本の標本サイズを 、標本比率を とします。 かつ の場合 、 データの個々の観測値は正規性を示します。




- データの個々の観測は互いに
独立している必要があります。これは、次の定義によって数学的に想定できます。
- を対象母集団のサイズとし、を母集団の単純ランダム標本の標本サイズとします。 の場合、データの個々の観測値は互いに独立しています。



SRS、正規性、独立性の条件は、ほとんどの統計学の教科書では推論ツールボックスの条件と呼ばれることがあります。この簡略化が使用されていない領域の詳細については、(https://en.wikipedia.org/wiki/Binomial_proportion_confidence_interval#Jeffreys_interval) を参照してください
。
例
民主主義国家で大統領選挙が行われていると仮定します。民主主義国家の有権者人口から 400 人の有権者を無作為に抽出した結果、272 人の有権者が候補者 B を支持していることがわかりました。政治学者は、有権者人口の何パーセントが候補者 B を支持しているかを判定したいと考えています。
政治学者の質問に答えるために、この民主主義国で候補者 B を支持する有権者の人口比率を決定するために、信頼度レベル 95% の Z 区間の 1 サンプル比率を作成できます。
解決
ランダムサンプルから、サンプルサイズ であることが分かっています。信頼区間を構築する前に、推論の条件が検証されます。


- 投票者集団から 400 人の有権者の無作為標本が得られたので、単純無作為標本の条件は満たされています。
- ととすると、 と であるかどうかがチェックされます 。




そして 
- 正常性の条件が満たされました。
- この民主主義における有権者の人口をとし、 とします。 の場合、独立性が存在します。




- この民主主義国の有権者の人口規模は少なくとも 4,000 人と推定されます。したがって、独立の条件は満たされています。

推論の条件が検証されると、信頼区間を構築することが可能になります。
させて、
を解くには、式を使用します。

の標準正規曲線では、上裾の面積は 0.0250、 の面積は 0.9750 となります。
の標準正規確率の表 。
標準正規ベル曲線を調べると、どの標準スコアが標準正規曲線の上裾面積 0.0250 または面積 1 - 0.0250 = 0.9750 を与えるかを特定することで、 の値を決定できます。 の値は、標準正規確率の表からも見つけることができます。


標準正規確率の表から、面積が 0.9750 となる の値は 1.96 です。したがって、 の値は1.96 です。


、、の値は、Z 区間の 1 サンプル比率の式に代入できます。



推論の条件と Z 区間の 1 サンプル比率の式に基づくと、この民主主義国家の有権者人口のうち候補者 B を支持する割合は 63.429% から 72.571% の間であると 95% の信頼度レベルで結論付けることができます。
信頼区間範囲内のパラメータの値
推論統計でよく聞かれる質問は、パラメータが信頼区間内に含まれているかどうかです。この質問に答える唯一の方法は、国勢調査を実施することです。上記の例を参照すると、人口比率が信頼区間の範囲内にある確率は 1 か 0 のいずれかです。つまり、パラメータが区間範囲に含まれているか、含まれていないかです。信頼区間の主な目的は、パラメータの理想的な値がどのようなものである可能性があるかをよりわかりやすく示すことです。
推定から生じる一般的な誤りと誤解
信頼区間の構築から生じる非常に一般的な誤りは、 などの信頼レベルが95% の確率を意味すると信じることである。これは誤りである。信頼レベルは、確率ではなく確実性の尺度に基づいている。したがって、 の値は0 と 1 の間だけになる。


ランク付けされたセットサンプリングを用いたPの推定
より正確なPの推定値は、単純ランダムサンプリングの代わりにランク付けされたセットサンプリングを選択することで得られる[7] [8]
参照
参考文献
- ^ 統計調査入門。Wiley。2014年8月18日。ISBN 978-1-118-95667-0。
- ^ abc Weisstein, Eric W. 「Sample Proportion」。mathworld.wolfram.com 。 2020年8月22日閲覧。
- ^ 「6.3: 標本割合」。Statistics LibreTexts 2014-04-16 。2020-08-22閲覧。
- ^ オット、R. ライマン (1993)。統計手法とデータ分析入門。ダックスベリー・プレス。ISBN 0-534-93150-2。
- ^ Weisstein, Eric (1998). CRC Concise Encyclopedia of Mathematics . Chapman & Hall/CRC. Bibcode :1998ccem.book.....W.
- ^ ヒンダース、デュアン(2008年)。注釈付き教師用版統計の実践。WHフリーマン。ISBN 978-0-7167-7703-8。
- ^ Abbasi, Azhar Mehmood; Yousaf Shad, Muhammad (2021-05-15). 「同時ベースのランク付けセットサンプリングを使用した人口比率の推定」. Communications in Statistics – Theory and Methods . 51 (9): 2689–2709. doi :10.1080/03610926.2021.1916529. ISSN 0361-0926. S2CID 236554602.
- ^ Abbasi, Azhar Mehmood; Shad, Muhammad Yousaf (2021-05-15). 「同時ベースのランク付けセットサンプリングを使用した人口比率の推定」. Communications in Statistics – Theory and Methods . 51 (9): 2689–2709. doi :10.1080/03610926.2021.1916529. ISSN 0361-0926. S2CID 236554602.