
確率論と統計学において、パラメータnとpを持つ二項分布は、 n 回の独立した実験のシーケンスにおける成功回数の離散確率分布であり、各実験はイエス・ノーの質問をし、それぞれ独自のブール値の結果、すなわち成功(確率p ) または失敗(確率q = 1 − p ) を持ちます。単一の成功/失敗実験はベルヌーイ試行またはベルヌーイ実験とも呼ばれ、結果のシーケンスはベルヌーイ過程と呼ばれます。単一の試行、つまりn = 1の場合、二項分布はベルヌーイ分布になります。二項分布は、統計的有意性の二項検定の基礎となります。[ 1 ]
二項分布は、母集団サイズNから復元抽出によってサイズnの標本を抽出した場合の成功回数をモデル化するためによく用いられます。標本抽出が非復元抽出で行われる場合、抽出は独立ではないため、結果として得られる分布は二項分布ではなく超幾何分布となります。しかし、Nがnよりはるかに大きい場合、二項分布は依然として良い近似値であり、広く用いられています。
確率変数X がパラメータを持つ二項分布に従う場合(自然数)およびp ∈ [ 0, 1 ]の場合、 X ~ B( n , p )と表記します。n回の独立したベルヌーイ試行(成功率pが同じ)でちょうどk 回の成功が得られる確率は、確率質量関数によって与えられます。 k = 0, 1, 2, ..., nの 場合、 は二項係数 です。この式は次のように理解できます。p k q n − kは、 n 回の独立したベルヌーイ試行のシーケンスで、 k 回の試行が「成功」、残りのn − k回の試行が「失敗」となる確率です。試行は独立しており、確率は試行間で一定であるため、k 回の成功(およびn − k 回の失敗)を含むn回の試行のシーケンスは、(シーケンス内の成功の位置に関係なく)同じ確率で達成されます。このような数列は、二項係数がn回の試行のうち、 k回の成功の位置を選択する方法の数を数えます。二項分布は、これらのシーケンスのいずれかが得られる確率に関係しており、つまり、それらのいずれかが得られる確率(p k q n − k)を加算する必要があります。回数、したがって .
二項分布確率の参照表を作成する場合、通常、表は最大でまで記入されます。値。これは、確率は、その補数によって計算できます 。
式f ( k , n , p )をkの関数として見てみると、それを最大化するk の値が存在する。このk の値は、計算によって求めることができる。 そしてそれを1と比較する。常に[ 2 ]を満たす 整数Mが存在する。
f ( k , n , p )は、 k < Mの場合は単調増加、 k > Mの場合は単調減少ですが、 ( n + 1) pが整数の場合は例外です。この場合、 fが最大となる値は( n + 1) pと( n + 1) p − 1 の2 つです。Mはベルヌーイ試行の最も可能性の高い結果 (つまり、最も可能性が高いが、全体としては依然として可能性が低い場合もある)であり、モードと呼ばれます。
偏りのあるコインを投げたとき、表が出る確率が0.3だとします。6回投げてちょうど4回表が出る確率は
累積分布関数は次のように表すことができます。 どこはkの「下限」 、つまりk以下の最大の整数です。
また、正則化された不完全ベータ関数を用いて次のように表すこともできます。 [ 3 ] これは ベータ分布とF分布の累積分布関数に相当します。[ 4 ]
累積分布関数の閉形式の境界をいくつか以下に示します。
X ~ B( n , p )、つまりX が二項分布に従う確率変数であり、n が実験の総数、p が各実験で成功結果が得られる確率である場合、Xの期待値は次のようになります。[ 5 ]
これは、期待値の線形性と、 X がそれぞれ期待値pを持つn個の同一のベルヌーイ確率変数の和であるという事実から導かれる。言い換えれば、はパラメータpを持つ同一の (かつ独立な) ベルヌーイ確率変数であり、X = X 1 + ... + X nであり、
分散は次のとおりです。
これは、独立な確率変数の和の分散が、それぞれの分散の和に等しいという事実からも同様に導かれる。
最初の6つの中心モーメントは次のように定義されます。は、
非中心モーメントは以下を満たす そして一般的には[ 6 ] [ 7 ] どこは第2種スターリング数であり、は-th下降指数二項モーメントを高次のポアソンモーメントで制限することにより、単純な境界 [ 8 ]が得られます。 これは、、 それから最大で定数倍離れている。
モーメント母関数は。
通常、二項分布B( n , p )の最頻値は次のようになります。、 どこは床関数です。ただし、( n + 1) pが整数で、pが 0 でも 1 でもない場合、分布には( n + 1) pと( n + 1) p − 1の 2 つのモードがあります。pが0 または 1 の場合、モードはそれぞれ 0 とnになります。これらのケースは次のようにまとめられます。
証明 :
のためにのみゼロ以外の値を持つ。 のために私たちは発見しますそしてのためにこれは、モードが0であることを証明しています。そしてのために。
させて我々は発見する
これからは
だからが整数であれば、そしてこれはモードです。その時だけはモードです。[ 9 ]
一般的に、二項分布の中央値を求めるための単一の公式は存在せず、場合によっては一意ではないこともあります。しかし、いくつかの特別な結果が確立されています。
k ≤ npの場合、累積分布関数の下側裾野の上限を導出できる。成功回数が最大k回である確率。これらの境界は、 k ≥ npの累積分布関数の上側テールの境界としても見なすことができます。
ホフディングの不等式は単純な境界を与える しかし、これはあまり厳密ではありません。特に、p = 1の場合、 F ( k ; n , p ) = 0 ( k < nの固定k、nに対して)となりますが、ホフディングの境界は正の定数に評価されます。
チェルノフ限界からより厳密な境界が得られる:[ 15 ] ここで、D ( a ∥ p )は、 aコインとpコインの間(つまり、ベルヌーイ分布 ( a )とベルヌーイ分布 ( p )の間)の相対エントロピー (またはカルバック・ライブラー情報量)です。
漸近的には、この境界はかなりタイトです。詳細は[ 15 ]を参照してください。
また、反集中境界として知られる、裾野F ( k ; n , p )の下限も得ることができます。二項係数をスターリングの公式で近似することにより、 [ 16 ]が示されます。 これはより単純だが緩い境界を意味する
p = 1/2およびk ≥ 3 n /8 ( nが偶数の場合)の場合、分母を定数にすることができます: [ 17 ]
nが既知の場合、成功率を用いて パラメータpを推定することができる。この推定量は、最尤推定法とモーメント法 を用いて求められます。この推定量は、最小十分かつ完全な統計量(すなわち、x)に基づいているため、レーマン・シェッフェの定理を用いて証明されるように、不偏かつ一様で最小分散です。また、確率とMSEの両方において一致性があります。この統計量は、ベルヌーイ標本の平均を取ることと同じであるため、中心極限定理により漸近的に正規分布に従います。分散はこれは、ウォルドの信頼区間など、さまざまな方法で使用される特性です。
ベータ分布を共役事前分布として使用する場合、 pの閉形式のベイズ推定量も存在する。事前分布として、事後平均推定値は次のようになる。 ベイズ推定量は漸近的に効率的であり、サンプルサイズが無限大に近づくにつれて ( n → ∞ )、最尤推定量解に近づきます。[ 18 ]ベイズ推定量はバイアスがあり(その程度は事前分布に依存します)、 確率的に許容可能で一致しています。ベータ分布を用いたベイズ推定量は、トンプソンサンプリングで使用できます。
標準一様分布を非情報的な事前分布として使用する特殊なケースでは、事後平均推定値は次のようになる。 (事後最頻値は標準推定量にそのままつながるはずです。)この方法は継承法則と呼ばれ、18世紀にピエール=シモン・ラプラスによって導入されました。
ジェフリーズの事前分布に頼る場合、事前分布は[ 19 ]これにより推定値が得られます 。
非常にまれな事象と小さなn (たとえば、x = 0の場合) でp を推定する場合、標準推定量を使用すると、これは時として非現実的で望ましくない。そのような場合、さまざまな代替推定法が存在する。[ 20 ]一つの方法は、ベイズ推定法を用いることである。その結果、以下のことが起こりました。 別の方法としては、 3の法則を用いて得られた信頼区間 の上限値を用いる方法がある。
nの値がかなり大きい場合でも、実際の平均の分布は著しく非正規分布になります。[ 21 ]この問題のため、信頼区間を推定するためのいくつかの方法が提案されています。
以下の信頼区間の式において、各変数は次のような意味を持ちます。
0.5 / nの連続性補正を加えることができる。
ここでpの推定値は次のように修正されます。
この方法はn > 10およびn 1 ≠ 0の場合にうまく機能します。[ 23 ]詳細はこちらを参照してください。[ 24 ] n1 = 0 の場合、nは以下のウィルソン(スコア)法を使用します。
以下の式の表記は、以前の式と2つの点で異なります。[ 26 ]
いわゆる「正確な」(クロッパー・ピアソン)法は最も保守的な方法である。[ 21 ] (正確とは完全に正確という意味ではなく、推定値が真の値よりも保守的でないという意味である。)
ウォルド法は教科書でよく推奨されているが、最も偏りが大きい方法である。
X ~ B( n , p )とY ~ B( m , p )が同じ確率pを持つ独立な二項変数である場合、X + Yは再び二項変数になります。その分布はZ = X + Y ~ B( n + m , p )です。[ 28 ]
二項分布に従う確率変数X ~ B( n , p )は、 n 個のベルヌーイ分布に従う確率変数の和と考えることができます。したがって、2 つの二項分布に従う確率変数X ~ B( n , p )とY ~ B( m , p )の和は、 n + m 個のベルヌーイ分布に従う確率変数の和に等しく、Z = X + Y ~ B( n + m , p )となります。これは加法定理を用いて直接証明することもできます。
しかし、XとYが同じ確率pを持たない場合、合計の分散はB( n + m , p )として分布する二項変数の分散よりも小さくなります。
二項分布は、 n 個の独立した同一でないベルヌーイ試行の合計の分布であるポアソン二項分布の特殊なケースであるB( p i )。[ 29 ]
この結果は、1978年にカッツと共著者らによって初めて導き出された。[ 30 ]
X ~ B( n , p 1 )とY ~ B( m , p 2 )は独立であるとする。T = ( X / n ) / ( Y / m )とする。
すると、log( T )は平均log( p1 / p2 )と分散((1/ p1 ) -1)/ n + ((1/ p2 ) -1)/ mの正規分布に近似的に従います。
X ~ B( n , p )かつY | X ~ B( X , q ) ( Xが与えられたときのYの条件付き分布)の場合、 Yは分布Y ~ B( n , pq )を持つ単純な二項確率変数です。
例えば、n個のボールをバスケットU Xに投げ入れ、当たったボールを別のバスケットU Yに投げ入れることを想像してみてください。pがU Xに当たる確率である場合、X ~ B ( n , p )はU Xに当たるボールの数です。qがU Yに当たる確率である場合、 U Yに当たるボールの数はY ~ B( X , q )であり、したがってY ~ B( n , pq )となります。
ベルヌーイ分布は、 n = 1の場合の二項分布の特殊なケースです。記号的には、X ~ B(1, p )はX ~ Bernoulli( p )と同じ意味を持ちます。逆に、任意の二項分布B( n , p )は、それぞれ同じ確率pを持つn個の独立したベルヌーイ試行の合計Bernoulli( p )の分布です。[ 31 ]

nが十分に大きい場合、分布の歪みはそれほど大きくありません。この場合、B( n , p )の妥当な近似は正規分布によって与えられます。この基本的な近似は、適切な連続性補正 を用いることで簡単に改善できます。基本的な近似は、nが増加するにつれて(少なくとも20)、一般的に改善され、pが0または1に近くない場合に良好になります。 [ 32 ] nが十分に大きく、pが0または1の極値から十分に離れているかどうかを判断するために、さまざまな経験則を使用できます。
これはベリー・エッセンの定理を用いて厳密に表すことができる。
ルール完全に同じ要求です 用語の順序を変更すると、次のようになります。 以来二乗を適用し、それぞれの因数で割ることができますそして望ましい条件を得るために: これらの条件は自動的に次のことを意味することに注意してください。一方、再び平方根を適用して3で割ると、 最初の不等式から2番目の不等式を引くと、次のようになる。 したがって、望ましい第一のルールが満たされ、
両方の値がそして 9より大きい。私たちはそれを簡単に手に入れることができます あとはそれぞれの因数で割るだけですそして3標準偏差ルールの別の形式を導き出すために:
以下は、連続性補正を適用する例です。二項分布に従う確率変数Xに対してPr( X ≤ 8)を計算したいとします。Yの分布が正規近似で与えられる場合、Pr( X ≤ 8)はPr( Y ≤ 8.5)で近似されます。0.5 を加えることで連続性補正が行われます。補正なしの正規近似では、精度が著しく低下します。
この近似はド・モアブル・ラプラスの定理として知られており、手計算を行う際に大幅な時間短縮になります(nが大きい場合の正確な計算は非常に面倒です)。歴史的には、これは 1738 年にアブラハム・ド・モアブルの著書『確率論』で導入された正規分布の最初の使用例です。今日では、 B( n , p )はパラメータpを持つn個の独立で同一分布のベルヌーイ変数の和であるため、中心極限定理の結果と見なすことができます。この事実は、共通の検定統計量でpの推定値である標本比率x / nを使用したpの値に対する仮説検定、つまり「比率 z 検定」の基礎となっています。[ 35 ]
例えば、大規模な集団から無作為にn人を抽出し、ある特定の意見に賛成するかどうかを尋ねるとします。賛成する人の割合は当然サンプルによって異なります。n人のグループを繰り返し、真に無作為に抽出した場合、その割合は、母集団における賛成の 真の割合pを平均とし、標準偏差が一定である近似正規分布に従います。
試行回数が無限大に近づくにつれて二項分布はポアソン分布に収束し、積npは有限の極限に収束します。したがって、nが十分に大きくpが十分に小さい場合、パラメータλ = npのポアソン分布を二項分布B( n , p )の近似として使用できます。経験則によれば、n ≥ 20かつp ≤ 0.05 [ 36 ]でnp ≤ 1の場合、またはn > 50かつp < 0.1でnp < 5 の場合[ 37 ]、またはn ≥ 100かつnp ≤ 10の場合[ 38 ] [ 39 ]にこの近似は良好です。
ポアソン近似の精度については、Novak [ 40 ]第 4 章およびその中の参考文献を参照してください。
二項分布とベータ分布は、繰り返しベルヌーイ試行を行う同じモデルの異なる見方です。二項分布は、それぞれ成功確率がpであるn個の独立した事象が与えられた場合のk個の成功の確率質量関数です。数学的には、α = k + 1、β = n − k + 1の場合、ベータ分布と二項分布はn + 1の係数で関連付けられます。 ;\beta )=(n+1)\mathrm {B} (k;n;p)}
ベータ分布は、ベイズ推論における二項分布の事前確率分布のファミリーも提供する。[ 41 ]一様事前分布が与えられた場合、 k回の成功が観測されたn個の独立事象が与えられたとき の成功確率pの事後分布はベータ分布である。[ 42 ]
周辺分布が二項分布である乱数生成法は確立されている。[ 43 ] [ 44 ]二項分布から乱数サンプル を生成する1つの方法は、逆アルゴリズムを使用することである。そのためには、 0からnまでのすべての値kに対してPr( X = k )となる確率を計算する必要がある。(これらの確率は、サンプル空間全体を包含するために、1に近い値に合計する必要がある。) 次に、擬似乱数生成器を使用して0から1の間で均一にサンプルを生成することで、最初のステップで計算された確率を使用して、計算されたサンプルを離散的な数値に変換することができる。
この分布はヤコブ・ベルヌーイによって導き出された。彼は、 p = r /( r + s )の場合を考察した。ここでpは成功の確率であり、rとsは正の整数である。ブレーズ・パスカルはそれ以前にp = 1/2の場合を考察し、対応する二項係数を表にまとめた。これは現在パスカルの三角形として認識されている。[ 45 ]
{{cite web}}: CS1 maint: bot: 元の URL の状態が不明です (リンク){{cite news}}: CS1 maint: bot: 元の URL の状態が不明です (リンク){{cite web}}: CS1 maint: bot: 元の URL の状態が不明です (リンク)