単一のサイコロ を連続して振った場合の、大数の法則を示す例 です。この連続したサイコロを振る回数が増えるにつれて、すべての結果の平均値は3.5に近づきます。少ない回数(左側)では各サイコロの出目はそれぞれ異なる形状を示しますが、多い回数(右側)では形状は極めて似通ったものになります。確率論 において、大数の法則 とは、多数の独立したランダムサンプルから得られた結果の平均 が、真の値が存在する場合には、真の値に収束するという数学的な法則 である。 [ 1 ] より厳密には、大数の法則は、独立で同一の分布に従う値のサンプルが与えられた場合、サンプル平均が真の平均 に収束するというものである。
大数の法則は、いくつかのランダムな 事象 の平均について、長期的に安定した結果を保証するため重要です。[ 1 ] [ 2 ] 例えば、カジノは ルーレット の1回のスピンで損失 を出すかもしれませんが、多数のスピンにわたって収益は予測可能な割合に収束する傾向があります。プレイヤーの連勝は、最終的にはゲームのパラメーターによって打ち消されます。重要なのは、この法則は(名前が示すように)多数 の観測を考慮した場合にのみ適用されるということです。少数の観測が期待値と一致するという原則も、ある値の連勝が他の値によってすぐに「バランス」されるという原則もありません。
歴史を通じて、多くの数学者がこの法則を改良してきた。今日では、大数の法則は統計学、確率論、経済学、保険など多くの分野で利用されている。[ 3 ]
例 6面サイコロ を1回振ると、1、2、3、4、5、6のいずれかの数字が等しい確率 で出ます。したがって、 1回のサイコロを振ったときの期待値は次のようになります。
1 + 2 + 3 + 4 + 5 + 6 6 = 3.5 {\displaystyle {\frac {1+2+3+4+5+6}{6}}=3.5}
大数の法則によれば、多数の6面サイコロを振ると、それらの値の平均(標本平均 と呼ばれることもある)は3.5に近づき、振るサイコロの数が増えるほど精度が高くなります。
大数の法則によれば、一連のベルヌーイ試行における 経験的な成功確率 は、理論的な確率に収束します。ベルヌーイ確率変数の場合、期待値は理論的な成功確率であり、そのような変数 n 個の平均(それらが独立同分布 (iid) であると仮定) は、まさに相対頻度になります。
この図は、相対頻度が理論上の確率に収束していく様子を示しています。袋から赤いボールを取り出す確率は0.4、黒いボールを取り出す確率は0.6です。左のグラフは黒いボールを取り出す相対頻度を、右のグラフは赤いボールを取り出す相対頻度を、それぞれ10,000回の試行で示しています。試行回数が増えるにつれて、相対頻度はそれぞれの理論上の確率に近づき、大数の法則が成り立っていることがわかります。 例えば、公平なコイン 投げはベルヌーイ試行です。公平なコインを1回投げたとき、表が出る理論上の確率は1/2です。 したがって、大数の法則によれば、「多数回」のコイン投げにおける表の割合は、おおよそ1/2になるはずです。 特に 、 n回の投げの後、表の割合はn が無限 大 に 近づく につれて、ほぼ 確実に 1/2 に収束 します。
表(と裏)の割合は1/2に近づきますが、 コイン を投げる回数が増えるにつれて、表と裏の絶対差はほぼ確実に大きく なり ます。つまり、絶対差が小さい値になる確率は、コインを投げる回数が増えるにつれてゼロに近づきます。また、絶対差とコインを投げる回数の比もほぼ確実にゼロに近づきます。直感的には、期待される差は大きくなりますが、コインを投げる回数よりも緩やかなペースで大きくなります。
大数の法則のもう1つの良い例はモンテカルロ法です。これらの方法は、数値結果を得るために繰り返し ランダムサンプリング に依存する計算 アルゴリズム の幅広いクラスです。繰り返しの回数が多いほど、近似の精度は高くなります。この方法が重要な理由は主に、他のアプローチを使用することが困難または不可能な場合があるためです。[ 4 ]
制限 多数の試行から得られた結果の平均は、場合によっては収束しないことがあります。たとえば、コーシー分布 または一部のパレート分布(α<1) から得られた n 個の結果の平均は、 n が 大きくなるにつれて収束しません。その理由は、裾が重いこと です。[ 5 ] コーシー分布とパレート分布は 2 つのケースを表しています。コーシー分布には期待値がありませんが、[ 6 ] パレート分布 ( α <1) の期待値は無限大です。[ 7 ] コーシー分布の例を生成する 1 つの方法は、乱数が−90° から +90° の間で一様に分布する角度の正接に等しい場合です。 [ 8 ] 中央値 はゼロですが、期待値は存在せず、実際には、そのようなn 個の変数の平均は、そのような変数 1 つと同じ分布を持ちます。n が 無限大に近づくにつれて、確率的にゼロ (または他の値) に収束しません。
試行に、人間の経済的・合理的行動によく見られるような選択バイアス が組み込まれている場合、試行回数を増やしても選択バイアスは残るため、大数の法則はそのバイアスを解決するのに役立たない。
歴史 拡散は 、大数の法則の一例です。最初は、障壁(マゼンタ色の線)の左側に溶質分子が存在し、右側には存在しません。障壁を取り除くと、溶質は拡散して容器全体に広がります。 上図: 単一分子の場合、その動きは非常にランダムに見える。中間: 分子数が増えるにつれて、溶質が容器内をより均一に満たす傾向が明確に見られるが、ランダムな変動も存在する。下図: 溶質分子が非常に多いため(多すぎて目視できない)、ランダム性はほぼなくなります。溶質は高濃度領域から低濃度領域へと滑らかかつ系統的に移動しているように見えます。現実的な状況では、化学者は拡散を、その根底にあるランダムな性質にもかかわらず、決定論的な巨視的現象として記述することができます(フィックの法則を 参照)。イタリアの数学者ジェロラモ・カルダーノ (1501–1576)は、証明なしに、経験統計の精度は試行回数とともに向上する傾向があると述べた。[ 9 ] [ 3 ] これは後に大数の法則として定式化された。大数の法則の特殊な形式(二値確率変数の場合)は、ヤコブ・ベルヌーイ によって初めて証明された。[ 10 ] [ 3 ] 彼が十分に厳密な数学的証明を開発するのに20年以上かかり、それは1713年に彼の著書『推測の技法 』 (Ars Conjectandi )で発表された。彼はこれを「黄金定理」と名付けたが、一般には「ベルヌーイの定理 」として知られるようになった。これは、ヤコブ・ベルヌーイの甥ダニエル・ベルヌーイ にちなんで名付けられたベルヌーイの原理 と混同してはならない。 1837年、SDポアソンはそれを 「大数の法則」という 名前でさらに詳しく説明しました。[ 11 ] [ 12 ] [ 3 ] その後、両方の名前で知られるようになりましたが、「大数の法則」が最もよく使われています。
ベルヌーイとポアソンが研究成果を発表した後、チェビシェフ [ 13 ] 、マルコフ 、ボレル 、カンテリ 、コルモゴロフ 、ヒンチン [ 3 ] など、他の数学者たちもこの法則の改良に貢献した。マルコフは、この法則が他のより弱い仮定の下で有限分散を持たない確率変数にも適用できることを示し、ヒンチンは1929年に、系列が独立同分布の確率変数から構成されている場合、大数の弱法則が成り立つためには期待値が存在するだけで十分であることを示した [ 15 ] 。これらのさらなる研究により、大数の法則の2つの顕著な形式が生まれた。1つは「弱」法則、もう1つは「強」法則と呼ばれ、これは累積標本平均が期待値に収束 する2つの異なるモードを指している。特に、以下で説明するように、強形式は弱形式を意味する
大数の法則には、以下に説明する2つの異なるバージョンがあります。これらは、大数の強法則と大数の弱法則と呼ばれています。[ 16 ] [ 1 ] X 1 , X 2 , ... が 、期待 値E( X 1 ) = E( X 2 ) = ... = μを持つ 独立同分布 (iid)の ルベーグ積分可能な 確率変数の無限列である場合について述べられており、どちらのバージョンの法則も、標本平均が
X ¯ n = 1 n ( X 1 + ⋯ + X n ) {\displaystyle {\overline {X}}_{n}={\frac {1}{n}}(X_{1}+\cdots +X_{n})}
期待値に収束する:
(X j のルベーグ積分可能性とは、期待値 E( X j ) がルベーグ積分に従って存在し、かつ有限であることを意味します。これは、関連する確率測度がルベーグ測度 に関して絶対連続であることを意味するものでは ありません 。)
入門的な確率論の教科書では、さらに同一の有限分散を仮定することが多い。 バラ ( X 私 ) = σ 2 \displaystyle \operatorname {Var} (X_{i})=\sigma ^{2}} (すべての私 {\displaystyle i} )そして、ランダム変数間に相関はありません。この場合、 n 個 のランダム変数の平均の分散は次のようになります。
バラ ( X ¯ n ) = バラ ( 1 n ( X 1 + ⋯ + X n ) ) = 1 n 2 バラ ( X 1 + ⋯ + X n ) = n σ 2 n 2 = σ 2 n 。 \displaystyle \operatorname {Var} ({\overline {X}}_{n})=\operatorname {Var} ({\tfrac {1}{n}}(X_{1}+\cdots +X_{n}))={\frac {1}{n^{2}}}\operatorname {Var} (X_{1}+\cdots +X_{n})={\frac {n\sigma ^{2}}{n^{2}}}={\frac {\sigma ^{2}}{n}}.}
これは証明を短縮および簡略化するために使用できます。有限分散の仮定は 必須で はありません。大きな分散または無限の分散は収束を遅くしますが、大数の法則はいずれにせよ成り立ちます。[ 17 ]
確率変数の相互独立性 は、法則のどちらのバージョンにおいても、ペアワイズ独立性 [ 18 ] または交換可能性 [ 19 ]に置き換えることができる。
強収束と弱収束の違いは、主張される収束モードに関係しています。これらのモードの解釈については、「確率変数の収束」を 参照してください。
弱い法則 大数の法則を示すシミュレーションです。各フレームで、片面が赤、もう片面が青のコインが投げられ、対応する列に点が追加されます。円グラフは、これまでの赤と青の割合を示しています。最初は割合が大きく変動しますが、試行回数が増えるにつれて50%に近づいていくことに注目してください。
大数の弱法則 (ヒンチンの法則とも呼ばれる) は、有限の平均を持つ確率変数からの独立同分布 (iid)サンプルの集合が与えられた場合、サンプル平均は確率的に 期待値に収束すると述べている[ 20 ]。
つまり、任意の正の数ε に対して、
リム n → ∞ 教授 ( | X ¯ n − μ | < ε ) = 1. \lim_{n\to\infty}\Pr \!\left(\,|\overlineX_n-\mu|<\varepsilon \,\right)=1.}
この結果を解釈すると、弱法則は、指定された非ゼロのマージン(ε )がどれほど小さくても、十分な大きさのサンプルがあれば、観測値の平均が期待値に近くなる確率が非常に高い、つまりマージン内に収まるということを示しています。
前述のように、弱い法則は iid 確率変数の場合に適用されますが、他のいくつかの場合にも適用されます。たとえば、期待値を一定に保ちながら、系列内の各確率変数の分散が異なる場合があります。分散が有界であれば、 1867 年にチェビシェフ が示したように、この法則が適用されます。(期待値が系列中に変化する場合、それぞれの期待値からの平均偏差にこの法則を適用するだけで済みます。この法則は、これが確率的にゼロに収束すると述べています。)実際、チェビシェフの証明は、最初のn 個の値の平均の分散がn が 無限大に近づくにつれてゼロに近づく限り有効です。[ 15 ] 例として、系列内の各確率変数が平均ゼロで分散が等しいガウス分布(正規分布)に従うと仮定します。 2 n / ログ ( n + 1 ) {\displaystyle 2n/\log(n+1)} これは有界ではありません。各段階で、平均は正規分布に従います(正規分布に従う変数の集合の平均として)。合計の分散は分散の合計に等しく、漸近的 に次のようになります。n 2 / ログ n {\displaystyle n^{2}/\log n} したがって、平均の分散は漸近的に次のようになる。1 / ログ n {\displaystyle 1/\log n} そしてゼロになる。
期待値が存在しない場合でも、弱い法則が適用される例もある。
強力な法律 大数の強法則 (コルモゴロフの法則とも呼ばれる) は、標本平均がほぼ確実に 期待値に収束することを述べている[ 21 ]。
つまり、
教授 ( リム n → ∞ X ¯ n = μ ) = 1. {\displaystyle \Pr \!\left(\lim _{n\to \infty }{\overline {X}}_{n}=\mu \right)=1.}
これは、試行回数n が無限大に近づくにつれて、観測値の平均が期待値に収束する確率が 1 に等しくなることを意味します。強法則の現代的な証明は弱法則の証明よりも複雑で、適切な部分列への移行に依存しています。[ 17 ]
大数の強法則は、点ごとのエルゴード定理 の特殊な場合と見なすことができる。この見方は、繰り返しサンプリングされた確率変数の期待値(ルベーグ積分の場合のみ)を「長期平均」と直感的に解釈することを正当化する。
法則3は、強収束(ほぼ確実に収束する)する確率変数は必ず弱収束(確率収束)することが保証されているため、強法則と呼ばれます。ただし、強法則が成り立たない特定の条件下では弱法則が成り立つことが知られており、その場合、収束は弱収束(確率収束)にとどまります。弱法則と強法則の違いについては、「弱法則と強法則の違い」を 参照してください。
強い法則は、期待値を持つ独立同分布の確率変数に適用されます(弱い法則と同様)。これは1930年にコルモゴロフによって証明されました。他の場合にも適用できます。コルモゴロフは1933年に、変数が独立同分布である場合、平均がほぼ確実に何か に収束するためには(これは強い法則の別の表現と考えることができます)、期待値を持つ必要があることを示しました(そしてもちろん、平均はほぼ確実にその値に収束します)。[ 22 ]
項が独立しているが同一分布ではない場合、
ただし、各X k は有限の 2 次モーメントを持ち、
∑ k = 1 ∞ 1 k 2 バラ [ X k ] < ∞ 。 {\displaystyle \sum _{k=1}^{\infty }{\frac {1}{k^{2}}}\operatorname {Var} [X_{k}]<\infty .}
この記述はコルモゴロフの強法則 として知られています。例えば、Sen & Singer (1993 、定理 2.3.10) を参照してください。
大数の法則は推定量の集合にも拡張され、集合全体で収束が一様であるため、一様大数の法則 と呼ばれます。
f ( x , θ ) は、θ ∈ Θに対して定義され、θに関して連続な 関数 であるとします。このとき、任意の固定されたθ に対して、数列 { f ( X 1 , θ ), f ( X 2 , θ ), ...} は、独立同分布の確率変数の列となり、この数列の標本平均は確率収束して E[ f ( X , θ )] となります。これが 点ごとの ( θ に関する) 収束です。
大数の均一法則 の具体的な例として、θ に関して均一に 収束する条件が挙げられます。[ 29 ] [ 30 ]
Θ はコンパクトで、f ( x , θ ) は、 ほとんどすべての xに対して、各 θ ∈ Θで連続であり、各θで x の可測関数である 。E[ d ( X )] < ∞となるような支配 関数d ( x )が存在し、‖ f ( x 、 θ ) ‖ ≤ d ( x ) すべての人々のために θ ∈ Θ 。 {\displaystyle \left\|f(x,\theta )\right\|\leq d(x)\quad {\text{for all}}\ \theta \in \Theta .} すると、E[ f ( X , θ )] はθ に関して連続であり、
すする θ ∈ Θ ‖ 1 n ∑ 私 = 1 n f ( X 私 、 θ ) − E [ f ( X 、 θ ) ] ‖ → P 0. {\displaystyle \sup _{\theta \in \Theta }\left\|{\frac {1}{n}}\sum _{i=1}^{n}f(X_{i},\theta )-\operatorname {E} [f(X,\theta )]\right\|{\overset {\mathrm {P} }{\rightarrow }}\ 0.}
この結果は、多くの推定量の一貫性を導出するのに役立ちます(極値推定量を 参照)。
ボレルの大数の法則エミール・ボレル にちなんで名付けられたボレルの大数の法則は 、実験を同一条件下で独立に多数回繰り返すと、特定の事象が発生すると予想される割合は、特定の試行でその事象が発生する確率とほぼ等しくなるというものである。繰り返し回数が多いほど、近似精度は高くなる傾向がある。より正確には、E を 問題の事象、p を その発生確率、N n ( E ) を最初のn 回の試行で E が 発生する回数とすると、確率 1 で、[ 31 ] N n ( E ) n → p として n → ∞ 。 {\displaystyle {\frac {N_{n}(E)}{n}}\to p{\text{ as }}n\to \infty .}
この定理は、事象の発生頻度の長期的な期待値としての確率という直感的な概念を厳密に定義するものである。これは、確率論におけるいくつかのより一般的な大数の法則のいずれかの特殊な場合である。
弱い法則の証明 X 1 、X 2 、 ... は有限の期待値を持つ独立同分布 の無限列の確率変数である。E ( X 1 ) = E ( X 2 ) = ⋯ = μ < ∞ {\displaystyle E(X_{1})=E(X_{2})=\cdots =\mu <\infty } 我々は標本平均の収束に興味がある
X ¯ n = 1 n ( X 1 + ⋯ + X n ) 。 {\displaystyle {\overline {X}}_{n}={\tfrac {1}{n}}(X_{1}+\cdots +X_{n}).}
大数の弱法則は次のように述べている。
有限分散を仮定したチェビシェフの不等式を用いた証明この証明では、有限分散 の仮定を使用します。バラ ( X 私 ) = σ 2 {\displaystyle \operatorname {Var} (X_{i})=\sigma ^{2}} (すべての私 {\displaystyle i} ) 確率変数の独立性は、それらの間に相関がないことを意味し、次のようになります。
バラ ( X ¯ n ) = バラ ( 1 n ( X 1 + ⋯ + X n ) ) = 1 n 2 バラ ( X 1 + ⋯ + X n ) = n σ 2 n 2 = σ 2 n 。 {\displaystyle \operatorname {Var} ({\overline {X}}_{n})=\operatorname {Var} ({\tfrac {1}{n}}(X_{1}+\cdots +X_{n}))={\frac {1}{n^{2}}}\operatorname {Var} (X_{1}+\cdots +X_{n})={\frac {n\sigma ^{2}}{n^{2}}}={\frac {\sigma ^{2}}{n}}.}
数列の共通平均μは、標本平均の平均である。
E ( X ¯ n ) = μ 。 {\displaystyle E({\overline {X}}_{n})=\mu .}
チェビシェフの不等式 を用いてX ¯ n {\displaystyle {\overline {X}}_{n}} 結果として
P ( | X ¯ n − μ | ≥ ε ) ≤ σ 2 n ε 2 。 {\displaystyle \operatorname {P} (\left|{\overline {X}}_{n}-\mu \right|\geq \varepsilon )\leq {\frac {\sigma ^{2}}{n\varepsilon ^{2}}}.}
これは以下の目的に使用できます。
P ( | X ¯ n − μ | < ε ) = 1 − P ( | X ¯ n − μ | ≥ ε ) ≥ 1 − σ 2 n ε 2 。 {\displaystyle \operatorname {P} (\left|{\overline {X}}_{n}-\mu \right|<\varepsilon )=1-\operatorname {P} (\left|{\overline {X}}_{n}-\mu \right|\geq \varepsilon )\geq 1-{\frac {\sigma ^{2}}{n\varepsilon ^{2}}}.}
nが 無限大に近づくと、式は1に近づきます。そして、確率収束 の定義により、次の式が得られます。
特性関数の収束を用いた証明 複素関数 に関するテイラーの定理 によれば、有限平均μを持つ任意の確率変数Xの 特性関数は 次のように表される。
φ X ( t ) = 1 + 私 t μ + o ( t ) 、 t → 0. {\displaystyle \varphi _{X}(t)=1+it\mu +o(t),\quad t\rightarrow 0.}
すべてのX 1 、X 2 、 ... は同じ特性関数を持つので、これを単にφ X と表記します。
特性関数の基本的な性質には、
φ 1 n X ( t ) = φ X ( t n ) そして φ X + Y ( t ) = φ X ( t ) φ Y ( t ) {\displaystyle \varphi _{{\frac {1}{n}}X}(t)=\varphi _{X}({\tfrac {t}{n}})\quad {\text{and}}\quad \varphi _{X+Y}(t)=\varphi _{X}(t)\varphi _{Y}(t)\quad } X とY が独立である場合。
これらのルールは、特性関数を計算するために使用できます。X ¯ n {\displaystyle {\overline {X}}_{n}} φ X に関して:
φ X ¯ n ( t ) = [ φ X ( t n ) ] n = [ 1 + 私 μ t n + o ( t n ) ] n → e 私 t μ 、 として n → ∞ 。 {\displaystyle \varphi _{{\overline {X}}_{n}}(t)=\left[\varphi _{X}\left({t \over n}\right)\right]^{n}=\left[1+i\mu {t \over n}+o\left({t \over n}\right)\right]^{n}\,\rightarrow \,e^{it\mu },\quad {\text{as}}\quad n\to \infty .}
極限e itμ は定数確率変数 μ の特性関数であり、したがってレヴィ連続性定理 により、X ¯ n {\displaystyle {\overline {X}}_{n}} 分布において μに収束する:
X ¯ n → D μ のために n → ∞ 。 {\displaystyle {\overline {X}}_{n}\,{\overset {\mathcal {D}}{\rightarrow }}\,\mu \qquad {\text{for}}\qquad n\to \infty .}
μは定数であり、これは分布のμへの収束と確率のμへの収束が同等であることを意味します(確率変数の収束を 参照)。したがって、
これは、特性関数が原点に存在する限り、標本平均が確率的にその原点における導関数に収束することを示している。
強法則の証明 我々は、以下の仮定の下で、強い法則の比較的簡単な証明を与える。X 私 {\displaystyle X_{i}} 独立同分布 である、E [ X 私 ] =: μ < ∞ {\displaystyle {\mathbb {E} }[X_{i}]=:\mu <\infty } 、バラ ( X 私 ) = σ 2 < ∞ {\displaystyle \operatorname {Var} (X_{i})=\sigma ^{2}<\infty } 、 そしてE [ X 私 4 ] =: τ < ∞ {\displaystyle {\mathbb {E} }[X_{i}^{4}]=:\tau <\infty } 。
まず、一般性を失うことなく、 次のことを仮定できることに注意しましょう。μ = 0 {\displaystyle \mu =0} 中心化によって。この場合、強い法則によれば、
教授 ( リム n → ∞ X ¯ n = 0 ) = 1 、 {\displaystyle \Pr \!\left(\lim _{n\to \infty }{\overline {X}}_{n}=0\right)=1,} または 教授 ( ω : リム n → ∞ S n ( ω ) n = 0 ) = 1. {\displaystyle \Pr \left(\omega :\lim _{n\to \infty }{\frac {S_{n}(\omega )}{n}}=0\right)=1.} これは、以下を示すことと同等である。 教授 ( ω : リム n → ∞ S n ( ω ) n ≠ 0 ) = 0 、 {\displaystyle \Pr \left(\omega :\lim _{n\to \infty }{\frac {S_{n}(\omega )}{n}}\neq 0\right)=0,} 注意してください リム n → ∞ S n ( ω ) n ≠ 0 ⟺ ∃ ϵ > 0 、 | S n ( ω ) n | ≥ ϵ 無限に頻繁に 、 {\displaystyle \lim _{n\to \infty }{\frac {S_{n}(\omega )}{n}}\neq 0\iff \exists \epsilon >0,\left|{\frac {S_{n}(\omega )}{n}}\right|\geq \epsilon \ {\mbox{infinitely often}},} したがって、強い法則を証明するには、すべてのϵ > 0 {\displaystyle \epsilon >0} 、 我々は持っています 教授 ( ω : | S n ( ω ) | ≥ n ϵ 無限に頻繁に ) = 0. {\displaystyle \Pr \left(\omega :|S_{n}(\omega )|\geq n\epsilon {\mbox{無限に多い}}\right)=0.} 事象を定義するA n = { ω : | S n | ≥ n ϵ } {\displaystyle A_{n}=\{\omega :|S_{n}|\geq n\epsilon \}} 、そして、もし私たちがそれを示せるならば ∑ n = 1 ∞ 教授 ( A n ) < ∞ 、 {\displaystyle \sum _{n=1}^{\infty }\Pr(A_{n})<\infty ,} すると、ボレル・カンテリの補題から結果が得られる。それでは、推定してみよう。教授 ( A n ) {\displaystyle \Pr(A_{n})} 。
計算します E [ S n 4 ] = E [ ( ∑ 私 = 1 n X 私 ) 4 ] = E [ ∑ 1 ≤ 私 、 j 、 k 、 l ≤ n X 私 X j X k X l ] 。 {\displaystyle {\mathbb {E} }[S_{n}^{4}]={\mathbb {E} }\left[\left(\sum _{i=1}^{n}X_{i}\right)^{4}\right]={\mathbb {E} }\left[\sum _{1\leq i,j,k,l\leq n}X_{i}X_{j}X_{k}X_{l}\right].} まず、次の形式のすべての項がX 私 3 X j 、 X 私 2 X j X k 、 X 私 X j X k X l {\displaystyle X_{i}^{3}X_{j},X_{i}^{2}X_{j}X_{k},X_{i}X_{j}X_{k}X_{l}} すべての添え字が異なる場合、期待値はゼロでなければなりません。これは、E [ X 私 3 X j ] = E [ X 私 3 ] E [ X j ] {\displaystyle {\mathbb {E} }[X_{i}^{3}X_{j}]={\mathbb {E} }[X_{i}^{3}]{\mathbb {E} }[X_{j}]} 独立性により、最後の項はゼロであり、他の項についても同様です。したがって、期待値がゼロでない和の項は、E [ X 私 4 ] {\displaystyle {\mathbb {E} }[X_{i}^{4}]} そしてE [ X 私 2 X j 2 ] {\displaystyle {\mathbb {E} }[X_{i}^{2}X_{j}^{2}]} 以来X 私 {\displaystyle X_{i}} は同一分布であり、これらはすべて同じであり、さらにE [ X 私 2 X j 2 ] = ( E [ X 私 2 ] ) 2 {\displaystyle {\mathbb {E} }[X_{i}^{2}X_{j}^{2}]=({\mathbb {E} }[X_{i}^{2}])^{2}} 。
があるn {\displaystyle n} フォームの条件E [ X 私 4 ] {\displaystyle {\mathbb {E} }[X_{i}^{4}]} そして3 n ( n − 1 ) {\displaystyle 3n(n-1)} フォームの条件( E [ X 私 2 ] ) 2 {\displaystyle ({\mathbb {E} }[X_{i}^{2}])^{2}} 、 など E [ S n 4 ] = n τ + 3 n ( n − 1 ) σ 4 。 {\displaystyle {\mathbb {E} }[S_{n}^{4}]=n\tau +3n(n-1)\sigma ^{4}.} 右辺は の二次多項式であることに注意してください。n {\displaystyle n} そのため、C > 0 {\displaystyle C>0} そのためE [ S n 4 ] ≤ C n 2 {\displaystyle {\mathbb {E} }[S_{n}^{4}]\leq Cn^{2}} のためにn {\displaystyle n} 十分に大きい。マルコフにより、 教授 ( | S n | ≥ n ϵ ) ≤ 1 ( n ϵ ) 4 E [ S n 4 ] ≤ C ϵ 4 n 2 、 {\displaystyle \Pr(|S_{n}|\geq n\epsilon )\leq {\frac {1}{(n\epsilon )^{4}}}{\mathbb {E} }[S_{n}^{4}]\leq {\frac {C}{\epsilon ^{4}n^{2}}},} のためにn {\displaystyle n} 十分に大きいので、この級数は総和可能である。これは任意の に対して成り立つので、ϵ > 0 {\displaystyle \epsilon >0} 我々は、大数の強法則を確立した。[ 32 ] 2次モーメントと4次モーメントに関するすべての有限性仮定を捨てることで、証明は大幅に強化できる。また、例えば、有限モーメントを持たない分布の部分和を議論するように拡張することもできる。このような証明では、同じボレル・カンテリ述語を証明するために、より複雑な議論が用いられる。これは、極限を確率の括弧内に概念的に取り込むためにコルモゴロフが考案した戦略である。[ 33 ]
結果 大数の法則は、数列の実現から未知の分布の期待値を与えるだけでなく、確率分布 のあらゆる特徴も与えます。[ 1 ] ボレルの大数の法則 を適用することで、確率質量関数 を容易に得ることができます。目的の確率質量関数の各事象について、特定の事象が発生する回数の割合で事象の発生確率を近似することができます。繰り返し回数が多いほど、近似精度は高くなります。連続の場合については、次のようになります。C = ( 1 − h 、 1 + h ] {\displaystyle C=(a-h,a+h]} 小さな正のhの場合。したがって、大きなnの場合:
N n ( C ) n ≈ p = P ( X ∈ C ) = ∫ 1 − h 1 + h f ( x ) d x ≈ 2 h f ( 1 ) {\displaystyle {\frac {N_{n}(C)}{n}}\thickapprox p=P(X\in C)=\int _{a-h}^{a+h}f(x)\,dx\thickapprox 2hf(a)}
この方法を用いると、x軸全体をグリッド(グリッドサイズ2h)で覆い、ヒストグラム と呼ばれる棒グラフを得ることができます。
アプリケーション 大数の法則の応用例の一つに、モンテカルロ法 [ 3 ] と呼ばれる重要な近似法があります。これは、数値のランダムサンプリングを使用して数値結果を近似するものです。区間[a, b]におけるf(x)の積分を計算するアルゴリズムは次のとおりです。[ 3 ]
ソフトウェアを使用して一様乱数変数 X 1 、 X 2 、 ...、 X n をシミュレートし、[0, 1] 上の独立同分布 (iid) 乱数変数U 1 、 U 2 、 ...、 U nを生成します。次に、 i= 1, 2, ..., n に対して X i = a + (b - a) U i とします。すると、 X 1 、 X 2 、 ...、 X n は [a, b] 上の独立同分布の一様乱数変数になります。 f(X 1 ), f(X 2 ), ..., f(X n ) を評価します。 f(X 1 ), f(X 2 ), ..., f(X n )の平均を計算する( b − 1 ) f ( X 1 ) + f ( X 2 ) + ⋯ + f ( X n ) n {\displaystyle (b-a){\tfrac {f(X_{1})+f(X_{2})+\dots +f(X_{n})}{n}}} そして、大数の強法則により、これは以下に収束する。( b − 1 ) E ( f ( X 1 ) ) = ( b − 1 ) ∫ 1 b f ( x ) 1 b − 1 d x = ∫ 1 b f ( x ) d x {\displaystyle (b-a)\operatorname {E} (f(X_{1}))=(b-a)\int _{a}^{b}f(x){\tfrac {1}{b-a}}\,dx=\int _{a}^{b}f(x){dx}} 。積分を求めることができますf ( x ) = コス 2 ( x ) x 3 + 1 {\displaystyle f(x)=\cos ^{2}(x){\sqrt {x^{3}+1}}} [-1, 2] 上。この積分を計算するために従来の方法を用いるのは非常に困難であるため、ここではモンテカルロ法を用いることができる。[ 3 ] 上記のアルゴリズムを用いると、次のようになる。
∫ − 1 2 f ( x ) d x = 0.905 {\displaystyle \int _{-1}^{2}f(x)\,dx=0.905} n = 25 の場合
そして
∫ − 1 2 f ( x ) d x = 1.028 {\displaystyle \int _{-1}^{2}f(x)\,dx=1.028} n = 250 の場合。
nが増加するにつれて、数値も増加することがわかります。積分の実際の結果を得ると、次のようになります。
∫ − 1 2 f ( x ) d x = 1.000194 {\displaystyle \int _{-1}^{2}f(x)\,dx=1.000194} 。
LLNを使用した場合、積分の近似値は真の値に近くなり、したがってより正確になった。[ 3 ]
別の例としては、f ( x ) = e x − 1 e − 1 {\displaystyle f(x)={\frac {e^{x}-1}{e-1}}} [0, 1] の範囲。[ 34 ] モンテカルロ法と LLN を使用すると、サンプル数が増えるにつれて数値が 0.4180233 にますます近づくことがわかります。[ 34 ]
注記 1 2 3 4 デッキング、ミシェル(2005)。確率 と統計の現代的入門 。シュプリンガー。pp . 181–190。ISBN 9781852338961 。 ↑ Yao, Kai; Gao, Jinwu (2016). "不確実な確率変数に対する大数の法則". IEEE Transactions on Fuzzy Systems . 24 (3): 615–621 . Bibcode : 2016ITFS...24..615Y . doi : 10.1109/TFUZZ.2015.2466080 . ISSN 1063-6706 . S2CID 2238905 . 1 2 3 4 5 6 7 8 9 セドール、ケリー。 「大数の法則とその応用」 (PDF) 。 ↑ Kroese, Dirk P.; Brereton, Tim; Taimre, Thomas; Botev, Zdravko I. (2014). "Why the Monte Carlo method is so important today". Wiley Interdisciplinary Reviews: Computational Statistics . 6 (6): 386– 392. doi : 10.1002/wics.1314 . hdl : 1959.4/unsworks_43203 . S2CID 18521840 . ↑ デッキング、ミシェル編 (2005). 確率と統計の現代的入門:なぜ、どのように理解するか . シュプリンガー統計学テキスト. ロンドン [ハイデルベルク]: シュプリンガー. p. 187. ISBN 978-1-85233-896-1 。↑デッキング 、 ミシェル(2005)。 確率と統計の現代的入門 。シュプリンガー。92 ページ 。ISBN 9781852338961 。{{cite book}}: CS1 maint: url-status (リンク)↑デッキング 、 ミシェル(2005)。 確率と統計の現代的入門 。シュプリンガー。63 ページ 。ISBN 9781852338961 。{{cite book}}: CS1 maint: url-status (リンク)↑ Pitman, EJG; Williams, EJ (1967). "コーシー分布関数のコーシー変量" . The Annals of Mathematical Statistics . 38 (3): 916–918 . doi : 10.1214/aoms/1177698885 . ISSN 0003-4851 . JSTOR 2239008 . ↑ ムロディノウ、L. (2008). 酔歩 。ニューヨーク:ランダムハウス。p. 50。 ↑ ベルヌーイ、ヤコブ (1713)。 「4」。 Ars Conjectandi: Civilibus、Moralibus、Oeconomicis における Usum & Applicationem Praecedentis Doctrinae (ラテン語)。シェイニン、オスカー訳。 ↑ ポワソンは、サウスダコタ州ポワソン (1837 年) で 「大数の法則」 ( la loi des grands nombres ) と命名しました。 Probabilité des jugements en matière criminelle et en matière Civile、précédées des règles générales du calcul des probabilitiés (フランス語)。フランス、パリ: バシュリエ。 p. 7 . 彼は139~143ページと277ページ以降で、この法則の2段階の証明を試みている。 ↑ Hacking, Ian (1983). "19世紀の決定論概念の亀裂". Journal of the History of Ideas . 44 (3): 455– 475. doi : 10.2307/2709176 . JSTOR 2709176 . ↑ チェビシェフ、P. (1846)。 「確率論の一般的な命題のデモンストレーション élémentaire」 。 Journal für die reine und angewandte Mathematik (フランス語)。 1846 (33): 259–267 . doi : 10.1515/crll.1846.33.259 。 S2CID 120850863 。 1 2 ユーリ・プロホロフ 。 「大数の法則」 。 数学百科事典 。EMS Press。 ↑ Bhattacharya, Rabi; Lin, Lizhen; Patrangenaru, Victor (2016). 『数理統計学と大標本理論入門 』 Springer Texts in Statistics. New York, NY: Springer New York. doi : 10.1007/978-1-4939-4032-5 . ISBN 978-1-4939-4030-1 。1 2 「大数の強い法則 – 最新情報」 . Terrytao.wordpress.com. 2008年6月19日. 2012年6月9日 閲覧 . ↑ ニュージーランド、エテマディ (1981)。 「強力な大数の法則の初歩的な証明」 。 Wahrscheinlichkeitstheorie Verw Gebiete 。 55 (1): 119–122 。 土井 : 10.1007/BF01013465 。 S2CID 122166046 。 ↑ Kingman, JFC (1978年4月) 「交換可能性の利用」 . The Annals of Probability . 6 (2). doi : 10.1214/aop/1176995566 . ISSN 0091-1798 . ↑ ロエヴェ 1977 、第1.4章、14ページ ↑ ロエヴ 1977 、第17.3章、251ページ 1 2 ユーリ・プロホロフ。 「大数の強い法則」 。 数学百科事典 。 ↑ 「大数の法則とは何か?(定義)|Built In」 . builtin.com . 2023年10月20日 取得 。 ↑ ロス(2009) ↑ レーマン、エーリッヒ L.、ロマーノ、ジョセフ P. (2006-03-30). 弱法則は定数に収束する . Springer. ISBN 9780387276052 。↑ Dguvl Hun Hong; Sung Ho Lee (1998). "交換可能な確率変数に対する大数の弱法則に関する注記" (PDF) . 韓国数学会誌 . 13 (2): 385– 391. 2016-07-01 の オリジナル (PDF)からアーカイブ済み。2014-06-28 に 取得 。 ↑ ムケルジー、サヤン。 「大数の法則」 (PDF) 。 2013年3月9日に オリジナル (PDF)からアーカイブ済み。 2014年6月28日 に取得 。 ↑ J. ゲイヤー、チャールズ。 「大数の法則」 (PDF) 。 ↑ Newey & McFadden 1994 、補題 2.4 ↑ Jennrich, Robert I. (1969). "非線形最小二乗推定量の漸近的性質" . The Annals of Mathematical Statistics . 40 (2): 633– 643. doi : 10.1214/aoms/1177697731 . ↑ Wen, Liu (1991). "ボレルの大数の強法則を証明するための解析的手法" .The American Mathematical Monthly . 98 (2): 146–148 . doi : 10.2307/2323947 . JSTOR 2323947 . ↑ 別の証明は Etemadi, Nasrollah (1981) によって与えられました。 「強力な大数の法則の初歩的な証明」 。 Zeitschrift für Wahrscheinlichkeitstheorie und verwandte Gebiete 。 55 .スプリンガー: 119–122 。 土井 : 10.1007/BF01013465 。 S2CID 122166046 。 ↑ 有限の 4 次モーメントという追加の仮定なしの証明については、 Billingsley, Patrick (1979). Probability and Measure のセクション 22 を参照してください。 1 2 Reiter, Detlev (2008)、 「モンテカルロ法入門」 、Fehske, H.、Schneider, R.、Weiße, A. (編)、 Computational Many-Particle Physics 、Lecture Notes in Physics、vol. 739、ベルリン、ハイデルベルク:Springer Berlin Heidelberg、pp. 63–78 、 doi : 10.1007/978-3-540-74686-7_3 、 ISBN 978-3-540-74685-0 2023年12月8日 取得
参考文献 Grimmett, GR; Stirzaker, DR (1992).確率とランダム過程 (第2 版). オックスフォード:クラレンドン・プレス. ISBN 0-19-853665-8 。 デュレット、リチャード(1995)。確率:理論と例 (第2 版)。ダックスベリー・プレス。 マーティン・ヤコブセン (1992)。Videregående Sandsynlighedsregning [ Advanced Probability Theory ] (デンマーク語) (第 3 版)。コペンハーゲン: HCØ-tryk。ISBN 87-91180-71-6 。 ロエヴェ、ミシェル(1977)。確率論1 (第4 版)。シュプリンガー。 ニューイ、ホイットニー K.、マクファデン、ダニエル (1994)。「36」。大標本推定と仮説検定 。計量経済学ハンドブック。第 IV 巻。エルゼビア サイエンス。pp. 2111–2245 。 ロス、シェルドン(2009)。確率論入門 (第8 版)。プレンティス・ホール。ISBN 978-0-13-603313-4 。 Sen, P. K; Singer, JM (1993).統計学における大標本法 . Chapman & Hall. セネタ、ユージーン (2013)。 「大数の法則の 300 年の歴史」。ベルヌーイ 。19 (4 ) : 1088–1121。arXiv : 1309.6488 。土井 : 10.3150/12-BEJSP12。S2CID 88520834。