確率と統計の概念
均一分布を示すグラフ
確率論 と 統計学 では 、各ランダム変数が 他のランダム変数と 同じ 確率分布を持ち、すべてが相互に 独立している場合、 ランダム変数 の集合は 独立かつ同一に分布している ( iid 、 iid 、または IID ) 。 [1] IIDは統計学で最初に定義され、 データマイニング や 信号処理 などの多くの分野で応用されています 。
導入
統計では、通常、ランダム サンプルを扱います。ランダム サンプルは、ランダムに選択されたオブジェクトのセットと考えることができます。より正式には、「 独立した同一分布 (IID) のランダム データ ポイントのシーケンス」です。
つまり、 ランダム サンプル と IID という 用語は同義です。統計学では、「 ランダム サンプル」が一般的な用語ですが、確率論では「 IID 」と言う方が一般的です 。
同一に分布している ということは、全体的な傾向が存在しないことを意味します。つまり、分布は変動せず、サンプル内のすべての項目は同じ 確率 分布から取得されます。
独立と は、サンプル項目がすべて独立したイベントであることを意味します。言い換えれば、それらは互いにいかなる形でも接続されていません。 [2] 1つの変数の値を知っていても、他の変数の値に関する情報は得られず、その逆も同様です。
応用
独立かつ同一に分布するランダム変数は、基礎となる数学を単純化する仮定としてよく使用されます。しかし、 統計モデリング の実際のアプリケーションでは、この仮定は現実的である場合もそうでない場合もあります。 [3]
iid仮定 は 中心極限定理 でも使われており、有限 分散 を持つiid変数の和(または平均)の確率分布は 正規分布 に近づくと述べています 。 [4]
iid仮定 は 、ランダム変数のシーケンスのコンテキストで頻繁に発生します。この場合、「独立かつ同一に分布する」とは、シーケンス内の要素が、その前のランダム変数から独立していることを意味します。このように、iid シーケンスは、 n 番目のランダム変数の確率分布がシーケンス内の前のランダム変数の関数である マルコフ シーケンス (1 次マルコフ シーケンスの場合) とは異なります。iid シーケンスは、 サンプル空間 またはイベント空間のすべての要素の確率が同じでなければならないことを意味するものではありません。 [5] たとえば、不正なサイコロを繰り返し投げると、結果が偏っているにもかかわらず、iid であるシーケンスが生成されます。
信号処理 と 画像処理 では 、iid への変換の概念は、「id」部分と「i.」部分の 2 つの仕様を意味します。
id . – 信号レベルは時間軸上でバランスが取れている必要があります。
i . – 信号スペクトルは平坦化される必要があります。つまり、フィルタリング( デコンボリューション など )によって ホワイトノイズ 信号(つまり、すべての周波数が均等に存在する信号)に変換される必要があります。
意味
2つのランダム変数の定義
ランダム変数 およびが 内の値を取るように定義されていると仮定します 。 および をそれぞれ および の 累積分布関数 とし 、それらの 結合累積分布関数 を で表します 。
バツ
{\displaystyle X}
はい
{\displaystyle Y}
私
⊆
R
{\displaystyle I\subseteq \mathbb {R} }
ふ
バツ
(
x
)
=
ポ
(
バツ
≤
x
)
{\displaystyle F_{X}(x)=\operatorname {P} (X\leq x)}
ふ
はい
(
ええ
)
=
ポ
(
はい
≤
ええ
)
{\displaystyle F_{Y}(y)=\オペレーター名 {P} (Y\leq y)}
バツ
{\displaystyle X}
はい
{\displaystyle Y}
ふ
バツ
、
はい
(
x
、
ええ
)
=
ポ
(
バツ
≤
x
∧
はい
≤
ええ
)
{\displaystyle F_{X,Y}(x,y)=\operatorname {P} (X\leq x\land Y\leq y)}
2つの確率変数 と が 同一分布する 場合、かつその場合のみ [6] 。
バツ
{\displaystyle X}
はい
{\displaystyle Y}
ふ
バツ
(
x
)
=
ふ
はい
(
x
)
∀
x
∈
私
{\displaystyle F_{X}(x)=F_{Y}(x)\,\forall x\in I}
2 つの確率変数 および は、 の場合に限り 独立 です 。(詳細については、 「独立性 (確率論)」§「2 つの確率変数 」 を参照してください。)
バツ
{\displaystyle X}
はい
{\displaystyle Y}
ふ
バツ
、
はい
(
x
、
ええ
)
=
ふ
バツ
(
x
)
⋅
ふ
はい
(
ええ
)
∀
x
、
ええ
∈
私
{\displaystyle F_{X,Y}(x,y)=F_{X}(x)\cdot F_{Y}(y)\,\forall x,y\in I}
2つの確率変数 とが 独立 かつ同一分布に従う場合 、 すなわち
、
バツ
{\displaystyle X}
はい
{\displaystyle Y}
2つ以上のランダム変数の定義
この定義は、2つ以上のランダム変数にも自然に拡張されます。 ランダム変数 が 独立 (詳細は 独立性(確率論)§ 2つ以上のランダム変数を 参照) かつ 同一分布に従う場合、すなわち、
ん
{\displaystyle n}
バツ
1
、
…
、
バツ
ん
{\displaystyle X_{1},\ldots ,X_{n}}
方程式
ここで は の結合累積分布関数を表します 。
F
X
1
,
…
,
X
n
(
x
1
,
…
,
x
n
)
=
P
(
X
1
≤
x
1
∧
…
∧
X
n
≤
x
n
)
{\displaystyle F_{X_{1},\ldots ,X_{n}}(x_{1},\ldots ,x_{n})=\operatorname {P} (X_{1}\leq x_{1}\land \ldots \land X_{n}\leq x_{n})}
X
1
,
…
,
X
n
{\displaystyle X_{1},\ldots ,X_{n}}
独立の定義
確率論では、2 つの事象 と は 、 の場合にのみ独立しているといいます 。以下では、 は の略です 。
A
{\textstyle \color {red}A}
B
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}\color {Green}B}
P
(
A
a
n
d
B
)
=
P
(
A
)
P
(
B
)
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}P({\color {red}A}\ \mathrm {and} \ {\color {green}B})=P({\color {red}A})P({\color {green}B})}
P
(
A
B
)
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}P({\color {red}A}{\color {green}B})}
P
(
A
a
n
d
B
)
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}P({\color {red}A}\ \mathrm {and} \ {\color {green}B})}
実験の 2 つのイベント、 およびがあるとします 。 の場合 、 の可能性があります 。一般に、 の発生は の確率に影響を及ぼします 。これを条件付き確率と呼びます。さらに、 の発生が の 発生に影響を及ぼさない場合にのみ 、 が存在します 。
A
{\textstyle \color {red}A}
B
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}\color {Green}B}
P
(
A
)
>
0
{\textstyle P({\color {red}A})>0}
P
(
B
|
A
)
{\textstyle P({\color {green}B}|{\color {red}A})}
A
{\textstyle \color {red}A}
B
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}\color {Green}B}
A
{\textstyle \color {red}A}
B
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}\color {Green}B}
P
(
B
|
A
)
=
P
(
B
)
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}P({\color {green}B}|{\color {red}A})=P({\color {green}B})}
注: および の場合、 と は 相互に独立しており、同時に相互に非互換であることを示すことはできません。つまり、独立性は互換性があり、相互排他性は関連している必要があります。
P
(
A
)
>
0
{\textstyle P({\color {red}A})>0}
P
(
B
)
>
0
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}P({\color {Green}B})>0}
A
{\textstyle \color {red}A}
B
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}\color {Green}B}
、、 およびが 3 つのイベントであるとします。、、、およびが満たされる場合 、 イベント 、、 および は 相互 に 独立しています。
A
{\textstyle \color {red}A}
B
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}\color {Green}B}
C
{\textstyle \definecolor {blue}{rgb}{0,0,1}\color {blue}C}
P
(
A
B
)
=
P
(
A
)
P
(
B
)
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}P({\color {red}A}{\color {green}B})=P({\color {red}A})P({\color {green}B})}
P
(
B
C
)
=
P
(
B
)
P
(
C
)
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}\definecolor {blue}{rgb}{0,0,1}\definecolor {Blue}{rgb}{0,0,1}P({\color {green}B}{\color {blue}C})=P({\color {green}B})P({\color {blue}C})}
P
(
A
C
)
=
P
(
A
)
P
(
C
)
{\textstyle \definecolor {blue}{rgb}{0,0,1}P({\color {red}A}{\color {blue}C})=P({\color {red}A})P({\color {blue}C})}
P
(
A
B
C
)
=
P
(
A
)
P
(
B
)
P
(
C
)
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}\definecolor {blue}{rgb}{0,0,1}\definecolor {Blue}{rgb}{0,0,1}P({\color {red}A}{\color {green}B}{\color {blue}C})=P({\color {red}A})P({\color {green}B})P({\color {blue}C})}
A
{\textstyle \color {red}A}
B
{\textstyle \definecolor {Green}{rgb}{0,0.5019607843137255,0}\definecolor {green}{rgb}{0,0.5019607843137255,0}\color {Green}B}
C
{\textstyle \definecolor {blue}{rgb}{0,0,1}\color {blue}C}
より一般的な定義は 、イベントが存在するというものです 。任意のイベントの積イベントの確率が 各イベントの確率の積に等しい場合、イベントは 互いに独立しています。
n
{\textstyle n}
A
1
,
A
2
,
…
,
A
n
{\textstyle {\color {red}A}_{1},{\color {red}A}_{2},\ldots ,{\color {red}A}_{n}}
2
,
3
,
…
,
n
{\textstyle 2,3,\ldots ,n}
A
1
,
A
2
,
…
,
A
n
{\textstyle {\color {red}A}_{1},{\color {red}A}_{2},\ldots ,{\color {red}A}_{n}}
例
例1
公正または不公正なルーレット ホイール のスピンの結果のシーケンスは iid です。このことの 1 つの意味は、ルーレットのボールが、たとえば 20 回連続して「赤」に止まった場合、次のスピンが「黒」になる可能性は、他のスピンの場合と同程度またはそれ以下であるということです ( ギャンブラーの誤謬を 参照)。
例2
コインを 10 回投げて、表が出た回数を記録します。
独立 – 着陸の各結果は他の結果に影響を与えません。つまり、10 個の結果は互いに独立しています。
同一に分布 – コインが公平であるか(表が出る確率が 1/2)不公平であるかに関係なく、各トスに同じコインが使用されている限り、各トスには他のトスと同じ確率が設定されます。
このような 2 つの可能な iid 結果のシーケンスは、 ベルヌーイ過程 とも呼ばれます。
例3
サイコロを 10 回振って、結果が 1 になった回数を記録します。
独立 – サイコロを振った各結果は次の結果に影響を与えません。つまり、10 個の結果は互いに独立しています。
同一に分布 – サイコロが公平か重み付けされているかに関係なく、各ロールの確率は他のロールと同じになります。対照的に、重み付けされているものと重み付けされていないものを含む 10 個の異なるサイコロを振っても、iid 変数は生成されません。
例4
52 枚のカードが入った標準的なトランプから 1 枚のカードを選び、そのカードをトランプに戻します。これを 52 回繰り返します。出現したキングの数を記録します。
独立 – カードの各結果は次の結果に影響を与えません。つまり、52 の結果は互いに独立しています。対照的に、引かれた各カードがデッキから除外されている場合、その後の引きはそれの影響を受け (1 枚のキングを引くと 2 枚目のキングを引く可能性が低くなります)、結果は独立しなくなります。
同一に分布 – カードを 1 枚引いた後、毎回キングが出る確率は 4/52 です。つまり、確率は毎回同一です。
一般化
ランダム変数がiid であるという仮定の下で最初に証明された多くの結果は、 より弱い分布仮定の下でも真であることが示されています。
交換可能なランダム変数
iid 変数の主な特性を共有する最も一般的な概念は、 ブルーノ・デ・フィネッティ によって導入された 交換可能なランダム変数 です。 [ 要出典 ] 交換可能性とは、変数が独立ではない可能性がある一方で、将来の変数は過去の変数のように振る舞うことを意味します。正式には、有限シーケンスの任意の値は、 それらの値の任意の 順列と同じ可能性があります。 結合確率分布は 対称群 の下で不変です 。
これは便利な一般化を提供します。たとえば、 非復元サンプリングは 独立ではありませんが、交換可能です。
レヴィ過程
確率論 では、iid 変数は 離散時間 レヴィ過程 として考えられます。つまり、各変数は、ある時点から別の時点までにどれだけ変化するかを示します。たとえば、一連のベルヌーイ試行は、 ベルヌーイ過程 として解釈されます 。
これを一般化して連続時間レヴィ過程 を含めることもできます 。また、多くのレヴィ過程は iid 変数の極限として考えることができます。たとえば、 ウィーナー過程は ベルヌーイ過程の極限です。
機械学習では
機械学習 (ML) では、データ内の統計的関係を学習します。ML モデルを効果的にトレーニングするには、広く一般化できるデータを使用することが重要です。 トレーニング データが タスクを十分に代表していない場合、新しい未知のデータに対するモデルのパフォーマンスが低下する可能性があります。
iid 仮説により、トレーニング サンプルに必要な個々のケースの数を大幅に削減できるため、最適化の計算が簡素化されます。最適化問題では、独立かつ同一の分布を仮定すると、尤度関数の計算が簡素化されます。この仮定により、尤度関数は次のように表すことができます。
l
(
θ
)
=
P
(
x
1
,
x
2
,
x
3
,
.
.
.
,
x
n
|
θ
)
=
P
(
x
1
|
θ
)
P
(
x
2
|
θ
)
P
(
x
3
|
θ
)
.
.
.
P
(
x
n
|
θ
)
{\displaystyle l(\theta )=P(x_{1},x_{2},x_{3},...,x_{n}|\theta )=P(x_{1}|\theta )P(x_{2}|\theta )P(x_{3}|\theta )...P(x_{n}|\theta )}
観測されたイベントの確率を最大化するために、log関数を適用してパラメータを最大化します 。具体的には、次の式を計算します。
θ
{\textstyle \theta }
a
r
g
m
a
x
θ
log
(
l
(
θ
)
)
{\displaystyle \mathop {\rm {argmax}} \limits _{\theta }\log(l(\theta ))}
どこ
log
(
l
(
θ
)
)
=
log
(
P
(
x
1
|
θ
)
)
+
log
(
P
(
x
2
|
θ
)
)
+
log
(
P
(
x
3
|
θ
)
)
+
.
.
.
+
log
(
P
(
x
n
|
θ
)
)
{\displaystyle \log(l(\theta ))=\log(P(x_{1}|\theta ))+\log(P(x_{2}|\theta ))+\log(P(x_{3}|\theta ))+...+\log(P(x_{n}|\theta ))}
コンピュータは複数の加算を非常に効率的に実行しますが、乗算はそれほど効率的ではありません。この簡略化により、計算効率が向上します。最大化のプロセスでは、対数変換によって多くの指数関数が線形関数に変換されます。
この仮説が中心極限定理 (CLT)
で実際に役立つ主な理由は 2 つあります。
サンプルが複雑な非 ガウス分布 から生成された場合でも、CLT によってガウス分布に簡略化できるため、十分に近似できます (「観測可能なサンプルが多数ある場合、多くのランダム変数の合計はほぼ正規分布になります」)。
2 つ目の理由は、モデルの精度は、モデル ユニットのシンプルさと表現力、およびデータの品質に依存するということです。ユニットがシンプルであれば、解釈と拡張が容易になり、表現力と拡張性によりモデルの精度が向上します。たとえば、ディープ ニューラル ネットワーク では、各ニューロンはシンプルでありながら強力な表現力を備えており、レイヤーごとに複雑な特徴を捉えてモデルの精度を高めます。
参照
参考文献
^ Clauset, Aaron (2011). 「確率分布に関する簡単な入門書」 (PDF) 。 サンタフェ研究所 。 2012年1月20日時点の オリジナル (PDF)からアーカイブ。 2011年11月29日 閲覧 。
^ Stephanie (2016-05-11). 「IID 統計: 独立分布と同一分布の定義と例」。 統計ハウツー 。2021-12-09 に閲覧 。
^ ハンペル、フランク(1998)、「統計学は難しすぎるか?」、 カナダ統計学ジャーナル 、 26 (3):497–513、 doi :10.2307/3315772、 hdl : 20.500.11850/145503 、 JSTOR 3315772、 S2CID 53117661 (§8)。
^ Blum, JR; Chernoff, H.; Rosenblatt, M.; Teicher, H. (1958). 「交換可能なプロセスの中心極限定理」. Canadian Journal of Mathematics . 10 : 222–229. doi : 10.4153/CJM-1958-026-0 . S2CID 124843240.
^ Cover, TM; Thomas, JA (2006). 情報理論の要素 . Wiley-Interscience . pp. 57–58. ISBN 978-0-471-24195-9 。
^ カセラ&バーガー 2002、定理 1.5.10
さらに読む