一般化極値分布の特殊なケース
確率論 と 統計学 において 、 ガンベル分布( I 型 一般化極値分布 とも呼ばれる )は、さまざまな分布のサンプル数の最大値(または最小値)の分布をモデル化するために使用されます。
この分布は、過去 10 年間の最大値のリストがある場合、特定の年の河川の最大水位の分布を表すために使用できます。これは、極端な地震、洪水、またはその他の自然災害が発生する可能性を予測するのに役立ちます。最大値の分布を表すためのガンベル分布の潜在的な適用性は、 極値理論 に関連しており、基礎となるサンプル データの分布が正規型または指数型である場合に有効である可能性が高いことを示しています。 [a]
ガンベル分布は、一般化極値分布 (フィッシャー・ティペット分布とも呼ばれる) の特殊なケースです。また、 対数 ワイブル分布 や 二重指数分布( ラプラス分布 を指すために使用される用語)とも呼ばれます。これは ゴンペルツ分布 と関連しており 、密度を最初に原点を中心に反射し、次に正の半直線に制限すると、ゴンペルツ関数が得られます。
離散選択 理論で一般的な 多項ロジット モデルの 潜在変数 定式化では、潜在変数の誤差は Gumbel 分布に従います。これは、2 つの Gumbel 分布の ランダム変数の差が ロジスティック分布 を持つ ため便利です 。
ガンベル分布は 、分布を記述した最初の論文に基づいて、 エミール・ジュリアス・ガンベル(1891-1966)にちなんで名付けられました。 [1] [2]
定義
ガンベル分布の
累積分布関数 は
ふ
(
x
;
μ
、
β
)
=
e
−
e
−
(
x
−
μ
)
/
β
{\displaystyle F(x;\mu,\beta)=e^{-e^{-(x-\mu)/\beta}}\,}
標準ガンベル分布
標準ガンベル分布は 、 累積分布関数が
μ
=
0
{\displaystyle \mu =0}
β
=
1
{\displaystyle \beta =1}
ふ
(
x
)
=
e
−
e
(
−
x
)
{\displaystyle F(x)=e^{-e^{(-x)}}\,}
および確率密度関数
ふ
(
x
)
=
e
−
(
x
+
e
−
x
)
。
{\displaystyle f(x)=e^{-(x+e^{-x})}.}
この場合、最頻値は0、中央値は 、平均は ( オイラー・マスケロニ定数 )、標準偏差は
−
ln
(
ln
(
2
)
)
≈
0.3665
{\displaystyle -\ln(\ln(2))\approx 0.3665}
γ
≈
0.5772
{\displaystyle \gamma \approx 0.5772}
π
/
6
≈
1.2825.
{\displaystyle \pi /{\sqrt {6}}\approx 1.2825.}
n > 1の キュムラント は 次のように与えられる。
κ
n
=
(
n
−
1
)
!
ζ
(
n
)
.
{\displaystyle \kappa _{n}=(n-1)!\zeta (n).}
プロパティ
最頻値はμ、中央値はμ 、平均はμで与えられる。
μ
−
β
ln
(
ln
2
)
,
{\displaystyle \mu -\beta \ln \left(\ln 2\right),}
E
(
X
)
=
μ
+
γ
β
{\displaystyle \operatorname {E} (X)=\mu +\gamma \beta }
、
ここで、 は オイラー・マスケローニ定数 です 。
γ
{\displaystyle \gamma }
標準偏差 は [ 3]
σ
{\displaystyle \sigma }
β
π
/
6
{\displaystyle \beta \pi /{\sqrt {6}}}
β
=
σ
6
/
π
≈
0.78
σ
.
{\displaystyle \beta =\sigma {\sqrt {6}}/\pi \approx 0.78\sigma .}
モードでは 、 の値は の値に関係なく に なります。
x
=
μ
{\displaystyle x=\mu }
F
(
x
;
μ
,
β
)
{\displaystyle F(x;\mu ,\beta )}
e
−
1
≈
0.37
{\displaystyle e^{-1}\approx 0.37}
β
.
{\displaystyle \beta .}
がパラメータを持つ iid Gumbel ランダム変数である 場合 、 もパラメータを持つ Gumbel ランダム変数です 。
G
1
,
.
.
.
,
G
k
{\displaystyle G_{1},...,G_{k}}
(
μ
,
β
)
{\displaystyle (\mu ,\beta )}
max
{
G
1
,
.
.
.
,
G
k
}
{\displaystyle \max\{G_{1},...,G_{k}\}}
(
μ
+
β
ln
k
,
β
)
{\displaystyle (\mu +\beta \ln k,\beta )}
がすべての自然数 と同じ分布に従う iid ランダム変数である 場合 、 は 必ずスケールパラメータ を持つ Gumbel 分布に従います (実際には、互いに素である k>1 の 2 つの異なる値だけを考えれば十分です)。
G
1
,
G
2
,
.
.
.
{\displaystyle G_{1},G_{2},...}
max
{
G
1
,
.
.
.
,
G
k
}
−
β
ln
k
{\displaystyle \max\{G_{1},...,G_{k}\}-\beta \ln k}
G
1
{\displaystyle G_{1}}
k
{\displaystyle k}
G
1
{\displaystyle G_{1}}
β
{\displaystyle \beta }
がガンベル分布に従う 場合、 Y が正であるか、または同等に X が負である 場合、 Y = − Xの条件付き分布は ゴンペルツ分布に従います。 Y の 累積分布関数 G は、 y > 0の 式によって、 X の累積分布関数 F と関連付けられます。 その結果、密度は次のように関連付けられます 。 ゴンペルツ密度は 、正の半直線に制限された反射ガンベル密度に比例します。 [4]
X
{\displaystyle X}
G
(
y
)
=
P
(
Y
≤
y
)
=
P
(
X
≥
−
y
∣
X
≤
0
)
=
(
F
(
0
)
−
F
(
−
y
)
)
/
F
(
0
)
{\displaystyle G(y)=P(Y\leq y)=P(X\geq -y\mid X\leq 0)=(F(0)-F(-y))/F(0)}
g
(
y
)
=
f
(
−
y
)
/
F
(
0
)
{\displaystyle g(y)=f(-y)/F(0)}
Xが 平均1の指数分布変数である 場合、−log( X )は標準ガンベル分布に従います。
と が独立である 場合 、 ( ロジスティック分布を 参照)。
X
∼
G
u
m
b
e
l
(
α
X
,
β
)
{\displaystyle X\sim \mathrm {Gumbel} (\alpha _{X},\beta )}
Y
∼
G
u
m
b
e
l
(
α
Y
,
β
)
{\displaystyle Y\sim \mathrm {Gumbel} (\alpha _{Y},\beta )}
X
−
Y
∼
L
o
g
i
s
t
i
c
(
α
X
−
α
Y
,
β
)
{\displaystyle X-Y\sim \mathrm {Logistic} (\alpha _{X}-\alpha _{Y},\beta )\,}
それにもかかわらず、が 独立であれば、 となる。これは、 (ここではオイラー・マスケロニ定数) に注目することで簡単にわかる 。代わりに、独立したガンベル確率変数の線形結合の分布は、GNIG分布とGIG分布で近似することができる。 [5]
X
,
Y
∼
G
u
m
b
e
l
(
α
,
β
)
{\displaystyle X,Y\sim \mathrm {Gumbel} (\alpha ,\beta )}
X
+
Y
≁
L
o
g
i
s
t
i
c
(
2
α
,
β
)
{\displaystyle X+Y\nsim \mathrm {Logistic} (2\alpha ,\beta )}
E
(
X
+
Y
)
=
2
α
+
2
β
γ
≠
2
α
=
E
(
L
o
g
i
s
t
i
c
(
2
α
,
β
)
)
{\displaystyle E(X+Y)=2\alpha +2\beta \gamma \neq 2\alpha =E\left(\mathrm {Logistic} (2\alpha ,\beta )\right)}
γ
{\displaystyle \gamma }
一般化多変量対数ガンマ分布 に関連する理論は、 ガンベル分布の多変量バージョンを提供します。
発生と応用
累積ガンベル分布の信頼帯 を用いた 10月の1日最大降雨量への 分布フィッティング。 [6]
ガンベルは、指数分布 に従う ランダム変数 のサンプルの 最大値(または最終 統計量 )からサンプルサイズの自然対数を引いた値は、サンプルサイズが増加するにつれてガンベル分布に近づくことを示しました [7] 。 [8]
具体的には、 の確率分布 とその累積分布を仮定します。 の実現値 のうちの最大値 が より小さくなる のは、すべての実現値が より小さい場合のみです 。したがって、最大値の累積分布は 次式を満たします。
ρ
(
x
)
=
e
−
x
{\displaystyle \rho (x)=e^{-x}}
x
{\displaystyle x}
Q
(
x
)
=
1
−
e
−
x
{\displaystyle Q(x)=1-e^{-x}}
N
{\displaystyle N}
x
{\displaystyle x}
X
{\displaystyle X}
X
{\displaystyle X}
x
~
{\displaystyle {\tilde {x}}}
P
(
x
~
−
log
(
N
)
≤
X
)
=
P
(
x
~
≤
X
+
log
(
N
)
)
=
[
Q
(
X
+
log
(
N
)
)
]
N
=
(
1
−
e
−
X
N
)
N
,
{\displaystyle P({\tilde {x}}-\log(N)\leq X)=P({\tilde {x}}\leq X+\log(N))=[Q(X+\log(N))]^{N}=\left(1-{\frac {e^{-X}}{N}}\right)^{N},}
そして、 が大きい場合 、右辺は次のように収束する。
N
{\displaystyle N}
e
−
e
(
−
X
)
.
{\displaystyle e^{-e^{(-X)}}.}
そのため、水文学 では 、ガンベル分布は、日降水量や河川流量の月間および年間の最大値などの変数を分析するために使用され、 [3] また、干ばつを説明するためにも使用されます。 [9]
ガンベルは、 事象の確率の 推定量 r ⁄ ( n +1) ( r はデータ系列内の観測値の順位、 n は観測値の総数) が、分布の 最頻値 の周りの 累積確率 の 不偏推定量であることも示しました。そのため、この推定量は プロット位置 としてよく使用されます 。
数論 において、ガンベル分布は 整数の ランダム分割における項の数 [10] や、最大 素数ギャップ と 素数コンステレーション 間の最大ギャップの傾向調整されたサイズを近似します。 [11]
クーポン収集の問題 に出てきます 。
ガンベルの再パラメータ化のトリック
機械学習 では 、ガンベル分布は カテゴリ分布からサンプルを生成するために時々使用されます。この手法は「ガンベルマックストリック」と呼ばれ、「 再パラメータ化トリック 」の特別な例です 。 [12]
詳細には、 を非負で全てがゼロではないものとし、を Gumbel(0, 1)の独立サンプルとすると、通常の積分により、 すなわち、
(
π
1
,
…
,
π
n
)
{\displaystyle (\pi _{1},\ldots ,\pi _{n})}
g
1
,
…
,
g
n
{\displaystyle g_{1},\ldots ,g_{n}}
P
r
(
j
=
arg
max
i
(
g
i
+
log
π
i
)
)
=
π
j
∑
i
π
i
{\displaystyle Pr(j=\arg \max _{i}(g_{i}+\log \pi _{i}))={\frac {\pi _{j}}{\sum _{i}\pi _{i}}}}
arg
max
i
(
g
i
+
log
π
i
)
∼
Categorical
(
π
j
∑
i
π
i
)
j
{\displaystyle \arg \max _{i}(g_{i}+\log \pi _{i})\sim {\text{Categorical}}\left({\frac {\pi _{j}}{\sum _{i}\pi _{i}}}\right)_{j}}
同様に、任意の が与えられた場合 、その ボルツマン分布 から次のように
サンプルすることができる。
x
1
,
.
.
.
,
x
n
∈
R
{\displaystyle x_{1},...,x_{n}\in \mathbb {R} }
P
r
(
j
=
arg
max
i
(
g
i
+
x
i
)
)
=
e
x
j
∑
i
e
x
i
{\displaystyle Pr(j=\arg \max _{i}(g_{i}+x_{i}))={\frac {e^{x_{j}}}{\sum _{i}e^{x_{i}}}}}
関連する方程式には以下が含まれる: [13]
もし ならば 。
x
∼
Exp
(
λ
)
{\displaystyle x\sim \operatorname {Exp} (\lambda )}
(
−
ln
x
−
γ
)
∼
Gumbel
(
−
γ
+
ln
λ
,
1
)
{\displaystyle (-\ln x-\gamma )\sim {\text{Gumbel}}(-\gamma +\ln \lambda ,1)}
arg
max
i
(
g
i
+
log
π
i
)
∼
Categorical
(
π
j
∑
i
π
i
)
j
{\displaystyle \arg \max _{i}(g_{i}+\log \pi _{i})\sim {\text{Categorical}}\left({\frac {\pi _{j}}{\sum _{i}\pi _{i}}}\right)_{j}}
。
max
i
(
g
i
+
log
π
i
)
∼
Gumbel
(
log
(
∑
i
π
i
)
,
1
)
{\displaystyle \max _{i}(g_{i}+\log \pi _{i})\sim {\text{Gumbel}}\left(\log \left(\sum _{i}\pi _{i}\right),1\right)}
つまり、ガンベル分布は最大安定分布族です。
E
[
max
i
(
g
i
+
β
x
i
)
]
=
log
(
∑
i
e
β
x
i
)
+
γ
.
{\displaystyle \mathbb {E} [\max _{i}(g_{i}+\beta x_{i})]=\log \left(\sum _{i}e^{\beta x_{i}}\right)+\gamma .}
ランダム変量生成
ガンベル分布の
分位関数(逆 累積分布関数 )は次のように与えられる。
Q
(
p
)
{\displaystyle Q(p)}
Q
(
p
)
=
μ
−
β
ln
(
−
ln
(
p
)
)
,
{\displaystyle Q(p)=\mu -\beta \ln(-\ln(p)),}
変量は パラメータを持つガンベル分布を持ち 、 ランダム変量は 区間上の 一様分布 から抽出されます 。
Q
(
U
)
{\displaystyle Q(U)}
μ
{\displaystyle \mu }
β
{\displaystyle \beta }
U
{\displaystyle U}
(
0
,
1
)
{\displaystyle (0,1)}
確率論文
ガンベル分布を組み込んだグラフ用紙。
ソフトウェアが登場する以前は、ガンベル分布を表すために確率論が使われていました (図を参照)。この確率論は累積分布関数の線形化に基づいています 。
F
{\displaystyle F}
−
ln
[
−
ln
(
F
)
]
=
x
−
μ
β
{\displaystyle -\ln[-\ln(F)]={\frac {x-\mu }{\beta }}}
この論文では、横軸は二重対数スケールで作成されています。縦軸は直線です。 論文の横軸に を、 縦軸に -変数をプロットすると、分布は傾き 1 の直線で表されます 。CumFreq などの分布フィッティング ソフトウェアが利用可能になると 、 分布 を プロットする作業が容易になりました。
F
{\displaystyle F}
x
{\displaystyle x}
/
β
{\displaystyle /\beta }
参照
注記
^ この記事では、ガンベル分布を使用して最大値の分布をモデル化します 。 最小値をモデル化するには、元の値の負の値を使用します。
参考文献
^ Gumbel、EJ (1935)、「Les valeurs extremes des distributions statistiques」 (PDF) 、 Annales de l'Institut Henri Poincaré 、 5 (2): 115–158
^ Gumbel EJ (1941). 「洪水流量の再現期間」. 数理統計年報、12、163–190。
^ ab Oosterbaan, RJ (1994). 「第 6 章 頻度と回帰分析」 (PDF) 。 Ritzema, HP (編) 排水原理と応用、出版物 16。 ワゲニンゲン、オランダ: 国際土地再生・改善研究所 (ILRI)。 pp. 175–224。 ISBN 90-70754-33-9 。
^ Willemse, WJ; Kaas, R. (2007). 「ゴンペルツの死亡率の法則の一般化による虚弱性に基づく死亡率モデルの合理的な再構築」 (PDF) . 保険: 数学と経済学 . 40 (3): 468. doi :10.1016/j.insmatheco.2006.07.003. 2017-08-09 に オリジナル (PDF)からアーカイブ 。 2019-09-24 に取得。
^ Marques, F.; Coelho, C.; de Carvalho, M. (2015). 「独立した Gumbel ランダム変数の線形結合の分布について」 (PDF) . 統計とコンピューティング . 25 (3): 683‒701. doi :10.1007/s11222-014-9453-5. S2CID 255067312.
^ 「CumFreq、確率の分布フィッティング、無料計算機」 。www.waterlog.info 。
^ 「ガンベル分布と指数分布」。Mathematics Stack Exchange 。
^ Gumbel, EJ (1954). 極値の統計理論といくつかの実際的な応用。応用数学シリーズ。第33巻(第1版)。米国商務省、国立標準局。ASIN B0007DSHG4 。
^ Burke, Eleanor J.; Perry, Richard HJ; Brown, Simon J. (2010). 「英国の干ばつの極値分析と将来の変化の予測」 Journal of Hydrology . 388 (1–2): 131–143. Bibcode :2010JHyd..388..131B. doi :10.1016/j.jhydrol.2010.04.035.
^エルデシュ、ポール; レーナー、ジョセフ ( 1941 )。「正の整数の分割における被加数の分布」 デューク数学ジャーナル 。8 (2): 335。doi :10.1215/S0012-7094-41-00826-8。
^ Kourbatov, A. (2013). 「素数 k 組間の最大ギャップ : 統計的アプローチ」 Journal of Integer Sequences . 16 . arXiv : 1301.2242 . Bibcode :2013arXiv1301.2242K. 第13.5.2条
^ Jang, Eric; Gu, Shixiang; Poole, Ben (2017 年 4 月)。Gumble-Softmax によるカテゴリカル再パラメータ化。国際学習表現会議 (ICLR) 2017。
^ Balog, Matej; Tripuraneni, Nilesh; Ghahramani, Zoubin; Weller, Adrian (2017-07-17). 「Lost Relatives of the Gumbel Trick」. 国際機械学習会議 . PMLR: 371–379. arXiv : 1706.04161 .
外部リンク