定義
確率密度関数 密度関数の対数がどのように変化するかを示すK = 3 {\displaystyle K=3} ベクトルを変更するとα {\displaystyle {\boldsymbol {\alpha }}} からα = ( 0.3 、 0.3 、 0.3 ) {\displaystyle {\boldsymbol {\alpha }}=(0.3,0.3,0.3)} に( 2.0 、 2.0 、 2.0 ) {\displaystyle (2.0,2.0,2.0)} すべての個人を保持α 私 \displaystyle \alpha _{i}} 互いに等しい。 次数ディリクレ分布K ≥ 2 {\displaystyle K\geq 2} パラメータ付きα 1 、 … 、 α K > 0 {\displaystyle \alpha _{1},\ldots ,\alpha _{K}>0} 確率密度関数 は次のように与えられる。
f ( x 1 、 … 、 x K ; α 1 、 … 、 α K ) = 1 B ( α ) ∏ 私 = 1 K x 私 α 私 − 1 ${\displaystyle f\left(x_{1},\ldots ,x_{K};\alpha _{1},\ldots ,\alpha _{K}\right)={\frac {1}{\mathrm {B} ({\boldsymbol {\alpha }})}}\prod _{i=1}^{K}x_{i}^{\alpha _{i}-1}}$ どこx 私 ∈ [ 0 、 1 ] すべての人々のために 私 ∈ { 1 、 … 、 K } そして ∑ 私 = 1 K x 私 = 1 。 すべての }}i\in \{1,\dots ,K\}{\mbox{ および }}\sum _{i=1}^{K}x_{i}=1\,.} に対して、$\displaystyle x_{i}\in \left[0,1\right]{\mbox{ \}$ が成り立つ。 つまり、確率密度関数は標準で定義されるK − 1 {\displaystyle K-1} 単体 が埋め込まれている K {\displaystyle K} 次元 ユークリッド空間 、R K \displaystyle \mathbb {R} ^{K}} 。
正規化定数 は多変量ベータ関数であり、 ガンマ関数 を用いて次のように表すことができる。
B ( α ) = ∏ 私 = 1 K Γ ( α 私 ) Γ ( ∑ 私 = 1 K α 私 ) 、 α = ( α 1 、 … 、 α K ) 。 {\displaystyle \mathrm {B} ({\boldsymbol {\alpha }})={\frac {\prod \limits _{i=1}^{K}\Gamma (\alpha _{i})}{\Gamma \left(\sum \limits _{i=1}^{K}\alpha _{i}\right)}},\qquad {\boldsymbol {\alpha }}=(\alpha _{1},\ldots ,\alpha _{K}).}
対称的なケース 一般的な特殊ケースとして、パラメータベクトルα を構成するすべての要素が同じ値を持つ対称ディリクレ分布が あります。対称ケースは、例えば、成分に対するディリクレ事前分布が必要な場合で、ある成分が別の成分よりも優先されるという事前知識がない場合に役立ちます。パラメータベクトルのすべての要素が同じ値を持つため、対称ディリクレ分布は、集中パラメータ と呼ばれる単一のスカラー値αでパラメータ化できます 。α に関して、密度関数は次の形式になります。
f ( x 1 、 … 、 x K ; α ) = Γ ( α K ) Γ ( α ) K ∏ 私 = 1 K x 私 α − 1 。 {\displaystyle f(x_{1},\dots ,x_{K};\alpha )={\frac {\Gamma (\alpha K)}{\Gamma (\alpha )^{K}}}\prod _{i=1}^{K}x_{i}^{\alpha -1}.}
α = 1 の 場合、 対称ディリクレ分布は、開標準( K -1) 単体 上の均一分布と等価であり、つまり、そのサポート 内のすべての点で均一です。この特定の分布は、フラットディリクレ分布 として知られています。集中パラメータの値が 1 より大きい場合、密で均等に分布した変量 が好まれます。つまり、単一のサンプル内のすべての値が互いに類似しています。集中パラメータの値が 1 より小さい場合、疎な分布が好まれます。つまり、単一のサンプル内のほとんどの値は 0 に近く、質量の大部分は少数の値に集中します。
α = 1/2 の場合、分布は、 ( K − 1) 次元単位超球面 (K 次元単位超球 の表面)から一様にランダムに点を選択し、各座標を二乗することによって得られる分布と同じになります。α = 1/2 の 分布 は、ディリクレ分布のジェフリーズ事前 分布です。
不動産
瞬間 させてX = ( X 1 、 … 、 X K ) ~ ディレクトリ ( α ) {\displaystyle X=(X_{1},\ldots ,X_{K})\sim \operatorname {Dir} ({\boldsymbol {\alpha }})} 。
させて
α 0 = ∑ 私 = 1 K α 私 。 {\displaystyle \alpha _{0}=\sum _{i=1}^{K}\alpha _{i}.}
それから[ 5 ] [ 6 ]
E [ X 私 ] = α 私 α 0 、 {\displaystyle \operatorname {E} [X_{i}]={\frac {\alpha _{i}}{\alpha _{0}}},} バラ [ X 私 ] = α 私 ( α 0 − α 私 ) α 0 2 ( α 0 + 1 ) 。 {\displaystyle \operatorname {Var} [X_{i}]={\frac {\alpha _{i}(\alpha _{0}-\alpha _{i})}{\alpha _{0}^{2}(\alpha _{0}+1)}}.}
さらに、もし私 ≠ j {\displaystyle i\neq j}
カバー [ X 私 、 X j ] = − α 私 α j α 0 2 ( α 0 + 1 ) 。 {\displaystyle \operatorname {Cov} [X_{i},X_{j}]={\frac {-\alpha _{i}\alpha _{j}}{\alpha _{0}^{2}(\alpha _{0}+1)}}.}
共分散行列は特異行列 である。
より一般的には、ディリクレ分布に従う確率変数のモーメントは次のように表すことができます。t = ( t 1 、 … 、 t K ) ∈ R K {\displaystyle {\boldsymbol {t}}=(t_{1},\dotsc ,t_{K})\in \mathbb {R} ^{K}} 、と表記するt ∘ 私 = ( t 1 私 、 … 、 t K 私 ) {\displaystyle {\boldsymbol {t}}^{\circ i}=(t_{1}^{i},\dotsc ,t_{K}^{i})} そのi 番目のアダマール乗 。次に、[ 7 ]
E [ ( t ⋅ X ) n ] = n ! Γ ( α 0 ) Γ ( α 0 + n ) ∑ t 1 k 1 ⋯ t K k K k 1 ! ⋯ k K ! ∏ 私 = 1 K Γ ( α 私 + k 私 ) Γ ( α 私 ) = n ! Γ ( α 0 ) Γ ( α 0 + n ) Z n ( t ∘ 1 ⋅ α 、 ⋯ 、 t ∘ n ⋅ α ) 、 {\displaystyle \operatorname {E} \left[({\boldsymbol {t}}\cdot {\boldsymbol {X}})^{n}\right]={\frac {n!\,\Gamma (\alpha _{0})}{\Gamma (\alpha _{0}+n)}}\sum {\frac {{t_{1}}^{k_{1}}\cdots {t_{K}}^{k_{K}}}{k_{1}!\cdots k_{K}!}}\prod _{i=1}^{K}{\frac {\Gamma (\alpha _{i}+k_{i})}{\Gamma (\alpha _{i})}}={\frac {n!\,\Gamma (\alpha _{0})}{\Gamma (\alpha _{0}+n)}}Z_{n}({\boldsymbol {t}}^{\circ 1}\cdot {\boldsymbol {\alpha }},\cdots ,{\boldsymbol {t}}^{\circ n}\cdot {\boldsymbol {\alpha }}),}
ここで、和は非負整数に関するものである。k 1 、 … 、 k K {\displaystyle k_{1},\ldots ,k_{K}} とn = k 1 + ⋯ + k K {\displaystyle n=k_{1}+\cdots +k_{K}} 、 そしてZ n {\displaystyle Z_{n}} は次数n の対称群 のサイクル指数多項式 です。
特別なケースがありますE [ t ⋅ X ] = t ⋅ α α 0 。 {\displaystyle \operatorname {E} \left[{\boldsymbol {t}}\cdot {\boldsymbol {X}}\right]={\frac {{\boldsymbol {t}}\cdot {\boldsymbol {\alpha }}}{\alpha _{0}}}.}
多変数類似E [ ( t 1 ⋅ X ) n 1 ⋯ ( t q ⋅ X ) n q ] {\textstyle \operatorname {E} \left[({\boldsymbol {t}}_{1}\cdot {\boldsymbol {X}})^{n_{1}}\cdots ({\boldsymbol {t}}_{q}\cdot {\boldsymbol {X}})^{n_{q}}\right]} ベクトルの場合t 1 、 … 、 t q ∈ R K {\displaystyle {\boldsymbol {t}}_{1},\dotsc ,{\boldsymbol {t}}_{q}\in \mathbb {R} ^{K}} 指数の色パターンで表現できる[ 8 ] n 1 、 … 、 n q {\displaystyle n_{1},\dotsc ,n_{q}} ポリアの列挙定理 の意味において。
具体的な例としては、単純な計算[ 9 ]が挙げられる。
E [ ∏ 私 = 1 K X 私 β 私 ] = B ( α + β ) B ( α ) = Γ ( ∑ 私 = 1 K α 私 ) Γ [ ∑ 私 = 1 K ( α 私 + β 私 ) ] × ∏ 私 = 1 K Γ ( α 私 + β 私 ) Γ ( α 私 ) 。 {\displaystyle \operatorname {E} \left[\prod _{i=1}^{K}X_{i}^{\beta _{i}}\right]={\frac {B\left({\boldsymbol {\alpha }}+{\boldsymbol {\beta }}\right)}{B\left({\boldsymbol {\alpha }}\right)}}={\frac {\Gamma \left(\sum \limits _{i=1}^{K}\alpha _{i}\right)}{\Gamma \left[\sum \limits _{i=1}^{K}(\alpha _{i}+\beta _{i})\right]}}\times \prod _{i=1}^{K}{\frac {\Gamma (\alpha _{i}+\beta _{i})}{\Gamma (\alpha _{i})}}.}
モード 分布の最頻値 は[ 10 ]ベクトル ( x1 , ..., xK ) で、
x 私 = α 私 − 1 α 0 − K 、 α 私 > 1. {\displaystyle x_{i}={\frac {\alpha _{i}-1}{\alpha _{0}-K}},\qquad \alpha _{i}>1.}
周辺分布 周辺分布は ベータ分布 である:[ 11 ]
X 私 ~ ベータ ( α 私 、 α 0 − α 私 ) 。 {\displaystyle X_{i}\sim \operatorname {Beta} (\alpha _{i},\alpha _{0}-\alpha _{i}).}
下記の「 関連分布」 も参照してください。
カテゴリーまたは多項式に共役する ディリクレ分布は、カテゴリ分布 (可能な結果の数が与えられた一般的な離散確率分布)と 多項分布 (カテゴリ分布に従う観測値の集合における各カテゴリの観測値の出現回数の分布)の共役事前 分布です。つまり、データ点がカテゴリ分布または多項分布のいずれかを持ち、その分布のパラメータ(データ点を生成する確率ベクトル)の事前分布がディリクレ分布である場合、パラメータの 事後分布 もディリクレ分布になります。直感的に言えば、このような場合、データ点を観測する前にパラメータについて知っていることから始めて、データ点に基づいて知識を更新し、最終的に古い分布と同じ形式の新しい分布を得ることができます。つまり、数学的な困難に陥ることなく、新しい観測値を一つずつ取り入れることで、パラメータに関する知識を逐次的に更新できるということです。
形式的には、これは次のように表現できます。モデルが与えられた場合
α = ( α 1 、 … 、 α K ) = 濃度ハイパーパラメータ p ∣ α = ( p 1 、 … 、 p K ) ~ ディレクトリ ( K 、 α ) X ∣ p = ( x 1 、 … 、 x K ) ~ 猫 ( K 、 p ) {\displaystyle {\begin{array}{rcccl}{\boldsymbol {\alpha }}&=&\left(\alpha _{1},\ldots ,\alpha _{K}\right)&=&{\text{concentration hyperparameter}}\\\mathbf {p} \mid {\boldsymbol {\alpha }}&=&\left(p_{1},\ldots ,p_{K}\right)&\sim &\operatorname {Dir} (K,{\boldsymbol {\alpha }})\\\mathbb {X} \mid \mathbf {p} &=&\left(\mathbf {x} _{1},\ldots ,\mathbf {x} _{K}\right)&\sim &\operatorname {Cat} (K,\mathbf {p} )\end{array}}}
すると、以下のことが成り立つ。
c = ( c 1 、 … 、 c K ) = カテゴリの発生回数 私 p ∣ X 、 α ~ ディレクトリ ( K 、 c + α ) = ディレクトリ ( K 、 c 1 + α 1 、 … 、 c K + α K ) {\displaystyle {\begin{array}{rcccl}\mathbf {c} &=&\left(c_{1},\ldots ,c_{K}\right)&=&{\text{number of occurrences of category }}i\\\mathbf {p} \mid \mathbb {X} ,{\boldsymbol {\alpha }}&\sim &\operatorname {Dir} (K,\mathbf {c} +{\boldsymbol {\alpha }})&=&\operatorname {Dir} \left(K,c_{1}+\alpha _{1},\ldots ,c_{K}+\alpha _{K}\right)\end{array}}}
この関係は、ベイズ統計学において、 N 個のサンプルが与えられた場合にカテゴリカル分布 の基礎となるパラメータpを 推定するために使用されます。直感的には、超事前 ベクトルα を擬似カウント 、つまり既に観測された各カテゴリの観測数を表すものと見なすことができます。そして、すべての新しい観測値(ベクトルc )のカウントを単純に加算することで、事後分布を導出します。
ベイズ混合モデル や、混合成分を含むその他の階層型ベイズモデルでは、モデルに現れる カテゴリ変数 の事前分布として、ディリクレ分布が一般的に用いられます。詳細については、下記の応用例 のセクションを参照してください。
エントロピ X がディレクトリ ( α ) {\displaystyle \operatorname {Dir} ({\boldsymbol {\alpha }})} 確率変数X の微分エントロピー (nat単位 )は[ 12 ]である。
h ( X ) = E [ − ln f ( X ) ] = ln B ( α ) + ( α 0 − K ) ψ ( α 0 ) − ∑ j = 1 K ( α j − 1 ) ψ ( α j ) {\displaystyle h({\boldsymbol {X}})=\operatorname {E} [-\ln f({\boldsymbol {X}})]=\ln \operatorname {B} ({\boldsymbol {\alpha }})+(\alpha _{0}-K)\psi (\alpha _{0})-\sum _{j=1}^{K}(\alpha _{j}-1)\psi (\alpha _{j})}
どこψ {\displaystyle \psi } はディガンマ関数 です。
次の式はE [ ln ( X 私 ) ] {\displaystyle \operatorname {E} [\ln(X_{i})]} 上記の微分エントロピー を導出するために使用できます。ln ( X 私 ) {\displaystyle \ln(X_{i})} ディリクレ分布の十分統計量である指数族微分恒等式 を用いて、期待値の解析的表現を得ることができる。ln ( X 私 ) {\displaystyle \ln(X_{i})} ( [ 13 ] の式(2.62)を参照)およびそれに関連する共分散行列:
E [ ln ( X 私 ) ] = ψ ( α 私 ) − ψ ( α 0 ) {\displaystyle \operatorname {E} [\ln(X_{i})]=\psi (\alpha _{i})-\psi (\alpha _{0})}
そして
カバー [ ln ( X 私 ) 、 ln ( X j ) ] = ψ ′ ( α 私 ) δ 私 j − ψ ′ ( α 0 ) {\displaystyle \operatorname {Cov} [\ln(X_{i}),\ln(X_{j})]=\psi '(\alpha _{i})\delta _{ij}-\psi '(\alpha _{0})}
どこψ {\displaystyle \psi } はディガンマ関数 です。ψ ′ {\displaystyle \psi '} はトリガンマ関数 であり、δ 私 j {\displaystyle \delta _{ij}} はクロネッカーデルタ です。
以外の値に対するレニー情報 のスペクトルλ = 1 {\displaystyle \lambda =1} [ 14 ] で与えられる
F R ( λ ) = ( 1 − λ ) − 1 ( − λ ログ B ( α ) + ∑ 私 = 1 K ログ Γ ( λ ( α 私 − 1 ) + 1 ) − ログ Γ ( λ ( α 0 − K ) + K ) ) {\displaystyle F_{R}(\lambda )=(1-\lambda )^{-1}\left(-\lambda \log \mathrm {B} ({\boldsymbol {\alpha }})+\sum _{i=1}^{K}\log \Gamma (\lambda (\alpha _{i}-1)+1)-\log \Gamma (\lambda (\alpha _{0}-K)+K)\right)}
そして情報エントロピーは極限であり、λ {\displaystyle \lambda } 1になります。
関連するもう 1 つの興味深い尺度は、確率質量分布Xを持つ離散カテゴリカル (K 個のうちの 1 つ) ベクトル Z のエントロピーです。 P ( Z 私 = 1 、 Z j ≠ 私 = 0 | X ) = X 私 {\displaystyle P(Z_{i}=1,Z_{j\neq i}=0|{\boldsymbol {X}})=X_{i}} X が与えられたときのZ の条件付き情報エントロピー は
S ( X ) = H ( Z | X ) = E Z [ − ログ P ( Z | X ) ] = ∑ 私 = 1 K − X 私 ログ X 私 {\displaystyle S({\boldsymbol {X}})=H({\boldsymbol {Z}}|{\boldsymbol {X}})=\operatorname {E} _{\boldsymbol {Z}}[-\log P({\boldsymbol {Z}}|{\boldsymbol {X}})]=\sum _{i=1}^{K}-X_{i}\log X_{i}}
X のこの関数はスカラー確率変数です。Xが すべての 1 値を持つ対称ディリクレ分布に従う場合α 私 = α {\displaystyle \alpha _{i}=\alpha } エントロピーの期待値(nat単位 )は[ 15 ]です。
E [ S ( X ) ] = ∑ 私 = 1 K E [ − X 私 ln X 私 ] = ψ ( K α + 1 ) − ψ ( α + 1 ) {\displaystyle \operatorname {E} [S({\boldsymbol {X}})]=\sum _{i=1}^{K}\operatorname {E} [-X_{i}\ln X_{i}]=\psi (K\alpha +1)-\psi (\alpha +1)}
カルバック・ライブラー情報量2 つのディリクレ分布間のカルバック・ライブラー (KL) ダイバージェンス、 ディレクトリ ( α ) {\displaystyle {\text{Dir}}({\boldsymbol {\alpha }})} そしてディレクトリ ( β ) {\displaystyle {\text{Dir}}({\boldsymbol {\beta }})} 同じ単体上では、次のようになります。[ 16 ]
D K L ( D 私 r ( α ) ‖ D 私 r ( β ) ) = ログ Γ ( ∑ 私 = 1 K α 私 ) Γ ( ∑ 私 = 1 K β 私 ) + ∑ 私 = 1 K [ ログ Γ ( β 私 ) Γ ( α 私 ) + ( α 私 − β 私 ) ( ψ ( α 私 ) − ψ ( ∑ j = 1 K α j ) ) ] {\displaystyle {\begin{aligned}D_{\mathrm {KL} }{\big (}\mathrm {Dir} ({\boldsymbol {\alpha }})\,\|\,\mathrm {Dir} ({\boldsymbol {\beta }}){\big )}&=\log {\frac {\Gamma \left(\sum _{i=1}^{K}\alpha _{i}\right)}{\Gamma \left(\sum _{i=1}^{K}\beta _{i}\right)}}+\sum _{i=1}^{K}\left[\log {\frac {\Gamma (\beta _{i})}{\Gamma (\alpha _{i})}}+(\alpha _{i}-\beta _{i})\left(\psi (\alpha _{i})-\psi \left(\sum _{j=1}^{K}\alpha _{j}\right)\right)\right]\end{aligned}}}
集約 もし
X = ( X 1 、 … 、 X K ) ~ ディレクトリ ( α 1 、 … 、 α K ) {\displaystyle X=(X_{1},\ldots ,X_{K})\sim \operatorname {Dir} (\alpha _{1},\ldots ,\alpha _{K})}
次に、添え字i とj を持つ確率変数をベクトルから削除し、それらの合計に置き換えると、
X ′ = ( X 1 、 … 、 X 私 + X j 、 … 、 X K ) ~ ディレクトリ ( α 1 、 … 、 α 私 + α j 、 … 、 α K ) 。 {\displaystyle X'=(X_{1},\ldots ,X_{i}+X_{j},\ldots ,X_{K})\sim \operatorname {Dir} (\alpha _{1},\ldots ,\alpha _{i}+\alpha _{j},\ldots ,\alpha _{K}).}
この集計特性は、周辺分布を導出するために使用できます。X 私 {\displaystyle X_{i}} 上記で述べたとおり。
中立 もしX = ( X 1 、 … 、 X K ) ~ ディレクトリ ( α ) {\displaystyle X=(X_{1},\ldots ,X_{K})\sim \operatorname {Dir} ({\boldsymbol {\alpha }})} すると、ベクトルXは 中立で あると言われる[ 17 ]。 つまり、X K は X ( − K ) {\displaystyle X^{(-K)}} [ 3 ]
X ( − K ) = ( X 1 1 − X K 、 X 2 1 − X K 、 … 、 X K − 1 1 − X K ) 、 {\displaystyle X^{(-K)}=\left({\frac {X_{1}}{1-X_{K}}},{\frac {X_{2}}{1-X_{K}}},\ldots ,{\frac {X_{K-1}}{1-X_{K}}}\right),}
同様に、X 2 、 … 、 X K − 1 {\displaystyle X_{2},\ldots ,X_{K-1}} X の任意の順列も中立であることに注目してください(これは一般化ディリクレ分布 から抽出されたサンプルにはない性質です)。[ 18 ]
これを集約の性質と組み合わせると、X j + ... + X K は以下に依存しないことがわかる。( X 1 X 1 + ⋯ + X j − 1 、 X 2 X 1 + ⋯ + X j − 1 、 … 、 X j − 1 X 1 + ⋯ + X j − 1 ) {\displaystyle \left({\frac {X_{1}}{X_{1}+\cdots +X_{j-1}}},{\frac {X_{2}}{X_{1}+\cdots +X_{j-1}}},\ldots ,{\frac {X_{j-1}}{X_{1}+\cdots +X_{j-1}}}\right)} 実際、ディリクレ分布の場合、3 ≤ j ≤ K − 1 {\displaystyle 3\leq j\leq K-1} ペア( X 1 + ⋯ + X j − 1 、 X j + ⋯ + X K ) {\displaystyle \left(X_{1}+\cdots +X_{j-1},X_{j}+\cdots +X_{K}\right)} 、そして2つのベクトル( X 1 X 1 + ⋯ + X j − 1 、 X 2 X 1 + ⋯ + X j − 1 、 … 、 X j − 1 X 1 + ⋯ + X j − 1 ) {\displaystyle \left({\frac {X_{1}}{X_{1}+\cdots +X_{j-1}}},{\frac {X_{2}}{X_{1}+\cdots +X_{j-1}}},\ldots ,{\frac {X_{j-1}}{X_{1}+\cdots +X_{j-1}}}\right)} そして( X j X j + ⋯ + X K 、 X j + 1 X j + ⋯ + X K 、 … 、 X K X j + ⋯ + X K ) {\displaystyle \left({\frac {X_{j}}{X_{j}+\cdots +X_{K}}},{\frac {X_{j+1}}{X_{j}+\cdots +X_{K}}},\ldots ,{\frac {X_{K}}{X_{j}+\cdots +X_{K}}}\right)} 正規化されたランダムベクトルの3つ組として見た場合、 は互いに独立で ある。同様の結果は、インデックス{1, 2, ..., K } を他の任意の非単一要素部分集合のペアに分割する場合にも成り立つ。
特性関数 ディリクレ分布の特性関数は、ラウリセラ超幾何級数 の合流形式である。 フィリップス によって次のように与えられている[ 19 ]。
C F ( s 1 、 … 、 s K − 1 ) = E ( e 私 ( s 1 X 1 + ⋯ + s K − 1 X K − 1 ) ) = Ψ [ K − 1 ] ( α 1 、 … 、 α K − 1 ; α 0 ; 私 s 1 、 … 、 私 s K − 1 ) {\displaystyle CF\left(s_{1},\ldots ,s_{K-1}\right)=\operatorname {E} \left(e^{i\left(s_{1}X_{1}+\cdots +s_{K-1}X_{K-1}\right)}\right)=\Psi ^{\left[K-1\right]}(\alpha _{1},\ldots ,\alpha _{K-1};\alpha _{0};is_{1},\ldots ,is_{K-1})}
どこ
Ψ [ m ] ( 1 1 、 … 、 1 m ; c ; z 1 、 … z m ) = ∑ ( 1 1 ) k 1 ⋯ ( 1 m ) k m z 1 k 1 ⋯ z m k m ( c ) k k 1 ! ⋯ k m ! 。 {\displaystyle \Psi ^{[m]}(a_{1},\ldots ,a_{m};c;z_{1},\ldots z_{m})=\sum {\frac {(a_{1})_{k_{1}}\cdots (a_{m})_{k_{m}}\,z_{1}^{k_{1}}\cdots z_{m}^{k_{m}}}{(c)_{k}\,k_{1}!\cdots k_{m}!}}.}
和は非負整数に関するものです。k 1 、 … 、 k m {\displaystyle k_{1},\ldots ,k_{m}} そしてk = k 1 + ⋯ + k m {\displaystyle k=k_{1}+\cdots +k_{m}} フィリップスはさらに、この形式は「数値計算には不便」であると述べ、複素経路積分 による代替案を提示している。
Ψ [ m ] = Γ ( c ) 2 π 私 ∫ L e t t 1 1 + ⋯ + 1 m − c ∏ j = 1 m ( t − z j ) − 1 j d t {\displaystyle \Psi ^{[m]}={\frac {\Gamma (c)}{2\pi i}}\int _{L}e^{t}\,t^{a_{1}+\cdots +a_{m}-c}\,\prod _{j=1}^{m}(t-z_{j})^{-a_{j}}\,dt}
ここで、Lは 複素平面上の任意の経路を表し、− ∞ {\displaystyle -\infty } 被積分関数のすべての特異点を正の方向に囲み、− ∞ {\displaystyle -\infty } 。
不平等 確率密度関数f ( x 1 、 … 、 x K − 1 ; α 1 、 … 、 α K ) {\displaystyle f\left(x_{1},\ldots ,x_{K-1};\alpha _{1},\ldots ,\alpha _{K}\right)} ディリクレ分布のさまざまな境界を意味する多機能不等式において重要な役割を果たします。[ 20 ]
別の不等式は、ディリクレ分布のモーメント生成関数を、スケーリングされた逆カルバック・ライブラー情報量の凸共役と関連付けています。[ 21 ]
ログ E ( exp ∑ 私 = 1 K s 私 X 私 ) ≤ すする p ∑ 私 = 1 K ( p 私 s 私 − α 私 ログ ( α 私 α 0 p 私 ) ) 、 {\displaystyle \log \operatorname {E} \left(\exp {\sum _{i=1}^{K}s_{i}X_{i}}\right)\leq \sup _{p}\sum _{i=1}^{K}\left(p_{i}s_{i}-\alpha _{i}\log \left({\frac {\alpha _{i}}{\alpha _{0}p_{i}}}\right)\right),} ここで上限は、( K -1) 単体を張るp について取られる。
いつX = ( X 1 、 … 、 X K ) ~ ディレクトリ ( α 1 、 … 、 α K ) {\displaystyle {\boldsymbol {X}}=(X_{1},\ldots ,X_{K})\sim \operatorname {Dir} \left(\alpha _{1},\ldots ,\alpha _{K}\right)} 各成分の周辺分布X 私 ~ ベータ ( α 私 、 α 0 − α 私 ) {\displaystyle X_{i}\sim \operatorname {Beta} (\alpha _{i},\alpha _{0}-\alpha _{i})} ベータ分布 。特に、K = 2 の場合、X 1 ~ ベータ ( α 1 、 α 2 ) {\displaystyle X_{1}\sim \operatorname {Beta} (\alpha _{1},\alpha _{2})} と同等X = ( X 1 、 1 − X 1 ) ~ ディレクトリ ( α 1 、 α 2 ) {\displaystyle {\boldsymbol {X}}=(X_{1},1-X_{1})\sim \operatorname {Dir} \left(\alpha _{1},\alpha _{2}\right)} 。
K個 の独立に分布するガンマ分布 の場合:
Y 1 ~ ガンマ ( α 1 、 1 ) 、 … 、 Y K ~ ガンマ ( α K 、 1 ) {\displaystyle Y_{1}\sim \operatorname {Gamma} (\alpha _{1},1),\ldots ,Y_{K}\sim \operatorname {Gamma} (\alpha _{K},1)}
私たちは文章を書いていますα 0 := ∑ 私 = 1 K α 私 {\displaystyle \alpha _{0}:=\sum _{i=1}^{K}\limits \alpha _{i}} : [ 22 ] : 402
V = ∑ 私 = 1 K Y 私 ~ ガンマ ( α 0 、 1 ) 、 {\displaystyle V=\sum _{i=1}^{K}Y_{i}\sim \operatorname {Gamma} \left(\alpha _{0},1\right),} X = ( X 1 、 … 、 X K ) = ( Y 1 V 、 … 、 Y K V ) ~ ディレクトリ ( α 1 、 … 、 α K ) 。 {\displaystyle X=(X_{1},\ldots ,X_{K})=\left({\frac {Y_{1}}{V}},\ldots ,{\frac {Y_{K}}{V}}\right)\sim \operatorname {Dir} \left(\alpha _{1},\ldots ,\alpha _{K}\right).}
Xは 互いに独立ではありませんが、 K 個 の独立したガンマ 確率変数の集合から生成されることがわかります。[ 22 ] : 594残念ながら、 X を 形成する際に合計V が失われるため (実際には、 Vは X と確率的に独立であることが示されます)、これらの値だけでは元のガンマ確率変数を復元することはできません。しかし、独立した確率変数の方が扱いやすいため、この再パラメータ化はディリクレ分布の性質に関する証明には依然として役立ちます。
ディリクレ分布の共役事前分布 ディリクレ分布は指数族分布 であるため、共役事前分布を持ちます。共役事前分布は次の形式です。[ 23 ]
CD ( α ∣ v 、 η ) ∝ ( 1 B ( α ) ) η exp ( − ∑ k v k α k ) 。 {\displaystyle \operatorname {CD} ({\boldsymbol {\alpha }}\mid {\boldsymbol {v}},\eta )\propto \left({\frac {1}{\operatorname {B} ({\boldsymbol {\alpha }})}}\right)^{\eta }\exp \left(-\sum _{k}v_{k}\alpha _{k}\right).}
ここv {\displaystyle {\boldsymbol {v}}} はK 次元の実ベクトルであり、η {\displaystyle \eta } はスカラーパラメータです。 の定義域は( v 、 η ) {\displaystyle ({\boldsymbol {v}},\eta )} 上記の非正規化密度関数を正規化できるパラメータのセットに限定されます。必要かつ十分な条件は次のとおりです。[ 24 ]
∀ k v k > 0 そして η > − 1 そして ( η ≤ 0 または ∑ k exp − v k η < 1 ) {\displaystyle \forall k\;\;v_{k}>0\;\;\;\;{\text{ and }}\;\;\;\;\eta >-1\;\;\;\;{\text{ and }}\;\;\;\;(\eta \leq 0\;\;\;\;{\text{ or }}\;\;\;\;\sum _{k}\exp -{\frac {v_{k}}{\eta }}<1)}
共役特性は次のように表すことができます。
[事前 :α ~ CD ( ⋅ ∣ v 、 η ) {\displaystyle {\boldsymbol {\alpha }}\sim \operatorname {CD} (\cdot \mid {\boldsymbol {v}},\eta )} ] および [観察 :x ∣ α ~ ディリクレ ( ⋅ ∣ α ) {\displaystyle {\boldsymbol {x}}\mid {\boldsymbol {\alpha }}\sim \operatorname {Dirichlet} (\cdot \mid {\boldsymbol {\alpha }})} ] それから [後方 :α ∣ x ~ CD ( ⋅ ∣ v − ログ x 、 η + 1 ) {\displaystyle {\boldsymbol {\alpha }}\mid {\boldsymbol {x}}\sim \operatorname {CD} (\cdot \mid {\boldsymbol {v}}-\log {\boldsymbol {x}},\eta +1)} ]。 公開されている文献には、サンプルを効率的に生成するための実用的なアルゴリズムはありません。CD ( α ∣ v 、 η ) {\displaystyle \operatorname {CD} ({\boldsymbol {\alpha }}\mid {\boldsymbol {v}},\eta )} 。
対数確率のスケーリングと変換による一般化 前述のように、ディリクレ変量は独立なガンマ 変量を正規化することによって生成できます。代わりに一般化ガンマ 変量を正規化すると、単体一般化ベータ分布(SGB)の変量が得られます。[ 25 ] 一方、SGB変量は、ディリクレ変量のスケーリングおよび平行移動された対数にソフトマックス関数 を適用することによっても得られます。具体的には、x = ( x 1 、 … 、 x K ) ~ ディレクトリ ( α ) {\displaystyle \mathbf {x} =(x_{1},\ldots ,x_{K})\sim \operatorname {Dir} ({\boldsymbol {\alpha }})} そしてy = ( y 1 、 … 、 y K ) {\displaystyle \mathbf {y} =(y_{1},\ldots ,y_{K})} ここで、対数を要素ごとに適用します。 y = ソフトマックス ( 1 − 1 ログ x + ログ b ) ⟺ x = ソフトマックス ( 1 ログ y − 1 ログ b ) {\displaystyle \mathbf {y} =\operatorname {softmax} (a^{-1}\log \mathbf {x} +\log \mathbf {b} )\;\iff \;\mathbf {x} =\operatorname {softmax} (a\log \mathbf {y} -a\log \mathbf {b} )} または y k = b k x k 1 / 1 ∑ 私 = 1 K b 私 x 私 1 / 1 ⟺ x k = ( y k / b k ) 1 ∑ 私 = 1 K ( y 私 / b 私 ) 1 {\displaystyle y_{k}={\frac {b_{k}x_{k}^{1/a}}{\sum _{i=1}^{K}b_{i}x_{i}^{1/a}}}\;\iff \;x_{k}={\frac {(y_{k}/b_{k})^{a}}{\sum _{i=1}^{K}(y_{i}/b_{i})^{a}}}} どこ1 > 0 {\displaystyle a>0} そしてb = ( b 1 、 … 、 b K ) {\displaystyle \mathbf {b} =(b_{1},\ldots ,b_{K})} すべてb k > 0 {\displaystyle b_{k}>0} 、 それからy ~ SGB ( 1 、 b 、 α ) {\displaystyle \mathbf {y} \sim \operatorname {SGB} (a,\mathbf {b} ,{\boldsymbol {\alpha }})} SGB密度関数は、変換に注目することで導出できます。x ↦ y {\displaystyle \mathbf {x} \mapsto \mathbf {y} } これは単体から単体自身への全単射であり、以下 の微分体積変化係数 [ 26 ] を誘導する。 R ( y 、 1 、 b ) = 1 1 − K ∏ k = 1 K y k x k {\displaystyle R(\mathbf {y} ,a,\mathbf {b} )=a^{1-K}\prod _{k=1}^{K}{\frac {y_{k}}{x_{k}}}} そこでは、x {\displaystyle \mathbf {x} } 関数として回復されるy {\displaystyle \mathbf {y} } 上記のように、これによりSGB密度をディリクレ密度で表すことが容易になります。 f SGB ( y ∣ 1 、 b 、 α ) = f ディレクトリ ( x ∣ α ) R ( y 、 1 、 b ) {\displaystyle f_{\text{SGB}}(\mathbf {y} \mid a,\mathbf {b} ,{\boldsymbol {\alpha }})={\frac {f_{\text{Dir}}(\mathbf {x} \mid {\boldsymbol {\alpha }})}{R(\mathbf {y} ,a,\mathbf {b} )}}} 変数変換 によるディリクレ密度のこの一般化は正規化フロー と密接に関連しているが、微分体積変化はヤコビ行列 式では与えられない。x ↦ y : R K → R K {\displaystyle \mathbf {x} \mapsto \mathbf {y} :\mathbb {R} ^{K}\to \mathbb {R} ^{K}} これはゼロですが、ヤコビ行列式により( x 1 、 … 、 x K − 1 ) ↦ ( y 1 、 … 、 y K − 1 ) {\displaystyle (x_{1},\ldots ,x_{K-1})\mapsto \mathbf {(} y_{1},\ldots ,y_{K-1})} 詳細は「フローの正規化 § 単体フロー」 で説明されています。
ディリクレ形状パラメータ間の相互作用についてさらに詳しく知りたい場合は、α {\displaystyle {\boldsymbol {\alpha }}} 変換パラメータ1 、 b {\displaystyle a,\mathbf {b} } 対数周辺分布を考慮すると役立つかもしれません。ログ x k 1 − x k {\displaystyle \log {\frac {x_{k}}{1-x_{k}}}} これはロジスティックベータ分布に 従う。B σ ( α k 、 ∑ 私 ≠ k α 私 ) {\displaystyle B_{\sigma }(\alpha _{k},\sum _{i\neq k}\alpha _{i})} 特に、テール挙動 と位置およびスケールパラメータによる一般化 に関するセクションを参照してください。
乱数生成
ガンマ分布から ガンマ分布に従う乱数源があれば、簡単にランダムベクトルをサンプリングできる。x = ( x 1 、 … 、 x K ) {\displaystyle x=(x_{1},\ldots ,x_{K})} パラメータを持つK 次元ディリクレ分布から( α 1 、 … 、 α K ) {\displaystyle (\alpha _{1},\ldots ,\alpha _{K})} まず、K個 の独立したランダムサンプルを抽出します。y 1 、 … 、 y K {\displaystyle y_{1},\ldots ,y_{K}} ガンマ分布 からそれぞれ密度が
ガンマ ( α 私 、 1 ) = y 私 α 私 − 1 e − y 私 Γ ( α 私 ) 、 {\displaystyle \operatorname {Gamma} (\alpha _{i},1)={\frac {y_{i}^{\alpha _{i}-1}\;e^{-y_{i}}}{\Gamma (\alpha _{i})}},\!}
そして設定する
x 私 = y 私 ∑ j = 1 K y j 。 {\displaystyle x_{i}={\frac {y_{i}}{\sum _{j=1}^{K}y_{j}}}.}
[証拠]
独立にサンプリングされたガンマ変量の同時分布、{ y 私 } {\displaystyle \{y_{i}\}} は、積によって与えられます。
e − ∑ 私 y 私 ∏ 私 = 1 K y 私 α 私 − 1 Γ ( α 私 ) {\displaystyle e^{-\sum _{i}y_{i}}\prod _{i=1}^{K}{\frac {y_{i}^{\alpha _{i}-1}}{\Gamma (\alpha _{i})}}}
次に、変数変換を用いてパラメータ化します。{ y 私 } {\displaystyle \{y_{i}\}} に関してはy 1 、 y 2 、 … 、 y K − 1 {\displaystyle y_{1},y_{2},\ldots ,y_{K-1}} そして∑ 私 = 1 K y 私 {\displaystyle \sum _{i=1}^{K}y_{i}} 、そして変数変換を実行します y → x {\displaystyle y\to x} そのためx ¯ = ∑ 私 = 1 K y 私 、 x 1 = y 1 x ¯ 、 x 2 = y 2 x ¯ 、 … 、 x K − 1 = y K − 1 x ¯ {\displaystyle {\bar {x}}=\textstyle \sum _{i=1}^{K}y_{i},x_{1}={\frac {y_{1}}{\bar {x}}},x_{2}={\frac {y_{2}}{\bar {x}}},\ldots ,x_{K-1}={\frac {y_{K-1}}{\bar {x}}}} 各変数0 ≤ x 1 、 x 2 、 … 、 x k − 1 ≤ 1 {\displaystyle 0\leq x_{1},x_{2},\ldots ,x_{k-1}\leq 1} 同様に0 ≤ ∑ 私 = 1 K − 1 x 私 ≤ 1 {\displaystyle 0\leq \textstyle \sum _{i=1}^{K-1}x_{i}\leq 1} 変数変換の公式を使用する必要がある。P ( x ) = P ( y ( x ) ) | ∂ y ∂ x | {\displaystyle P(x)=P(y(x)){\bigg |}{\frac {\partial y}{\partial x}}{\bigg |}} その中で| ∂ y ∂ x | {\displaystyle {\bigg |}{\frac {\partial y}{\partial x}}{\bigg |}} は変換ヤコビアンである。yをxの関数として明示的に表すと、次のようになる。 y 1 = x ¯ x 1 、 y 2 = x ¯ x 2 … y K − 1 = x ¯ x K − 1 、 y K = x ¯ ( 1 − ∑ 私 = 1 K − 1 x 私 ) {\displaystyle y_{1}={\bar {x}}x_{1},y_{2}={\bar {x}}x_{2}\ldots y_{K-1}={\bar {x}}x_{K-1},y_{K}={\bar {x}}(1-\textstyle \sum _{i=1}^{K-1}x_{i})} ヤコビアンは次のようになります。 | x ¯ 0 … x 1 0 x ¯ … x 2 ⋮ ⋮ ⋱ ⋮ − x ¯ − x ¯ … 1 − ∑ 私 = 1 K − 1 x 私 | {\displaystyle {\begin{vmatrix}{\bar {x}}&0&\ldots &x_{1}\\0&{\bar {x}}&\ldots &x_{2}\\\vdots &\vdots &\ddots &\vdots \\-{\bar {x}}&-{\bar {x}}&\ldots &1-\sum _{i=1}^{K-1}x_{i}\end{vmatrix}}}
行列式は、ある行の倍数を別の行に追加しても変化しないことに注目し、最初の K-1 行をそれぞれ最下行に追加することで評価できます。
| x ¯ 0 … x 1 0 x ¯ … x 2 ⋮ ⋮ ⋱ ⋮ 0 0 … 1 | {\displaystyle {\begin{vmatrix}{\bar {x}}&0&\ldots &x_{1}\\0&{\bar {x}}&\ldots &x_{2}\\\vdots &\vdots &\ddots &\vdots \\0&0&\ldots &1\end{vmatrix}}}
最下段を中心に展開すると、行列式の値が得られます。x ¯ K − 1 {\displaystyle {\bar {x}}^{K-1}} 結合確率密度関数にxを代入し、ヤコビ行列式を含めると、次の式が得られる。
[ ∏ 私 = 1 K − 1 ( x ¯ x 私 ) α 私 − 1 ] [ x ¯ ( 1 − ∑ 私 = 1 K − 1 x 私 ) ] α K − 1 ∏ 私 = 1 K Γ ( α 私 ) x ¯ K − 1 e − x ¯ = Γ ( α ¯ ) [ ∏ 私 = 1 K − 1 ( x 私 ) α 私 − 1 ] [ 1 − ∑ 私 = 1 K − 1 x 私 ] α K − 1 ∏ 私 = 1 K Γ ( α 私 ) × x ¯ α ¯ − 1 e − x ¯ Γ ( α ¯ ) {\displaystyle {\begin{aligned}&{\frac {\left[\prod _{i=1}^{K-1}({\bar {x}}x_{i})^{\alpha _{i}-1}\right]\left[{\bar {x}}(1-\sum _{i=1}^{K-1}x_{i})\right]^{\alpha _{K}-1}}{\prod _{i=1}^{K}\Gamma (\alpha _{i})}}{\bar {x}}^{K-1}e^{-{\bar {x}}}\\=&{\frac {\Gamma ({\bar {\alpha }})\left[\prod _{i=1}^{K-1}(x_{i})^{\alpha _{i}-1}\right]\left[1-\sum _{i=1}^{K-1}x_{i}\right]^{\alpha _{K}-1}}{\prod _{i=1}^{K}\Gamma (\alpha _{i})}}\times {\frac {{\bar {x}}^{{\bar {\alpha }}-1}e^{-{\bar {x}}}}{\Gamma ({\bar {\alpha }})}}\end{aligned}}} どこα ¯ = ∑ 私 = 1 K α 私 {\displaystyle {\bar {\alpha }}=\textstyle \sum _{i=1}^{K}\alpha _{i}} 右辺は、ディリクレ分布の確率密度関数の積として認識できます。x 私 {\displaystyle x_{i}} そしてガンマ分布のPDFx ¯ {\displaystyle {\bar {x}}} 積の形から、ディリクレ変数とガンマ変数は独立であることがわかるので、後者は単純に省略することで積分消去でき、次の式が得られる。 x 1 、 x 2 、 … 、 x K − 1 ~ ( 1 − ∑ 私 = 1 K − 1 x 私 ) α K − 1 ∏ 私 = 1 K − 1 x 私 α 私 − 1 B ( α ) {\displaystyle x_{1},x_{2},\ldots ,x_{K-1}\sim {\frac {(1-\sum _{i=1}^{K-1}x_{i})^{\alpha _{K}-1}\prod _{i=1}^{K-1}x_{i}^{\alpha _{i}-1}}{B({\boldsymbol {\alpha }})}}}
これは、
∏ 私 = 1 K x 私 α 私 − 1 B ( α ) {\displaystyle {\frac {\prod _{i=1}^{K}x_{i}^{\alpha _{i}-1}}{B({\boldsymbol {\alpha }})}}} サポート付き∑ 私 = 1 K x 私 = 1 {\displaystyle \sum _{i=1}^{K}x_{i}=1}
以下は、サンプルを描画するためのPythonコードの例です。
params = [ a1 , a2 , ... , ak ] sample = [ random . gammavariate ( a , 1 ) for a in params ] sample = [ v / sum ( sample ) for v in sample ] この定式化は、ガンマ分布がどのようにパラメータ化されているか(形状/尺度か形状/レートか)に関わらず正しい。なぜなら、尺度とレートが1.0の場合、両者は等価だからである。
周辺ベータ分布から 効率の低いアルゴリズム[ 29 ] は、単変量周辺分布と条件付き分布がベータ分布であることを前提としており、以下のように進行する。シミュレーションx 1 {\displaystyle x_{1}} から
ベータ ( α 1 、 ∑ 私 = 2 K α 私 ) {\displaystyle {\textrm {Beta}}\left(\alpha _{1},\sum _{i=2}^{K}\alpha _{i}\right)}
次にシミュレーションを行うx 2 、 … 、 x K − 1 {\displaystyle x_{2},\ldots ,x_{K-1}} 順番に、以下のとおりです。j = 2 、 … 、 K − 1 {\displaystyle j=2,\ldots ,K-1} シミュレーションϕ j {\displaystyle \phi _{j}} から
ベータ ( α j 、 ∑ 私 = j + 1 K α 私 ) 、 {\displaystyle {\textrm {Beta}}\left(\alpha _{j},\sum _{i=j+1}^{K}\alpha _{i}\right),}
そして
x j = ( 1 − ∑ 私 = 1 j − 1 x 私 ) ϕ j 。 {\displaystyle x_{j}=\left(1-\sum _{i=1}^{j-1}x_{i}\right)\phi _{j}.}
最後に、
x K = 1 − ∑ 私 = 1 K − 1 x 私 。 {\displaystyle x_{K}=1-\sum _{i=1}^{K-1}x_{i}.}
この反復手順は、上述の「弦を切る」という直感と非常によく一致する。
以下は、サンプルを描画するためのPythonコードの例です。
params = [ a1 , a2 , ... , ak ] xs = [ random . betavariate ( params [ 0 ], sum ( params [ 1 :]))] for j in range ( 1 , len ( params ) - 1 ): phi = random . betavariate ( params [ j ], sum ( params [ j + 1 :])) xs . append (( 1 - sum ( xs )) * phi ) xs . append ( 1 - sum ( xs ))
各アルファが1の場合 α 1 = ... = α K = 1 の場合、分布からのサンプルは、区間[0, 1]から K − 1 個 の値を独立かつ一様にランダムに抽出し、そのセットに値0 と1を追加して K + 1 個の 値を持つようにし、そのセットをソートし、順序が隣接する値の各ペア間の差を計算してx 1 、 ...、x K を得ることによって見つけることができます。
各アルファが 1/2 で、超球との関係α 1 = ... = α K = 1/2 の場合、標準正規分布からK 個の値を独立にランダムに抽出し、これらの値を二乗し、それらの合計で割ることによって正規化することで、分布からの サンプル を 見つけることができ ます。
点( x 1 , ..., x K ) は、同様の手順で( K −1 ) 次元単位超球 (これはK 次元超球 の表面です) から一様にランダムに抽出できます。標準正規分布からK 個の値を独立にランダムに抽出し、それぞれの座標値を、それらの二乗の合計の平方根である定数で割ることによって正規化します。