統計学 において、混合モデル とは、観測データセットが 個々の観測値が属する部分集団を特定することを必要とせずに、全体集団内に部分集団 が存在することを表す確率モデル です。形式的には、混合モデルは全体集団における観測値の確率分布 を表す混合分布 に対応します。しかし、「混合分布」に関連する問題は、部分集団の特性から全体集団の特性を導き出すことに関係するのに対し、「混合モデル」は、部分集団の識別情報なしに、プールされた集団に関する観測値のみに基づいて、部分集団の特性について統計的推論を行うために使用されます。混合モデルは、 モデルベースクラスタリングという 名称でクラスタリングに使用されるほか、密度推定 にも使用されます。
混合モデルは、構成要素の合計が一定値(1、100%など)に制約される構成データ モデルと混同してはなりません。ただし、構成モデルは、母集団のメンバーがランダムにサンプリングされる混合モデルと考えることができます。逆に、混合モデルは、読者集団の総サイズ が1に正規化される構成モデルと考えることができます。
構造
一般混合モデル 典型的な有限次元混合モデルは、以下の構成要素からなる階層モデルである。
さらに、ベイズ的な設定 では、混合重みとパラメータ自体が確率変数となり、これらの変数には事前分布 が設定されます。このような場合、重みは通常、ディリクレ分布 (カテゴリカル分布の共役事前 分布)から抽出されたK 次元の確率ベクトルとみなされ、パラメータはそれぞれの共役事前分布に従って分布します。
数学的に、基本的なパラメトリック混合モデルは次のように記述できます。
K = 混合物の成分数 N = 観測数 θ 私 = 1 … K = コンポーネントに関連付けられた観測値の分布のパラメータ 私 ϕ 私 = 1 … K = 混合物の重み、すなわち特定の成分の事前確率 私 ϕ = K すべての個々の要素で構成される次元ベクトル ϕ 1 … K 合計は1でなければならない z 私 = 1 … N = 観察の構成要素 私 x 私 = 1 … N = 観察 私 F ( x | θ ) = 観測値の確率分布、パラメータ化 θ z 私 = 1 … N ~ カテゴリカル ( ϕ ) x 私 = 1 … N | z 私 = 1 … N ~ F ( θ z 私 ) {\displaystyle {\begin{array}{lcl}K&=&{\text{number of mixture components}}\\N&=&{\text{number of observations}}\\\theta _{i=1\dots K}&=&{\text{parameter of distribution of observation associated with component }}i\\\phi _{i=1\dots K}&=&{\text{mixture weight, i.e., prior probability of a particular component }}i\\{\boldsymbol {\phi }}&=&K{\text{-dimensional vector composed of all the individual }}\phi _{1\dots K}{\text{; must sum to 1}}\\z_{i=1\dots N}&=&{\text{component of observation }}i\\x_{i=1\dots N}&=&{\text{observation }}i\\F(x|\theta )&=&{\text{probability distribution of an observation, parametrized on }}\theta \\z_{i=1\dots N}&\sim &\operatorname {Categorical} ({\boldsymbol {\phi }})\\x_{i=1\dots N}|z_{i=1\dots N}&\sim &F(\theta _{z_{i}})\end{array}}} ベイズ統計の設定では、すべてのパラメータは以下のように確率変数に関連付けられます。
K 、 N = 上記のとおり θ 私 = 1 … K 、 ϕ 私 = 1 … K 、 ϕ = 上記のとおり z 私 = 1 … N 、 x 私 = 1 … N 、 F ( x | θ ) = 上記のとおり α = コンポーネントパラメータの共有ハイパーパラメータ β = 混合重みの共有ハイパーパラメータ H ( θ | α ) = コンポーネントパラメータの事前確率分布、パラメータ化 α θ 私 = 1 … K ~ H ( θ | α ) ϕ ~ S y m m e t r 私 c - D 私 r 私 c h l e t K ( β ) z 私 = 1 … N | ϕ ~ カテゴリカル ( ϕ ) x 私 = 1 … N | z 私 = 1 … N 、 θ 私 = 1 … K ~ F ( θ z 私 ) {\displaystyle {\begin{array}{lcl}K,N&=&{\text{as above}}\\\theta _{i=1\dots K},\phi _{i=1\dots K},{\boldsymbol {\phi }}&=&{\text{as above}}\\z_{i=1\dots N},x_{i=1\dots N},F(x|\theta )&=&{\text{as above}}\\\alpha &=&{\text{shared hyperparameter for component parameters}}\\\beta &=&{\text{shared hyperparameter for mixture weights}}\\H(\theta |\alpha )&=&{\text{prior probability distribution of component parameters, parametrized on }}\alpha \\\theta _{i=1\dots K}&\sim &H(\theta |\alpha )\\{\boldsymbol {\phi }}&\sim &\operatorname {Symmetric-Dirichlet} _{K}(\beta )\\z_{i=1\dots N}|{\boldsymbol {\phi }}&\sim &\operatorname {Categorical} ({\boldsymbol {\phi }})\\x_{i=1\dots N}|z_{i=1\dots N},\theta _{i=1\dots K}&\sim &F(\theta _{z_{i}})\end{array}}} この特性化では、F とHを用いて 、 それぞれ観測値とパラメータに関する任意の分布を記述します。通常、H は F の共役事前分布 となります。Fの最も一般的な選択肢は、ガウス分布 (実数値観測値の場合)とカテゴリ分布 (離散観測値の場合)です。混合成分の分布として考えられるその他の一般的なものは次のとおりです。
二項分布 :総発生回数が固定されている場合の「肯定的な発生」(成功、賛成票など)の数多項分布は 、二項分布に似ていますが、複数の選択肢がある事象の出現回数(例:アンケートにおける「はい/いいえ/たぶん」)を表します。負の二項分布は 、二項分布型の観測値に対して、特定の成功回数が発生する前に発生する失敗回数を関心対象とする分布である。ポアソン分布 とは、一定期間内に発生する事象の回数を表す分布であり、事象の発生率が一定であるという特徴を持つ。指数分布は 、一定の発生率で特徴付けられる事象の、次の事象が発生するまでの時間を表します。対数正規分布は 、所得や価格など、指数関数的に増加すると仮定される正の実数に適用されます。多変量正規分布 (別名:多変量ガウス分布)は、個々にガウス分布に従う相関のある結果のベクトルに適用されます。 重尾相関結果のベクトルに対する多変量スチューデント t 分布 [ 2 ] ベルヌーイ 分布に従う値のベクトル。例えば、白黒画像に対応し、各値はピクセルを表す。以下の手書き認識の例を参照のこと。
具体的な例
ガウス混合モデル プレート表記 を用いた非ベイズガウス混合モデル。小さな四角は固定パラメータ、大きな円は確率変数を表します。塗りつぶされた図形は既知の値を表します。[K] はサイズK のベクトルを意味します。典型的な非ベイズ型ガウス 混合モデルは次のようになります。
K 、 N = 上記のとおり ϕ 私 = 1 … K 、 ϕ = 上記のとおり z 私 = 1 … N 、 x 私 = 1 … N = 上記のとおり θ 私 = 1 … K = { μ 私 = 1 … K 、 σ 私 = 1 … K 2 } μ 私 = 1 … K = 成分の平均 私 σ 私 = 1 … K 2 = 成分の分散 私 z 私 = 1 … N ~ カテゴリカル ( ϕ ) x 私 = 1 … N ~ N ( μ z 私 、 σ z 私 2 ) {\displaystyle {\begin{array}{lcl}K,N&=&{\text{as above}}\\\phi _{i=1\dots K},{\boldsymbol {\phi }}&=&{\text{as above}}\\z_{i=1\dots N},x_{i=1\dots N}&=&{\text{as above}}\\\theta _{i=1\dots K}&=&\{\mu _{i=1\dots K},\sigma _{i=1\dots K}^{2}\}\\\mu _{i=1\dots K}&=&{\text{mean of component }}i\\\sigma _{i=1\dots K}^{2}&=&{\text{variance of component }}i\\z_{i=1\dots N}&\sim &\operatorname {Categorical} ({\boldsymbol {\phi }})\\x_{i=1\dots N}&\sim &{\mathcal {N}}(\mu _{z_{i}},\sigma _{z_{i}}^{2})\end{array}}}
プレート表記 を用いたベイズガウス混合モデル。小さな四角は固定パラメータ、大きな円は確率変数を表します。塗りつぶされた図形は既知の値を表します。[K] はサイズK のベクトルを意味します。ガウス 混合モデルのベイズ版は以下のとおりです。
K 、 N = 上記のとおり ϕ 私 = 1 … K 、 ϕ = 上記のとおり z 私 = 1 … N 、 x 私 = 1 … N = 上記のとおり θ 私 = 1 … K = { μ 私 = 1 … K 、 σ 私 = 1 … K 2 } μ 私 = 1 … K = 成分の平均 私 σ 私 = 1 … K 2 = 成分の分散 私 μ 0 、 λ 、 ν 、 σ 0 2 = 共有ハイパーパラメータ μ 私 = 1 … K ~ N ( μ 0 、 λ σ 私 2 ) σ 私 = 1 … K 2 ~ 私 n v e r s e - G 1 m m 1 ( ν 、 σ 0 2 ) ϕ ~ S y m m e t r 私 c - D 私 r 私 c h l e t K ( β ) z 私 = 1 … N ~ カテゴリカル ( ϕ ) x 私 = 1 … N ~ N ( μ z 私 、 σ z 私 2 ) {\displaystyle {\begin{array}{lcl}K,N&=&{\text{as above}}\\\phi _{i=1\dots K},{\boldsymbol {\phi }}&=&{\text{as above}}\\z_{i=1\dots N},x_{i=1\dots N}&=&{\text{as above}}\\\theta _{i=1\dots K}&=&\{\mu _{i=1\dots K},\sigma _{i=1\dots K}^{2}\}\\\mu _{i=1\dots K}&=&{\text{mean of component }}i\\\sigma _{i=1\dots K}^{2}&=&{\text{variance of component }}i\\\mu _{0},\lambda ,\nu ,\sigma _{0}^{2}&=&{\text{shared hyperparameters}}\\\mu _{i=1\dots K}&\sim &{\mathcal {N}}(\mu _{0},\lambda \sigma _{i}^{2})\\\sigma _{i=1\dots K}^{2}&\sim &\operatorname {Inverse-Gamma} (\nu ,\sigma _{0}^{2})\\{\boldsymbol {\phi }}&\sim &\operatorname {Symmetric-Dirichlet} _{K}(\beta )\\z_{i=1\dots N}&\sim &\operatorname {Categorical} ({\boldsymbol {\phi }})\\x_{i=1\dots N}&\sim &{\mathcal {N}}(\mu _{z_{i}},\sigma _{z_{i}}^{2})\end{array}}} {\displaystyle } ディリクレ過程 から正規分布を抽出したベイズガウス混合モデルを用いた一次元データのクラスタリングプロセスのアニメーション。クラスタのヒストグラムは異なる色で表示されます。パラメータ推定プロセス中に、新しいクラスタが作成され、データ上で成長します。凡例には、クラスタの色と各クラスタに割り当てられたデータポイントの数が表示されます。
カテゴリ混合モデル プレート表記 を用いた非ベイズ型カテゴリカル混合モデル。小さな四角は固定パラメータ、大きな円は確率変数を表します。塗りつぶされた図形は既知の値を表します。[K]はサイズK のベクトルを意味し、[V]も同様です。カテゴリカルな 観測値を用いた典型的な非ベイズ混合モデルは次のようになります。
K 、 N : {\displaystyle K,N:} 上記のとおりϕ 私 = 1 … K 、 ϕ : {\displaystyle \phi _{i=1\dots K},{\boldsymbol {\phi }}:} 上記のとおりz 私 = 1 … N 、 x 私 = 1 … N : {\displaystyle z_{i=1\dots N},x_{i=1\dots N}:} 上記のとおりV : {\displaystyle V:} カテゴリカルな観測値の次元、例:語彙数θ 私 = 1 … K 、 j = 1 … V : {\displaystyle \theta _{i=1\dots K,j=1\dots V}:} コンポーネントの確率私 {\displaystyle i} 観測対象j {\displaystyle j} θ 私 = 1 … K : {\displaystyle {\boldsymbol {\theta }}_{i=1\dots K}:} 次元のベクトルV 、 {\displaystyle V,} で構成されているθ 私 、 1 … V ; {\displaystyle \theta _{i,1\dots V};} 合計は1でなければならない確率変数:
z 私 = 1 … N ~ カテゴリカル ( ϕ ) x 私 = 1 … N ~ カテゴリカル ( θ z 私 ) {\displaystyle {\begin{array}{lcl}z_{i=1\dots N}&\sim &\operatorname {Categorical} ({\boldsymbol {\phi }})\\x_{i=1\dots N}&\sim &{\text{Categorical}}({\boldsymbol {\theta }}_{z_{i}})\end{array}}}
プレート表記 を用いたベイズカテゴリカル混合モデル。小さな四角は固定パラメータ、大きな円は確率変数を表します。塗りつぶされた図形は既知の値を表します。[K]はサイズK のベクトルを意味し、[V]も同様です。カテゴリカルな 観測値を用いた典型的なベイズ混合モデルは次のようになります。
K 、 N : {\displaystyle K,N:} 上記のとおりϕ 私 = 1 … K 、 ϕ : {\displaystyle \phi _{i=1\dots K},{\boldsymbol {\phi }}:} 上記のとおりz 私 = 1 … N 、 x 私 = 1 … N : {\displaystyle z_{i=1\dots N},x_{i=1\dots N}:} 上記のとおりV : {\displaystyle V:} カテゴリカルな観測値の次元、例:語彙数θ 私 = 1 … K 、 j = 1 … V : {\displaystyle \theta _{i=1\dots K,j=1\dots V}:} コンポーネントの確率私 {\displaystyle i} 観測対象j {\displaystyle j} θ 私 = 1 … K : {\displaystyle {\boldsymbol {\theta }}_{i=1\dots K}:} 次元のベクトルV 、 {\displaystyle V,} で構成されているθ 私 、 1 … V ; {\displaystyle \theta _{i,1\dots V};} 合計は1でなければならないα : {\displaystyle \alpha :} 共有濃度ハイパーパラメータθ {\displaystyle {\boldsymbol {\theta }}} 各コンポーネントについてβ : {\displaystyle \beta :} 濃度ハイパーパラメータϕ {\displaystyle {\boldsymbol {\phi }}} 確率変数:
ϕ ~ S y m m e t r 私 c - D 私 r 私 c h l e t K ( β ) θ 私 = 1 … K ~ 対称ディリクレ V ( α ) z 私 = 1 … N ~ カテゴリカル ( ϕ ) x 私 = 1 … N ~ カテゴリカル ( θ z 私 ) {\displaystyle {\begin{array}{lcl}{\boldsymbol {\phi }}&\sim &\operatorname {Symmetric-Dirichlet} _{K}(\beta )\\{\boldsymbol {\theta }}_{i=1\dots K}&\sim &{\text{Symmetric-Dirichlet}}_{V}(\alpha )\\z_{i=1\dots N}&\sim &\operatorname {Categorical} ({\boldsymbol {\phi }})\\x_{i=1\dots N}&\sim &{\text{Categorical}}({\boldsymbol {\theta }}_{z_{i}})\end{array}}}
例
住宅価格 N 種類の住宅の価格を観測したと仮定します。異なる地域にある異なるタイプの住宅は価格が大きく異なりますが、特定の地域にある特定のタイプの住宅(例えば、中級高級住宅街にある3ベッドルームの住宅)の価格は、平均値付近にかなり近い値で集中する傾向があります。このような価格のモデルとして考えられるのは、価格がK 種類の異なる成分からなる混合モデルで正確に記述されると仮定することです。各成分は、未知の平均と分散を持つ正規分布 に従い、各成分は住宅タイプと地域の特定の組み合わせを指定します。このモデルを観測された価格に当てはめると(例えば、期待値最大化アルゴリズム を用いるなど)、住宅タイプと地域に応じて価格がクラスター化され、各タイプと地域における価格のばらつきが明らかになります。(価格や所得など、必ず正の値であり、指数関数的に 増加する傾向のある値については、正規 分布よりも対数正規分布の方が適切なモデルとなる場合があることに注意してください。)
文書内のトピック 文書は、総語彙サイズV のN 個の異なる単語で構成され、各単語はK 個 の可能なトピックのいずれかに対応すると仮定します。このような単語の分布は、K 個 の異なるV 次元カテゴリ分布 の混合としてモデル化できます。この種のモデルは、一般的にトピックモデル と呼ばれます。このようなモデルに期待値最大化を 適用すると、(とりわけ)パラメータの数が多すぎる ため、現実的な結果が得られないことが多いことに注意してください。良好な結果を得るには、通常、いくつかの追加の仮定が必要です。通常、モデルには次の 2 種類の追加コンポーネントが追加されます。
トピック分布を記述するパラメータに対して事前分布が設定されます。この事前分布では、集中パラメータが1よりかなり小さいディリクレ分布を使用し、疎 な分布 ( 少数の単語のみが有意に非ゼロの確率を持つ)を促進します。 自然なクラスタリングを活用するために、単語のトピックの同一性に対して何らかの追加的な制約が課せられる。 例えば、マルコフ連鎖を トピック識別子(つまり、各観測値の混合成分を指定する潜在変数)に適用することができます。これは、近接する単語が類似のトピックに属するという事実に対応します。(これにより、隠れマルコフモデル 、具体的には、状態遷移に対して同じ状態にとどまる遷移を優先する事前分布 が設定されたモデルが得られます。) もう一つの可能性は、潜在的ディリクレ配分 モデルです。これは、単語をD個 の異なる文書に分割し、各文書にはごく少数のトピックのみが一定の頻度で出現すると仮定します。
手書き文字認識 以下の例は、Christopher M. Bishop著 『パターン認識と機械学習』 [ 5 ] の例に基づいています。
0から9までの手書き数字のスキャンであることがわかっているN × N の白黒画像が与えられたと想像してください。ただし、どの数字が書かれているかはわかりません。混合モデルを作成できます。K = 10 {\displaystyle K=10} 異なるコンポーネント、各コンポーネントはサイズのベクトルN 2 {\displaystyle N^{2}} ベルヌーイ分布 (ピクセルごとに1つ)を使用します。このようなモデルは、ラベル付けされていない手書き数字のセットに対して期待値最大化アルゴリズム を使用して学習させることができ、書かれている数字に応じて画像を効果的にクラスタリングします。同じモデルを使用して、パラメータを一定に保ち、考えられる各数字について新しい画像の確率を計算し(簡単な計算です)、最も高い確率を生成した数字を返すだけで、別の画像の数字を認識することができます。
弾丸の精度(円形誤差確率、CEPとも呼ばれる)を評価する混合モデルは、複数の発射体を目標に向ける問題(空、陸、または海上防衛アプリケーションなど)に適用され、複数の発射体の中で発射体の物理的特性や統計的特性が異なります。例としては、複数の弾薬タイプからの発射や、複数の場所から1つの目標に向けて発射する場合などが挙げられます。発射体タイプの組み合わせは、ガウス混合モデルとして特徴付けられます。[ 6 ] さらに、発射体群の精度のよく知られた尺度は、円形誤差確率 (CEP)であり、これは、平均して発射体群の半分が目標点を中心とした半径Rの円内に収まるような数 Rです。混合モデルは、 R の値を決定する(または推定する)ために使用できます。混合モデルは、異なるタイプの発射体を適切に捉えます。
直接的および間接的な応用 上記の金融の例は、混合モデルの直接的な応用例の一つです。混合モデルでは、各観測値が複数の異なる情報源またはカテゴリのいずれかに属するような、何らかの基礎的なメカニズムが存在すると仮定します。ただし、この基礎的なメカニズムは観測可能である場合もあれば、そうでない場合もあります。この混合モデルでは、各情報源は成分確率密度関数によって記述され、その混合重みは、観測値がその成分から生じる確率を表します。
混合モデルの間接的な適用においては、そのようなメカニズムは想定しません。混合モデルは、その数学的な柔軟性を利用するために用いられます。例えば、平均値の異なる2つの正規分布を混合すると、2つの モード を持つ密度分布が得られることがありますが、これは標準的なパラメトリック分布ではモデル化できません。また、混合分布は基本的なガウス分布よりも裾の厚い分布をモデル化できるため、より極端な事象をモデル化する候補となり得ます。
予知保全 混合モデルに基づくクラスタリングは、予測保全 における機械の状態の識別にも主に用いられています。密度プロットは、高次元特徴の密度を分析するために使用されます。複数のモデル密度が観測された場合、有限個の正規混合によって有限個 の密度が形成されると想定されます。多変量ガウス混合モデルは、機械の各状態を表すk個のグループに特徴データをクラスタリングするために使用されます。機械の状態は、正常状態、電源オフ状態、または故障状態のいずれかです。[ 7 ] 形成された各クラスタは、スペクトル分析などの手法を用いて診断できます。近年、これは早期故障検出などの他の分野でも広く使用されています。[ 8 ]
ファジー画像セグメンテーション グレースケールヒストグラムを用いた画像セグメンテーションにおけるガウス混合モデルの例 画像処理やコンピュータビジョン では、従来の画像セグメンテーション モデルでは、1 つのピクセルに 1 つの排他的なパターンのみを割り当てることがよくあり ます。ファジーセグメンテーションやソフトセグメンテーションでは、任意のパターンが任意の単一ピクセルに対して一定の「所有権」を持つことができます。パターンがガウス分布である場合、ファジーセグメンテーションは自然にガウス混合になります。このような空間的に正則化された混合モデルは、他の解析ツールや幾何学的ツール (拡散境界上の相転移など) と組み合わせることで、より現実的で計算効率の高いセグメンテーション手法につながる可能性があります。[ 9 ]
社会科学データにおけるクラスタリング 混合モデルは、社会科学において、観察データをクラスタリングし、複雑で異質な集団における潜在的なグループ構造を特定するために広く用いられています。武力紛争の研究[ 13 ] では、教師なし混合モデルに基づくクラスタリングが紛争事象データに適用され、事前に定義されたカテゴリに頼ることなく、経験的に導き出された紛争タイプに観察結果をグループ化しています。このような分析により、地理的、人口統計学的、経済的、インフラ的特性においてクラスター間で体系的な差異が明らかになり、異なる人口構成や開発プロファイルに関連する明確な紛争の原型に対応しています。これは、混合モデルが社会科学研究におけるデータ駆動型分類をどのようにサポートできるかを示す数多くの例の1つです。
識別可能性 識別可能性とは、検討対象のクラス(ファミリー)内のいずれのモデルに対しても、一意の特性が存在することを指します。モデルが識別不可能な場合、推定手順が明確に定義されない可能性があり、漸近理論が成り立たない可能性があります。
例 J を n = 2 のすべての二項分布のクラスとする。すると、 J の 2 つのメンバーの混合は次のようになる。
p 0 = π ( 1 − θ 1 ) 2 + ( 1 − π ) ( 1 − θ 2 ) 2 p 1 = 2 π θ 1 ( 1 − θ 1 ) + 2 ( 1 − π ) θ 2 ( 1 − θ 2 ) {\displaystyle {\begin{aligned}p_{0}&=\pi {\left(1-\theta _{1}\right)}^{2}+\left(1-\pi \right){\left(1-\theta _{2}\right)}^{2}\\[1ex]p_{1}&=2\pi \theta _{1}\left(1-\theta _{1}\right)+2\left(1-\pi \right)\theta _{2}\left(1-\theta _{2}\right)\end{aligned}}}
そしてp 2 = 1 − p 0 − p 1 です。明らかに、p 0 とp 1 が与えられた場合、決定すべきパラメータ( π 、θ 1 、θ 2 ) が 3 つあるため、上記の混合モデルを一意に決定することはできません。
意味 同じクラスのパラメトリック分布の混合を考えます。
J = { f ( ⋅ ; θ ) : θ ∈ Ω } {\displaystyle J=\{f(\cdot ;\theta ):\theta \in \Omega \}}
J をすべての成分分布のクラスとする。すると、J の凸包 Kは、 J 内のすべての有限混合分布のクラスを定義する。
K = { p ( ⋅ ) : p ( ⋅ ) = ∑ 私 = 1 n 1 私 f 私 ( ⋅ ; θ 私 ) 、 1 私 > 0 、 ∑ 私 = 1 n 1 私 = 1 、 f 私 ( ⋅ ; θ 私 ) ∈ J ∀ 私 、 n } {\displaystyle K=\left\{p(\cdot ):p(\cdot )=\sum _{i=1}^{n}a_{i}f_{i}(\cdot ;\theta _{i}),a_{i}>0,\sum _{i=1}^{n}a_{i}=1,f_{i}(\cdot ;\theta _{i})\in J\ \forall i,n\right\}}
K は、そのすべてのメンバーが一意である場合に識別可能であると言われます。つまり、 K の2 つのメンバーp とp ′ がそれぞれJ のk 分布とk ′ 分布の混合である場合、 p = p ′ となるのは、まずk = k ′ であり、次にすべてのiに対して a i = a i ′ およびf i = f i ′ となるように総和を並べ替えることができる場合に限ります。
パラメータ推定とシステム同定 パラメトリック混合モデルは、分布Yが既知であり、 X からサンプリングできるものの、 a i とθ iの 値を決定したい場合によく使用されます。このような状況は、複数の異なる部分集団から構成される母集団からサンプリングを行う研究で発生する可能性があります。
確率混合モデルは、欠損データ 問題として捉えられることが多い。これを理解する一つの方法は、対象となるデータ点が、モデル化に用いる分布のいずれかに「所属」していると仮定することである。当初、この所属は不明、つまり欠損している。推定の役割は、選択したモデル関数に対して適切なパラメータを考案することであり、データ点と各モデル分布との関連性は、それぞれの分布における所属として表される。
混合分解の問題に対するさまざまなアプローチが提案されており、その多くは期待値最大化 (EM) や最大事後確率推定 (MAP) などの最尤法に焦点を当てています。一般的に、これらの方法は システム同定 とパラメータ推定の問題を別々に検討します。混合内の成分の数と関数形式を決定する方法は、対応するパラメータ値を推定する方法とは区別されます。注目すべき例外としては、Tarter と Lock [ 14 ] で概説されているグラフィカルな方法や、最近ではFigueiredo と Jain [ 15 ] などの最小メッセージ長 (MML) 技術、そしてある程度は McWilliam と Loh (2009) によって提案されたモーメントマッチングパターン分析ルーチンなどがあります。[ 16 ]
期待値最大化(EM)期待値最大化(EM) は、 事前に 与えられた成分数を持つ混合物のパラメータを決定するために使用される最も一般的な手法であると思われる。これは、この問題に対する最尤推定を実装する特定の方法である。EM は 、Dempster ら (1977) [ 17 ] による次の反復アルゴリズムのように、閉形式の式が可能な有限正規混合物に対して特に魅力的である。
w s ( j + 1 ) = 1 N ∑ t = 1 N h s ( j ) ( t ) {\displaystyle w_{s}^{(j+1)}={\frac {1}{N}}\sum _{t=1}^{N}h_{s}^{(j)}(t)} μ s ( j + 1 ) = ∑ t = 1 N h s ( j ) ( t ) x ( t ) ∑ t = 1 N h s ( j ) ( t ) {\displaystyle \mu _{s}^{(j+1)}={\frac {\sum _{t=1}^{N}h_{s}^{(j)}(t)x^{(t)}}{\sum _{t=1}^{N}h_{s}^{(j)}(t)}}} Σ s ( j + 1 ) = ∑ t = 1 N h s ( j ) ( t ) [ x ( t ) − μ s ( j + 1 ) ] [ x ( t ) − μ s ( j + 1 ) ] ⊤ ∑ t = 1 N h s ( j ) ( t ) {\displaystyle \Sigma _{s}^{(j+1)}={\frac {\sum _{t=1}^{N}h_{s}^{(j)}(t)[x^{(t)}-\mu _{s}^{(j+1)}][x^{(t)}-\mu _{s}^{(j+1)}]^{\top }}{\sum _{t=1}^{N}h_{s}^{(j)}(t)}}} 事後確率を用いて
h s ( j ) ( t ) = w s ( j ) p s ( x ( t ) ; μ s ( j ) 、 Σ s ( j ) ) ∑ 私 = 1 n w 私 ( j ) p 私 ( x ( t ) ; μ 私 ( j ) 、 Σ 私 ( j ) ) 。 {\displaystyle h_{s}^{(j)}(t)={\frac {w_{s}^{(j)}p_{s}(x^{(t)};\mu _{s}^{(j)},\Sigma _{s}^{(j)})}{\sum _{i=1}^{n}w_{i}^{(j)}p_{i}(x^{(t)};\mu _{i}^{(j)},\Sigma _{i}^{(j)})}}.} したがって、パラメータの現在の推定値に基づいて、各t = 1, …, N ( N はサンプルサイズ) について、与えられた観測値x ( t )が状態 s から生成される条件付き確率 が決定されます。次に、新しいコンポーネントの重みが平均条件付き確率に対応し、各コンポーネントの平均と共分散がサンプル全体の平均と共分散のコンポーネント固有の加重平均となるようにパラメータが更新されます。
デンプスター[ 17 ] は、EMの各反復が尤度を低下させないことも示しており、これは他の勾配ベースの最大化手法にはない特性です。さらに、EMは確率ベクトル に対する制約を自然に組み込み、サンプルサイズが十分に大きい場合、共分散の正定値性を反復します。これは、明示的に制約された方法では適切な値をチェックして維持するために余分な計算コストがかかるため、重要な利点です。理論的には、EMは1次アルゴリズムであり、そのため固定点解にゆっくりと収束します。レッドナーとウォーカー(1984)は、超線形および2次ニュートン法と準ニュートン法を支持する議論の中でこの点を指摘し、経験的テストに基づいてEMの収束が遅いことを報告しています。彼らは、パラメータ値自体の収束は速くなくても、尤度の収束は速いことを認めています。EMと他のアルゴリズムの収束に関する相対的な利点は、他の文献で議論されています。[ 18 ]
EM の使用に対するその他の一般的な反対意見としては、局所最大値を誤って特定する傾向があることや、初期値に敏感であることなどが挙げられます。[ 19 ] [ 20 ] パラメータ空間内のいくつかの初期点で EM を評価することでこれらの問題に対処できますが、これは計算コストが高く、Udea と Nakano (1998) のアニーリング EM 法 (初期コンポーネントが本質的に重なり合うように強制され、初期推測の基底がより均一になる) などの他のアプローチの方が好ましい場合があります。
FigueiredoとJain [ 15 ] は、境界(例えばGhoshとSen(1985)のように正則条件が破綻する場所)で得られる「意味のない」パラメータ値への収束は、モデルコンポーネントの数が最適値/真の値を超える場合に頻繁に観察されることを指摘している。このことを踏まえ、彼らは推定と識別の統一的なアプローチを提案しており、初期n は期待される最適値を大幅に超えるように選択する。彼らの最適化ルーチンは、候補コンポーネントを支持する情報が不十分な場合に効果的に排除する最小メッセージ長(MML)基準によって構築される。このようにして、n の削減を体系化し、推定と識別を共同で検討することが可能となる。
期待のステップ 混合モデルのパラメータの初期推定値を用いて、各データポイントの各構成分布への「部分的な帰属度」は、各データポイントの帰属変数の期待値を 計算することによって算出されます。つまり、各データポイントx j と分布Y i について、帰属値y i , j は次のようになります。
y 私 、 j = 1 私 f Y ( x j ; θ 私 ) f X ( x j ) 。 {\displaystyle y_{i,j}={\frac {a_{i}f_{Y}(x_{j};\theta _{i})}{f_{X}(x_{j})}}.}
最大化ステップ グループメンバーシップの期待値が得られたら、分布パラメータのプラグイン推定値を再計算します。
混合係数a i は、 N 個の データポイントにおけるメンバーシップ値の平均 値です。
1 私 = 1 N ∑ j = 1 N y 私 、 j {\displaystyle a_{i}={\frac {1}{N}}\sum _{j=1}^{N}y_{i,j}} コンポーネントモデルのパラメータθ i も、メンバーシップ値で重み付けされたデータ点x j を用いて期待値最大化によって計算されます。たとえば、θ が平均μである場合
μ 私 = ∑ j y 私 、 j x j ∑ j y 私 、 j 。 {\displaystyle \mu _{i}={\frac {\sum _{j}y_{i,j}x_{j}}{\sum _{j}y_{i,j}}}.} a i とθ i ' の新しい推定値を用いて、期待値計算の手順を繰り返し、新しいメンバーシップ値を再計算します。この手順は、モデルパラメータが収束するまで繰り返されます。
モーメントマッチング モーメントマッチング法は 、1894 年のカール・ピアソンの画期的な研究に遡る、混合パラメータを決定する最も古い手法の 1 つです。このアプローチでは、複合分布のモーメントが特定の値に一致するように混合パラメータが決定されます。多くの場合、モーメント方程式の解の抽出は、非自明な代数的または計算上の問題を引き起こす可能性があります。さらに、Day [ 21 ] による数値解析では、このような方法は EM に比べて非効率的である可能性があることが示されています。それにもかかわらず、この方法への関心が再び高まっており、たとえば Craigmile と Titterington (1998) や Wang [ 22 ]などが研究を行っています。
McWilliamとLoh(2009)は、EMアルゴリズムでは計算コストが高すぎるような高次元システムにおける、ハイパーキュボイド正規混合コピュラ の特性化について考察している。ここでは、パターン解析ルーチンを用いて、一連の単変量モーメントおよび(ある意味では)二変量モーメントと整合する多変量テール依存性を生成する。次に、この手法の性能を株式の対数リターンデータを用いて評価し、コルモゴロフ・スミルノフ 検定統計量から良好な記述適合性が示唆された。
スペクトル法 混合モデル推定におけるいくつかの問題は、スペクトル法 を用いることで解決できる。特に、データ点x i が 高次元実空間 の点であり、隠れた分布が対数凹関数( ガウス分布 や指数分布 など)であることが分かっている場合に有効である。
混合モデルを学習するスペクトル法は、データ点を含む行列の特異値分解 に基づいています。その考え方は、学習対象となる分布の数をkとしたとき、上位 k 個の特異ベクトルを考慮することです。これらのベクトルによって張られる線形部分空間 への各データ点の射影により、同じ分布に由来する点は非常に近い位置にグループ化され、異なる分布に由来する点は遠く離れた位置に留まります。
スペクトル法の特徴の一つは、分布が特定の分離条件(例えば、近すぎないこと)を満たす場合、推定された混合分布が真の分布に非常に近い確率で得られることを証明 できる点である。
図解法 TarterとLock [ 14 ] は、成分内の分散を減らすために、経験的頻度プロットにカーネル関数を適用する混合識別のグラフィカルなアプローチについて述べている。この方法により、平均値が異なる成分をより容易に識別できる。このλ 法は成分の数や関数形式に関する事前の知識を必要としないが、その成功はカーネルパラメータの選択に依存しており、カーネルパラメータはある程度、成分構造に関する仮定を暗黙のうちに含んでいる。
シミュレーション 確率p i (合計 = p i = 1)を持つ分布F i 、i = 1 ~n の混合分布からのサイズN のサンプルをシミュレートするには、次のようになります。
サイズnの カテゴリ分布から N 個の乱数を生成します。確率p i ( i = 1からn) は、N 個の各値がどのF i から生成されるかを示します。i番目 の カテゴリに割り当てられた乱数の数をm i で表します。 各i に対して、F i 分布からm i 個の乱数を生成する。
参考文献 ↑ Pal, Samyajoy; Heumann, Christian (2024). "Flexible Multivariate Mixture Models: A Comprehensive Approach for Modeling Mixtures of Non-Identical Distributions". International Statistical Review insr.12593. doi : 10.1111/insr.12593 . ↑ Chatzis, Sotirios P.; Kosmopoulos, Dimitrios I.; Varvarigou, Theodora A. (2008). "信号モデリングと分類:t分布に基づくロバストな潜在空間モデルの使用". IEEE Transactions on Signal Processing . 56 (3): 949–963 . Bibcode : 2008ITSP...56..949C . doi : 10.1109/TSP.2007.907912 . S2CID 15583243 . ↑ Yu, Guoshen (2012). "区分線形推定器による逆問題の解決: ガウス混合モデルから構造的スパース性まで". IEEE Transactions on Image Processing . 21 (5): 2481–2499 . arXiv : 1006.3056 . Bibcode : 2012ITIP...21.2481G . doi : 10.1109/tip.2011.2176743 . PMID 22180506. S2CID 479845 . ↑ Dinov, ID. 「期待値最大化と混合モデルチュートリアル」。カリフォルニアデジタルライブラリ 、統計オンライン計算リソース、論文EM_MM、 http://repositories.cdlib.org/socr/EM_MM、2008年12月9日 ↑ ビショップ、クリストファー (2006). パターン認識と機械学習 . ニューヨーク: スプリンガー. ISBN 978-0-387-31073-2 。↑ Spall, JC および Maryak, JL (1992). 「非独立同分布データからの射影精度の分位点の実現可能なベイズ推定量」 Journal of the American Statistical Association 、第 87 巻 (419)、pp. 676–681。JSTOR 2290205 ↑ Amruthnath, Nagdev; Gupta, Tarun (2018-02-02).モデルベースクラスタリングアプローチを 用い た教師なし学習における故障クラス予測 。未発表。doi : 10.13140/rg.2.2.22085.14563 。 ↑ Amruthnath, Nagdev; Gupta, Tarun (2018-02-01). 予測保守における故障検出のための教師なし機械学習アルゴリズムに関する研究 。未発表。doi : 10.13140 /rg.2.2.28822.24648 。 ↑ Shen, Jianhong (Jackie) (2006). "ソフトMumford-Shahセグメンテーションのための確率的変分モデル" . International Journal of Biomedical Imaging . 2006 092329: 2– 16. Bibcode : 2006IJBI.200649515H . doi : 10.1155/IJBI/2006/92329 . PMC 2324060 . PMID 23165059 . ↑ Myronenko, Andriy; Song, Xubo (2010). "点群レジストレーション: コヒーレント点ドリフト". IEEE Trans. Pattern Anal. Mach. Intell . 32 (12): 2262– 2275. arXiv : 0905.2635 . Bibcode : 2010ITPAM..32.2262M . doi : 10.1109/TPAMI.2010.46 . PMID 20975122 . S2CID 10809031 . ↑ Ravikumar, Nishant; Gooya, Ali; Cimen, Serkan; Frangi, Alexjandro; Taylor, Zeike (2018). "統計的形状モデルのためのスチューデントのt混合モデルを使用した点群のグループ別類似性レジストレーション" . Med. Image Anal . 44 : 156– 176. doi : 10.1016/j.media.2017.11.012 . PMID 29248842 . ↑ Bayer, Siming; Ravikumar, Nishant; Strumia, Maddalena; Tong, Xiaoguang; Gao, Ying; Ostermeier, Martin; Fahrig, Rebecca; Maier, Andreas (2018). "ハイブリッド混合モデルを用いた術中脳シフト補正" . Medical Image Computing and Computer Assisted Intervention – MICCAI 2018 . Granada, Spain: Springer, Cham. pp. 116– 124. doi : 10.1007/978-3-030-00937-3_14 . ↑ Kushwaha, Niraj; Oh, Woi Sok; Shah, Shlok; Lee, Edward D. (2025-12-01). "データ駆動型紛争分類は弱い予測指標を明らかにする" . Royal Society Open Science . 12 (12) 250897. doi : 10.1098/rsos.250897 . ISSN 2054-5703 . 1 2 3 Tarter, Michael E. (1993), Model Free Curve Estimation , Chapman and Hall 1 2 Figueiredo, MAT; Jain, AK (2002 年 3 月). "有限混合モデルの教師なし学習". IEEE Transactions on Pattern Analysis and Machine Intelligence . 24 (3): 381–396 . Bibcode : 2002ITPAM..24..381F . CiteSeerX 10.1.1.362.9811 . doi : 10.1109/34.990138 . ↑ McWilliam, N.; Loh, K. (2008), クレジットデリバティブの評価における多次元テール依存性の組み込み(ワーキングペーパー) 1 2 Dempster, AP; Laird, NM; Rubin, DB (1977). "EMアルゴリズムによる不完全データからの最尤推定". Journal of the Royal Statistical Society, Series B . 39 (1): 1– 38. CiteSeerX 10.1.1.163.7580 . doi : 10.1111/j.2517-6161.1977.tb01600.x . JSTOR 2984875 . ↑ Xu, L.; Jordan, MI (1996 年 1 月). "ガウス混合に対する EM アルゴリズムの収束特性について". Neural Computation . 8 (1): 129–151 . doi : 10.1162/neco.1996.8.1.129 . hdl : 10338.dmlcz/135225 . S2CID 207714252 . 1 2 McLachlan, GJ (2000), 有限混合モデル , Wiley ↑ Botev, ZI; Kroese, DP (2004). "Global Likelihood Optimization Via the Cross-Entropy Method, with an Application to Mixture Models". Proceedings of the 2004 Winter Simulation Conference, 2004. Vol. 1. pp. 517–523 . CiteSeerX 10.1.1.331.2319 . doi : 10.1109/WSC.2004.1371358 . ISBN 978-0-7803-8786-7 . S2CID 6880171 . ↑ Day, NE (1969). "正規分布の混合の成分の推定". Biometrika . 56 (3): 463–474 . doi : 10.2307/2334652 . JSTOR 2334652 . ↑ Wang, J. ( 2001), "正規分布の多変量混合を用いた市場変数の日次変化の生成", 第33回冬季シミュレーション会議議事録 : 283–289 ↑ Améndola, Carlos; et al. (2015). "ガウス混合のモーメント多様体". Journal of Algebraic Statistics . 7 . arXiv : 1510.04654 . Bibcode : 2015arXiv151004654A . doi : 10.18409/jas.v7i1.42 . S2CID 88515304 . ↑ McLachlan, GJ; Basford, KE (1988)、「混合モデル:推論とクラスタリングへの応用」、 統計学:教科書とモノグラフ 、 Bibcode : 1988mmia.book.....M ↑ ティタリントン、スミス、 マコフ 1985
さらに読む
混合モデルに関する書籍 Everitt, BS; Hand, DJ (1981).有限混合分布 . Chapman & Hall. ISBN 978-0-412-22420-1 。 Lindsay, BG (1995).混合モデル:理論、幾何学、および応用 。NSF-CBMS 地域会議シリーズ 確率と統計。第 5 巻。ヘイワード:数理統計研究所。Marin, JM; Mengersen, K. ; Robert, CP (2011). "分布の混合に関するベイズモデリングと推論" (PDF) . Dey, D.; Rao, CR (編) 『Essential Bayesian models 』. Handbook of statistics: Bayesian thinking - modeling and computation. Vol. 25. Elsevier. ISBN 9780444537324 。 McLachlan, GJ; Peel, D. (2000).有限混合モデル . Wiley. ISBN 978-0-471-00626-8 。 Press, WH ; Teukolsky, SA ; Vetterling, WT; Flannery, BP (2007). 「第 16.1 節 ガウス混合モデルと k-平均クラスタリング」 . Numerical Recipes : The Art of Scientific Computing (第 3 版). ニューヨーク: Cambridge University Press. ISBN 978-0-521-88068-8 。ティタリングトン、M. 、スミス、A.、マコフ、U. (1985).有限混合分布の統計分析 . ワイリー. ISBN 978-0-471-90763-3 。Yao, W.; Xiang, S. (2024).混合モデル:パラメトリック、セミパラメトリック、および新しい方向性 . Chapman & Hall/CRC Press. ISBN 978-0367481827 。
ガウス混合モデルの応用 Reynolds, DA; Rose, RC (1995年1月)「ガウス混合話者モデルを用いた堅牢なテキスト非依存話者識別」IEEE Transactions on Speech and Audio Processing . 3 (1): 72– 83. Bibcode : 1995ITSAP...3...72R . doi : 10.1109/89.365379 . S2CID 7319345 . Permuter, H.; Francos, J.; Jermyn, IH (2003).画像データベース検索のためのテクスチャと色のガウス混合モデル . IEEE International Conference on Acoustics, Speech, and Signal Processing , 2003. Proceedings (ICASSP '03). doi : 10.1109/ICASSP.2003.1199538 . Permuter, Haim; Francos, Joseph; Jermyn, Ian (2006). "画像分類とセグメンテーションのための色とテクスチャ特徴のガウス混合モデルの研究" (PDF) . Pattern Recognition . 39 (4): 695– 706. Bibcode : 2006PatRe..39..695P . doi : 10.1016/j.patcog.2005.10.028 . S2CID 8530776 . レムケ、ヴォルフガング(2005)。状態空間フレームワークにおける期間構造モデリングと推定 。シュプリンガー・フェルラーク。ISBN 978-3-540-28342-3 。 Brigo, Damiano ; Mercurio, Fabio (2001).解析的に扱いやすいスマイルモデルのための変位拡散と混合拡散 . 数理ファイナンス – バチェリエ会議 2000. 議事録. Springer Verlag.Brigo, Damiano; Mercurio, Fabio (2002年6月)「対数正規混合ダイナミクスと市場ボラティリティスマイルへの較正」International Journal of Theoretical and Applied Finance . 5 (4): 427. CiteSeerX 10.1.1.210.4165 . doi : 10.1142/S0219024902001511 . Spall, JC; Maryak, JL (1992). "非独立同分布データからの射影精度の分位点の実現可能なベイズ推定量". Journal of the American Statistical Association . 87 (419): 676–681 . doi : 10.1080/01621459.1992.10475269 . JSTOR 2290205 . Alexander, Carol (2004 年 12 月). 「不確実な変動性を伴う正規混合拡散:短期および長期のスマイル効果のモデリング」(PDF) . Journal of Banking & Finance . 28 (12): 2957–80 . doi : 10.1016/j.jbankfin.2003.10.017 . スティリアノウ、ヤニス。パンタジス、ヤニス。カルデレロ、フェリペ。ラリー、ペドロ。セヴラン、フランソワ。シムケ、サシャ。ボナル、ロランド。マッタ、フェデリコ。ヴァルサマキス、アタナシオス (2005)。GMM ベースのマルチモーダル生体認証検証 (PDF) 。 Chen, J.; Adebomi, O.E.; Olusayo, OS; Kulesza, W. (2010).マルチターゲット追跡のためのガウス混合確率仮説密度アプローチの評価 . IEEE International Conference on Imaging Systems and Techniques , 2010. doi : 10.1109/IST.2010.5548541 . {{cite conference}}: CS1 maint: 数値名: 著者リスト (リンク)
外部リンク Nielsen, Frank (2012年3月23日). 「K-MLE: 統計的混合モデルを学習するための高速アルゴリズム」. 2012 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) . pp. 869–872 . arXiv : 1203.5181 . Bibcode : 2012arXiv1203.5181N . doi : 10.1109/ICASSP.2012.6288022 . ISBN 978-1-4673-0046-9 . S2CID 935615 . SOCRによるEMと混合モデル化の実証 混合モデルに関するページ(および有限混合モデルに適用される最小メッセージ長 (MML )のためのSnobプログラム)は、DL Doweによって管理されています。 PyMix – Pythonの混合モデルパッケージ。Pythonで幅広い混合モデルベースのデータマイニングアプリケーションのためのアルゴリズムとデータ構造を提供します。 sklearn.mixture –ガウス混合モデルを学習(およびそこからサンプリング)するためのscikit-learn Pythonライブラリのモジュール。以前はSciPyに同梱されていましたが、現在は SciKitに同梱されています。 GMM.m GMM実装用Matlabコード GPGPUを使用して100倍の速度で高速化された、EMとMCMCを用いたベイズ混合モデルのGPUmix C++実装。 EMアルゴリズムを用いたGMM実装のためのMatlabコード jMEF:指数型分布族の混合分布を学習・処理するためのJavaオープンソースライブラリ(ブレグマンダイバージェンスを用いた双対性を使用)。Matlabラッパーも含まれています。 ガウス混合モデル(GMM)を推定するための期待値最大化(EM)アルゴリズムの、非常に高速でクリーンなC言語による実装。 mclustは、混合モデル構築のためのRパッケージです。 dpgmm純粋な Python によるディリクレ過程ガウス混合モデルの実装 (変分法)。 ガウス混合モデルに関するブログ記事。期待値最大化法を用いて学習させたガウス混合モデルについて、Pythonによる実装例を交えて解説します。