確率過程の数学理論において、可変次数マルコフ(VOM)モデルは、よく知られているマルコフ連鎖モデルを拡張した重要なモデル群です。マルコフ連鎖モデルでは、マルコフ性を持つ系列内の各確率変数は固定数の確率変数に依存しますが、VOMモデルでは、この条件付け確率変数の数は、観測された具体的な実現値に基づいて変化する可能性があります。
この実現シーケンスはしばしばコンテキストと呼ばれ、そのためVOMモデルはコンテキストツリーとも呼ばれます。[ 1 ] VOMモデルは、色付き確率的サフィックスツリー(PST)によって美しく表現されます。[ 2 ]条件付け確率変数の数の柔軟性は、統計分析、分類、予測などの多くのアプリケーションにとって大きな利点となります。[ 3 ] [ 4 ] [ 5 ]
例えば、それぞれが三項アルファベット{ a , b , c }から値を取るランダム変数のシーケンスを考えてみましょう。具体的には、部分文字列aaabcの無限連結から構成される文字列aaabcaaabcaaabcaaabc…aaabcを考えてみましょう。
最大次数 2 の VOM モデルは、次の 5 つの条件付き確率成分のみを使用して上記の文字列を近似できます: Pr( a | aa ) = 0.5、Pr( b | aa ) = 0.5、Pr( c | b ) = 1.0、Pr( a | c ) = 1.0、Pr( a | ca ) = 1.0。
この例では、Pr( c | ab ) = Pr( c | b ) = 1.0であるため、より短いコンテキストbだけで次の文字を決定できます。同様に、最大次数 3 の VOM モデルでは、条件付き確率の要素が 5 つだけ使用して文字列を正確に生成できます。これらの要素はすべて 1.0 です。
その文字列の次の文字の 1 次マルコフ連鎖を構築するには、次の 9 つの条件付き確率成分を推定する必要があります: Pr( a | a )、Pr( a | b )、 Pr ( a | c )、Pr( b | a )、Pr ( b | b )、Pr( b | c )、Pr( c | a )、Pr( c | b )、Pr( c | c )。次の文字の 2 次マルコフ連鎖を構築するには、27 個の条件付き確率成分を推定する必要があります: Pr( a | aa )、Pr( a | ab )、…、Pr( c | cc )。そして、次の文字の 3 次マルコフ連鎖を構築するには、次の 81 個の条件付き確率成分を推定する必要があります: Pr( a | aaa )、Pr( a | aab )、…、Pr( c | ccc )。
実際の状況では、マルコフ連鎖の次数が増加するにつれて指数関数的に増加する条件付き確率成分の数を正確に推定するのに十分なデータが得られることはほとんどない。
可変次数マルコフモデルは、現実的な設定では、過去の状態の一部が将来の状態から独立している状態(コンテキストによって表される)の特定の実現が存在すると仮定しています。したがって、「モデルパラメータの数を大幅に削減できます。」[ 1 ]
A をサイズ の状態空間 (有限アルファベット) とする。
マルコフ性を持つ数列を考えるn個の確率変数の実現値のうち、位置iにおける状態 (記号) は、そして州の連結そしては、。
観測された状態のトレーニングセットが与えられた場合、VOMモデルの構築アルゴリズム[ 3 ] [ 4 ] [ 5 ]は、過去の状態(以前に観測されたシンボル)または将来の状態に基づいて、シーケンス内の各状態に対する確率割り当てを提供するモデルPを学習します。
具体的には、学習者は条件付き確率分布を生成する。記号の場合 文脈が与えられた場合ここで、* 記号は、空のコンテキストを含む任意の長さの状態のシーケンスを表します。
VOMモデルは、次の形式の条件付き分布を推定しようと試みる。コンテキストの長さ利用可能な統計情報によって異なる。対照的に、従来のマルコフモデルは、コンテキストの長さを固定すると仮定して、これらの条件付き分布を推定しようとする。したがって、これらはVOMモデルの特殊なケースとみなすことができる。
実際、与えられたトレーニングシーケンスに対して、VOMモデルは固定次数マルコフモデルよりも優れたモデルパラメータ化を得ることがわかっており、学習されたモデルの分散とバイアスのトレードオフが改善します。 [ 3 ] [ 4 ] [ 5 ]
VOMモデルのパラメータを推定するためのさまざまな効率的なアルゴリズムが考案されている。[ 4 ]
VOMモデルは、機械学習、情報理論、バイオインフォマティクスなどの分野にうまく適用されており、コーディングやデータ圧縮[ 1 ]、文書圧縮[ 4 ]、DNAおよびタンパク質配列の分類と識別[ 6 ]などの具体的なアプリケーションも含まれています。[ 3 ]統計的プロセス管理、 [ 5 ]スパムフィルタリング、 [ 7 ]ハプロタイピング、 [ 8 ]音声認識、 [ 9 ]社会科学におけるシーケンス分析、 [ 2 ] その他。