条件付き確率場(CRF )は、パターン認識や機械学習でよく用いられる統計モデリング手法の一種で、構造化予測に使用されます。分類器は「近傍」のサンプルを考慮せずに単一のサンプルに対してラベルを予測しますが、CRFはコンテキストを考慮に入れることができます。そのためには、予測間の依存関係を表すグラフモデルとして予測をモデル化します。使用するグラフの種類は、アプリケーションによって異なります。例えば、自然言語処理では、「線形連鎖」CRFがよく用いられ、各予測は直近の近傍のみに依存します。画像処理では、グラフは通常、近傍または類似の場所に位置を接続し、類似の予測が確実に得られるようにします。
CRFが使用されるその他の例としては、自然言語処理や生物学的シーケンスのためのシーケンスデータのラベル付けや解析[ 1 ]、品詞タグ付け、浅い構文解析[ 2 ]、固有表現認識[ 3 ]、遺伝子探索、ペプチド重要機能領域探索[ 4 ]、物体認識[ 5 ]、コンピュータビジョンにおける画像セグメンテーション[ 6 ]などがある。
Lafferty、McCallum、Pereira [ 1 ]は観測値に対する CRF を定義している。およびランダム変数次のように:
させてグラフである。、 となることによっては頂点によってインデックス付けされます。
それから各確率変数が条件付き確率場である場合条件付きはグラフに関してマルコフ性を満たす。つまり、その確率はG内の隣接ノードのみに依存し、過去の状態には依存しない。
、 どこつまりそして隣人同士。
つまり、CRFは、ノードが互いに素な2つの集合に分割できる無向グラフモデルである。そしてそれぞれ観測変数と出力変数、条件付き分布次にモデル化される。
一般的なグラフの場合、CRFにおける厳密な推論の問題は扱いが困難です。CRFの推論問題は基本的にMRFの場合と同じであり、同じ議論が成り立ちます。[ 7 ] ただし、厳密な推論が可能な特殊なケースが存在します。
正確な推論が不可能な場合、近似解を得るためにいくつかのアルゴリズムを用いることができる。これらには以下が含まれる。
パラメーターを学ぶ通常は最尤学習によって行われます。すべてのノードが指数族分布を持ち、トレーニング中にすべてのノードが観測される場合、この最適化は凸最適化となります。[ 7 ]例えば、勾配降下法や、L-BFGSアルゴリズムなどの準ニュートン法を用いて解くことができます。一方、一部の変数が観測されない場合、推論問題はこれらの変数について解く必要があります。一般的なグラフでは正確な推論は扱いにくいため、近似を用いる必要があります。
シーケンスモデリングでは、通常、対象となるグラフは連鎖グラフです。観測変数の入力シーケンス一連の観測を表し、これは、観測値に基づいて推測する必要がある隠れた(または未知の)状態変数を表します。鎖状に構造化されており、各鎖の間には辺がある。そして単純な解釈に加えて、入力シーケンス内の各要素の「ラベル」として、このレイアウトは効率的なアルゴリズムを可能にします。
それぞれの条件付き依存関係の上は、次の形式の固定された特徴関数セットによって定義されます。これは、入力シーケンスに対する測定値であり、各可能な値の尤度を部分的に決定するものと考えることができる。モデルは各特徴に数値的な重みを割り当て、それらを組み合わせて特定の値の確率を決定します。。
線形連鎖CRFは、概念的にはより単純な隠れマルコフモデル(HMM)と多くの点で共通する用途がありますが、入力および出力シーケンス分布に関する特定の仮定を緩和しています。HMMは、状態遷移と出力をモデル化するために定数確率を使用する非常に具体的な特徴関数を持つCRFとして大まかに理解できます。逆に、CRFは、入力シーケンスに応じて隠れ状態のシーケンス内の位置全体で変化する任意の関数に定数遷移確率を変換するHMMの一般化として大まかに理解できます。
特に、HMMとは対照的に、CRFは任意の数の特徴関数を含むことができ、特徴関数は入力シーケンス全体を検査することができる。推論中のどの時点においても、特徴関数の範囲は確率的な解釈を持つ必要はない。
CRFは、各固定数に依存する以前の変数従来の高次CRFの定式化では、トレーニングと推論は、の値が小さい場合にのみ実用的です。( k ≤ 5など)、 [ 8 ]計算コストは指数関数的に増加するため。
しかし、最近の別の進歩により、ベイズノンパラメトリックの分野の概念とツールを活用することで、これらの問題が改善されました。具体的には、CRF-infinity アプローチ[ 9 ]は、スケーラブルな方法で無限に長い時間ダイナミクスを学習できる CRF 型モデルを構成します。これは、連続観測における無限に長いダイナミクスを学習するためのノンパラメトリック ベイズ モデルであるシーケンスメモイザ (SM) に基づく CRF 用の新しいポテンシャル関数を導入することによって実現されます。[ 10 ]このようなモデルを計算的に扱いやすくするために、CRF-infinity は、想定される新しいポテンシャル関数 (SM によって駆動される) の平均場近似[ 11 ]を採用しています。これにより、任意の長さの時間的依存関係を捉えてモデル化する能力を損なうことなく、モデルの効率的な近似トレーニングおよび推論アルゴリズムを考案できます。
CRFには、ラベルシーケンスの可変長セグメントをモデル化するセミマルコフ条件付き確率場(semi-CRF)という別の一般化が存在する。[ 12 ]これにより、高次CRFの長距離依存性をモデル化する能力の多くが提供されます。妥当な計算コストで。
最後に、構造化サポートベクターマシンなどの構造化予測のためのマージンが大きいモデルは、 CRFに代わる学習手順と見なすことができる。
潜在動的条件付き確率場(LDCRF)または識別型確率的潜在変数モデル(DPLVM)は、シーケンスタグ付けタスク用のCRFの一種です。これらは、識別的に学習される潜在変数モデルです。
LDCRFでは、他のシーケンスタグ付けタスクと同様に、観測のシーケンスxが与えられた場合、モデルが解決しなければならない主な問題は、ラベルのシーケンスy =を割り当てる方法です。1 つの有限ラベルセットYから。通常の線形連鎖 CRF のようにP ( y | x )を直接モデル化する代わりに、確率の連鎖規則を使用して、潜在変数のセットhがxとyの間に「挿入」されます。[ 13 ]
これにより、観測値とラベル間の潜在的な構造を捉えることができます。[ 14 ] LDCRFは準ニュートン法を使用してトレーニングできますが、コリンズの構造化パーセプトロンアルゴリズムに基づいて、潜在変数パーセプトロンと呼ばれる特殊なバージョンのパーセプトロンアルゴリズムも開発されています。[ 13 ]これらのモデルは、コンピュータビジョン、特にビデオストリームからのジェスチャー認識[ 14 ]や浅い構文解析[ 13 ]に応用されています。