判別モデル(条件付きモデルとも呼ばれる)は、分類によく用いられるモデルの一種です。機械学習では、通常、条件付き分布 P(Y|X) をモデル化するか、入力 X を出力 Y にマッピングする直接的な決定ルールを学習します。判別モデルは、分類と回帰によく用いられ、主な目的は新しいデータに対する正確な予測です。通常、既存のデータポイントに合格/不合格、勝敗、生存/死亡、健康/病気などのラベルを割り当てる二値分類問題を解決するために使用されます。判別モデルは通常、クラスを分離するか、選択した損失関数の下で予測誤差を最小化するように学習されます。判別モデルは、データがどのように生成されるかをモデル化し、新しいデータをサンプリングするために使用できる生成モデルと対比されることがよくあります。
生成モデルとは異なり、結合確率を研究する判別モデリング研究では、または、与えられた未観測変数(ターゲット)をマッピングするクラスラベルに観測変数(トレーニングサンプル)に依存します。たとえば、物体認識では、これは生のピクセル(または画像の生のピクセルから抽出された特徴)のベクトルである可能性が高い。確率論的枠組みでは、これは条件付き確率分布をモデル化することによって行われる。これは予測に使用できますから条件付きモデルと判別モデルには依然として区別がありますが、多くの場合、これらは単に判別モデルとして分類されます。
条件付きモデルは条件付き確率分布をモデル化するのに対し、従来の識別モデルは最も類似した学習済みサンプルを中心に入力をマッピングすることを最適化することを目的としています。[ 1 ]
統計的分類では、生成アプローチと識別アプローチという2つの主要なアプローチがあります。これらは、統計的モデリングの度合いが異なる様々なアプローチによって分類器を計算します。用語は一貫していませんが、[ a ] 3つの主要なタイプを区別できます。
これら最後の2つのクラスの区別は、必ずしも一貫してなされているわけではない。
別の区分では、これらを対称的に次のように定義します。
厳密な定義に関わらず、この用語は憲法に則っている。なぜなら、生成モデルは観測値と目標値のいずれかのランダムなインスタンス(結果)を「生成」するために使用できるからである。または、目標値yが与えられた観測xの一方、識別モデルまたは識別分類器 (モデルなし) は、観測xが与えられた場合に目標変数Yの値を「識別」するために使用できます。
では、クラスラベル(分類)と特徴変数、トレーニングサンプルとして。
生成モデルは結合確率を取る、 どこ入力とはラベルであり、最も可能性の高い既知のラベルを予測します。未知の変数についてベイズの定理を用いて。
識別モデルは、生成モデルとは異なり、観測変数と目標変数の同時分布からサンプルを生成することはできません。しかし、分類や回帰など、同時分布を必要としないタスクでは、識別モデルの方が優れたパフォーマンスを発揮します(計算する変数が少ないことが一因です)。一方、生成モデルは、複雑な学習タスクにおける依存関係の表現において、一般的に識別モデルよりも柔軟性に優れています。さらに、ほとんどの識別モデルは本質的に教師あり学習であり、教師なし学習を容易にサポートすることはできません。識別モデルと生成モデルのどちらを選択するかは、最終的にはアプリケーション固有の詳細によって決まります。
識別モデルと生成モデルは、事後確率の導入においても異なります。最小期待損失を維持するためには、結果の誤分類の最小化を達成する必要があります。識別モデルでは、事後確率は、は、訓練データから得られるパラメータを用いたパラメトリックモデルから推論されます。パラメータの推定値は、パラメータに関する尤度または分布計算の最大化によって得られます。一方、生成モデルは結合確率に焦点を当てているため、クラスの事後確率はベイズの定理では、
繰り返し実験では、二値分類タスクのさまざまなモデルにロジスティック回帰とナイーブベイズを適用したところ、識別学習では漸近誤差が低くなるのに対し、生成学習では漸近誤差が早く高くなることがわかりました。しかし、UlusoyとBishopの共同研究「物体検出と分類のための生成手法と識別手法の比較」では、上記の記述はモデルがデータに適したものである場合(つまり、データ分布が生成モデルによって正しくモデル化されている場合)にのみ正しいと述べています。
判別モデルを使用する主な利点は以下のとおりです。
生成モデリングを使用する利点と比較すると:
以下のアプローチは、トレーニングデータセットが与えられているという前提に基づいています。、 どこ入力に対応する出力は[ 2 ]
私たちはその機能を使用する予定です線形分類器法を用いて、訓練データセットから観察された挙動をシミュレートする。結合特徴ベクトルを使用する。決定関数は次のように定義されます。
メミシェヴィッチの解釈によれば、[ 2 ]これも入力の互換性を測定するスコアを計算します潜在的な出力それから最高得点を獲得したクラスを決定します。
0-1損失関数は決定理論でよく使われるものなので、条件付き確率分布、 どこは、トレーニングデータを最適化するためのパラメータベクトルであり、ロジスティック回帰モデルについては以下のように再考することができる。
上記の式はロジスティック回帰を表しています。モデル間の大きな違いは、事後確率の導入方法にあることに注意してください。事後確率はパラメトリックモデルから推測されます。そして、次の式によってパラメータを最大化することができます。
また、以下の対数損失方程式に置き換えることもできます。
対数損失は微分可能であるため、勾配ベースの手法を用いてモデルを最適化できる。目的関数は凸関数であるため、大域的最適解が保証される。対数尤度の勾配は次のように表される。
どこ期待は。
上記の方法は、分類対象の数が比較的少ない場合に効率的な計算を可能にする。
2 つのモデリング方法にはそれぞれ長所と短所があるため、両方のアプローチを組み合わせることが実践上良いモデリングになります。たとえば、Marras の論文「変形可能なモデルの構築と分類のための共同識別生成モデル」 [ 3 ]では、彼と共著者はモデルの顔分類に 2 つのモデリングの組み合わせを適用し、従来のアプローチよりも高い精度を得ています。
同様に、Kelm [ 4 ]も、多条件学習によるピクセル分類のための生成モデルと識別モデルの組み合わせに関する論文で、ピクセル分類のための 2 つのモデリングの組み合わせを提案しました。
クラスタリングの前に識別特徴を抽出するプロセスでは、主成分分析(PCA) は一般的に使用されていますが、必ずしも識別的なアプローチではありません。対照的に、LDA は識別的なアプローチです。[ 5 ]線形判別分析(LDA) は、上記で挙げた欠点を解消する効率的な方法を提供します。ご存知のように、識別モデルは分類の前に複数のサブタスクの組み合わせを必要とし、LDA は次元を削減することでこの問題に対する適切な解決策を提供します。
判別モデルの例としては、以下のようなものがある。