統計学において、多項ロジスティック回帰は、ロジスティック回帰を多クラス問題、つまり2つ以上の離散的な結果を持つ問題に一般化した分類手法です。 [ 1 ]つまり、これは、一連の独立変数(実数値、二値、カテゴリ値など)が与えられた場合に、カテゴリ分布に従う従属変数 のさまざまな可能な結果の確率を予測するために使用されるモデルです。
多項ロジスティック回帰は、多項LR [ 2 ] [ 3 ] 、多クラスLR、ソフトマックス回帰、多項ロジット(mlogit)、最大エントロピー(MaxEnt)分類器、条件付き最大エントロピーモデルなど、さまざまな別名で知られています。[ 4 ]
多項ロジスティック回帰は、対象となる従属変数が名義変数(つまりカテゴリ変数、意味のある順序付けができない一連のカテゴリのいずれかに分類される変数)であり、かつカテゴリが2つ以上ある場合に使用されます。例としては、以下のようなものがあります。
これらはすべて統計的分類問題です。共通しているのは、意味のある順序付けができない限られた項目セットから得られる予測対象の従属変数と、従属変数を予測するために使用される独立変数セット(特徴量、説明変数などとも呼ばれます)です。多項ロジスティック回帰は、観測された特徴量の線形結合と問題固有のパラメータを使用して従属変数の各値の確率を推定する分類問題の特定の解法です。特定の問題に対するパラメータの最適な値は、通常、トレーニングデータ(たとえば、診断検査結果と血液型がわかっている人、または既知の単語が話されている例など)から決定されます。
多項ロジスティックモデルは、データがケース固有であると仮定します。つまり、各独立変数は各ケースに対して単一の値を持ちます。他のタイプの回帰と同様に、独立変数が互いに統計的に独立している必要はありません(たとえば、ナイーブベイズ分類器とは異なります)。ただし、多重共線性は比較的低いと仮定されます。そうでない場合、複数の変数の影響を区別することが難しくなるためです。[ 5 ]
多項ロジットを用いて選択をモデル化する場合、無関係な選択肢の独立性(IIA)という仮定に依存しますが、これは必ずしも望ましいものではありません。この仮定は、ある選択肢を別の選択肢よりも好む確率は、他の「無関係な」選択肢の有無に依存しないというものです。例えば、自転車が選択肢として追加されたとしても、通勤に車やバスを利用する相対的な確率は変わりません。これにより、K個の選択肢の選択を、 K - 1個の独立した二項選択のセットとしてモデル化できます 。このセットでは、1つの選択肢が「ピボット」として選択され、他のK - 1個の選択肢が1つずつそれと比較されます。IIA仮説は合理的選択理論の中核となる仮説ですが、心理学の多くの研究では、個人が選択を行う際にこの仮定に違反することが多いことが示されています。問題となるケースの例として、選択肢に車と青いバスが含まれる場合が挙げられます。両者のオッズ比が1 :1だと仮定します。ここで、赤いバスという選択肢が導入された場合、人は赤いバスと青いバスのどちらを選んでも構わないと考え、車 :青いバス :赤いバスのオッズ比を1 :0.5 :0.5とする可能性があります。つまり、車:バスの比率は1 :1のまま維持しつつ、車:青いバスの比率を1:0.5に 変更することになります。この場合、赤いバスという選択肢は実際には無関係ではありませんでした。なぜなら、赤いバスは青いバスの完全な代替品だったからです。
選択をモデル化するために多項ロジットを使用する場合、状況によっては、異なる選択肢間の相対的な選好に過度に制約を課す可能性があります。分析の目的が、1 つの選択肢が消滅した場合(たとえば、3 人の候補者がいる選挙から 1 人の候補者が撤退した場合)に選択がどのように変化するかを予測することである場合は、特に考慮する必要があります。ネストされたロジットや多項プロビットなどの他のモデルは、IIA の違反を許容するため、このような場合に使用できます。[ 6 ]
多項ロジスティック回帰の基礎となる数学モデルを記述する方法は複数あり、それぞれ同等の表現が存在します。そのため、異なる文献におけるこのテーマの扱い方を比較することは困難です。ロジスティック回帰に関する本稿では、単純ロジスティック回帰の同等の定式化をいくつか紹介しており、これらの多くは多項ロジットモデルにも類似の表現が存在します。
他の多くの統計的分類手法と同様に、これらの手法の根底にある考え方は、与えられた観測値の説明変数(特徴)と内積を用いて線形結合された一連の重みからスコアを構築する線形予測関数を構築することである。
ここで、X iは観測iを説明する説明変数のベクトル、β kは結果kに対応する重み(または回帰係数)のベクトル、score( X i , k ) は観測i をカテゴリkに割り当てることに関連付けられたスコアです。離散選択理論では、観測は人を表し、結果は選択を表すため、スコアは人i が結果kを選択することに関連付けられた効用とみなされます。予測された結果は、最も高いスコアを持つものです。
多項ロジットモデルと、同じ基本設定を持つ他の多くの手法、モデル、アルゴリズム(パーセプトロンアルゴリズム、サポートベクターマシン、線形判別分析など)との違いは、最適な重み/係数を決定(学習)する手順と、スコアの解釈方法にあります。特に、多項ロジットモデルでは、スコアを直接確率値に変換できます。これは、観測の測定された特性に基づいて、観測iが結果kを選択する確率を示します。これにより、特定の多項ロジットモデルの予測を、それぞれに誤差が生じる可能性のある複数の予測を含む、より大きな手順に組み込むための原理に基づいた方法が提供されます。このような予測を組み合わせる手段がない場合、誤差は増幅する傾向があります。例えば、大規模な予測モデルを、一連のサブモデルに分割し、あるサブモデルの予測結果を別のサブモデルの入力として使用し、その予測結果をさらに別のサブモデルの入力として使用する、といったように分割していく場合を考えてみましょう。各サブモデルの予測精度が90%で、5つのサブモデルが直列に接続されている場合、全体のモデルの精度は0.95 = 59%にしかなりません。各サブモデルの精度が80%の場合、全体の精度は0.85 = 33%に低下します。この問題は誤差伝播として知られており、通常多数の部分から構成される現実世界の予測モデルでは深刻な問題となります。この問題を軽減する一つの方法として、単一の最適な予測を行うのではなく、起こりうる各結果の確率を予測することが挙げられます。
基本的な設定はロジスティック回帰と同じですが、唯一の違いは従属変数が二値変数ではなくカテゴリ変数である点です。つまり、結果は2つではなくK個存在することになります。以下の説明はやや簡略化されています。詳細については、ロジスティック回帰に関する記事を参照してください。
具体的には、 N 個の観測データポイントの系列があると仮定します。各データポイントi (1 からNまで) は、M個の説明変数x 1, i ... x M,i (独立変数、予測変数、特徴量などとも呼ばれます) と、それに関連付けられたカテゴリカルな結果Y i (従属変数、応答変数とも呼ばれます) から構成され、 Y iはK個の可能な値のいずれかを取ることができます。これらの可能な値は、論理的に分離したカテゴリ (たとえば、異なる政党、血液型など) を表し、多くの場合、それぞれに 1 からKまでの番号を任意に割り当てることで数学的に記述されます。説明変数と結果は、データポイントの観測された特性を表し、多くの場合、 N 個の「実験」の観測に由来すると考えられます。ただし、「実験」は単にデータを収集することだけで構成される場合もあります。多項ロジスティック回帰の目的は、説明変数と結果変数の関係を説明するモデルを構築することです。これにより、説明変数は既知であるが結果変数は未知である新たなデータポイントに対して、新たな「実験」の結果を正確に予測することが可能になります。この過程で、モデルは異なる説明変数が結果変数に及ぼす相対的な影響を説明しようと試みます。
いくつかの例を挙げます。
他の線形回帰と同様に、多項ロジスティック回帰では線形予測関数を使用する。観測値iが結果kとなる確率を、以下の形式で予測する。
どこは、 m番目の説明変数とk番目の結果変数に関連付けられた回帰係数です。ロジスティック回帰の記事で説明されているように、回帰係数と説明変数は通常、サイズM + 1 のベクトルにグループ化されるため、予測関数をより簡潔に記述できます。
どこは結果kに関連付けられた回帰係数のセットであり、(行ベクトル)は、観測値iに関連付けられた説明変数のセットであり、エントリ 0 の先頭に 1 が付加されています。
多項ロジットモデルを導出するには、K個の可能な結果に対して、K個の独立した二項ロジスティック回帰モデルを実行することを想定できます。このモデルでは、1つの結果を「ピボット」として選択し、残りのK - 1個の結果をピボット結果に対して個別に回帰分析します。結果K(最後の結果)をピボットとして選択した 場合、 K - 1個の回帰方程式は次のようになります。
この定式化は、構成データ分析で一般的に使用される加法対数比変換としても知られています。他のアプリケーションでは、「相対リスク」と呼ばれています。[ 7 ]
両辺を指数化して確率を求めると、次の式が得られます。
K個の確率の合計が1になるという事実を用いると、次のことがわかる。
これを利用して、他の確率を求めることができます。
複数の回帰分析を実行するという事実は、なぜこのモデルが上述の無関係な選択肢の独立性という仮定に基づいているのかを明らかにしている。
The unknown parameters in each vector βk are typically jointly estimated by maximum a posteriori (MAP) estimation, which is an extension of maximum likelihood using regularization of the weights to prevent pathological solutions (usually a squared regularizing function, which is equivalent to placing a zero-mean Gaussianprior distribution on the weights, but other distributions are also possible). The solution is typically found using an iterative procedure such as generalized iterative scaling,[8]iteratively reweighted least squares (IRLS),[9] by means of gradient-based optimization algorithms such as L-BFGS,[4] or by specialized coordinate descent algorithms.[10]
The formulation of binary logistic regression as a log-linear model can be directly extended to multi-way regression. That is, we model the logarithm of the probability of seeing a given output using the linear predictor as well as an additional normalization factor, the logarithm of the partition function:
As in the binary case, we need an extra term to ensure that the whole set of probabilities forms a probability distribution, i.e. so that they all sum to one:
The reason why we need to add a term to ensure normalization, rather than multiply as is usual, is because we have taken the logarithm of the probabilities. Exponentiating both sides turns the additive term into a multiplicative factor, so that the probability is just the Gibbs measure:
The quantity Z is called the partition function for the distribution. We can compute the value of the partition function by applying the above constraint that requires all probabilities to sum to 1:
Therefore
Note that this factor is "constant" in the sense that it is not a function of Yi, which is the variable over which the probability distribution is defined. However, it is definitely not constant with respect to the explanatory variables, or crucially, with respect to the unknown regression coefficients βk, which we will need to determine through some sort of optimization procedure.
The resulting equations for the probabilities are
The following function:
これはソフトマックス関数と呼ばれます。その理由は、値を指数化する効果が両者の違いを誇張することである。その結果、0に近い値を返すはすべての値の最大値よりもかなり小さく、最大値に適用すると、次に大きい値に極めて近い場合を除き、1に近い値を返します。したがって、ソフトマックス関数は、滑らかな関数(簡単に微分できるなど)として振る舞い、指示関数を近似する加重平均を構築するために使用できます。
したがって、確率方程式は次のように書くことができます。
したがって、ソフトマックス関数は、二項ロジスティック回帰におけるロジスティック関数と同等の役割を果たす。
すべての係数ベクトルは一意に識別可能です。これは、すべての確率の合計が 1 になる必要があるため、残りのすべてがわかれば、そのうちの 1 つが完全に決定されるためです。結果として、係数ベクトルは 1 つしか存在しません。個別に指定可能な確率、したがって係数のベクトルはそれぞれ識別可能である。これを理解する一つの方法は、すべての係数ベクトルに定数ベクトルを加えると、方程式が同一になることに注目することである。
その結果、設定するのが一般的である(または、他の係数ベクトルのいずれか)。基本的に、定数を設定して、ベクトルの1つがそして、他のすべてのベクトルは、それらのベクトルと選択したベクトルとの差に変換されます。これは、K 個の選択肢のうちの 1 つを中心に「ピボット」し、他のK − 1 個の選択肢が、中心となる選択肢と比較してどれだけ優れているか、あるいは劣っているかを調べることに相当します。数学的には、係数は次のように変換されます。
これにより、以下の式が得られます。
回帰係数にプライム記号が付いている点を除けば、これはK - 1個の独立した2方向回帰という観点から、上述のモデルの形式と全く同じである。
多項ロジスティック回帰は、二項ロジスティック回帰で説明した二方向潜在変数モデルに倣って、潜在変数モデルとして定式化することも可能です。この定式化は離散選択モデルの理論において一般的であり、多項ロジスティック回帰を関連する多項プロビットモデルと比較しやすくするだけでなく、より複雑なモデルへの拡張も容易にします。
各データポイントiと可能な結果k = 1,2,..., Kに対して、次のような分布に従う連続潜在変数Y i,k * (つまり、観測されない確率変数) が存在すると想像してください。
どこつまり、標準的なタイプ1の極値分布です。
この潜在変数は、データポイントiが結果kを選択した場合の効用と考えることができます。ただし、実際に得られる効用の量にはある程度のランダム性があり、これは選択に影響を与える他のモデル化されていない要因を考慮に入れています。実際の変数の値はは、これらの潜在変数から非ランダムな方法で決定されます(つまり、ランダム性は観測された結果から潜在変数に移されています)。結果kは、関連する効用(値)が)は他のすべての選択肢の効用よりも大きい、つまり結果kに関連付けられた効用がすべての効用の最大値である場合です。潜在変数は連続であるため、2 つの値がまったく同じになる確率は 0 なので、このシナリオは無視します。つまり、次のようになります。
あるいは同等に:
最初の式を詳しく見てみましょう。これは次のように書くことができます。
ここで留意すべき点がいくつかあります。
実際に上記の確率の値を求めるのはやや難しく、一連の値の中から特定の順序統計量(最初の値、つまり最大値)を計算する問題となります。しかし、得られる式は上記の定式化と同じであり、両者は等価であることが示せます。
多項ロジスティック回帰を用いる場合、従属変数のカテゴリのうち1つを基準カテゴリとして選択します。基準カテゴリを除く従属変数の各カテゴリについて、すべての独立変数のオッズ比を個別に算出します。基準カテゴリは分析から除外されます。指数ベータ係数は、対応する独立変数が1単位変化したときの、基準カテゴリに対する従属変数が特定のカテゴリに属するオッズの変化を表します。
観測値のために説明された変数は、確率的に独立でカテゴリカルに分布するランダム変数の実現値とみなされる。。
このモデルの尤度関数は次のように定義されます。
インデックスは観測値1からnを表し、インデックスははクラス1からKを表します。はクロネッカーデルタです。
したがって、負の対数尤度関数は、よく知られている交差エントロピーである。
自然言語処理では、多項ロジスティック回帰分類器は、予測子として機能する確率変数(一般に特徴量と呼ばれる)の統計的独立性を仮定しないため、ナイーブベイズ分類器の代替としてよく使用されます。ただし、このようなモデルでの学習はナイーブベイズ分類器よりも遅いため、学習するクラスの数が非常に多い場合には適切ではない可能性があります。特に、ナイーブベイズ分類器での学習は、特徴量とクラスの共起数を数えるだけの簡単な作業ですが、最大エントロピー分類器では、通常、最大事後確率(MAP)推定を使用して最大化される重みを反復手順を使用して学習する必要があります。#係数の推定を参照してください。