背景 多項ロジスティック回帰は、対象となる従属変数が 名義変数 (つまりカテゴリ変数 、意味のある順序付けができない一連のカテゴリのいずれかに分類される変数)であり、かつカテゴリが2つ以上ある場合に使用されます。例としては、以下のようなものがあります。
成績や好み、嫌いなことなどを考慮すると、大学生はどの専攻を選ぶだろうか? 様々な診断検査の結果から、その人の血液型はどれか? ハンズフリーの携帯電話ダイヤルアプリにおいて、音声信号の様々な特性を考慮すると、誰の名前が発話されたと判断できますか? 特定の人口統計学的特性を考慮した場合、人はどの候補者に投票するだろうか? 企業の特性と様々な候補国の特性を考慮した場合、企業はどの国にオフィスを設置するだろうか? これらはすべて統計的分類 問題です。共通しているのは、意味のある順序付けができない限られた項目セットから得られる予測対象の従属変数と、従属変数を予測するために使用される 独立変数 セット(特徴量、説明変数などとも呼ばれます)です。多項ロジスティック回帰は、観測された特徴量の線形結合と問題固有のパラメータを使用して従属変数の各値の確率を推定する分類問題の特定の解法です。特定の問題に対するパラメータの最適な値は、通常、トレーニングデータ(たとえば、診断検査結果と血液型がわかっている人、または既知の単語が話されている例など)から決定されます。
前提条件 多項ロジスティックモデルは、データがケース固有であると仮定します。つまり、各独立変数は各ケースに対して単一の値を持ちます。他のタイプの回帰と同様に、独立変数が互いに統計的に独立している必要はありません(たとえば、 ナイーブベイズ分類器 とは異なります)。ただし、多重共線性は 比較的低いと仮定されます。そうでない場合、複数の変数の影響を区別することが難しくなるためです。[ 5 ]
多項ロジットを用いて選択をモデル化する場合、無関係な選択肢の独立性 (IIA)という仮定に依存しますが、これは必ずしも望ましいものではありません。この仮定は、ある選択肢を別の選択肢よりも好む確率は、他の「無関係な」選択肢の有無に依存しないというものです。例えば、自転車が選択肢として追加されたとしても、通勤に車やバスを利用する相対的な確率は変わりません。これにより、K個の選択肢の選択を、 K - 1個の独立した二項選択のセットとしてモデル化できます 。このセットでは、1つの選択肢が「ピボット」として選択され、他のK - 1個の選択肢が1つずつそれと比較されます。IIA仮説は合理的選択理論の中核となる仮説ですが、心理学の多くの研究では、個人が選択を行う際にこの仮定に違反することが多いことが示されています。問題となるケースの例として、選択肢に車と青いバスが含まれる場合が挙げられます。両者のオッズ比が1 :1だと仮定します。ここで、赤いバスという選択肢が導入された場合、人は赤いバスと青いバスのどちらを選んでも構わないと考え、車 :青いバス :赤いバスのオッズ比を1 :0.5 :0.5とする可能性があります。つまり、車:バスの比率は1 :1のまま維持しつつ、車:青いバスの比率を1:0.5に 変更することになります。この場合、赤いバスという選択肢は実際には無関係ではありませんでした。なぜなら、赤いバスは青いバスの完全な代替品だったからです。
選択をモデル化するために多項ロジットを使用する場合、状況によっては、異なる選択肢間の相対的な選好に過度に制約を課す可能性があります。分析の目的が、1 つの選択肢が消滅した場合(たとえば、3 人の候補者がいる選挙から 1 人の候補者が撤退した場合)に選択がどのように変化するかを予測することである場合は、特に考慮する必要があります。ネストされたロジット や多項プロビット などの他のモデルは、IIA の違反を許容するため、このような場合に使用できます。[ 6 ]
モデル
導入 多項ロジスティック回帰の基礎となる数学モデルを記述する方法は複数あり、それぞれ同等の表現が存在します。そのため、異なる文献におけるこのテーマの扱い方を比較することは困難です。ロジスティック回帰 に関する本稿では、単純ロジスティック回帰の同等の定式化をいくつか紹介しており、これらの多くは多項ロジットモデルにも類似の表現が存在します。
他の多くの統計的分類 手法と同様に、これらの手法の根底にある考え方は、与えられた観測値の説明変数(特徴)と内積を用いて 線形結合さ れた一連の重みからスコアを構築する線形予測関数 を構築することである。
スコア ( X 私 、 k ) = β k ⋅ X 私 、 {\displaystyle \operatorname {score} (\mathbf {X} _{i},k)={\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i},} ここで、X i は観測i を説明する説明変数のベクトル、β k は結果k に対応する重み(または回帰係数 )のベクトル、score( X i , k ) は観測 i を カテゴリk に割り当てることに関連付けられたスコアです。離散選択 理論では、観測は人を表し、結果は選択を表すため、スコアは人i が 結果kを選択することに関連付けられた 効用 とみなされます。予測された結果は、最も高いスコアを持つものです。
多項ロジットモデルと、同じ基本設定を持つ他の多くの手法、モデル、アルゴリズム(パーセプトロン アルゴリズム、サポートベクターマシン 、線形判別分析 など)との違いは、最適な重み/係数を決定(学習)する手順と、スコアの解釈方法にあります。特に、多項ロジットモデルでは、スコアを直接確率値に変換できます。これは、観測の測定された特性に基づいて、観測iが 結果kを選択する 確率 を示します。これにより、特定の多項ロジットモデルの予測を、それぞれに誤差が生じる可能性のある複数の予測を含む、より大きな手順に組み込むための原理に基づいた方法が提供されます。このような予測を組み合わせる手段がない場合、誤差は増幅する傾向があります。例えば、大規模な予測モデル を、一連のサブモデルに分割し、あるサブモデルの予測結果を別のサブモデルの入力として使用し、その予測結果をさらに別のサブモデルの入力として使用する、といったように分割していく場合を考えてみましょう。各サブモデルの予測精度が90%で、5つのサブモデルが直列に接続されている場合、全体のモデルの精度は0.95 = 59%にしかなりません。 各サブモデルの精度が80%の場合、全体の精度は0.85 = 33%に低下します。 この問題は誤差伝播 として知られており、通常多数の部分から構成される現実世界の予測モデルでは深刻な問題となります。この問題を軽減する一つの方法として、単一の最適な予測を行うのではなく、起こりうる各結果の確率を予測することが挙げられます。
設定 基本的な設定はロジスティック回帰 と同じですが、唯一の違いは従属変数 が二値変数 ではなくカテゴリ変数である点です。つまり、結果は2つではなく K個 存在することになります。以下の説明はやや簡略化されています。詳細については、ロジスティック回帰に関する 記事を参照してください。
データポイント 具体的には、 N 個の 観測データポイントの系列があると仮定します。各データポイントi (1 から N まで) は、M 個の説明変数x 1, i ... x M,i (独立変数 、予測変数、特徴量などとも呼ばれます) と、それに関連付けられたカテゴリカルな 結果Y i (従属変数 、応答変数とも呼ばれます) から構成され、 Y i はK 個の可能な値のいずれかを取ることができます。これらの可能な値は、論理的に分離したカテゴリ (たとえば、異なる政党、血液型など) を表し、多くの場合、それぞれに 1 からKまでの番号を任意に割り当てることで数学的に記述されます。説明変数と結果は、データポイントの観測された特性を表し、多くの場合、 N 個 の「実験」の観測に由来すると考えられます。ただし、「実験」は単にデータを収集することだけで構成される場合もあります。多項ロジスティック回帰の目的は、説明変数と結果変数の関係を説明するモデルを構築することです。これにより、説明変数は既知であるが結果変数は未知である新たなデータポイントに対して、新たな「実験」の結果を正確に予測することが可能になります。この過程で、モデルは異なる説明変数が結果変数に及ぼす相対的な影響を説明しようと試みます。
いくつかの例を挙げます。
観察される結果は、患者群における肝炎 などの疾患の様々な病型(「疾患なし」やその他の関連疾患を含む場合もある)であり、説明変数としては、関連性があると考えられる患者の特性(性別、人種、年齢、血圧 、各種肝機能検査の結果など)が挙げられる。目標は、新たな患者において観察された肝臓関連症状の原因となっている疾患を予測することである。 観測される結果は、選挙で人々が選んだ政党であり、説明変数は各個人の人口統計学的特性(性別、人種、年齢、収入など)である。目標は、与えられた特性を持つ新規有権者の投票行動を予測することである。
線形予測器 他の線形回帰と同様に、多項ロジスティック回帰では線形予測関数を使用する。 f ( k 、 私 ) {\displaystyle f(k,i)} 観測値i が結果k となる確率を、以下の形式で予測する。
f ( k 、 私 ) = β 0 、 k + β 1 、 k x 1 、 私 + β 2 、 k x 2 、 私 + ⋯ + β M 、 k x M 、 私 、 {\displaystyle f(k,i)=\beta _{0,k}+\beta _{1,k}x_{1,i}+\beta _{2,k}x_{2,i}+\cdots +\beta _{M,k}x_{M,i},} どこβ m 、 k \displaystyle \beta _{m,k}} は、 m 番目の説明変数とk 番目の結果変数に関連付けられた回帰係数 です。ロジスティック回帰の 記事で説明されているように、回帰係数と説明変数は通常、サイズM + 1 のベクトルにグループ化されるため、予測関数をより簡潔に記述できます。
f ( k 、 私 ) = β k ⋅ x 私 、 {\displaystyle f(k,i)={\boldsymbol {\beta }}_{k}\cdot \mathbf {x} _{i},} どこβ k {\displaystyle {\boldsymbol {\beta }}_{k}} は結果k に関連付けられた回帰係数のセットであり、x 私 {\displaystyle \mathbf {x} _{i}} (行ベクトル)は、観測値i に関連付けられた説明変数のセットであり、エントリ 0 の先頭に 1 が付加されています。
独立した二項回帰のセットとして 多項ロジットモデルを導出するには、K個 の可能な結果に対して、K 個の独立した二項ロジスティック回帰モデルを実行することを想定できます。このモデルでは、1つの結果を「ピボット」として選択し、残りのK - 1個の結果をピボット結果に対して個別に回帰分析します。結果K (最後の結果)をピボットとして選択した 場合、 K - 1個の回帰方程式は次のようになります。
ln 教授 ( Y 私 = k ) 教授 ( Y 私 = K ) = β k ⋅ X 私 、 1 ≤ k < K {\displaystyle \ln {\frac {\Pr(Y_{i}=k)}{\Pr(Y_{i}=K)}}\,=\,{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i},\;\;\;\;\;\;1\leq k<K} 。この定式化は、構成データ分析で一般的に使用される加法対数比 変換としても知られています。他のアプリケーションでは、「相対リスク」と呼ばれています。[ 7 ]
両辺を指数化して確率を求めると、次の式が得られます。
教授 ( Y 私 = k ) = 教授 ( Y 私 = K ) e β k ⋅ X 私 、 1 ≤ k < K {\displaystyle \Pr(Y_{i}=k)\,=\,{\Pr(Y_{i}=K)}\;e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}},\;\;\;\;\;\;1\leq k<K} K 個の確率の合計が1になるという事実を用いると、次のことがわかる。
教授 ( Y 私 = K ) = 1 − ∑ j = 1 K − 1 教授 ( Y 私 = j ) = 1 − ∑ j = 1 K − 1 教授 ( Y 私 = K ) e β j ⋅ X 私 ⇒ 教授 ( Y 私 = K ) = 1 1 + ∑ j = 1 K − 1 e β j ⋅ X 私 。 {\displaystyle {\begin{aligned}\Pr(Y_{i}=K)={}&1-\sum _{j=1}^{K-1}\Pr(Y_{i}=j)\\={}&1-\sum _{j=1}^{K-1}{\Pr(Y_{i}=K)}\;e^{{\boldsymbol {\beta }}_{j}\cdot \mathbf {X} _{i}}\;\;\Rightarrow \;\;\Pr(Y_{i}=K)\\={}&{\frac {1}{1+\sum _{j=1}^{K-1}e^{{\boldsymbol {\beta }}_{j}\cdot \mathbf {X} _{i}}}}.\end{aligned}}} これを利用して、他の確率を求めることができます。
教授 ( Y 私 = k ) = e β k ⋅ X 私 1 + ∑ j = 1 K − 1 e β j ⋅ X 私 、 1 ≤ k < K {\displaystyle \Pr(Y_{i}=k)={\frac {e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}}{1+\sum _{j=1}^{K-1}e^{{\boldsymbol {\beta }}_{j}\cdot \mathbf {X} _{i}}}},\;\;\;\;\;\;1\leq k<K} 。複数の回帰分析を実行するという事実は、なぜこのモデルが上述の無関係な選択肢の独立性という仮定に基づいているのかを明らかにしている。
対数線形モデルとして 二項ロジスティック回帰を対数線形モデル として定式化する手法は、多変量回帰に直接拡張できます。つまり、線形予測子と追加の正規化係数である分割 関数 の対数を用いて、特定の出力が発生する確率の対数 をモデル化します。
ln 教授 ( Y 私 = k ) = β k ⋅ X 私 − ln Z 、 1 ≤ k ≤ K 。 {\displaystyle \ln \Pr(Y_{i}=k)={\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}-\ln Z,\;\;\;\;\;\;1\leq k\leq K.} 二値の場合と同様に、追加の項が必要です− ln Z {\displaystyle -\ln Z} 確率の集合全体が確率分布 を形成するように、つまり、それらすべての合計が1になるようにする。
∑ k = 1 K 教授 ( Y 私 = k ) = 1 {\displaystyle \sum _{k=1}^{K}\Pr(Y_{i}=k)=1} 通常のように乗算するのではなく、正規化を保証するために項を追加する必要がある理由は、確率の対数を取っているためです。両辺を指数化することで、加法項が乗法因子に変わり、確率はギブス測度に なります。
教授 ( Y 私 = k ) = 1 Z e β k ⋅ X 私 、 1 ≤ k ≤ K 。 {\displaystyle \Pr(Y_{i}=k)={\frac {1}{Z}}e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}},\;\;\;\;\;\;1\leq k\leq K.} 量Zは、分布の 分配関数 と呼ばれます。分配関数の値は、すべての確率の合計が1になるという上記の制約を適用することで計算できます。
1 = ∑ k = 1 K 教授 ( Y 私 = k ) = ∑ k = 1 K 1 Z e β k ⋅ X 私 = 1 Z ∑ k = 1 K e β k ⋅ X 私 。 {\displaystyle 1=\sum _{k=1}^{K}\Pr(Y_{i}=k)\;=\;\sum _{k=1}^{K}{\frac {1}{Z}}e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}\;=\;{\frac {1}{Z}}\sum _{k=1}^{K}e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}.} したがって
Z = ∑ k = 1 K e β k ⋅ X 私 。 {\displaystyle Z=\sum _{k=1}^{K}e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}.} この係数は、確率分布が定義される変数であるY i の関数ではないという意味で「定数」であることに注意してください。しかし、説明変数に関して、あるいは決定的に重要な点として、何らかの最適化 手順によって決定する必要のある未知の回帰係数β k に関して、この係数は決して定数ではありません。
結果として得られる確率の式は以下のとおりです。
教授 ( Y 私 = k ) = e β k ⋅ X 私 ∑ j = 1 K e β j ⋅ X 私 、 1 ≤ k ≤ K 。 {\displaystyle \Pr(Y_{i}=k)={\frac {e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}}{\sum _{j=1}^{K}e^{{\boldsymbol {\beta }}_{j}\cdot \mathbf {X} _{i}}}},\;\;\;\;\;\;1\leq k\leq K.}
以下の機能:
ソフトマックス ( k 、 s 1 、 … 、 s K ) = e s k ∑ j = 1 K e s j {\displaystyle \operatorname {softmax} (k,s_{1},\ldots ,s_{K})={\frac {e^{s_{k}}}{\sum _{j=1}^{K}e^{s_{j}}}}} これはソフトマックス関数 と呼ばれます。その理由は、値を指数化する効果がs 1 、 … 、 s K {\displaystyle s_{1},\ldots ,s_{K}} 両者の違いを誇張することである。その結果、ソフトマックス ( k 、 s 1 、 … 、 s K ) {\displaystyle \operatorname {softmax} (k,s_{1},\ldots ,s_{K})} 0に近い値を返すs k {\displaystyle s_{k}} はすべての値の最大値よりもかなり小さく、最大値に適用すると、次に大きい値に極めて近い場合を除き、1に近い値を返します。したがって、ソフトマックス関数は、滑らかな関数(簡単に 微分 できるなど)として振る舞い、指示関数を 近似する加重平均を構築するために使用できます。
f ( k ) = { 1 もし k = 引数 最大 j s j 、 0 さもないと 。 {\displaystyle f(k)={\begin{cases}1&{\textrm {if}}\;k=\operatorname {\arg \max } _{j}s_{j},\\0&{\textrm {otherwise}}.\end{cases}}} したがって、確率方程式は次のように書くことができます。
教授 ( Y 私 = k ) = ソフトマックス ( k 、 β 1 ⋅ X 私 、 … 、 β K ⋅ X 私 ) {\displaystyle \Pr(Y_{i}=k)=\operatorname {softmax} (k,{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i},\ldots ,{\boldsymbol {\beta }}_{K}\cdot \mathbf {X} _{i})} したがって、ソフトマックス関数は、二項ロジスティック回帰におけるロジスティック関数 と同等の役割を果たす。
すべてのβ k {\displaystyle {\boldsymbol {\beta }}_{k}} 係数ベクトルは一意に識別可能 です。これは、すべての確率の合計が 1 になる必要があるため、残りのすべてがわかれば、そのうちの 1 つが完全に決定されるためです。結果として、係数ベクトルは 1 つしか存在しません。K − 1 {\displaystyle K-1} 個別に指定可能な確率、したがってK − 1 {\displaystyle K-1} 係数のベクトルはそれぞれ識別可能である。これを理解する一つの方法は、すべての係数ベクトルに定数ベクトルを加えると、方程式が同一になることに注目することである。
e ( β k + C ) ⋅ X 私 ∑ j = 1 K e ( β j + C ) ⋅ X 私 = e β k ⋅ X 私 e C ⋅ X 私 ∑ j = 1 K e β j ⋅ X 私 e C ⋅ X 私 = e C ⋅ X 私 e β k ⋅ X 私 e C ⋅ X 私 ∑ j = 1 K e β j ⋅ X 私 = e β k ⋅ X 私 ∑ j = 1 K e β j ⋅ X 私 {\displaystyle {\begin{aligned}{\frac {e^{({\boldsymbol {\beta }}_{k}+\mathbf {C} )\cdot \mathbf {X} _{i}}}{\sum _{j=1}^{K}e^{({\boldsymbol {\beta }}_{j}+\mathbf {C} )\cdot \mathbf {X} _{i}}}}&={\frac {e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}e^{\mathbf {C} \cdot \mathbf {X} _{i}}}{\sum _{j=1}^{K}e^{{\boldsymbol {\beta }}_{j}\cdot \mathbf {X} _{i}}e^{\mathbf {C} \cdot \mathbf {X} _{i}}}}\\&={\frac {e^{\mathbf {C} \cdot \mathbf {X} _{i}}e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}}{e^{\mathbf {C} \cdot \mathbf {X} _{i}}\sum _{j=1}^{K}e^{{\boldsymbol {\beta }}_{j}\cdot \mathbf {X} _{i}}}}\\&={\frac {e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}}{\sum _{j=1}^{K}e^{{\boldsymbol {\beta }}_{j}\cdot \mathbf {X} _{i}}}}\end{aligned}}} その結果、設定するのが一般的であるC = − β K {\displaystyle \mathbf {C} =-{\boldsymbol {\beta }}_{K}} (または、他の係数ベクトルのいずれか)。基本的に、定数を設定して、ベクトルの1つが0 {\displaystyle {\boldsymbol {0}}} そして、他のすべてのベクトルは、それらのベクトルと選択したベクトルとの差に変換されます。これは、K 個 の選択肢のうちの 1 つを中心に「ピボット」し、他のK − 1 個の選択肢が、中心となる選択肢と比較してどれだけ優れているか、あるいは劣っているかを調べることに相当します。数学的には、係数は次のように変換されます。
β k ′ = β k − β K 、 1 ≤ k < K 、 β K ′ = 0. {\displaystyle {\begin{aligned}{\boldsymbol {\beta }}'_{k}&={\boldsymbol {\beta }}_{k}-{\boldsymbol {\beta }}_{K},\;\;\;\;1\leq k<K,\\{\boldsymbol {\beta }}'_{K}&=0.\end{aligned}}} これにより、以下の式が得られます。
教授 ( Y 私 = k ) = e β k ′ ⋅ X 私 1 + ∑ j = 1 K − 1 e β j ′ ⋅ X 私 、 1 ≤ k ≤ K {\displaystyle \Pr(Y_{i}=k)={\frac {e^{{\boldsymbol {\beta }}'_{k}\cdot \mathbf {X} _{i}}}{1+\sum _{j=1}^{K-1}e^{{\boldsymbol {\beta }}'_{j}\cdot \mathbf {X} _{i}}}},\;\;\;\;\;\;1\leq k\leq K} 回帰係数にプライム記号が付いている点を除けば、これはK - 1個の独立した2方向回帰という観点から、上述のモデルの形式と全く同じである。
潜在変数モデルとして 多項ロジスティック回帰は、二項ロジスティック回帰で説明した二方向潜在変数モデル に倣って、潜在変数モデルとして定式化することも可能です。この定式化は離散選択 モデルの理論において一般的であり、多項ロジスティック回帰を関連する多項プロビット モデルと比較しやすくするだけでなく、より複雑なモデルへの拡張も容易にします。
各データポイントi と可能な結果k = 1,2,..., K に対して、次のような分布に従う連続潜在変数 Y i,k * (つまり、観測されない確率変数) が存在すると想像してください。
Y 私 、 k * = β k ⋅ X 私 + ε k 、 k ≤ K {\displaystyle Y_{i,k}^{\ast }={\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}+\varepsilon _{k}\;\;\;\;,\;\;k\leq K} どこε k ~ EV 1 ( 0 、 1 ) 、 {\displaystyle \varepsilon _{k}\sim \operatorname {EV} _{1}(0,1),} つまり、標準的なタイプ1の極値分布 です。
この潜在変数は、データポイントi が結果kを選択した場合の 効用 と考えることができます。ただし、実際に得られる効用の量にはある程度のランダム性があり、これは選択に影響を与える他のモデル化されていない要因を考慮に入れています。実際の変数の値はY 私 {\displaystyle Y_{i}} は、これらの潜在変数から非ランダムな方法で決定されます(つまり、ランダム性は観測された結果から潜在変数に移されています)。結果k は、関連する効用(値)が Y 私 、 k * {\displaystyle Y_{i,k}^{\ast }} )は他のすべての選択肢の効用よりも大きい、つまり結果k に関連付けられた効用がすべての効用の最大値である場合です。潜在変数は連続で あるため、2 つの値がまったく同じになる確率は 0 なので、このシナリオは無視します。つまり、次のようになります。
教授 ( Y 私 = 1 ) = 教授 ( Y 私 、 1 * > Y 私 、 2 * そして Y 私 、 1 * > Y 私 、 3 * そして ⋯ そして Y 私 、 1 * > Y 私 、 K * ) 教授 ( Y 私 = 2 ) = 教授 ( Y 私 、 2 * > Y 私 、 1 * そして Y 私 、 2 * > Y 私 、 3 * そして ⋯ そして Y 私 、 2 * > Y 私 、 K * ) ⋮ 教授 ( Y 私 = K ) = 教授 ( Y 私 、 K * > Y 私 、 1 * そして Y 私 、 K * > Y 私 、 2 * そして ⋯ そして Y 私 、 K * > Y 私 、 K − 1 * ) {\displaystyle {\begin{aligned}\Pr(Y_{i}=1)&=\Pr(Y_{i,1}^{\ast }>Y_{i,2}^{\ast }{\text{ and }}Y_{i,1}^{\ast }>Y_{i,3}^{\ast }{\text{ and }}\cdots {\text{ and }}Y_{i,1}^{\ast }>Y_{i,K}^{\ast })\\\Pr(Y_{i}=2)&=\Pr(Y_{i,2}^{\ast }>Y_{i,1}^{\ast }{\text{ and }}Y_{i,2}^{\ast }>Y_{i,3}^{\ast }{\text{ and }}\cdots {\text{ and }}Y_{i,2}^{\ast }>Y_{i,K}^{\ast })\\&\,\,\,\vdots \\\Pr(Y_{i}=K)&=\Pr(Y_{i,K}^{\ast }>Y_{i,1}^{\ast }{\text{ and }}Y_{i,K}^{\ast }>Y_{i,2}^{\ast }{\text{ and }}\cdots {\text{ and }}Y_{i,K}^{\ast }>Y_{i,K-1}^{\ast })\\\end{aligned}}} あるいは同等に:
教授 ( Y 私 = k ) = 教授 ( 最大 ( Y 私 、 1 * 、 Y 私 、 2 * 、 … 、 Y 私 、 K * ) = Y 私 、 k * ) 、 k ≤ K {\displaystyle \Pr(Y_{i}=k)\;=\;\Pr(\max(Y_{i,1}^{\ast },Y_{i,2}^{\ast },\ldots ,Y_{i,K}^{\ast })=Y_{i,k}^{\ast })\;\;\;\;,\;\;k\leq K} 最初の式を詳しく見てみましょう。これは次のように書くことができます。
教授 ( Y 私 = 1 ) = 教授 ( Y 私 、 1 * > Y 私 、 k * ∀ k = 2 、 … 、 K ) = 教授 ( Y 私 、 1 * − Y 私 、 k * > 0 ∀ k = 2 、 … 、 K ) = 教授 ( β 1 ⋅ X 私 + ε 1 − ( β k ⋅ X 私 + ε k ) > 0 ∀ k = 2 、 … 、 K ) = 教授 ( ( β 1 − β k ) ⋅ X 私 > ε k − ε 1 ∀ k = 2 、 … 、 K ) {\displaystyle {\begin{aligned}\Pr(Y_{i}=1)&=\Pr(Y_{i,1}^{\ast }>Y_{i,k}^{\ast }\ \forall \ k=2,\ldots ,K)\\&=\Pr(Y_{i,1}^{\ast }-Y_{i,k}^{\ast }>0\ \forall \ k=2,\ldots ,K)\\&=\Pr({\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}+\varepsilon _{1}-({\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}+\varepsilon _{k})>0\ \forall \ k=2,\ldots ,K)\\&=\Pr(({\boldsymbol {\beta }}_{1}-{\boldsymbol {\beta }}_{k})\cdot \mathbf {X} _{i}>\varepsilon _{k}-\varepsilon _{1}\ \forall \ k=2,\ldots ,K)\end{aligned}}} ここで留意すべき点がいくつかあります。
一般的に、もしX ~ EV 1 ( 1 、 b ) {\displaystyle X\sim \operatorname {EV} _{1}(a,b)} そしてY ~ EV 1 ( 1 、 b ) {\displaystyle Y\sim \operatorname {EV} _{1}(a,b)} それからX − Y ~ 物流 ( 0 、 b ) 。 {\displaystyle X-Y\sim \operatorname {Logistic} (0,b).} つまり、独立で同一分布に従う 2つの極値分布変数の差はロジスティック分布 に従い、最初のパラメータは重要ではありません。これは、最初のパラメータが位置パラメータ 、つまり平均値を一定量だけシフトさせるものであり、2つの値が両方とも同じ量だけシフトされた場合、その差は同じままであることから理解できます。これは、特定の選択の確率の根底にあるすべての関係式がロジスティック分布に関係していることを意味し、一見恣意的に思えた極値分布という最初の選択が、いくらか理解しやすくなります。 極値分布またはロジスティック分布の 2 番目のパラメータはスケール パラメータ であり、X ~ 物流 ( 0 、 1 ) {\displaystyle X\sim \operatorname {Logistic} (0,1)} それからb X ~ 物流 ( 0 、 b ) 。 {\displaystyle bX\sim \operatorname {Logistic} (0,b).} これは、スケール1の代わりに任意のスケールパラメータを持つ誤差変数を使用した場合の影響は、すべての回帰ベクトルに同じスケールを乗じるだけで簡単に補償できることを意味します。前の点と合わせて考えると、誤差変数に標準的な極値分布(位置0、スケール1)を使用しても、任意の極値分布を使用した場合と比べて一般性が損なわれることはないことがわかります。実際、より一般的な分布を使用した場合、モデルは識別不可能 (最適な係数の単一のセットが存在しない)になります。 回帰係数ベクトルの差分のみが使用されるため、すべての係数ベクトルに任意の定数を加えてもモデルには影響がありません。つまり、対数線形モデルと同様に、係数ベクトルのうちK - 1個のみが識別可能であり、最後の1つは任意の値(例えば0)に設定できます。 実際に上記の確率の値を求めるのはやや難しく、一連の値の中から特定の順序統計量 (最初の値、つまり最大値)を計算する問題となります。しかし、得られる式は上記の定式化と同じであり、両者は等価であることが示せます。
切片の推定 多項ロジスティック回帰を用いる場合、従属変数のカテゴリのうち1つを基準カテゴリとして選択します。基準カテゴリを除く従属変数の各カテゴリについて、すべての独立変数のオッズ比を 個別に算出します。基準カテゴリは分析から除外されます。指数ベータ係数は、対応する独立変数が1単位変化したときの、基準カテゴリに対する従属変数が特定のカテゴリに属するオッズの変化を表します。
尤度関数 観測値y 私 ∈ { 1 、 … 、 K } {\displaystyle y_{i}\in \{1,\dots ,K\}} のために私 = 1 、 … 、 n {\displaystyle i=1,\dots ,n} 説明された変数は、確率的に独立でカテゴリカルに分布する ランダム変数の実現値とみなされる。Y 1 、 … 、 Y n {\displaystyle Y_{1},\dots ,Y_{n}} 。
このモデルの尤度関数は次のように定義されます。
L = ∏ 私 = 1 n P ( Y 私 = y 私 ) = ∏ 私 = 1 n ∏ j = 1 K P ( Y 私 = j ) δ j 、 y 私 、 {\displaystyle L=\prod _{i=1}^{n}P(Y_{i}=y_{i})=\prod _{i=1}^{n}\prod _{j=1}^{K}P(Y_{i}=j)^{\delta _{j,y_{i}}},} インデックス私 {\displaystyle i} は観測値1からn を表し、インデックスはj {\displaystyle j} はクラス1からK を表します。δ j 、 y 私 = { 1 、 のために j = y 私 0 、 さもないと {\displaystyle \delta _{j,y_{i}}={\begin{cases}1,{\text{ for }}j=y_{i}\\0,{\text{ otherwise}}\end{cases}}} はクロネッカーデルタ です。
したがって、負の対数尤度関数は、よく知られている交差エントロピーである。
− ログ L = − ∑ 私 = 1 n ∑ j = 1 K δ j 、 y 私 ログ ( P ( Y 私 = j ) ) = − ∑ j = 1 K ∑ y 私 = j ログ ( P ( Y 私 = j ) ) 。 {\displaystyle -\log L=-\sum _{i=1}^{n}\sum _{j=1}^{K}\delta _{j,y_{i}}\log(P(Y_{i}=j))=-\sum _{j=1}^{K}\sum _{y_{i}=j}\log(P(Y_{i}=j)).}
自然言語処理への応用 自然言語処理 では、多項ロジスティック回帰分類器は、予測子として機能する確率変数(一般に特徴量と呼ばれる)の 統計的独立性を 仮定しないため、ナイーブベイズ分類器 の代替としてよく使用されます。ただし、このようなモデルでの学習はナイーブベイズ分類器よりも遅いため、学習するクラスの数が非常に多い場合には適切ではない可能性があります。特に、ナイーブベイズ分類器での学習は、特徴量とクラスの共起数を数えるだけの簡単な作業ですが、最大エントロピー分類器では、通常、最大事後確率 (MAP)推定を使用して最大化される重みを反復手順を使用して学習する必要があります。#係数の推定を 参照してください。
参考文献 ↑ グリーン、ウィリアム H. (2012).計量経済学分析 (第7 版). ボストン:ピアソン・エデュケーション. pp. 803–806 . ISBN 978-0-273-75356-8 。↑ Engel, J. (1988). "多項ロジスティック回帰". Statistica Neerlandica . 42 (4): 233– 252. doi : 10.1111/j.1467-9574.1988.tb01238.x . ↑ メナード、スコット ( 2002)。 応用ロジスティック回帰分析 。SAGE。91ページ 。ISBN 9780761922087 。1 2 Malouf, Robert (2002). 最大エントロピーパラメータ推定のためのアルゴリズムの比較 (PDF) . 第6回自然言語学習会議 (CoNLL). pp. 49–55 . ↑ ベルスリー、デイビッド (1991). 条件付け診断 : 回帰における共線性と弱データ . ニューヨーク: ワイリー. ISBN 9780471528890 。↑ Baltas, G.; Doyle, P. (2001). "マーケティングリサーチにおけるランダム効用モデル:概説". Journal of Business Research . 51 (2): 115– 125. doi : 10.1016/S0148-2963(99)00058-2 . ↑ Stataマニュアル「mlogit — 多項ロジスティック回帰」 ↑ Darroch, JN & Ratcliff, D. (1972). "対数線形モデルのための一般化反復スケーリング" . The Annals of Mathematical Statistics . 43 (5): 1470– 1480. doi : 10.1214/aoms/1177692379 . ↑ ビショップ、クリストファー M. (2006). パターン認識と機械学習 . Springer. pp. 206–209 . ↑ Yu, Hsiang-Fu; Huang, Fang-Lan; Lin, Chih-Jen (2011). "ロジスティック回帰と最大エントロピーモデルのためのデュアル座標降下法" (PDF) . Machine Learning . 85 ( 1– 2): 41– 75. doi : 10.1007/s10994-010-5221-8 .