
統計学では、ロジスティック モデル(またはロジット モデル) は、イベントの対数オッズを1 つ以上の独立変数の線形結合としてモデル化する統計モデルです。回帰分析では、ロジスティック回帰[ 1 ] (またはロジット回帰)は、ロジスティック モデルのパラメータ (線形または非線形結合の係数)を推定します。バイナリ ロジスティック回帰では、指示変数によってコード化された単一のバイナリ従属変数があり、2 つの値には「0」と「1」というラベルが付けられます。一方、独立変数はそれぞれバイナリ変数 (指示変数によってコード化された 2 つのクラス) または連続変数(任意の実数値)になります。ラベルが「1」の値に対応する確率は、0 (確実に値「0」) から 1 (確実に値「1」) の間で変化するため、ラベルが付けられます。[ 2 ]対数オッズを確率に変換する関数はロジスティック関数であるため、その名前が付けられています。対数オッズ尺度の測定単位は、 log istic unitに由来するlogitと呼ばれ、そのため別の名称も存在します。正式な数学的説明については「背景」および「定義」を、具体的な例については「例」を参照してください。
二値変数は、統計学において、チームが勝つ確率、患者が健康である確率など、特定のクラスやイベントが発生する確率をモデル化するために広く使用されています(§ アプリケーションを参照)。ロジスティック モデルは、 1970 年頃から二項回帰で最も一般的に使用されているモデルです。[ 3 ]可能な値が 2 つ以上ある場合(たとえば、画像が猫、犬、ライオンなどのいずれであるか)、二値変数はカテゴリ変数に一般化でき、二項ロジスティック回帰は多項ロジスティック回帰に一般化されます。複数のカテゴリが順序付けられている場合は、順序ロジスティック回帰を使用できます(たとえば、比例オッズ順序ロジスティック モデル[ 4 ])。さらなる拡張については、§ 拡張を参照してください。ロジスティック回帰モデル自体は、入力に基づいて出力の確率をモデル化するだけであり、統計的分類は行いません(分類器ではありません)。ただし、例えばカットオフ値を選択し、カットオフ値よりも高い確率を持つ入力を一方のクラスに、カットオフ値よりも低い確率を持つ入力をもう一方のクラスに分類することで、分類器を作成するために使用できます。これは、二値分類器を作成する一般的な方法です。
ロジスティック関数の代わりに異なるシグモイド関数を使用した二値変数の類似の線形モデル(線形結合を確率に変換するため)も使用できます。最も有名なのはプロビットモデルです。§ 代替案を参照してください。ロジスティックモデルの特徴は、独立変数の1つを増やすと、与えられた結果のオッズが一定の割合で乗法的にスケーリングされ、各独立変数には独自のパラメータがあることです。二値従属変数の場合、これはオッズ比を一般化したものです。より抽象的に言えば、ロジスティック関数はベルヌーイ分布の自然なパラメータであり、この意味で実数を確率に変換する「最も単純な」方法です。
ロジスティック回帰のパラメータは、最も一般的には最尤推定法(MLE) によって推定されます。線形最小二乗法とは異なり、閉形式の式はありません。§モデル適合を参照してください。MLE によるロジスティック回帰は、二値またはカテゴリカル応答に対して、 通常の最小二乗法(OLS) による線形回帰がスカラー応答に対して果たすのと同様に基本的な役割を果たします。つまり、シンプルでよく分析されたベースライン モデルです。§ 線形回帰との比較で議論を参照してください。 一般的な統計モデルとしてのロジスティック回帰は、もともとジョセフ・バークソン[ 5 ]によって開発され、主に普及しました。これは、バークソン (1944)で彼が「ロジット」という言葉を作り出したことから始まりました。§歴史を参照 してください。
ロジスティック回帰は、機械学習、ほとんどの医療分野、社会科学など、さまざまな分野で使用されています。たとえば、負傷した患者の死亡率を予測するために広く使用されている外傷および傷害重症度スコア( TRISS )は、もともとボイドらがロジスティック回帰を使用して開発したものです。[ 6 ] 患者の重症度を評価するために使用される他の多くの医療スケールは、ロジスティック回帰を使用して開発されています。[ 7 ] [ 8 ] [ 9 ] [ 10 ]ロジスティック回帰は、患者の観察された特性(年齢、性別、体格指数、さまざまな血液検査の結果など)に基づいて、特定の疾患(たとえば、糖尿病、冠状動脈性心疾患)を発症するリスクを予測するために使用できます。[ 11 ] [ 12 ] 別の例としては、年齢、収入、性別、人種、居住州、過去の選挙での投票などに基づいて、ネパールの有権者がネパール会議派、ネパール共産党、またはその他の政党に投票するかどうかを予測することが挙げられます。 [ 13 ]この手法は、特に特定のプロセス、システム、または製品の故障確率を予測するために、工学でも使用できます。 [ 14 ] [ 15 ]また、顧客が製品を購入したり、購読を停止したりする傾向を予測するなど、マーケティングの用途でも使用されます。 [ 16 ]経済学では、人が労働力になる可能性を予測するために使用でき、ビジネス用途としては、住宅所有者が住宅ローンを滞納する可能性を予測することが挙げられます。条件付きランダムフィールドは、ロジスティック回帰をシーケンスデータに拡張したもので、自然言語処理で使用されます。災害対策担当者や技術者は、建物火災、山火事、ハリケーンなどの小規模および大規模な避難時に、住宅所有者や建物居住者が下す決定を予測するためにこれらのモデルに頼っています。[ 17 ] [ 18 ] [ 19 ]これらのモデルは、信頼性の高い災害管理計画と建築環境のより安全な設計の開発に役立ちます。
ロジスティック回帰は、電子メールがスパムかどうかを識別したり、患者の検査結果に基づいて特定の状態の有無を評価して病気を診断したりするなど、二値分類タスクに広く使用されている教師あり機械学習アルゴリズムです。このアプローチでは、ロジスティック関数(またはシグモイド関数)を使用して、入力特徴の線形結合を0から1の間の確率値に変換します。この確率は、特定の入力が2つの事前定義されたカテゴリのいずれかに対応する可能性を示します。ロジスティック回帰の基本的なメカニズムは、二値結果の確率を正確にモデル化するロジスティック関数の能力に基づいています。特徴的なS字型の曲線を持つロジスティック関数は、実数値を0から1の区間内の値に効果的にマッピングします。この特徴により、電子メールを「スパム」または「スパムではない」に分類するなど、二値分類タスクに特に適しています。従属変数が特定のグループに分類される確率を計算することで、ロジスティック回帰は情報に基づいた意思決定をサポートする確率的フレームワークを提供します。[ 20 ]
簡単な例として、説明変数1つとカテゴリ2つを用いたロジスティック回帰分析を用いて、以下の質問に答えることができます。
20人の学生グループが、試験勉強に0時間から6時間費やすとします。勉強に費やす時間数は、学生が試験に合格する確率にどのように影響しますか?
この問題にロジスティック回帰を用いる理由は、従属変数である合格と不合格の値が「1」と「0」で表されるものの、基数ではないためです。もし問題が変更され、合格/不合格が0~100の点数(基数)に置き換えられた場合、単純回帰分析を用いることができます。
この表は、各学生が勉強に費やした時間と、合格(1)か不合格(0)かを示しています。
学習時間 ( x k ) とテスト結果 ( y k = 合格の場合は 1、不合格の場合は 0)からなるデータにロジスティック関数を当てはめたい。データポイントは添え字kでインデックス付けされており、kは から始まる 。にx変数は「説明変数」と呼ばれ、y変数は「カテゴリ変数」と呼ばれ、「合格」または「不合格」の2つのカテゴリから構成され、それぞれカテゴリ値1と0に対応します。

ロジスティック関数は次の形式です。
ここでμは位置パラメータ(曲線の中点、)そしてsはスケールパラメータです。この式は次のように書き換えることができます。
どこそしてそれは切片として知られています(直線の垂直切片またはy切片です)。)、 そして(逆スケールパラメータまたはレートパラメータ):これらは、xの関数としての対数オッズのy切片と傾きです。逆に、そして。
このモデルは実際には過度に単純化されており、学生が無限に勉強すれば(限界=1)全員が合格することを意味していることに注意してください。
ロジスティック回帰の適合度の一般的な尺度は、ロジスティック損失(または対数損失)、すなわち負の対数尤度を使用します。与えられたx kとy kに対して、次のように記述します。. そのは対応する確率です。は1 に等しくなり、は、それらがゼロになる確率です(ベルヌーイ分布を参照)。 の値を求めたいのです。そしてこれはデータに「最もよく適合する」ものです。データへの「最もよく適合する」ものの比較については、線形回帰の場合を参照してください。線形回帰では、適合とデータ点 ( y k )との二乗偏差の合計、つまり二乗誤差損失が適合の良し悪しの尺度として用いられ、この損失が最小化されたときに最もよく適合するものが得られます。
k番目の点の対数損失は:
対数損失は、実際の結果に対する「驚き」として解釈できる。予測と比較して 、情報量の尺度です。対数損失は常に0以上であり、完全な予測の場合(つまり、そして、 またはそして)であり、予測が悪化するにつれて無限大に近づきます(つまり、そしてまたはそして)、つまり実際の結果は「より驚くべき」ということです。ロジスティック関数の値は常に厳密にゼロから1の間にあるため、対数損失は常にゼロより大きく、無限大より小さくなります。線形回帰では、モデルがデータポイントを通過することである点で損失がゼロになる可能性があり(すべての点が直線上にある場合は全体として損失がゼロになります)、ロジスティック回帰では、どの点でも損失がゼロになることはありません。は0または1のいずれかですが、 .
これらは1つの式にまとめることができます。
この式は、より正式には予測分布の交差エントロピーとして知られています。実際の分布から(合格、不合格)の2要素空間上の確率分布として。
これらを合計した総損失は、全体的な負の対数尤度である。、そして、これらの選択肢に対して最適な適合が得られます。そしてそのため最小化されています。
あるいは、損失を最小化する代わりに、その逆数である(正の)対数尤度を最大化することもできる。
あるいは、同等に、与えられたデータセットが特定のロジスティック関数によって生成される確率である尤度関数自体を最大化する。
この方法は最尤推定法として知られています。
ℓは非線形であるためそして、それらの最適値を決定するには数値的手法が必要となる。ℓ を最大化する一つの方法は、 ℓのに関する導関数を求めることであるそしてゼロになる:
そして、最大化手順は、上記の2つの方程式を解くことによって実行できます。そして、これもまた、一般的には数値的手法の使用を必要とするだろう。
の値そして上記のデータを用いてℓとLを最大化する値は以下のとおりである。
これにより、 μとsの値は次のようになる。
そのそして係数をロジスティック回帰方程式に入力することで、試験に合格する確率を推定できます。
例えば、2時間勉強する学生の場合、値を入力するとこの式に代入すると、試験に合格する推定確率は0.25となる。
同様に、4時間勉強する学生の場合、試験に合格する確率は0.87と推定される。
この表は、様々な学習時間における試験合格の推定確率を示しています。
ロジスティック回帰分析の結果は以下のとおりです。
ウォルド検定によると、勉強時間は試験合格の確率と有意に関連していることが示されています()。ワルド法ではなく、ロジスティック回帰のp値を計算する推奨方法[ 21 ]は尤度比検定(LRT)であり、このデータでは次のようになります。(下記の§ 逸脱度検定および尤度比検定を参照)。
この単純なモデルは二項ロジスティック回帰の一例であり、1つの説明変数と、2つのカテゴリ値のいずれかを取る二値カテゴリ変数から構成されています。多項ロジスティック回帰は、二項ロジスティック回帰を一般化したもので、任意の数の説明変数と任意の数のカテゴリに対応できます。

ロジスティック回帰の説明は、標準的なロジスティック関数の説明から始めることができます。ロジスティック関数はシグモイド関数であり、任意の実数値を入力として受け取ります。、そして0から1の間の値を出力します。[ 2 ]ロジットの場合、これは入力対数オッズを受け取り、出力確率を持つと解釈されます。標準ロジスティック関数 :\mathbb {R} \rightarrow (0,1)} は次のように定義されます。
図1に、 t区間(−6,6)におけるロジスティック関数のグラフを示す。
と仮定しましょう単一の説明変数の線形関数である(は複数の説明変数の線形結合であり、同様に扱われます。次のように:
そして一般的なロジスティック関数次のように記述できます。
ロジスティックモデルでは、従属変数の確率として解釈される成功/ケースと等しく、失敗/非ケースとは等しくない。応答変数は分布は同一ではない。1つのデータポイントと異なる設計行列が与えられているが、それらは互いに独立している。および共有パラメータ[ 11 ]
ロジット(対数オッズ)関数を逆関数として定義できます。標準ロジスティック関数の。これは以下の条件を満たすことが容易にわかる。
同様に、両辺を指数関数化すると、オッズは次のようになります。
上記の式において、各項は以下のとおりです。
従属変数がケースと等しくなる確率(ある線形結合が与えられた場合)予測変数の)は、線形回帰式の指数関数に相当します。これは、ロジットが確率と線形回帰式の間のリンク関数としてどのように機能するかを示しています。ロジットは負の無限大から正の無限大までの範囲をとるため、線形回帰を実行するための適切な基準を提供し、ロジットはオッズに簡単に変換できます。[ 2 ]
そこで、従属変数がケースと等しくなるオッズを定義します(ある線形結合が与えられた場合)。予測因子の内訳は以下のとおりです。
連続的な独立変数の場合、オッズ比は次のように定義できます。

この指数関数的な関係は、: オッズはxが1単位増加するごとに。[ 22 ]
説明変数が複数ある場合、上記の式改訂可能そして、これが成功の対数オッズと予測変数の値の関係式で使用されると、線形回帰はm個の説明変数を持つ多重回帰になります。すべての人々のためにすべて推定値です。
繰り返しますが、より伝統的な方程式は次のとおりです。
そして
通常。
データセットにはN個の点が含まれています。各点iは、 m個の入力変数x 1, i ... x m,i (独立変数、説明変数、予測変数、特徴量、属性とも呼ばれます) と、バイナリの結果変数Y i (従属変数、応答変数、出力変数、クラスとも呼ばれます) で構成されます。つまり、Y i は 0 (多くの場合「いいえ」または「失敗」を意味します) または 1 (多くの場合「はい」または「成功」を意味します) の 2 つの値のみを取ることができます。ロジスティック回帰の目的は、データセットを使用して結果変数の予測モデルを作成することです。
線形回帰と同様に、結果変数Y iは説明変数x 1, i ... x m,iに依存すると仮定されます。
説明変数は、実数値、二値変数、カテゴリ変数など、どのようなタイプでも構いません。主な違いは、連続変数と離散変数です。
(2つ以上の選択肢を持つ離散変数は、通常、ダミー変数(または指標変数)を用いてコード化されます。つまり、離散変数の各可能な値に対して、0または1の値をとる個別の説明変数が作成され、1は「変数が指定された値を持つ」ことを意味し、0は「変数がその値を持たない」ことを意味します。)
形式的には、結果Y iはベルヌーイ分布に従うデータとして記述され、各結果は、その結果に固有の、しかし説明変数に関連する観測不能な確率p iによって決定されます。これは、以下のいずれかの同等の形式で表現できます。
これら4行の意味は以下のとおりです。
ロジスティック回帰の基本的な考え方は、線形回帰ですでに開発されたメカニズムを利用して、線形予測関数、すなわち説明変数と、対象となるモデルに固有だがすべての試行で同じ回帰係数のセットの線形結合を用いて確率 p i をモデル化することです。特定のデータポイントiについては、次のように記述されます。
どこ回帰係数は、特定の説明変数が結果に及ぼす相対的な影響を示すものです。
このモデルは通常、以下のように、よりコンパクトな形式にまとめられます。
これにより、線形予測関数を次のように記述することが可能になります。
2つのベクトル間の内積を表す表記法を用いる。

上記の説明変数1つに対する二項ロジスティック回帰の例は、任意の数の説明変数x 1、x 2、...および任意の数のカテゴリ値に対する二項ロジスティック回帰に一般化できます。。
まず、M個の説明変数x 1、x 2 ... x Mと、上記の例のように 2 つのカテゴリ値 ( y = 0 と 1 ) を持つロジスティック モデルを考えてみましょう。単純な二項ロジスティック回帰モデルでは、予測変数とイベントの対数オッズ (ロジットとも呼ばれる) の間に線形関係があると仮定しました。この線形関係は、 M個の説明変数がある場合にも拡張できる。
ここでtは対数オッズであり、はモデルのパラメータです。モデルの基底 ( b ) がオイラー数eに限定されないという追加の一般化が導入されています。ほとんどのアプリケーションでは、基底は対数の底は通常eとされます。しかし、場合によっては、底を 2 または底を 10 で計算した方が結果を伝えやすいことがあります。
より簡潔な表記のために、説明変数とβ係数を以下のように指定します。 -次元ベクトル:
説明変数x 0 =1 を追加した場合、ロジットは次のように表すことができます。
確率pを解くと収量:
どこは底が のシグモイド関数です上記の式は、が固定されている場合、対数オッズを簡単に計算できます。特定の観測値、または確率与えられた観測値に対して。ロジスティックモデルの主な使用例は、観測値が与えられた場合です。確率を推定するそれ最適なベータ係数は、対数尤度を最大化することによって再び見つけることができます。K回の測定の場合、次のように定義します。k番目の測定値の説明ベクトルとして、その測定のカテゴリカルな結果として、対数尤度は単純なものと非常によく似た形式で記述できます。上記のケース:
上記の簡単な例と同様に、最適なβパラメータを見つけるには数値計算法が必要です。有効な手法の一つは、対数尤度の各βパラメータに関する導関数をゼロに等しくすることです。これにより、対数尤度の最大値で成り立つ一連の方程式が得られます。
ここで、x mkはk 番目の測定値からのx m説明変数の値です。
例を考えてみましょう説明変数、、および係数、、 そしてこれらは上記の方法によって決定されたものである。具体的には、モデルは以下のとおりである。
ここでpは、これは次のように解釈できます。
上記の2つのカテゴリ(二項ロジスティック回帰)の場合、カテゴリは「0」と「1」でインデックス付けされ、2つの確率がありました。結果がカテゴリ1である確率は次のように与えられます。そして、結果がカテゴリー0になる確率は次のように表される。これらの確率の合計は1になります。これは、この設定では「0」と「1」しかあり得ないカテゴリであるため、必ず正しいことになります。
一般的に、もし私たちが説明変数( x 0を含む)およびカテゴリー、必要になります各カテゴリごとに個別の確率(添え字n付き)があり、これは共変量ベクトルxを条件として、カテゴリ結果yがカテゴリy=nに属する確率を表します。これらの確率をすべてのカテゴリについて合計すると1になります。数学的に便利な基数eを用いると、これらの確率は次のようになります。
それぞれの確率はそれぞれ独自の回帰係数セットを持つ必要なとおり、すべてのカテゴリnは 1 です。他の確率で定義されるのは人為的である。どの確率でもそのように定義されるように選択できたはずだ。この特別なnの値は「ピボットインデックス」と呼ばれ、対数オッズ ( t n ) はピボット確率で表され、説明変数の線形結合として再び表される。
また、単純なケースでは、2つのカテゴリーのケースが回復され、そして。
上記の確率によって特定のK個の測定値またはデータポイントが生成される対数尤度を計算できます。各測定値をkでインデックス付けし、k番目の測定された説明変数のセットを次のように表します。そしてそれらのカテゴリー別結果は、これは[0,N]内の任意の整数に等しくなります。対数尤度は次のようになります。
どこは、 y k = nの場合に 1、それ以外の場合は 0 となる指示関数です。説明変数が 2 つの場合、この指示関数はn = 1 のときにy k 、 n = 0のときに1-y kと定義されました。これは便利でしたが、必須ではありませんでした。[ 24 ]繰り返しになりますが、最適なベータ係数は、一般的に数値的手法を用いて対数尤度関数を最大化することによって見つけることができます。考えられる解法の 1 つは、各ベータ係数に関する対数尤度の導関数をゼロに設定し、ベータ係数を解くことです。
どこは、のm番目の係数です。ベクトルとは、 k番目の測定値に対するm番目の説明変数です。データからベータ係数が推定されると、その後の任意の説明変数セットが、考えられる結果カテゴリのいずれかをもたらす確率を推定できるようになります。
ロジスティック回帰には、さまざまな同等の仕様と解釈が存在し、それらはより一般的なモデルの異なるタイプに適合し、さまざまな一般化を可能にする。
ロジスティック回帰が用いる特定のモデルは、標準的な線形回帰や二値結果に用いられる他のタイプの回帰分析と区別されるものであり、特定の結果の確率が線形予測関数にどのように結び付けられるかという点にある。
上記で説明したより簡潔な表記法を用いて記述すると、次のようになります。
この定式化は、ロジスティック回帰を一般化線形モデルの一種として表現しており、変数の期待値の何らかの任意の変換に対して上記の形式の線形予測関数を当てはめることで、様々なタイプの確率分布を持つ変数を予測します。
ロジット関数(オッズの自然対数)を用いた変換の直感は、すでに上で説明しました。また、この変換は、確率(0から1の間に限定される)を、範囲が の変数に変換するという実際的な効果もあります。―これにより、等式の右辺にある線形予測関数の潜在的な範囲と一致する。
確率p iと回帰係数はどちらも観測されておらず、それらを決定する手段はモデル自体の一部ではありません。通常、それらは何らかの最適化手順、たとえば最尤推定によって決定され、観測データに最もよく適合する値(つまり、既に観測されているデータに対して最も正確な予測を与える値)を見つけます。通常、正則化条件が適用され、ありそうもない値、たとえば回帰係数のいずれかの極端に大きな値を排除しようとします。正則化条件の使用は、最尤推定の拡張である最大事後確率(MAP)推定を行うことと同等です。(正則化は、係数に平均ゼロのガウス事前分布を置くことと同等の二乗正則化関数を使用して最も一般的に行われますが、他の正則化も可能です。)正則化を使用するかどうかにかかわらず、通常、閉形式の解を見つけることはできません。代わりに、反復重み付き最小二乗法(IRLS)などの反復数値法、または最近ではより一般的にはL-BFGS法などの準ニュートン法を使用する必要がある。[ 25 ]
β jパラメータ推定値の解釈は、説明変数jの単位変化に対するオッズの対数への加算効果として解釈されます。例えば、性別のような二値の説明変数の場合、これは、例えば男性の場合と女性の場合で、その結果が生じる確率の推定値です。
同等の式では、ロジット関数の逆関数であるロジスティック関数を使用します。つまり、次のようになります。
この式は、確率分布(具体的には、確率質量関数を用いる)として表すこともできます。
ロジスティックモデルは、潜在変数モデルと同等の定式化が可能です。この定式化は離散選択モデルの理論でよく用いられ、複数の相関する選択肢を持つより複雑なモデルへの拡張を容易にするだけでなく、ロジスティック回帰と密接に関連するプロビットモデルとの比較も容易にします。
各試行iに対して、次のような分布に従う連続潜在変数Y i * (つまり、観測されない確率変数) が存在すると想像してください。
どこ
つまり、潜在変数は線形予測関数と標準ロジスティック分布に従って分布する加法的なランダム誤差変数を用いて直接記述することができる。
すると、Y i はこの潜在変数が正であるかどうかの指標と見なすことができる。
誤差変数を、位置と尺度を任意の値に設定した一般的なロジスティック分布ではなく、標準ロジスティック分布でモデル化するという選択は、制約が多いように思えるかもしれませんが、実際にはそうではありません。回帰係数は自分で選択でき、多くの場合、誤差変数の分布のパラメータの変化を相殺するために使用できることを覚えておく必要があります。たとえば、位置パラメータμ(平均を設定する)がゼロでないロジスティック誤差変数分布は、位置パラメータがゼロで、μが切片係数に加算された分布と同等です。どちらの場合も、説明変数の設定に関係なく、 Y i *の値は同じになります。同様に、任意の尺度パラメータsは、尺度パラメータを1に設定し、すべての回帰係数をsで割ることと同等です。後者の場合、Y i *の結果値は、すべての説明変数セットに対して、前者の場合よりもs倍小さくなりますが、重要なことに、常に0の同じ側に留まり、したがって同じY iの選択につながります。
(これは、尺度パラメータの無関係性が、2つ以上の選択肢が存在するより複雑なモデルには当てはまらない可能性があることを示唆している。)
この定式化は、一般化線形モデルで表現され、潜在変数を含まない、前述の定式化と完全に等価であることが判明しました。これは、標準ロジスティック分布の累積分布関数(CDF)がロジスティック関数であり、それがロジット関数の逆関数であるという事実を用いて、次のように示すことができます。
それから:
この定式化は離散選択モデルでは標準的なものであり、ロジスティック回帰(「ロジットモデル」)とプロビットモデルの関係を明確にしています。プロビットモデルでは、誤差変数が標準ロジスティック分布ではなく標準正規分布に従って分布します。ロジスティック分布と正規分布はどちらも対称で、基本的な単峰性の「ベルカーブ」形状をしています。唯一の違いは、ロジスティック分布の方が裾がやや重いということです。つまり、外れ値データに対する感度が低く(したがって、モデルの誤った仕様や誤ったデータに対してやや頑健である)、ロジスティック分布の方が優れているということです。
さらに別の定式化では、2つの別々の潜在変数を使用する。
どこ
ここで、EV 1 (0,1) は標準的なタイプ 1極値分布である。
それから
このモデルでは、従属変数の各可能な結果に対して、それぞれ独立した潜在変数と回帰係数のセットが存在します。このように分離する理由は、多項ロジットモデルのように、ロジスティック回帰を複数の結果を持つカテゴリ変数に容易に拡張できるようにするためです。このようなモデルでは、各可能な結果を異なる回帰係数のセットを用いてモデル化するのが自然です。また、それぞれの潜在変数を、関連する選択を行うことに関連する理論的効用として捉えることも可能であり、効用理論の観点からロジスティック回帰を説明できます。(効用理論では、合理的な行為者は常に最も効用の高い選択肢を選びます。)これは、経済学者が離散選択モデルを定式化する際に採用するアプローチです。理論的に強固な基盤を提供すると同時に、モデルに関する直感的な理解を容易にし、ひいては様々な拡張を容易に検討できるようにするためです。(以下の例を参照してください。)
タイプ1の極値分布の選択はかなり恣意的に思えるが、数学的にはうまくいくし、合理的な選択理論を通してその使用を正当化できるかもしれない。
一見すると分かりにくいかもしれないが、このモデルは前のモデルと等価であることが判明した。なぜなら、回帰係数と誤差変数のセットが2つあり、誤差変数の分布も異なっているからである。実際、このモデルは以下の置換を行うことで前のモデルに直接帰着する。
これに対する直感的な理解は、2つの値の最大値に基づいて選択するため、正確な値ではなく、その差だけが重要であり、これにより実質的に1つの自由度が失われるという事実から得られる。もう1つの重要な事実は、2つのタイプ1極値分布変数の差がロジスティック分布であるということ、つまり以下のように、同等のものを実証できます。
さらに別の定式化では、上記の双方向潜在変数定式化と、潜在変数を含まない上位の元の定式化を組み合わせ、その過程で多項ロジットの標準的な定式化の1つへのリンクを提供します。
ここでは、確率p iのロジットを線形予測子として記述する代わりに、線形予測子を 2 つの結果それぞれに対応する 2 つの部分に分割します。
2つの別々の回帰係数セットが導入されており、これは2方向潜在変数モデルと同様で、2つの方程式は、関連する確率の対数を線形予測子として記述する形式に、追加の項を加えた形で現れます。最後に。この項は、結果が分布となることを保証する正規化係数として機能します。これは、両辺を指数関数化することで確認できます。
この形式から明らかなように、 Zの目的は、Y iに関する結果的な分布が実際に確率分布となること、つまり合計が 1 になることを保証することです。これは、Z がすべての非正規化確率の合計であり、各確率をZで割ることによって確率が「正規化」されることを意味します。つまり、次のようになります。
そして、結果として得られる方程式は次のようになる。
あるいは一般的に言えば:
これは、多項ロジットのように、この定式化を2つ以上の結果に一般化する方法を明確に示しています。この一般的な定式化は、まさに次のソフトマックス関数です。
これが前のモデルと同等であることを証明するために、まず上記のモデルが過剰指定されていることを認識することから始めます。そして独立して指定することはできません。むしろつまり、一方が分かれば他方も自動的に分かる。結果として、モデルは識別不可能であり、複数の組み合わせでそして考えられるすべての説明変数に対して、同じ確率が得られます。実際、両方に任意の定数ベクトルを加えると、同じ確率が得られることがわかります。
その結果、2つのベクトルのうちの1つに任意の値を選択することで、問題を単純化し、識別可能性を回復することができます。ここでは、 それから、
など
これは、この定式化が確かに前の定式化と同等であることを示しています。(2方向潜在変数定式化と同様に、(同等の結果が得られるでしょう。)
多項ロジットモデルのほとんどの扱いは、ここで紹介した「対数線形」定式化、または上記で紹介した2方向潜在変数定式化のいずれかを拡張することから始まります。これは、どちらの定式化も、モデルを多方向の結果に拡張する方法を明確に示しているためです。一般的に、潜在変数を用いた表現は、離散選択モデルや効用理論が主流である計量経済学や政治学でより一般的であり、一方、ここで紹介した「対数線形」定式化は、機械学習や自然言語処理などのコンピュータ科学でより一般的です。
このモデルには同等の定式化がある
この関数形式は、一般的に単層パーセプトロンまたは単層人工ニューラルネットワークと呼ばれます。単層ニューラルネットワークは、ステップ関数ではなく連続出力を計算します。X = ( x 1 , ..., x k )に関する p iの導関数は、次の一般形式から計算されます。
ここで、f ( X )はXに関する解析関数です。この選択により、単層ニューラルネットワークはロジスティック回帰モデルと同一になります。この関数は連続微分が可能であるため、バックプロパゲーションに使用できます。また、この関数は微分が容易であるため、好ましいとされています。
密接に関連するモデルでは、各iは単一のベルヌーイ試行ではなく、n i 個の独立した同一分布の試行に関連付けられていると仮定し、観測値Y iは観測された成功数 (個々のベルヌーイ分布に従う確率変数の合計) であり、したがって二項分布に従います。
この分布の一例として、 n iを植えた後に発芽する種子の割合 ( p i )が挙げられます。
期待値の観点から見ると、このモデルは次のように表されます。
となることによって
あるいは同等に:
このモデルは、上記のより基本的なモデルと同様の方法を用いて適合させることができます。
回帰係数は通常、最尤推定法を用いて推定される。[ 26 ] [ 27 ]残差が正規分布する線形回帰とは異なり、尤度関数を最大化する係数値の閉形式表現を見つけることはできないため、代わりに反復プロセスを使用する必要がある。たとえば、ニュートン法などである。このプロセスは暫定的な解から始まり、それを少し修正して改善できるかどうかを確認し、これ以上改善がなくなるまでこの修正を繰り返す。この時点でプロセスは収束したと言われる。[ 26 ]
場合によっては、モデルが収束しないことがあります。モデルが収束しないということは、反復処理で適切な解が見つからなかったため、係数が意味をなさないことを示しています。収束しない原因としては、予測変数とケースの比率が大きい、多重共線性、疎性、完全分離など、さまざまなことが考えられます。
二項ロジスティック回帰(または)は、例えば、反復重み付き最小二乗法(IRLS)を用いて計算することができ、これはニュートン法を用いてベルヌーイ分布 過程の対数尤度を最大化することと同等である。問題がベクトル行列形式で記述され、パラメータが説明変数ベルヌーイ分布の期待値パラメータ以下の反復アルゴリズムを使用して求めることができます。
どこは対角重み行列であり、期待値のベクトル、
回帰行列と応答変数のベクトル。詳細は文献を参照してください。[ 29 ]

ベイズ統計学の文脈では、通常、回帰係数に事前分布が設定され、例えばガウス分布の形で表されます。ロジスティック回帰では、尤度関数の共役事前分布は存在しません。ベイズ推論を解析的に実行していた時代には、このため、非常に低次元の場合を除いて事後分布の計算が困難でした。しかし現在では、 OpenBUGS、JAGS、PyMC、Stan、Turing.jlなどの自動ソフトウェアによって、シミュレーションを使用してこれらの事後分布を計算できるため、共役性の欠如は問題になりません。ただし、サンプルサイズやパラメータ数が大きい場合、完全なベイズシミュレーションは時間がかかるため、変分ベイズ法や期待値伝播法などの近似法がよく用いられます。
広く用いられている「10分の1ルール」とは、ロジスティック回帰モデルは、説明変数1つあたり最低約10個のイベント(EPV)に基づいていれば、説明変数に対して安定した値を与えるというものです。ここで、イベントとは、従属変数の中で頻度の低いカテゴリに属するケースを指します。したがって、このルールに基づいて設計された研究では、ある事象(例えば心筋梗塞)が発生すると予想される割合を説明する変数研究参加者の には合計で参加者。しかし、このルールはシミュレーション研究に基づいており、確固たる理論的根拠を欠いているため、その信頼性についてはかなりの議論がある。[ 30 ]一部の著者によると[ 31 ]、このルールは状況によっては過度に保守的であり、著者らは次のように述べている。「信頼区間のカバレッジが93%未満、第一種過誤が7%超、または相対バイアスが15%超を問題視する場合(やや主観的に)、我々の結果は、2~4 EPVでは問題がかなり頻繁に発生し、5~9 EPVではまれであり、10~16 EPVでもまだ観察されることを示している。各問題の最悪の事例は、5~9 EPVでは深刻ではなく、通常は10~16 EPVの場合と同程度であった。」[ 32 ]
他の研究者たちは、異なる基準を用いて、上記とは一致しない結果を得ている。有用な基準は、適合モデルが、モデル開発サンプルで達成したと思われるのと同じ予測識別能力を新しいサンプルでも達成できるかどうかである。この基準では、候補変数ごとに20イベントが必要となる場合がある。[ 33 ] また、予測確率の誤差範囲が0.95の信頼水準で±0.1となるようにモデルの切片を十分に正確に推定するには、96の観測値が必要であると主張することもできる。[ 13 ]
どのようなフィッティング手順においても、モデルに別のフィッティングパラメータ(例えば、ロジスティック回帰モデルのベータパラメータ)を追加すると、測定結果を予測するモデルの能力はほぼ確実に向上します。これは、追加した項に予測値がなくても当てはまります。なぜなら、モデルは単にデータ内のノイズに「過剰適合」しているだけだからです。問題は、別のフィッティングパラメータを追加することによって得られる改善が、追加項の組み込みを推奨するほど十分なほど大きいのか、それとも単に過剰適合によって期待される改善に過ぎないのか、ということです。
要するに、ロジスティック回帰では、逸脱度と呼ばれる統計量が定義されます。これは、ロジスティックモデルの適合度と結果データとの間の誤差の尺度です。データ点の数が非常に多い場合、逸脱度はカイ二乗分布に従うため、説明変数の有意性を判断するためにカイ二乗検定を実施することができます。
線形回帰とロジスティック回帰には多くの類似点があります。たとえば、単純線形回帰では、K個のデータ点(x k、y k)のセットが、次の形式の提案されたモデル関数に適合されます。フィッティングは、各データポイントの残差の二乗和(二乗誤差項)を最小化するbパラメータを選択することによって得られます。
適合を構成する最小値は、
ヌルモデルの概念を導入すると、変数xは y k の結果を予測するのに役立たないと仮定されます。データポイントは、二乗誤差項を持つy = b 0の形式のヌルモデル関数に適合されます。
フィッティングプロセスは、b 0の値を最小化する値を選択することから成ります。ヌルモデルへの適合度を、で表す。 どこで添え字はヌルモデルを表します。ヌルモデルは以下のように最適化されることがわかります。どこはy k値の平均であり、最適化されたは:
これは、 y kデータ点の(補正されていない)標本標準偏差の二乗に比例します。
y kデータ点がさまざまなx kにランダムに割り当てられ、提案モデルを使用して適合される場合を想定できます。具体的には、 y kの結果のすべての順列に対する提案モデルの適合を検討できます。これらの適合の最適化された誤差は、ヌルモデルの最適誤差よりも小さくなることはなく、これらの最小誤差の差は、提案モデルの自由度からヌルモデルの自由度を引いた値に等しいカイ二乗分布に従うことが示されます。この場合、カイ二乗検定を用いることで、これらの順列のy kのセットのうち、元のy kを使用した最小誤差以下の最小誤差をもたらすものがいくつあるかを推定することができ、それによって、提案モデルにx変数を含めることによってどの程度の改善が得られるかを推定することができます。
ロジスティック回帰の場合、適合度の尺度は尤度関数Lまたはその対数である対数尤度ℓです。尤度関数Lは、線形回帰の場合と同様だが、尤度は最小化ではなく最大化される。提案モデルの最大化された対数尤度をで表す。。
単純な二項ロジスティック回帰の場合、K個のデータポイントは確率的な意味で次の形式の関数に適合されます。
どこでは、対数オッズは次のように表されます。
そして対数尤度は次のようになります。
帰無モデルの場合、次のように与えられます。
帰無仮説モデルの対数オッズは次のように表されます。
そして対数尤度は次のようになります。
なぜなら私たちはLの最大値において、ヌルモデルの最大対数尤度は
最適は:
どこは再びy k値の平均です。ここでも、提案されたモデルがy kのあらゆる順列に適合するかどうかを概念的に考えることができ、これらの順列適合の最大対数尤度は、ヌルモデルのそれよりも小さくなることはないことが示されます。
また、線形回帰における誤差のアナロジーとして、ロジスティック回帰の適合度の逸脱度を次のように定義できます。
これは常に正またはゼロになります。この選択の理由は、逸脱度が適合度の良い尺度であるだけでなく、近似的にカイ二乗分布に従い、データ点の数 ( K ) が増加するにつれて近似精度が向上し、データ点の数が無限大の極限では完全にカイ二乗分布になるからです。線形回帰の場合と同様に、この事実を利用して、ランダムなデータ点のセットが提案モデルによって得られた適合よりも良い適合を与える確率を推定し、提案モデルにx k 個のデータ点を含めることによってモデルがどれだけ有意に改善されるかを推定することができます。
上記で説明した学生のテストスコアの単純なモデルの場合、帰無モデルの対数尤度の最大値は単純モデルの対数尤度の最大値は逸脱は
カイ二乗検定を用いると、自由度1のカイ二乗分布の11.6661...から無限大までの積分は0.00063649...に等しい。
これは実質的に、ランダムなy kへの 10,000 回の適合のうち約 6 回は、与えられたy kよりも適合度が優れている (逸脱度が小さい) と期待できることを意味し、したがって、提案されたモデルにx変数とデータを含めることは、ヌルモデルに比べて非常に大きな改善であると結論付けることができます。言い換えれば、私たちは、帰無仮説を棄却します。自信。
線形回帰モデルの適合度は一般的にR 2を使用して測定されます。ロジスティック回帰にはこれに直接対応するものがないため、代わりに次の方法を含むさまざまな方法[ 34 ] : ch.21を使用できます。
線形回帰分析では、二乗和の計算によって分散を分割することに関心があります。基準の分散は、基本的に予測変数によって説明される分散と残差分散に分割されます。ロジスティック回帰分析では、二乗和の計算の代わりに逸脱度が使用されます。 [ 35 ]逸脱度は、線形回帰の二乗和の計算に類似しており[ 2 ] 、ロジスティック回帰モデルにおけるデータへの適合度の不足の尺度です。[ 35 ]「飽和」モデル(理論的に完全に適合するモデル)が利用可能な場合、逸脱度は、与えられたモデルを飽和モデルと比較することによって計算されます。[ 2 ] この計算により、尤度比検定が得られます。[ 2 ]
上記の式では、D は逸脱度を表し、ln は自然対数を表します。この尤度比 (適合モデルと飽和モデルの比) の対数は負の値になるため、負の符号が必要です。Dは近似的にカイ二乗分布に従うことが示されています。[ 2 ] 値が小さいほど適合モデルが飽和モデルから逸脱していないため、適合度が優れていることを示します。カイ二乗分布に基づいて評価すると、有意でないカイ二乗値は説明されていない分散が非常に少ないことを示し、したがってモデルの適合度が良好であることを示します。逆に、有意なカイ二乗値は分散のかなりの部分が説明されていないことを示します。
飽和モデルが利用できない場合(よくあるケース)、逸脱度は単純に −2·(適合モデルの対数尤度) として計算され、飽和モデルの対数尤度への参照は以降のすべてから削除しても問題ありません。
ロジスティック回帰では、逸脱度の2つの尺度が特に重要です。それは、ヌル逸脱度とモデル逸脱度です。ヌル逸脱度は、切片のみを持つモデル(つまり「予測変数なし」)と飽和モデルとの差を表します。モデル逸脱度は、少なくとも1つの予測変数を持つモデルと飽和モデルとの差を表します。[ 35 ]この点において、ヌルモデルは予測変数モデルを比較するための基準となります。逸脱度は、特定のモデルと飽和モデルとの差の尺度であるため、値が小さいほど適合度が高いことを示します。したがって、予測変数または予測変数セットの寄与を評価するには、ヌル逸脱度からモデル逸脱度を差し引き、その差を評価すればよいのです。自由度[ 2 ]が推定されたパラメータの数の差に等しい カイ二乗分布。
させて
両者の違いは次のとおりです。
モデルの逸脱度がヌル逸脱度よりも有意に小さい場合、予測変数または予測変数のセットがモデルの適合度を有意に改善すると結論付けることができます。これは、線形回帰分析で予測の有意性を評価するために使用されるF検定に類似しています。 [ 35 ]
線形回帰では、適合度を評価するために二乗多重相関係数R 2が使用されます。これは、予測変数によって説明される基準の分散の割合を表すためです。 [ 35 ]ロジスティック回帰分析では、合意された類似の尺度はありませんが、それぞれに限界がある競合する尺度がいくつかあります。[ 35 ] [ 36 ]
このページでは、最も一般的に使用されている4つの指標と、あまり使用されていない1つの指標について解説します。
ホスマー・レメショウ検定は漸近的に次の式に従う検定統計量を使用する。分布は、モデル集団のサブグループにおける観測されたイベント発生率が期待されるイベント発生率と一致するかどうかを評価するために用いられます。この検定は、予測確率の恣意的なビン分けに依存し、検出力が比較的低いことから、一部の統計学者によって時代遅れとみなされています。[ 37 ]
モデルを適合させた後、研究者は個々の予測因子の寄与を調べたいと思うでしょう。そのためには、回帰係数を調べます。線形回帰では、回帰係数は予測因子の単位変化ごとに基準がどれだけ変化するかを表します。[ 35 ]しかし、ロジスティック回帰では、回帰係数は予測因子の単位変化ごとにロジットがどれだけ変化するかを表します。ロジットは直感的ではないため、研究者は回帰係数の指数関数に対する予測因子の影響、つまりオッズ比(定義を参照)に注目するでしょう。線形回帰では、回帰係数の有意性はt検定を計算することによって評価されます。ロジスティック回帰では、個々の予測因子の有意性を評価するために設計されたいくつかの異なる検定があり、最も有名なのは尤度比検定とワルド統計量です。
モデルの適合性を評価するために上述した尤度比検定は、特定のモデルに対する個々の「予測因子」の寄与を評価するための推奨手順でもあります。[ 2 ] [ 26 ] [ 35 ]単一の予測因子モデルの場合、予測因子モデルの逸脱度を、自由度1のカイ二乗分布上のヌルモデルの逸脱度と比較するだけです。予測因子モデルの逸脱度が有意に小さい場合(2つのモデルの自由度の差を使用したカイ二乗と比較)、予測因子と結果の間に有意な関連があると結論付けることができます。一般的な統計パッケージ(SPSSなど)の中には尤度比検定統計量を提供するものもありますが、この計算負荷の高い検定がないと、多重ロジスティック回帰の場合に個々の予測因子の寄与を評価することはより困難になります。個々の予測因子の寄与を評価するには、予測因子を階層的に入力し、各新しいモデルを前のモデルと比較することで、各予測因子の寄与を決定できます。[ 35 ]いわゆる「段階的」手順の妥当性については、統計学者の間で議論がある。これらの手順は名目上の統計的特性を維持せず、誤解を招く可能性があるという懸念がある。[ 38 ]
あるいは、特定のモデルにおける個々の予測因子の寄与を評価する際には、ワルド統計量の有意性を調べることができます。線形回帰におけるt検定に類似したワルド統計量は、係数の有意性を評価するために使用されます。ワルド統計量は、回帰係数の二乗と係数の標準誤差の二乗の比であり、漸近的にカイ二乗分布に従います。[ 26 ]
いくつかの統計パッケージ(SPSS、SASなど)は個々の予測因子の寄与を評価するためにワルド統計量を報告しますが、ワルド統計量には限界があります。回帰係数が大きい場合、回帰係数の標準誤差も大きくなる傾向があり、第II種過誤の確率が高まります。また、データが疎な場合、ワルド統計量は偏りやすい傾向があります。[ 35 ]
症例がまれであると仮定します。その場合、人口における有病率よりも頻繁にサンプリングを行いたいと思うかもしれません。たとえば、10,000 人に 1 人に影響を与える疾患があり、データを収集するために完全な身体検査を行う必要があるとします。少数の疾患患者のデータを取得するためだけに、何千人もの健康な人の身体検査を行うのは費用がかかりすぎるかもしれません。したがって、より多くの疾患患者、おそらくすべてのまれな結果を評価するかもしれません。これも遡及的サンプリング、または同等に不均衡データと呼ばれます。経験則として、症例数の 5 倍の割合で対照群をサンプリングすると、十分な対照データが得られます。[ 39 ]
ロジスティック回帰は、ランダムにサンプリングされたデータではなく、不均衡なデータで推定しても、各独立変数が結果に及ぼす影響の係数推定値を正しく得られるという点で独特です。つまり、そのようなデータからロジスティックモデルを構築した場合、モデルが一般集団で正しい場合、パラメータはすべて正しいが、修正できます真の有病率が以下のとおりであるとわかっている場合:[ 39 ]
どこ真の有病率とこれはサンプルにおける有病率です。
他の回帰分析と同様に、ロジスティック回帰では、連続変数またはカテゴリ変数のいずれかである1つ以上の予測変数を使用します。ただし、通常の線形回帰とは異なり、ロジスティック回帰は、連続的な結果ではなく、限られた数のカテゴリのいずれかに属する従属変数(二項分布の場合、従属変数をベルヌーイ試行の結果として扱う)を予測するために使用されます。この違いにより、線形回帰の仮定が満たされません。特に、残差は正規分布に従うことができません。さらに、線形回帰は、二値の従属変数に対して意味のない予測を行う可能性があります。必要なのは、二値変数を任意の実数値(負または正)をとることができる連続変数に変換する方法です。そのため、二項ロジスティック回帰では、まず各独立変数の異なるレベルで事象が発生するオッズを計算し、次にその対数を取って、従属変数の変換バージョンとして連続基準を作成します。オッズの対数は確率のロジットであり、ロジットは次のように定義されます。
ロジスティック回帰における従属変数はベルヌーイ分布に従うが、ロジットは制約のない尺度である。[ 2 ]ロジット関数はこの種の一般化線形モデルにおける リンク関数である。
Yはベルヌーイ分布に従う応答変数であり、xは予測変数である。β値は線形パラメータである。
次に、成功確率のロジットを予測変数に適合させます。ロジットの予測値は、自然対数の逆数である指数関数を介して、予測オッズに変換されます。したがって、二項ロジスティック回帰における観測された従属変数は0または1の変数ですが、ロジスティック回帰は、従属変数が「成功」であるオッズを連続変数として推定します。一部のアプリケーションでは、オッズのみが必要です。他のアプリケーションでは、従属変数が「成功」であるか否かについて、特定のイエス・ノーの予測が必要です。このカテゴリカルな予測は、計算された成功オッズに基づいて行うことができ、選択されたカットオフ値を超える予測オッズは成功の予測に変換されます。
機械学習アプリケーションにおいて、二値分類にロジスティック回帰を用いる場合、最尤推定法(MLE)は交差エントロピー損失関数を最小化する。
ロジスティック回帰は重要な機械学習アルゴリズムです。その目的は、確率変数の確率をモデル化することです。実験データに基づいて0または1となる。[ 40 ]
パラメータ化された一般化線形モデル関数を考える、
したがって、
そしてそれ以来我々は、はここでは、サンプル内のすべての観測値が独立にベルヌーイ分布に従うと仮定して尤度関数を計算します。
通常、対数尤度が最大化され、
これは、勾配降下法などの最適化手法を用いて最大化されます。
と仮定するとペアは基礎となる分布から一様に抽出され、 Nが大きい極限では、
どこは条件付きエントロピーであり、これはカルバック・ライブラー情報量です。このことから、モデルの対数尤度を最大化することで、モデルと最大エントロピー分布との KL 情報量を最小化できるという直感が導き出されます。直感的には、パラメータに関する仮定が最も少ないモデルを探すことになります。
ロジスティック回帰は、一般化線形モデルの特殊なケースと見なすことができ、したがって線形回帰と類似していると言えます。しかし、ロジスティック回帰モデルは、線形回帰とは全く異なる仮定(従属変数と独立変数の関係について)に基づいています。特に、これら2つのモデルの主な違いは、ロジスティック回帰の次の2つの特徴に見られます。まず、条件付き分布です。従属変数が二値であるため、ガウス分布ではなくベルヌーイ分布になります。第二に、予測値は確率であり、ロジスティック回帰は結果そのものではなく特定の結果の確率を予測するため、ロジスティック分布関数によって(0,1)に制限されます。
ロジスティック モデル (ロジット モデル) の一般的な代替案は、関連する名前が示すようにプロビット モデルです。一般化線形モデルの観点から見ると、これらはリンク関数の選択が異なります。ロジスティック モデルはロジット関数(逆ロジスティック関数) を使用し、プロビット モデルはプロビット関数(逆誤差関数) を使用します。同様に、これら 2 つの方法の潜在変数の解釈では、前者は標準ロジスティック分布の誤差を仮定し、後者は標準正規分布の誤差を仮定します。[ 41 ]他のシグモイド関数または誤差分布を代わりに使用することもできます。
ロジスティック回帰は、フィッシャーの1936年の手法である線形判別分析の代替手段である。[ 42 ] 線形判別分析の仮定が成り立つ場合、条件付けを逆にしてロジスティック回帰を生成することができる。しかし、ロジスティック回帰は判別分析の多変量正規分布の仮定を必要としないため、その逆は成り立たない。[ 43 ]
線形予測子効果の仮定は、スプライン関数などの手法を用いることで容易に緩和できる。[ 13 ]
ロジスティック回帰の詳細な歴史については、Cramer (2002)に記載されています。ロジスティック関数は、 1830 年代から 1840 年代にかけて、アドルフ・ケトレの指導の下、ピエール・フランソワ・ヴェルフルストによって人口増加のモデルとして開発され、「ロジスティック」と名付けられました。詳細は、ロジスティック関数 §歴史を参照してください。 [ 44 ]ヴェルフルストは、最初の論文 (1838 年) では、曲線をデータにどのように適合させたかを明記していません。[ 45 ] [ 46 ]より詳細な論文 (1845 年) では、ヴェルフルストは、曲線が 3 つの観測点を通るようにしてモデルの 3 つのパラメータを決定しましたが、予測精度は低いものでした。[ 47 ] [ 48 ]
ロジスティック関数は、化学において自己触媒作用のモデルとして独自に開発されました(ヴィルヘルム・オストヴァルト、1883年)。[ 49 ]自己触媒反応とは、生成物の1つがそれ自体同じ反応の触媒であり、反応物の1つの供給量が固定されている反応のことです。これは、人口増加と同じ理由で、自然にロジスティック方程式を生み出します。つまり、反応は自己強化的であるが制約があるということです。
ロジスティック関数は、1920 年にレイモンド・パールとローウェル・リードによって人口増加のモデルとして独自に再発見され、 Pearl & Reed (1920)として出版され、現代統計学での使用につながった。彼らは当初、フェルフルストの研究を知らず、おそらくL. Gustave du Pasquierからそのことを知ったが、彼にほとんど功績を認めず、彼の用語を採用しなかった。[ 50 ]フェルフルストの優先権は認められ、1925 年にUdny Yuleによって「ロジスティック」という用語が復活し、それ以来使用されている。[ 51 ]パールとリードは最初にこのモデルを米国の人口に適用し、また最初は曲線が 3 つの点を通るようにして当てはめたが、フェルフルストの場合と同様に、これもまた不十分な結果をもたらした。[ 52 ]
1930年代には、チェスター・イットナー・ブリスがブリス(1934)で「プロビット」という用語を造語し、ジョン・ガダムがガダム(1933)でプロビットモデルを開発・体系化し、ロナルド・A・フィッシャーがフィッシャー(1935)でブリスの研究の補足として最尤推定法でモデルを適合させた。プロビットモデルは主にバイオアッセイで使用され、1860年に遡る先行研究があった(プロビットモデル§歴史を参照)。プロビットモデルはその後のロジットモデルの開発に影響を与え、これらのモデルは互いに競合した。[ 53 ]
ロジスティック モデルは、生物学的検定におけるプロビット モデルの代替として、エドウィン ビッドウェル ウィルソンと彼の学生ジェーン ウースターがWilson & Worcester (1943)で初めて使用した可能性が高い。[ 54 ]しかし、ロジスティック モデルがプロビット モデルの一般的な代替として発展したのは、主にジョセフ バークソンが何十年にもわたって行った研究によるものであり、バークソン (1944)で「プロビット」になぞらえて「ロジット」という造語を作り、バークソン (1951)とその後の数年間に続いた。[ 55 ]ロジット モデルは当初プロビット モデルより劣っていると見なされていたが、「徐々にプロビットと同等の地位を獲得」し、[ 56 ]特に 1960 年から 1970 年の間にその傾向が顕著になった。1970 年までに、ロジット モデルは統計学雑誌で使用されるプロビット モデルと同等の地位を獲得し、その後それを凌駕した。この相対的な人気は、バイオアッセイ内でプロビットを置き換えるのではなく、バイオアッセイ以外の分野でロジットが採用されたこと、および実務で非公式に使用されたことによるものです。ロジットの人気は、ロジットモデルの計算の単純さ、数学的特性、および汎用性によるもので、さまざまな分野での使用を可能にしています。[ 3 ]
その期間中にさまざまな改良が行われ、特にデビッド・コックスによる改良が行われました(コックス(1958)を参照) 。[ 4 ]
多項ロジットモデルは、Cox (1966)とTheil (1969)によって独立して導入され、ロジットモデルの適用範囲と人気を大幅に拡大しました。[ 57 ] 1973 年にDaniel McFadden は、多項ロジットを離散選択理論、特にLuce の選択公理と関連付け、多項ロジットは無関係な選択肢の独立性の仮定と選択肢のオッズを相対的な選好として解釈することから導かれることを示しました。[ 58 ]これにより、ロジスティック回帰の理論的基礎が与えられました。[ 57 ]
拡張機能は多数あります。
これらの任意の確率単位は「プロビット」と呼ばれています。
{{cite journal}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク)