統計学において、一般化線形モデル(GLM )は、通常の線形回帰を柔軟に一般化したものです。GLMは、線形モデルをリンク関数を介して応答変数と関連付けること、および各測定値の分散の大きさを予測値の関数とすることによって、線形回帰を一般化します。
一般化線形モデルは、線形回帰、ロジスティック回帰、ポアソン回帰など、さまざまな統計モデルを統一する方法として、ジョン・ネルダーとロバート・ウェダーバーンによって定式化されました。[ 1 ]彼らは、モデルパラメータの最尤推定(MLE) のための反復重み付き最小二乗法を提案しました。MLE は依然として人気があり、多くの統計計算パッケージのデフォルトの方法となっています。ベイズ回帰や分散安定化応答への最小二乗適合など、他のアプローチも開発されています。
通常の線形回帰では、与えられた未知の量(応答変数、確率変数)の期待値を、一連の観測値(予測変数)の線形結合として予測します。これは、予測変数の一定の変化が応答変数の一定の変化につながることを意味します(つまり、線形応答モデル)。これは、応答変数がどちらの方向にもほぼ無限に変化できる場合、またはより一般的には、予測変数の変動に比べて比較的小さな変化しかしない量(例えば、人間の身長)に適しています。
しかし、これらの仮定は、応答変数の種類によっては不適切です。たとえば、応答変数が常に正の値を取り、広範囲にわたって変化すると予想される場合、一定の入力変化は、一定の変化ではなく、幾何級数的(つまり指数関数的)に変化する出力変化につながります。例として、線形予測モデルが、あるデータ(おそらく主に大規模なビーチから得られたもの)から、気温が10度低下するとビーチを訪れる人が1,000人減少すると学習したとします。このモデルは、規模の異なるビーチにうまく一般化できる可能性は低いでしょう。より具体的に言うと、このモデルを使用して、定期的に50人のビーチ利用者がいるビーチで気温が10度低下した場合の新しい来場者数を予測すると、あり得ない-950という来場者数を予測してしまうという問題があります。論理的には、より現実的なモデルは、ビーチの来場者数が一定の割合で増加すると予測するでしょう(たとえば、気温が10度上昇すると来場者数が2倍になり、10度低下すると来場者数が半減する)。このようなモデルは指数応答モデル(または対数線形モデル。応答の対数が線形に変化すると予測されるため)と呼ばれます。
同様に、イエス/ノーの選択をする確率(ベルヌーイ変数)を予測するモデルは、確率が両端で制限されている(0 から 1 の間である必要がある)ため、線形応答モデルとしてはさらに不適切です。たとえば、気温の関数として、ある人がビーチに行く可能性を予測するモデルを考えてみましょう。妥当なモデルでは、たとえば、気温が 10 度変化すると、その人がビーチに行く可能性が 2 倍になるか 2 倍になるかを予測するかもしれません。しかし、「2 倍になる」とは、確率の観点から何を意味するのでしょうか。これは、確率の値を文字通り 2 倍にする(たとえば、50% が 100% になり、75% が 150% になるなど)という意味ではありません。むしろ、オッズが 2 倍になるということです。2:1 のオッズから 4:1 のオッズ、8:1 のオッズなどです。このようなモデルは、対数オッズまたはロジスティックモデルです。
一般化線形モデルは、応答変数が任意の分布(単なる正規分布ではなく)を持つこと、および応答変数の任意の関数(リンク関数)が予測変数と線形に変化すること(応答変数自体が線形に変化しなければならないと仮定するのではなく)を可能にすることで、これらの状況すべてをカバーします。たとえば、上記の予測されるビーチ参加者数の場合は、通常、ポアソン分布と対数リンク関数でモデル化されますが、予測されるビーチ参加確率の場合は、通常、ベルヌーイ分布(または問題の表現方法によっては二項分布)と対数オッズ(またはロジット)リンク関数でモデル化されます。
一般化線形モデル(GLM)では、従属変数の各結果Yは、指数族と呼ばれる確率分布の大きなクラスに属する特定の分布から生成されると仮定されます。指数族には、正規分布、二項分布、ポアソン分布、ガンマ分布などが含まれます。分布の条件付き平均μは、独立変数Xに以下の関係で依存します。
ここで、E( Y | X ) はXを条件としたYの期待値であり、X β は未知のパラメータβの線形結合である線形予測子であり、gはリンク関数である。
この枠組みでは、分散は通常、平均値の関数Vとして表されます。
Vが指数分布族に従う場合が都合が良いが、単に分散が予測値の関数である場合もある。
GLMは3つの要素から構成されます。
過分散指数族(または分散を持つ指数族)は、指数族および分布の指数分散モデルの一般化であり、によってパラメータ化された確率分布の族を含みます。そして密度関数f (または離散分布の場合は確率質量関数) は、次の形式で表すことができます。
分散パラメータ、は、通常既知であり、通常は分布の分散に関連しています。、、、、 そしては既知である。この族には、正規分布、指数分布、ガンマ分布、ポアソン分布、ベルヌーイ分布、そして(試行回数が固定されている場合)二項分布、多項分布、負の二項分布など、多くの一般的な分布が含まれる。
スカラーの場合そして(表記)そしてこの場合、これは以下になります。
は分布の平均に関連しています。ジョン・ネルダーとロバート・ウェダーバーンによる元の定式化は、[ 2 ] [ 3 ]は、不偏推定方程式を得るための重要な要件です。 これにより、分布の誤指定の下での最尤推定値の一貫性など、多くの魅力的な特性が得られます[ 4 ]。が恒等関数である場合、分布は正準形式(または自然形式)であると言われます。任意の分布は、 を書き換えることで正準形式に変換できることに注意してください。としてそして変換を適用する変換は常に可能です新しいパラメータ化の観点から言えば、は一対一関数ではありません。指数族に関するページのコメントを参照してください。
さらに、そしてアイデンティティである場合、は正準パラメータ(または自然パラメータ)と呼ばれ、平均と関連しています。
スカラーの場合そしてこれは、
このシナリオでは、分布の分散は[ 3 ]であることが示される。
スカラーの場合そしてこれは、
線形予測子は、独立変数に関する情報をモデルに組み込む量です。記号η(ギリシャ語の「イータ」)は線形予測子を表します。これは、リンク関数を介してデータの期待値と関連付けられます。
ηは未知のパラメータβの線形結合(したがって「線形」)として表されます。線形結合の係数は独立変数行列Xとして表されます。 したがってηは次のように表すことができます。
リンク関数は、線形予測子と分布関数の平均値との間の関係を示します。一般的に使用されるリンク関数は数多くあり、その選択はいくつかの考慮事項に基づいています。応答の密度関数の指数関数から導出される、明確に定義された標準的なリンク関数が常に存在します。しかし、場合によっては、リンク関数の定義域を分布関数の平均値の範囲に合わせようとしたり、例えばベイズプロビット回帰のように、アルゴリズム上の目的で非標準的なリンク関数を使用したりすることが理にかなっていることがあります。
正規パラメータを持つ分布関数を使用する場合正準リンク関数は、に関してはつまり 最も一般的な分布では、平均は分布の密度関数の標準形式のパラメータの1つであり、は、上記で定義した、密度関数をその標準形にマッピングする関数です。標準リンク関数を使用する場合、これにより十分な統計量となる。
以下に、一般的に使用されているいくつかの指数型分布とその典型的な使用データ、および標準リンク関数とその逆関数(ここでは平均関数と呼ぶこともあります)を表に示します。
指数分布とガンマ分布の場合、正準リンク関数の定義域は、平均の許容範囲とは異なります。特に、線形予測子が正の値をとる場合、平均が負の値をとるというあり得ない事態が生じます。尤度を最大化する際には、このような事態を避けるための対策を講じる必要があります。代替案として、非正準リンク関数を用いる方法があります。
ベルヌーイ分布、二項分布、カテゴリ分布、多項分布の場合、分布のサポートは予測対象のパラメータと同じタイプのデータではありません。これらのすべての場合において、予測パラメータは1つ以上の確率、つまり範囲内の実数です。その結果得られるモデルはロジスティック回帰(二値ではなくK個の値を予測する場合は多項ロジスティック回帰)として知られています。
ベルヌーイ分布と二項分布の場合、パラメータは単一の確率であり、単一の事象が発生する可能性を示します。ベルヌーイ分布は、単一の結果が常に0または1であるにもかかわらず、期待値が実数値の確率、つまり「はい」(または1)の結果が発生する確率となるという点で、一般化線形モデルの基本条件を満たしています。同様に、二項分布では、期待値はNpであり、つまり「はい」の結果の期待割合が予測される確率となります。
カテゴリ分布および多項分布の場合、予測対象となるパラメータは確率のKベクトルであり、すべての確率の合計が1になるという制約があります。各確率は、 K個の可能な値のうちの1つが発生する可能性を示します。多項分布、およびカテゴリ分布のベクトル形式の場合、ベクトルの要素の期待値は、二項分布やベルヌーイ分布と同様に、予測確率と関連付けることができます。
最尤推定値は、反復重み付き最小二乗法アルゴリズム、または次の形式の更新を伴うニュートン法を使用して求めることができます。
どこは観測情報行列(ヘッセ行列の負の値)であり、はスコア関数、またはフィッシャーのスコアリング方法である。
一般的に、事後分布は閉じた形で求めることができないため、近似する必要があり、通常はラプラス近似またはギブスサンプリングなどのマルコフ連鎖モンテカルロ法を使用します。
混乱を招く可能性のある点として、一般化線形モデルと一般線形モデルという2つの広範な統計モデルの区別が挙げられます。共同発案者のジョン・ネルダーはこの用語について遺憾の意を表明しています。[ 6 ]
一般線形モデルは、恒等リンク関数と正規分布に従う応答変数を持つ一般化線形モデルの特殊なケースとみなすことができます。関心のある最も正確な結果は一般線形モデルでのみ得られるため、一般線形モデルはやや長い歴史的発展を遂げてきました。非恒等リンク関数を持つ一般化線形モデルの結果は漸近的であり(サンプルサイズが大きい場合にうまく機能する傾向があります)。
一般化線形モデル(一般線形モデルの一例でもある)の単純かつ非常に重要な例として、線形回帰が挙げられます。線形回帰では、最小二乗推定量の使用はガウス・マルコフの定理によって正当化されますが、この定理は分布が正規分布であることを前提としていません。
しかし、一般化線形モデルの観点からは、分布関数が一定の分散を持つ正規分布であり、リンク関数が恒等関数(分散が既知の場合は正準リンク関数)であると仮定することが有用である。これらの仮定の下では、最小二乗推定量は最尤パラメータ推定値として得られる。
正規分布の場合、一般化線形モデルでは最尤推定値に対する閉形式の式が得られるため、便利です。他のほとんどの一般化線形モデルでは、閉形式の推定値が得られません。
応答データYがバイナリ (0 と 1 の値のみをとる) の場合、分布関数は一般的にベルヌーイ分布が選択され、 μ iの解釈はY iが値 1 をとる確率pとなります。
二項関数には、いくつかの一般的なリンク関数が存在する。
最も典型的なリンク関数は、正準ロジットリンク関数です。
この設定のGLMはロジスティック回帰モデル(またはロジットモデル)です。
あるいは、連続累積分布関数(CDF)の範囲が二項分布の平均の範囲。正規分布の累積分布関数は人気のある選択肢であり、プロビットモデルを生成します。そのリンクは
プロビットモデルを用いる理由は、入力変数を正規累積分布関数(CDF)に定数スケーリングすることで(これは全てのパラメータを等しくスケーリングすることで吸収できる)、実質的にロジット関数と同一の関数が得られるものの、状況によってはプロビットモデルの方がロジットモデルよりも扱いやすいからである。(正規分布の事前分布をパラメータに設定するベイズ環境では、正規事前分布と正規CDFリンク関数の関係から、プロビットモデルはギブスサンプリングを用いて計算できるが、ロジットモデルは一般的に計算できない。)
相補対数対数関数も使用できます。
このリンク関数は非対称であり、ロジットおよびプロビットのリンク関数とは異なる結果を生み出すことがよくあります。[ 7 ]クロログモデルは、イベントがゼロ(欠陥など)または1つ以上観測されるアプリケーションに対応し、イベント数はポアソン分布に従うと仮定されます。[ 8 ]ポアソン仮定とは、
ここでμは期待されるイベント数を表す正の数である。pが少なくとも1つのイベントが発生した観測の割合を表す場合、その補数は
その後
線形モデルでは、応答変数が実数全体にわたって値を取る必要があります。μは正でなければならないため、対数を取ることでそれを強制できます。log( μ )を線形モデルとすると、これにより「cloglog」変換が得られます。
恒等リンク関数g(p) = pは、二項分布データに対して線形確率モデルを生成するために用いられることもあります。しかし、恒等リンク関数は、ゼロ未満または1を超える無意味な「確率」を予測してしまう可能性があります。これは、cloglog、プロビット、ロジット(または任意の逆累積分布関数)などの変換を用いることで回避できます。恒等リンク関数の主な利点は、線形数学を用いて推定できることであり、他の標準的なリンク関数は、p = 0.5 付近で恒等リンク関数とほぼ線形に一致するという点です。
「準二項分布データは次のとおりです。
ここで、分散パラメータτは二項分布の場合ちょうど 1 です。実際、標準的な二項尤度ではτは省略されます。τ が存在する場合、そのモデルは「準二項分布」と呼ばれ、修正された尤度は準尤度と呼ばれます。これは、それが一般に実際の確率分布の族に対応する尤度ではないためです。τが1 を超える場合、そのモデルは過分散を示すと言われます。
二項分布の場合、応答変数として多項分布(または、合計が制約されたカウントの一般化線形モデル)を許容するように容易に拡張できます。これには通常、次の2つの方法があります。
応答変数が順序尺度である場合、次のような形式のモデル関数を当てはめることができます。
m > 2の場合。異なるリンクgは、比例オッズモデルや順序プロビットモデルなどの順序回帰モデルにつながります。
応答変数が名義尺度である場合、またはデータが順序モデルの仮定を満たさない場合は、次の形式のモデルを当てはめることができます。
m > 2の場合、異なるリンクgによって多項ロジットモデルまたは多項プロビットモデルが得られます。これらは順序応答モデルよりも一般的であり、推定されるパラメータの数も多くなります。
一般化線形モデルの別の例として、ポアソン分布を用いて計数データをモデル化するポアソン回帰が挙げられます。リンク関数は通常、対数、すなわち正準リンク関数です。
分散関数は平均に比例する
ここで、分散パラメータτは通常、ちょうど1に固定されます。そうでない場合、結果として得られる準尤度モデルは、過分散を伴うポアソン分布または準ポアソン分布として記述されることがよくあります。
応答があった場合は二重境界連続確率変数であり、それを単位区間[0,1]に標準化した後、一般化線形モデルの例として、連続二項分布に基づく連続二項(コビン)回帰[ 9 ]があり、これは連続ベルヌーイ分布の2パラメータ一般化である。は分散に反比例し、
標準的な一般化線形モデル(GLM)は、観測値間に相関がないことを前提としています。しかし、例えば縦断研究やクラスターデザインのように、観測値間に相関がある場合に対応できるよう、拡張版が開発されています。
一般化加法モデル(GAM)は、GLMのもう一つの拡張であり、線形予測子ηは共変量Xに関して線形である必要はなく、 x i sに適用される平滑化関数の合計である。
平滑化関数f iはデータから推定されます。一般に、これには多数のデータポイントが必要であり、計算負荷が高くなります。[ 12 ] [ 13 ]
一般線形モデルと混同されずに定着するような、もっと洒落た名前を考えるべきだったと思いますが、一般と一般化は厳密には同じではありません。別の名前を考えた方が良かったかもしれない理由は理解できます。
{{cite book}}: CS1メンテナンス: パブリッシャーの場所 (リンク){{cite book}}: CS1メンテナンス: パブリッシャーの場所 (リンク)