統計学において、ベクトル一般化線形モデル(VGLM )は、一般化線形モデル(GLM )が扱うモデルの範囲を拡大するために提案されました。特に、VGLMは、古典的な指数分布族以外の応答変数 や、複数のパラメータを扱うことができます。各パラメータ(必ずしも平均値である必要はありません)は、リンク関数によって変換できます。VGLMの枠組みは、複数の応答を自然に扱うのに十分な大きさです。これらの応答は、それぞれ異なるパラメータ値を持つ可能性のある特定の統計分布から得られる、複数の独立した応答です。
ベクトル一般化線形モデルについては、Yee (2015) に詳細に説明されています。[ 1 ] 採用されている中心的なアルゴリズムは、通常すべてのモデルパラメータの最尤推定のための反復重み付き最小二乗法です。特に、フィッシャースコアリングは、ほとんどのモデルで対数尤度関数の1階微分と期待される2階微分を使用する方法で実装されています。
GLMは基本的に古典的な指数族の1パラメータモデルをカバーし、最も重要な統計的回帰モデル3つ(線形モデル、カウントのポアソン回帰、二値応答のロジスティック回帰)を含みます。しかし、指数族は通常のデータ分析にはあまりにも制限が大きすぎます。たとえば、カウントの場合、ゼロ過剰、ゼロ切断、過分散が頻繁に発生し、準二項分布や準ポアソン分布の形で二項分布やポアソン分布モデルに施された場当たり的な適応は、アドホックで不十分であると言えます。しかし、VGLMフレームワークは、 ゼロ過剰ポアソン回帰、ゼロ変更ポアソン(ハードル)回帰、正ポアソン回帰、 負二項分布回帰などのモデルを容易に処理できます。別の例として、線形モデルでは、正規分布の分散は尺度パラメータとして扱われ、多くの場合、邪魔なパラメータとして扱われます(そもそもパラメータとして考慮される場合でも)。しかし、VGLMフレームワークでは、共変量を用いて分散をモデル化することができます。
概して言えば、VGLMは、古典的な指数型分布族以外の多くのモデルを扱い、単一の平均値の推定に限定されないGLMと考えることができます。推定時には、IRLSで用いられる重み付き最小二乗法ではなく 、M個の線形予測子間の相関を処理するために一般化最小二乗法を用います。
応答または結果または従属変数(s)は、は、特定の分布から生成されると想定されます。ほとんどの分布は単変量なので、、そして例としてこれは二変量正規分布です。
データを次のように記述することもあります のためにn個の観測値はそれぞれ独立しているとみなされる。.は既知の正の事前重みであり、多くの場合。
説明変数または独立変数は次のように記述されますまたは、iが必要な場合、通常は切片があり、その場合は または。
実際、VGLMフレームワークではS個の応答が可能で、それぞれの次元は上記のS = 1では、次元はより一般的にはS の応答は、 S = 3vglm(cbind(y1, y2, y3) ~ x2 + x3, ..., data = mydata)の場合のようにコードで処理します。話を単純化するために、この記事のほとんどではS = 1 としています。
VGLMは通常、次の4つの要素から構成されます。
各線形予測子は、独立変数に関する情報をモデルに組み込む量です。(ギリシャ文字の「イータ」)は線形予測子を表し、添え字jはj番目のものを表すために使用されます。これはj番目のパラメータを説明変数に関連付け、 未知のパラメータの線形結合(したがって「線形」)として表現される すなわち、回帰係数の。
j番目のパラメータ、分布の は独立変数に依存します。を通して
させてをすべての線形予測子のベクトルとする。(便宜上、常に とする。) 次元はMである)。したがって、すべての共変量は線形予測子を介してすべてのパラメータに影響を与える可能性がある後ほど、線形予測子を加法予測子に一般化します。加法予測子は、各関数の滑らかな関数の合計です。そして、それぞれの関数はデータから推定される。
各リンク関数は、線形予測子と分布のパラメータとの間の関係を示します。一般的に使用されるリンク関数は多数あり、その選択はある程度任意です。リンク関数の定義域を分布のパラメータ値の範囲に合わせるようにすると良いでしょう。上記では、各パラメータに対して異なるリンク関数を許容します。一般化線形モデルと同様の特性を持ち、例えば、一般的なリンク関数には、パラメータのロジットリンクが含まれます。、そして正のパラメータに対する対数リンク。このVGAMパッケージには、identitylink()正と負の両方の値をとる可能性のあるパラメータに対応する関数があります。
より一般的には、VGLMフレームワークは回帰係数間の任意の線形制約を可能にする。各線形予測子について。たとえば、いくつかを0に設定したり、いくつかを等しい値に制約したりしたい場合があります。
どこでは制約行列です。各制約行列は既知で事前に指定されており、M行、1 ~M列です。制約行列の要素は有限値であり、多くの場合 0 または 1 です。たとえば、値 0 はその要素を実質的に省略し、値 1 はその要素を含みます。一部のモデルでは並列性の仮定があるのが一般的で、これは、 のために、一部のモデルでは、これも。すべての人々のためにこれは自明な制約として知られています。すべての回帰係数は推定値であり、互いに無関係です。すべてのj行目の切片のみのパラメータとして知られています。等しいのためにつまり、切片のみを表す。したがって、切片のみのパラメータは、可能な限り単純にスカラーとしてモデル化される。
未知のパラメータ、は、通常、最尤法によって推定されます。すべての回帰係数は、次のように行列にまとめることができます。
さらに一般的には、変数の値を許容することができる それぞれに異なる値を持たせる例えば、各線形予測子が異なる時点のものである場合、時間変動共変量が存在する可能性があります。例えば、離散選択モデルでは、 条件付きロジットモデル、 ネストされたロジットモデル、 一般化ロジットモデルなどがあり、特定のバリアントを区別し、例えば交通手段の選択に多項ロジットモデルを適合させることができます。コストなどの変数は選択によって異なり、例えばタクシーはバスよりも高く、バスは徒歩よりも高くなります。xijの機能により、VGAM一般化することができます に。
最も一般的な公式は
ここではオプションのオフセットです。行列の実際的な例。このVGAMパッケージには、xij対角行列の連続する要素を入力できる引数があります。
Yee (2015) [ 1 ] は、 VGAM と呼ばれるRパッケージの実装について説明しています。 [ 2 ] 現在、このソフトウェアは約 150 のモデル/分布に適合します。中心となるモデリング関数はvglm()とですvgam()。引数にはVGAM ファミリー関数familyが割り当てられます。たとえば、負の二項回帰 の場合は 、ポアソン回帰の場合は、 比例オッズモデルの場合は、 順序カテゴリ回帰の場合は累積ロジットモデルの場合は です。family = negbinomialfamily = poissonfffamily = propodds
対数尤度を最大化しています
どこでは正の値であり、既知の事前重みです。最尤推定値は、フィッシャーのスコアリング法を用いた反復重み付け最小二乗アルゴリズム を使用して求めることができ、更新形式は次のようになります。
どこは反復aにおけるフィッシャー情報行列です。これは期待情報行列、またはEIMとも呼ばれます。
計算では、式の右辺から構築された(小さな)モデル行列vglm() と制約行列を組み合わせて、大きなモデル行列を作成します。IRLS はこの大きなXに適用されます。この行列は、ベクトル線形モデルが解決される基礎となる最小二乗問題であるため、VLM 行列として知られています。VLMは重み付き多変量回帰であり、応答行列の各行の分散共分散行列は必ずしも同じではなく、既知です。(古典的な多変量回帰では、すべての誤差は同じ分散共分散行列を持ち、それは未知です)。特に、VLM は重み付き二乗和を最小化します。
この量は、IRLSの各反復で最小化されます。作業応答(擬似応答および調整済み従属ベクトルとも呼ばれる)は次のとおりです。
どこでこれらは作業重みまたは作業重み行列として知られています。これらは対称かつ正定値です。EIMを使用することで、パラメータ空間の大部分において、これらの行列がすべて正定値(単に合計値になるだけでなく)であることを保証できます。これに対し、ニュートン・ラフソン法を用いる場合は、観測情報行列が使用されることになり、これらの行列はパラメータ空間のごく一部においてのみ正定値となる傾向があります。
計算上は、コレスキー分解を用いて作業重み行列を逆行列化し、全体的な一般化最小二乗問題を通常の最小二乗問題に変換する。
もちろん、すべての一般化線形モデルはVGLMの特殊なケースです。しかし、 尺度パラメータに対してモーメント法を用いるのではなく、すべてのパラメータを最尤推定法によって推定することがよくあります。
応答変数がM + 1個のレベルを持つ順序尺度である場合、次のような形式のモデル関数を当てはめることができます。
のために 異なるリンク関数gは、比例オッズモデルまたは順序プロビットモデルにつながります。たとえば、VGAMファミリー関数はcumulative(link = probit)累積確率にプロビットリンクを割り当てるため、このモデルは累積プロビットモデルとも呼ばれます。一般に、これらは累積リンクモデルと呼ばれます。
カテゴリ分布および多項分布の場合、適合値は(M + 1)個の確率からなるベクトルであり、すべての確率の合計が1になるという性質を持ちます。各確率は、 M + 1個の可能な値 のうちの1つが発生する可能性を示します。
応答変数が名義尺度である場合、またはデータが順序モデルの仮定を満たさない場合は、次の形式のモデルを当てはめることができます。
のために上記のリンクはマルチロジットリンクと呼ばれることもあり、このモデルは多項ロジットモデルと呼ばれます。応答変数の最初または最後のレベルを 参照グループまたはベースライングループとして選択するのが一般的ですが、上記では最後のレベルを使用しています。VGAMファミリー関数は上記のモデルに適合し、参照グループとして使用するレベルを割り当てることができるmultinomial()引数があります。refLevel
古典的な一般化線形モデル(GLM)理論は、カウントデータに対してポアソン回帰を実行します。リンク関数は通常対数であり、これは正準リンク関数として知られています。分散関数は平均に比例します。
ここで分散パラメータはは通常、ちょうど 1 に固定されます。そうでない場合、結果として得られる準尤度モデルは、過分散を伴うポアソン分布、または準ポアソン分布として記述されることがよくあります。はモーメント法によって推定されることが多く、そのため、の信頼区間は入手が困難である。
対照的に、VGLMはポアソン分布に比べて過分散を扱うためのより豊富なモデル群を提供します。例えば、負の二項分布とそのいくつかの変種などです。別のカウント回帰モデルとしては、一般化ポアソン分布があります。その他のモデルとしては、ゼータ分布やジップ分布などがあります。
RR-VGLMは、 B行列の部分集合がより低いランクであるVGLMです。一般性を失うことなく、は共変量ベクトルの分割です。次に、B行列のうち、 に対応する部分形式はどこそして は薄い行列(つまり、R列を持つ行列)であり、例えば、ランクR = 1 の場合はベクトルです。RR-VGLM は、特定のモデルやデータセットに適用すると、いくつかの利点をもたらす可能性があります。まず、Mとpが大きい場合、VGLM によって推定される回帰係数の数は大きくなります() RR-VGLM は、 Rが低い場合 (例えばR = 1 またはR = 2)には推定回帰係数の数を大幅に削減できます。 これが特に役立つモデルの例として、ステレオタイプ モデルとしても知られるRR多項ロジット モデルがあります。次に、は潜在変数のR次元ベクトル であり、多くの場合、これらは有用な解釈が可能です。R = 1 の場合、次のように書くことができます。 潜在変数は説明変数の負荷量を含む。RR-VGLMは、 そして、説明変数に対してVGLMが適合される。第三に、R = 2 の場合、バイプロットを作成することができ、これによりモデルを視覚化できます。
RR-VGLMは、変数の制約行列が であるVGLMであることが示せる。不明であり、推定する必要がある。その後、このような変数に対して、RR-VGLMは、固定する交代アルゴリズムによって推定できます。 推定値そして修正する推定値など
実際には、いくつかの一意性制約が必要となる。 および/またはではVGAM、このrrvglm()関数はデフォルトでコーナー制約を使用します。つまり、 の上位R行は設定されていますRR-VGLMは2003年に提案された。[ 3 ]
RR-VGLMの特殊なケースは、R = 1、M = 2の場合です。これは、 2つのパラメータから1つのパラメータへの次元削減です。すると、次のことが示されます。
要素そして推定値です。同様に、
この式は、そしてこれは、例えば平均-分散関係のモデリングなどに役立つ、モデルの2つのパラメータ間の関係を誘導します。リンク関数を選択できる場合もあり、そのため、2つのパラメータを結合する際に多少の柔軟性が提供されます。例えば、単位区間内のパラメータに対して、ロジット、プロビット、コーシット、またはクロログリンクが使用できます。上記の式は、特に負の二項分布に有用であり、RR-NBは分散関数を持ちます。
これは一部の著者によってNB-Pバリアントと呼ばれている。そしてこれらは推定値であり、それらに対する近似的な信頼区間も得ることができる。
ちなみに、制約行列の適切な組み合わせを選択することで、他にもいくつかの有用なNBバリアントを適合させることもできます。例えば、NB - 1、NB - 2(デフォルト)、NB - Hなどです。Yee(2014)[ 4 ]およびYee(2015)[ 1 ]の表11.3を参照してください。 negbinomial()
行列相互作用モデル(RCIM)のサブクラス も提案されており、これらはRR-VGLMの特殊なタイプです。RCIMは行列Y応答にのみ適用され、明示的な説明変数はありません。 代わりに、各行と各列の指示変数が明示的に設定され、次の形式の 次数Rの交互作用が設定されます。許可されています。このタイプのモデルの特殊なケースとしては、グッドマンRC関連モデル や、Rパッケージで実装されている準分散法などがありますqvcalc。
RCIMは、 Yに適用されたRR-VGLMとして定義できます。
グッドマンRC協会モデルでは、つまり、R = 0 の場合、それは行効果と列効果を持つカウント行列に適合されたポアソン回帰であり、これは相互作用のない二元配置分散分析モデルと似た考え方です。
RCIM のもう 1 つの例は、は恒等リンクであり、パラメータは中央値であり、モデルは非対称ラプラス分布に対応します。この場合、相互作用のない RCIM は、メディアン ポリッシュと呼ばれる手法に似ています。
ではVGAM、rcim()関数grc()は上記のモデルに適合します。また、YeeとHadi(2014)[ 5 ]は、RCIMを使用して制約のない二次順序付けモデルを種データに適合させることができることを示しています。これは、順序付けにおける 間接勾配分析 の例です(統計生態学のトピック)。
ベクトル一般化加法モデル(VGAM)は、線形予測子がVGLMを大きく拡張したものです。共変量に関して線形である必要はないしかし、平滑化関数の合計は:
どこ これらはM個の加法予測子です。各平滑関数はデータから推定されます。したがって、VGLMはモデル駆動型であり、VGAMはデータ駆動型です。現在、このVGAMパッケージには平滑化スプラインのみが実装されています。M > 1の場合、それらは実際にはベクトルスプラインであり、の成分関数を推定します。 同時に。もちろん、VGLM で回帰スプラインを使用することもできます。VGAM の背後にある動機は、Hastie と Tibshirani (1990) [ 6 ] および Wood (2017) [ 7 ]の動機と似ています。VGAM は 1996 年に提案されました。[ 8 ]
現在、 EilersとMarx(1996)のPスプラインを使用してVGAMを推定する作業が行われています。 [ 9 ]これにより、平滑化スプラインとベクトルバックフィッティングを使用するよりも、自動平滑化パラメータの選択をより簡単に実行できるなど、 いくつかの利点が得られます。
これらは、RR-VGLM クラスに潜在変数の二次項を追加します。その結果、潜在変数の関数として、各応答にベル型の曲線を当てはめることができます。R = 2の場合、2 つの潜在変数の関数としてベル型の表面が得られます。これは、二 変量正規分布にいくらか似ています。QRR-VGLM の具体的な応用例は、生態学の順序付けと呼ばれる多変量解析の分野で見られます。
QRR-VGLM の具体的なランク 1 の例として、S種のポアソン データについて考えてみましょう。種sのモデルはポアソン回帰です。
のために記号を使用する最も右側のパラメータ化これらはそれぞれ種の個体数、最適値、耐性に関係するため、生態学的に特別な意味を持ちます。例えば、耐性はニッチ幅の尺度であり、値が大きいほどその種は幅広い環境で生息できることを意味します。上記の式では、ベル型の曲線を得るために。
QRR-VGLMは最尤推定法によってガウス順序付けモデルに適合し、直接勾配分析の一例です。パッケージcqo()内の関数はVGAM現在、optim()最適なものを探索するために 呼び出されます。そして、それを踏まえると、サイトスコアを計算し、それに 適した一般化線形モデルを当てはめるのは容易です。この関数は、制約付き二次順序付けの頭文字であるCQOにちなんで名付けられています。制約付きは直接勾配分析(環境変数があり、それらの線形結合が潜在変数として扱われる)を意味し、二次は潜在変数の二次形式を意味します。 でスケール。残念ながら、QRR-VGLM は応答変数と説明変数の両方の外れ値に敏感であり、計算コストも高く、全体的な解ではなく局所的な解を与える可能性があります。QRR-VGLM は 2004 年に提案されました。[ 10 ]
{{cite book}}: CS1メンテナンス: パブリッシャーの場所 (リンク){{cite book}}: CS1メンテナンス: パブリッシャーの場所 (リンク){{cite book}}: CS1メンテナンス: パブリッシャーの場所 (リンク)