係数の解釈 単一の予測変数を持つモデルがあると仮定します。n = 1 {\displaystyle n=1} :
ログ ( E ( Y ∣ x ) ) = α + β x {\displaystyle \log(\operatorname {E} (Y\mid \mathbf {x} ))=\alpha +\beta x} 点における予測値を計算してみましょう( Y 2 、 x 2 ) {\displaystyle (Y_{2},x_{2})} そして( Y 1 、 x 1 ) {\displaystyle (Y_{1},x_{1})} :
ログ ( E ( Y 2 ∣ x 2 ) ) = α + β x 2 {\displaystyle \log(\operatorname {E} (Y_{2}\mid x_{2}))=\alpha +\beta x_{2}} ログ ( E ( Y 1 ∣ x 1 ) ) = α + β x 1 {\displaystyle \log(\operatorname {E} (Y_{1}\mid x_{1}))=\alpha +\beta x_{1}} 2番目から1番目を引くことで:
ログ ( E ( Y 2 ∣ x 2 ) ) − ログ ( E ( Y 1 ∣ x 1 ) ) = β ( x 2 − x 1 ) {\displaystyle \log(\operatorname {E} (Y_{2}\mid x_{2}))-\log(\operatorname {E} (Y_{1}\mid x_{1}))=\beta (x_{2}-x_{1})} ここで、x 2 = x 1 + 1 {\displaystyle x_{2}=x_{1}+1} 我々は以下を得る:
ログ ( E ( Y 2 ∣ x 2 ) ) − ログ ( E ( Y 1 ∣ x 1 ) ) = β \displaystyle \log(\operatorname {E} (Y_{2}\mid x_{2}))-\log(\operatorname {E} (Y_{1}\mid x_{1}))=\beta } したがって、モデルの係数は、独立変数が1増加したときの結果変数のカウントの対数の増加として解釈されます。
対数の法則を適用することで:
ログ ( E ( Y 2 ∣ x 2 ) E ( Y 1 ∣ x 1 ) ) = β {\displaystyle \log \left({\dfrac {\operatorname {E} (Y_{2}\mid x_{2})}{\operatorname {E} (Y_{1}\mid x_{1})}}\right)=\beta } E ( Y 2 ∣ x 2 ) E ( Y 1 ∣ x 1 ) = e β \displaystyle {\dfrac {\operatorname {E} (Y_{2}\mid x_{2})}{\operatorname {E} (Y_{1}\mid x_{1})}}=e^{\beta }} E ( Y 2 ∣ x 2 ) = e β E ( Y 1 ∣ x 1 ) {\displaystyle \operatorname {E} (Y_{2}\mid x_{2})=e^{\beta }\operatorname {E} (Y_{1}\mid x_{1})} つまり、独立変数が1増加すると、結果変数は指数化された係数で乗算される。
指数化された係数は、発生率 とも呼ばれます。
最尤法に基づくパラメータ推定 パラメータθ と入力ベクトルxが与えられた場合、予測される ポアソン分布 の平均は、上述のように次のように与えられる。
λ := E ( Y ∣ x ) = e θ ′ x 、 {\displaystyle \lambda :=\operatorname {E} (Y\mid x)=e^{\theta 'x},\,} したがって、ポアソン分布の確率質量関数 は次のように与えられる。
p ( y ∣ x ; θ ) = λ y y ! e − λ = e y θ ′ x e − e θ ′ x y ! {\displaystyle p(y\mid x;\theta )={\frac {\lambda ^{y}}{y!}}e^{-\lambda }={\frac {e^{y\theta 'x}e^{-e^{\theta 'x}}}{y!}}} ここで、 m 個のベクトルからなるデータセットが与えられたと仮定します。x 私 ∈ R n + 1 、 私 = 1 、 … 、 m {\displaystyle x_{i}\in \mathbb {R} ^{n+1},\,i=1,\ldots ,m} 一連のm 値とともにy 1 、 … 、 y m ∈ N {\displaystyle y_{1},\ldots ,y_{m}\in \mathbb {N} } すると、与えられたパラメータθ のセットに対して、この特定のデータセットが得られる確率は次のように与えられる。
p ( y 1 、 … 、 y m ∣ x 1 、 … 、 x m ; θ ) = ∏ 私 = 1 m e y 私 θ ′ x 私 e − e θ ′ x 私 y 私 ! 。 {\displaystyle p(y_{1},\ldots ,y_{m}\mid x_{1},\ldots ,x_{m};\theta )=\prod _{i=1}^{m}{\frac {e^{y_{i}\theta 'x_{i}}e^{-e^{\theta 'x_{i}}}}{y_{i}!}}.} 最尤法を用いて、この確率 を最大にするパラメータθ のセットを見つけたい。そのためには、まず方程式をθ に関する尤度関数 として書き直す。
L ( θ ∣ X 、 Y ) = ∏ 私 = 1 m e y 私 θ ′ x 私 e − e θ ′ x 私 y 私 ! 。 {\displaystyle L(\theta \mid X,Y)=\prod _{i=1}^{m}{\frac {e^{y_{i}\theta 'x_{i}}e^{-e^{\theta 'x_{i}}}}{y_{i}!}}.} 右辺 の式は実際には変わっていないことに注意してください。このような形式の式は通常扱いにくいため、代わりに対数尤度 を使用します。
ℓ ( θ ∣ X 、 Y ) = ログ L ( θ ∣ X 、 Y ) = ∑ 私 = 1 m ( y 私 θ ′ x 私 − e θ ′ x 私 − ログ ( y 私 ! ) ) 。 {\displaystyle \ell (\theta \mid X,Y)=\log L(\theta \mid X,Y)=\sum _{i=1}^{m}\left(y_{i}\theta 'x_{i}-e^{\theta 'x_{i}}-\log(y_{i}!)\right).} 総和の各項の最初の 2 項にのみパラメータθが現れることに注意してください。したがって、 θの最適値を見つけることだけに関心があるため、 y i ! を省略して、単に次のように記述できます。
ℓ ( θ ∣ X 、 Y ) = ∑ 私 = 1 m ( y 私 θ ′ x 私 − e θ ′ x 私 ) 。 {\displaystyle \ell (\theta \mid X,Y)=\sum _{i=1}^{m}\left(y_{i}\theta 'x_{i}-e^{\theta 'x_{i}}\right).} 最大値を求めるには、方程式を解く必要があります。∂ ℓ ( θ ∣ X 、 Y ) ∂ θ = 0 {\displaystyle {\frac {\partial \ell (\theta \mid X,Y)}{\partial \theta }}=0} 閉形式解は存在しない。しかし、負の対数尤度、− ℓ ( θ ∣ X 、 Y ) {\displaystyle -\ell (\theta \mid X,Y)} は凸関数であるため、勾配降下法 などの標準的な凸最適化手法を適用して、 θ の最適値を求めることができます。
ポアソン回帰の実践 ポアソン回帰は、従属変数がカウントである場合、たとえばコールセンターへの電話の着信などのイベントの場合に適切である可能性があります。 [ 3 ] イベントは、1 つの電話の着信が別の電話の着信の可能性を高めたり低くしたりしないという意味で独立している必要がありますが、イベントの単位時間あたりの確率は、時刻などの共変量に関連していると理解されます。
「露出」とオフセットポアソン回帰は、発生率データにも適している場合があります。発生率は、事象の数をその単位の曝露 (特定の観測単位)の何らかの尺度で割ったものです。[ 4 ] 例えば、生物学者は森林の樹種の数を数えることがあります。事象は樹木の観測、曝露は単位面積、発生率は単位面積あたりの樹種の数になります。人口統計学者は、地理的地域の死亡率を、死亡者数を人年で割ったものとしてモデル化することがあります。より一般的には、事象発生率は単位時間あたりの事象として計算でき、これにより各単位の観測期間を変更できます。これらの例では、曝露はそれぞれ単位面積、人年、単位時間です。ポアソン回帰では、これはオフセット として扱われます。発生率がカウント/曝露である場合、式の両辺に曝露を掛けると、それが式の右辺に移動します。次に式の両辺を対数変換すると、最終的なモデルには、回帰係数に追加される項として log(曝露) が含まれます。この対数変換された変数 log(exposure) はオフセット変数と呼ばれ、パラメータ推定値 (log(exposure) が 1 に制約された状態で方程式の右辺に現れます。
ログ ( E ( Y ∣ x ) ) = θ ′ x {\displaystyle \log(\operatorname {E} (Y\mid x))=\theta 'x} これはつまり
ログ ( E ( Y ∣ x ) 暴露 ) = ログ ( E ( Y ∣ x ) ) − ログ ( 暴露 ) = θ ′ x {\displaystyle \log \left({\frac {\operatorname {E} (Y\mid x)}{\text{exposure}}}\right)=\log(\operatorname {E} (Y\mid x))-\log({\text{exposure}})=\theta 'x} ログ ( E ( Y ∣ x ) ) = θ ′ x + ログ ( 暴露 ) {\displaystyle \log \left(\operatorname {E} (Y\mid x)\right)=\theta 'x+\log({\text{exposure}})} R におけるGLM の場合のオフセットは、以下の関数を使用して実現できます。offset()
glm ( y ~ offset ( log ( exposure )) + x , family = poisson ( link = log ) )
過分散とゼロインフレ ポアソン分布 の特徴は、平均が分散と等しいことです。特定の状況では、観測された分散が 平均よりも大きいことがわかります。これは過分散として知られており、モデルが適切でないことを示しています。一般的な原因は、関連する説明変数または従属観測値の省略です。状況によっては、 準尤度 推定または負の二項分布 を使用することで、過分散の問題を解決できます。[ 5 ] [ 6 ]
Ver Hoef と Boveng は、 準ポアソン分布 (準尤度による過分散とも呼ばれる) と負の二項分布 (ガンマ ポアソン分布と同等) の違いを次のように説明しています。E ( Y ) = μ の場合、準ポアソン モデルでは var( Y ) = θμ と 仮定し、ガンマ ポアソン分布では var( Y ) = μ (1 + κμ ) と仮定します。ここで、θ は準ポアソン過分散パラメータ、κは 負の二項分布 の形状パラメータです。どちらのモデルでも、パラメータは反復重み付き最小二乗法 を使用して推定されます。準ポアソン分布の場合、重みはμ / θ です。負の二項分布の場合、重みはμ /(1 + κμ ) です。μ が 大きく、ポアソン分布を超える変動が大きい場合、負の二項分布の重みは1/ κ に制限されます。 Ver HoefとBovengは、平均二乗残差を平均に対してプロットすることによって2つのうちどちらかを選択する例について議論した。[ 7 ]
ポアソン回帰におけるもう一つのよくある問題は、ゼロの過剰です。ゼロ事象が発生するか、何らかの事象が発生するかを決定するプロセスと、事象の発生数を決定するポアソン過程という2つのプロセスが作用している場合、ポアソン回帰が予測するよりも多くのゼロが発生します。例としては、喫煙者ではない人がいるグループのメンバーが1時間に吸うタバコの本数の分布が挙げられます。
負の二項分布 モデルやゼロ過剰分布モデル などの他の一般化線形モデルの方が、 このような場合にはより適切に機能する可能性がある。
それどころか、分散不足はパラメータ推定に問題を引き起こす可能性がある。[ 8 ]
拡張機能
正則化ポアソン回帰 ポアソン回帰のパラメータを推定する場合、通常は、次の形式の式の尤度を最大化するθの値を見つけようとします。
∑ 私 = 1 m ログ ( p ( y 私 ; e θ ′ x 私 ) ) 、 {\displaystyle \sum _{i=1}^{m}\log(p(y_{i};e^{\theta 'x_{i}})),} ここで、m はデータセット内の例の数であり、p ( y 私 ; e θ ′ x 私 ) {\displaystyle p(y_{i};e^{\theta 'x_{i}})} は、平均を に設定したポアソン分布 の確率質量関数 です。e θ ′ x 私 {\displaystyle e^{\theta 'x_{i}}} . 正則化は、代わりに[ 9 ] を最大化することによって、この最適化問題に追加できます。
∑ 私 = 1 m ログ ( p ( y 私 ; e θ ′ x 私 ) ) − λ ‖ θ ‖ 2 2 、 {\displaystyle \sum _{i=1}^{m}\log(p(y_{i};e^{\theta 'x_{i}}))-\lambda \left\|\theta \right\|_{2}^{2},} ある正の定数に対してλ {\displaystyle \lambda } この手法は、リッジ回帰 と同様に、過学習を 軽減することができます。
参考文献 ↑ Nelder, JA (1974). "分割表の対数線形モデル:古典的最小二乗法の一般化" . Journal of the Royal Statistical Society, Series C (Applied Statistics) . 23 (3): pp. 323–329. doi : 10.2307/2347125 . JSTOR 2347125 . ↑ ウールドリッジ、ジェフリー (2010). クロスセクションおよびパネルデータの計量経済学的分析 (第 2 版). マサチューセッツ州ケンブリッジ: MIT 出版. p. 726. ↑ グリーン、ウィリアム H. (2003). 計量経済学分析 (第 5 版). プレンティス・ホール. pp. 740 –752. ISBN 978-0130661890 。↑ Frome, Edward L. (1983). "ポアソン回帰モデルを用いた率の分析" . Biometrics . 39 (3): pp. 665–674. doi : 10.2307/2531094 . JSTOR 2531094 . ↑ Paternoster R、Brame R ( 1997 ) 。 「非行への複数 の経路?犯罪 の発達 理論 と一般理論の検証」。 犯罪学 。35 : 49–84。doi : 10.1111/j.1745-9125.1997.tb00870.x。eISSN 1745-9125。ISSN 0011-1384 。 ↑ Berk R 、 MacDonald J ( 2008)。「過分散とポアソン回帰」。Journal of Quantitative Criminology。24 ( 3): 269–284。doi : 10.1007/s10940-008-9048-4。S2CID 121273486 。 ↑ Ver Hoef, JAY M.; Boveng, Peter L. (2007-01-01). "準ポアソン回帰 vs. 負の二項回帰: 過分散カウントデータをどのようにモデル化すべきか?" . Ecology . 88 (11): 2766– 2772. Bibcode : 2007Ecol...88.2766V . doi : 10.1890/07-0043.1 . PMID 18051645 . 2016-09-01 に取得 . ↑ Schwarzenegger, Rafael; Quigley, John; Walls, Lesley (2021年11月23日) 「依存性を引き出す努力は価値があるか?多変量ポアソン・ガンマ確率モデルに関する研究」 。Proceedings of the Institution of Mechanical Engineers, Part O: Journal of Risk and Reliability。237 ( 5): 5。doi : 10.1177/1748006X211059417 。 ↑ Perperoglou, Aris (2011-09-08). "ペナルティ付きポアソン回帰による生存データの適合". Statistical Methods & Applications . 20 (4). Springer Nature: 451– 462. doi : 10.1007/s10260-011-0172-1 . ISSN 1618-2510 . S2CID 10883925 .
さらに読む キャメロン、AC; トリヴェディ、PK (1998).カウントデータの回帰分析 . ケンブリッジ大学出版局. ISBN 978-0-521-63201-0 。 Christensen, Ronald (1997).対数線形モデルとロジスティック回帰 . Springer Texts in Statistics (第2 版). ニューヨーク: Springer-Verlag. ISBN 978-0-387-98247-2 MR 1633357 . グーリエロウ、クリスチャン (2000)。「離散正変数の計量経済学:ポアソンモデル」。質的従属変数の計量経済学 。 ニューヨーク:ケンブリッジ大学出版局。pp. 270–83。ISBN 978-0-521-58985-7 。Greene, William H. (2008). 「イベント数と期間のモデル」.計量経済学分析 (第8 版). Upper Saddle River: Prentice Hall. pp. 906–944 . ISBN 978-0-13-600383-0 。ヒルベ、JM(2007)。負の二項回帰 。ケンブリッジ大学出版局。ISBN 978-0-521-85772-7 。 Jones, Andrew M. 他 (2013). 「計数データのためのモデル」.応用医療経済学 . ロンドン: Routledge. pp. 295–341 . ISBN 978-0-415-67682-3 。 Myers, Raymond H. 他 (2010). 「ロジスティック回帰モデルとポアソン回帰モデル」.一般化線形モデルとその工学および科学への応用 (第2 版). ニュージャージー州: Wiley. pp. 176–183 . ISBN 978-0-470-45463-3 。