統計的手法
条件付きロジスティック回帰は、ロジスティック回帰の拡張版であり、層別化とマッチングを考慮することができます。主な応用分野は観察研究、特に疫学です。1978年にNorman Breslow、Nicholas Day、Katherine Halvorsen、Ross L. Prentice、C. Sabaiによって考案されました。 [1]マッチングされたデータに対する最も柔軟で一般的な手順です。
背景
観察研究では、交絡因子を制御する方法として層別化またはマッチングを使用します。
ロジスティック回帰は、各層に異なる定数項を設定することで層別化を考慮できます。層の番目の観測値のラベル(例:症例ステータス)と対応する予測変数の値を示します。次に、1つの観測値が





ここで、 は番目の層の定数項です。このモデルのパラメータは、最尤推定法を使用して推定できます。


たとえば、運動が心血管疾患のリスクに与える影響を推定する場合を考えてみましょう。運動量が多い人が若かったり、医療を受けやすくなったり、健康を改善するその他の違いがあったりする場合、運動に費やした時間(分)に対する心血管疾患発症のロジスティック回帰分析では、運動が健康に与える影響を過大評価する可能性があります。これに対処するために、年齢や居住地の郵便番号などの人口統計学的特性に基づいて人々をグループ化することができます。各層は、同様の人口統計学的特性を持つ人々のグループです。ベクトルには、層 の個人の関心のある変数(この場合は、運動に費やした時間)に関する情報が含まれています。値は、人口統計学的特性が心血管疾患発症に与える影響であり、層内のすべての人で同じであると想定されています。ベクトル(この例では単なるスカラー)は、関心のある量、つまり運動が心血管疾患に与える影響です。 内に制御変数を含めることもできます。








モチベーション
上で説明したロジスティック回帰は、データ量に比べて層数が少ない場合にうまく機能します。層数を固定し、データ量を増やすと、モデルパラメータ(各層とベクトル)の推定値は真の値に収束します。


しかし、小さな層がたくさんあると、データ量とともにパラメータの数が増えるため、異常な動作が発生します。たとえば、各層に 2 つのデータポイントが含まれている場合、データポイントを持つモデルのパラメータ数は となり、パラメータの数はデータポイントの数と同じオーダーになります。これらの設定では、データ量が増えるにつれて、最大尤度推定の基となる漸近結果は有効ではなくなり、結果として得られる推定値は偏ります。条件付きロジスティック回帰はこの問題を修正します。実際、マッチしたペアデータの無条件分析では、正しい条件付きのオッズ比の 2 乗であるオッズ比の推定値が得られることが示されています。[2]
ロジスティック回帰に基づく検定に加えて、関連検定に示されているように、条件付きロジスティック回帰の前には、一致したデータに対する他の検定がいくつか存在していました。しかし、それらの検定では、任意の層サイズを持つ連続予測子の分析はできませんでした。また、これらの手順はすべて、条件付きロジスティック回帰の柔軟性、特に共変量を制御する可能性を欠いています。
条件付き尤度
条件付きロジスティック回帰では、各層の症例数を条件として上記の病的な動作に対処する条件付き尤度アプローチを使用します。これにより、層パラメータを推定する必要がなくなります。
層がペアになっている場合、最初の観察がケースで2番目がコントロールである場合、これは次のように表すことができます。
![{\displaystyle {\begin{aligned}&\mathbb {P} (Y_{i1}=1,Y_{i2}=0|X_{i1},X_{i2},Y_{i1}+Y_{i2}=1)\\&={\frac {\mathbb {P} (Y_{i1}=1|X_{i1})\mathbb {P} (Y_{i2}=0|X_{i2})}{\mathbb {P} (Y_{i1}=1|X_{i1})\mathbb {P} (Y_{i2}=0|X_{i2})+\mathbb {P} (Y_{i1}=0|X_{i1})\mathbb {P} (Y_{i2}=1|X_{i2})}}\\[6pt]\ &={\frac {{\frac {\exp(\alpha _{i}+{\boldsymbol {\beta }}^{\top }X_{i1})}{1+\exp(\alpha _{i}+{\boldsymbol {\beta }}^{\top }X_{i1})}}\times {\frac {1}{1+\exp(\alpha _{i}+{\boldsymbol {\beta }}^{\top }X_{i2})}}}{{\frac {\exp(\alpha _{i}+{\boldsymbol {\beta }}^{\top }X_{i1})}{1+\exp(\alpha _{i}+{\boldsymbol {\beta }}^{\top }X_{i1})}}\times {\frac {1}{1+\exp(\alpha _{i}+{\boldsymbol {\beta }}^{\top }X_{i2})}}+{\frac {1}{1+\exp(\alpha _{i}+{\boldsymbol {\beta }}^{\top }X_{i1})}}\times {\frac {\exp(\alpha _{i}+{\boldsymbol {\beta }}^{\top }X_{i2})}{1+\exp(\alpha _{i}+{\boldsymbol {\beta }}^{\top }X_{i2})}}}}\\[6pt]\ &={\frac {\exp({\boldsymbol {\beta }}^{\top }X_{i1})}{\exp({\boldsymbol {\beta }}^{\top }X_{i1})+\exp({\boldsymbol {\beta }}^{\top }X_{i2})}}.\\[6pt]\end{aligned}}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/729cafa9bdb8fa09e5a3d2e42419fef9442fb096)
同様の計算により、最初の観測値がケースである
、サイズ の層の条件付き尤度は、


ここで、 は集合 のサイズのすべての部分集合の集合です。



完全な条件付き対数尤度は、各層の対数尤度の合計になります。推定量は、条件付き対数尤度を最大化するものとして定義されます。

実装
clogit条件付きロジスティック回帰は、Rのパッケージ内の関数として利用できます。条件付きロジスティックモデルの対数尤度は、特定のデータ構造を持つCoxモデルの対数尤度と同じであるため、パッケージsurvival内にあります。 [3]survival
statsmodelsPythonではバージョン0.14以降のパッケージを通じて利用することもできます。 [4]
注記
- ^ Breslow NE、Day NE、 Halvorsen KT、Prentice RL、Sabai C (1978)。「マッチした症例対照研究における多重相対リスク関数の推定」。Am J Epidemiol。108 ( 4): 299–307。doi :10.1093/oxfordjournals.aje.a112623。PMID 727199。
- ^ Breslow, NE; Day, NE (1980). 癌研究における統計的手法。第1巻-症例対照研究の分析。リヨン、フランス:IARC。pp. 249–251。2016年12月26日時点のオリジナルよりアーカイブ。 2016年11月4日閲覧。
- ^ Lumley, Thomas. 「R ドキュメント 条件付きロジスティック回帰」 。2016年11 月 3 日閲覧。
- ^ "statsmodels.discrete.conditional_models.ConditionalLogit" . 2023年3月25日閲覧。
- ^ Day, NE, Byar, DP (1979). 「症例対照研究における仮説の検定 - Mantel-Haenszel 統計とロジットスコア検定の同等性」.バイオメトリクス. 35 (3): 623–630. doi :10.2307/2530253. JSTOR 2530253. PMID 497345.
{{cite journal}}: CS1 maint: multiple names: authors list (link)