生存関数は、患者、デバイス、またはその他の対象物が一定期間を超えて生存する確率を示す関数です。[ 1 ]生存関数は、生存 者関数[ 2 ]または信頼性関数[ 3 ]とも呼ばれます。信頼性関数という 用語は工学分野で一般的ですが、生存関数という用語は人間の死亡率を含むより広い範囲のアプリケーションで使用されます。生存関数は、寿命の相補累積分布関数です。相補累積分布関数は、一般的に生存関数と呼ばれることもあります。
生涯故障までの時間を表す連続確率変数とする。累積分布関数を持つ確率密度関数インターバル中にすると、生存関数または信頼性関数は次のようになります。
以下のグラフは、仮説上の生存関数の例を示しています。x軸は時間、y軸は生存する被験者の割合です。これらのグラフは、被験者が時間tを超えて生存する確率を示しています。

例えば、生存関数1の場合、t = 2ヶ月より長く生存する確率は0.37です。つまり、被験者の37%が2ヶ月以上生存します。

生存関数2の場合、 t = 2ヶ月より長く生存する確率は0.97です。つまり、被験者の97%が2ヶ月以上生存します。

生存期間の中央値は、生存関数から決定できます。生存期間の中央値は、生存関数が値0.5と交差する点です。[ 4 ]例えば、生存関数 2 の場合、被験者の 50% が 3.72 か月生存します。したがって、生存期間の中央値は3.72 か月です。

生存期間の中央値は、グラフだけでは必ずしも判断できるとは限りません。例えば、生存関数4では、被験者の50%以上が10ヶ月の観察期間よりも長く生存しています。

生存関数は、生存データを記述および表示するいくつかの方法の 1 つです。データを表示するもう 1 つの便利な方法は、被験者の生存時間の分布を示すグラフです。Olkin、[ 5 ] 426 ページで、次の生存データの例を示します。エアコン (AC) システムの連続した故障間の時間数が記録されました。連続した故障間の時間 t は、1、3、5、7、11、11、11、12、14、14、14、16、16、20、21、23、42、47、52、62、71、71、87、90、95、120、120、225、246、261 時間です。故障間の平均時間は 59.6 です。下の図は、故障間の時間の分布を示しています。グラフの下にある青い目盛りは、連続するエアコン故障の間隔時間を示しています。

この例では、指数分布を表す曲線が交流故障時間の分布に重ね合わされています。指数分布は交流故障時間の分布を近似しています。この特定の指数曲線は、パラメータラムダλによって指定されます。
故障時間の分布は、時間が任意の正の値をとることができるため、確率密度関数(PDF) です。方程式では、PDF はf Tと指定されます。時間が離散値 (1 日、2 日など) しかとれない場合、故障時間の分布は確率質量関数と呼ばれます。ほとんどの生存分析法では、時間が任意の正の値をとることができると仮定し、f Tが PDF となります。観測された AC 故障間の時間を指数関数で近似すると、指数曲線は AC 故障時間の確率密度関数f Tを与えます。
生存データを表示するもう1つの便利な方法は、各時点までの累積故障数を示すグラフです。これらのデータは、各時点までの累積故障数または累積故障率として表示できます。下のグラフは、空調システムの各時点における累積故障確率(または割合)を示しています。黒色の階段状の線は、累積故障率を表しています。各階段の下部には、観測された故障時間を示す青い目盛りが付いています。滑らかな赤色の線は、観測データに適合させた指数曲線を表しています。
![]()
各時点までの累積故障確率のグラフを累積分布関数(CDF)と呼びます。生存分析では、累積分布関数は生存時間が特定の時間t以下である確率を示します。
Tを生存時間とします。T は任意の正の数です。特定の時間は小文字のtで表されます。T の累積分布関数は次の関数です。
ここで、右辺は確率変数Tがt以下である確率を表します。時間が任意の正の値をとることができる場合、累積分布関数F ( t )は確率密度関数f ( t )の積分です。
エアコンの例では、以下の累積分布関数のグラフは、データに指数曲線近似を用いて推定した結果、故障までの時間が100時間以下である確率が0.81であることを示しています。
![]()
故障時間が100時間以下である確率をグラフ化する代わりに、故障時間が100時間を超える確率をグラフ化することもできます。故障時間が100時間を超える確率は、故障時間が100時間以下である確率から1を引いた値でなければなりません。なぜなら、合計確率は1になる必要があるからです。
これにより、以下が得られます。
この関係は、あらゆる故障時間に一般化できる。
この関係は、以下のグラフに示されています。左側のグラフは累積分布関数で、Pr( T ≤ t )です。右側のグラフはPr( T > t ) = 1 − Pr( T ≤ t )です。右側のグラフは生存関数S ( t ) です。S ( t ) = 1 – CDFであるという事実が、生存関数が相補累積分布関数とも呼ばれる理由です。
![]()
エアコンの例のように、生存時間の分布は指数分布などの関数でよく近似できる場合があります。生存分析では、指数分布、ワイブル分布、ガンマ分布、正規分布、対数正規分布、対数ロジスティック分布など、いくつかの分布が一般的に使用されます。[ 3 ] [ 6 ]これらの分布はパラメータによって定義されます。たとえば、正規(ガウス)分布は、平均と標準偏差の 2 つのパラメータによって定義されます。パラメータによって定義される生存関数は、パラメトリックであると言われます。
上記の4つの生存関数グラフでは、生存関数の形状は特定の確率分布によって定義されています。生存関数1は指数分布、2はワイブル分布、3は対数ロジスティック分布、4は別のワイブル分布によって定義されています。
指数生存分布では、個人や機器の年齢に関係なく、どの時間間隔でも故障の確率は同じです。この事実から、指数生存分布の「記憶がない」性質が導かれます。つまり、対象の年齢は次の時間間隔での故障の確率に影響を与えません。指数分布は、故障した部品を交換するシステムの寿命の良いモデルとなる可能性があります。[ 7 ]また、短い時間間隔での生物の生存をモデル化するのに有用かもしれません。生物の完全な寿命の良いモデルとなる可能性は低いでしょう。[ 8 ]エフロンとハスティ[ 9 ] (p.134 )が指摘しているように、「人間の寿命が指数分布であれば、老人や若者は存在せず、幸運な人や不運な人がいるだけでしょう」。
指数生存関数の重要な仮定は、ハザード率が一定であるということです。上記の例では、毎年死亡する男性の割合は10%で一定であり、これはハザード率が一定であることを意味します。しかし、ハザード率が一定であるという仮定は適切ではない場合があります。例えば、ほとんどの生物では、死亡リスクは中年期よりも老年期の方が高く、つまりハザード率は時間とともに増加します。乳がんなどの一部の疾患では、5年後には再発リスクが低くなり、つまりハザード率は時間とともに減少します。ワイブル分布は、ハザード率が一定、増加、または減少する場合に対応できるように指数分布を拡張したものです。
正規分布、対数正規分布、対数ロジスティック分布、ガンマ分布など、特定のデータセットにより適したパラメトリック生存関数が他にもいくつかあります。特定のアプリケーションに適したパラメトリック分布の選択は、グラフ法または正式な適合度検定を使用して行うことができます。これらの分布と検定については、生存分析の教科書に記載されています。[ 1 ] [ 3 ] Lawless [ 10 ] は、パラメトリックモデルについて幅広く解説しています。
パラメトリック生存関数は、製造業の分野で広く用いられています。これは、観察期間を超えた生存関数の推定が可能になるためです。しかし、パラメトリック関数を適切に利用するには、選択した分布によってデータが適切にモデル化される必要があります。適切な分布が見つからない場合、あるいは臨床試験や実験の前に特定できない場合は、ノンパラメトリック生存関数が有用な代替手段となります。
生存率のパラメトリックモデルは、不可能または望ましくない場合があります。このような場合、生存関数をモデル化する最も一般的な方法は、ノンパラメトリックなカプラン・マイヤー推定量です。この推定量には、生涯データが必要です。定期的な症例数(コホート数)と死亡数(および回復数)は、生涯データがなくても、生存関数のノンパラメトリックな最尤推定値と最小二乗推定値を算出するのに統計的に十分です。
となることによって