
医学や統計学において、感度と特異度は、ある疾患の有無を報告する検査の精度を数学的に表す指標です。疾患を持つ人を「陽性」、持たない人を「陰性」とすると、感度は検査が真の陽性をどれだけ正確に識別できるかを示す指標であり、特異度は検査が真の陰性をどれだけ正確に識別できるかを示す指標です。
病状の真の状態が不明な場合、感度と特異度は、正しいと仮定される「ゴールドスタンダード検査」を基準として定義されます。診断とスクリーニングの両方を含むすべての検査において、感度と特異度の間には通常トレードオフの関係があり、感度が高いほど特異度は低くなり、その逆もまた然りです。
疾患の存在を確実に検出でき、真陽性率が高く偽陰性率が低い検査は、感度が高いと言えます。これは、疾患を治療しない場合の結果が深刻である場合、および/または治療が非常に効果的で副作用が最小限である場合に特に重要です。
疾患を持たない人を確実に除外し、真の陰性数が多く偽陽性数が少ない検査は、特異度が高いと言えます。これは、疾患があると診断された人が、さらなる検査、費用、偏見、不安などに晒される可能性がある場合に特に重要です。

「感度」と「特異度」という用語は、1947年にアメリカの生物統計学者ジェイコブ・イェルシャルミーによって導入されました。[ 1 ]
There are different definitions within laboratory quality control, wherein "analytical sensitivity" is defined as the smallest amount of substance in a sample that can accurately be measured by an assay (synonymously to detection limit), and "analytical specificity" is defined as the ability of an assay to measure one particular organism or substance, rather than others.[2] However, this article deals with diagnostic sensitivity and specificity as defined at top.
Imagine a study evaluating a test that screens people for a disease. Each person taking the test either has or does not have the disease. The test outcome can be positive (classifying the person as having the disease) or negative (classifying the person as not having the disease). The test results for each subject may or may not match the subject's actual status. In that setting:
After getting the numbers of true positives, false positives, true negatives, and false negatives, the sensitivity and specificity for the test can be calculated. If it turns out that the sensitivity is high then any person who has the disease is likely to be classified as positive by the test. On the other hand, if the specificity is high, any person who does not have the disease is likely to be classified as negative by the test. An NIH web site has a discussion of how these ratios are calculated.[3]
Consider the example of a medical test for diagnosing a condition. Sensitivity (sometimes also named the detection rate in a clinical setting) refers to the test's ability to correctly detect ill patients out of those who do have the condition.[4] Mathematically, this can be expressed as:
感度の高い検査で陰性結果が出た場合、病気を「除外」するのに役立つことがあります[ 4 ]。なぜなら、実際に病気にかかっている人を誤診することはほとんどないからです。感度100%の検査では、陽性反応を示すことで、病気にかかっているすべての患者を認識します。この場合、陰性検査結果は、患者に病気が存在しないことを確実に示します。しかし、感度の高い検査で陽性結果が出ても、必ずしも病気を「確定」するのに役立つとは限りません。常に陽性反応を示すように設計された「偽の」検査キットがあるとします。病気の患者に使用すると、すべての患者が陽性反応を示し、検査の感度は100%になります。しかし、感度は偽陽性を考慮していません。偽の検査は健康な患者にも陽性反応を示し、偽陽性率は100%となり、病気の検出や「確定」には役に立ちません。
感度の計算では、判定不能な検査結果は考慮されません。検査を繰り返すことができない場合、判定不能なサンプルは分析から除外するか(感度を引用する際に除外するサンプルの数を明記する必要があります)、偽陰性として扱うことができます(この場合、感度の最悪の値が得られ、過小評価される可能性があります)。
感度が高い検査ほど、第二種過誤率は低くなる。
病気の診断のための医療検査を例に考えてみましょう。特異度とは、疾患のない健康な患者を正しく除外する検査の能力を指します。数学的には、これは次のように表すことができます。
特異度の高い検査で陽性結果が出た場合、健康な患者では陽性結果が出ることはまれであるため、疾患の「確定」に役立つことがあります。[ 5 ]特異度が100%の検査では、陰性となることで疾患のない患者をすべて識別するため、陽性結果が出れば疾患の存在が確定します。しかし、特異度の高い検査で陰性結果が出ても、必ずしも疾患の「除外」に役立つとは限りません。たとえば、常に陰性結果を返す検査は、特異度は偽陰性を考慮しないため、特異度が100%になります。このような検査では、疾患のある患者でも陰性となるため、疾患の「除外」には役に立ちません。
特異度が高い検査ほど、第一種過誤率は低くなる。
上記の図は、感度と特異度の関係を示すものです。グラフ中央の黒い点線は、感度と特異度が等しい点を示しています。黒い点線の左側へ移動すると、感度は上昇し、A線で最大値の100%に達し、特異度は低下します。A線での感度が100%なのは、その点で偽陰性がゼロであり、つまりすべての陰性検査結果が真の陰性であるからです。右側へ移動すると、その逆の現象が起こり、特異度はB線に達するまで上昇し、100%になり、感度は低下します。B線での特異度が100%なのは、その点で偽陽性数がゼロであり、つまりすべての陽性検査結果が真の陽性であるからです。
感度と特異度を示す上記の2つの図の中央の実線は、検査のカットオフポイントです。前述のとおり、この線を移動させると、感度と特異度の間でトレードオフが生じます。この線の左側には、カットオフポイントを下回るデータポイントがあり、陰性とみなされます(青い点は偽陰性(FN)、白い点は真陰性(TN)を示します)。線の右側には、カットオフポイントを上回るデータポイントがあり、陽性とみなされます(赤い点は偽陽性(FP)を示します)。各側には40個のデータポイントがあります。
感度が高く特異度が低い図では、偽陰性 (FN) が 3 件、偽陽性 (FP) が 8 件あります。陽性結果 = 真陽性 (TP) + FP という事実を使用すると、TP = 陽性結果 - FP、つまり TP = 40 - 8 = 32 となります。データセット内の病気の人の数は TP + FN に等しく、32 + 3 = 35 です。したがって、感度は 32 / 35 = 91.4% です。同じ方法を使用すると、TN = 40 - 3 = 37、健康な人の数は 37 + 8 = 45 となり、特異度は 37 / 45 = 82.2 % となります。
感度が低く特異度が高い図では、偽陰性(FN)が8、偽陽性(FP)が3です。前の図と同じ方法を用いると、真陽性(TP)は40 - 3 = 37となります。病気の人の数は37 + 8 = 45で、感度は37 / 45 = 82.2 %です。真陰性(TN)は40 - 8 = 32です。したがって、特異度は32 / 35 = 91.4%となります。
赤い点は、その疾患を持つ患者を示しています。赤い背景は、テストがデータポイントを陽性と予測する領域を示しています。この図の真陽性は 6、偽陰性は 0 です (すべての陽性状態が正しく陽性と予測されているため)。したがって、感度は 100% ( 6 / (6 + 0)から)。この状況は、点線が位置 A にある前の図にも示されています (左側はモデルによって陰性と予測され、右側はモデルによって陽性と予測されます)。点線、つまりテストのカットオフラインが位置 A にある場合、テストは真陽性クラスのすべての集団を正しく予測しますが、真陰性クラスのデータポイントを正しく識別することはできません。
先に説明した図と同様に、赤い点は病状のある患者を示しています。ただし、この場合、緑色の背景は、検査がすべての患者が病状がないと予測していることを示しています。真の陰性であるデータポイントの数は26であり、偽陽性の数は0です。この結果、特異度は100%となります(26 / (26 + 0)より)。したがって、感度または特異度だけでは、検査の性能を評価することはできません。
医学診断において、検査の感度は、検査が疾患のある人を正しく識別する能力(真陽性率)であり、検査の特異度は、検査が疾患のない人を正しく識別する能力(真陰性率)です。疾患があることがわかっている患者 100 人を検査し、43 人が陽性だった場合、検査の感度は 43% です。疾患のない 100 人を検査し、96 人が完全に陰性だった場合、検査の特異度は 96% です。感度と特異度は、その値が検査に固有のものであり、対象集団における疾患の有病率に依存しないため、有病率に依存しない検査特性です。 [ 6 ]陽性予測値と陰性予測値は、感度や特異度とは異なり、検査対象集団における疾患の有病率の影響を受ける値です。
特異度の高い検査は陽性の場合に疾患を確定するのに有効であり、感度の高い検査は陰性の場合に疾患を除外するのに有効であるとよく言われます。[ 7 ] [ 8 ]これにより、特異度の高い検査は陽性の場合に疾患を確定し(SP-P-IN)、感度の高い検査は陰性の場合に疾患を除外する(SN-N-OUT)という、広く使われている覚え方である SPPIN と SNNOUT が生まれました。しかし、どちらの経験則も推論的に誤解を招く可能性があります。なぜなら、どの検査の診断力も、検査対象の疾患の有病率、検査の感度、および特異度によって決まるからです。[ 9 ] [ 10 ] [ 11 ] SNNOUT の覚え方は、検査対象のサンプルにおける問題の疾患の有病率が極めて低い場合にある程度有効です。
特異度と感度のトレードオフは、ROC分析において、再現率(TPR)と偽陽性率(FPR)のトレードオフとして検討される。 [ 12 ]これらに等しい重みを与えることで、情報量=特異度+感度-1=TPR-FPRが最適化され、その大きさは2つのクラス間の情報に基づいた決定の確率を示す(> 0は情報の適切な使用、0は偶然レベルのパフォーマンス、< 0は情報の不適切な使用を表す)。[ 13 ]
感度指数、またはd′ (「ディープライム」と発音) は、信号検出理論で使用される統計量です。これは、信号分布とノイズ分布の平均とノイズ分布の標準偏差との間の分離を示します。平均と標準偏差が正規分布する信号とノイズの場合、そして、 そしてそしてそれぞれ、d′は次のように定義される。
d′の推定値は、ヒット率と誤報率の測定値からも求めることができます。計算式は以下のとおりです。
ここで、関数Z ( p ) 、p ∈ [0, 1] は累積ガウス分布の逆関数です。
d′は無次元統計量である。d ′の値が大きいほど、信号がより容易に検出できることを示す。
感度、特異度、および類似の用語の関係は、次の表を使用して理解できます。ある疾患の陽性例がP個、陰性例がN個あるグループを考えます。4つの結果は、2×2分割表または混同行列で定式化でき、また、4つの結果を使用して、次のようにいくつかの指標を導出できます。
関連計算
この架空のスクリーニング検査(便潜血検査)は、大腸がん患者の3分の2(66.7%)を正しく特定しました。[ a ]残念ながら、有病率を考慮すると、この架空の検査は偽陽性率が高く、無症状の人々の全体集団において大腸がんを確実に特定することはできません(PPV = 10%)。
一方、この仮想的な検査は、がんのない個人を非常に正確に検出できることが示されています(陰性予測値 ≈ 99.5%)。したがって、無症状の成人を対象とした大腸がんの定期検診に使用した場合、陰性結果は、大腸がんの発症を心配している患者を安心させるなど、患者と医師にとって重要な情報を提供します。
感度と特異度の値だけでは、非常に誤解を招く可能性があります。結果が少ない実験結果に頼ることを避けるためには、「最悪の場合」の感度または特異度を計算する必要があります。例えば、ある検査は、ゴールドスタンダードに対して4回検査すれば簡単に100%の感度を示すかもしれませんが、ゴールドスタンダードに対してさらに1回検査を行い、結果が悪かった場合、感度はわずか80%と判断されることになります。これを実現する一般的な方法は、二項比率信頼区間を示すことであり、これは多くの場合、ウィルソンスコア区間を用いて計算されます。
感度と特異度の信頼区間を計算することで、特定の信頼水準(例えば95%)で正しい値が含まれる値の範囲がわかります。[ 26 ]
情報検索では、陽性予測値は精度、感度は再現率と呼ばれます。特異度と感度のトレードオフとは異なり、これらの指標はどちらも真の陰性の数とは無関係です。真の陰性数は一般的に不明であり、関連する検索済み文書の実際の数よりもはるかに多くなります。真の陰性数が陽性数に比べて非常に多いというこの仮定は、他のアプリケーションではまれです。[ 13 ]
Fスコアは、陽性クラスにおける検査の性能を測る単一の指標として使用できます。Fスコアは、精度と再現率の調和平均です。
統計的仮説検定の伝統的な用語では、検定の感度は検定の統計的検出力と呼ばれますが、この文脈における「検出力」という言葉は、より一般的な用法を持ち、本稿の文脈には当てはまりません。感度の高い検定では、第二種過誤が少なくなります。
情報検索の領域と同様に、遺伝子予測の研究領域では、ゲノム配列中の真の陰性(非遺伝子)の数は一般的に不明であり、実際の遺伝子数(真の陽性)よりもはるかに多い。この研究領域では、便利で直感的に理解できる用語である特異度が、生物統計学で定義されている精度と再現率の数式とともに頻繁に使用されている。このように定義された特異度(陽性予測値)と感度(真陽性率)のペアは、遺伝子予測アルゴリズムの精度を特徴付ける主要なパラメータである。[ 27 ] [ 28 ] [ 29 ] [ 30 ] 逆に、真陰性率という意味での特異度という用語は、ゲノム解析の研究領域ではほとんど、あるいは全く適用されないだろう。