
医学と統計学では、感度と特異度は、病状の有無を報告する検査の精度を数学的に表します。病状のある人が「陽性」とみなされ、病状のない人が「陰性」とみなされる場合、感度は検査が真陽性をどれだけ正確に識別できるかの尺度であり、特異度は検査が真陰性をどれだけ正確に識別できるかの尺度です。
- 感度(真陽性率)は、個人が実際に陽性であるという条件の下で、陽性の検査結果が出る確率です。
- 特異度(真陰性率)は、個人が実際に陰性であるという条件の下で、陰性の検査結果が出る確率です。
病状の真の状態が分からない場合、感度と特異度は、正しいと想定される「ゴールド スタンダード テスト」を基準にして定義できます。診断とスクリーニングの両方のテストでは通常、感度と特異度の間にトレードオフがあり、感度が高いほど特異度は低くなり、その逆も同様です。
病気の存在を確実に検出し、真陽性の数が多く偽陰性の数が少ない検査は、感度が高くなります。これは、病気を治療しなかった場合の結果が深刻である場合や、治療が非常に効果的で副作用が最小限である場合に特に重要です。
症状のない個人を確実に除外し、真陰性が多く偽陽性が少ない結果となる検査は、特異度が高くなります。症状があると特定された人が、より多くの検査、費用、偏見、不安などにさらされる可能性がある場合には、これは特に重要です。

「感度」と「特異度」という用語は、1947年にアメリカの生物統計学者ジェイコブ・イェルシャルミーによって導入されました。[1]
検査室の品質管理にはさまざまな定義があり、「分析感度」は、分析によって正確に測定できるサンプル内の物質の最小量(検出限界と同義)と定義され、「分析特異性」は、他の生物または物質ではなく特定の生物または物質を測定する分析の能力と定義されています。[2]ただし、この記事では、冒頭で定義されている診断感度と特異性を扱います。
スクリーニング研究への応用
ある病気のスクリーニング検査を評価する研究を想像してください。検査を受ける人は、病気にかかっているかかかっていないかのどちらかです。検査結果は陽性 (病気にかかっていると分類) または陰性 (病気にかかっていないと分類) になります。各被験者の検査結果は、被験者の実際の状態と一致する場合もあれば、一致しない場合もあります。その設定では、次のようになります。
- 真陽性: 病気の人が正しく病気であると判定される
- 偽陽性: 健康な人が誤って病気と判定される
- 真陰性:健康な人が正しく健康であると判定される
- 偽陰性:病気の人が誤って健康であると判定される
真陽性、偽陽性、真陰性、偽陰性の数がわかれば、検査の感度と特異度を計算できます。感度が高いと、病気にかかっている人は誰でも検査で陽性と分類される可能性が高くなります。一方、特異度が高いと、病気にかかっていない人は誰でも検査で陰性と分類される可能性が高くなります。NIH の Web サイトには、これらの比率の計算方法についての説明があります。[3]
意味
感度
病気を診断するための医療検査の例を考えてみましょう。感度(臨床現場では検出率と呼ばれることもあります)とは、病気の患者を実際に持っている人から正しく検出する検査の能力を指します。[4]数学的には、次のように表現できます。
高感度の検査で陰性の結果が出れば、病気を「除外」するのに役立ち、[4]病気にかかっている人を誤診することはほとんどない。100% の感度の検査では、陽性の結果が出れば病気にかかっている患者はすべて認識される。この場合、陰性の検査結果が出れば、患者に病気があることは明確に否定される。しかし、高感度の検査で陽性の結果が出ても、必ずしも病気を「判定」するのには役立たない。「偽の」検査キットが常に陽性の結果が出るように設計されているとしよう。病気の患者に使用すると、すべての患者が陽性となり、検査の感度は 100% となる。しかし、感度は偽陽性を考慮に入れていない。偽の検査キットは健康な患者にも陽性の結果が出るため、偽陽性率は 100% となり、病気の検出や「判定」には役に立たなくなる。
感度の計算では、不確定なテスト結果は考慮されません。テストを繰り返すことができない場合は、不確定なサンプルを分析から除外するか (感度を引用するときに除外数を明記する必要があります)、偽陰性として処理することができます (この場合、感度の最悪の値が得られるため、感度が過小評価される可能性があります)。
感度の高いテストでは、タイプ II エラー率が低くなります。
特異性
病気を診断するための医療検査の例を考えてみましょう。特異度とは、病気のない健康な患者を正しく除外する検査の能力を指します。数学的には、次のように表すことができます。
特異度の高い検査で陽性の結果が出た場合、病気を「確定」するのに有用である。なぜなら、その検査は健康な患者ではめったに陽性の結果が出ないからである。[5]特異度が 100% の検査では、病気にかかっていない患者はすべて陰性の結果で認識されるため、陽性の結果が出れば病気の存在が確定的に判定される。しかし、特異度の高い検査で陰性の結果が出た場合、必ずしも病気を「確定」するのに有用であるわけではない。例えば、常に陰性の検査結果が出る検査は、特異度が 100% になる。なぜなら、特異度では偽陰性は考慮されないからである。そのような検査では、病気にかかっている患者には陰性の結果が出るため、病気を「確定」するのには役に立たない。
特異度が高いテストでは、タイプ I のエラー率が低くなります。
グラフィックイラスト
-
感度と特異度のグラフ表示
上記のグラフは、感度と特異度の関係を示すためのものです。グラフの中央にある黒い点線は、感度と特異度が同じである場所です。黒い点線の左に移動すると、感度が上がり、線 A で最大値の 100% に達し、特異度は下がります。線 A の感度が 100% なのは、その時点で偽陰性がゼロであるためです。つまり、陰性の検査結果はすべて真陰性です。右に移動すると、反対のことが当てはまり、特異度は線 B に達するまで上がり、100% になり、感度は下がります。線 B の特異度が 100% なのは、その線で偽陽性の数がゼロであるためです。つまり、陽性の検査結果はすべて真陽性です。
-
感度は高いが特異度は低い
-
感度は低いが特異度は高い
感度と特異度を示す上記の両方の図の中央の実線は、テストのカットオフ ポイントです。前述のように、この線を移動すると、感度と特異度のレベルの間でトレードオフが発生します。この線の左側には、カットオフ ポイントを下回る結果となり、陰性と見なされるデータ ポイントが含まれます (青い点は偽陰性 (FN)、白い点は真陰性 (TN) を示します)。線の右側には、カットオフ ポイントを上回り、陽性と見なされるデータ ポイントが含まれます (赤い点は偽陽性 (FP) を示します)。各側には 40 のデータ ポイントが含まれます。
感度が高く特異度が低いことを示す図では、FN が 3 つ、FP が 8 つあります。陽性結果 = 真陽性 (TP) + FP であることから、TP = 陽性結果 - FP、つまり TP = 40 - 8 = 32 となります。データセット内の病気の人の数は TP + FN、つまり 32 + 3 = 35 です。したがって、感度は 32 / 35 = 91.4% です。同じ方法を使用すると、TN = 40 - 3 = 37、健康な人の数は 37 + 8 = 45 となり、特異度は 37 / 45 = 82.2% となります。
感度が低く特異度が高いことを示す図では、FN が 8 個、FP が 3 個あります。前の図と同じ方法を使用すると、TP = 40 - 3 = 37 になります。病人の数は 37 + 8 = 45 なので、感度は 37 / 45 = 82.2 % になります。TN は 40 - 8 = 32 個あります。したがって、特異度は 32 / 35 = 91.4% になります。
-
100%の感度を持つテスト結果
-
100%の特異度を持つ検査結果
赤い点は、病状の患者を示しています。赤い背景は、テストがデータ ポイントを陽性と予測する領域を示しています。この図の真陽性は 6 で、偽陰性は 0 です (すべての陽性状態が正しく陽性と予測されるため)。したがって、感度は 100% です ( 6 / (6 + 0)より)。この状況は、点線が位置 A にある前の図にも示されています (左側はモデルによって陰性と予測され、右側はモデルによって陽性と予測されます)。点線 (テスト カットオフライン) が位置 A にある場合、テストは真陽性クラスのすべての集団を正しく予測しますが、真陰性クラスのデータ ポイントを正しく識別することはできません。
前述の図と同様に、赤い点は病状のある患者を示しています。ただし、この場合、緑の背景は、すべての患者が病状に罹患していないとテストが予測していることを示しています。真陰性のデータ ポイントの数は 26 で、偽陽性の数は 0 です。この結果、特異度は 100% になります ( 26 / (26 + 0)から)。したがって、感度または特異度のみを使用してテストのパフォーマンスを測定することはできません。
医療用途
医療診断において、検査の感度とは、病気にかかっている人を正しく識別する検査の能力(真陽性率)であり、検査の特異度とは、病気にかかっていない人を正しく識別する検査の能力(真陰性率)である。病気にかかっていることが判明している患者 100 人を検査し、43 人が陽性と判定された場合、検査の感度は 43% である。病気にかかっていない患者 100 人を検査し、96 人が完全に陰性の結果を示した場合、検査の特異度は 96% である。感度と特異度は、有病率に依存しない検査特性であり、その値は検査に固有のものであり、対象集団における病気の有病率には左右されない。 [6] 陽性予測値と陰性予測値は、感度や特異度ではなく、検査対象集団における病気の有病率の影響を受ける値である。これらの概念は、このアプレットのベイズ臨床診断モデルでグラフィカルに示されており、陽性予測値と陰性予測値が有病率、感度、特異度の関数として表示されている。
誤解
特異度の高い検査は陽性の場合に病気を判定するのに効果的であるのに対し、感度の高い検査は陰性の場合に病気を除外するのに効果的であるとよく主張される。[7] [8]このことから、SPPINとSNNOUTという記憶法が広く使われるようになった。これによれば、特異度の高い検査が陽性の場合、病気があると判定し(SP-P-IN)、感度の高い検査が陰性の場合、病気を除外する(SN-N-OUT)。しかし、どちらの経験則も推論上誤解を招きやすい。なぜなら、あらゆる検査の診断力は、検査対象の疾患の有病率、検査の感度、および特異度によって決まるからである。[9] [10] [11] SNNOUTの記憶法は、検査したサンプルにおける問題の疾患の有病率が極めて低い場合には、ある程度の妥当性がある。
特異度と感度のトレードオフは、ROC分析ではTPRとFPR(つまり、再現率とフォールアウト)のトレードオフとして検討されます。[12]これらに等しい重みを与えると、情報提供度= 特異度 + 感度 - 1 = TPR - FPRが最適化され、その大きさは2つのクラス間の情報に基づいた決定の確率を示します(> 0は情報の適切な使用、0は偶然レベルのパフォーマンス、< 0は情報の誤った使用を表します)。[13]
感度指数
感度指数またはd ′ (「ディープライム」と発音) は、信号検出理論で使用される統計です。これは、ノイズ分布の標準偏差と比較した、信号分布とノイズ分布の平均間の分離を提供します。平均と標準偏差がそれぞれ、および、およびで正規分布する信号とノイズの場合、 d′は次のように定義されます。
- [14]
d′の推定値は、ヒット率と誤報率の測定からも得られます。次のように計算されます。
- d′ = Z (ヒット率) − Z (誤報率)、[15]
ここで関数Z ( p )、p∈ [0,1]は累積ガウス分布の逆関数です。
d′ は無次元統計です。d ′が高いほど、信号がより容易に検出されることを示します。
混同行列
感度、特異度、および類似用語の関係は、次の表を使用して理解できます。ある状態について、 P 個の陽性例とN 個の陰性例を持つグループを考えてみましょう。4 つの結果は、2×2分割表または混同行列で定式化でき、4 つの結果を使用していくつかのメトリックを導出することもできます。
- ^ データ内の実際の陽性症例数
- ^ 状態または特性の存在を正しく示す検査結果
- ^ タイプIIエラー: 特定の条件または属性が欠如していると誤って示すテスト結果
- ^ データ内の実際の陰性症例数
- ^ 症状や特徴が存在しないことを正しく示す検査結果
- ^ タイプIエラー: 特定の条件または属性が存在すると誤って示すテスト結果
- 実例
- 感度67%、特異度91%の診断テストを2030人に適用し、人口有病率1.48%の疾患を調べる。
関連する計算
- 偽陽性率(α)=第1種過誤=1−特異度=FP /(FP + TN)=180 /(180 + 1820)=9%
- 偽陰性率(β)=第2種過誤=1−感度=FN /(TP + FN)=10 /(20 + 10)≈33%
- パワー= 感度 = 1 − β
- 陽性尤度比= 感度 / (1 − 特異度) ≈ 0.67 / (1 − 0.91) ≈ 7.4
- 陰性尤度比 = (1 − 感度) / 特異度 ≈ (1 − 0.67) / 0.91 ≈ 0.37
- 有病率閾値= ≈ 0.2686 ≈ 26.9%
この仮想スクリーニング検査(便潜血検査)では、大腸がん患者の3分の2(66.7%)を正しく特定しました。[a]残念ながら、有病率を考慮すると、この仮想検査は偽陽性率が高く、無症状の人々全体の集団で大腸がんを確実に特定することはできないことがわかります(PPV = 10%)。
一方、この仮説的検査は、がんのない個人を非常に正確に検出する(NPV ≈ 99.5%)ことが実証されています。したがって、無症状の成人を対象とした定期的な大腸がんスクリーニングに使用する場合、陰性の結果は、胃腸症状の原因ががんではないことを示したり、大腸がんの発症を心配している患者を安心させたりなど、患者と医師にとって重要なデータとなります。
引用された感度または特異度における誤差の推定
感度と特異度の値だけでは、非常に誤解を招く可能性があります。結果の少ない実験に依存しないようにするには、「最悪の場合」の感度または特異度を計算する必要があります。たとえば、特定のテストでは、ゴールド スタンダードに対して4 回テストすると、簡単に 100% の感度を示すことができますが、ゴールド スタンダードに対して 1 回追加テストを行った結果が悪かった場合、感度は 80% にしかなりません。これを行う一般的な方法は、ウィルソン スコア間隔を使用して計算されることが多い二項比例信頼区間を示すことです。
感度と特異度の信頼区間を計算し、与えられた信頼水準(例えば95%)で正しい値が含まれる値の範囲を与えることができる。[26]
情報検索における用語
情報検索では、陽性予測値は精度と呼ばれ、感度は再現率と呼ばれます。特異度と感度のトレードオフとは異なり、これらの尺度は両方とも真陰性の数とは無関係です。真陰性は一般には未知であり、実際の関連文書や検索された文書の数よりもはるかに大きいです。真陰性の数と陽性の数が非常に多いというこの仮定は、他のアプリケーションではまれです。[13]
F スコアは、陽性クラスのテストのパフォーマンスを測る単一の指標として使用できます。F スコアは、精度と再現率の 調和平均です。
統計的仮説検定の従来の用語では、検定の感度は検定の統計的検出力と呼ばれますが、その文脈における検出力という言葉は、現在の文脈には当てはまらないより一般的な用法を持っています。感度の高い検定では、タイプ II エラーが少なくなります。
ゲノム解析の用語
情報検索の領域と同様に、遺伝子予測の研究分野では、ゲノム配列中の真陰性(非遺伝子)の数は一般に未知であり、実際の遺伝子数(真陽性)よりもはるかに多い。この研究分野では、便利で直感的に理解できる用語「特異度」は、生物統計学で定義されている精度と再現率の数式とともに頻繁に使用されている。このように定義された特異度(陽性予測値として)と感度(真陽性率)のペアは、遺伝子予測アルゴリズムの精度を特徴付ける主要なパラメータを表す。[27] [28] [29] [30] 逆に、真陰性率という意味での「特異度」という用語は、ゲノム解析の研究分野ではほとんど、あるいはまったく適用されないであろう。
参照
注記
- ^ すべての医療スクリーニング検査には利点と欠点がある。大腸がんスクリーニングなどの臨床診療ガイドラインでは、これらのリスクと利点について説明されている。[24] [25]
参考文献
- ^ Yerushalmy J (1947). 「X線技術に特に注目した医療診断方法の評価における統計的問題」.公衆衛生レポート. 62 (2): 1432–39. doi :10.2307/4586294. JSTOR 4586294. PMID 20340527. S2CID 19967899.
- ^ Saah AJ、Hoover DR (1998)。「感度と特異度の再考:分析および診断言語における用語の重要性」Ann Dermatol Venereol . 125 (4): 291–4. PMID 9747274。
- ^ Parikh R, Mathai A, Parikh S, Chandra Sekhar G, Thomas R (2008). 「感度、特異度、予測値の理解と使用」. Indian Journal of Ophthalmology . 56 (1): 45–50. doi : 10.4103 /0301-4738.37595 . PMC 2636062. PMID 18158403.
- ^ ab Altman DG、 Bland JM (1994年6 月)。「診断テスト 1: 感度と特異度」。BMJ。308 ( 6943 ) : 1552。doi :10.1136/bmj.308.6943.1552。PMC 2540489。PMID 8019315。
- ^ 「SpPinとSnNout」。Centre for Evidence Based Medicine (CEBM) 。 2023年1月18日閲覧。
- ^ Mangrulkar R.「診断推論IおよびII」。2011年8月1日時点のオリジナルよりアーカイブ。2012年1月24日閲覧。
- ^ 「エビデンスに基づく診断」ミシガン州立大学。2013年7月6日時点のオリジナルよりアーカイブ。2013年8月23日閲覧。
- ^ 「感度と特異度」。エモリー大学医学部エビデンスに基づく医療コース。
- ^ Baron JA (1994年4 月~6月)。 「残念ながら真実ではない」。医療意思決定。14 (2):107。doi : 10.1177 /0272989X9401400202。PMID 8028462。S2CID 44505648。
- ^ Boyko EJ (1994 年 4 月 ~ 6 月)。「最も感度が高く、最も特異的な診断検査で疾患を除外または確定する: 近道か、それとも誤った方向か?」。医療意思決定。14 (2 ) : 175~179。doi :10.1177/0272989X9401400210。PMID 8028470。S2CID 31400167 。
- ^ Pewsner D、Battaglia M、Minder C、Marx A、Bucher HC、Egger M (2004 年 7 月)。「「SpPIn」と「SnNOut」による診断の妥当性または不妥当性の判定: 注意事項」。BMJ。329 ( 7459 ) : 209–13。doi : 10.1136 /bmj.329.7459.209。PMC 487735。PMID 15271832。
- ^ Fawcett T (2006). 「ROC分析入門」.パターン認識レター. 27 (8): 861–874. Bibcode :2006PaReL..27..861F. CiteSeerX 10.1.1.646.2144 . doi :10.1016/j.patrec.2005.10.010. S2CID 2027090.
- ^ ab Powers DM (2011). 「評価: 精度、再現率、F 値から ROC、情報量、注目度、相関まで」。機械学習テクノロジージャーナル。2 (1): 37–63。
- ^ Gale SD、Perkel DJ (2010 年 1 月)。「基底核経路は、脱抑制を介して鳴鳥のドーパミン作動性ニューロンの選択的聴覚反応を駆動する」。The Journal of Neuroscience。30 ( 3 ): 1027–37。doi :10.1523/ JNEUROSCI.3585-09.2010。PMC 2824341。PMID 20089911。
- ^ Macmillan NA、Creelman CD(2004年9月15日)。検出理論:ユーザーガイド。Psychology Press。p. 7。ISBN 978-1-4106-1114-7。
- ^ Fawcett T (2006). 「ROC分析入門」(PDF) .パターン認識レター. 27 (8): 861–874. doi :10.1016/j.patrec.2005.10.010. S2CID 2027090.
- ^ Provost F、Tom Fawcett (2013-08-01)。「ビジネスのためのデータサイエンス:データマイニングとデータ分析的思考について知っておくべきこと」。O'Reilly Media, Inc.
- ^ Powers DM (2011). 「評価: 精度、再現率、F 値から ROC、情報量、注目度、相関まで」。機械学習テクノロジージャーナル。2 (1): 37–63。
- ^ Ting KM (2011). Sammut C, Webb GI (編).機械学習百科事典. Springer. doi :10.1007/978-0-387-30164-8. ISBN 978-0-387-30164-8。
- ^ Brooks H, Brown B, Ebert B, Ferro C, Jolliffe I, Koh TY, Roebber P, Stephenson D (2015-01-26). 「WWRP/WGNE 予報検証研究合同ワーキンググループ」。オーストラリア気象気候研究協力。世界気象機関。2019-07-17閲覧。
- ^ Chicco D、Jurman G (2020年1月)。「バイナリ分類評価におけるF1スコアと 精度に対するMatthews相関係数(MCC )の利点」。BMC Genomics。21 ( 1): 6-1–6-13。doi : 10.1186 / s12864-019-6413-7。PMC 6941312。PMID 31898477。
- ^ Chicco D、Toetsch N、Jurman G (2021年2月)。「マシューズ相関係数(MCC)は、2クラス混同行列評価において、バランスのとれた正確性、ブックメーカーの情報、マーク度よりも信頼性が高い」。BioData Mining。14 ( 13 ):13。doi :10.1186 /s13040-021-00244 - z。PMC 7863449。PMID 33541410。
- ^ Tharwat A. (2018年8月). 「分類評価方法」.応用コンピューティングと情報科学. 17 :168–192. doi : 10.1016/j.aci.2018.08.003 .
- ^ Lin JS、Piper MA、Perdue LA、Rutter CM、Webber EM、O'Connor E、Smith N、Whitlock EP (2016年6月21日)。「大腸がんのスクリーニング」。JAMA。315 ( 23 ) : 2576–2594。doi : 10.1001 /jama.2016.3332。ISSN 0098-7484。PMID 27305422 。
- ^ Bénard F, Barkun AN, Martel M, Renteln Dv (2018年1月7日). 「平均リスク成人に対する大腸がんスクリーニングガイドラインの系統的レビュー:現在の世界的推奨事項の要約」. World Journal of Gastroenterology . 24 (1): 124–138. doi : 10.3748/wjg.v24.i1.124 . PMC 5757117. PMID 29358889 .
- ^ 「診断テストオンライン計算機は、2x2 テーブルから感度、特異度、尤度比、予測値を計算します - 予測パラメータの信頼区間の計算機」。medcalc.org。
- ^ Burge C , Karlin S (1997). 「ヒトゲノムDNAの完全な遺伝子構造の予測」(PDF) . Journal of Molecular Biology . 268 (1): 78–94. CiteSeerX 10.1.1.115.3107 . doi :10.1006/jmbi.1997.0951. PMID 9149143. 2015-06-20にオリジナル(PDF)からアーカイブ。
- ^ 「GeneMark-ES」. Lomsadze A (2005). 「自己学習アルゴリズムによる新規ゲノムの遺伝子発見」。核酸 研究。33 ( 20 ): 6494–6906。doi :10.1093/nar/gki937。PMC 1298918。PMID 16314312。
- ^ Korf I (2004). 「新規ゲノムにおける遺伝子発見」BMC Bioinformatics . 5 : 59. doi : 10.1186/1471-2105-5-59 . PMC 421630 . PMID 15144565.
- ^ Yandell M、Ence D (2012 年 4 月)。「真核生物ゲノム注釈の初心者向けガイド」。Nature Reviews 。遺伝学。13 ( 5): 329–42。doi : 10.1038/nrg3174。PMID 22510764。S2CID 3352427。
さらに読む
- Altman DG、 Bland JM (1994 年 6 月) 。「診断テスト 1: 感度と特異度」。BMJ。308 ( 6943 ) : 1552。doi :10.1136/ bmj.308.6943.1552。PMC 2540489。PMID 8019315。
- Loong TW (2003 年 9 月)。「脳の右側における感度と特異度の理解」。BMJ . 327 ( 7417): 716–9. doi :10.1136/bmj.327.7417.716. PMC 200804. PMID 14512479 。
外部リンク
- UIC計算機
- ヴァッサー大学の感度/特異度計算機
- MedCalc 無料オンライン計算機
- ベイジアン臨床診断モデルアプレット
