第一種過誤、または偽陽性とは、統計的仮説検定において真の帰無仮説を誤って棄却することである。第二種過誤、または偽陰性とは、誤った帰無仮説を誤って受け入れることである。[ 1 ]
分析において、新たな誤解を招く情報によって、何らかの基本前提が誤って棄却された場合、第一種過誤が発生します。一方、より適切な測定を行えばその前提が誤りであることが判明するにもかかわらず、不完全または不十分なデータのためにそのような前提が維持された場合、第二種過誤が発生します。例えば、医療検査の文脈において、帰無仮説を「この患者は当該疾患に罹患していない」とした場合、疾患がないにもかかわらず罹患していると診断することは第一種過誤であり、疾患があるにもかかわらず罹患していないと診断することは第二種過誤となります。帰無仮説が文脈上のデフォルト期待をどのように規定するかによって、第一種過誤と第二種過誤の具体的な現れ方が左右され、これは文脈や応用によって異なります。一般的に、このような過誤のリスクを完全に排除することはできず、例えば有意水準を変更することによって、両タイプの過誤をトレードオフすることしかできません。
第一種過誤と第二種過誤に関する知識は、医学、生体認証、コンピュータ科学などの分野で広く応用されている。これらの過誤を最小限に抑えることは統計理論における研究対象であるが、関連する結果が既知の観察可能な因果過程によって決定されない限り、いずれの過誤も完全に排除することは不可能である。
統計的検定理論において、統計的誤差の概念は仮説検定の不可欠な部分である。検定は、帰無仮説と呼ばれる2つの競合する命題を選択することであり、これは次のように表される。対立仮説は、これは、裁判における判決と概念的に類似しています。帰無仮説は被告の立場に対応します。被告が有罪が証明されるまでは無罪と推定されるのと同様に、帰無仮説も、データがそれに反する説得力のある証拠を提供するまでは真であると推定されます。対立仮説は、被告に不利な立場に対応します。具体的には、帰無仮説には差異の不在、または関連性の不在も含まれます。したがって、帰無仮説は差異または関連性があるというものにはなり得ません。
テスト結果が現実と一致していれば、正しい判断が下されたことになる。しかし、テスト結果が現実と一致しなければ、誤りが生じたことになる。判断が間違っている状況は2つある。帰無仮説が真であるにもかかわらず、帰無仮説を棄却する場合である。一方、対立仮説は真実かもしれないが、我々は否定しない2種類のエラーが区別される。タイプIエラーとタイプIIエラーである。[ 2 ]
第一の種類の誤りは、検定手順の結果として帰無仮説を誤って棄却してしまうことです。この種の誤りは第一種過誤(偽陽性)と呼ばれ、時には第一種の誤りとも呼ばれます。法廷の例で言えば、第一種過誤は無実の被告人を有罪にしてしまうことに相当します。
2つ目の種類の誤りは、検定手続きの結果として帰無仮説を棄却できないことです。この種の誤りは、第2種過誤(偽陰性)と呼ばれ、2種目の誤りとも呼ばれます。法廷の例で言えば、第2種過誤は犯罪者を無罪にすることに相当します。
クロスオーバーエラー率(CER)とは、第一種過誤と第二種過誤が等しくなる点のことです。CER値が低いシステムほど、CER値が高いシステムよりも精度が高くなります。他の条件がすべて同じであれば、第一種過誤と第二種過誤の発生率が等しくなる(つまりCERが等しくなる)ことで、全体のエラー率が最も低くなります。[ 3 ]
偽陽性と偽陰性に関して言えば、陽性結果は帰無仮説を棄却することに対応し、陰性結果は帰無仮説を棄却できないことに対応します。「偽」とは、導き出された結論が間違っていることを意味します。したがって、第一種過誤は偽陽性に相当し、第二種過誤は偽陰性に相当します。
帰無仮説の真偽と検定結果の関係を表にまとめたもの:[ 4 ]

完璧なテストでは、偽陽性も偽陰性もゼロになります。しかし、統計的手法は確率的であり、統計的結論が正しいかどうかを確実に知ることはできません。不確実性がある限り、誤りを犯す可能性があります。これを考慮すると、すべての統計的仮説検定には、第一種過誤と第二種過誤を犯す確率があります。[ 5 ]
これら2種類の誤差率は互いにトレードオフの関係にある。つまり、特定のサンプルセットにおいては、一方の種類の誤差を減らそうとすると、一般的に他方の種類の誤差が増加することになる。
同じ考え方は、正解率という観点からも表現でき、誤り率を最小限に抑え、仮説検定の質を向上させるために利用できます。第一種過誤を犯す確率を減らすには、α値をより厳しくすることが簡単かつ効果的です。例えば、α値を0.05ではなく0.01に設定します。分析の検出力と密接に関連する第二種過誤を犯す確率を減らすには、検定のサンプルサイズを増やすか、αレベルを緩める(例えば、αレベルを0.05ではなく0.1に設定する)ことで、分析の検出力を高めることができます。第一種過誤率が制御されている場合、検定統計量はロバストです。
閾値(カットオフ値)を変化させることで、検査の特異度や感度を高め、検査の質を向上させることもできます。例えば、血液サンプル中の特定のタンパク質の濃度を測定する医療検査を考えてみましょう。検査者は閾値(図中の黒い垂直線)を調整することができ、この閾値を超える数値が検出された場合、人々は病気であると診断されます。図によれば、閾値を変更すると、曲線上の動きに対応して、偽陽性と偽陰性が変化します。
実際の実験では、第一種過誤と第二種過誤を完全に回避することは不可能であるため、帰無仮説 H₀ を誤って棄却したり、H₀ を受容したりするリスクをどの程度許容できるかを検討することが重要です。この問題の解決策は、統計量のp 値または有意水準α を報告することです。たとえば、検定統計量の p 値が 0.0596 の場合、H₀ が真である場合に誤って棄却する確率は 5.96% です。または、統計量が α レベル 0.05 で実施される場合、 H₀ を誤って棄却する確率は5% です。有意水準 α が 0.05 は比較的よく用いられますが、すべてのシナリオに当てはまる一般的なルールはありません。
アメリカの高速道路の制限速度は時速120キロメートル(75 マイル)です。通過する車両の速度を測定する装置が設置されています。この装置は通過する車両の速度を3回測定し、ランダムサンプルとしてX1、X2、X3を記録するとします。交通警察は平均速度に応じて運転手に罰金を科すか科さないかを決定します。つまり、検定統計量
さらに、測定値 X 1、 X 2、 X 3は正規分布 N(μ,2) としてモデル化されると仮定します。すると、T は N(μ,2/)であり、パラメータμは通過車両の真の速度を表します。この実験では、帰無仮説H₀と対立仮説H₁は
H₀ : μ=120 対 H₁ : μ>120。
統計レベルをα=0.05で実施する場合、臨界値cを計算して解決する必要があります。
正規分布の単位変換ルールによれば、Z表を参照すると、
ここで、重要な領域について説明します。つまり、車両の記録された速度が臨界値121.9を超えると、運転手は罰金を科せられます。しかし、記録された平均速度が121.9を超えているにもかかわらず、実際の速度が120を超えていないため、5%の運転手が誤って罰金を科せられることになります。これは、第一種過誤と呼ばれます。
タイプIIエラーは、車両の実際の速度が時速120キロメートルを超えているにもかかわらず、運転手が罰金を科されないケースに対応します。たとえば、車両の実際の速度μ=125の場合、運転手が罰金を科されない確率は次のように計算できます。
つまり、車両の実際の速度が125の場合、統計的に有意水準α=0.05で分析を行った場合、記録された平均速度が121.9より低いため、運転手が罰金を免れる確率は0.36%となります。実際の速度が125よりも121.9に近いほど、罰金を免れる確率は高くなります。
第一種過誤と第二種過誤のトレードオフも考慮する必要があります。つまり、この場合、交通警察が無実の運転手に誤って罰金を科したくないのであれば、有意水準αを0.01のようなより小さな値に設定することができます。しかし、その場合、実際の速度が時速120キロメートルを超えている運転手(例えば時速125キロメートル)が罰金を免れる可能性が高くなります。
統計学者が、世界(あるいはそこに住む人々)の観察された現象に関する「推測的な仮説」が支持できるかどうかを判断するために検定を行うことは、標準的な手法である。このような検定の結果は、特定の結果の集合が推測された仮説と合理的に一致するか(あるいは一致しないか)を判断する。
統計的慣例として、推測された仮説は常に誤りであると仮定され、いわゆる「帰無仮説」は、観察された現象が単に偶然に発生した(したがって、推測された要因は効果がない)という前提に 基づいています。このテストでは、この仮説が正しいか間違っているかを判断します。これが、テスト対象の仮説が帰無仮説と呼ばれることが多い理由です(おそらくフィッシャー(1935年、19ページ)によって造語された)。なぜなら、この 仮説がテストによって無効化されるか無効化されないかのどちらかになるからです。帰無仮説が無効化された場合、データは「対立仮説」(元の推測された仮説)を支持していると結論付けることができます。
統計学者がネイマンとピアソンの慣例に従って「検証される仮説」(または「無効化される仮説」)をH 0という表現で表すという慣例を一貫して適用してきた結果、「帰無仮説」という用語が「無仮説」、 つまり問題の結果が偶然によって生じたという記述を意味すると多くの人が理解する状況が生じています。これは必ずしも正しいとは限りません。 フィッシャー(1966)によれば、重要な制約は「帰無仮説は正確でなければならない、つまり曖昧さや不明瞭さがあってはならない。なぜなら、帰無仮説は『分布の問題』の基礎を提供しなければならず、その問題に対する有意性検定はそれを解決するからである」ということです。[ 9 ]この結果、実験科学では、帰無仮説は一般的に特定の処置が効果がないという記述であり、観察科学では、特定の測定変数の値と実験予測値との間に差がないという記述です。
帰無仮説が真であると仮定した場合に、得られた結果と同程度の極端な結果が得られる確率が、事前に設定された閾値確率(例えば5%)よりも低い場合、その結果は統計的に有意であるとされ、帰無仮説は棄却される。
イギリスの統計学者サー・ロナルド・アイマー・フィッシャー(1890年~1962年)は、帰無仮説を強調した。
帰無仮説は決して証明または確立されることはなく、実験の過程で反証される可能性がある。すべての実験は、事実が帰無仮説を反証する機会を与えるためだけに存在すると言えるだろう。
—フィッシャー、1935年、19ページ
帰無仮説検定の問題に対処するため、アンドリュー・ゲルマン、ジョン・カーリンらは、有意な結果の検討に加え、タイプSエラーとタイプMエラーを提案している。[ 10 ]
S型エラーとは、符号の誤りのことです。S型エラー率は、有意な結果が得られた場合に、その効果が真の効果とは逆の方向に推定される確率を表します。これは、検出力の低い検定設定で頻繁に発生する可能性があります。
M型誤差は、大きさに関する誤差です。これは、「誇張係数」と呼ばれる、有意な結果が得られた場合の推定値の絶対値と真の値の比率を評価することによって対処されます。有意性検定を用いてスクリーニングを行うと選択バイアスが生じ、効果量を大幅に過大評価してしまう可能性があるため、この係数は重要です。
医療現場において、スクリーニングと検査の適用範囲には大きな違いがある。
スクリーニングとは、比較的安価な検査を、疾患の臨床的兆候を全く示さない大勢の人々に実施することである(例:パップテスト)。
検査には、はるかに高額で、しばしば侵襲的な処置が伴い、何らかの臨床的疾患の兆候を示す人にのみ実施され、疑われる診断を確定するために用いられることがほとんどである。
例えば、米国のほとんどの州では、新生児に対してフェニルケトン尿症や甲状腺機能低下症などの先天性疾患のスクリーニング検査を義務付けている。
スクリーニング検査は偽陽性率が高いものの、これらの疾患をはるかに早期の段階で発見できる可能性を大幅に高めるため、価値があるとみなされている。
献血希望者を対象にHIVや肝炎のスクリーニングを行うために用いられる簡単な血液検査は、偽陽性率がかなり高い。しかし、医師は、実際にこれらのウイルスに感染しているかどうかを判断するために、はるかに高価で精度の高い検査を用いる。
医療スクリーニングで最も広く議論されている偽陽性は、乳がん検診の手順であるマンモグラフィーによるものかもしれません。米国のマンモグラフィーの偽陽性率は最大15%で、世界で最も高いです。米国における偽陽性率の高さの1つは、10年間で、スクリーニングを受けたアメリカ人女性の半数がマンモグラフィーで偽陽性となることです。偽陽性のマンモグラフィーは費用がかさみ、米国では追跡検査と治療に年間1億ドル以上が費やされています。また、女性に不必要な不安を与えます。米国における偽陽性率の高さの結果、マンモグラフィーで陽性となった女性の90~95%は実際には乳がんではないのです。世界で最も低い偽陽性率はオランダの1%です。最も低い偽陽性率は一般的に北欧諸国で、マンモグラフィーフィルムは2回読影され、追加検査の閾値が高く設定されています(閾値が高いほど検査の検出力は低下します)。
理想的な集団検診は、安価で実施が容易であり、可能であれば偽陰性ゼロであるべきだ。こうした検査は通常、偽陽性が多く発生するが、それらはより高度な(そして高価な)検査によって後から選別することができる。
偽陰性および偽陽性は、医療検査において重大な問題である。
スクリーニング検査のように、検査対象の疾患が稀な場合、偽陽性は深刻かつ直感に反する問題を引き起こす可能性があります。検査の偽陽性率が1万分の1であるにもかかわらず、100万のサンプル(または人)のうち真陽性が1人しかいない場合、その検査で検出された陽性のほとんどは偽陽性となります。観察された陽性結果が偽陽性である確率は、ベイズの定理を用いて計算できます。
偽陰性は、特に検査対象の疾患が一般的な場合、深刻かつ直感に反する問題を引き起こします。例えば、偽陰性率がわずか10%の検査を、実際の罹患率が70%の集団に対して行った場合、検査で検出される陰性の多くは偽陰性となります。
これは時として、患者とその疾患の両方に対する不適切または不十分な治療につながる。よくある例としては、心臓負荷試験が進行した狭窄による冠動脈血流の制限しか検出しないことが知られているにもかかわらず、冠動脈アテローム性動脈硬化症を検出するために心臓負荷試験に頼ることが挙げられる。
指紋認証、顔認証、虹彩認証などの生体認証照合は、第一種過誤と第二種過誤の影響を受けやすい。
第一種過誤の発生確率は「偽拒否率」(FRR)または偽非一致率(FNMR)と呼ばれ、第二種過誤の発生確率は「偽受入率」(FAR)または偽一致率(FMR)と呼ばれます。
システムが容疑者との一致を極めて稀にしか起こさないように設計されている場合、第II種過誤の発生確率は「誤報率」と呼ばれます。一方、システムが検証目的で使用される場合(そして、受け入れられることが標準である場合)、FARはシステムセキュリティの指標となり、FRRはユーザーの不便さのレベルを測る指標となります。
刑事訴訟においては、万が一誤りがあったとしても、それが第一種過誤(無実の人を罪に問うこと)ではなく第二種過誤(本来有罪であるはずの被告人を無罪放免にすること)となるよう、極めて重視される。この重視こそが、高い立証責任(合理的な疑いを超えて有罪であること)や、検察側による有罪証拠や証言の解釈に対する綿密な精査、そして証拠価値よりも偏見を招く可能性のある証拠に対する懐疑的な姿勢や排除(規則403のバランステスト)の理由なのである。

何世紀にもわたる膨大な研究は、刑事訴訟における司法の誤りが、被告人だけでなく、司法制度全体の公正さに対する認識や、犯罪行為の申し立てが真剣かつ公正に審理されるという地域社会の関係者の信頼にも深刻な影響を与えることを論じてきた。イギリスの法学者ウィリアム・ブラックストーンは、公正な制度であれば、10人の有罪被告人を釈放するよりも、1人以上の無実の人を投獄する方がましだという概念を説明するために、ブラックストーンの10対1の比率を考案した。
近年、法学研究や主流の法理学では、司法の誤りや冤罪について議論するためのより厳密な用語を得るために、第一種過誤と第二種過誤の分類法が採用されている。米国最高裁判所は、Ballew v. Georgia [ 12 ]における誤りの議論において第一種過誤と第二種過誤の分類法を使用しており、裁判官や法学教授は、以前の研究でよく使われていた「誤って有罪判決を受けた」や「誤って無罪判決を受けた」といったよりくだけた表現ではなく、この二分法的な分類法をますます使用するようになっている。
近年の学術研究や司法上の関心は、第一種過誤(無実の被告人を誤って有罪とすること)を防ぐための安全策として、陪審員の規模と全員一致に焦点を当てることが多い。
米国最高裁判所は、12人未満の小規模な陪審員は第一種過誤を起こしやすいとして批判している[ 13 ]。一方、一部の裁判官は、通常の12人を超える陪審員を選任することに問題があると批判している(ウィスコンシン州控訴裁判所のアンダーソン判事は、1993年にこの問題に関して注目すべき反対意見を書いている。「被告が12人を超える陪審員による裁判に同意することを認める立法上の公共政策の宣言がない限り、12人を超える陪審員による審議を認めるのは明らかな誤りである」[ 14 ])。全員一致の評決に関して、2020年4月20日、米国最高裁判所は、重大な犯罪で被告人を有罪とするには陪審員の全員一致の評決が必要であると憲法修正第6条で判決を下し、重大な刑事事件で全員一致の評決を必要とする主な理由の1つとして、第一種過誤に関する懸念を挙げた。[ 15 ]
空港の保安検査は、基本的には目視検査システムであるため、誤検知が日常的に発生している。設置されている保安警報装置は、武器の機内持ち込みを防止することを目的としているが、感度が高すぎるため、鍵、ベルトのバックル、小銭、携帯電話、靴の中の画鋲といった小さな物でも、1日に何度も警報が鳴ってしまうことが多い。
したがって、偽陽性(無実の旅行者をテロリストと誤認すること)と真陽性(テロリスト予備軍を検出すること)の比率は非常に高く、ほとんどすべての警報が偽陽性であるため、これらのスクリーニング検査の陽性予測値は非常に低い。
誤った結果が生じる相対的なコストによって、検査作成者がこうした事態を許容する可能性が決まります。このシナリオでは、偽陰性のコストは非常に高く(飛行機に爆弾が持ち込まれるのを検知できないと数百人の死者が出る可能性がある)、一方、偽陽性のコストは比較的低い(比較的簡単な追加検査で済む)ため、最も適切な検査は、統計的特異度は低いが統計的感度が高い検査(偽陰性を最小限に抑える代わりに、偽陽性率が高くなる検査)です。
偽陽性と偽陰性の概念は、コンピュータセキュリティ、スパムフィルタリング、マルウェア、光学文字認識など、コンピュータおよびコンピュータアプリケーションの分野で広く用いられています。
例えば、スパムフィルタリングの場合:
ほとんどのスパム対策は、不要なメールの大部分をブロックまたはフィルタリングできますが、誤検出を大幅に減らすことははるかに困難な作業です。誤検出が少ないことは、スパムフィルタリングの効率性を示す指標となります。
{{cite book}}: CS1 メンテナンス: その他 (リンク)これらのパラメータは次の式で関連付けられます:…ここで、Eは
効果
量、
n
はサンプルサイズ、αは第一種過誤率、σはデータの変動の標準偏差です。
慣例として、第一種過誤率は0.05に設定されている。