
ベースレートの誤謬(ベースレート無視[ 2 ]またはベースレートバイアスとも呼ばれる)は、人々が特定のケースのみに関連する情報を優先してベースレート(一般的な有病率など)を無視する傾向がある誤謬の一種である[ 3 ] 。ベースレート無視は、より一般的な拡張無視の特定の形態である。
法廷手続きの文脈で統計的検査(DNA検査など)の結果に適用される場合、これは検察官の誤謬または弁護人の誤謬とも呼ばれます。これらの用語は、1987年にウィリアム・C・トンプソンとエドワード・シューマンによって導入されましたが、 [ 4 ] [ 5 ]検察官の誤謬の定義は、ベースレートのエラーやベイズの定理として分析できない、有罪または責任に関する多くの追加の誤った推論にも及ぶと主張されています。[ 6 ]
ベースレートの誤謬の一例として、偽陽性パラドックス(精度パラドックスとも呼ばれる)があります。このパラドックスは、真陽性よりも偽陽性のテスト結果が多い状況(つまり、分類器の精度が低い状況)を指します。例えば、顔認識カメラが指名手配犯を99%の精度で識別できるとしても、1日に1万人を分析する場合、高い精度はテスト回数によって相殺されてしまいます。そのため、プログラムが作成する犯罪者リストには、犯罪者(真陽性)よりも無実の人(偽陽性)がはるかに多く含まれる可能性が高くなります。これは、犯罪者全体よりも無実の人のほうがはるかに多いからです。陽性テスト結果の確率は、テストの精度だけでなく、サンプリングされた集団の特性によっても決まります。[ 7 ]根本的な問題は、真の陰性の割合がはるかに高いため、陽性反応を示す人の集団は偽陽性が大部分を占めることになるということです。なぜなら、はるかに大きい[陰性]グループのごく一部でも、はるかに小さい[陽性]グループのより大きな割合よりも多くの陽性反応を示すからです。
有病率(特定の疾患を持つ人の割合)が検査の偽陽性率よりも低い場合、個々の症例で偽陽性となるリスクが非常に低い検査であっても、全体としては真陽性よりも偽陽性が多くなります。[ 8 ]
有病率の高い集団から得られた陽性結果を扱った後に、有病率の低い集団での検査で陽性結果を解釈する場合、特に直感に反する。 [ 8 ]検査の偽陽性率が、その疾患を持つ新しい集団の割合よりも高い場合、有病率の高い集団での検査から経験を積んだ検査管理者は、経験から、陽性検査結果は通常、陽性の被験者を示していると結論付けるかもしれないが、実際には偽陽性がはるかに発生している可能性が高い。
1,000人の集団Aを対象に感染症検査を実施するとします。この集団Aのうち40%が感染しています。検査の偽陽性率は5%(0.05)、偽陰性率は0です。集団Aに対して1,000回の検査を実施した場合、予想される結果は次のようになります。
したがって、集団Aでは、陽性検査を受けた人は、それが感染を正しく示していると93%以上の確信(400 / 30 + 400)を持つことができます。
次に、感染率がわずか2%の集団Bに対して同じ検査を実施することを考えてみましょう。集団Bに対して1000回の検査を実施した場合の期待される結果は次のようになります。
集団Bでは、検査で陽性反応が出た69人のうち、実際に感染しているのはわずか20人です。したがって、一見「95%の精度」に見える検査であっても、感染していると告げられた後に実際に感染している確率はわずか29%(20 / 20 + 49)です。
A群の検査経験を持つ検査員は、 B群では通常感染を正しく示していた結果が、今では偽陽性となることが多いという事実に、矛盾を感じるかもしれない。感染の事後確率と偽陽性となる事前確率を混同してしまうのは、健康を脅かす検査結果を受け取った後に起こりうる自然な誤りである。
警察官の一団が、運転手が酔っていない場合でも、5%の確率で飲酒運転と誤検出する呼気検査器を持っていると想像してください。しかし、呼気検査器は、本当に酔っている人を必ず検出します。1000人に1人の運転手が飲酒運転をしています。警察官が無作為に運転手を停車させて呼気検査を行ったとします。検査の結果、運転手は酔っていると示されました。運転手に関するその他の情報は何もわかっていません。
運転手が飲酒運転をしている確率は95%にも達すると推測する人も多いが、実際の確率は約2%である。
これについては次のように説明できます。平均して、テストされたドライバー1,000人につき、
したがって、1 + 49.95 = 50.95 の陽性検査結果のうち、特定のドライバーが本当に飲酒運転をしている確率は。
しかしながら、この結果の妥当性は、警察官が運転手を本当に無作為に、つまり運転技術の未熟さではなく、無作為に停車させたという当初の仮定の妥当性にかかっている。もし、運転手を停車させた理由が無作為であったり、あるいは他の無作為ではない理由があったりした場合、計算には、飲酒運転者が適切に運転する確率と、飲酒していない運転者が(不)適切に運転する確率も含まれることになる。
より厳密には、ベイズの定理を用いて約0.02という同じ確率を確立することができる。目標は、呼気検査器が飲酒運転を示した場合に、運転手が飲酒運転をしている確率を求めることであり、これは次のように表すことができる。
ここで、Dは呼気検査器が運転手が飲酒運転をしていると示していることを意味する。ベイズの定理を用いると、
このシナリオでは、以下の情報が判明しています。
式からわかるように、ベイズの定理にはp ( D ) が必要であり、これは全確率の法則を用いて前述の値から計算できます。
これにより
これらの数値をベイズの定理に代入すると、次のようになる。
これは、検査の精度を意味します。
人口100万人の都市に、テロリストが100人、非テロリストが999,900人いるとします。例を単純化するために、都市にいるすべての人を住民と仮定します。したがって、無作為に選ばれた住民がテロリストである基本確率は0.0001であり、同じ住民が非テロリストである基本確率は0.9999です。テロリストを捕まえるために、都市は監視カメラと自動顔認識ソフトウェアを備えた警報システムを設置します。
このソフトウェアには、1%の故障率が2つあります。
仮に住人が警報を作動させたとしましょう。基本率の誤謬に陥った人は、検知された人物がテロリストである確率は99%だと推論するでしょう。この推論は一見もっともらしく思えますが、実際には誤った推論であり、以下の計算で、テロリストである確率は実際には99%ではなく1%程度であることが分かります。
この誤謬は、2つの異なる失敗率の性質を混同することから生じます。「テロリスト100人あたりのベルが鳴らない回数」(P(¬B | T)、つまり住民がテロリストである場合にベルが鳴らない確率)と「ベルが鳴る回数あたりの非テロリストの数」(P(¬T | B)、つまりベルが鳴る場合に住民が非テロリストである確率)は無関係な量であり、一方が他方と必ずしも等しいとは限らず、近いとも限りません。これを示すために、テロリストが全くいない別の都市に同じ警報システムを設置した場合を考えてみましょう。最初の都市と同様に、検出された非テロリスト住民100人につき1人に対して警報が鳴りますが、最初の都市とは異なり、テロリストに対しては警報が鳴りません。したがって、警報が鳴るすべてのケースは非テロリストによるものですが、偽陰性率を計算することさえできません。その都市における「100回の鐘鳴らしあたり非テロリストの数」は100であるが、P(T | B) = 0%である。鐘が鳴ったからといってテロリストが発見される可能性はゼロである。
最初の都市の全人口100万人がカメラの前を通過すると想像してみてください。100人のテロリストのうち約99人が警報を鳴らし、999,900人の非テロリストのうち約9,999人が警報を鳴らします。したがって、警報を鳴らす人は約10,098人となり、そのうち約99人がテロリストです。警報を鳴らす人が実際にテロリストである確率は10,098分の99に過ぎず、これは1%未満であり、当初の予想である99%をはるかに下回ります。
この例では、ベースレートの誤謬が非常に誤解を招くのは、テロリストよりも非テロリストの方がはるかに多く、偽陽性(非テロリストがテロリストとしてスキャンされる)の数が真陽性(テロリストがテロリストとしてスキャンされる)の数よりもはるかに多いからです。
複数の実務家は、テロの基本発生率が極めて低いため、偽陽性のパラドックスにより、データマイニングや予測アルゴリズムを使用してテロリストを特定することは現実的に不可能であると主張している。 [ 9 ] [ 10 ] [ 11 ] [ 12 ]正確な結果1件あたりの偽陽性の推定値は、1万件以上[ 12 ]から10億件まで幅がある。[ 10 ]その結果、各手がかりを調査することはコストと時間の面で非現実的である。[ 9 ] [ 11 ]これらのモデルを実用化するために必要な精度レベルは、おそらく達成不可能である。まず第一に、テロの基本発生率が低いということは、正確なアルゴリズムを作成するためのデータが不足していることも意味する。[ 11 ]さらに、テロを検出する文脈では、偽陰性は非常に望ましくないため、可能な限り最小限に抑える必要がある。しかし、そのためには特異度を犠牲にして感度を上げる必要があり、偽陽性が増加する。[ 12 ]また、結果の 99% 以上が偽陽性であることを考えると、法執行機関によるそのようなモデルの使用が、必要な立証責任を満たすかどうかは疑問である。 [ 12 ]
多属性スクリーニングでは、この効果を増幅させる明確なメカニズムが存在する。15個の特定の事前決定属性に一致する確率は10⁻³⁵ ( 30デシリオン分の1)であるのに対し、1,000個の属性のうち任意の15個に一致する個人をフラグ付けするシステムでは、1人あたりの誤報確率は約10⁻⁴となる。これは、低い基本率だけではなく、閾値ルールの組み合わせによって生じる31桁の差である。人口100万人の都市では、これにより約226件の誤報が発生する。誤報がゼロとなる確率は約10⁻⁹⁹である。このようなシステムは、臨界人口規模で急激な相転移を示し、それを超えると失敗が確実になり、閾値調整によって防止することはできない。[ 13 ]
犯罪が発生した。法医学的分析の結果、犯人の血液型は人口の10%に共通する特定の血液型であることが判明した。容疑者が逮捕され、その容疑者も同じ血液型であることが判明した。
検察官は、その根拠のみに基づいて容疑者を起訴し、裁判で被告が有罪である確率は90%であると主張する可能性がある。
しかし、この結論は、被告人が血液検査以前に発見された、血液検査とは無関係の確固たる証拠に基づいて主要な容疑者として選ばれた場合にのみ、ほぼ正しいと言える。そうでなければ、提示された推論は欠陥があり、被告人が無実の人物であるという高い事前確率(つまり、血液検査以前)を見落としている。例えば、犯罪が発生した町に1000人が住んでいると仮定しよう。これは、犯人の血液型を持つ人が100人住んでいることを意味し、そのうち真犯人は1人だけである。したがって、被告人の血液型が殺人犯の血液型と一致するという事実のみに基づくと、被告人が有罪である真の確率はわずか1%であり、検察官が主張する90%よりもはるかに低い。
検察官の誤謬とは、ランダムに一致する事前確率が被告人が無罪である確率と等しいと仮定することである。検察官が専門家証人に質問する際に、この誤謬を用いる場合、「無罪の人からこの証拠が見つかる確率は非常に小さいので、陪審員はこの被告人が無罪である可能性を安全に無視できる、ということでよろしいですか?」と尋ねることがある。 [ 14 ]この主張は、無罪の人から証拠が見つかる確率が、証拠が見つかった場合にその人が無罪である確率と同じであると仮定しているが、これは正しくない。前者は通常、優れた法医学的証拠手続きにより小さい(前の例では10%)が、後者(その例では99%)はそれと直接関係がなく、実際には被告人がランダムに無罪の人である可能性が高い事前確率に依存しているため、多くの場合はるかに高くなる。
O・J・シンプソンは1995年、元妻のニコール・ブラウン・シンプソンと彼女の友人ロナルド・ゴールドマンの殺害容疑で裁判にかけられたが、無罪となった。
犯行現場の血液は、400人に1人の割合で共通する特徴を持つシンプソンの血液と一致した。しかし、弁護側は、ロサンゼルスでサンプルに一致する人の数はフットボールスタジアムを満員にするほどであり、400人に1人という数字は役に立たないと主張した。[ 15 ] [ 16 ]サンプルに一致する特定の人物が犯人である可能性が高いと推論するために、「400人に1人」という数字だけに頼るのは誤りであり、検察側の誤謬の一例であっただろう。

同じ裁判で、検察側はシンプソンが妻に暴力を振るっていたという証拠を提示した。弁護側は、配偶者虐待を受けた女性2500人につき殺害された女性は1人だけであり、シンプソンが妻に暴力を振るった経歴は裁判とは無関係だと主張した。しかし、弁護側の計算の根拠は誤っていた。著者ゲルト・ギゲレンツァーによれば、正しい確率には追加の文脈が必要である。シンプソンの妻は家庭内暴力を受けただけでなく、家庭内暴力(シンプソンによる)を受け、(誰かによって)殺害されたのだ。ギゲレンツァーは、「殺害されたパートナーがいる場合、加害者が実際にパートナーを殺害した確率は約8/9、つまり約90%である」と書いている。[ 17 ]配偶者虐待のほとんどのケースは殺人には至らないが、配偶者虐待の経歴がある殺人事件のほとんどは配偶者によって行われている。
イギリス人女性のサリー・クラークは、1998年に生後11週の第一子と生後8週の第二子を殺害したとして告発された。検察側は、専門家証人であるロイ・メドウ教授兼小児科コンサルタント[ 18 ]に、同じ家族で2人の子供が乳幼児突然死症候群(SIDS)で死亡する確率は約7300万分の1であると証言させた。これは、過去のデータで測定された実際の発生率よりもはるかに低い頻度であった。メドウは、SIDSによる単独死亡データと、乳児間でそのような死亡の確率は相関しないという仮定からこれを推定した[ 19 ] 。
メドウは、7300万人に1人という 確率はあり得ないことではないと認めつつも、そのような事故は「100年に1回」しか起こらないと主張し、1500万世帯の2児家族がいる国では、2人の死亡がそのような稀な事故によるものではなく、代理ミュンヒハウゼン症候群によるものである可能性の方がはるかに高いと述べた。しかし、家族内でSIDSによる死亡の可能性は、すでにこのような状況で子供が亡くなっている場合、著しく高くなると考える十分な理由がある(SIDSに対する遺伝的素因は、想定される統計的独立性を無効にする可能性が高い[ 20 ] )。そのため、一部の家族はSIDSにかかりやすくなり、この誤りは生態学的誤謬の結果である[ 21 ]。同じ家族内で2人のSIDS死亡が発生する可能性は、それ以外はすべて同じ家族で1人の死亡が発生する可能性を2乗することによって適切に推定することはできない[ 22 ] 。
7300万分の1という 数字は、2件の連続事故の確率を大幅に過小評価していたが、仮にその評価が正確だったとしても、裁判所は7300 万分の1という数字自体には何の意味もないという事実を見落としていたようだ。事前確率として、それは他の可能性の事前確率と比較検討されるべきだった。2人の死亡者が出た以上、以下の説明のうちいずれかが真実であるはずであり、いずれも事前確率としては極めて起こりそうもない。
裁判中に2番目の可能性の確率の推定値が提案されたかどうか、あるいは最初の2つの確率の比較が、検察側の主張と無罪の主張を評価する統計分析において行うべき重要な推定値であると理解されていたかどうかは不明である。
クラークは1999年に有罪判決を受け、その結果、王立統計学会から誤りを指摘するプレスリリースが出された。 [ 23 ]
2002年、レイ・ヒル(サルフォード大学の数学教授)は、これら2つの可能性のある説明の確率を正確に比較しようと試みました。彼は、連続する事故は連続する殺人よりも4.5倍から9倍起こりやすいと結論付け、クラークの有罪の事前確率は4.5対1から9対1の間であるとしました。[ 24 ]
裁判所が、両方の赤ちゃんを検査した法医学病理医が無罪を証明する証拠を隠蔽していたことを発見した後、上級裁判所は2003年1月29日にクラークの有罪判決を破棄した。[ 25 ]
実験では、個人を特定できる情報がある場合、人々は一般的な情報よりも個人を特定できる情報を好むことがわかっています。[ 26 ] [ 27 ] [ 28 ]
いくつかの実験では、学生に架空の学生の成績平均点(GPA)を推定するように求めました。GPA分布に関する関連統計が与えられた場合、学生は、新しい記述情報が明らかに学校の成績とはほとんどまたは全く関係がない場合でも、特定の学生に関する記述情報が与えられると、それらの統計を無視する傾向がありました。 [ 27 ]この発見は、面接官は基本的な統計よりも優れた合格候補者を選ぶことができないため、面接は大学入学選考プロセスにおいて不要な部分であると主張するために使用されてきました。
心理学者のダニエル・カーネマンとエイモス・トベルスキーは、代表性と呼ばれる単純なルールまたは「ヒューリスティック」の観点からこの発見を説明しようと試みた。彼らは、可能性や因果関係に関する多くの判断は、あるものが別のものやカテゴリーをどれだけ代表しているかに基づいていると主張した。[ 27 ]カーネマンは、ベースレート無視を拡張無視の特定の形態とみなしている。[ 29 ]リチャード・ニスベットは、基本的帰属エラーのような帰属バイアスのいくつかはベースレート誤謬の例であると主張している。人々は、類似の状況で他人がどのように行動したかについての「合意情報」(「ベースレート」)を使用せず、代わりに単純な性格帰属を好む。[ 30 ]
心理学では、人々が基本率情報を評価する条件と評価しない条件についてかなりの議論がある。[ 31 ] [ 32 ]ヒューリスティクスとバイアスプログラムの研究者たちは、人々が基本率を無視し、ベイズの定理などの確率的推論の特定の規範に違反する推論を行う傾向があることを示す経験的発見を強調してきた。この研究の流れから導き出された結論は、人間の確率的思考は根本的に欠陥があり、誤りやすいということだった。[ 33 ]他の研究者たちは、認知プロセスと情報形式との関連性を強調し、そのような結論は一般的に正当化されないと主張している。[ 34 ] [ 35 ]
上記の例2をもう一度考えてみましょう。必要な推論は、呼気検査が陽性であった場合に、(無作為に選ばれた)運転手が飲酒運転をしている(事後)確率を推定することです。形式的には、この確率は上記のようにベイズの定理を用いて計算できます。しかし、関連情報を提示する方法はいくつかあります。形式的には同等の、以下の問題の変形を考えてみましょう。
この場合、関連する数値情報(p(酔っている)、p(D|酔っている)、p(D |しらふ))は、特定の参照クラスに関する自然頻度で表されます(参照クラスの問題を参照)。経験的研究によると、このように情報が提示されると、人々の推論はベイズの定理により近いものとなり、一般の人々[ 35 ]や専門家[ 36 ]のベースレート無視を克服するのに役立ちます。その結果、コクラン共同計画のような組織は、健康統計を伝えるためにこの種の形式を使用することを推奨しています[ 37 ] 。このようなベイズ推論の問題を自然頻度形式に変換するように人々に教えることは、単に確率(またはパーセンテージ)をベイズの定理に代入するように教えるよりも効果的です[ 38 ] 。また、自然頻度のグラフ表現(アイコン配列、仮説的結果プロットなど)は、人々がより良い推論を行うのに役立つことも示されています[ 38 ] [ 39 ] [ 40 ] [ 41 ]。
自然頻度形式が役立つ重要な理由の1つは、この情報形式が必要な計算を簡略化することで、必要な推論を容易にすることです。これは、必要な確率p (酔っている| D ) を計算する別の方法を使用するとわかります。
ここで、N (drunk ∩ D ) は飲酒運転で呼気検査で陽性反応が出たドライバーの数を表し、N ( D ) は呼気検査で陽性反応が出たケースの総数を表します。この式と上記の式との等価性は、確率論の公理から導かれ、N (drunk ∩ D ) = N × p ( D | drunk) × p (drunk) となります。重要なのは、この式は形式的にはベイズの定理と等価ですが、心理的には等価ではないということです。自然頻度を使用すると推論が簡略化されます。これは、必要な数学演算を正規化された分数 (つまり確率) ではなく自然数に対して実行できるため、偽陽性の数が多いことがより明確になるため、そして自然頻度が「入れ子構造」を示すためです。[ 42 ] [ 43 ]
すべての頻度形式がベイズ推論を容易にするわけではありません。[ 43 ] [ 44 ]自然頻度とは、自然サンプリングによって得られる頻度情報を指し、[ 45 ]ベースレート情報(例えば、ドライバーのランダムサンプルを取ったときの飲酒運転者の数)を保持します。これは、ベースレートが事前に固定されている系統的サンプリング(例えば、科学実験)とは異なります。後者の場合、ベースレート情報が保持されないため、ベイズの定理を使用して明示的に再導入する必要があるため、飲酒運転で検査が陽性のドライバーの数と呼気検査で陽性となった人の総数を比較して事後確率 p(飲酒運転|検査陽性)を推測することはできません。
-19への曝露が同じままであれば、ワクチン接種者が増えるにつれて、ワクチン接種者の割合が人口に占める割合がますます高くなるため、症例数、入院者数、死亡者数もワクチン接種者の間で増加します。たとえば、人口の100%がワクチン接種を受けた場合、症例の100%がワクチン接種者になります。
メッセージ: 全体集団における疾患の有病率が低い場合、偽陽性検査は真陽性検査よりも起こりやすくなります。これは偽陽性パラドックスと呼ばれます。
一見すると、これは逆説的に思える。学生全体として
ステロイドを
使用する人が少ないほど、使用者と特定された学生が実際には使用者でない可能性が高くなる。これは偽陽性パラドックスと呼ばれている。
- 引用元: Gonick, L.; Smith, W. (1993). The cartoon guide to statistics . New York: Harper Collins. p. 49.
基本的に彼女を良い、清潔な生活を送る母親にしている特徴を、彼女に不利な要因として使用するのは明らかに不公平です。確かに、そのような要因によって自然死の可能性が低くなることは認めますが、同じ特徴によって殺人の可能性も低くなります。
{{cite news}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク)。学会は医師による重大な臨床ミスを容認しない。なぜなら、そのようなミスは生死を分ける可能性があると広く認識されているからである。R対サリー・クラーク事件は、医療専門家証人が重大な統計的ミスを犯した一例であり、そのミスは事件の結果に深刻な影響を与えた可能性がある。