用語の定義 仮説検定の目的は、標本データを 調べることによって、統計的母集団 の特定の特性が真であるかどうかを立証することです。通常、母集団は、分布のパラメータが未知の確率変数 によってモデル化されます。たとえば、ある臨床試験では、特定の薬剤が高血圧の治療に有効かどうかを立証したい場合があり、「その薬剤を服用した患者に観察される血圧の変化」が確率変数となります。仮説の例としては、「血圧の平均変化はゼロである」または「血圧の平均変化は負である」などが挙げられます。一般に、母集団を記述するパラメータに関する記述はすべて仮説 となり得ます(ただし、標本に関する記述は仮説ではありません)。[ 3 ]
この検定では、デフォルトの「帰無」仮説 (H 0 と表記)と、その否定である対立仮説 (H 1 )という 2 つの仮説を比較します。[ 4 ] これは通常、文献レビュー や過去の研究などから構築されているため、研究仮説 と一致します。ただし、研究仮説が帰無仮説と一致する場合もあります。帰無仮説と対立仮説は、互いに排他的な 2 つの記述です。
「統計的有意性の検定で検証される記述は「帰無仮説」と呼ばれます。有意性検定は、帰無仮説に対する証拠の強さを評価するように設計されています。通常、帰無仮説は「効果がない」または「差がない」という記述です。」[ 5 ]
通常、このテストでは、研究対象の介入が効果がない、または母集団パラメータが何らかの「明白な」値を取るという帰無仮説を選択します。与えられたサンプルデータから検定統計量 が計算され、検定者は、帰無仮説が真であると仮定した場合に、少なくともこの極端な値を観測する条件付き確率を計算します。この確率( p値 と呼ばれる)がテストの有意水準 (で表される)よりも小さい場合、α {\displaystyle \alpha } ) の場合、帰無仮説は棄却されます。この検定では、帰無仮説が偽であるとは結論付けていません 。また、帰無仮説が偽である確率が 未満であるとも結論付けていません。α {\displaystyle \alpha } [ 6 ]
標本から検証対象の仮説が真か偽かを明確に判断することは通常不可能であるため、仮説検定の結論が正しいとは限りません。考えられる誤差には2つの種類があります。
第一種過誤 とは、帰無仮説が真であるにもかかわらず、確率で帰無仮説が棄却される過誤のことである。α = P ( 拒否する H 0 | H 0 ) \displaystyle \alpha =P({\text{H_{0}|H_{0}を棄却する}) これは検定の有意水準と同じです。 第二種過誤 とは、対立仮説が真であるにもかかわらず、確率で帰無仮説が受け入れられる過誤のことである。β = P ( 受け入れる H 0 | H 1 ) {\displaystyle \beta =P({\text{H_{0}|H_{1}を受け入れる} 数量1 − β {\displaystyle 1-\beta } これは検定力 と呼ばれる。 さらにいくつかの定義を付け加えます。
単純仮説 :母集団の分布を完全に規定する仮説。複合仮説:母集団の分布を完全に特定しない 仮説。 肯定的なデータ:研究者が帰無仮説を棄却することを可能にするデータ。 データがN(0,1)分布から得られると仮定します。たとえば、有意水準α = 0.05を選択した場合、Z表から、片側臨界値は約1.645となります。片側臨界値C α ≈ 1.645は、選択した有意水準に対応します。臨界領域[C α , ∞)は、標準正規分布の裾として実現されます。 統計的検定の臨界値 は 、検定の受容領域の境界です。 [ 7 ] 受容領域とは、帰無仮説が棄却されない検定統計量の値の集合です。受容領域の形状によっては、臨界値が1つまたは複数存在する場合があります。 拒絶領域 /棄却域 :帰無仮説が棄却される検定統計量の値の集合。サイズ :単純な仮説の場合、これは検定が帰無仮説を誤って棄却する確率です。 偽陽性 率です。複合仮説の場合、これは帰無仮説に含まれるすべてのケースにおいて帰無仮説を棄却する確率の上限です。偽陽性率の補数は、生物統計学 では特異度 と呼ばれます。(「これは特異度の高い検査です。結果が陽性であるため、患者がその疾患にかかっていると自信を持って言えます。」)詳細な定義については、感度と特異度 、および第一種過誤と第二種過誤 を参照してください。統計的有意性検定 :統計的仮説検定の前身(起源の項を参照)。サンプルが(帰無)仮説と十分に矛盾する場合、実験結果は統計的に有意 。これは、常識、意味のある実験結果を特定するための実用的なヒューリスティック、統計的証拠の閾値を確立する慣習、またはデータから結論を導き出す方法など、さまざまな観点から考えられていた。統計的仮説検定は、対立仮説を明示することで、この概念に数学的な厳密性と哲学的な一貫性を加えた。この用語は、現在では統計的仮説検定の一部となっている現代版を指すのに漠然と用いられている。保守的な検定:ある検定が保守的であるというのは、特定の名目上の有意水準に基づいて構築された場合、帰無仮説を誤って 棄却する真の確率が、その名目上の有意水準を超えることが決してないという場合である。 正確なテスト スカラーパラメータの場合、主な対立仮説は4種類あります。
対立仮説は 、対立仮説の下での母集団分布が未知のパラメータを持たない完全に定義された分布となるように仮説検定が構成される場合に発生します。このような仮説は通常、実際的な関心はありませんが、統計的推論 の理論的考察の基礎であり、ネイマン・ピアソン補題の基礎となっています。片側方向性 。片側方向性対立仮説は、標本分布の片側のみの棄却域に関係します。両側方向性 。両側方向性対立仮説は、標本分布の棄却領域の両方に関係します。非方向性 。非方向性の対立仮説は、棄却領域には関係せず、帰無仮説が真ではないことのみに関心を持ちます。統計的仮説検定では、検定統計量(例えばz値 やt値 )を閾値と比較します。検定統計量(以下の表に示す式)は最適性に基づいて決定されます。第一種過誤率が一定の場合、これらの統計量を用いることで第二種過誤率を最小化できます(検出力を最大化することに相当します)。以下の用語は、このような最適性の観点から検定を説明するものです。
最も強力な検定:特定のサイズ または有意水準 において、対立仮説に含まれる検定対象のパラメータの特定の値に対して、最も高い検出力(棄却確率)を持つ検定。 一様に最も強力な検定 (UMP)
近代における起源と初期の論争現代の有意性検定は、主にカール・ピアソン (p 値 、ピアソンのカイ二乗検定 )、ウィリアム・シーリー・ゴセット (スチューデントのt分布 )、ロナルド・フィッシャー (「帰無仮説 」、分散分析 、「有意性検定 」)の成果である一方、仮説検定はイェジー・ネイマン とエゴン・ピアソン(カールの息子)によって開発された。ロナルド・フィッシャーは統計学のキャリアをベイズ主義者としてスタートしたが(Zabell 1992)、フィッシャーはすぐにその主観性(特に事前確率を決定する際の 無差別原理 の使用)に幻滅し、帰納的推論に対してより「客観的」なアプローチを提供しようとした。[ 14 ]
フィッシャーは、正規分布 を仮定して少数のサンプルから結果を抽出する厳密な実験計画と手法を重視した。一方、ネイマン(若いピアソンと共同研究を行った)は、多数のサンプルからより多くの結果を得るための数学的な厳密さと、より広い範囲の分布に対応する手法を重視した。現代の仮説検定は、20世紀初頭に開発されたフィッシャーとネイマン/ピアソンの定式化、手法、用語が混在した、一貫性のないハイブリッドである。
フィッシャーは「有意性検定」を普及させた。彼は帰無仮説(母集団の度数分布に対応するもの)と標本を必要とした。彼の(今ではよく知られている)計算によって、帰無仮説を棄却するかどうかが決定された。有意性検定では対立仮説を用いないため、第二種過誤 (偽陰性)の概念は存在しなかった。
p値 は、研究者が(他の知識に基づいて)将来の実験を修正するか、帰無仮説に対する確信を強めるかを判断するのに役立つことを目的とした、非公式だが客観的な指標として考案された。 [ 15 ] 仮説検定(およびタイプI/IIエラー)は、フィッシャーのp 値よりも客観的な代替手段としてネイマンとピアソンによって考案され、研究者の行動を判断することを目的としているが、研究者による帰納的推論は必要としない。 [ 16 ] [ 17 ]
ネイマンとピアソンは、フィッシャーとは異なる問題(彼らはこれを「仮説検定」と呼んだ)を検討した。彼らはまず、2つの単純な仮説(どちらも度数分布を持つ)を検討した。そして、2つの確率を計算し、通常は確率の高い方の仮説(サンプルを生成した可能性が高い仮説)を選択した。彼らの方法は常に仮説を選択するものであり、また、2種類の誤差確率を計算することも可能であった。
フィッシャーとネイマン/ピアソンは激しく対立した。ネイマン/ピアソンは、自分たちの定式化を有意性検定の改良された一般化だと考えていた(定義論文[ 16 ] は抽象的 であり、数学者たちは何十年にもわたってこの理論を一般化して洗練させてきた[ 18 ] )。フィッシャーは、実験の過程で、予期せぬ誤差の原因により、帰無仮説に関する当初の仮定が疑わしいことが判明することが多いため、この定式化は科学研究には適用できないと考えていた。彼は、データ収集前に定式化されたモデルに基づく厳格な棄却/受容の決定は、科学者が直面するこの一般的なシナリオとは相容れず、この方法を科学研究に適用しようとすると大混乱を招くと信じていた[ 19 ] 。
フィッシャーとネイマン=ピアソンの間の論争は哲学的な根拠に基づいて行われ、ある哲学者はそれを統計的推論におけるモデルの適切な役割をめぐる論争と特徴づけた。[ 20 ]
ネイマンは1938年にカリフォルニア大学バークレー校 の職に就き、ピアソンとのパートナーシップを解消し、(以前は同じ建物に入居していた)両者を分離させた。フィッシャーとネイマンの間の紛争は、1962年のフィッシャーの死によって(27年間未解決のまま)終結した。ネイマンは高く評価された追悼文を書いた。[ 21 ] ネイマンの後の出版物の中には、p 値と有意水準を報告したものもある。[ 22 ]
帰無仮説有意性検定(NHST)仮説検定の現代版は一般に帰無仮説有意性検定(NHST) [ 23 ] と呼ばれ、フィッシャー法とネイマン・ピアソン法のハイブリッドである。2000年にレイモンド・S・ニッカーソン は、NHSTは(当時)「心理学実験で収集されたデータの分析方法としておそらく最も広く使われており、約70年間そうであった」と同時に「非常に議論の的となっている」と述べる記事を書いた[ 23 ] 。
この融合は、1940年代から始まった統計学教科書の執筆者たちの混乱から生じた(フィッシャーの予言通り)[ 24 ] (ただし、例えば信号検出 では、今でもネイマン/ピアソンの定式化が使われている)。上記以外にも、概念上の大きな違いや多くの注意点が無視された。ネイマンとピアソンは、より強力な用語、より厳密な数学、より一貫した哲学を提供したが、今日入門統計学で教えられている内容は、彼らの方法よりもフィッシャーの方法との類似点が多い。[ 25 ]
1940年頃、[ 24 ] 統計学の教科書の著者は、検定統計量 (またはデータ)の代わりにp 値を使用してネイマン・ピアソンの「有意水準」と比較することで、2つのアプローチを組み合わせ始めました。
哲学 ポール・ミールは、帰無仮説の選択の 認識論的 重要性がほとんど認識されていないと主張している。帰無仮説が理論によって予測される場合、より精密な実験は、その根底にある理論に対するより厳しい検証となる。帰無仮説が「差がない」または「効果がない」というデフォルトの場合、より精密な実験は、実験を行う動機となった理論に対するより緩やかな検証となる。[ 26 ]
フィッシャーとネイマンは、確率の主観性に反対した。彼らの見解は、客観的な定義の確立に貢献した。彼らの歴史的な意見の相違の核心は、哲学的なものであった。
仮説検定に対する哲学的批判の多くは、統計学者によって他の文脈、特に相関関係は因果関係を意味しないこと や実験計画法で 議論されている。仮説検定は哲学者にとって継続的な関心事である。[ 20 ] [ 27 ]
教育 統計学は学校でますます教えられるようになり、仮説検定は教えられる要素の 1 つです。[ 28 ] [ 29 ] 大衆メディアで報告される多くの結論 (政治世論調査から医学研究まで) は統計に基づいています。一部の著者は、このような統計分析によって、大量のデータを含む問題について明確に考えることができ、また、そのデータからの傾向や推論を効果的に報告できると述べていますが、一般大衆向けの著者は、用語や概念を正しく使用するために、この分野をしっかりと理解しておく必要があると警告しています。[ 30 ] [ 31 ] 大学の入門統計学の授業では、仮説検定に重点が置かれており、おそらく授業の半分を占めています。文学や神学などの分野では、統計分析に基づく発見が取り入れられています (聖書分析を 参照)。入門統計学の授業では、仮説検定は手順書のように教えられます。仮説検定は大学院レベルでも教えられています。統計学者は、優れた統計検定手順 ( z 、スチューデントのt 、F 、カイ二乗など) を作成する方法を学びます。統計的仮説検定は統計学の中で成熟した分野と考えられているが、[ 32 ] 限られた範囲で開発が続けられている。
ある学術研究によると、入門統計学の指導におけるマニュアル的な方法では、歴史、哲学、論争に割く時間が全くないという。仮説検定は、既成の統一的な方法として教えられてきた。調査によると、このクラスの卒業生は(統計的推論のあらゆる側面に関して)哲学的な誤解に満ちており、それは教師の間でも根強く残っている。[ 33 ] この問題は10年以上前に取り上げられ、[ 34 ] 教育改革の要求は続いているが、[ 35 ] 学生は依然として仮説検定に関する根本的な誤解を抱えたまま統計学の授業を卒業する。[ 36 ] 仮説検定の指導を改善するためのアイデアとしては、学生に発表論文中の統計的誤りを探すよう促すこと、統計学の歴史を教えること、そして一般的に退屈なこの分野における論争を強調することなどが挙げられる。[ 37 ]
レイモンド・S・ニッカーソンは次のようにコメントした。
NHST に関する議論は、現代のアプローチの基礎となっている推論統計理論の発展に大きく貢献した人々の間で未解決の意見の相違があることに端を発している。Gigerenzerら (1989)は 、一方では R.A. Fisher、他方では Jerzy Neyman と Egon Pearson の間の論争、そしてこれら 2 つの見解と Thomas Bayes の追随者たちの見解との間の意見の相違についてかなり詳細に検討した。彼らは、NHST を潜在的なユーザーに教えるために使用されているほとんどの教科書には、歴史的かつ現在も続いている論争の兆候がほとんど見られないという驚くべき事実を指摘した。その結果、正確な歴史的視点と、統計的推論に対するさまざまなアプローチの複雑さと時には論争の的となる哲学的基盤の理解が欠如していることが、統計的検定が誤用され、誤解される明らかな容易さを説明する大きな要因となっている可能性がある。[ 23 ]
実際に頻度論的仮説検定を行う際の典型的な手順は以下のとおりです。
仮説(データを用いて検証可能な主張)を定義する。 関連する統計的検定とそれに対応する検定統計量 T を選択してください。 仮定から、帰無仮説の下での検定統計量の分布を導出します。標準的なケースでは、これは既知の結果となります。例えば、検定統計量は自由度が既知のt分布 に従うか、平均と分散が既知の正規分布 に従う可能性があります。 有意水準(α )、つまり許容される 偽陽性率の 最大値を選択してください。一般的な値は5%と1%です。 観測値から検定統計量Tの観測値 t obs を計算します。 帰無仮説を棄却して対立仮説を採用するか、棄却しないかを決定します。ネイマン・ピアソンの 決定ルールは、観測値t obs が棄却域にある場合は帰無仮説H 0 を棄却し、そうでない場合は帰無仮説を棄却しないというものです。[ 38 ]
実例 放射性物質入りスーツケースの例(下記参照)に適用した場合の、2つのプロセスの違いは以下のとおりです。
「ガイガーカウンターの数値は10です。許容限度は9です。スーツケースの中を確認してください。」 「ガイガーカウンターの数値が高いです。安全なスーツケースの97%はこれより低い数値を示します。許容範囲は95%です。スーツケースを確認してください。」 前者の報告書は適切だが、後者はデータに関するより詳細な説明と、スーツケースが検査される理由を述べている。
帰無仮説を棄却しないということは、帰無仮説が「受け入れられた」ことを意味するわけではない(ただし、ネイマンとピアソンは彼らの原著論文でその言葉を使用している。解釈の 項を参照)。
ここで説明したプロセスは計算には十分であるが、実験計画の 考慮事項を著しく無視している。[ 39 ] [ 40 ]
実験を実施する前に、適切なサンプルサイズを推定することが特に重要である。
「有意性検定」という言葉は、統計学者のロナルド・フィッシャー によって造語された。[ 41 ]
解釈 帰無仮説が真であり、統計的仮定が満たされている場合、p値が有意水準以下になる確率はα {\displaystyle \alpha } 最大でα {\displaystyle \alpha } これにより、仮説検定が指定された偽陽性率を維持することが保証されます(統計的仮定が満たされている場合)。[ 3 ]
p 値は、帰無仮説の下で、得られた検定統計量と少なくとも同程度に極端な検定統計量が発生する確率です。有意水準0.05では、公平なコインは平均して20回のテストのうち1回で帰無仮説(公平であるという仮説)を(誤って)棄却すると予想されます。p値 は、帰無仮説またはその反対が正しい確率を示すものではありません(よくある誤解の原因です)。[ 42 ]
p 値が選択した有意水準よりも小さい場合(あるいは、観測された検定統計量が棄却域内にある場合)、選択した有意水準において帰無仮説は棄却される。p値が選択した有意水準よりも小さくない場合( あるいは 、観測された検定統計量が棄却域外にある場合)、選択した有意水準において帰無仮説は棄却されない。
(下記の)「お茶を試飲する女性」の例では、フィッシャーは、結果が偶然によるものではないという結論を正当化するために、女性がすべてのお茶を正しく分類することを要求しました。彼の実験では、女性が実質的にランダムに推測していた場合(帰無仮説)、観察された結果(完璧に分類されたお茶)が発生する確率は1.4%であることが明らかになりました。
用途と重要性 統計は、ほとんどのデータ群の分析に役立ちます。これは仮説検定にも同様に当てはまり、科学的理論が存在しない場合でも結論を正当化することができます。女性が紅茶を試飲した例では、(紅茶にミルクを注いだもの)と(ミルクに紅茶を注いだもの)の間に違いがないことは「明白」でした。しかし、データは「明白」な事実と矛盾していました。
仮説検定の現実世界における応用例には以下が含まれる:[ 43 ]
男性の方が女性よりも悪夢に悩まされる人が多いかどうかを検証する 文書の著者の特定 満月が行動に及ぼす影響の評価 コウモリが反響音によって昆虫を感知できる範囲を決定する 病院のカーペットが感染症の増加につながるかどうかを判断する 禁煙するための最適な方法を選ぶ バンパーステッカーが車の所有者の行動を反映しているかどうかを確認する 筆跡鑑定士の主張を検証する 統計的仮説検定は、統計学全体および統計的推論 において重要な役割を果たしています。例えば、レーマン(1992)は、ネイマンとピアソン(1933)による基礎的な論文のレビューの中で、「それにもかかわらず、欠点はあるものの、1933年の論文で定式化された新しいパラダイムと、その枠組みの中で行われた多くの発展は、統計学の理論と実践の両方において中心的な役割を果たし続けており、近い将来もそうあり続けると予想される」と述べています。
有意性検定は、一部の実験社会科学において好まれる統計的手法となっている(1990年代初頭の応用心理学ジャーナルの論文の90%以上)。 [ 44 ] 他の分野では、パラメーター(効果量 など)の推定が好まれている。有意性検定は、科学的方法 の中核である予測値と実験結果の伝統的な比較の代替として用いられる。理論が関係の符号しか予測できない場合、方向性(片側)仮説検定を設定することで、統計的に有意な結果のみが理論を支持するようにすることができる。この形式の理論評価は、仮説検定の最も批判されている適用方法である。
注意事項 「もし政府が統計的手法に医薬品のような警告表示を義務付けたら、ほとんどの推論手法には確かに長いラベルが付くだろう。」[ 45 ] この注意は仮説検定とその代替案に当てはまる。
仮説検定が成功した場合、その確率と第一種過誤率が関連付けられます。結論が間違っている可能 性もあります。
試験結果の信頼性は、その根拠となるサンプルの質に左右される。実験デザインは極めて重要である。以下のような予期せぬ効果がいくつか観察されている。
賢いハンス効果 。馬が簡単な算術計算ができるように見えた。 ホーソン効果 。工場労働者は、照明が明るいほど生産性が高く、照明が暗いほど生産性が高くなるという現象。 プラセボ効果 。薬効成分を含まない錠剤が驚くほど効果的だった。 誤解を招くデータを用いた統計分析は、誤った結論を生み出す。データ品質の問題は、より微妙な場合もある。例えば、予測 においては、予測精度を測る指標について合意が得られていない。合意された測定基準がない限り、測定結果に基づく決定は必ず論争を招くことになる。
出版バイアス:統計的に有意でない結果は出版される可能性が低く、それが文献に偏りをもたらす可能性がある。
多重検定: 調整なしに複数の真の帰無仮説検定を同時に実施すると、タイプIエラーの全体的な確率は名目上のアルファレベルよりも高くなります。[ 46 ]
仮説検定の結果に基づいて重要な意思決定を行う者は、結論だけでなく詳細にも目を向けることが賢明である。物理科学においては、ほとんどの結果は独立した検証によってのみ完全に受け入れられる。
ノンパラメトリックブートストラップ仮説検定 ブートストラップベースのリサンプリング 法は、帰無仮説検定に使用できます。ブートストラップは、帰無仮説が正しいと仮定して、元の結合サンプルデータをランダムに(復元抽出で)リサンプリングすることにより、多数のシミュレーションサンプルを作成します。ブートストラップは、分布に依存せず、制約のあるパラメトリック仮定に依存せず、漸近保証のある経験的近似法に基づいているため、非常に汎用性があります。従来のパラメトリック仮説検定は計算効率が高いですが、より強い構造的仮定を置きます。帰無仮説の下での検定統計量の確率を計算することが困難または不可能な状況(おそらく不便さや基礎となる分布の知識不足のため)では、ブートストラップは統計的推論のための実行可能な方法を提供します。[ 47 ] [ 48 ] [ 49 ] [ 50 ]
例
人間の性比 統計的仮説検定の最も初期の使用例は、一般的に、男性と女性の出生確率が等しいかどうか(帰無仮説)という問題に起因しており、これは1700年代にジョン・アーバスノット (1710年)[ 51 ] によって、そして後にピエール=シモン・ラプラス (1770年代)[ 52 ]によって取り上げられました。
アーバスノットは、1629年から1710年までの82年間のロンドンの出生記録を調べ、単純なノンパラメトリック検定である 符号検定 を適用した。[ 53 ] [ 54 ] [ 55 ] 毎年、ロンドンで生まれた男性の数は女性の数を上回った。男性と女性の出生数が等しい確率であると仮定すると、観察された結果の確率は0.5 82 、つまり約4,836,000,000,000,000,000,000,000分の1である。現代の用語では、これはp値である。アーバスノットは、これは偶然によるものとしては小さすぎるため、神の摂理によるものに違いないと結論付けた。「したがって、支配しているのは偶然ではなく芸術である」。現代の用語では、彼は p = 1/2 82の 有意水準で、男性と女性の出生が等しい確率であるという帰無仮説を棄却した。
ラプラスは、約50万人の出生統計を検討した。統計によると、女の子に比べて男の子が多かった。[ 9 ] 彼はp 値を計算して、その過剰は実際のものであるが、説明のつかない効果であると結論付けた。[ 56 ]
お茶を試飲する女性 有名な仮説検定の例として、紅茶を味わう淑女の実験[57]では、フィッシャーの 同僚 である ミュリエル・ブリストル 博士が、紅茶とミルクのどちらが先にカップに入れられたかを判別できると主張した。フィッシャーは、彼女に8つのカップ(各種類4つずつ)をランダムな順序で与えることを提案した。すると、彼女が正解した数になる確率はどれくらいか、ただしそれは単なる偶然か、という疑問が生じる。帰無仮説は、淑女にはそのような能力はないというものだった。検定統計量は、4つのカップを選択する際の成功回数を単純に数えたものだった。棄却域は、従来の確率基準(< 5%)に基づくと、4つのうち4つが成功したという単一のケースだった。4つの成功のパターンは、70通りの組み合わせのうち1つに相当する(p≈ 1.4%)。フィッシャーは、代替仮説は(決して)必要ではないと主張した。淑女はすべてのカップを正しく識別した[ 58 ] 。これは統計的に有意な結果とみなされるだろう。
透視能力者カードゲーム 被験者は透視能力 のテストを受けます。被験者には、ランダムに選ばれたトランプの裏面が25回表示され、それが4つのスート のうちどれに属するかを尋ねられます。正解した回数をX と呼びます。
彼らの透視能力の証拠を見つけようとする限り、今のところ帰無仮説は、その人は透視能力がないというものである。[ 59 ] 対立仮説は、その人は(多かれ少なかれ)透視能力があるというものである。
帰無仮説が正しい場合、被験者ができることは推測することだけです。どのカードについても、特定のスートが出現する確率(相対頻度)は1/4です。対立仮説が正しい場合、被験者は1/4より大きい確率でスートを正しく予測します。正しく推測する確率をp とします。したがって、仮説は次のようになります。
帰無仮説: H 0 : p = 1 4 {\displaystyle {\text{:}}\qquad H_{0}:p={\tfrac {1}{4}}} (あくまで推測ですが) そして
代替仮説: H 1 : p > 1 4 {\displaystyle {\text{:}}H_{1}:p>{\tfrac {1}{4}}} (真の透視能力者) 被験者が25枚すべてのカードを正しく予測した場合、その被験者は透視能力があるとみなし、帰無仮説を棄却します。24回または23回の正答の場合も同様です。一方、5回または6回の正答では、透視能力があるとみなす理由はありません。では、12回または17回の正答の場合はどうでしょうか?被験者が透視能力があるとみなす臨界値cはいくつでしょうか?臨界値 cはどのように決定するのでしょうか? c =25(つまり、すべてのカードが正しく予測された場合にのみ透視能力を認める)を選択した場合、c =10の場合よりも厳格になります。前者の場合、透視能力があると認められる被験者はほとんどいませんが、後者の場合、一定数の被験者がテストに合格します。実際には、どの程度厳格にするかは自分で決めます。つまり、第一種の誤り、つまり偽陽性 、または第一種過誤をどの程度許容するかを決めるのです。c =25の場合、そのような誤りの確率は次のようになります。
P ( 拒否する H 0 ∣ H 0 有効です ) = P ( X = 25 ∣ p = 1 4 ) = ( 1 4 ) 25 ≈ 10 − 15 {\displaystyle P({\text{H_{0}\mid H_{0}{\text{は妥当である}})=P\left(X=25\mid p={\frac {1}{4}}\right)=\left({\frac {1}{4}}\right)^{25}\approx 10^{-15}} 、したがって、非常に小さい。偽陽性の確率は、25回すべて正解する確率である。
より厳密でない条件として、c = 10 とすると、次のようになります。
P ( 拒否する H 0 ∣ H 0 有効です ) = P ( X ≥ 10 ∣ p = 1 4 ) = ∑ k = 10 25 P ( X = k ∣ p = 1 4 ) = ∑ k = 10 25 ( 25 k ) ( 1 − 1 4 ) 25 − k ( 1 4 ) k ≈ 0.0713 {\displaystyle P({\text{H_{0}\mid H_{0}{\text{は妥当である}}を棄却する}})=P\left(X\geq 10\mid p={\frac {1}{4}}\right)=\sum _{k=10}^{25}P\left(X=k\mid p={\frac {1}{4}}\right)=\sum _{k=10}^{25}{\binom {25}{k}}\left(1-{\frac {1}{4}}\right)^{25-k}\left({\frac {1}{4}}\right)^{k}\approx 0.0713} 。したがって、c = 10 の場合、偽陽性の確率ははるかに高くなります。
実際にテストを実施する前に、第一種過誤の最大許容確率(α )を決定します。通常、1%から5%の範囲の値が選択されます。(最大許容エラー率がゼロの場合、正解の推測回数は無限に必要になります。)この第一種過誤率に応じて、臨界値c が計算されます。たとえば、エラー率を1%に選択した場合、c は次のように計算されます。
P ( 拒否する H 0 ∣ H 0 有効です ) = P ( X ≥ c ∣ p = 1 4 ) ≤ 0.01 {\displaystyle P({\text{H_{0}\mid H_{0}{\text{は有効である}}を棄却する}})=P\left(X\geq c\mid p={\frac {1}{4}}\right)\leq 0.01} 。この性質を持つすべての数値 c の中から、タイプ II エラー、つまり偽陰性 の確率を最小限に抑えるために、最小値を選択します。上記の例では、以下を選択します。c = 13 {\displaystyle c=13} 。
その他の例 例えば、ある河川の水質が長年にわたって観測されている場合、「データの前半と後半の間で水質に変化はない」という帰無仮説に対して、「記録の後半では水質が悪化している」という対立仮説を検定する。
統計的仮説検定を 裁判における判決になぞらえると、帰無仮説は被告の立場(被告は無罪)に相当し、対立仮説は検察側の立場(被告は有罪)に相当します。被告は有罪が証明されるまでは無罪と推定されるため、仮説検定においても同様に、帰無仮説は当初は真であると仮定されます 。検察側の主張を証明するには、被告を有罪とするに足る十分な証拠が必要となります。これは、仮説検定における十分な統計的有意性 に相当します。
法廷では、裁判の基礎として考慮できるのは法的証拠のみです。仮説検定に関しては、帰無仮説の統計的有意性を測定するために、妥当な検定統計量 を設定する必要があります。帰無仮説が一定の有意水準で棄却された場合、証拠は対立仮説を支持します。ただし、これは第一種過誤 の可能性により、対立仮説が真であることを意味するとは限りません。統計的有意性を定量化するために、検定統計量変数は、帰無仮説が正しいという仮定の下で、実際に観察された結果 と少なくとも同程度に極端な検定結果が得られる確率を決定するために、正規分布 やt分布 などの特定の確率分布に従うと仮定されます。これはp 値 として定義されます。[ 60 ] [ 61 ] p値が選択された有意水準 ( α )よりも小さい場合、観察されたデータは 帰無 仮説 と十分に矛盾しており、したがって帰無仮説は棄却される可能性があると主張できます。検定の結果、有効な主張は「有意水準(α )において、帰無仮説は棄却され、対立仮説が支持される」となる。裁判の比喩で言えば、「誤った有罪判決の確率 α を許容範囲内として、被告は有罪である」という宣告になるだろう。
ネイマン・ピアソン仮説検定ネイマン・ピアソン仮説検定(または帰無仮説統計的有意性検定)の例は、放射性スーツケースの例を変更することで作成できます。「スーツケース」が実際に放射性物質を輸送するための遮蔽容器である場合、テストを使用して、放射性源が存在しない、1つ存在する、2つ(すべて)存在するという3つの仮説の中から選択することができます。テストは安全のために必要であり、それぞれの場合に措置が必要になります。仮説検定のネイマン・ピアソン補題 は、仮説を選択するための良い基準は、それらの確率の比(尤度比)であると述べています。簡単な解決方法は、観測されたガイガーカウントに対して最も高い確率を持つ仮説を選択することです。典型的な結果は直感と一致します。カウントが少ない場合は源がなく、カウントが多い場合は2つの源があり、中間のカウントの場合は1つの源があることを意味します。また、通常は 否定を証明する のに問題があることに注意してください。帰無仮説は少なくとも反証可能 でなければなりません。
ネイマン・ピアソン理論は、事前確率と意思決定から生じる行動のコストの両方に対応できる。[ 64 ] 前者は、各検定で以前の検定結果を考慮することを可能にする(フィッシャーの有意性検定とは異なる)。後者は、確率だけでなく、経済問題(例えば)を考慮することを可能にする。尤度比は、仮説を選択するための優れた基準であり続ける。
仮説検定の 2 つの形式は、異なる問題設定に基づいています。元のテストは真偽問題に類似しており、ネイマン・ピアソン検定は多肢選択式に近いものです。Tukey [ 65 ] の見解では、前者 は 強力な 証拠のみに基づいて結論を導き出し、後者は利用可能な証拠に基づいて決定を導き出します。この 2 つのテストは数学的にも哲学的にもかなり異なっているように見えますが、後の発展により正反対の主張につながっています。多数の微小な放射性物質を考えてみましょう。仮説は 0、1、2、3、... 粒の放射性砂になります。放射線がまったくないか、いくらかある場合 (Fisher ) と、放射性砂が 0 粒の場合とすべての選択肢 (ネイマン・ピアソン) の間にはほとんど区別がありません。1933 年のネイマン・ピアソンの主要な論文[ 16 ] では、複合仮説 (分布に未知のパラメータが含まれるもの) も検討されました。ある例では、(スチューデントの)t 検定の最適性が証明されており、「検討中の仮説に対してこれ以上の検定方法はあり得ない」(321ページ)と述べられている。ネイマン=ピアソン理論は、その提唱当初からフィッシャー法の最適性を証明していた。
フィッシャーの有意性検定は、応用において数学的な成長の可能性はほとんどないものの、人気のある柔軟な統計ツールであることが証明されています。ネイマン・ピアソン仮説検定は、数理統計学の柱であると主張されており、[ 66 ] この分野に新しいパラダイムを生み出しました。また、統計的プロセス管理 、検出理論 、決定理論 、ゲーム理論 における新しい応用も刺激しました。どちらの定式化も成功していますが、その成功の性質は異なります。
定式化をめぐる論争は未解決である。科学では主に、入門統計学で教えられるフィッシャーの(わずかに修正された)定式化が用いられる。統計学者は大学院でネイマン・ピアソン理論を学ぶ。数学者は定式化を統合したことを誇りに思っている。哲学者はそれらを別々に考察する。学識ある意見では、定式化は(フィッシャー対ネイマン)競合的、非両立的[ 14 ] 、または補完的[ 18 ] と様々に見なされている。ベイズ推論が認められるようになってから、論争はさらに複雑になった。
用語に一貫性がない。仮説検定とは、時間とともに変化する2つの定式化の組み合わせを指す場合もある。有意性検定と仮説検定に関する議論は、特に混乱を招きやすい。
フィッシャーは、仮説検定は産業品質管理を行う上で有用な戦略であると考えていたが、仮説検定が科学者にとって有用であるという点には強く反対した。[ 15 ] 仮説検定は、有意性検定で使用される検定統計量を求める手段を提供する。[ 18 ] 検出力の概念は、有意水準を調整することによる影響を説明するのに有用であり、サンプルサイズ決定 において広く用いられている。この2つの方法は、哲学的に異なるままである。[ 20 ] これらは通常(常にではない が)、同じ数学的答えを生み出す。好ましい答えは文脈に依存する。[ 18 ] フィッシャー理論とネイマン・ピアソン理論の既存の統合は強く批判されているが、ベイズ目標を達成するために統合を修正することが検討されている。[ 67 ]
批判 統計的仮説検定に対する批判の多くは、以下の問題点に集約される。
p 値の解釈は、停止ルール と多重比較の定義に依存します。前者は研究の過程でしばしば変化し、後者は必然的に曖昧になります(つまり、「p値は、観測された(データ)と、観測されたかもしれないが観測されなかった他の可能性のある(データ)の両方に依存します」)。[ 68 ] 概念的に異なるフィッシャー法とネイマン・ピアソン法を組み合わせたことに起因する混乱(一部)。[ 65 ] 繰り返し実験による推定や確認を排除し、統計的有意性を強調する。[ 69 ] 出版基準として統計的有意性を厳密に要求することで、出版バイアス が生じる。[ 70 ] 批判のほとんどは間接的である。統計的仮説検定は間違っているのではなく、誤解され、過剰に使用され、誤用されている。 グループ間に差があるかどうかを検出するために使用すると、パラドックスが生じます。実験設計の改善(測定精度とサンプルサイズの増加など)が行われるにつれて、検定はより寛容になります。データのすべてのノイズ源が完全に相殺されるという不合理な仮定を受け入れない限り、どちらの方向にも統計的有意性を見つける可能性は100%に近づきます。[ 71 ] しかし、2つのグループ間の平均差がゼロにならないというこの不合理な仮定は、iidランダム変数の任意の2つのサブグループ間の期待差がゼロであるため、データが独立かつ同一分布(iid)にならないことを意味します。したがって、iid仮定も不合理です。 哲学的な懸念の層。統計的有意性の確率は、実験者/分析者による決定の関数である。[ 72 ] 決定が慣習に基づく場合、それは恣意的または無思慮であるとされ[ 73 ] 、そうでないものについては主観的であるとされる。タイプIIエラーを最小限に抑えるために、大きなサンプルが推奨される。心理学では、十分に大きなサンプルでは、事実上すべての帰無仮説が偽であると主張されるため、「帰無仮説を棄却することだけを目的として実験を行うことは通常無意味である」 [ 74 ] 。心理学では、「統計的に有意な発見はしばしば誤解を招く」[ 75 ] 。統計的有意性は実質的有意性を意味するものではなく、相関は因果関係を意味するものではない 。したがって、帰無仮説に疑義を呈することは、研究仮説を直接支持することとは程遠い。 「それは我々が知りたいことを教えてくれない」[ 76 ] 数十件の苦情リストが入手可能である[ 77 ] [ 23 ] [ 78 ] 批判者と支持者は、帰無仮説有意性検定(NHST)の特性に関して、事実上ほぼ一致している。NHSTは重要な情報を提供できるが、統計分析の唯一のツールとしては不十分 である。帰無仮説を棄却できたとしても、研究仮説を支持するものではない可能性がある。 現在も議論が続いているのは、既存の慣行を踏まえて、近い将来に最適な統計的手法を選択することである。しかし、適切な研究設計によってこの問題を最小限に抑えることができる。批判者はNHSTを完全に禁止し、これらの慣行から完全に脱却することを望んでいるが[ 79 ] 、支持者はそれほど絶対的ではない変更を提案している[ 80 ] 。
有意性検定、特にそれが出版バイアスに及ぼす影響をめぐる論争は、いくつかの結果を生み出した。米国心理学会は、 見直しの後、統計報告の要件を強化した[ 81 ]。 医学雑誌の 出版社は、出版バイアスに対抗するために、統計的に有意でない結果もいくつか掲載する義務があることを認識した[ 82 ] 。また、そのような結果のみを掲載する雑誌(帰無仮説を支持する論文誌 )が創刊された[ 83 ] 。教科書にはいくつかの注意書きが追加され[ 84 ] 、有意な結果を得るために必要なサンプルサイズを推定するために必要なツールの解説が増えた。有意性検定の使用を放棄した主要な組織はほとんどないが、放棄を検討した組織もある。[ 81 ] 例えば、2023年にJournal of Physiology の編集者は、「同誌に論文を掲載する者には推定方法の使用を強く推奨する」(効果量 の大きさ(読者が発見が実用的、生理学的、または臨床的に関連性があるかどうかを判断できるようにするため)と、その推定の精度を伝えるための信頼区間を 意味する)と述べ、「最終的には、Journal of Physiologyに論文を掲載する者が最も気にするべきは、統計的有意性ではなく、データの生理学的重要性である」と述べている。[ 85 ]
P値は確率変数です。[ 86 ] したがって、統計的検定の決定は確率変数です。その安定性を理解するために、以下のようなアプローチが提案されています。
参考文献 ↑ Lewis, Nancy D.; Lewis, Nigel Da Costa; Lewis, ND (2013). 100 Statistical Tests in R: What to Choose, how to Easily Calculate, with Over 300 Illustrations and Examples . Heather Hills Press. ISBN 978-1-4840-5299-0 。 ↑ Kanji, Gopal K. (2006年7月18日). 100の統計検定 . SAGE. ISBN 978-1-4462-2250-8 。1 2 レーマン、EL; ロマーノ、ジョセフ P. (2005). 統計的仮説検定 (第3 版). ニューヨーク:スプリンガー. ISBN 978-0-387-98864-1 。↑ カルロス・コルティーニャス、ケン・ブラック(2014年9月23日)。『 ビジネスと経済のための統計学』 。ワイリー。314 ページ 。ISBN 978-1-119-94335-8 。↑ ムーア、デイビッド S. ; マッケイブ、ジョージ P. (2003). 統計学の実践入門 (第4 版). ニューヨーク. ISBN 0-7167-9657-0 OCLC 49751157。 {{cite book}}: CS1メンテナンス: 場所の発行元が見つかりません (リンク)↑ Wasserstein RL、Lazar NA ( 2016)。 「 ASAの p 値に関する声明 :文脈、プロセス、目的」 ( PDF) 。The American Statistician。70 ( 2): 129–133。doi : 10.1080 / 00031305.2016.1154108。S2CID 124084622 。 ↑ Hughes, Ann J.; Grawoig, Dennis E. (1971). Statistics: A Foundation for Analysis . Reading, Mass.: Addison-Wesley. p . 191. ISBN 0-201-03021-7 。↑ Bellhouse, P. (2001), "John Arbuthnot", in Statisticians of the Centuries by CC Heyde and E. Seneta , Springer, pp. 39–42 , ISBN 978-0-387-95329-8 1 2 ラプラス、P. (1778)。 「確率の記憶」 。 パリ王立科学アカデミーの回想録 : 227–332 。 Laplace、P. (1878–1912) に再版されました。 「確率に関する記憶 (XIX, XX)」 。 ラプラスの全作品 。 Vol. 9. ゴティエ・ヴィラール。 383–488 ページ 。 英語翻訳: Laplace, P. (2010 年 8 月 21 日)。 「確率に関するメモワール」 (PDF) 。 Pulskam、Richard J による翻訳。2015 年 4 月 27 日の オリジナル (PDF)からアーカイブ。 ↑ Pearson, K (1900). 「相関のある変数体系の場合、確率からの偏差の与えられた体系が、ランダムサンプリングから生じたと合理的に想定できるようなものであるという基準について」 (PDF) . The London, Edinburgh, and Dublin Philosophical Magazine and Journal of Science . 5 (50): 157– 175. doi : 10.1080/14786440009463897 . ↑ Pearson, K (1904). "On the Theory of Contingency and Its Relation to Association and Normal Correlation" . Drapers' Company Research Memoirs Biometric Series . 1 : 1– 35. ↑ Zabell, S (1989). "RA Fisher による逆確率の歴史" . Statistical Science . 4 (3): 247– 256. doi : 10.1214/ss/1177012488 . JSTOR 2245634 . ↑ Cohen, J. (1990). "私がこれまでに学んだこと" . American Psychologist . 45 (12): 1304– 1312. doi : 10.1037/0003-066X.45.12.1304 . S2CID 7180431 . 1 2 Raymond Hubbard、 MJ Bayarri 、「P値は誤差確率ではない」Wayback Machine に2013年9月4日に アーカイブ済み 。Fisherの証拠に基づくp 値とNeyman-Pearsonの第I種過誤率の違いを説明するワーキングα {\displaystyle \alpha } 。 1 2 Fisher, R (1955). "統計的方法と科学的帰納" (PDF) . Journal of the Royal Statistical Society, Series B . 17 (1): 69– 78. doi : 10.1111/j.2517-6161.1955.tb00180.x . 1 2 3 4 Neyman, J; Pearson, ES (1933 年 1 月 1 日). 「統計的仮説の最も効率的な検定の問題について」 . Philosophical Transactions of the Royal Society A. 231 ( 694–706 ) : 289–337 . Bibcode : 1933RSPTA.231..289N . doi : 10.1098/rsta.1933.0009 . ↑ Goodman, SN (1999年6月15日) . 「エビデンスに基づく医療統計に向けて。1:P値の誤謬」 Ann Intern Med . 130 (12): 995–1004 . doi : 10.7326/0003-4819-130-12-199906150-00008 . PMID 10383371. S2CID 7534212 . 1 2 3 4 Lehmann, EL (1993 年 12 月). 「フィッシャー、ネイマン-ピアソンの仮説検定理論: 1 つの理論か、それとも 2 つの理論か?」。 Journal of the American Statistical Association . 88 (424): 1242– 1249. Bibcode : 1993JASA...88.1242L . doi : 10.1080/01621459.1993.10476404 . ↑ Fisher, RN (1958). "The Nature of Probability" (PDF) . Centennial Review . 2 : 261– 274. 我々は、高度な訓練を受け、非常に知的な若者を、誤った数字の表を脇に抱え、脳があるべき場所に濃い霧を抱えたまま、世に送り出すという危険に非常に陥っている。もちろん、今世紀には、彼らは誘導ミサイルの開発に携わり、医療専門家に疾病の制御について助言するだろうが、彼らがあらゆる種類の国家的な取り組みを妨害する可能性には限界がない。 1 2 3 Lenhard, Johannes (2006). "モデルと統計的推論: フィッシャーとネイマン-ピアソンの論争". Br. J. Philos. Sci . 57 : 69–91 . doi : 10.1093/bjps/axi152 . S2CID 14136146 . ↑ Neyman, Jerzy (1967). "RA Fisher (1890—1962): An Appreciation". Science . 156 (3781): 1456– 1460. Bibcode : 1967Sci...156.1456N . doi : 10.1126/science.156.3781.1456 . PMID 17741062 . S2CID 44708120 . ↑ Losavich, JL; Neyman, J.; Scott, EL; Wells, MA (1971). "ホワイトトップ実験における人工降雨の負の見かけ上の効果に関する仮説的説明" . 米国科学アカデミー紀要 . 68 (11): 2643– 2646. Bibcode : 1971PNAS...68.2643L . doi : 10.1073/pnas.68.11.2643 . PMC 389491 . PMID 16591951 . 1 2 3 4 5 6 Nickerson, Raymond S. (2000). "Null Hypothesis Significance Tests: A Review of an Old and Continuing Controversy" (PDF) . Psychological Methods . 5 (2): 241– 301. doi : 10.1037/1082-989X.5.2.241 . PMID 10937333 . S2CID 28340967 . 2000年2月23日に オリジナル からアーカイブ済み。 1 2 Halpin, PF; Stam, HJ (2006 年冬)「帰納的推論か帰納的行動か:フィッシャーとネイマン:心理学研究における統計的検定へのピアソンのアプローチ(1940~1960 年)」 アメリカ 心理学ジャーナル 119 (4): 625–653 . doi : 10.2307/20445367 . JSTOR 20445367 . PMID 17286092 . ↑ ギーゲレンツァー、ゲルト;ゼノ・スウィティンク;セオドア・ポーター;ロレイン・ダストン;ジョン・ビーティ;ローレンツ・クルーガー(1989)。「第3部:推論の専門家」。 『偶然の帝国:確率はいかに科学と日常生活を変えたか 』。ケンブリッジ大学出版局。70 ~ 122ページ 。ISBN 978-0-521-39838-1 。↑ Meehl, P (1990). "理論の評価と修正:ラカトス派の防衛戦略とそれを保証する2つの原則" (PDF) . Psychological Inquiry . 1 (2): 108– 141. doi : 10.1207/s15327965pli0102_1 . ↑ Mayo, DG; Spanos, A. (2006). "Severe Testing as a Basic Concept in a Neyman–Pearson Philosophy of Induction". The British Journal for the Philosophy of Science . 57 (2): 323– 357. CiteSeerX 10.1.1.130.8131 . doi : 10.1093/bjps/axl003 . S2CID 7176653 . ↑ 数学 > 高校:統計と確率 > 入門非推奨リンク( 2012年7月28日に archive.today にアーカイブ済み) 共通コア州基準イニシアチブ(米国の生徒に関連) ↑ カレッジボードテスト > AP:科目 > 統計学カレッジボード(米国学生向け) ↑ハフ 、 ダレル(1993)。 統計で嘘をつく方法 。ニューヨーク:ノートン。p . 8。ISBN 978-0-393-31072-6 。 社会経済動向、景気状況、世論調査、国勢調査といった膨大なデータを報告するには、統計的手法と統計用語が不可欠である。しかし、言葉を誠実に使いこなす書き手と、その意味を理解する読者がいなければ、結果として得られるのは意味論的なナンセンスに過ぎない。↑ スネデカー、ジョージ W.、コックラン、ウィリアム G. (1967). 統計的方法 (第 6 版). アイオワ州エイムズ: アイオワ州立大学出版局. p. 3. 「…統計学の基本的な考え方は、問題について明確に考えるのに役立ち、健全な推論を行うために満たされなければならない条件についての指針を与え、論理的な根拠のない多くの推論を検出することを可能にする。」1 2 E. L. Lehmann (1997). "統計的仮説検定: 書籍の物語" . Statistical Science . 12 (1): 48– 52. doi : 10.1214/ss/1029963261 . ↑ Sotos, Ana Elisa Castro; Vanhoof, Stijn; Noortgate, Wim Van den; Onghena, Patrick (2007). "統計的推論に関する学生の誤解:統計教育に関する研究からの経験的証拠のレビュー" (PDF) . Educational Research Review . 2 (2): 98– 113. doi : 10.1016/j.edurev.2007.04.001 . ↑ Moore, David S. (1997). "新しい教育法と新しい内容:統計学の事例" (PDF) . International Statistical Review . 65 (2): 123– 165. doi : 10.2307/1403333 . JSTOR 1403333 . ↑ ハバード、レイモンド、 アームストロング、J. スコット (2006)。 「 統計的有意性の意味を本当に理解していない理由:教育者への示唆」。Journal of Marketing Education。28 ( 2 ): 114–120。doi : 10.1177 /0273475306288399。hdl : 2092 / 413。S2CID 34729227 。 ↑ Sotos, Ana Elisa Castro; Vanhoof, Stijn; Noortgate, Wim Van den; Onghena, Patrick (2009). "仮説検定に関する学生の誤解に対する自信度はどのくらいか?" . Journal of Statistics Education . 17 (2). doi : 10.1080/10691898.2009.11889514 . ↑ Gigerenzer, G. (2004). "The Null Ritual: What You Always Wanted to Know About Significant Testing but Were Afraid to Ask" (PDF) . The SAGE Handbook of Quantitative Methodology for the Social Sciences . pp. 391–408 . doi : 10.4135/9781412986311 . ISBN 9780761923596 。↑ 「統計 的 仮説検定」 。Springer Texts in Statistics 。2005年 。doi : 10.1007/0-387-27605- x。ISBN 978-0-387-98864-1 ISSN 1431-875X ↑ ヒンケルマン、クラウス; ケンプソーン、オスカー (2008)。 実験計画と分析 。第 1巻および第2巻(第2 版)。ワイリー 。ISBN 978-0-470-38551-7 。↑ モンゴメリー、ダグラス(2009)。 実験計画と分析 。ニュージャージー州ホーボーケン:ワイリー 。ISBN 978-0-470-12866-4 。↑ RA Fisher (1925). Statistical Methods for Research Workers 、エジンバラ: Oliver and Boyd、1925、p.43。 ↑ Nuzzo, Regina (2014). "科学的方法: 統計的誤差" . Nature . 506 (7487): 150– 152. Bibcode : 2014Natur.506..150N . doi : 10.1038/506150a . hdl : 11573/685222 . PMID 24522584 . ↑ リチャード・J・ラーセン、ドナ・フォックス・ストループ(1976)。 『実世界の統計学:事例集』 マクミラン 。ISBN 978-0023677205 。↑ Hubbard, R.; Parsa, AR; Luthy, MR (1997). "心理学における統計的有意性検定の普及:応用心理学ジャーナルの事例". Theory and Psychology . 7 (4): 545–554 . doi : 10.1177/0959354397074006 . S2CID 145576828 . ↑ ムーア、デイビッド (2003). 統計学の実践入門 . ニューヨーク: WH フリーマン社. p. 426. ISBN 9780716796572 。↑ Ranganathan, Priya; Pramesh, C. S; Buyse, Marc (2016 年 4 月~6 月). "統計分析におけるよくある落とし穴: 多重検定の危険性" . Perspect Clin Res . 7 (2): 106– 107. doi : 10.4103/2229-3485.179436 . PMC 4840791. PMID 27141478 . ↑ Hall, P. および Wilson, SR、1991年。ブートストラップ仮説検定のための2つのガイドライン。Biometrics、pp.757-762。 ↑ Tibshirani, RJ および Efron, B.、1993 年。ブートストラップ入門。統計学および応用確率論に関するモノグラフ、57(1)。 ↑ Martin, MA, 2007. Bootstrap hypothesis testing for some common statistical problems: A critical evaluation of size and power properties. Computational Statistics & Data Analysis, 51(12), pp.6321-6342. ↑ Horowitz, JL, 2019. Bootstrap methods in econometrics. Annual Review of Economics, 11, pp.193-224. 私は ↑ ジョン・ アーバスノット (1710)。 「男女の出生に見られる一定の規則性から導かれる神の摂理の論証」 ( PDF ) 。 ロンドン 王立協会の哲学的トランザクション 。27 ( 325–336 ): 186–190。doi : 10.1098 /rstl.1710.0011。S2CID 186209819 。 ↑ Brian, Éric; Jaisson, Marie (2007). "Physico-Theology and Mathematics (1710–1794)". The Descent of Human Sex Ratio at Birth . Springer Science & Business Media. pp. 1 –25. ISBN 978-1-4020-6036-6 。↑ Conover, WJ (1999)、「第3.4章:符号検定」、 実践ノンパラメトリック統計学 (第3 版)、Wiley、pp. 157–176 、 ISBN 978-0-471-16068-7 ↑ スプレント、P. (1989)、 応用ノンパラメトリック統計手法 (第2 版)、チャップマン&ホール、 ISBN 978-0-412-44980-2 ↑ スティグラー、スティーブン・M. (1986). 『統計の歴史:1900年以前の不確実性の測定』 ハーバード大学出版局、 225-226 頁 。ISBN 978-0-67440341-3 。↑ スティグラー、スティーブン・M. (1986). 『統計学の歴史:1900年以前の不確実性の測定』 ケンブリッジ、マサチューセッツ州:ハーバード大学出版局ベルナップ・プレス、 134 ページ 。ISBN 978-0-674-40340-6 。↑ フィッシャー卿、ロナルド・A. (2000) [1935]. 「お茶を味わう淑女の数学」 . ジェームズ・ロイ・ニューマン編 『数学の世界』第3巻 [ 実験計画法 ] . クーリエ・ドーバー出版. ISBN 978-0-486-41151-4 。 元々はフィッシャーの著書『実験計画法』 からの引用です。↑ ボックス、ジョーン・フィッシャー(1978)。RAフィッシャー 、 『科学者の生涯』 。ニューヨーク:ワイリー 。p.134。ISBN 978-0-471-09300-8 。↑ Jaynes, ET (2007). 確率論 :科学の論理 (第5版 )。ケンブリッジ:ケンブリッジ大学出版局 。ISBN 978-0-521-59271-0 。↑ Corneliussen, Steven T. (2015-11-24). 「どの科学者が11歳の子どもに炎、時間、睡眠、色、音をうまく説明できるか?」 Physics Today (11) 11792. Bibcode : 2015PhT..2015k1792C . doi : 10.1063/pt.5.8150 . ISSN 1945-0699 . ↑ Wasserstein, Ronald L.; Lazar, Nicole A. (2016-04-02). "p値に関するASA声明:背景、プロセス、および目的" . The American Statistician . 70 (2): 129– 133. doi : 10.1080/00031305.2016.1154108 . ISSN 0003-1305 . S2CID 124084622 . ↑ Schervish, M (1996)統計理論 、p. 218. スプリンガーISBN 0-387-94546-6 ↑ ケイ、デイビッド H.、フリードマン、デイビッド A. (2011). 「統計学参考ガイド」 . 科学的証拠に関する参考マニュアル (第3 版). イーガン、ミネソタ州; ワシントン DC: ウェスト・ナショナル・アカデミーズ・プレス. p. 259. ISBN 978-0-309-21421-6 。↑ アッシュ、ロバート(1970)。 基礎確率論 。ニューヨーク:ワイリー 。ISBN 978-0471034506 。 第8.2節1 2 Tukey, John W. (1960). "結論と決定". Technometrics . 26 (4): 423– 433. doi : 10.1080/00401706.1960.10489909 . 「仮説検証の手順を精査し、ネイマン・ピアソンの決定要素とフィッシャーの結論要素を分離するまでは、異質な要素が密接に混在していることが、絶えず混乱の原因となるだろう。」…「『最善を尽くす』ことと『確実なことだけを述べる』ことの両方に意義があるが、それぞれの事例において、どちらが行われているのか、そしてどちらを行うべきなのかを知ることが重要である。」↑ スティグラー、スティーブン M. (1996 年 8 月) 「1933 年の統計の歴史」 . 統計科学 . 11 (3): 244– 252. doi : 10.1214/ss/1032280216 . JSTOR 2246117 . ↑ Berger, James O. (2003). "Could Fisher, Jeffreys and Neyman Have Agreed on Testing?" . Statistical Science . 18 (1): 1– 32. Bibcode : 2003StaSc..1897485B . doi : 10.1214/ss/1056397485 . ↑ Cornfield, Jerome (1976). "臨床試験への最近の方法論的貢献" (PDF) . American Journal of Epidemiology . 104 (4): 408– 421. doi : 10.1093/oxfordjournals.aje.a112313 . PMID 788503 . ↑ Yates, Frank (1951). 「研究者のための統計的手法が統計学の発展に及ぼす影響」. アメリカ統計学会誌 . 46 (253): 19– 34. doi : 10.1080/01621459.1951.10500764 . 「[RA Fisherの]『統計的方法』全体を通して形式的な有意性検定が重視されてきたため、科学研究者は、特に実験から得られたデータに対して行う有意性検定の結果に過度に注意を払い、調査対象の効果の大きさの推定値にはほとんど注意を払わなくなってしまった。」…「有意性検定を重視し、各実験の結果を個別に検討してきた結果、科学研究者は実験における有意性検定の実施を究極の目的とみなすことが多くなってしまったという残念な結果が生じている。」↑ Begg, Colin B.; Berlin, Jesse A. (1988). "出版バイアス:医療データの解釈における問題". Journal of the Royal Statistical Society, Series A . 151 (3): 419– 463. doi : 10.2307/2982993 . JSTOR 2982993 . S2CID 121054702 . ↑ Meehl, Paul E. (1967). "心理学と物理学における理論検証:方法論的パラドックス" (PDF) . Philosophy of Science . 34 (2): 103– 115. doi : 10.1086/288135 . S2CID 96422880 . 2013年12月3日に オリジナル (PDF) からアーカイブ済み。 30年後、ミールは統計的有意性理論が数学的に妥当であることを認めつつも、帰無仮説のデフォルト選択に疑問を呈し続け、「問題は認識論であって統計ではない:有意性検定を信頼区間に置き換え、危険な数値予測の精度を定量化する」(ハーロウ(1997)の第14章)の中で、「社会科学者の理論と事実の論理的関係に対する理解不足」を非難した。↑ Bakan, David (1966). "心理学研究における有意性の検定". Psychological Bulletin . 66 (6): 423– 437. doi : 10.1037/h0020412 . PMID 5974619 . ↑ Gigerenzer, G (2004年11月). 「無思慮な統計」. The Journal of Socio-Economics . 33 (5): 587–606 . doi : 10.1016/j.socec.2004.09.033 . hdl : 11858/00-001M-0000-0025-87C0-8 . ↑ Nunnally, Jum (1960). "心理学における統計学の位置". Educational and Psychological Measurement . 20 (4): 641–650 . doi : 10.1177/001316446002000401 . S2CID 144813784 . ↑ Lykken, David T. (1991). 「そもそも心理学の何が問題なのか?」。 心理 学について明確に考える 。1 : 3–39 。 ↑ Jacob Cohen (1994 年 12 月)「地球は丸い (p < .05)」 American Psychologist 49 (12): 997–1003 . doi : 10.1037 /0003-066X.49.12.997 . S2CID 380942 . この論文をきっかけに、米国心理学会(APA)による統計手法の見直しが行われた。コーエン氏は、その見直しを行ったタスクフォースのメンバーであった。↑ クライン、レックス(2004)。 『有意性検定を超えて:行動研究におけるデータ分析手法の改革 』ワシントンDC:アメリカ心理学会 。ISBN 9781591471189 。↑ Branch, Mark (2014). 「帰無仮説有意性検定の悪性副作用」 Theory & Psychology . 24 (2): 256– 277. doi : 10.1177/0959354314525282 . S2CID 40712136 . ↑ Hunter, John E. (1997年1月). 「必要: 有意性検定の禁止」. Psychological Science . 8 (1): 3–7 . doi : 10.1111/j.1467-9280.1997.tb00534.x . S2CID 145422959 . ↑ Lakens, Daniël (2021). "p値の実際的な代替手段は正しく使用されたp値である" . Perspectives on Psychological Science . 16 (3): 639– 648. doi : 10.1177/1745691620958012 . PMC 8114329 . S2CID 231863811 . 1 2 Wilkinson, Leland (1999). "心理学ジャーナルにおける統計的方法; ガイドラインと説明". American Psychologist . 54 (8): 594–604 . Bibcode : 1999AmPsy..54..594W . doi : 10.1037/0003-066X.54.8.594 . S2CID 428023 . 「仮説検定。実際のp値を報告するよりも、二者択一の採択・棄却の決定の方が優れている状況は想像しがたい。あるいは、信頼区間を報告する方がさらに良いだろう。」(p 599)。委員会は、心理学の報告における仮説検定の禁止に反対する決定を説明する際に、「寛容」という注意喚起の用語を用いた。(p 603)↑ 「ICMJE:否定的な研究を掲載する義務」 。 2012年7月16日に オリジナル からアーカイブ 。 2012年 9月3日 に取得。 編集者は、主要な結果またはその他の結果が統計的に有意であるかどうかにかかわらず、読者に関連する重要な問題に関する綿密に実施された研究については、掲載を真剣に検討すべきである。統計的有意性の欠如を理由に研究結果を提出または掲載しないことは、出版バイアスの重要な原因である。 ↑ 帰無仮説を支持する論文集 ウェブサイト: JASNHホームページ。第1巻第1号は2002年に発行され、掲載されている論文はすべて心理学関連のテーマに関するものです。↑ ハウエル、デイビッド(2002)。 心理学のための統計的方法 (第5 版)。ダックスベリー 。94 ページ 。ISBN 978-0-534-37770-0 。↑ Williams, S.; Carson, R.; Tóth, K. (2023年10月10日). 「The Journal of PhysiologyにおけるP値を超えて:効果量と信頼区間の価値に関する入門」 . J Physiol . 601 (23): 5131–5133 . doi : 10.1113 / JP285575 . PMID 37815959. S2CID 263827430 . ↑ P値は確率変数である Duncan J. Murdoch、Yu-Ling Tsai、James Adcock、「The American Statistician」、2008年、 https://www.jstor.org/stable/27644033 ↑ Boos, Dennis D; Stefanski, Leonard A (2011). "P値の精度と再現性" . The American Statistician . 65 (4): 213– 221. doi : 10.1198/tas.2011.10129 . PMC 3370685 . PMID 22690019 . ↑ Ho, Joses; Tumkaya, Tayfun; Aryal, Sameer; Choi, Hyungwon; Claridge-Chang, Adam (2019年6月19日). "P値を超えて:推定グラフィックスによるデータ分析" . Nature Methods . 16 (7): 565– 566. doi : 10.1038/s41592-019-0470-3 . ISSN 1548-7091 . PMID 31217592 . 1 2 Kruschke, JK (2012年7月9日). 「ベイズ推定がT検定に取って代わる」 (PDF) . Journal of Experimental Psychology: General . 142 (2): 573– 603. doi : 10.1037/a0029146 . PMID 22774788 . S2CID 5610231 . 1 2 Kruschke, JK (2018 年 5 月 8 日). 「ベイズ推定におけるパラメータ値の拒否または受容」 (PDF) . Advances in Methods and Practices in Psychological Science . 1 (2): 270– 280. doi : 10.1177/2515245918771304 . S2CID 125788648 . ↑ Armstrong, J. Scott (2007). "有意性検定は予測の進歩を阻害する" . International Journal of Forecasting . 23 (2): 321– 327. CiteSeerX 10.1.1.343.9516 . doi : 10.1016/j.ijforecast.2007.03.004 . S2CID 1550979 . ↑ Kass, RE (1993). ベイズ因子とモデルの不確実性 (PDF) (レポート). ワシントン大学統計学部. ↑ Rozeboom, William W (1960). "The fallacy of the null-hypothesis significance test" (PDF) . Psychological Bulletin . 57 (5): 416– 428. CiteSeerX 10.1.1.398.9002 . doi : 10.1037/h0042040 . PMID 13744252 . 「…統計学を科学的推論に適切に適用するには、逆確率(別名ベイズ確率)を徹底的に検討することが不可欠である…」 事前確率分布は「少なくとも近い将来においては、人によって異なる主観的な感覚としてしか利用できない」ことが残念に思われた。↑ Berger, James (2006). "客観的ベイズ分析の事例" . ベイズ分析 . 1 (3): 385– 402. doi : 10.1214/06-ba115 . 「客観的」ベイズ分析の様々な定義を列挙する中で、「統計学(ひいては科学)の主要な目標は、データから学ぶための完全に首尾一貫した客観的ベイズ的方法論を見つけることである」と述べられている。しかし著者は、この目標は「達成不可能」であるとの見解を示している。↑ Aldrich, J (2008). "RA Fisher on Bayes and Bayes' theorem" . Bayesian Analysis . 3 (1): 161– 170. doi : 10.1214/08-BA306 .
さらに読む Lehmann EL (1992)「NeymanとPearson (1933)『統計的仮説検定の最も効率的な問題について』への序論」。『統計学のブレークスルー』第1巻(Kotz , S.、Johnson, NL編)、Springer-Verlag。ISBN 0-387-94037-5 (その後、論文の再掲載が行われた) ネイマン、J.、ピアソン、ES(1933)。「統計的仮説 の最も効率的な検定 の 問題について」。Philosophical Transactions of the Royal Society A。231 (694–706 ) :289–337。Bibcode :1933RSPTA.231..289N。doi:10.1098/rsta.1933.0009 。
外部リンク 「統計的仮説、検証」、数学百科事典 、EMS Press 、2001 [1994] 古典的な仮説検定に対するベイズ的批判 統計学者の長年の懸念を浮き彫りにする、古典的な仮説検定に対する批判 統計検定の概要:適切な統計検定の選び方 生物学的知識発見における統計分析に基づく仮説検定法;Md. Naseef-Ur-Rahman Chowdhury、Suvankar Paul、Kazi Zakia Sultana
オンライン計算機 p値と仮説検定の計算ツールをいくつかご紹介します。