素粒子物理学において、CL [1]はモデルパラメータに上限(除外限界[2]とも呼ばれる)を設定する統計的手法であり、負でない値のみを取ることができるパラメータに使用される区間推定の特定の形式である。CLは信頼水準を指すと言われているが、「この手法の名前は誤解を招くもので、CLの除外領域は信頼区間ではない」。[3]これは、 CERNのLEP実験に携わる物理学者によって初めて導入され、それ以来多くの高エネルギー物理学実験で使用されている。これは、限界の特性が誤差確率によって定義されるという意味で頻度主義的手法であるが、区間の規定された信頼水準がそのカバレッジ確率と等しくないという点で標準信頼区間とは異なる。この偏差の理由は、最も強力なテストに基づく標準の上限は、パラメータ値がゼロの場合に一定の確率で空の区間を必然的に生成し、この特性はほとんどの物理学者や統計学者によって望ましくないと見なされるためである。[4]
CLs法で導出される上限には常にパラメータのゼロ値が含まれるため、この時点でのカバレッジ確率は常に100%になります。CLsの定義は、統計的推論の正確な理論的枠組みから導かれるものではないため、アドホックと説明されることもあります。しかし、統計学者アラン・バーンバウム が提唱した統計的証拠の概念[5]と非常によく似ています。
意味
X を、負でない実パラメータを持つ確率分布からのランダムサンプルとします。信頼水準 を持つパラメータθのCL上限は、次の特性を持つ 統計量 (つまり、観測可能なランダム変数)です。
不等式は、Xの分布が離散的で、等式を正確に達成できない場合を説明するために定義で使用されます。X の分布が連続的である場合は、これを等式に置き換える必要があります。定義では、被覆確率 が常に より大きいことを意味していることに注意してください。
対立仮説に対する帰無仮説の仮説検定を考えることによって、同等の定義を行うことができます。すると、( 1 )の分子は、で評価されると、検定のタイプIの誤り確率( )(すなわち、の場合に棄却される)に相当し、分母はのべき乗( )に相当する。したがって、棄却基準は、比がより小さくなることを必要とする。これは、 が真の場合に対立仮説が真のときよりもXのような極端な結果が観測される可能性が低いため、 が除外されると直感的に解釈できます。
上限の計算は通常、検定統計量 を構築し、その 値を見つけることによって行われます。
実験の観測結果は どこですか。
高エネルギー物理学における使用
CLs 法に基づく上限値は、LEP、テバトロン、LHCなどの粒子加速器実験で得られた実験結果の多数の出版物で使用されており、最も有名なのは新粒子の探索です。
起源
CL の元々の動機は、物理学者 G. Zech [6]がイベント計数実験のために提案した条件付き確率計算に基づいています。実験が、それぞれ速度とを持つポアソン分布で記述される信号プロセスと背景プロセスから生じるイベントを測定することから成り立っているとします。つまり、 です。は既知であり、 は実験によって推定されるパラメータであると仮定します。与えられた実験結果に上限を設定するための標準的な手順は、の値を除外することで、これにより少なくともカバレッジが保証されます。たとえば、およびイベントが観測される場合を考えてみましょう。すると、 は95% の信頼水準で除外されることがわかります。しかし、これは が除外されること、つまり のすべての可能な値が除外されることを意味します。このような結果は解釈が困難です。なぜなら、実験では の非常に小さな値を背景のみの仮説と本質的に区別できないため、そのような小さな値が除外されると宣言することは(背景のみの仮説を支持して)不適切と思われます。この困難を克服するために、Zech は の確率を という観測値に条件付けることを提案しました。ここで は(測定不可能な)背景イベントの数です。この背後にある理由は、が小さいときの方が が大きいときよりも手順によってエラー(つまり、真の値をカバーしない区間)が発生する可能性が高く、 の分布自体が に依存しないからです。つまり、全体的なエラー確率ではなく、サンプル内の背景イベントの数に関する知識に基づいて条件付き確率を報告する必要があります。この条件付き確率は
これは、上記の CL の定義に対応します。最初の等式は、条件付き確率の定義を使用しているだけであり、2 番目の等式は、 の場合、およびバックグラウンド イベントの数は定義により信号強度に依存しないという事実から来ています。
条件付き議論の一般化
ゼックの条件付き議論は、一般の場合に形式的に拡張することができる。信頼区間が導かれる 検定統計量であると仮定し、
ここで は実験で観測された結果である。 は測定不可能な( は未知なので)ランダム変数とみなすことができ、その分布は とは無関係に 0 から 1 の間で一様である。検定が不偏であれば、結果は次のことを意味する。
そこから、前の場合 と同様に、次の式が得られる。
基本原則との関係
上記の議論は、補助的な統計量の存在を必要としない、より一般化された条件付きの概念を表現しているものの、統計的推論の条件付き原理の精神に従っていると見なすことができます。しかし、条件付き原理は、元のより制限されたバージョンでも、正式には尤度原理を意味しており、これはバーンバウムによって有名に示された結果です。[7] CLは尤度原理に従わないため、このような考慮事項は妥当性を示唆するためにのみ使用できますが、基礎的な観点からの理論的完全性を示すことはできません。(ただし、条件付き原理が必要であると見なされる場合は、どの頻度主義的方法についても同じことが言えます)。
バーンバウム自身は 1962 年の論文で、CL 比は単独で使用するのではなく、有意性検定によって提供される統計的証拠の強さの尺度として使用すべきであると示唆しました。これは、尤度原理の単純な適用から導き出されたものです。実験の結果が「承認」/「拒否」の決定の形でのみ報告される場合、全体的な手順は、 、および の確率で 2 つの可能な結果のみを持つ実験と同等です。したがって、結果「拒否」に関連付けられた尤度比はであり、したがって、この結果の証拠の解釈を決定する必要があります。(2 つの単純な仮説の検定の場合、尤度比は尤度関数のコンパクトな表現であるため)。一方、尤度原理に一貫して従う場合は、元の結果の尤度比を使用し、 を使用しないでください。そのため、このような解釈の根拠は疑わしいものになります。バーンバウムは後に、これは「証拠の解釈にはせいぜい経験的価値しかなく、実質的な価値はない」と述べました。
同様の結論に至るより直接的なアプローチは、バーンバウムの信頼原理の定式化に見出すことができる。これは、より一般的なバージョンとは異なり、両方の種類のエラー確率を参照している。これは次のように述べられている。[8]
「統計的証拠の概念は、が真実である場合には低い確率で「賛成または反対の強力な証拠」が見つかり、が真実である場合にははるかに高い確率で「反対の強力な証拠」が見つからない限り、もっともらしいものではありません。」
このような信頼度の定義は、CL の定義によって自然に満たされるように見えます。この信頼度原理と、より一般的な (ネイマン-ピアソン理論に関連する) 信頼度原理の両方のバージョンは尤度原理と互換性がないため、信頼区間の条件付き特性を考慮することによって生じる問題に対する真に完全な解決策と見なすことができる頻度主義的方法はないというのは事実です。
大規模サンプル限界での計算
特定の規則性条件が満たされると、一般的な尤度関数は、大規模サンプルの限界においてガウス関数となる。そのような場合、信頼水準におけるCLの上限(一様最も強力な検定から導出される)は、 [9]で与えられる。
ここで、は標準正規累積分布、は最大尤度推定値、は標準偏差です。後者は、フィッシャー情報行列の逆行列から推定するか、「アシモフ」 [9]データセットを使用して推定できます。この結果は、に対して一様事前分布が使用されている場合、ベイズ信頼区間と同等になります。
参考文献
- ^ Read, AL (2002). 「検索結果の提示:CL(s) テクニック」Journal of Physics G: Nuclear and Particle Physics . 28 (10): 2693– 2704. Bibcode :2002JPhG...28.2693R. doi :10.1088/0954-3899/28/10/313.
- ^ ミハイル・ロモノーソフ生誕300周年記念の素粒子物理学、13ページ、Googleブックス
- ^ Amnon Harel. 「CMS 検索における統計的手法」(PDF) . indico.cern.ch . 2015 年 4 月 10 日閲覧。
- ^ Mark Mandelkern (2002). 「境界パラメータの信頼区間の設定」.統計科学. 17 (2): 149– 159. doi : 10.1214/ss/1030550859 . JSTOR 3182816.
- ^ Ronald N. Giere (1977). 「Allan Birnbaumの統計的証拠の概念」. Synthese . 36 (1): 5– 13. doi :10.1007/bf00485688. S2CID 46973213.
- ^ G. Zech (1989). 「バックグラウンドまたは測定誤差のある実験における上限値」(PDF) . Nucl. Instrum. Methods Phys. Res. A . 277 ( 2– 3): 608– 610. Bibcode :1989NIMPA.277..608Z. doi :10.1016/0168-9002(89)90795-X.
- ^ バーンバウム、アラン( 1962年) 。「統計的推論の基礎について」アメリカ統計学会誌。57 (298):269-326。doi:10.2307/2281640。JSTOR 2281640。MR 0138176 。 (議論あり)
- ^ バーンバウム、アラン( 1977年)。「ネイマン=ピアソン理論の意思決定理論および推論理論としての解釈、およびベイズ理論に対するリンドレー=サベージの議論に対する批判」。シンセシス。36 (1):19–49。doi:10.1007/bf00485690。S2CID 35027844。
- ^ ab G. Cowan; K. Cranmer; E. Gross; O. Vitells (2011). 「新しい物理学の尤度ベーステストのための漸近公式」. Eur. Phys. J. C. 71 ( 2): 1554. arXiv : 1007.1727 . Bibcode :2011EPJC...71.1554C. doi :10.1140/epjc/s10052-011-1554-0.
さらに読む
- Leon Jay Gleser (2002). 「[境界パラメータの信頼区間の設定]: コメント」.統計科学. 17 (2): 161– 163. doi : 10.1214/ss/1030550859 . JSTOR 3182818.
- Fraser, DAS; Reid N.; Wong, ACM (2004). 「制限付きパラメータの推論」. Phys. Rev. D . 69 (3): 033002. arXiv : physics/0303111 . doi :10.1103/PhysRevD.69.033002. S2CID 18947032.
- Robert D. Cousins (2011)。「有界物理パラメータに対する最も強力な片側上限信頼限界によって誘導される負に偏った関連サブセット」。arXiv : 1109.2023 [physics.data-an]。
外部リンク
- 粒子データグループ(PDG)による統計手法のレビュー
