統計的仮説検定では、e 値は帰無仮説(たとえば、「コインは公平である」、または医学的文脈では「この新しい治療法は効果がない」)に対するデータ内の証拠を定量化します。e 値はp 値のより堅牢な代替手段として機能し、p 値のいくつかの欠点に対処します。
p 値とは対照的に、e 値は任意の継続を扱うことができます。つまり、後続の実験 (たとえば、同じ治療に関する臨床試験) の e 値を単純に掛け合わせることで、共同実験の証拠を表す新しい「積」の e 値を得ることができます。これは、実際によくあることですが、後の実験を実行する決定が、以前の実験で観察されたデータに漠然とした未知の方法で依存し、何回の試験が行われるかが事前にわからない場合でも機能します。積の e 値は意味のある量のままであり、タイプ I のエラー制御によるテストにつながります。このため、e 値とその連続的な拡張であるe プロセスは、いつでも有効な統計手法 (たとえば、信頼シーケンス) の基本的な構成要素です。p 値に対するもう 1 つの利点は、個々の e 値が任意に依存している場合でも、e 値の加重平均は e 値のままであることです。これが、e 値が多重検定でも役立つツールであることが判明した理由の 1 つです。[1]
E値は、さまざまな方法で解釈できます。まず、e値は、それらを統合しやすくするより適切なスケールで提示されたテストの再スケーリングとして解釈できます。[2] 2番目に、e値の逆数はp値ですが、単なるp値ではありません。特別なp値であり、「レベルp」での拒否によって一般化されたタイプIエラーの保証が保持されます。 [ 3] 3番目に、e値は尤度比の広範な一般化であり 、ベイズ係数とも関連していますが、ベイズ係数とは異なります。4番目に、e値は賭けとして解釈できます。5番目に、シーケンシャルなコンテキストでは、非負のスーパーマルチンゲールの増分として解釈することもできます。 2019年に「e値」という用語が造られ、いくつかの研究グループによって画期的な結果がいくつか達成されて以来、e値への関心が爆発的に高まっています。最初の概要記事は2023年に公開されました。[4]
定義と数学的背景
帰無仮説を データ の分布の集合として与えます。通常、それぞれに1 つの結果と固定サンプル サイズまたは停止時間があります。統計実験の結果の完全なシーケンスを表すこのような を、結果のサンプルまたはバッチと呼びます 。ただし、場合によっては、順序付けられていない結果のバッグまたは単一の結果になることもあります。
e変数またはe統計量は、すべての条件下で期待値が1に制限される 非負のランダム変数です。
。
e 変数が取る値はe 値と呼ばれます。実際には、e 値(数値) という用語は、基礎となる e 変数 (ランダム変数、つまりデータの測定可能な関数) を指すときによく使用されます。
解釈
テストの継続的な解釈として
帰無仮説の検定は、伝統的にデータから への関数としてモデル化される。検定がレベルに対して有効であるとは、次の場合 である。
これは、データから次の式を満たす 関数として簡単にまとめられる。
。
さらに、これは、検定がの値を取るようにすることで外部ランダム化を許可するように一般化されることがあります。ここで、その値は、その後に仮説を棄却する確率として解釈されます。
この方法でテストをモデル化する場合の問題は、従来の決定空間または では、テストが拒否するレベルがエンコードされないことです。これは奇妙です。なぜなら、レベル 1% での拒否は、レベル 10% での拒否よりもはるかに強い主張だからです。より適切な決定空間は のようです。
e 値は、この問題を解決するものとして解釈できます。実際、テストをレベルごとに再スケールすることで、 から、から に再スケールできます。
、
ここで、混乱を避けるために、この証拠尺度でのテストを と表記する。このようなテストは、
。
つまり、e 値であれば有効です。
実際、これは、e値が再スケールされたランダム化テストであり、仮説に反する証拠として継続的に解釈されることを示しています。 で値を取る標準e値は、レベル0テストの一般化として表示されます。[2]
この解釈は、e値がテストの基本であることを示しています。e値はテストと同等であり、再スケーリングによって薄く覆い隠されています。この観点から、典型的なe値が従来のテストと非常に異なって見えるのは驚くべきことです。客観的な
対立仮説の場合は、従来のネイマン・ピアソン形式の検定が行われます。実際、これにより、その場合の確率が最大化されます。
しかし、テストの値を仮説に反する証拠として継続的に解釈する場合、次のようなさまざまな目標を最大化することにも興味があるかもしれません。
。
これにより、従来のネイマン・ピアソン検定とは著しく異なる検定が得られ、確率1で正となるため、乗算によって統合するとより適したものになります。この観点から、従来の検定と比較したe値の主な革新性は、異なる検出力ターゲットを最大化することである。[2]
より強いデータ依存レベルのタイプIエラー保証を持つp値として
任意のe変数 と任意のすべてのに対して、
。
これは、 が有効な p 値であることを意味します。さらに、の場合は 棄却される有意水準の e 値ベースのテストには、によって制限されるタイプ I エラーがあります。ただし、標準の p 値の場合、上記の不等式 (*) は通常、等式 (連続値データの場合) またはほぼ等式 (離散データの場合) であるのに対し、e 変数の場合はそうではありません。このため、e 値ベースのテストは、標準の p 値に基づくテストよりも保守的 (検出力が低い) になります。
この保守性と引き換えに、p値はより強い保証を伴う。特に、データに依存する可能性のあるすべての有意水準について、
のときのみ成り立ちます。つまり、p値がこの保証を満たすのは、それがe変数の逆数である場合のみです。[3]
この保証の解釈は、平均すると、データ依存レベルの使用によって生じる相対的なタイプ I エラーの歪みが、データ依存有意レベルの選択ごとに制御されるということです。従来の p 値は、データ非依存レベルまたは事前に指定されたレベルに対してのみこの保証を満たします。
このより強い保証は、データを観察した後に有意水準を選択できるため、事後タイプ I 誤りとも呼ばれます。この保証を満たす p 値は、事後 p 値とも呼ばれます。が何らかの e 値に対して である場合に限り、事後 p 値であるため、これを e 値の別の定義と見なすことができます。
この事後的タイプIエラーの下では、有意水準を選択する問題は消え去ります。事後的p値に等しく設定することで、仮説を棄却する最小のデータ依存水準を選択するだけで済みます。実際、このデータ依存水準では、
は e 変数であるためです。結果として、レベル を真に棄却しても、事後的なタイプ I の誤りの保証は保持されます。従来の p 値 の場合、レベル p で棄却しても、そのような保証はありません。
さらに、事後 p 値は e 値のオプションの継続およびマージ プロパティを継承します。ただし、算術加重平均ではなく、事後 p 値の 加重調和平均は依然として事後 p 値です。
尤度比の一般化として
を単純な帰無仮説とする。を 上の任意の分布とし、
を尤度比とします。すると、 はe 変数になります。逆に、単純な帰無仮説に関連する e 変数は、何らかの分布に関する尤度比として記述できます。したがって、帰無仮説が単純な場合、e 変数は尤度比と一致します。ただし、e 変数は一般的な複合帰無仮説に対しても存在し、尤度比の一般化として考えることができます。e 変数を構築する 2 つの主な方法、UI と RIPr (以下を参照) はどちらも尤度比のバリエーションである式につながります。
尤度比の他の 2 つの標準的な一般化は、(a)標準的な古典的な尤度比検定で使用される一般化尤度比と (b)ベイズ因子です。重要なのは、(a) も (b) も一般に e 変数ではないということです。(a) の意味での一般化尤度比は、対立仮説が単純でない限り e 変数ではありません (「普遍的推論」の項を参照)。ベイズ因子は、帰無仮説が単純な場合 e 変数です。これを確認するには、 が統計モデルを表し、上の事前密度が である場合、上記のように、密度が であるベイズ周辺分布 として 設定できることに注目してください。
は、対のベイズ因子でもあります。帰無仮説が複合的な場合、いくつかの特殊なe変数は、いくつかの非常に特殊な事前分布を持つベイズ因子として記述できますが、実際に遭遇するベイズ因子のほとんどはe変数ではなく、実際に遭遇する多くのe変数はベイズ因子ではありません。[4]
賭けとして
1 通貨単位で、負でないペイオフ のチケットを購入できるとします。「は e 変数である」と「帰無仮説が真であれば、この賭けに参加してもお金を得ることは期待できない」という文は、論理的に同等です。これは、 がe 変数であるということは、チケットを購入することで期待される利益がペイオフからコストを差し引いたもの、つまり であり 、期待値 を持つことを意味するためです。この解釈に基づくと、一連のテストの積 e 値は、個々の e 変数によって与えられるペイオフで順番に賭け、常にすべての利益を再投資することで得た金額として解釈できます。[5]
賭けの解釈は、e 変数を と書き直すと特に明らかになります。ここで、 は すべて の の下 で期待値を持ち 、 は となるように選択されます。 任意の e 変数は の形式で記述できます が、パラメトリックなヌルの場合は、尤度比として記述する方が通常は数学的に便利です。 一方、形式は、ノンパラメトリックな設定では多くの場合より便利です。プロトタイプの例として、[6]では、 が境界区間 内の値を取る場合を考えます 。 によると、 は平均 の分布に従って iid です。 について他の仮定は行われません。次に、任意の に対して、単一の結果 の e 変数の族 を構築します(これらは の であり、 は非負であることが保証されています)。次に、の積を取ることで、 完全なデータ ベクトルの新しい e 変数を定義できます。
、
ここで、は過去のデータのみに基づいたの推定値であり、 「e-power」または「GRO」の意味で可能な限り大きくなるように設計されています(下記参照)。Waudby-SmithとRamdasはこのアプローチを使用して、チェルノフ、ホエフディング、バーンスタイン境界などのより古典的な方法に基づくものよりも大幅に狭くなる傾向がある平均の「ノンパラメトリック」信頼区間を構築します。[6]
基本的な特性: オプションの継続
同じ帰無仮説を異なるデータや実験設定で追跡テストすることが予想される場合、E値はp値よりも適しています。これには、たとえば、メタ分析で個々の結果を組み合わせることが含まれます。この設定でのe値の利点は、オプションで継続できることです。実際、それらは、明示的なタイプIエラー制御を備えた世界初の完全な「オンライン」メタ分析で採用されています。[7]
非公式には、任意継続は、独立したサンプル で定義された 任意の数の e 値の積 が、各 e 値の定義が以前のすべての結果に依存することが許可されている場合でも、また新しいサンプルの収集を停止するタイミングを決定するためにどのようなルールが使用されている場合でも (新しい試行を実行するなど)、それ自体が e 値であることを意味します。したがって、任意の有意水準 について 、帰無仮説が真である場合、e 値の積が よりも大きくなる確率はによって制限されます。したがって、これまでに観察されたサンプルを組み合わせて、積 e 値が よりも大きい場合に帰無仮説を棄却することにした場合、タイプ I の誤りの確率は によって制限されたままになります。e 値に基づく検定は、任意継続 の下で安全 (タイプ I 有効) であると言えます。
数学的には、まず、積 e 変数が、によって生成されたフィルタリングで非負の離散時間マルチンゲールを形成することを示すことによってこれが示されます (個々の e 変数はこのマルチンゲールの増分です)。結果は、 Doob のオプション停止定理とVille の不等式 の結果として得られます。
上の例では、すでに暗黙的に積 e 変数を使用しており、個々の結果に対して e 変数を定義し、結果を取得して新しい e 値を設計しました。したがって、この例では、個々の結果が上記の「バッチ」(完全なサンプル)の役割を果たしているため 、元のバッチ「内」でオプションの停止を行うこともできます。つまり、任意の個々の結果(「結果のバッチ」だけでなく)で、どのような理由であってもデータ分析を停止し、結果が を超えている場合は拒否することができます。ただし、結果のバッチに対して定義されたすべての e 変数を、この方法で結果ごとの e 値の積として分解できるわけではありません。これが不可能な場合は、オプションの停止(サンプル内)には使用できず、オプションの継続(1 つのサンプルから次のサンプルなど)にのみ使用できます。
構築と最適性
データから独立して設定すると、自明なe 値が得られます。これは定義上 e 変数ですが、帰無仮説を棄却することはできません。この例は、いくつかの e 変数が、以下に定義される意味で他のものよりも優れている可能性があることを示しています。直感的には、良い e 変数とは、対立仮説が正しい場合に大きくなる傾向がある (1 よりはるかに大きい) 変数です。これは p 値の場合と似ています。e 値と p 値はどちらも対立仮説を参照せずに定義できますが、対立仮説が利用可能な場合は、高い確率で小さい (p 値) または大きい (e 値) ことを望みます。標準的な仮説検定では、有効な検定の質は統計的検出力の概念によって形式化されます が、この概念は e 値のコンテキストで適切に修正する必要があります。[4] [8]
与えられた代替案に対するe変数の質の標準的な概念は、この分野のほとんどの著者によって使用され、経済学におけるケリー基準の一般化であり、(古典的な検出力と密接な関係を示すため)e-パワーと呼ばれることもあります。[9]この意味での最適なe変数は、対数最適または成長率最適(多くの場合、GRO [8]と略される)として知られています。単純な代替案の場合、与えられたe変数のe-パワーは単に期待値 として定義されます 。複合代替案の場合、e-パワーとGROにはさまざまなバージョン(たとえば、最悪ケースの絶対値、最悪ケースの相対値)があります[8]。
単純な対立仮説、単純な帰無仮説:尤度比
とを両方とも単純とします。すると尤度比e変数は 上記の意味で最大のe-powerを持ちます。つまり、GROです。[4]
単純な代替、複合ヌル: 逆情報投影 (RIPr)
を単純、を合成とし、 のすべての要素が同じ基礎測度に対する密度(小文字で表記)を持つものとする。Grünwald らは、弱い正則性条件下ではGRO e変数が存在し、本質的に一意であり、次のように与えられることを示している。
ここで、はの 凸包への の 逆情報射影 (RIPr)です。[8]さらなる正則性条件下では (およびこれまでに遭遇したすべての実際的に適切な場合)、 はベイズ周辺密度によって与えられます。つまり、となる 特定の一意の分布が上に 存在します。
単純な代替、複合ヌル: 普遍推論 (UI)
上記と同じ設定で、[10]は、規則性条件が全くない場合、
は e 変数です (データに基づくMLE (最大尤度推定量) が常に明確に定義されている場合、2 番目の等式が成立します)。e 変数を構築するこの方法は、ユニバーサル推論 (UI)法と呼ばれています。「ユニバーサル」とは、規則性条件が必要ないことを意味します。
複合代替、単純ヌル
ここで、 を単純、 を 合成とすると、 のすべての要素は同じ基礎測度に対する密度を持つ。成長最適に近い e 変数を得るための、現在 2 つの一般的で密接に関連した方法がある (合成に対して適切に再定義[4] )。ロビンズの混合法とプラグイン法である。プラグイン法は、もともと Wald [11]によるものであるが、本質的にはPhilip Dawidによって「prequential plug-in」[12]として、またJorma Rissanenによって「predictive MDL」[13]として再発見された。混合法は、本質的には「分子についてベイズ的であること」に相当する (「ベイズ法」と呼ばれないのは、帰無仮説と対立仮説の両方が合成仮説である場合、分子がベイズ周辺分布ではないことが多いためである)。 に任意の事前分布を仮定し、を設定する。
e変数を使用します。
プラグイン法を説明するために、が 確率過程を構成し、 のデータに基づく の推定量を と 仮定します。実際には、通常は「平滑化された」最大尤度推定量(リッジ回帰の回帰係数など)が使用され、最初は何らかの「デフォルト値」 に設定されます。ここで、 を設定すること により、 の密度を再帰的に構築します 。
実際には、混合法とプラグイン法はどちらも、データをうまく説明する代替案の特定のインスタンス化を学習するものと考えることができます。 [4]
複合ヌルと代替
パラメトリック設定では、複合代替の主な方法( またはを取得する)と複合帰無の主な方法(UIまたはRIPr、代替として単一分布 または を使用する)を単純に組み合わせることができます。特に、プラグインメソッドをUIメソッドと一緒に使用すると、結果のe変数は次のようになります。
これは、古典的な尤度比検定で使用される一般化尤度比に似ていますが、根本的に異なります。
RIPr と比較した UI 法の利点は、(a) MLE を効率的に計算できる場合はいつでも適用できることです。多くの場合、逆情報射影を計算できるかどうか、またどのように計算できるかは不明です。(b) e 変数だけでなく完全な e プロセスも「自動的に」得られることです (下記参照)。上記の式で を一般的な停止時間 に置き換えても、結果の比率は依然として e 変数です。逆情報射影の場合、この自動 e プロセス生成は特殊な場合にのみ適用されます。
RIPrと比較した主な欠点は、e-power/GRO基準の点で大幅に最適ではない可能性があることです。つまり、RIPrベースの方法よりも古典的な統計的検出力が低いテストにつながります。したがって、RIPr法が計算上実行可能でeプロセスにつながる設定では、RIPr法が好まれます。これらには、z検定、t検定および対応する線形回帰、ベルヌーイ分布、ガウス分布、ポアソン分布を使用したkサンプル検定、ログランク検定(これらのサブセットについてはRパッケージが利用可能)、およびモデルX仮定の下での条件付き独立性検定が含まれます。[14]ただし、他の多くの統計的検定問題では、逆情報投影の高速実装が存在するかどうかは現在(2023年)不明であり、存在しない可能性もあります(例:モデルX仮定のない一般化線型モデル)。
ノンパラメトリック設定(上記の例のような平均値の検定やノンパラメトリック2サンプル検定など) では、e変数を考慮する方が自然であることが多い。しかし、表面的には尤度比とは非常に異なっているように見えるものの、尤度比として解釈されることも多く、RIPr構築のバージョンを実装していると再解釈されることさえある。[4]
最後に、実際には、数学的または計算的に便利なRIPr、UI、およびその他の方法の組み合わせに頼ることがあります。[4]たとえば、RIPrは小さな結果ブロックの最適なe変数を取得するために適用され、次にこれらを乗算してより大きなサンプルのe変数を取得します。これらのe変数は実際にはうまく機能しますが、もはや最適とは見なされません。
3番目の構築方法: p-to-e (およびe-to-p) キャリブレーション
p値をe値に変換する関数が存在する。[15] [16] [17]このような関数はp-to-eキャリブレータと呼ばれる。正式には、キャリブレータは非負の減少関数であり、p変数(値がp値であるランダム変数)に適用されるとe変数を生成する。の場合、キャリブレータは別のキャリブレータを支配すると言われ、不等式が厳密であればこの支配は厳密である。許容されるキャリブレータとは、他のどのキャリブレータにも厳密に支配されないキャリブレータである。関数がキャリブレータであるためには、一様確率測度にわたって最大でも1の積分を持つ必要があることが示される。
許容されるキャリブレータの 1 つのファミリは、を持つ関数の集合によって与えられます 。別のキャリブレータは、 を積分することによって与えられます。
逆に、e-to-p キャリブレータは e 値を p 変数に戻します。興味深いことに、次のキャリブレータは他のすべての e-to-p キャリブレータよりも優れています。
- 。
理論的には重要であるが、結果として得られるe変数は与えられた値に対して成長最適値からは程遠いことが多いため、キャリブレーションはe変数の実際の設計ではあまり使用されない。[8]
Eプロセス
意味
ここで、離散時間確率過程を構成する、連続して到着するデータについて考えます。を別の離散時間過程とします。ここで、 はそれぞれに対して最初の結果の (測定可能な) 関数として記述できます。任意の に対して停止時間が e 変数である場合、つまりすべての に対してである場合、 をe過程と呼びます。
基本的なケースでは、停止時間は、各サンプル サイズ で、これまでに観測されたデータのみに基づいて、データ収集を停止するかどうかを決定する任意のルールによって定義できます。たとえば、「1 より大きい結果が 4 回連続して見られたら停止する」、「 で停止する」、またはレベル-アグレッシブ ルール、「レベル - レベルで拒否できるようになった時点で停止する(つまり、 となる 最小の で停止する)」などです。e プロセスを使用すると、このようなルールを使用して e 変数を取得できます。重要なのは、データ アナリストが停止に使用するルールを知らない可能性があることです。たとえば、上司からデータ収集を停止するように指示されても、その理由を正確には知らない場合があります。それでも、有効な e 変数とタイプ I エラー制御が得られます。これは、p 値に基づくデータ分析 (停止ルールが事前に決定されていない場合は無効になります) や、従来の Wald スタイルの逐次分析(さまざまな長さのデータで機能しますが、停止時間を事前に決定する必要があります) とは対照的です。より複雑なケースでは、停止時間はわずかに減少した濾過に対して相対的に定義される必要があるが、これは実際には大きな制約ではない。特に、レベルアグレッシブルールは常に許可されている。オプションの停止下でのこの有効性のため、eプロセスは信頼区間の基本的な構成要素であり、いつでも有効な信頼区間としても知られている。[18] [4]
技術的には、e プロセスは、開始値が 1 である非負のスーパーマルチンゲールであるテスト スーパーマルチンゲールの一般化です。つまり、任意のテスト スーパーマルチンゲールは e プロセスを構成しますが、その逆は当てはまりません。
工事
Eプロセスはさまざまな方法で構築できます。多くの場合、定義が以前のデータに依存することが許されるe値から始めます。つまり 、
全ての
(また、複雑なテスト問題では、この定義は縮小フィルタリングを使用して少し変更する必要があります)。この場合、 を使用した積プロセスはテスト スーパーマルチンゲールであり、したがって e プロセスでもあります (この構成は、上記の「e 値を賭けとして」で説明した例ですでに使用していることに注意してください。 を固定した場合、e 値は過去のデータに依存しませんでしたが、 を使用することで、e 値は過去のデータに依存するようになりました)。
eプロセスを構築するもう一つの方法は、サンプルサイズに対して上で説明した普遍的推論構成を使用することです。その結果得られるe値のシーケンスは常にeプロセスになります。[4]
歴史
歴史的に、e値は、著名な数学者ハーバート・ロビンズと彼の学生数名による、いつでも有効な信頼区間法に関する先駆的な研究の中で、非負のスーパーマルチンゲールの構成要素として暗黙的に登場しています。[18] e値(またはそれに非常によく似たもの)が独立した関心の量として扱われたのは、1976年に別の著名な数学者レオニード・レビンによるアルゴリズム的ランダム性理論においてが初めてです。先駆者であるV.ヴォフクが様々な協力者と行った様々な論文(例えば[16] [15])での貢献と、全く異なる分野での概念の独立した再発明を除いて、[19]この概念は、わずか数か月以内にいくつかの研究グループによる先駆的な論文がarXivに掲載された2019年までまったく普及しませんでした(以下で参照されている対応するジャーナル出版物は、数年後に公開されることもあります)。これらの論文では、この概念に最終的に適切な名前が付けられました(「S値」[8]と「E値」[17] 。 [8]の論文の後のバージョンでは「E値」も採用されました)。その一般的な特性[17] 、それらを構築する2つの一般的な方法[10]、および賭けとの密接な関係[5]について説明しています)。それ以来、世界中の研究者の関心が高まっています。2023年には、e値が中心的な役割を果たす「安全でいつでも有効な方法」に関する最初の概要論文が登場しました。[4]
参考文献
- ^ Wang, Ruodu; Ramdas, Aaditya (2022-07-01). 「E値によるFalse Discovery Rate Control」. Journal of the Royal Statistical Society Series B: Statistical Methodology . 84 (3): 822– 852. arXiv : 2009.02824 . doi :10.1111/rssb.12489. ISSN 1369-7412.
- ^ abc Koning, Nick W. (2024). 「継続的テスト」. arXiv : 2409.05654 .
- ^ ab Koning, Nick W. (2024). 「事後α仮説検定と事後p値」. arXiv : 2312.08040 .
- ^ abcdefghijk Ramdas, Aaditya; Grünwald, Peter; Vovk, Vladimir; Shafer, Glenn (2023-11-01). 「ゲーム理論的統計と安全でいつでも有効な推論」.統計科学. 38 (4). arXiv : 2210.01948 . doi :10.1214/23-sts894. ISSN 0883-4237.
- ^ ab Shafer, Glenn (2021-04-01). 「賭けによるテスト:統計的および科学的コミュニケーションの戦略」。英国王立統計学会誌シリーズA:社会における統計。184 (2): 407– 431。doi :10.1111/rssa.12647。ISSN 0964-1998 。
- ^ ab Waudby-Smith, Ian; Ramdas, Aaditya (2023-02-16). 「賭けによる制限付きランダム変数の平均推定」。Journal of the Royal Statistical Society Series B: Statistical Methodology . 86 : 1– 27. arXiv : 2010.09686 . doi :10.1093/jrsssb/qkad009. ISSN 1369-7412.
- ^ Ter Schure, JA (Judith); Ly, Alexander; Belin, Lisa; Benn, Christine S.; Bonten, Marc JM; Cirillo, Jeffrey D.; Damen, Johanna AA; Fronteira, Inês; Hendriks, Kelly D. (2022-12-19). 医療従事者のCOVID-19感染と入院を減らすためのカルメット・ゲラン菌ワクチン - ランダム化比較試験からの個々の参加者データのリビングシステマティックレビューと前向きALL-INメタアナリシス(レポート). 感染症(HIV/AIDSを除く). doi :10.1101/2022.12.15.22283474.
- ^ abcdefg グリュンヴァルト、ピーター;デ・ハイデ、リアンヌ。クーレン、ワウター (2024)。 「安全な検査」。王立統計協会ジャーナル、シリーズ B。
- ^ 王秋琦;王、若都。ジーゲル、ヨハンナ (2022)。 「電子バックテスト」。SSRN 電子ジャーナル。土井:10.2139/ssrn.4206997。ISSN 1556-5068。
- ^ ab Wasserman, Larry; Ramdas, Aaditya; Balakrishnan, Sivaraman (2020-07-06). 「普遍推論」. Proceedings of the National Academy of Sciences . 117 (29): 16880– 16890. arXiv : 1912.11436 . Bibcode :2020PNAS..11716880W. doi : 10.1073/pnas.1922664117 . ISSN 0027-8424. PMC 7382245 . PMID 32631986.
- ^ Wald, Abraham (1947). 逐次分析 (セクション 10.10). J. Wiley & sons, Incorporated.
- ^ Dawid, AP (2004-07-15). 「Prequential Analysis」.統計科学百科事典. doi :10.1002/0471667196.ess0335. ISBN 978-0-471-15044-2。
- ^ Rissanen, J. (1984年7月). 「ユニバーサルコーディング、情報、予測、および推定」. IEEE Transactions on Information Theory . 30 (4): 629– 636. doi :10.1109/tit.1984.1056936. ISSN 0018-9448.
- ^ Candès, Emmanuel; Fan, Yingying; Janson, Lucas; Lv, Jinchi (2018-01-08). 「Panning for Gold: 'Model-X' Knockoffs for High Dimensional Controlled Variable Selection」. Journal of the Royal Statistical Society Series B: Statistical Methodology . 80 (3): 551– 577. arXiv : 1610.02351 . doi :10.1111/rssb.12265. ISSN 1369-7412.
- ^ ab Shafer, Glenn; Shen, Alexander; Vereshchagin, Nikolai; Vovk, Vladimir (2011-02-01). 「テストマルチンゲール、ベイズ係数、p値」.統計科学. 26 (1). arXiv : 0912.4269 . doi :10.1214/10-sts347. ISSN 0883-4237.
- ^ ab Vovk, VG (1993年1月). 「確率の論理と統計の基礎への応用」.王立統計学会誌、シリーズB (方法論) . 55 (2): 317– 341. doi :10.1111/j.2517-6161.1993.tb01904.x. ISSN 0035-9246.
- ^ abc Vovk, Vladimir; Wang, Ruodu (2021-06-01). 「E値:キャリブレーション、組み合わせ、およびアプリケーション」。統計年報。49 ( 3)。arXiv : 1912.06116。doi :10.1214 /20-aos2020。ISSN 0090-5364 。
- ^ ab Darling, DA; Robbins, Herbert (1967年7月). 「平均、分散、中央値の信頼系列」. Proceedings of the National Academy of Sciences . 58 (1): 66– 68. Bibcode :1967PNAS...58...66D. doi : 10.1073/pnas.58.1.66 . ISSN 0027-8424. PMC 335597. PMID 16578652 .
- ^ Zhang, Yanbao; Glancy, Scott; Knill, Emanuel (2011-12-22). 「局所的実在論を拒否するための漸近最適データ解析」. Physical Review A. 84 ( 6): 062118. arXiv : 1108.2468 . Bibcode :2011PhRvA..84f2118Z. doi :10.1103/physreva.84.062118. ISSN 1050-2947.
