統計学において、逐次分析または逐次仮説検定とは、サンプルサイズを事前に固定しない統計分析のことである。データは収集され次第評価され、有意な結果が得られた時点で、あらかじめ定義された停止ルールに従ってサンプリングが停止される。そのため、より古典的な仮説検定や推定よりもはるかに早い段階で結論に達することができ、結果として費用や人的コストを削減できる場合がある。
逐次分析法は、第二次世界大戦中にコロンビア大学の統計研究グループに所属していたアブラハム・ウォルド[ 1 ]が、ジェイコブ・ウォルフォウィッツ、W・アレン・ウォリス、 ミルトン・フリードマン[ 2 ] [ 3 ]とともに、より効率的な産業品質管理のためのツールとして初めて考案したとされている。戦争遂行におけるその価値はすぐに認識され、「制限付き」分類を受けることになった[ 4 ]。同時期に、ジョージ・バーナードはイギリスで最適停止法に取り組むグループを率いていた。この方法への初期の貢献は、 KJ・アローがD・ブラックウェル、MA・ギルシックとともに行ったものである[ 5 ]。
同様のアプローチは、ほぼ同時期にアラン・チューリングによって、ブレッチリー・パークで使用されていたバンブリズムス技術の一部として、ドイツのエニグマ暗号機で暗号化された異なるメッセージを関連付けて分析すべきかどうかについての仮説を検証するために、第一原理から独自に開発された。この研究は1980年代初頭まで秘密にされていた。[ 6 ]
ピーター・アーミテージは、特に臨床試験の分野で、医学研究における逐次解析の使用法を導入した。逐次法は、スチュアート・ポコックの研究によって、逐次設計における第一種過誤率を制御する方法について明確な推奨事項が提供された後、医学においてますます普及した。 [ 7 ]
研究者が観測値が増えるにつれてデータを繰り返し分析すると、第一種過誤の確率が高くなります。したがって、全体的な第一種過誤率が望ましいレベルに維持されるように、各中間分析でアルファレベルを調整することが重要です。これは概念的にはボンフェローニ補正の使用に似ていますが、データの繰り返し参照は依存しているため、アルファレベルに対してより効率的な補正を使用できます。最も初期の提案の1つはポコック境界です。第一種過誤率を制御する代替方法には、ヘイビットル-ペト境界などがあり、中間分析の境界を決定するための追加の研究は、 O'Brien & Fleming [ 8 ]および Wang & Tsiatis [ 9 ]によって行われています。
ポコック境界などの補正の制限は、データの収集前にデータの参照回数を決定する必要があり、データの参照は等間隔である必要がある(たとえば、50、100、150、200 人の患者の後)ことです。Demets と Lan [ 10 ]によって開発されたアルファ支出関数アプローチにはこれらの制限がなく、支出関数に選択されたパラメータによっては、ポコック境界または O'Brien と Fleming によって提案された補正と非常によく似ています。このような制限がまったくない別のアプローチは、e 値と e プロセスに基づいています。
2 つの治療群があるランダム化試験では、例えば、グループ逐次検定は次のように実施されることがあります。各グループで n 人の被験者が集まった後、中間解析が実施されます。2 つのグループを比較する統計検定が実施され、帰無仮説が棄却された場合は試験が終了します。そうでない場合は、試験は継続され、各グループでさらに n 人の被験者が募集され、すべての被験者を含めて統計検定が再度実施されます。帰無仮説が棄却された場合は試験が終了し、そうでない場合は、中間解析が最大回数実施されるまで定期的な評価が継続され、その時点で最後の統計検定が実施され、試験が中止されます。[ 11 ]
逐次分析は、 1657年にホイヘンスらが研究したギャンブラーの破産問題とも関連がある。[ 12 ]
ステップ検出とは、時系列データまたは信号の平均レベルにおける急激な変化を検出するプロセスです。これは通常、変化点検出と呼ばれる特殊な統計的手法の一種とみなされます。多くの場合、ステップは小さく、時系列データは何らかのノイズによって劣化しているため、ステップがノイズに隠れてしまう可能性があり、この問題は困難になります。そのため、統計的アルゴリズムや信号処理アルゴリズムが必要となることがよくあります。特にアラートを生成する目的で、データが入力される際にアルゴリズムをオンラインで実行する場合、これは逐次分析の応用例となります。
帰無仮説を棄却したために早期に終了した試験では、通常、真の効果量が過大評価されます。[ 13 ]これは、サンプルサイズが小さい場合、大きな効果量の推定値のみが有意な効果につながり、その結果、試験が終了するためです。単一試験における効果量の推定値を修正する方法が提案されています。[ 14 ]このバイアスは、主に単一研究を解釈する際に問題となることに注意してください。メタ分析では、早期中止による効果量の過大評価は、遅く中止した試験における過小評価によって相殺されるため、Schou & Marschner は「臨床試験の早期中止はメタ分析におけるバイアスの実質的な原因ではない」と結論付けています。[ 15 ]
逐次分析では、複数の分析が実行されるため、p 値の意味も変化します。観測されたデータと「少なくとも同程度に極端な」データとして定義される p 値の定義を再定義する必要があります。解決策の 1 つは、停止時間と特定のルックでの検定統計量の高さに基づいて、一連の逐次検定の p 値を順序付けることです。これは、Armitageによって最初に提案された段階的順序付け[ 13 ]として知られています。