統計的推論、特に予測推論において、予測区間とは、すでに観測された内容を前提として、将来の観測が一定の確率で入る区間の推定値です。予測区間は、回帰分析でよく使用されます。
簡単な例として、1 から 6 までの面の値を持つ 6 面サイコロが挙げられます。面の値の推定期待値の信頼区間は約 3.5 で、サンプル サイズが大きくなるにつれて狭くなります。ただし、次のサイコロの予測区間は、これまでに確認されたサンプルの数に関係なく、およそ 1 から 6 の範囲になります。
予測区間は、頻度主義統計とベイズ統計の両方で使用されます。予測区間は、頻度主義信頼区間またはベイズ信頼区間が観測不可能な母集団パラメータに対して持つ関係と同じ関係を将来の観測に対して持ちます。つまり、予測区間は個々の将来のポイントの分布を予測しますが、パラメータの信頼区間と信頼区間は、真の母集団平均または観測不可能なその他の関心量の推定値の分布を予測します。
導入
基礎となる分布が正規分布であり、サンプルセット { X 1、...、 X n }を持つというパラメトリック仮定を行う場合、信頼区間と信用区間を使用して基礎となる母集団の母平均μと母標準偏差σ を推定できます。一方、予測区間を使用して次のサンプル変数X n +1の値を推定できます。
あるいは、ベイズの用語では、予測区間は、変数の分布のパラメータではなく、変数自体の信頼区間として記述できます。
予測区間の概念は、単一の将来のサンプル値についての推論に限定される必要はなく、より複雑なケースにまで拡張できます。たとえば、分析が年間の最大流量の年間値に基づいて行われることが多い河川の洪水のコンテキストでは、今後 50 年以内に発生する可能性のある最大の洪水について推論を行うことに関心があるかもしれません。
予測区間は観測不可能な母集団パラメータではなく、過去と未来の観測値のみに関係するため、ブルーノ・デ・フィネッティによる観測可能値への焦点に従い、シーモア・ガイサー[要出典]などの統計学者は信頼区間よりも優れた方法として予測区間を提唱している。[要出典]
正規分布
パラメータが不明な正規分布のサンプルが与えられた場合、頻度主義的な意味での予測区間、つまり、繰り返し実験を行ったときにX n +1が望ましい割合で区間内に入るようなサンプルの統計に基づく区間[ a , b ]を与えることが可能である。これを「予測信頼区間」と呼ぶこともある。[1]
頻度主義的予測区間の一般的な手法は、観測量X 1、...、 X n、 X n +1の重要量(確率分布がパラメータに依存しない観測量とパラメータの関数)を見つけて計算することです。これを逆転させることで、これまでの観測値に基づいて計算されたある区間に将来の観測値X n +1が含まれる確率が得られます。観測量のみに依存するこのような重要量は補助統計量と呼ばれます。[2]重要量を構築する通常の方法は、場所に依存する 2 つの変数の差を取って場所が相殺されるようにし、次にスケールに依存する 2 つの変数の比を取ってスケールが相殺されるようにすることです。最もよく知られている重要量はスチューデントの t 統計量で、この方法で導出でき、後述で使用します。
既知の平均、既知の分散
平均と分散がわかっている正規分布N ( μ , σ2 )における将来の観測値Xの予測区間[ ℓ , u ]は、次のように計算できる。
ここで、Xの標準得点は標準正規分布に従って分布します。
したがって
または
zは標準正規分布における 分位数であり、
または同等。

予測区間は通常次のように表されます。
たとえば、平均 ( μ ) が 5、標準偏差 ( σ ) が 1 の正規分布の 95% 予測区間を計算する場合、z は約 2 になります。したがって、予測区間の下限は約 5 ‒ (2⋅1) = 3 で、上限は約 5 + (2⋅1) = 7 となり、予測区間は約 3 から 7 になります。

パラメータの推定
未知のパラメータを持つ分布の場合、予測への直接的なアプローチは、パラメータを推定し、関連する分位関数を使用することです。たとえば、標本平均をμの推定値として使用し、標本分散s 2 をσ 2の推定値として使用できます。ここでのs 2には 2 つの自然な選択肢があります。で割ると不偏推定値が得られ、nで割ると最大尤度推定値が得られるため、どちらを使用してもかまいません。次に、これらの推定パラメータを使用して分位関数を使用し、予測区間を求めます。
このアプローチは使用可能ですが、結果として得られる区間には反復サンプリングの解釈がありません[4]。つまり、予測信頼区間ではありません。
続編では、サンプル平均を使用します。
そして(偏りのない)標本分散:
平均値は不明、分散は既知
[5]平均μが不明だが分散が既知の正規分布を考えると、観測値の標本平均は分布を持ち、将来の観測値は分布を持つ。これらの差を取るとμがキャンセルされ、分散の正規分布が得られる。
を解くと、前と同じように区間を計算できる予測分布が得られます。これは、100 p % の分位範囲を使用する場合、この計算を繰り返し適用すると、将来の観測値が100 p % の確率で 予測区間内に収まるという意味で、予測信頼区間です。
この予測分布は、複合分散を使用するため、推定平均と既知の分散を使用するよりも保守的であり、わずかに広い間隔が得られることに注意してください。これは、目的の信頼区間プロパティを保持するために必要です。
平均は既知、分散は不明
逆に、平均μが分かっていて分散が分からない正規分布が与えられた場合、観測値の標本分散はスケールに応じて分布になります。より正確には、
一方、将来の観測値は分布を持ちます。 将来の観測値の残差と標本標準偏差s の比を取ると σ がキャンセルされ、自由度がn – 1のスチューデントの t 分布が得られます(導出を参照)。
を解くと予測分布が得られ、そこから前と同じように間隔を計算できます。
この予測分布は、正規分布の代わりに t 分布を使用するため、推定標準偏差と既知の平均μを持つ正規分布を使用するよりも保守的であり、したがってより広い間隔が得られることに注意してください。これは、目的の信頼区間プロパティを保持するために必要です。
平均値は不明、分散は不明
μとσ2が未知の正規分布について上記を組み合わせると、次の補助統計量が得られる: [6]
この単純な組み合わせは、正規分布の標本平均と標本分散が独立した統計であるため可能です。これは正規分布にのみ当てはまり、実際に正規分布の特徴となります。
を解くと予測分布が得られる。
特定の間隔内に落ちる 確率は次のようになります。
ここで、T a は自由度n − 1のスチューデントt分布の100((1 − p )/2)番目 のパーセンタイルである 。したがって、数値は
は100(1 − p )%予測区間の終点である 。
ノンパラメトリック法
母集団に関する仮定を一切せずに、つまり非パラメトリックな方法で予測区間を計算することができます。
残差ブートストラップ法は、ノンパラメトリック予測区間の構築に使用できます。
等角予測
一般に、等角予測法の方が一般的です。最小値と最大値を予測区間の境界として使用する特殊なケースを見てみましょう。同一のランダム変数のサンプル { X 1、...、 X n } がある場合、すべての観測値が最大値になる確率は等しいため、次の観測値X n +1が最大になる確率は 1/( n + 1) です。同様に、X n +1 が最小になる確率も 1/( n + 1) です。 もう 1 つの ( n − 1)/( n + 1) の場合、X n +1 はサンプル { X 1、...、 X n } のサンプル最大値とサンプル最小値の間にあります。したがって、サンプル最大値と最小値をMとm で表すと、 ( n − 1)/( n + 1) 予測区間は [ m、 M ] になります。
これは将来の観測値が範囲内に入る確率を示しますが、セグメント内のどこに入るかについては推定値を与えないことに注意してください。特に、観測値の範囲外に入る場合は、範囲から大きく外れている可能性があります。詳細については、極値理論を参照してください。正式には、これは母集団からのサンプリングだけでなく、必ずしも独立または同一に分布している必要のない、交換可能なランダム変数のシーケンスに適用されます。
他の間隔との対比
信頼区間との対比
予測信頼区間の式では、母集団の平均と標準偏差の観測不可能なパラメータμとσについては言及されていません。観測されたサンプル統計とサンプルの平均と標準偏差が使用され、推定されるのは将来のサンプルの結果です。
予測区間を検討する場合、標本統計を母集団パラメータの推定値として使用し、これらの推定値に信頼区間を適用するのではなく、「次の標本」自体を統計と見なし、その標本分布を計算します。
パラメータ信頼区間では、母集団パラメータを推定します。これを次のサンプルの予測として解釈したい場合は、(推定された)母集団分布を使用して、この推定母集団から抽出した「次のサンプル」をモデル化します。対照的に、予測信頼区間では、そのような母集団からのnまたはn + 1 の観測値のサンプルの標本分布 ( の統計) を使用します。母集団分布は直接使用されませんが、標本分布の形式に関する仮定 (パラメータの値ではない) は標本分布の計算に使用されます。
回帰分析では
予測区間の一般的な応用は回帰分析です。データが直線 (単回帰) でモデル化されていると仮定します。
ここで、 は応答変数、は説明変数、ε iはランダム誤差項、および はパラメータです。
通常の最小二乗法などからパラメータの推定値とが与えられると、与えられた説明値x dに対する予測応答値y dは
(回帰直線上の点)ですが、実際の応答は
点推定値は 平均応答と呼ばれ、y dの期待値の推定値である。
予測区間は、代わりにy d が含まれると予想される区間を示します。実際のパラメータαとβ が(誤差項ε iとともに)わかっている場合、これは必要ありませんが、サンプルから推定する場合は、切片と傾き(および)の推定値の標準誤差とそれらの相関を使用して予測区間を計算できます。
回帰分析では、Faraway (2002、p. 39) は、平均応答の予測の区間と観測応答の予測の区間を区別しています。これは、基本的に、上記の拡張係数の平方根内に単位項を含めるかどうかに影響します。詳細については、Faraway (2002) を参照してください。
ベイズ統計
予測推論の提唱者であるシーモア・ガイサーは、ベイズ統計の予測的応用について述べています。[7]
ベイズ統計では、ランダム変数の事後確率から信頼区間として(ベイズ)予測区間を計算できます。理論的な作業では、信頼区間は将来のイベントの予測ではなく、パラメータの推論(つまり、変数自体の結果ではなくパラメータの信頼区間)のために計算されることがほとんどです。ただし、特にアプリケーションがまだ観察されていないケースの可能性のある極端な値に関係する場合、そのような値の信頼区間は実用上重要になることがあります。
アプリケーション
予測区間は、血液検査が正常かどうかを判断するための血液検査の基準範囲などの基準範囲の定義としてよく使用されます。この目的で最も一般的に使用される予測区間は 95% 予測区間であり、それに基づいた基準範囲は標準基準範囲と呼ぶことができます。
参照
注記
- ^ Geisser (1993, p. 6): 第2章: 非ベイズ予測アプローチ
- ^ ガイサー(1993年、7ページ)
- ^ abcd Sterne & Kirkwood (2003, p. 472) の表 A2
- ^ ガイサー(1993年、8~9ページ)
- ^ ガイサー(1993年、7ページ~)
- ^ ガイサー (1993、例 2.2、p. 9-10)
- ^ ガイサー(1993)
参考文献
- Faraway, Julian J. (2002)、R を使用した実用的な回帰分析と分散分析(PDF)
- ガイサー、シーモア(1993)、予測推論、CRCプレス
- スターン、ジョナサン; カークウッド、ベティ R. (2003)、エッセンシャル メディカル スタティスティックス、ブラックウェル サイエンス、ISBN 0-86542-871-9
さらに読む
- Chatfield, C. (1993). 「区間予測の計算」. Journal of Business & Economic Statistics . 11 (2): 121– 135. doi :10.2307/1391361. JSTOR 1391361.
- Lawless, JF; Fredette, M. (2005). 「頻度主義予測区間と予測分布」Biometrika . 92 (3): 529– 542. doi : 10.1093/biomet/92.3.529 .
- Meade, N.; Islam, T. (1995). 「成長曲線予測の予測間隔」Journal of Forecasting . 14 (5): 413– 430. doi :10.1002/for.3980140502.
- ISO 16269-8 データの標準解釈、パート 8、予測区間の決定
