
頻度論的推論によれば、信頼区間(CI)とは、母平均などの未知の統計パラメータの真の値が(繰り返しサンプリングによって)含まれる可能性が高い値の範囲です。[ 1 ]単一の点推定値(例:「平均スクリーンタイムは1日あたり3時間です」)を報告する代わりに、信頼区間は、2~4時間などの範囲と、通常95%の特定の信頼水準を提供します。
95% の信頼水準は、真のパラメータが特定の計算された区間内に含まれる確率が 95% であることを意味するものではありません。これは、ベイズ推論における信用区間に関連付けられています。信頼水準は、区間を生成するために使用された方法の長期的な信頼性を反映しています。[ 2 ] [ 3 ]言い換えれば、同じ母集団から同じサンプリング手順を 100 回繰り返した場合、結果として得られる区間の約 95 個が真の母集団平均を含むと予想されます。頻度論的アプローチでは、真の母集団平均は固定された未知の定数とみなされ、信頼区間はランダムサンプルからのデータを使用して計算されます。サンプルがランダムであるため、区間の端点は確率変数です。
させて統計パラメータを持つ確率分布からのランダムサンプルである。 ここ、は推定される量であり、分布を決定するその他のパラメータ(存在する場合)を含みます。パラメータの信頼区間信頼水準または係数は区間ですランダム変数によって決定されるそして物件について:
番号(通常は大きい値(例:0.95))は、次のような形式で示されることがあります。(またはパーセンテージとして))、 どこは小さな正の数で、多くの場合 0.05 です。これは、区間が確率がある価値をカバーする繰り返しサンプリングを行う。
あるいは、一部の著者[ 4 ]は単に
信頼水準は「少なくとも「。被覆確率が厳密により大きくなることがわかっている場合一部のパラメータ値の場合、信頼区間は保守的、つまり安全側に偏っていると呼ばれます。
多くのアプリケーションでは、必要な信頼水準を正確に満たす信頼区間を構築することは困難ですが、近似区間を計算することは可能です。区間を構築するためのルールは、以下の条件を満たす場合に受け入れられます。
許容できるレベルの近似値まで。
信頼区間を計算する方法は数多くあり、最適な方法は状況によって異なります。広く適用されている2つの方法は、ブートストラップ法と中心極限定理です。[ 2 ]後者の方法は、標本平均を計算する必要があるため、標本が大きい場合にのみ有効です。およびサンプル標準偏差漸近的に標準正規量を用いる
どこそしてはそれぞれ母平均と標本サイズである。
仮定するは、未知のパラメータを持つ正規分布母集団からの独立したサンプルである。および分散標本平均を定義するおよび偏りのない標本分散として
次に値
スチューデントのt分布に従う自由度。[ 5 ]この値は、その分布が観測不可能なパラメータの値に依存しないため有用である。そしてつまり、それは極めて重要な量である。
95%信頼区間を計算したいとします。まず、分布の97.5パーセンタイルであるすると、2.5%の確率でより小さくなりますそして、それよりも大きくなる確率は2.5%(t分布は0に関して対称であるため)。言い換えれば、
その結果、置き換えることによってと用語を並べ替えると、
どこは標本の確率尺度です。
これは、この条件が95%の確率で発生することを意味します。繰り返しサンプリングを行うと、次の値が得られます。サンプルを観察すると、次の値が得られます。のためにそしてのためにこれから以下の区間を計算し、これを平均値の95%信頼区間と呼びます。
信頼区間には様々な解釈が可能である(以下では95%信頼区間を例として取り上げる)。

信頼区間と信頼水準はしばしば誤解されており、発表された研究では、専門の科学者でさえしばしばそれらを誤って解釈していることが示されています。[ 9 ]
よくある誤解とは異なり、95%の信頼水準は次のような意味ではありません。
例えば、ある工場が金属棒を生産しており、25本の棒のランダムサンプルから 母集団平均長さの95%信頼区間が36.8~39.0mmであるとします。[ 12 ]
代わりに、95%信頼水準とは、そのようなサンプルを100個取った場合、真の母平均が計算された区間の約95%の範囲内にあると予想されることを意味します。[ 1 ] [ 10 ] [ 11 ] [ 12 ]

信頼区間の解釈は、複数のグループが関係する場合に特に難しい。よくある誤解として、信頼区間が「ちょうど接している」場合、2つのグループに有意差があると考えることと、一方のグループの信頼区間が他方のグループの平均値を除外する場合に、2つのグループに差があると考えることが挙げられる。これらは一般的にはどちらも正しくないが、経験豊富な研究者でさえ、しばしばこのような間違いを犯す。[ 13 ]
信頼区間は、平均値などの母集団パラメータを推定するために使用されます。例えば、公平な6面サイコロの期待値は3.5です。繰り返しサンプリングを行い、多数の95%信頼区間を計算した結果、およそ95%の信頼区間に3.5が含まれることになります(そして、信頼区間の幅はサンプルサイズが大きくなるにつれて狭くなります)。
一方、予測区間は、将来の個々の観測値が一定の確率で収まると予想される範囲を示します。公平な6面サイコロを1回振った場合、正確な95%予測区間は存在しません。しかし、20面サイコロを振った場合は、正確な95%予測区間が存在します。そのような区間の1つは、なぜなら、95%の確率でサイコロを振った結果が19以下になり、残りの5%で20になるからです。
重要な違いは、信頼区間はパラメータ推定における不確実性を定量化するのに対し、予測区間は将来の観測値を予測する際の不確実性を定量化する点にある。
分散が既知の正規分布の平均を推定するなど、多くの一般的な状況では、[ 14 ]信頼区間は無情報事前分布の下で信用区間と一致します。このような場合、信頼区間に関する一般的な誤解(例えば、信頼区間をパラメータに関する確率の記述として解釈すること)が、実際には正しい結論をもたらす可能性があります。

ウェルチ[ 15 ]は、信頼区間理論と他の区間推定理論(フィッシャーの信頼区間や客観的ベイズ区間を含む)との違いを明確に示す例を提示した。ロビンソン[ 16 ]はこの例を「ネイマンの信頼区間理論に対する最もよく知られた反例」と呼んだ。ウェルチにとっては、これは信頼区間理論の優位性を示すものであり、この理論の批判者にとっては、その欠点を示すものであった。ここでは、簡略化したバージョンを提示する。
仮には一様分布からの独立した観測値である分布。次に、最適な 50% 信頼手順は、[ 17 ]
信頼区間推定値を導出するために、信頼区間推定値または客観的ベイズ推定値を用いることができる。 これもまた50%信頼度手順である。ウェルチは、信頼区間理論の要件に従って、最初の信頼度手順が2番目の手順よりも優れていることを示した。最初の手順に含まれる確率2 番目の手順に含まれる確率以下最初の手順で得られた区間の平均幅は、2番目の手順で得られた区間の平均幅よりも小さい。したがって、古典的な信頼区間理論においては、最初の手順が好ましい。
しかし、最初の手順で得られた区間には、必ず真の値が含まれることが保証されます。したがって、名目上の50%信頼係数は、特定の区間に真の値が含まれるという不確実性とは無関係である。2番目の手順にはこの性質はない。
さらに、最初の手順で非常に短い間隔が生成された場合、これは次のことを示しています。両者は非常に近接しているため、単一のデータポイントの情報しか提供しません。しかし、最初の区間は幅が狭いため、パラメータの妥当な値のほとんどすべてを除外してしまいます。2番目の手順にはこのような特性はありません。
最初の手順の 2 つの直感に反する特性 – 100% のカバー率離れており、カバー率はほぼ0%ですそれらは互いに近い値であり、平均して 50% のカバー率が得られるようにバランスが取れています。しかし、最初の手順は最適であるにもかかわらず、その区間は推定値の精度を評価することも、区間が真の値を含んでいるという不確実性を評価することも提供しません。
この例は、信頼区間の単純な解釈に反論するために用いられる。信頼区間の手順が、名目上のカバレッジを超える特性(精度との関係やベイズ推論との関係など)を持つと主張される場合、それらの特性は証明されなければならない。手順が信頼区間の手順であるという事実から、それらの特性が導き出されるわけではない。
Steiger [ 18 ]は、 ANOVAにおける一般的な効果量尺度に対するいくつかの信頼度手順を提案した。Morey ら[ 10 ]は、 ω 2の信頼度手順を含め、これらの信頼度手順のいくつかは、 F統計量がますます小さくなるにつれて(ω 2のすべての可能な値との不適合を示す) 、信頼区間が縮小し、単一の値ω 2 = 0 のみを含むことさえあるという性質を持っていることを指摘している。つまり、CI は無限に狭い(これは、 のためにCI)。
この挙動は、信頼区間と有意性検定の関係と一致しています。Fが非常に小さくなり、グループの平均が偶然に期待されるよりもはるかに近くなると、有意性検定ではω 2のほとんどまたはすべての値に対して棄却を示す可能性があります。したがって、区間は非常に狭くなるか、あるいは空になることもあります (または、Steiger が提案した慣例に従って、0 のみを含む)。しかし、これはω 2の推定値が非常に正確であることを示すものではありません。ある意味では、その逆を示しています。つまり、結果自体の信頼性に疑問がある可能性があるということです。これは、信頼区間が推定値の精度を示すという一般的な解釈とは矛盾します。
二項比率の信頼区間を計算する方法は1920年代から現れた。[ 19 ] [ 20 ]信頼区間の基本的な考え方は1930年代初頭に発展し、[ 21 ] [ 22 ] [ 23 ]最初の徹底的かつ一般的な説明は1937年にイェジー・ネイマンによって行われた。 [ 7 ]
ネイマンは、アイデアの発展を次のように説明した(参照番号は変更されている):[ 23 ]
[私の信頼区間に関する研究]は、1930年頃、当時ワルシャワで私の教え子だったヴァツワフ・ピトコフスキが農業経済学の実証研究中に抱いた単純な疑問から始まった。その疑問とは、「推定された回帰係数の精度を、教条主義にとらわれずにどのように特徴づけるか」というものだった。
ピトコフスキーのモノグラフは…1932年に出版された。[ 24 ]たまたまそれより少し前に、フィッシャーは信頼区間分布と信頼区間論証に関する最初の論文を発表した。 [ 25 ]まったく予想外なことに、信頼区間論証の概念的枠組みは信頼区間のそれとは全く異なるが、いくつかの特定の問題の具体的な解決策は一致していた。そこで、1934年に発表した信頼区間の理論を提示した最初の論文[ 21 ]で、ベイズの定理を参照することなく、また解が事前確率に依存しないという区間推定の考え方について、フィッシャーの優先権を認めた。同時に、フィッシャーの問題へのアプローチには小さな誤解が含まれていることを穏やかに示唆した。
医学雑誌では、信頼区間は1970年代に推奨されましたが、広く使用されるようになったのは1980年代になってからです。[ 26 ] 1988年までに、医学雑誌は信頼区間の報告を義務付けるようになりました。[ 27 ]