| 学生の | |||
|---|---|---|---|
確率密度関数 | |||
累積分布関数 | |||
| パラメータ | 自由度(実数、ほぼ常に正の整数) | ||
| サポート | |||
| CDF | どこは超幾何関数である | ||
| 平均 | のためにそれ以外の場合は未定義 | ||
| 中央値 | |||
| モード | |||
| 分散 | のためにのためにそれ以外の場合は未定義 | ||
| 歪度 | のためにそれ以外の場合は未定義 | ||
| 過剰尖度 | のためにのためにそれ以外の場合は未定義 | ||
| エントロピ | どこはディガンマ関数であり、ベータ関数は | ||
| MGF | 未定義 | ||
| CF | のために、 どこは第2種変形ベッセル関数である[ 1 ] | ||
確率論と統計学において、スチューデントのt 分布(または単にt 分布)は、標準正規分布を一般化した連続確率分布です。標準正規分布と同様に、ゼロを中心として対称であり、ベル型をしています。
しかし、裾野が重く、裾野の確率質量はパラメータによって制御される。 のためにスチューデントのt分布は、非常に「厚い」裾を持つ標準コーシー分布になります。一方、標準正規分布になる非常に「細い」尾を持つ。
「学生」という名前は、ウィリアム・シーリー・ゴセットがアイルランドのダブリンにあるギネス醸造所で働いていた際に、科学論文の発表で使用したペンネームである。
スチューデントのt分布は、2つの標本平均の差の統計的有意性を評価するためのスチューデントのt検定、2つの母平均の差の信頼区間の構築、線形回帰 分析など、広く使用されている多くの統計分析において役割を果たしています。
位置尺度t分布の形で これは正規分布を一般化したものであり、また、正規分布族のデータのベイズ分析において、分散パラメータに関して周辺化を行う際の複合分布としても現れる。
スチューデントのt 分布の確率密度関数(PDF) は次のように表される。 どこは自由度数であり、はガンマ関数です。これは次のように書くこともできます。 どこはベータ関数である。特に、正の整数値の自由度ν > 1に対しては、次のようになる。
確率密度関数は対称であり、その全体的な形状は平均0、分散1の正規分布変数のベル型に似ていますが、やや低く幅広くなっています。自由度が増加するにつれて、t 分布は平均0、分散1の正規分布に近づきます。このため、正規性パラメータとも呼ばれる。[ 2 ]
以下の画像は、 t分布の密度を 、t の値が増加するにつれて示しています。比較のために正規分布を青線で示しています。t分布( 赤線)は、増加する。
累積分布関数(CDF)は、正則化された 不完全ベータ関数Iを用いて記述できます。t > 0の場合、
どこ
対称性により他の値が得られます。次の式が有効です。は
どこ ;\ ;\ )} は超幾何関数の特殊な例です。
その逆累積分布関数については、分位関数§ スチューデントのt分布を参照してください。
特定の値スチューデントのt分布の簡単な形式を示してください。
のためにt分布の生のモーメント は
秩序の瞬間またはそれ以上のものは存在しません。[ 3 ]
用語、kが偶数の場合、ガンマ関数の性質を使用して次のように簡略化できます。
スチューデントのt分布自由度は、確率変数Tの分布として定義できます[ 4 ] [ 5 ]
どこ
別の分布は、与えられた定数μに対して、次のように 定義される確率変数の分布として定義される。 この確率変数は、非心度パラメータμを持つ非心t分布に従います。この分布は、スチューデントのt検定の検出力に関する研究において重要です。
X 1 , ..., X nは、期待値μと分散σ 2を持つ正規分布に従う確率変数Xの独立な実現値であると仮定します。
を標本平均とし、
は標本からの分散の不偏推定値である。確率変数は
カイ二乗分布を持ち、自由度(コックランの定理による)。[ 6 ] 量
は平均0、分散1の正規分布に従う。は平均μ、分散σ² / nの正規分布に従う。さらに、これら2つの確率変数(正規分布に従うZとカイ二乗分布に従うV )は独立であることを示すことができる。したがって、重要な量は
これは、正確な標準偏差σ が標本標準誤差sに置き換えられている点でZとは異なり、上記のようにスチューデントのt分布に従います。未知の母分散σ 2 は分子と分母の両方にあったため、相殺され、 Tには現れないことに注意してください。Gosset は、上記の確率密度関数を直感的に得ました。n − 1に等しく 、フィッシャーは 1925 年にそれを証明した。[ 7 ]
検定統計量Tの分布は以下に依存するt分布はμやσに依存しないが、μやσに依存しないという性質が、理論的にも実践的にもt分布を重要なものにしている。
t分布は、 t統計量 の標本分布 として現れます。以下では1標本t統計量について説明します。対応する2標本t統計量については、スチューデントのt検定を参照してください。
させて平均が正規分布からの独立かつ同一の分布のサンプルであるおよび分散標本平均と不偏標本分散は次のように表されます。
結果として得られる(1標本)t 統計量は次のとおりである。
そして、スチューデントのt 分布に従って分布し、自由度。
したがって、推論の目的においては、t統計量は平均と分散が等しい場合に 有用な「重要な量」となります。は未知の母集団パラメータであり、 t 統計量の確率分布はどちらにも依存しないという意味である。または
偏りのない推定値の代わりに最尤推定値を使用することもできます 統計値が得られる これは、位置尺度t 分布に従って分布します。
位置スケールt 分布は、ガウス分布(正規分布)と平均値を合成することによって得られる。分散は未知であり、分散にはパラメータを持つ逆ガンマ分布が適用される。そして言い換えれば、確率変数Xは未知の分散が逆ガンマ分布に従うガウス分布に従うと仮定し、その後、分散を周辺化(積分)して消去します。
言い換えれば、この分布はガウス分布と、パラメータを持つスケーリングされた逆カイ二乗分布を合成することによって得られる。そしてスケールされた逆カイ二乗分布は、逆ガンマ分布とまったく同じ分布ですが、パラメータ化が異なります。
この特徴付けが有用な理由は、ベイズ統計学において逆ガンマ分布がガウス分布の分散の共役事前分布であるからである。その結果、位置尺度t 分布は多くのベイズ推論問題で自然に現れる。[ 8 ]
スチューデントのt 分布は、ある値を持つランダム変数Xの最大エントロピー確率分布です。[ 9 ]これは、pdf が指数族の形式 で記述できるという観察からすぐに導かれる。十分な統計量として。
関数A ( t | ν )は、 t ≥ 0の場合の、-tからtまでのスチューデントの確率密度関数f ( t )の積分です。したがって、観測データから計算された値よりも小さいtの値が偶然に発生する確率を示します。そのため、関数A ( t | ν )は、2 つのデータセットの平均値の差が統計的に有意であるかどうかを検定する際に、対応するtの値と、2 つのデータセットが同じ母集団から抽出された場合にその値が発生する確率を計算することによって使用できます。これは、さまざまな状況、特にt検定で使用されます。自由度νの統計量tの場合、A ( t | ν )は、2つの平均値が同じである場合 (小さい方の平均値が大きい方の平均から引かれ、 t ≥ 0 となる場合) に、t が観測値よりも小さくなる確率です。これは、 t分布の累積分布関数F ν ( t )から簡単に計算できます。
ここで、I x ( a , b )は正則化された不完全ベータ関数です。
統計的仮説検定では、この関数を使用してp値を構築します。
スチューデントのt 分布は、3つのパラメータを持つ位置尺度t 分布に一般化される。位置パラメータを導入することによりスケールパラメータと および場所規模の家族変革 私たちは
結果として得られる分布は、非標準化スチューデントのt 分布とも呼ばれます。
位置尺度t分布の密度は次のように定義されます。[ 12 ]
同様に、密度は次のように表すことができる。:
このバージョンのディストリビューションのその他の特性は次のとおりです。[ 12 ]
スチューデントのt分布は、加法誤差 を伴うデータが観測される状況において、平均値などの未知のパラメータを推定することを目的とする、さまざまな統計的推定問題で用いられます。実際的な統計作業のほぼすべてにおいて、これらの誤差の母集団標準偏差が未知であり、データから推定する必要がある場合、t分布は、この推定によって生じる追加の不確実性を考慮するためによく用いられます。このような問題のほとんどにおいて、誤差の標準偏差が既知であれば、 t分布の代わりに正規分布が用いられます。
信頼区間と仮説検定は、特定の統計量(例えば標準得点)の標本分布の分位数を必要とする2つの統計的手法です。この統計量がデータの線形関数であり、標準偏差の通常の推定値で割ったものである場合、得られた量をスチューデントのt分布に従うように再スケーリングおよび中心化することができます。平均値、加重平均、回帰係数を含む統計分析はすべて、この形式の統計量につながります。
教科書の問題では、母集団の標準偏差が既知であるかのように扱われることが多く、それによってスチューデントのt 分布を使用する必要がなくなります。これらの問題は一般的に2種類あります。(1) サンプルサイズが非常に大きいため、分散のデータに基づく推定値を確実なものとして扱うことができる問題、(2) 数学的推論を説明する問題で、標準偏差の推定の問題は、著者や教師が説明しようとしているポイントではないため、一時的に無視される問題。
興味深い帰無仮説の下では、中程度のサンプルサイズに対してt分布に従う統計量が数多く存在することが示されており、そのためt分布は有意性検定の基礎となる。例えば、スピアマンの順位相関係数ρの分布は、帰無仮説(相関がゼロ)の場合、サンプルサイズが約20を超えるとt分布によってよく近似される。
数Aが次のように選ばれると仮定します。
Tがn − 1自由度のt 分布に従う場合。対称性により、これはA が以下を満たすことと同じです。
つまり、Aはこの確率分布の「95パーセンタイル」であり、それから
ここで、S nは観測値の標本標準偏差です。これは以下と同等です。
したがって、端点が
はμの90%信頼区間です。したがって、正規分布に従うと合理的に期待できる一連の観測値の平均がわかった場合、t分布を使用して、その平均の信頼限界が、帰無仮説 で予測される値などの理論的に予測される値を含むかどうかを調べることができます。
この結果がスチューデントのt 検定で用いられています。2つの正規分布から抽出した標本の平均値の差自体が正規分布に従うため、t 分布を用いることで、その差が妥当にゼロであると仮定できるかどうかを検証できるのです。
データが正規分布している場合、平均値の片側(1 − α)信頼上限(UCL)は、次の式を使用して計算できます。
結果として得られるUCLは、特定の信頼区間と母集団サイズに対して発生する最大の平均値になります。言い換えれば、は観測値の平均であるため、分布の平均がUCL 1 − αより小さい確率は信頼水準1 − αに等しい。
t分布は、平均と分散が未知の正規分布から、観測されていないサンプルに対する予測区間 を構築するために使用できる。
スチューデントのt 分布、特に3パラメータ(位置尺度)版は、正規分布との関連性から、ベイズ統計学において頻繁に登場します。正規分布に従う確率変数の分散が未知であり、その分散に対して逆ガンマ分布に従う共役事前分布が設定されている場合、結果として得られる変数の周辺分布はスチューデントのt分布に従います。同様の結果をもたらす同等の構成としては、分散に対する共役スケーリング逆カイ二乗分布、または精度に対する共役ガンマ分布があります。分散に対して 1 / σ ² に比例する不適切な事前分布が設定されている場合も、 t分布が現れます。これは、正規分布に従う変数の平均が既知であるか、共役正規分布に従う事前分布に従って未知に分布しているか、または不適切な定数事前分布に従って未知に分布しているかに関係なく当てはまります。
t 分布を生み出す関連状況は以下のとおりです。
t分布 は、正規分布で許容されるよりも裾が重いデータの場合、正規分布の代替としてよく使用されます。たとえば、Lange et al. [ 13 ]を参照してください。従来のアプローチは、外れ値を特定し(たとえば、Grubbsの検定を使用)、何らかの方法でそれらを除外または重みを下げることでした。しかし、外れ値を特定することは必ずしも容易ではなく(特に高次元の場合)、t分布はそのようなデータの自然なモデルの選択であり、頑健な統計 に対するパラメトリックなアプローチを提供します。
ベイズ的な説明は Gelman ら[ 14 ]に見られます。自由度パラメータは分布の尖度を制御し、尺度パラメータと相関があります。尤度には複数の局所最大値が存在する可能性があり、そのため、自由度をかなり低い値に固定し、これを所与として他のパラメータを推定する必要がある場合がよくあります。一部の著者は、3 ~ 9 の値がしばしば良い選択肢であると報告しています。Venables と Ripley は、5 の値がしばしば良い選択肢であると示唆しています。
実用的な回帰と予測のニーズのために、関数のスチューデントt分布の一般化であるスチューデントtプロセスが導入されました。スチューデントtプロセスは、ガウス過程がガウス分布から構築されるのと同様に、スチューデントt分布から構築されます。ガウス過程の場合、すべての値の集合は多次元ガウス分布を持ちます。同様に、 区間上のスチューデントt過程である プロセスの対応する値が() は、多変量スチューデントt 分布を併せ持つ。[ 15 ]これらのプロセスは、回帰、予測、ベイズ最適化、および関連する問題に使用される。多変量回帰および多出力予測には、多変量スチューデントt プロセスが導入され、使用される。[ 16 ]
以下の表は、片側または両側のさまざまな臨界領域における自由度νのt 分布の値を示しています。最初の列はν、上部のパーセンテージは信頼水準です。表本体の数字は信頼区間のセクションで説明されている要因。
νが無限大となる最後の行は、正規分布の臨界点を示しています。なぜなら、自由度が無限大のt 分布は正規分布だからです。(上記の「関連分布」を参照)。
サンプルサイズが11、サンプル平均が 10、サンプル分散が2 のサンプルがあるとします。自由度 10 で 90% の信頼度の場合、表から得られる 片側t値は 1.372 です。次に、信頼区間は次のように計算されます。
90%の信頼度で、真の平均値が以下にあると判断します。
言い換えれば、この方法で特定のサンプルから上限値が算出された場合、90%の確率でこの上限値は真の平均値を超える。
そして、90%の信頼度で、真の平均値は上方にある
言い換えれば、この方法で特定のサンプルから下限値が算出された場合、90%の確率でその下限値は真の平均値を下回る。
つまり、80%の信頼度(100% − 2 × (1 − 90%) = 80%で計算)で、真の平均値は区間内に含まれるということになります。
与えられたサンプルからこの方法で上限値と下限値を計算した場合、80%の確率で真の平均値が上限値より低く、かつ下限値より高くなると言うことは、この方法で計算された特定の上限値と下限値の間に真の平均値が存在する確率が80%であると言うこととは異なります。信頼区間と検察官の誤謬を参照してください。
今日では、 Rプログラミング言語などの統計ソフトウェアや、多くの表計算ソフトで利用できる関数によって、表を使わずにt分布とその逆分布の値を計算できる 。
スチューデントのt 分布からランダムサンプルを構築するにはさまざまなアプローチがあります。問題は、サンプルが単独で必要とされるか、または、例えばコピュラ依存性の多次元アプリケーションのように、均一サンプルに分位関数を適用して構築されるかによって異なります。単独サンプリングの場合、Box–Muller 法の拡張とその極形式が容易に適用できます。[ 17 ]この方法は、すべての実数の正の自由度νに等しく適用できるという利点がありますが、他の多くの候補方法はνがゼロに近い場合に失敗します。[ 17 ]

統計学において、t 分布は1876年にヘルマート[ 18 ] [ 19 ] [ 20 ]とリューロート[ 21 ] [ 22 ] [ 23 ]によって事後分布として初めて導出された。そのため、スチューデントのt分布はスティグラーの命名法則の一例である。t分布は、カール・ピアソンの1895年の論文[ 24 ]において、ピアソンIV型分布としてより一般的な形でも登場した。
英語圏の文献では、この分布は、ウィリアム・シーリー・ゴセットがアイルランドのダブリンにあるギネス醸造所で働いていた際に「学生」というペンネームで1908年にバイオメトリカ誌に発表した論文に由来している。[ 25 ]ペンネームの由来に関する説の一つは、ゴセットの雇用主が科学論文を発表する際に実名ではなくペンネームを使うことを好んだため、彼は身元を隠すために「学生」という名前を使ったというものである。別の説は、ギネスが原材料の品質を判断するためにt検定を使用していることを競合他社に知られたくなかったというものである。 [ 26 ] [ 27 ]
ゴセットはギネスで働いており、小標本の問題に興味を持っていた。例えば、大麦の化学的性質では、標本サイズはわずか3になることもある。ゴセットの論文では、この分布を「正規母集団から抽出された標本の標準偏差の頻度分布」と呼んでいる。これはロナルド・フィッシャーの研究によって広く知られるようになり、彼はこの分布を「スチューデントの分布」と呼び、検定値を文字tで表した。[ 7 ] [ 28 ]
{{cite book}}: CS1 maint: postscript (リンク){{cite journal}}: CS1 maint: 数値名: 著者リスト (リンク)