統計学において、スチューデント化は、スチューデントというペンネームで執筆したウィリアム・シーリー・ゴセットにちなんで名付けられ、標本から得られた統計量(標本平均など)を、標本に基づく母集団標準偏差の推定値で割るプロセスです。「正規化」では分子のみが不確実ですが、スチューデント化では分子と分母の両方が不確実であり、通常(つまり、ガウス分布を仮定した場合)はスチューデントT分布に従います。この用語は、同じ次数の別の統計量による高次の統計量の標準化にも使用されます。[ 1 ] [ 2 ]たとえば、3次中心モーメントの推定値は、標本標準偏差の3乗で割ることによって標準化されます。
標準化は通常、中心化された変数を既知の母集団標準偏差で割ることによって行われますが、) 学生化は、は未知です。簡単な例として、位置尺度ファミリーからデータが得られる場合に、標本平均を標本標準偏差で割るプロセスがあります。「スチューデント化」の結果、位置と尺度パラメータの両方に依存する平均の確率分布を扱う複雑さが、位置パラメータのみに依存する分布を考慮することに簡略化されます。しかし、未知の母標準偏差ではなく標本標準偏差が使用されるため、スチューデント化された統計量の確率分布を求める数学が複雑になります。分母自体が標本ごとに変動する確率変数であるため、結果として得られる統計量は、通常、標準正規分布ではなく、スチューデントのt分布のような、より広がった分布に従います。
基本的な検定に加えて、スチューデント化残差による回帰診断や多重比較において、スチューデント化範囲分布は第一種過誤を制御しながら統計的検出力を維持するために使用されるため、非常に重要です。計算統計学では、スチューデント化統計量を使用するという考え方は、リサンプリング、特にブートストラップの文脈で特性が改善された信頼区間を開発する上で重要です。[ 3 ]
学生化の発展は、20世紀初頭の産業における品質管理の実践的なニーズによって推進された。この概念は、オックスフォード大学ニューカレッジで学び、ダブリンのギネス醸造所で働いていた化学者であり数学者でもあるウィリアム・シーリー・ゴセットの研究と密接に関連している。ゴセットは、大麦やホップなどの原材料の品質を分析する際に、少量のサンプルを扱うという実践的な品質管理上の問題に直面した。
当時主流だった統計的手法は、主にカール・ピアソンによって開発されたもので、母集団標準偏差()は既知であると仮定できる。平均値に関する推論には、標準正規(Z)検定がよく用いられたが、母集団の標準偏差を知る必要があった。しかし、産業界や実験室では、母集団の分散は不明なことが多く、標本から推定する必要があった。
ゴセットは、母集団標準偏差を標本標準偏差に置き換えることで、検定統計量の分布が変化するため、特にサンプルサイズが非常に小さい場合に、不確実性が増大します。醸造所では非常に小さなサンプル(多くの場合、3つか4つの測定値)しか採取できなかったため、従来のZ検定では誤差が常に過小評価され、ビールの品質について誤った結論が出ていました。
この問題に対処するため、彼はこの余分な変動性を考慮した確率分布のファミリーを開発しました。彼の画期的な研究は、1908年に「Student」というペンネームで雑誌『Biometrika』に掲載されました(ギネス社が技術的発見を秘密にするという方針をとっていたため)。これが、現在スチューデントのt分布として知られるものにつながりました。スチューデント化は、この調整の根底にある中心的なメカニズムとして浮上しました。後に、ロナルド・A・フィッシャーは、自由度の使用を形式化することによってこれらのアイデアを洗練させました。t分布の形状を決定する。[ 4 ]
回帰分析において、スチューデント化残差は、外れ値や影響力の大きい観測値を特定するのに特に役立つ標準化残差の一種です。典型的な線形回帰モデルでは、基礎となる誤差の分散が等しい場合でも、生の残差(観測値とモデルによって予測された値の差)の分散はすべて同じではありません。これは、各残差の分散が対応するデータポイントの「レバレッジ」に依存するためです。独立変数の平均から遠いポイントほどレバレッジが高く、残差の分散は小さくなります。
残差を比較しやすく、解釈しやすくするために、統計学者はスチューデント化を用いて残差を「均等化」します。これは、各生残差をその標準偏差の推定値で割ることによって行われます。スチューデント化された残差には、主に2つの種類があります。
スチューデント化残差の使用は、回帰分析の診断における標準的な手法です。これらの残差を予測値に対してプロットすることで、研究者は線形モデルの仮定(等分散性など)が成り立っているかどうか、あるいは特定のデータポイントが分析全体の結果を歪めているかどうかを検証できます。
歴史的な起源を超えて、スチューデント化は現代の統計のさまざまな文脈で登場し、中でもスチューデント化範囲が最も広く使用されています。統計学では、スチューデント化範囲は、標本の最大値と最小値の差を推定標準誤差で割ったものとして定義されます。q = (x_max − x_min) / s ここで、s はデータの推定標準誤差です。
この統計量は、テューキーのHSD (正直有意差)検定の基礎となるもので、研究者は複数のグループの平均値を比較し、どのグループ間に有意差があるかを調べることができます。スチューデント化を行わない場合、複数のグループを比較すると、第一種過誤(実際には差がないのに差があると判断してしまうこと)のリスクが大幅に増加します。スチューデント化された尺度を用いることで、この検定は比較対象となるグループ数を考慮した一貫した閾値を提供し、研究全体の信頼水準の正確性を確保します。
生物学や心理学といった分野では、実験に複数の処置群が含まれることが多いため、スチューデント化範囲分布は、複数の個別のt検定を実行するよりも、より堅牢な枠組みを提供する。