標本平均(標本平均)または経験平均(経験平均)、および標本共分散または経験共分散は、 1つ以上の確率変数に関するデータの標本から計算される統計量です。
標本平均とは、より大きな母集団から抽出された標本の平均値(または平均値)のことです。ここで「母集団」とは、人数ではなく、収集されたか否かを問わず、関連するデータ全体を指します。便宜上、フォーチュン500社のうち40社の売上高を標本として用いる場合、母集団全体である500社すべての売上高を調べる必要はありません。標本平均は、母集団全体の平均値である母集団平均の推定値として用いられます。標本が大きく代表的であれば、推定値は母集団平均に近くなる可能性が高くなります。標本平均の信頼性は、標準誤差を用いて推定されます。標準誤差は、標本の分散を用いて計算されます。標本がランダムであれば、標準誤差は標本サイズとともに減少し、標本サイズが増加するにつれて標本平均の分布は正規分布に近づきます。
「標本平均」という用語は、統計学者が標本内の複数の変数の値(例えば、フォーチュン500企業の標本の売上高、利益、従業員数など)を調べている場合、平均値のベクトルを指すためにも使用できます。この場合、各変数の標本分散だけでなく、各変数ペア間の関係も示す標本分散共分散行列(または単に共分散行列)が存在します。3つの変数を考慮する場合、これは3×3の行列になります。標本共分散は、標本平均の推定値としての信頼性を判断するのに役立ち、母集団共分散行列の推定値としても役立ちます。
標本平均と標本共分散は、計算が容易であることやその他の望ましい特性から、標本における値の分布の位置とばらつきを表したり、母集団の値を推定したりするために、統計学において広く用いられている。
標本平均とは、標本中の変数の値の平均であり、それらの値の合計を値の数で割ったものです。数式を用いると、母集団から変数Xに関するN個の観測値の標本が抽出された場合、標本平均は次のようになります。
この定義によれば、標本(1, 4, 1)が母集団(1,1,3,4,0,2,1,0)から抽出された場合、標本平均は人口平均と比較するとたとえ標本がランダムであっても、完全に代表的であることはまれであり、たとえ標本がすべて同じ母集団から抽出されたものであっても、他の標本では標本平均が異なることになる。例えば、標本(2、1、0)の標本平均は1となる。
統計学者が 1つの変数ではなくK個の変数に関心があり、各観測値がK個の変数それぞれに対応する値を持つ場合、全体の標本平均は個々の変数に対するK個の標本平均から構成される。は、 j番目の確率変数 ( j = 1,..., K )に関するi番目の独立に抽出された観測値 ( i = 1,..., N )である。これらの観測値は、それぞれK個のエントリを持つN 個の列ベクトルに整理することができ、 K × 1 列ベクトルは、すべての変数のi番目の観測値を表す。( i =1,..., N )
サンプル平均ベクトルj番目の要素は列ベクトルですこれは、 j番目の変数のN個の観測値の平均値です。
したがって、標本平均ベクトルには各変数の観測値の平均が含まれており、次のように記述されます。
標本共分散行列はK × K行列である。エントリー付き
どこは、データのもととなる母集団のj番目の 変数とk番目の変数の間の共分散の推定値です。観測ベクトルに関して言えば、標本共分散は
あるいは、観測ベクトルを行列の列として配置すると、
これはK行N列の行列です。ここで、標本共分散行列は次のように計算できます。
どこは、1 のN行1ベクトルです 。観測値が列ではなく行として配置されている場合、は 1× K行ベクトルとなり、は、列jが変数jに関するN個の観測値のベクトルであるN × K行列であり、適切な場所に転置を適用すると、
ランダムベクトルの共分散行列と同様に、標本共分散行列も半正定値行列です。それを証明するには、任意の行列に対して次の式が成り立つことに注意してください。マトリックスは半正定値である。さらに、共分散行列は、そのランクが正定値である場合に限り正定値である。ベクトルはKです。
標本平均と標本共分散行列は、ランダムベクトルの平均と共分散行列の不偏推定値である。、 j番目の要素 ( j = 1, ..., K ) が確率変数のいずれかである行ベクトル。 [ 1 ]標本共分散行列は分母ではなくベッセルの補正の変形による:簡単に言うと、標本共分散は各観測値と標本平均の差に依存しますが、標本平均はすべての観測値に基づいて定義されるため、各観測値とわずかに相関しています。母平均がが既知であれば、類似の不偏推定値は
母集団平均を用いると、分母に。これは、確率と統計において、確率変数(大文字)と確率変数の実現値(小文字)を区別することがなぜ重要なのかを示す例です。
ガウス分布の場合も、分母にNが含まれます。Nが大きい場合、1/ Nと1/( N - 1)の比は1に近づくため、標本が大きい場合は最尤推定値は不偏推定値とほぼ等しくなります。
各確率変数について、標本平均は母平均の良い推定値となります。ここで「良い」推定値とは、効率的かつ不偏であることを意味します。もちろん、同じ分布から抽出された異なる標本は異なる標本平均を与え、したがって真の母平均の異なる推定値を与えるため、この推定値は母平均の真の値とは必ずしも一致しません。したがって、標本平均は定数ではなく確率変数であり、それゆえに独自の分布を持ちます。
μを母平均とし、母集団から抽出されたn個の独立した観測値のランダムサンプルの母集団分散は、標本平均の期待値である。
標本平均の分散は
サンプルが独立ではなく相関している場合は、擬似複製の問題を避けるために特別な注意を払う必要があります。
母集団が正規分布に従う場合、標本平均は以下のように正規分布に従います。
母集団が正規分布に従わない場合でも、nが大きくσ² / n < +∞であれば、標本平均は近似的に正規分布に従います。これは中心極限定理の結果です。
重み付きサンプルでは、各ベクトル( K個の確率変数それぞれに関する個々の観測値の各セット)には重みが割り当てられる。一般性を失うことなく、重みは正規化されていると仮定する。
(そうでない場合は、重みをその合計で割ります。)すると、重み付き平均ベクトルはは
すべての重みが同じ場合、加重平均と共分散は、上述の(偏りのある)標本平均と共分散に帰着します。
標本平均と標本共分散はロバスト統計量ではないため、外れ値に敏感です。ロバスト性は、特に実世界のアプリケーションでは望ましい特性であることが多いため、ロバストな代替手段が望ましいことが証明される可能性があります。特に、位置の標本中央値[ 3 ]や分散の四分位範囲(IQR)などの分位点ベースの統計量です。その他の代替手段には、トリミング平均やウィンザー化平均などのトリミングとウィンザー化があります。