統計理論において、U統計量とは、固定サイズのすべてのタプルに特定の関数を適用した結果の平均として定義される統計量のクラスである。「U」は不偏(inbiased)の略である。 初等統計学では、U統計量は最小分散不偏推定量を作成する際に自然に現れる。
U統計理論では、推定可能なパラメータ(または統計関数)の各不偏推定量から、大きなクラスの確率分布に対して最小分散不偏推定量を導出できます。[ 1 ] [ 2 ]推定可能なパラメータは、母集団の累積確率分布の測定可能な関数です。たとえば、すべての確率分布に対して、母集団の中央値は推定可能なパラメータです。U統計理論は、一般的なクラスの確率分布に適用されます。
特定のパラメトリック族のために最初に導出された多くの統計量は、一般分布の U 統計量として認識されています。ノンパラメトリック統計では、U 統計量の理論は、統計的手順 (推定量や検定など) や、そのような量の漸近正規性および分散 (有限サンプルの場合) に関連する推定量を確立するために使用されます。[ 3 ]この理論は、ランダムグラフなどの確率過程だけでなく、より一般的な統計を研究するためにも使用されています。[ 4 ] [ 5 ] [ 6 ]
問題が独立同分布の確率変数を含み、特定のパラメータの推定が必要であるとします。少数の観測値のみに基づいて単純な不偏推定値を構築できると仮定します。これは、与えられた数の観測値に基づく基本推定量を定義します。たとえば、1つの観測値自体が平均の不偏推定値であり、2つの観測値を使用して分散の不偏推定値を導出できます。この推定量に基づくU統計量は、サブサンプルに適用された基本推定量の平均値(全観測値から与えられたサイズのすべての組み合わせ選択にわたる)として定義されます。
Pranab K. Sen (1992) は、U 統計を導入し、それに関連する理論を提示したWassily Hoeffding (1948) の論文のレビューを提供し、その中で Sen は、統計理論における U 統計の重要性を概説しています。 Sen は、 [ 7 ]「 Hoeffding (1948) の影響は現在圧倒的であり、今後も続く可能性が非常に高い」と述べています。U 統計の理論は、[ 8 ]独立で同一の分布を持つ確率変数やスカラー確率変数に限定されるものではないことに注意してください。[ 9 ]
Hoeffding (1948) による U 統計量という用語は、次のように定義されます。
させては実数または複素数のいずれかとし、になるの -値関数次元変数。各関連するU統計量は値の平均として定義されるセットを越えての-インデックスのタプル個別のエントリがあります。正式には、
特に、対称であるため、上記は簡略化され、
今どこにいるのかは、のサブセットを表します。増加するタプルの集合。
各U統計量は必然的に対称関数である。
U統計量は、統計学の研究、特にホフディングの独立同分布確率変数の文脈、あるいはより一般的には、有限母集団からの単純無作為抽出のような交換可能なシーケンスにおいて非常に自然なものであり、その定義特性は「平均における継承」と呼ばれています。
フィッシャーのk統計量とテューキーの多項式U統計量は、同次多項式U統計量の例である(フィッシャー、1929年;テューキー、1950年)。
サイズNの母集団から抽出されたサイズnの単純無作為標本φに対して、U 統計量は、標本値ƒ n ( x φ )の平均が母集団値ƒ N ( x ) と完全に等しいという性質を持つ。
いくつかの例:U統計量は標本平均です。
もしU統計量はペアワイズ偏差の平均値である。 定義済み。
もしU統計量は標本分散である 除数付き定義済み。
3番目-統計、サンプル歪度は次のように定義されます。はU統計量です。
以下の事例は重要な点を浮き彫りにしています。は3つの値の中央値です。は中央値ではありません値。ただし、これは母集団の中央値ではなく、3 つの値の中央値の期待値の最小分散不偏推定値です。同様の推定値は、確率分布族のパラメータが確率加重モーメントまたはL モーメントによって推定される場合に中心的な役割を果たします。