
統計学では、標本最大値と標本最小値(最大観測値と最小観測値とも呼ばれる)は、標本の最大値と最小値です。[ 1 ]これらは基本的な要約統計量であり、 5数要約やボウリーの7桁要約、およびそれに関連する箱ひげ図などの記述統計で使用されます。
最小値と最大値は、最初の順序統計量と最後の順序統計量です(サンプルサイズがnの場合、それぞれX (1)とX ( n )と表記されることが多い)。
サンプルに外れ値が存在する場合、それらは極端に高いか低いかによって、必ずサンプルの最大値または最小値、あるいはその両方を含みます。ただし、サンプルの最大値と最小値が他の観測値から異常に離れていない場合は、必ずしも外れ値であるとは限りません。
標本最大値と標本最小値は、最も頑健性の低い統計量である。つまり、外れ値に対して最も敏感である。
これは利点にも欠点にもなり得ます。極端な値が(測定誤差ではなく)現実のものであり、堤防建設や経済的損失といった極値理論の応用例のように、実際に重大な影響を及ぼす場合、外れ値(標本極値に反映される)は重要になります。一方、外れ値が実際の結果にほとんど、あるいは全く影響を与えない場合、標本極値のような頑健性の低い統計量を用いると統計が不明瞭になるだけであり、他の分位数などの頑健な代替手段を用いるべきです。例えば、10パーセンタイルと90パーセンタイル(第1十分位と第4十分位)は、より頑健な代替手段です。
標本のすべての要素を用いるあらゆる統計量の構成要素であることに加えて、標本極値は、ばらつきの尺度である範囲や、位置の尺度である中間範囲の重要な部分でもあります。また、標本極値は最大絶対偏差を実現します。つまり、標本極値のうちの1つは、任意の点から最も遠い点であり、特に中央値や平均値などの中心の尺度から最も遠い点となります。
標本集合の場合、最大値関数は滑らかではなく、したがって微分不可能である。統計学で発生する最適化問題では、多くの場合、標本集合の最大値に近い滑らかな関数で近似する必要がある。
例えば、滑らかな最大値、
これは標本最大値の良い近似値である。
標本最大値と標本最小値は基本的な要約統計量であり、最も極端な観測値を示し、5数要約と7数要約の一種、およびそれに関連する箱ひげ図で使用されます。
標本の最大値と最小値は、ノンパラメトリックな予測区間を提供する。母集団からの標本、あるいはより一般的には交換可能な確率変数の系列において、各観測値は最大値または最小値となる確率が等しい。
したがって、サンプルがある場合そして別の観察結果を選ぶすると、これはこれまでに観測された最大値である確率、これまでに観測された最小値である確率、したがって他の当時、サンプル最大値とサンプル最小値の間にある したがって、標本最大値と標本最小値をそれぞれMとmとすると、[ m , M ]の予測区間。
例えば、n = 19 の場合、[ m , M ] は 18/20 = 90% の予測区間を示します。つまり、90% の確率で、20 番目の観測値はこれまでに観測された最小値と最大値の間に収まります。同様に、n = 39 の場合は 95% の予測区間、n = 199 の場合は 99% の予測区間となります。
外れ値に敏感であるため、データがクリーンでない限り、標本極値は推定値として信頼性高く使用することはできません。堅牢な代替手段としては、最初のデシルと最後のデシルがあります。
しかし、クリーンなデータや理論的な設定においては、特に平坦な分布の場合、非常に優れた推定値となることがあり、小規模なデータセットでは中間値が最も効率的な推定値となる。
しかし、正規分布や尖度の高い分布などの中尖分布の位置推定には非効率的です。
1つまたは2つの未知の端点を持つ一様分布からの非復元抽出の場合(したがってNが不明な場合、またはMとNの両方が未知の場合、標本最大値、またはそれぞれ標本最大値と標本最小値は、未知のエンドポイントに対する十分かつ完全な統計量です。したがって、これらから導出される不偏推定量はUMVU推定量になります。
上端点のみが不明な場合、標本最大値は母集団最大値の偏りのある推定値ですが、不偏推定値は(ここでmは標本最大値、kは標本サイズ)はUMVU推定量です。詳細はドイツ戦車問題を参照してください。
両端点が不明な場合、標本範囲は母集団範囲の偏りのある推定値となりますが、上記の最大値の場合と同様に補正することで、UMVU推定値が得られます。
両端点が不明な場合、中間値は区間の中央値(ここでは母集団の中央値、平均値、または中間値に相当)の不偏推定量(したがって UMVU 推定量)となります。
標本極値が十分統計量である理由は、極値でない標本の条件付き分布が、標本の最大値と最小値の間の均一区間の分布と一致するからである。つまり、端点が固定されると、内部の点の値は追加情報を提供しない。

標本極値は、単純な正規性検定、特に尖度検定に使用できます。標本最大値と最小値のt統計量を計算し(標本平均を引いて標本標準偏差で割ります)、標本サイズに対して異常に大きい場合(3シグマルールと表、より正確にはスチューデントのt分布に従って)、標本分布の尖度は正規分布の尖度から大きく逸脱していることになります。
例えば、日常的なプロセスでは、3σの事象は1年に1回(暦日換算で1年半に1回)、4σの事象は平均して暦日換算で40年に1回、営業日換算で60年に1回(生涯に1回)、5σの事象は5,000年に1回(記録された歴史の中で1回)、6σの事象は150万年に1回(実質的に発生しない)発生すると予想されます。したがって、標本極値が平均値から6σ離れている場合、正規性の著しい破綻が生じていることになります。
さらに、このテストは複雑な統計学を用いなくても非常に簡単に説明できる。
例えば、尖度リスクに直面した場合などに、これらの正規性検定を適用することができる。

標本極値は極値理論において主に2つの役割を果たす。
しかし、標本極値を指針として用いる際には注意が必要です。裾の重い分布や非定常過程においては、極端な事象は、これまで観測されたどの事象よりもはるかに極端なものとなる可能性があります。この点については、ブラックスワン理論で詳しく説明されています。