
数理統計学は、統計データを収集するための技術ではなく、数学の一分野である確率論を統計学に応用したものです。これに使われる具体的な数学的技術には、数学的解析、線型代数、確率解析、微分方程式、測度論などがあります。[1] [2]
導入
統計データ収集は、研究の計画、特にランダム化実験の設計とランダムサンプリングを使用した調査の計画に関係しています。データの初期分析は、研究を実施する前に指定された研究プロトコルに従うことがよくあります。研究のデータは、最初の結果からヒントを得た二次仮説を検討したり、新しい研究を提案したりするために分析することもできます。計画された研究のデータの二次分析では、データ分析のツールが使用され、これを行うプロセスは数理統計です。
データ分析は次のように分けられます。
- 記述統計– データを記述する、つまりデータとその典型的な特性を要約する統計の一部。
- 推論統計– データから結論を導き出す統計の一部(データに何らかのモデルを使用)。たとえば、推論統計には、データのモデルの選択、データが特定のモデルの条件を満たしているかどうかの確認、および関連する不確実性の定量化(たとえば、信頼区間の使用)が含まれます。
データ分析ツールはランダム化研究のデータで最も効果的に機能しますが、他の種類のデータにも適用されます。たとえば、自然実験や観察研究のデータでは、推論は統計学者が選択したモデルに依存するため、主観的になります。[3] [4]
トピック
数理統計学における重要なトピックには次のようなものがある: [5] [6]
確率分布
確率分布は、ランダムな実験、調査、または統計的推論の手順の可能性のある結果の測定可能な各サブセットに確率を割り当てる関数です。例としては、サンプル空間が数値的でない実験(分布はカテゴリ分布になります)、サンプル空間が離散ランダム変数でエンコードされ、分布を確率質量関数で指定できる実験、およびサンプル空間が連続ランダム変数でエンコードされ、分布を確率密度関数で指定できる実験が挙げられます。連続時間で定義される確率過程を含むようなより複雑な実験では、より一般的な確率尺度の使用が必要になる場合があります。
確率分布は、単変量または多変量のいずれかです。単変量分布は、単一のランダム変数がさまざまな代替値を取る確率を与えます。多変量分布 (結合確率分布) は、ランダムベクトル(2 つ以上のランダム変数のセット) がさまざまな値の組み合わせを取る確率を与えます。重要でよく見られる単変量確率分布には、二項分布、超幾何分布、および正規分布があります。多変量正規分布は、よく見られる多変量分布です。
特別配布
- 正規分布、最も一般的な連続分布
- ベルヌーイ分布、単一のベルヌーイ試行の結果(成功/失敗、はい/いいえなど)
- 二項分布、独立した発生の総数が一定である場合の「肯定的な発生」(成功、賛成票など)の数
- 負の二項分布、二項分布型の観測値の場合、関心のある量は、与えられた数の成功が発生する前に失敗した回数である。
- 幾何分布。二項分布型の観測値ですが、関心のある量は最初の成功の前の失敗の数です。負の二項分布の特殊なケースで、成功の数は 1 です。
- 離散一様分布、有限の値の集合(例えば、公平なサイコロの出目)
- 連続一様分布、連続的に分布する値の場合
- ポアソン分布、与えられた期間におけるポアソン型イベントの発生回数
- 次のポアソン型イベントが発生するまでの時間に対する指数分布
- ガンマ分布、次のk個のポアソン型イベントが発生するまでの時間
- カイ二乗分布、標準正規変数の二乗和の分布。例えば、正規分布するサンプルのサンプル分散に関する推論に役立ちます(カイ二乗検定を参照)。
- スチューデントのt分布は、標準正規変数と尺度化されたカイ2乗変数の平方根の比の分布です。未知の分散を持つ正規分布サンプルの平均に関する推論に役立ちます(スチューデントのt検定を参照)。
- ベータ分布、単一の確率(0から1までの実数)の場合。ベルヌーイ分布および二項分布と共役です。
統計的推論
統計的推論は、観測誤差や標本変動などのランダム変動の影響を受けるデータから結論を導き出すプロセスです。[7]推論と帰納の手順のこのようなシステムの初期要件は、システムが明確に定義された状況に適用されたときに合理的な答えを生成し、さまざまな状況に適用できるほど一般性があることです。推論統計は、サンプルデータを使用して仮説をテストし、推定を行うために使用されます。記述統計はサンプルを記述しますが、推論統計はサンプルが表すより大きな集団についての予測を推論します。
統計的推論の結果は、「次に何をすべきか」という質問に対する答えである可能性があります。これは、さらなる実験や調査を行うかどうかの決定、または何らかの組織や政府の政策を実施する前に結論を出すかどうかの決定である可能性があります。ほとんどの場合、統計的推論は、何らかの形式のランダム サンプリングによって対象の母集団から抽出されたデータを使用して、母集団に関する命題を作成します。より一般的には、ランダム プロセスに関するデータは、有限期間におけるその観察された動作から取得されます。推論を行うパラメーターまたは仮説が与えられた場合、統計的推論では、次のものが最もよく使用されます。
- ランダム化が使用された場合に既知となる、データを生成すると想定されるランダムプロセスの統計モデル、および
- ランダムプロセスの特定の実現、つまりデータのセット。
回帰
統計学において、回帰分析は変数間の関係を推定する統計的プロセスです。従属変数と 1 つ以上の独立変数の関係に焦点が当てられ、複数の変数をモデル化および分析する多くの方法が含まれます。より具体的には、回帰分析は、独立変数のいずれか 1 つが変化し、他の独立変数が固定されている場合に、従属変数 (または「基準変数」) の標準値がどのように変化するかを理解するのに役立ちます。最も一般的には、回帰分析は、独立変数が与えられた場合の従属変数の条件付き期待値、つまり独立変数が固定されている場合の従属変数の平均値を推定します。あまり一般的ではありませんが、独立変数が与えられた場合の従属変数の条件付き分布の分位点、またはその他の位置パラメータに焦点が当てられます。すべての場合において、推定対象は、回帰関数と呼ばれる独立変数の関数です。回帰分析では、確率分布で記述できる回帰関数の周りの従属変数の変化を特徴付けることも重要です。
回帰分析を実行するための多くの手法が開発されています。線型回帰などのよく知られた手法はパラメトリックであり、回帰関数はデータから推定される有限個の未知のパラメータ(通常の最小二乗法など)に基づいて定義されます。ノンパラメトリック回帰は、回帰関数が指定された関数セット(無限次元になる場合もあります)に収まるようにする手法を指します。
ノンパラメトリック統計
ノンパラメトリック統計は、パラメータ化された確率分布のファミリーに基づかない方法でデータから計算された値です。記述統計と推論統計の両方が含まれます。一般的なパラメータは期待値、分散などです。パラメトリック統計とは異なり、ノンパラメトリック統計は評価される変数の確率分布について仮定を立てません。 [8]
ノンパラメトリック法は、順位付けされた集団(1 から 4 つの星が付けられた映画レビューなど)を調査するために広く使用されています。嗜好を評価する場合など、データに順位付けがあっても明確な数値的解釈がない場合には、ノンパラメトリック法の使用が必要になることがあります。測定レベルに関して、ノンパラメトリック法は「順序」データをもたらします。
ノンパラメトリック法は仮定が少ないため、パラメトリック法に比べて適用範囲がはるかに広くなります。特に、対象となるアプリケーションについてあまり知られていない状況でも適用できます。また、仮定が少ないため、ノンパラメトリック法はより堅牢です。
ノンパラメトリック法の欠点の1つは、仮定に依存しないため、一般的にパラメトリック法よりも検出力が低いことです。 [9] 検出力の低いノンパラメトリック検定は、サンプルサイズが小さい場合によく使用されるため問題があります。[9]多くのパラメトリック法は、ネイマン・ピアソンの補題や尤度比検定 などの方法を通じて、最も強力な検定であることが証明されています。
ノンパラメトリック法を使用するもう 1 つの理由は、そのシンプルさです。パラメトリック法の使用が正当化される場合でも、場合によってはノンパラメトリック法の方が使いやすいことがあります。このシンプルさと堅牢性の高さにより、ノンパラメトリック法は不適切な使用や誤解の余地が少ないと一部の統計学者は考えています。
統計学、数学、数理統計学
数理統計は、統計学の重要なサブセットです。統計理論家は数学を用いて統計手順を研究し、改善しており、統計研究では数学的な疑問が生じることがよくあります。
ガウス、ラプラス、CS パースなどの数学者や統計学者は、確率分布と損失関数(または効用関数)を用いた決定理論を使用していました。統計的推論に対する決定理論的アプローチは、アブラハム・ウォルドとその後継者によって再活性化され[10] [11] [12] [ 13] [14] [15 ] [16] 、科学計算、分析、最適化を広範に使用しています。実験の設計には、統計学者は代数と組合せ論を使用します。しかし、統計の実践は確率と決定理論に依存することが多いため、その適用は議論の余地があります[4]
参照
参考文献
- ^ Kannan, D.; Lakshmikantham, V. 編 (2002).確率解析とその応用ハンドブック。ニューヨーク: M. Dekker。ISBN 0824706609。
- ^ シェルビッシュ、マーク・J. (1995).統計理論(訂正第2刷)。ニューヨーク:シュプリンガー。ISBN 0387945466。
- ^ フリードマン、DA ( 2005)統計モデル:理論と実践、ケンブリッジ大学出版局。ISBN 978-0-521-67105-7
- ^ ab フリードマン、デイビッド A. (2010)。コリアー、デイビッド、セコン、ジャスジート S.、スターク、フィルプ B. (編)。統計モデルと因果推論:社会科学との対話。ケンブリッジ大学出版局。ISBN 978-0-521-12390-7。
- ^ Hogg, RV, A. Craig、JW McKean. 「数理統計学入門」(2005年)。
- ^ Larsen, Richard J. および Marx, Morris L. 「数理統計学とその応用入門」(2012 年)。Prentice Hall。
- ^ Upton, G., Cook, I. (2008) Oxford Dictionary of Statistics、OUP。ISBN 978-0-19-954145-4
- ^ 「ノンパラメトリック手法の研究」。カーネギーメロン大学。 2022年8月30日閲覧。
- ^ ab 「ノンパラメトリック検定」。sphweb.bumc.bu.edu 。2022年8月31日閲覧。
- ^ Wald, Abraham (1947).逐次分析. ニューヨーク: John Wiley and Sons. ISBN 0-471-91806-7
ドーバー再版、2004年:
ISBN
0-486-43912-7
を参照 - ^ Wald, Abraham (1950).統計的決定関数. John Wiley and Sons, ニューヨーク.
- ^ レーマン、エリック(1997年)。統計的仮説のテスト(第2版)。ISBN 0-387-94919-4。
- ^ レーマン、エリック、カセラ、ジョージ(1998)。点推定の理論(第2版)。ISBN 0-387-98502-6。
- ^ Bickel, Peter J. ; Doksum, Kjell A. (2001).数理統計学: 基礎と選択トピックス. 第 1 巻 (第 2 版 (2007 年更新)). Pearson Prentice-Hall.
- ^ ル・カム、ルシアン(1986)。統計的意思決定理論における漸近的手法。シュプリンガー・フェアラーク。ISBN 0-387-96307-3。
- ^ Liese, Friedrich & Miescke, Klaus-J. (2008).統計的意思決定理論:推定、テスト、選択。Springer。
さらに読む
- ボロフコフ、AA(1999)。数理統計学。CRCプレス。ISBN 90-5699-018-7
- 確率と統計の仮想実験室(アラバマ大学ハンツビル校)
- StatiBot は、統計テストに関するインタラクティブなオンライン エキスパート システムです。
- レイ、マノハール。シャルマ、ハー・スワラップ (1966)。数学的統計学。ラム・プラサド&サンズ。 978-9383385188出版年月日
