用語集
E
- 基本的な事象
- 標本空間において結果が1つしかない事象。可能性の集合において、正確に1通りの方法で起こり得る可能性。例えば、標準的なトランプのデッキからカードを引く場合、「スペードのジャックを引く」は基本事象である(デッキ全体にスペードのジャックは1枚しかないため)が、「キングまたはエースを引く」は基本事象ではない(デッキにはキングが4枚、エースが4枚あるため)。
- 推定理論
- 統計学の一分野であり、ランダムな要素を含む測定された経験的データに基づいてパラメータの値を推定することを扱う。パラメータは、その値が測定データの分布に影響を与えるような形で、基礎となる物理的状況を記述する。推定者は、測定値を用いて未知のパラメータを近似しようとする。
- 推定器
- 既知のデータを用いて未知のパラメータを推定する関数。推定値は、その関数を特定のデータセットに実際に適用した結果である。例えば、平均値を推定値として用いることができる。
- 期待値
- 実験の各可能な結果の確率に、対応するペイオフまたは「価値」を掛けたものの合計。したがって、同じオッズの賭けを何度も繰り返した場合に、賭けごとに「期待される」平均額を表します。たとえば、公平な6面サイコロを振った場合の期待値は3.5です。この概念は、直感的には、特定の手順または実験のすべての可能な結果の加重平均の一般化であり、実験の多数の独立した実現の算術平均と見なすことができます。確率変数Xの期待値は、期待値演算子に対して通常E(X)と表記され、
(mu)はパラメータを表します。 - 実験
- 無限に繰り返すことができ、かつ明確に定義された一連の結果をもたらすあらゆる手順。
- 指数族
- イベント
- 手順や実験の標本空間(つまり、起こりうる結果)の部分集合で、確率を割り当てることができるもの。例えば、サイコロを振った場合、「3が出る」ことは事象であり(サイコロが公平であれば確率は1/6 )、同様に「5または6が出る」ことも事象である(確率は1/3 )。
H
- ヒストグラム
- 数値データの分布を概略的にグラフで表したもの。ヒストグラムは、値の全範囲を連続する重複しない区間に分割し、各区間にデータセットのインスタンスがいくつ含まれるかを数えることで、この分布を表示します。
ヒストグラムレストランで渡されたチップの分布を示す
J
- 共同分布
- 2つの確率変数XとYが与えられたとき、 XとYの同時分布とは、XとYが同時に存在する確率分布のことである。
- 同時確率
- 2つの事象が同時に起こる確率。AとBの同時確率は次のように表されます。
または
。
K
- カルマンフィルター
- カーネル
- カーネル密度推定
- 尖度
- 実数値確率変数の確率分布の「裾野の広さ」を測る指標。尖度を定量化、推定、解釈する方法は様々ですが、一般的な解釈としては、尖度は分布の形状がまれに発生する極端な観測値(外れ値)によってどの程度影響を受けるかを示す指標です。この場合、尖度が高いほど、分散の大部分が、頻繁に発生する中程度の偏差ではなく、まれに発生する極端な偏差によるものであることを意味します。
L
- Lモーメント
- 大数の法則(LLN)
- 同じ実験を多数回繰り返して得られた結果の平均値は、その実験の期待値に近くなり、試行回数が増えるほど期待値に近づく傾向があるという定理。この法則は、いかなる実験結果も信頼できるとみなすためには十分な数の試行が必要であることを示唆しており、ひいては、少数の試行しか行わないと、実験結果の解釈が不完全または誤解を招く可能性があることを示唆している。
大数の法則を示すグラフ公平なサイコロを繰り返し振った結果(緑線)は、理論上の期待値に急速に近づく。サイコロを振る回数が増えるにつれて、1回のロール(青線)の結果が変化する。- 尤度関数
- 条件付き確率関数は、第 1 引数を固定した状態で、第 2 引数の関数として考えられます。たとえば、1 からnまでの番号が振られたn 個のボールが入った袋から、番号kのボールを取り出すことを想像してみてください。確率変数Nの尤度関数は、 n個のボールがあるという条件の下でkを取り出す確率として記述できます。尤度は、n がk以上の場合1/ n 、 nがk未満の場合 0 になります。確率分布関数とは異なり、この尤度関数は標本空間で合計が 1 になることはありません。
- 損失関数
- 尤度比検定
R
- 確率変数
- 確率空間上の可測関数であり、多くの場合実数値をとる。確率変数の分布関数は、その変数の様々な値の確率を表す。確率変数の平均と分散も導出できる。離散確率変数および連続確率変数も参照のこと。
- ランダム化ブロックデザイン
- 範囲
- データセット内のすべてのデータを含む最小区間の長さ。データセットに含まれる最大値と最小値の算術差として計算され、データに使用されている単位と同じ単位で表されます。この範囲は、データセットの統計的なばらつきの尺度となります。
- 再帰的ベイズ推定
- 回帰分析
- 従属変数と1つ以上の誤差のない独立変数との間の関係を推定する一連の統計的手法を用いるデータ分析または統計モデル。このようなモデルの最も一般的な例は線形回帰であり、特定の数学的基準に従ってデータ点の集合に最もよく適合する直線の式を計算し、データ点のグラフ上にプロットする。その他の形式の回帰では、関連する手法を用いて代替パラメータを推定したり、さまざまな非線形モデルから条件付き期待値を推定したりする。
- 反復測定デザイン
- 応答変数
- 実験的処置、または1つ以上の他の変数の変化によって値が影響を受ける、または影響を受けると予想される変数。たとえば、6か月間特定の食事療法を行った後のコレステロール値など。応答変数は、研究対象の何らかの現象に応じて変化または反応する変数です。この用語は、従属変数とほぼ同義で使われることが多い。[ 1 ]
- 制限付きランダム化
- 頑健な統計
- 丸め誤差
T
- 検定統計量
- 整然としたデータ
- 「各変数は列、各観測値は行、各観測単位の種類は表」となるようにデータを構造化するための標準。これはコッドの第3正規形に相当する。[ 4 ]
- 時間領域
- 時系列
- 時系列分析
- 時系列予測
- 治療
- 統計研究において概念的に操作可能な変数。例えば、健康研究では、特定の食事療法に従うことは治療であるが、年齢は治療ではない。[ 1 ]
- トライアル
- 実験が固定数の反復から構成される場合、個々の反復をそれぞれ指すことができる。例えば、1回からn回(例えば17回)のコイン投げからなる実験を考えてみよう。この場合、実験全体が17回の1の反復から構成されているため、混乱を避けるために1回の試行を1試行と呼ぶことができる。
- トリミング推定器
- 第一種過誤と第二種過誤
U
- 単峰性確率分布
- ユニット
- 統計的研究において、治療が割り当てられる対象物。例えば、タバコを吸うことの影響を調べる研究では、対象物は人となる。[ 1 ]
参考文献
- 1 2 3 4 5 Reiter, Jerome (2000年1月24日). 「統計学を用いて因果関係を決定する」. American Mathematical Monthly . 107 (1): 24–32 . doi : 10.2307/2589374 . JSTOR 2589374 .
- 1 2 Pav Kalinowski. 信頼区間(CI)と効果量推定の理解。心理科学協会オブザーバー 2010年4月10日。http ://www.psychologicalscience.org/index.php/publications/observer/2010/april-10/understanding-confidence-intervals-cis-and-effect-size-estimation.html
- ↑ムーア、デイビッド;マッケイブ、ジョージ(2003)。統計学の実践入門(第4版)。ニューヨーク:WHフリーマン社、438ページ。ISBN 9780716796572。
- ↑ Wickham, Hadley (2014). "Tidy Data" (PDF) . Journal of Statistical Software . 59 (10). doi : 10.18637/jss.v059.i10 .
外部リンク
- 「DOE用語集」、NIST/SEMATECH統計手法電子ハンドブック、NIST 、 2009年2月28日取得
- 統計用語集、statistics.com 、 2009年2月28日取得
- 確率と統計の初期使用例に関するページ(サウサンプトン大学)