統計学では、データはさまざまな統計データ型、たとえばカテゴリデータ(国など)、方向データ(角度または方向、風の測定値など)、カウントデータ(イベントの整数)、または実間隔(温度の測定値など) を持つことができます。データ型は統計学の基本的な概念であり、変数を記述するために論理的に使用できる確率分布の種類、変数に対して許容される操作、変数を予測するために使用される回帰分析の種類などを制御します。データ型の概念は測定レベルの概念に似ていますが、より具体的です。たとえば、カウントデータには、非負の実数値データに必要な分布 (ポアソン分布や二項分布など)が必要ですが、どちらも同じ測定レベル (比率スケール) に分類されます。
測定レベルの分類法を作成するために、さまざまな試みがなされてきました。心理物理学者のスタンレー・スミス・スティーブンスは、名義尺度、順序尺度、間隔尺度、比率尺度を定義しました。名義尺度では、値の間に意味のある順位順序がなく、1 対 1 の変換が可能です。順序尺度では、連続する値の間には不正確な差がありますが、それらの値には意味のある順序があり、順序を維持する変換が可能です。間隔尺度では、測定値間に意味のある距離が定義されていますが、ゼロ値は任意であり (経度や摂氏または華氏での温度測定の場合のように)、線形変換が可能です。比率尺度では、意味のあるゼロ値と異なる測定値間の距離の両方が定義されており、再スケーリング変換が可能です。
名目または順序の測定のみに準拠する変数は、数値的に適切に測定できないため、カテゴリ変数としてグループ化されることがあります。一方、比率と間隔の測定は、数値の性質上、離散的または連続的になり得る量的変数としてグループ化されます。このような区別は、コンピューターサイエンスのデータタイプと緩く相関していることが多く、二値カテゴリ変数はブールデータ型で表され、多値カテゴリ変数は任意に割り当てられた整数で積分データ型で表され、連続変数は浮動小数点計算を伴う実数データ型で表されます。ただし、コンピューターサイエンスのデータタイプを統計データタイプにマッピングするかどうかは、後者のどの分類が実装されているかによって異なります。
他の分類法も提案されている。例えば、MostellerとTukey(1977)[1]は、等級、ランク、カウントされた分数、カウント、量、残高を区別した。Nelder(1990)[2]は、連続カウント、連続比率、カウント比率、データのカテゴリモードについて説明した。Chrisman(1998)、 [3] van den Berg(1991)[4]も参照。
異なる種類の測定手順から得られたデータに異なる種類の統計手法を適用することが適切かどうかという問題は、変数の変換と研究問題の正確な解釈に関する問題によって複雑化します。「データとそれが記述するものとの関係は、特定の種類の統計的記述が、いくつかの変換の下で不変ではない真理値を持つ可能性があるという事実を反映しているだけです。変換を検討するのが賢明かどうかは、答えようとしている質問によって異なります。」(Hand、2004、p. 82)。[5]
シンプルなデータ型
次の表は、さまざまな単純なデータ型、関連する分布、許容される演算などを分類したものです。論理的に可能な値に関係なく、これらのデータ型はすべて、通常、実数を使用してコード化されます。これは、ランダム変数の理論では、これらのデータ型が実数を保持すると明示的に想定されることが多いためです。
多変量データ型
単一の数値では記述できないデータは、実数値のランダム変数のランダム ベクトルに押し込まれることがよくありますが、それらを独自に扱う傾向が高まっています。例をいくつか示します。
- ランダム ベクトル。個々の要素は相関している場合も、そうでない場合もあります。相関ランダム ベクトルを表すために使用される分布の例には、多変量正規分布と多変量 t 分布があります。一般に、任意の要素と他の任意の要素の間には任意の相関関係がある可能性がありますが、これは特定のサイズを超えると管理不能になることが多く、相関要素に対するさらなる制限が必要になります。
- ランダム行列。ランダム行列は線形に配置してランダムベクトルとして扱うことができますが、これは異なる要素間の相関関係を表す効率的な方法ではない場合があります。行列正規分布やウィシャート分布など、一部の確率分布はランダム行列専用に設計されています。
- ランダムシーケンス。これらはランダムベクトルと同じものと見なされることもありますが、他の場合には、この用語は各ランダム変数が近くの変数とのみ相関している場合に特に適用されます (マルコフモデルの場合など)。これはベイズネットワークの特殊なケースであり、遺伝子シーケンスや長いテキスト文書などの非常に長いシーケンスによく使用されます。隠れマルコフモデルなど、このようなシーケンス用に特別に設計されたモデルがいくつかあります。
- ランダム プロセス。これはランダム シーケンスに似ていますが、シーケンスの長さが不定または無限であり、シーケンス内の要素が 1 つずつ処理されます。これは、時系列として記述できるデータ(連続する日の株価など) によく使用されます。ランダム プロセスは、離散的な間隔ではなく、連続的に変化する値 (連続する瞬間の温度など) をモデル化するためにも使用されます。
- ベイズ ネットワーク。これは、グラフィカル モデルを使用して記述されたランダム変数の集合に対応し、個々のランダム変数は、変数を近くの変数に関連付ける条件付き分布を使用してグラフ構造でリンクされます。
- ランダム フィールド。ランダム プロセスを複数の次元に拡張したもので、物理学では一般的です。統計力学では、 3 次元 (時間を含めると 4 次元) にわたって連続的に変化する力や電場などの特性を記述するために使用されます。
これらの概念はさまざまな科学分野に由来しており、頻繁に重複して使用されています。その結果、複数の概念が同じ問題に適用できる場合が非常に多くあります。
参考文献
- ^ Mosteller, F. ; Tukey, JW (1977).データ分析と回帰. Addison-Wesley. ISBN 978-0-201-04854-4。
- ^ Nelder, JA (1990)。「統計情報の分析と解釈をコンピュータ化するために必要な知識」。エキスパートシステムと人工知能:データに関する情報の必要性。ロンドン:図書館協会。OCLC 27042489 。
- ^ Chrisman, Nicholas R. (1998). 「地図作成における測定レベルの再考」.地図作成と地理情報科学. 25 (4): 231–242. Bibcode :1998CGISy..25..231C. doi :10.1559/152304098782383043.
- ^ ヴァン デン バーグ、G. (1991)。分析方法の選択。ライデン: DSWO プレス。ISBN 978-90-6695-062-7。
- ^ Hand, DJ (2004).測定理論と実践: 定量化による世界. Wiley. p. 82. ISBN 978-0-470-68567-9。
