
統計学において、データ変換とは、データセットの各点に決定論的な数学関数を適用することです。つまり、各データ点z iは、変換された値y i = f ( z i ) に置き換えられます。ここで、fは関数です。変換は通常、データが適用される統計的推論手順の仮定により近いものとなるように、またはグラフの解釈性や見栄えを向上させるために適用されます。
ほとんどの場合、データ変換に使用される関数は可逆であり、一般的には連続関数です。変換は通常、比較可能な測定値の集合に適用されます。たとえば、ある通貨単位での人々の所得に関するデータを扱う場合、各個人の所得値を対数関数で変換するのが一般的です。
データの変換方法、あるいは変換を適用すべきかどうかについての指針は、実施する特定の統計分析から得られるべきである。たとえば、母平均の近似95%信頼区間を構築する簡単な方法は、標本平均に標準誤差の2単位を加算または減算することである。ただし、ここで使用されている定数係数2は正規分布に特有のものであり、標本平均がほぼ正規分布に従う場合にのみ適用可能である。中心極限定理によれば、多くの場合、標本サイズが十分に大きい場合、標本平均は正規分布に従う。しかし、母集団が大きく歪んでおり、標本サイズがせいぜい中程度である場合、中心極限定理による近似は不十分であり、結果として得られる信頼区間はおそらく誤ったカバレッジ確率を持つことになる。したがって、データに大きな歪みがある証拠がある場合、信頼区間を構築する前にデータを対称分布に変換するのが一般的である[ 1 ]。必要に応じて、分位数(中央値など)の信頼区間を、データに適用した変換の逆変換を使用して元のスケールに戻すことができます。[ 2 ] [ 3 ]
データは、視覚化しやすくするために変換することもできます。たとえば、世界の国々を点とし、各国の面積と人口をデータ値とする散布図があるとします。変換されていないデータ(たとえば、面積は平方キロメートル、人口は人数)を使用してプロットを作成すると、ほとんどの国はグラフの左下隅に点が密集してプロットされます。面積や人口が非常に大きい少数の国は、グラフの大部分にまばらに分布します。単に単位を再スケーリングする(たとえば、千平方キロメートルまたは百万人)だけでは、この状況は変わりません。しかし、面積と人口の両方を対数変換すると、グラフ上の点はより均一に分布します。
データ変換を適用するもう1つの理由は、正式な統計分析や視覚化を行わない場合でも、解釈性を向上させるためです。たとえば、車の燃費を比較する場合を考えてみましょう。これらのデータは通常、「1リットルあたりのキロメートル」または「1ガロンあたりのマイル」で表されます。しかし、ある車を運転した場合と別の車を運転した場合で、1年間にどれだけ燃料が余分に消費されるかを評価することが目的であれば、逆関数を適用して変換したデータ(1キロメートルあたりのリットル、または1マイルあたりのガロン)を扱う方が自然です。
データ変換は、元のデータが線形回帰の仮定の 1 つ以上を満たさない場合、線形回帰によるモデリングに適したデータにするための是正措置として使用できます。[ 4 ]例えば、最も単純な線形回帰モデルでは、Yの期待値(予測される応答変数) と各独立変数(他の独立変数が固定されている場合) の間に線形関係があると仮定します。線形性が近似的にでも成り立たない場合、回帰モデルの独立変数または従属変数のいずれかを変換して線形性を改善できる場合があります。[ 5 ]例えば、元の独立変数の二次関数を追加すると、Yの期待値との線形関係が得られ、線形回帰の特殊なケースである多項式回帰モデルになります。
線形回帰のもう 1 つの仮定は等分散性、つまり予測変数の値に関係なく誤差の分散が同じでなければならないことです。この仮定が破られた場合 (つまり、データが不均一分散である場合)、 Yのみの変換、またはX (予測変数) とYの両方の変換を見つけることで、変換された変数に対して等分散性の仮定 (線形性の仮定に加えて) が成り立ち[ 5 ]、したがって、これらの変数に対して線形回帰を適用できる可能性があります。
データ変換のもう1つの応用例は、誤差項の正規性の欠如の問題に対処することです。回帰パラメータの最小二乗推定が意味を持つためには、単変量正規性は必要ありません(ガウス・マルコフの定理を参照)。ただし、変数が多変量正規性を示す場合、信頼区間と仮説検定の統計的特性は向上します。誤差項の分散を安定させる変換(つまり、不均一分散性に対処する変換)は、誤差項を近似的に正規化するのにもよく役立ちます。[ 5 ] [ 6 ]
方程式:
方程式:
方程式:
方程式:
一般化線形モデル(GLM)は、正規分布以外の誤差分布モデルを持つ応答変数に対応できる、通常の線形回帰の柔軟な一般化を提供します。GLMでは、線形モデルをリンク関数を介して応答変数に関連付けることができ、各測定値の分散の大きさを予測値の関数にすることができます。[ 8 ] [ 9 ]
対数変換と平方根変換は正のデータに対して一般的に使用され、乗法逆変換(逆数変換)はゼロ以外のデータに使用できます。べき変換は、非負の値λでパラメータ化された変換のファミリーであり、対数変換、平方根変換、乗法逆変換を特殊なケースとして含みます。データ変換に体系的に取り組むために、統計的推定手法を使用してべき変換のパラメータλを推定し、特定の状況で近似的に最も適切な変換を特定することができます。べき変換ファミリーには恒等変換も含まれるため、このアプローチは、変換なしでデータを分析するのが最適かどうかを示すこともできます。回帰分析では、このアプローチはBox-Cox変換として知られています。
逆変換、Yeo–Johnson変換などのいくつかのべき変換、および逆双曲線正弦を適用するなどの他の特定の変換は、正の値と負の値の両方を含むデータに意味のある形で適用できます[ 10 ](λが奇数の場合、べき変換はすべての実数に対して可逆です)。ただし、負の値と正の値の両方が観測される場合、すべての値に定数を加えることから始めて、任意のべき変換を適用できる非負のデータのセットを作成することが一般的です。[ 3 ]
データ変換が適用される一般的な状況の一つは、対象となる値が数桁にわたる場合です。所得、種の個体数、銀河の大きさ、降雨量など、多くの物理現象や社会現象がこのような振る舞いを示します。べき変換、特に対数変換は、このようなデータに対称性をもたらすためによく用いられます。対数変換が好まれるのは、その結果を「倍率変化」という観点から解釈しやすいからです。
対数は比率にも有用な効果をもたらします。正の量XとYを比率X / Yを使用して比較する場合、 X < Yであれば比率は区間 (0,1) に収まり、X > Yであれば比率は半直線 (1,∞) に収まります。ここで、比率 1 は等価性に対応します。X と Y を対称的に扱う分析では、等しい場合の対数比 log( X / Y ) はゼロになり、 XがYのK倍である場合、対数比はYがXのK倍である場合と同様にゼロから等距離になるという性質を持ちます(これらの 2 つの状況での対数比は log( K ) と− log( K ) です)。
値が端点を除いて0から1の範囲に自然に制限されている場合、ロジット変換が適切である可能性があります。これにより、( − ∞,∞)の範囲の値が得られます。
1. データセットを正規分布に似せるように変換することは、必ずしも必要または望ましいとは限りません。しかし、対称性や正規性を求める場合は、べき変換のいずれかを用いることで実現できる場合が多いです。
2. 言語的パワー関数は、ジップ・マンデルブロの法則に従って分布します。この分布は非常に尖っていて尖度が高いため、研究者は、例えば著者帰属の問題を解決するために統計学に背を向けざるを得ませんでした。しかし、データ変換を適用することで、ガウス統計の使用は完全に可能です。[ 11 ]
3. 変換後に正規性が達成されたかどうかを評価するには、標準的な正規性検定のいずれかを使用できます。グラフによるアプローチは通常、正式な統計的検定よりも情報量が多いため、正規分位点プロットは、データセットが正規母集団に適合しているかどうかを評価するためによく使用されます。あるいは、サンプルの歪度と尖度に基づく経験則も提案されています。[ 12 ] [ 13 ]
同順位のないn個の値X 1、 ...、X nの集合を観測する場合(つまり、 n個の異なる値がある場合)、 X i を変換された値Y i = kに置き換えることができます。ここで、kは、 X i がすべてのX値の中でk番目に大きい値になるように定義されます。これはランク変換と呼ばれ、[ 14 ] 、一様分布に完全に適合するデータを作成します。このアプローチには、母集団の類似物があります。
確率積分変換を用いると、X が任意の確率変数であり、FがXの累積分布関数である場合、 Fが可逆である限り、確率変数U = F ( X ) は単位区間[0,1]上の一様分布に従います。
一様分布から、可逆累積分布関数を持つ任意の分布に変換することができます。Gが可逆累積分布関数であり、U が一様分布する確率変数である場合、確率変数G −1 ( U ) の累積分布関数はGとなります。
この2つをまとめると、Xが任意の確率変数で、FがXの可逆累積分布関数であり、Gが可逆累積分布関数である場合、確率変数G −1 ( F ( X ))はGを累積分布関数として持ちます。
多くの統計データは「分散と平均値の関係」を示します。これは、期待値が異なるデータ値では変動性が異なることを意味します。例えば、世界のさまざまな人口を比較すると、所得の分散は平均所得とともに増加する傾向があります。多数の小地域単位(例えば、米国の郡)を考慮し、各郡内の所得の平均値と分散を求めると、平均所得が高い郡ほど分散も高くなることが一般的です。
分散安定化変換は、分散と平均の関係を取り除くことを目的としており、分散が平均に対して一定になるようにします。分散安定化変換の例としては、標本相関係数に対するフィッシャー変換、ポアソンデータ(カウントデータ)に対する平方根変換またはアンスコム変換、回帰分析に対するボックス・コックス変換、および比率(二項データ)に対するアークサイン平方根変換または角度変換があります。アークサイン平方根変換は、比率データの統計分析によく使用されますが、二項比率または非二項比率に対しては、それぞれロジスティック回帰またはロジット変換の方が適しているため、特にタイプIIエラーの減少のため、推奨されません。[ 15 ] [ 3 ]
単変量関数は、多変量データに点ごとに適用して周辺分布を変更できます。また、適切に構築された変換を使用して、多変量分布のいくつかの属性を変更することも可能です。たとえば、時系列データやその他のタイプのシーケンスデータを扱う場合、定常性を改善するためにデータを差分するのが一般的です。ランダムベクトルXによって生成されたデータが、共分散行列Σを持つ観測値のベクトルX iとして観測される場合、線形変換を使用してデータを無相関化できます。これを行うには、コレスキー分解を使用して Σ = A A'を表現します。すると、変換されたベクトルY i = A −1 X iの共分散行列は単位行列になります。
{{cite book}}: CS1メンテナンス: 場所の発行元が見つかりません (リンク)