2つの分布を統計的に同一にする手法
統計学において、 分位正規化とは、2 つの 分布 の統計的特性を同一にする手法です 。テスト分布を同じ長さの参照分布に分位正規化するには、テスト分布を並べ替え、参照分布を並べ替えます。テスト分布の最高エントリは参照分布の最高エントリの値を取り、参照分布の次に高いエントリは、テスト分布が参照分布の摂動になるまで、これを繰り返します。
参照分布を使用せずに 2 つ以上の分布を互いに 分位 正規化するには、前と同じように並べ替えてから、分布の平均 (通常は 算術平均 ) に設定します。したがって、すべてのケースで最も高い値は最も高い値の平均になり、2 番目に高い値は 2 番目に高い値の平均になります。
一般的に、参照分布は、ガウス分布 や ポアソン分布 などの標準的な統計分布のいずれかになります。参照分布は、分布の 累積分布関数 からランダムに、または定期的にサンプルを取得して生成できます 。ただし、任意の参照分布を使用できます。
クォンタイル正規化はマイクロアレイ データ解析で頻繁に使用されます。これは クォンタイル標準化 [1] として導入され 、その後 クォンタイル正規化 に改名されました。 [2]
例
列 (1 ~ 3) と行 (AD) に整理された、非常に小さなデータセットでのこのような正規化の簡単な説明:
あ
:
B
:
C
:
だ
:
1
_
2
_
3
_
5
4
3
2
1
4
3
4
6
4
2
8
{\displaystyle {\begin{matrix}&{}\\[6pt]&A:\\&B:\\&C:\\&D:\end{matrix}}\quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]5&4&3\\2&1&4\\3&4&6\\4&2&8\end{matrix}}}
各列について、エントリを最低から最高(i から iv)の順にランク付けします。
あ
:
B
:
C
:
だ
:
1
_
2
_
3
_
5
4
3
2
1
4
3
4
6
4
2
8
⟶
1
_
2
_
3
_
私
ヴ
私
私
私
私
私
私
私
私
私
私
私
私
私
私
私
私
私
私
私
私
私
私
ヴ
{\displaystyle {\begin{matrix}&{}\\[6pt]&A:\\&B:\\&C:\\&D:\end{matrix}}\quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]5&4&3\\2&1&4\\3&4&6\\4&2&8\end{matrix}}\quad \longrightarrow \quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]{\rm {iv}}&{\rm {iii}}&{\rm {i}}\\{\rm {i}}&{\rm {i}}&{\rm {ii}}\\{\rm {ii}}&{\rm {iii}}&{\rm {iii}}\\{\rm {iii}}&{\rm {ii}}&{\rm {iv}}\end{matrix}}}
これらのランク値は後で使用するために取っておきます。最初のデータ セットに戻ります。各列の値を並べ替えて、各列が最低から最高の順になるようにします。結果は次のとおりです。
A
:
B
:
C
:
D
:
1
_
2
_
3
_
5
4
3
2
1
4
3
4
6
4
2
8
⟶
1
_
2
_
3
_
2
1
3
3
2
4
4
4
6
5
4
8
{\displaystyle {\begin{matrix}&{}\\[6pt]&A:\\&B:\\&C:\\&D:\end{matrix}}\quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]5&4&3\\2&1&4\\3&4&6\\4&2&8\end{matrix}}\quad \longrightarrow \quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]2&1&3\\3&2&4\\4&4&6\\5&4&8\end{matrix}}}
次に、各行の平均を計算し、最低から最高(i から iv)の順にランク付けします。
(
2
+
1
+
3
)
/
3
=
2.00
(rank i)
(
3
+
2
+
4
)
/
3
=
3.00
(rank ii)
(
4
+
4
+
6
)
/
3
=
4.67
(rank iii)
(
5
+
4
+
8
)
/
3
=
5.67
(rank iv)
{\displaystyle {\begin{aligned}(2+1+3)/3&=2.00{\text{ (rank i)}}\\(3+2+4)/3&=3.00{\text{ (rank ii)}}\\(4+4+6)/3&=4.67{\text{ (rank iii)}}\\(5+4+8)/3&=5.67{\text{ (rank iv)}}\end{aligned}}}
ここで、先ほどのランキング順を取り、対応する順位に従って平均値を代入します。
A
:
B
:
C
:
D
:
1
_
2
_
3
_
i
v
i
i
i
i
i
i
i
i
i
i
i
i
i
i
i
i
i
i
i
i
i
i
v
⟶
1
_
2
_
3
_
5.67
4.67
2.00
2.00
2.00
3.00
3.00
4.67
4.67
4.67
3.00
5.67
{\displaystyle {\begin{matrix}&{}\\[6pt]&A:\\&B:\\&C:\\&D:\end{matrix}}\quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]{\rm {iv}}&{\rm {iii}}&{\rm {i}}\\{\rm {i}}&{\rm {i}}&{\rm {ii}}\\{\rm {ii}}&{\rm {iii}}&{\rm {iii}}\\{\rm {iii}}&{\rm {ii}}&{\rm {iv}}\end{matrix}}\quad \longrightarrow \quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]5.67&4.67&2.00\\2.00&2.00&3.00\\3.00&4.67&4.67\\4.67&3.00&5.67\end{matrix}}}
これらは新しい正規化された値です。
ただし、列 2 のように、値がランクで同順位の場合、それらの値には、異なる場合に通常表すランクに対応する値の平均を割り当てる必要があることに注意してください。列 2 の場合、それらはランク iii と iv を表します。したがって、ランク iii の同順位の 2 つのエントリには、ランク iii とランク iv の平均 ((4.67 + 5.67)/2 = 5.17) を割り当てます。こうして、次の正規化された値のセットが得られます。
A
:
B
:
C
:
D
:
1
_
2
_
3
_
5.67
4.67
2.00
2.00
2.00
3.00
3.00
4.67
4.67
4.67
3.00
5.67
⟶
1
_
2
_
3
_
5.67
5.17
2.00
2.00
2.00
3.00
3.00
5.17
4.67
4.67
3.00
5.67
{\displaystyle {\begin{matrix}&{}\\[6pt]&A:\\&B:\\&C:\\&D:\end{matrix}}\quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]5.67&{\mathbf {4.67}}&2.00\\2.00&2.00&3.00\\3.00&{\mathbf {4.67}}&4.67\\4.67&3.00&5.67\end{matrix}}\quad \longrightarrow \quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]5.67&{\mathbf {5.17}}&2.00\\2.00&2.00&3.00\\3.00&{\mathbf {5.17}}&4.67\\4.67&3.00&5.67\end{matrix}}}
新しい値は同じ分布を持ち、簡単に比較できるようになりました。3 つの列ごとの要約統計は次のとおりです。
Min
:
1st Qrt
:
Median
:
Mean
:
3rd Qrt
:
Max
:
1
_
2
_
3
_
2.00
2.00
2.00
2.75
2.75
2.75
3.83
4.08
3.83
3.83
3.83
3.83
4.92
5.17
4.92
5.67
5.17
5.67
{\displaystyle {\begin{array}{r}&{}\\[6pt]&{\text{Min}}:\\&{\text{1st Qrt}}:\\&{\text{Median}}:\\&{\text{Mean}}:\\&{\text{3rd Qrt}}:\\&{\text{Max}}:\end{array}}\quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]2.00&2.00&2.00\\2.75&2.75&2.75\\3.83&4.08&3.83\\3.83&3.83&3.83\\4.92&5.17&4.92\\5.67&5.17&5.67\end{matrix}}}
参考文献
^ Amaratunga, D.; Cabrera, J. (2001). 「ウイルス DNA マイクロチップからのデータの分析」. アメリカ統計学会誌 . 96 (456): 1161. doi :10.1198/016214501753381814. S2CID 18154109.
^ Bolstad, BM; Irizarry, RA; Astrand, M.; Speed, TP (2003). 「分散とバイアスに基づく高密度オリゴヌクレオチドアレイデータの正規化方法の比較」. バイオインフォマティクス . 19 (2): 185–193. doi : 10.1093/bioinformatics/19.2.185 . PMID 12538238.
外部リンク