ゲノム制御(GC)は、遺伝子関連研究における集団構造の交絡効果を制御するために使用される統計的手法です。この手法は、 1999 年の論文でBernie DevlinとKathryn Roederによって最初に概説されました。 [ 1 ]この手法では、匿名の遺伝子マーカーのセットを使用して、カイ二乗統計量の分布に対する集団構造の影響を推定します。特定の形質に関連していると疑われる特定の対立遺伝子のカイ二乗統計量の分布は、その形質に関連していないと予想される対立遺伝子の同じ統計量の分布と比較できます。[ 2 ] [ 3 ]この手法では、関連性の可能性についてテストされているマーカーとはリンクしていないマーカーを使用することが想定されています。 [ 4 ]理論的には、関連分析における検定統計量の過分散を引き起こす集団構造の傾向を利用します。[ 5 ]ゲノム制御法は、集団ベースのデータに適用されるにもかかわらず、家族ベースのデザインと同じくらい頑健です。 [ 6 ]真の関連性を検出する統計的検出力が低下する可能性があり、集団構造によるバイアス効果を排除できない可能性もある。[ 7 ]ゲノム制御法のより堅牢な形式は、研究対象の関連性を2つのCochran–Armitage傾向検定として表現し、その方法を各検定に個別に適用することによって実行できる。[ 8 ]
関連研究、特に症例対照研究における集団の均一性の仮定は容易に破られ、第一種過誤と第二種過誤の両方につながる可能性があります。したがって、研究で使用されるモデルが集団構造を補正することが重要です。症例対照研究の問題は、疾患に遺伝的関与がある場合、症例集団は対照集団の個人よりも関連している可能性が高いことです。これは、観察の独立性の仮定が破られていることを意味します。多くの場合、これは関連性の有意性の過大評価につながりますが、サンプルの選択方法によって異なります。偶然にも症例のサブ集団で対立遺伝子頻度が高い場合、症例集団でより蔓延している形質との関連性が見つかります。[ 9 ]この種の偽の関連性はサンプル集団が大きくなるにつれて増加するため、遺伝子座が形質に比較的小さな影響しか及ぼさない大規模な関連研究では、この問題は特に注意する必要があります。上記の問題を場合によっては補正できる方法が、DevlinとRoeder(1999)によって開発されました。[ 10 ]頻度論的アプローチとベイズ的アプローチの両方を使用する(後者は多数の候補遺伝子を扱う場合に適している)。
集団構造を補正する頻度論的方法は、問題の形質とは連鎖していないマーカーを用いて、集団構造によって引き起こされる統計量の過大評価を補正する。この方法は当初、二値形質のために開発されたが、その後、量的形質にも一般化された。[ 11 ]症例群と対照群の遺伝的差異を検出する二値形質の場合、DevlinとRoeder(1999)はArmitageの傾向検定を用いている。
そして対立遺伝子頻度の検査
母集団がハーディ・ワインベルグ平衡にある場合、 2つの統計量はほぼ等しくなります。母集団の層別化がないという帰無仮説の下では、傾向検定は漸近的に自由度1の分布。統計量が係数で膨張するという考え方。となることによってどこ階層化の影響に依存する。上記の方法は、インフレ率がは一定であるため、遺伝子座はほぼ等しい突然変異率を持ち、2 つの集団で異なる選択を受けておらず、ライトの近交係数Fで測定されるハーディ・ワインベルグ不均衡の量は異なる遺伝子座間で異ならないはずです。これらのうち最後の点が最も懸念されます。層別化の影響が異なる遺伝子座間で類似している場合、連鎖していないマーカーから推定できる
ここで、Lは連鎖していないマーカーの数である。分母は、ガンマ分布から頑健な推定値として導出される。他の推定方法も提案されており、例えば、ReichとGoldstein [ 12 ]は統計量の平均値を用いることを提案している。これは推定の唯一の方法ではない。しかし、Bacanu ら[ 13 ]によれば、連鎖していないマーカーの一部が実際に疾患原因遺伝子座と不均衡であったり、それ自体が疾患と関連していたりする場合でも、これは適切な推定値である。帰無仮説の下で、L 個の連鎖していない遺伝子を使用して層別化を補正する場合、およそ分布している。この補正により、全体の第一種過誤率はほぼ等しくなるはずです。人口が階層化されている場合でも。DevlinとRoeder(1999)[ 10 ]は主に次のような状況を検討した。95% の信頼水準を与え、より小さな p 値を与えません。 Marchini ら (2004) [ 14 ]は、シミュレーションにより、ゲノム制御は、この値が非常に小さく、2 つの集団 (症例と対照) が極めて異なる場合、保守的でない p 値につながる可能性があることを示しました。これは、連鎖していないマーカーの数が 50 ~ 100 のオーダーである場合に特に問題でした。これにより、偽陽性 (その有意水準で) が発生する可能性があります。