エピゲノムワイド関連研究(EWAS )は、 DNAメチル化などの定量化可能なエピジェネティックマークのゲノムワイドセットを異なる個体で調べ、エピジェネティック変異と特定の識別可能な表現型/形質との関連性を導き出す研究です。特定の遺伝子座におけるDNAメチル化などのパターンが変化し、表現型に影響を受けた症例と対照個体を区別する場合、これは、表現型と因果的または結果的に関連するエピジェネティックな摂動が起こったことの兆候であると考えられます。[ 1 ]

エピゲノムは遺伝的要因と環境的要因の両方によって制御されるため、非常に動的で複雑です。エピジェネティック情報は、DNA やヒストンのマーク、および非コード RNAとして細胞内に存在します。DNA メチル化 (DNAm) パターンは時間とともに変化し、発生段階や組織の種類によって異なります。主なタイプの DNAm は、遺伝子発現制御に関与することが知られているCpGジヌクレオチド内のシトシンにあります。DNAm パターンの変化は、癌や糖尿病などの複雑な疾患で広く研究されています。[ 1 ]正常な細胞では、バルクゲノムは CpG で高度にメチル化されていますが、遺伝子プロモーター領域のCpG アイランド(CPI)は高度に非メチル化されたままです。異常な DNAm は、癌細胞で最も一般的な分子異常のタイプであり、バルクゲノムが全体的に「低メチル化」され、プロモーター領域の CPI が「高メチル化」され、通常は腫瘍抑制遺伝子のサイレンシングにつながります。[ 2 ]最近では、糖尿病に関する研究により、一卵性双生児間の疾患関連エピジェネティックマークの違い、一般人口における1型糖尿病の発生率の上昇、子宮内または小児期の環境が成人期の疾患結果に影響を与える発達再プログラミング事象など、疾患のエピジェネティック要素を裏付けるさらなる証拠が明らかになっている。[ 1 ]
翻訳後ヒストン修飾には、コアヒストンテールのメチル化、アセチル化、リン酸化などが含まれますが、これらに限定されません。これらの翻訳後修飾は、その遺伝子座のクロマチン状態を修飾できるタンパク質によって読み取られます。 [ 1 ] エピジェネティック変異は、3つの異なる方法で発生します。遺伝によって受け継がれ、生殖細胞を含む成人のすべての細胞に存在する場合(世代間エピジェネティック遺伝と呼ばれるプロセス。ヒトではまだ観察されていない議論の多い現象)、ランダムに発生し、成人の細胞の一部に存在する場合(発生のどの段階で変異が発生するかによってその量が異なる)、または行動的要因や環境的要因の結果として誘発される場合があります。[ 1 ] EWASはこれまで、メチル化の変化をいくつかの疾患や複雑な病態と関連付けてきましたが、これらの疾患の疫学は不明であり、したがって、これらの疾患の病因に寄与する、または病因の結果であるエピジェネティック因子の特定に不可欠です。[ 3 ]
後向き研究では、関心のある疾患や表現型を持たない対照群と、関心のある表現型を持つ症例群という2つのカテゴリーに分類される無関係な個人を比較します。このような研究の利点は、エピゲノムデータと統合できる遺伝子型および発現データが利用可能な症例対照サンプルのコホートが既に多数存在することです。しかし、欠点としては、エピジェネティックな差異が疾患関連の遺伝的差異、疾患後のプロセス、または疾患関連の薬物介入の結果であるかどうかを判断できないことです。[ 1 ]
エピジェネティックマークの世代を超えた遺伝パターンを研究するのに有用です。EWASの主な限界は、表現型が問題の変数の結果としてエピジェネティック変化と関連しているのか、それともエピジェネティック変化につながる以前のゲノム変異の結果として関連しているのかを解読することです。親と子のゲノムおよびエピゲノムデータを比較することで、疾患または表現型がゲノム変異によるものである可能性を排除できます。この研究デザインの限界は、十分な大きさのコホートがほとんど存在しないことです。[ 1 ]
一卵性双生児は同一のゲノム情報を持っています。したがって、特定の疾患や表現型に関して不一致が見られる場合、それはエピジェネティックな差異の結果である可能性が高いです。しかし、双生児を長期的に研究しない限り、エピジェネティックな変異が疾患の原因なのか結果なのかを判断することは不可能です。もう1つの制約は、対象となる疾患を持つ不一致の一卵性双生児の十分な数のコホートを募集することです。[ 1 ]
縦断研究では、通常、出生時または疾患発症前から長期間にわたって個人のコホートを追跡します。サンプルが採取され、記録が長年にわたって保持されるため、これらの研究は特定の表現型の因果関係を決定するのに非常に役立ちます。同じ個人が疾患発症前と発症後の時点で追跡されるため、症例と対照群の違いによる交絡効果は排除されます。縦断研究は、リスク研究(疾患発症前のDNAサンプルを使用)だけでなく、特定の曝露による治療前と治療後を使用してエピゲノムへの環境影響を調査する介入研究にも役立ちます。[ 4 ]大きな欠点は、研究の期間が長いことと費用がかかることです。疾患が異なる一卵性双生児を使用した縦断研究は、エピジェネティックな変動に対する遺伝的影響を排除できるという利点があります。[ 1 ]
エピゲノムマーカーの強い組織特異性は、エピゲノムワイド関連解析(EWAS)の設計と解釈において大きな課題となっている。組織の選択は、アクセス可能性とエピジェネティックパターンの時間的安定性の両方によって制約されるが、堅牢なEWASには、個体間で変動しながらも時間的に安定している遺伝子座が必要となる。実際には、疾患関連組織はアクセスできないことが多く、ほとんどのEWASは血液中のDNAメチル化測定に依存している。しかし、血液中で観察されるメチル化の変化は、細胞型の構成が変動し、標的組織との関連性が不明確であるため、生物学的に解釈することが困難な場合が多い。さらに、代替組織の使用は、個体間のエピジェネティックな差異と環境誘発性の変化が組織間で相関しているという暗黙の仮定に基づいているが、この仮定を裏付ける経験的根拠はほとんどない。この根本的な制約に対する解決策は、複数の組織間で一貫した個体間メチル化差異を示す、全身的な個体間変動の相関領域(CoRSIV)にEWASを集中させることである。 CoRSIVに焦点を当てたアッセイは、組織間で本質的に共有されている遺伝子座を標的とすることで、組織の入手可能性への依存を減らし、組織特異性による交絡を軽減し、連続サンプリングや疾患関連組織へのアクセスを必要とせずに、環境または発生によって引き起こされるエピジェネティックな関連性をより確実に検出することを可能にします[ 5 ]。

エピゲノム全体のDNAメチル化定量化プラットフォームは、ハイスループット技術であるIllumina Methylation Assayを利用しています。従来、27k Illuminaアレイは、約14,000個の遺伝子のプロモーター領域にある平均2つのCpGサイトをカバーしており、ヒトゲノムの2,800万個のCpGサイトの0.1%未満しかカバーしていませんでした。これは、ヒトエピゲノム全体を代表するには不十分です。このアレイを使用した初期のEWAS [ 6 ] [ 7 ]はいずれも、関連するプローブを検証するために独立した検証を使用していませんでした。興味深い観察結果は、症例と対照間の差が非CpGアイランドプローブ(このアレイ設計では著しく過小評価されていた)に偏っていたことであり、より高密度のプローブで非CpGアイランドをカバーする後期の設計の450kアレイの使用を強く推奨するものです。現在、Illumina 450kアレイは、過去2年間でEWASを報告する研究で最も広く使用されているプラットフォームです。このアレイは、ゲノム内の CpG サイトの 2% 未満しかカバーしていませんが、プロモーター (CpG アイランドと周辺配列を含む) に高密度のプローブを使用して既知のすべての遺伝子をカバーしようと試み、さらに、遺伝子本体、3' 非翻訳領域、およびその他の遺伝子間配列全体に低密度でカバーしています。[ 8 ]

DNAメチル化は通常0~1のスケールで定量化され、メチル化アレイは特定のCpG部位でメチル化されているDNA分子の割合を測定します。最初に行われる解析は、DNAメチル化が曝露や表現型によって変化する部位を特定するための単変量関連性検定です。続いて、多重検定補正を行い、 DNAメチル化の定量化におけるバッチ効果やその他の技術的な交絡効果を低減するための解析戦略を用います。組織組成の変化から生じる可能性のある交絡効果も考慮されます。さらに、メチル化状態に影響を与える可能性のある年齢、性別、行動などの交絡因子を共変量として調整します。関連性の結果は、集団構造を考慮するために、ゲノム制御インフレーション係数で補正されます。
一般的に、CpGメチル化の平均レベルは、交絡因子やバッチ効果を調整できる線形回帰[ 9 ]を使用してカテゴリ間で比較されます。 [ 10 ]一般的に、テストされた表現型/刺激に関連するCpGを特定するために、P < 1e-7 [ 11 ]のP値閾値が使用されます。これらのCpGは、エピゲノム全体の有意性に達すると考えられます。この有意水準で効果量も計算され、2つの定性グループを比較したときのメチル化の差、または表現型に応じて異なる定量的値を示します。表現型および/または治療/環境刺激と有意に関連するCpGサイトは、通常、マンハッタンプロットで表されます。[ 12 ]
単一の CpG サイトは、単一サイトの自然な変動効果や、マイクロアレイプローブの不良や外れ値などの技術的な変動の影響を受けやすい。このような変動を考慮し、より強固な関連性を得るために、隣接する測定値を使用することで検出力を高めることができる。[ 13 ] [ 14 ]これまでの研究では、機能的に関連する知見は、単一の CpG ではなくゲノム領域に関連付けられてきた。したがって、領域レベルを調べることで、関連領域をより確信を持って特定し、下流の機能研究を導くことができる。
別の分析方法として、教師なしクラスタリングを使用して、サンプル間のメチル化変動の類似性に基づいて CpG サイトのクラスを作成する方法があります。各クラス内の平均メチル化値を使用して次元削減されたデータセットを構築し、DNA メチル化と関心のある表現型との関連性の効率的なテストを容易にします。[ 15 ]これは、大規模なデータセットの次元を削減し、生物学的に誘発された相関関係を最大限に活用するために使用されます。この方法は、テスト対象の変数に関連するメチル化の大まかなパターンを特定するのに便利ですが、特定の関心のある CpG サイトを見逃す可能性があります。平均メチル化レベルの違いに加えて、サンプル間の DNA メチル化の変動の違いも生物学的に意味がある可能性があり、グループ間の差異変動のスキャンを促します。[ 12 ]
関連するCpG部位またはアイランド/領域の位置は、コンピュータ上で解析することで、機能的な関連性を推測できます。例えば、関連するCpGがプロモーター領域内にあるかどうか、あるいは転写開始部位からの距離が関連しているかどうかを検討できます。特に、表現型に関連するDNAメチル化が遺伝子転写の調節によって作用すると仮定する場合、この距離は重要になります。過去の生物学的知識に基づく他の多くの推論は、特定のCpG領域が研究され、転写の変化と関連付けられている場合に推測できます。これは、機能検証のために追求する領域を特定するための追加フィルターとして使用できます。機能エンリッチメント解析用に開発されたいくつかのバイオインフォマティクスツールは、まずこれらの領域を遺伝子にマッピングすることで、差次的メチル化領域に適用できます。これは、CpGと、この領域によって調節される可能性のある遺伝子プロモーターとの間の距離をマッピングすることによって行われます。このように、ゲノム領域に基づくエンリッチメント解析は、補完的なアプローチとして提案されており、解釈の可能性を大きく広げます。[ 12 ]差次的メチル化領域は、例えば特定のクロマチン修飾や転写因子結合部位が豊富に存在する部位を含むゲノム領域のカタログと比較することができる。
症例(または対照)の部位における平均メチル化率を、症例(または対照)組織サンプル中のランダムに選択されたDNA鎖のメチル化確率を表すものとみなせば、メチル化オッズ比を計算できます。メチル化オッズ比は、ランダムな症例の組織サンプル中のランダムなDNA鎖がメチル化されるオッズを、対照の同じオッズで割ったものです。これは、相対的な大きさを組み込んだ効果量の尺度を提供しますが、分散などのメチル化スペクトルの特徴の症例と対照間の差は考慮されません。メチル化オッズ比は、前向き研究と後ろ向き研究の間で比較可能であり、その値は関連性のみを測定し、因果関係を示唆するものではありません。メチル化リスクスコアも計算されており、表現型に関連する各マーカーのメチル化値の合計をマーカー固有の効果量で重み付けして重み付けメチル化リスクスコアを計算することにより、CpG部位全体の情報を統合できます[ 16 ]。
初期研究で特定された偽陽性を排除するためには、独立したコホートを用いた再現研究が必要です。これはヒトコホートで行うことも、より集中的な動物モデルで行うこともできます。再現研究のコホートを選択する際には、対象者が初期コホートを反映していること、および同じ交絡因子が考慮されていることが重要です。ただし、再現研究は対象者やサンプルの入手可能性によって制限される場合があります。
エピゲノムの変異は疾患の原因となる場合もあれば、疾患の結果として生じる場合もあり、この2つを区別することはEWASにおける大きな課題です。これを回避する方法の一つは、疾患の症状が現れる前にエピジェネティックな変異が存在するかどうかを判断することです。そのためには、同じ集団を長年にわたって追跡調査する縦断研究が望ましいでしょう(ただし、これには費用や研究期間といった課題があります)。また、疾患発症前に生じたエピジェネティックな変異が必ずしも疾患の原因となるわけではないという可能性も考慮する必要があります。
EWASで最も一般的に使用される組織は血液です。しかし、血液サンプルには複数の異なる細胞型が含まれており、それぞれが固有のエピジェネティックシグネチャを持っています。そのため、採取したサンプルが均質であるかどうかを判断することは非常に難しく、したがって、エピジェネティックマークの変動が表現型/刺激の違いによるものなのか、サンプルの不均一性によるものなのかを判断することも困難です。
現在、多くのEWASでは、入手しやすさと採取の容易さから、血液を代替組織として用いています。しかし、血液中のエピジェネティックな変化は、疾患に関連する特定の組織の変化とは必ずしも関連しない可能性があります。エピジェネティックな原因因子を持つ可能性のある興味深い疾患の多くは、脳、肺、心臓などの組織に影響を与えます。しかし、ヒト患者を研究する際には、これらの組織を採取してサンプルとして提供することは不可能であり、そのため研究対象から外されています。
EWASdb [ 17 ] ( http://www.bioapp.org/ewasdb/ ) は、最初のエピゲノムワイド関連データベース (2015 年に初めてオンライン公開され、2018 年 10 月 13 日に Nucleic Acids Res に初めて掲載) であり、302 の疾患/表現型 (p<1e-7) に関連する 1319 の EWAS 研究の結果を格納しています。EWASdb には、単一のエピマーカーの EWAS、KEGG パスウェイの EWAS、GO ( Gene Ontology ) カテゴリの EWAS の 3 種類の EWAS 結果が格納されています。
EWAS Atlas [ 18 ] ( https://bigd.big.ac.cn/ewas ) は、EWAS の知識を包括的に収集したキュレーション済みの EWAS 知識ベースです。既存のデータ指向のエピジェネティック リソースとは異なり、EWAS Atlas は、多数の出版物から EWAS 知識を手動でキュレーションしています。現在の実装では、EWAS Atlas は主要なエピジェネティック マークの 1 つである DNA メチル化に焦点を当てています。これは、126 の組織/細胞株に関係し、351 の特性、2,230 のコホート、390 のオントロジー エンティティをカバーする 388,851 の高品質の EWAS 関連付けを統合しており、495 の出版物で報告された 649 の研究から完全に手動でキュレーションされています。さらに、特性間および特性とエピゲノムの関係をプロファイリングできる強力な特性エンリッチメント分析ツールを備えています。今後の展開としては、最新のEWAS論文の定期的なキュレーション、より多くのエピジェネティックマーカーの組み込み、そしてEWASとGWASの統合などが挙げられます。EWAS Atlasは、EWASに関する知識のキュレーション、統合、標準化に特化しており、生物学的形質に関連するエピジェネティック修飾の分子メカニズムを研究者が解明する上で大きな可能性を秘めています。
EWAS Data Hub [ 19 ] ( https://bigd.big.ac.cn/ewas/datahub ) は、DNAメチル化アレイデータの収集と正規化、および関連するメタデータのアーカイブを行うためのリソースです。EWAS Data Hub の最新リリースでは、75,344 サンプルからの包括的な DNA メチル化アレイデータコレクションを統合し、異なるデータセット間のバッチ効果を除去する効果的な正規化手法を採用しています。そのため、EWAS Data Hub は、膨大な量の高品質 DNA メチル化データと標準化されたメタデータの両方を活用し、81 種類の組織/細胞タイプ (25 種類の脳部位と 25 種類の血液細胞タイプを含む)、6 種類の祖先カテゴリー、および 67 種類の疾患 (39 種類の癌を含む) を含む、さまざまな状況における参照 DNA メチル化プロファイルを提供します。要約すると、EWAS Data Hub は、表現型特性評価、臨床治療、およびヘルスケアのためのメチル化ベースのバイオマーカーの取得と発見を支援する大きな可能性を秘めています。